智谱:Ox Alpha揭晓,参数、价格与国产算力适配全面超预期【天风计算机缪欣君团队】 ❗️强推智谱和国产算力 1)Ox Alpha正式揭晓为GLM-5.3 F

图片

无图片

正文

智谱:Ox Alpha揭晓,参数、价格与国产算力适配全面超预期【天风计算机缪欣君团队】

❗️强推智谱和国产算力

1)Ox Alpha正式揭晓为GLM-5.3 Flash, 参数规模、定价与国产算力适配三项大超预期。模型仅320B总参数、18B激活参数和45层,显著小于GLM-5系列旗舰,却已全面超越GLM-5.2,并在Coding与Agent任务上接近Claude Opus 4.8。匿名测试期间全部流量均由国产芯片承载,验证智谱已具备从预训练、架构到推理Infra的全栈能力。

2) GLM-5.3 Flash已处于开源模型的帕累托最优前沿。在DeepSWE中,Ox Alpha以更少的输出Token实现约63%的高得分,能力与Token效率同时进入闭源模型区间,并在综合能力上领先DeepSeek V4 Flash。价格方面,GLM促销期输入/输出价格仅0.075/0.25美元/百万Token,约为V4 Flash非高峰价格的1/3、峰值价格的1/5—1/6;常规价格0.15/0.50美元仍低于V4 Flash非高峰价格,实际任务成本优势更加突出。

3)架构创新实现智能与效率的同步提升。模型通过线性注意力与稀疏注意力混合架构、IndexPool和mHC,在保持1M长上下文与原生多模态能力的同时,将注意力计算量和KV Cache较GLM-5.3分别降低3.01倍和4.44倍。可以看到, 智谱并非以牺牲能力换取速度,而是通过架构与预训练协同优化,将模型智力和推理效率共同推向新的帕累托前沿。

4) 本次发布同时验证智谱的预训练Scaling与国产Infra能力。仅320B/18B的基座已在多数任务上接近更大参数旗舰,证明数据、架构与训练方法有望继续Scaling至更大模型;推理侧通过自研引擎、混合量化及EPD分离式架构,将国产芯片端到端服务性能较初始基线提升3倍,硬件效率与单Token成本已接近主流英伟达GPU。看好智谱引领国产开源模型加速智力平权,以更低成本打开模型应用空间,并持续利好智谱及国产算力产业链。

总体总结

主题正文

  1. 智谱:Ox Alpha揭晓,参数、价格与国产算力适配全面超预期【天风计算机缪欣君团队】
  2. 模型仅320B总参数、18B激活参数和45层,显著小于GLM-5系列旗舰,却已全面超越GLM-5.2,并在Coding与Agent任务上接近Claude Opus 4.8。
  3. 在DeepSWE中,Ox Alpha以更少的输出Token实现约63%的高得分,能力与Token效率同时进入闭源模型区间,并在综合能力上领先DeepSeek V4 Flash。
  4. 价格方面,GLM促销期输入/输出价格仅0.075/0.25美元/百万Token,约为V4 Flash非高峰价格的1/3、峰值价格的1/5—1/6;
  5. 常规价格0.15/0.50美元仍低于V4 Flash非高峰价格,实际任务成本优势更加突出。
  6. 模型通过线性注意力与稀疏注意力混合架构、IndexPool和mHC,在保持1M长上下文与原生多模态能力的同时,将注意力计算量和KV Cache较GLM-5.3分别降低3.01倍和4.44倍。
  7. 仅320B/18B的基座已在多数任务上接近更大参数旗舰,证明数据、架构与训练方法有望继续Scaling至更大模型;
  8. 推理侧通过自研引擎、混合量化及EPD分离式架构,将国产芯片端到端服务性能较初始基线提升3倍,硬件效率与单Token成本已接近主流英伟达GPU。