智谱:认领Ox-Alpha,模型定价及基于国产卡推理超出市场预期【东吴传媒互联网张良卫团队】 事件:智谱上线并开源 GLM-5.3-Flash(320B-A18
- 序号:437
- 星球链接:打开网页
- 附件:图片 0,音频 0,文档 0
- 音频文件:无音频
图片
无图片
正文
智谱:认领Ox-Alpha,模型定价及基于国产卡推理超出市场预期【东吴传媒互联网张良卫团队】
事件:智谱上线并开源 GLM-5.3-Flash(320B-A18B),核心要点如下:
1)模型能力优秀,前期已获市场认可,匿名发布阶段社区关注度极高,但参数规模仍然令人惊喜。正式发布前以匿名模型 Ox-Alpha 在 OpenCode 和 OpenRouter进行了大规模测试,迅速成为当周最受欢迎模型,创下双平台调用量新高。具体指标上,GLM-5.3-Flash 总参数 320B,能力超过 GLM-5.2(参数量高出一倍的模型),AA 综合智能指数 57 分,进入全球前沿区间,与 Claude Opus 4.8 持平;Z.ai Code Bench 编程体感与 Opus 4.8 相当。同时,GLM-5.3-Flash是GLM-5 系列首个原生多模态模型,模型可自主判断何时"观察"并用视觉反馈指导下一步行动。
2)定价具有吸引力,体现公司极强工程能力。GLM-5.3 flash定价为 GLM-5.3 的 1/10,限时折扣内为 1/20,为 Claude Opus 4.8 的 1/40。体现公司极强工程能力:模型总参数量与 GLM-4.5 相当,激活参数 18B(GLM-4.5 为 32B)、层数 45(GLM-4.5 为 92),几乎减半;30T Token 多模态预训练。首个采用稀疏注意力+线性注意力混合架构的开源前沿模型,线性注意力捕获局部依赖,稀疏注意力经轻量级索引器召回全局上下文;引入 IndexPool(加权池化将 4 个索引器缓存向量压缩为 1 个)降低 1M 上下文开销。
3)过去一周匿名测试的免费服务全部由国产芯片集群承载,系公司首次以国产芯片集群服务大规模流量,且硬件效率和单 token 成本已达主流英伟达 GPU 相当水平,验证了国产芯片可在大规模场景下高效经济地支撑前沿模型推理,为未来推理放量奠定实践基础。
观点重申:近期海外头部模型ARR预期波动,导致市场对于LLM观点出现分歧,我们仍坚定看好智谱投资机会,公司模型能力维持领先优势,融资落地后公司算力规模持续扩大,将有助于提升ARR的增长预期及能见度,维持公司“买入”评级。
风险提示:行业应用进展不及预期
总体总结
主题正文
- 事件:智谱上线并开源 GLM-5.3-Flash(320B-A18B),核心要点如下:
- 1)模型能力优秀,前期已获市场认可,匿名发布阶段社区关注度极高,但参数规模仍然令人惊喜。
- 具体指标上,GLM-5.3-Flash 总参数 320B,能力超过 GLM-5.2(参数量高出一倍的模型),AA 综合智能指数 57 分,进入全球前沿区间,与 Claude Opus 4.8 持平;
- 同时,GLM-5.3-Flash是GLM-5 系列首个原生多模态模型,模型可自主判断何时"观察"并用视觉反馈指导下一步行动。
- GLM-5.3 flash定价为 GLM-5.3 的 1/10,限时折扣内为 1/20,为 Claude Opus 4.8 的 1/40。
- 体现公司极强工程能力:模型总参数量与 GLM-4.5 相当,激活参数 18B(GLM-4.5 为 32B)、层数 45(GLM-4.5 为 92),几乎减半;
- 3)过去一周匿名测试的免费服务全部由国产芯片集群承载,系公司首次以国产芯片集群服务大规模流量,且硬件效率和单 token 成本已达主流英伟达 GPU 相当水平,验证了国产芯片可在大规模场景下高效经济地支撑前沿模型推理,为未来推理放量奠定实践基础。
- 观点重申:近期海外头部模型ARR预期波动,导致市场对于LLM观点出现分歧,我们仍坚定看好智谱投资机会,公司模型能力维持领先优势,融资落地后公司算力规模持续扩大,将有助于提升ARR的增长预期及能见度,维持公司“买入”评级。