【dcjsj】智谱GLM-5.3-Flash:继续把智能/成本帕累托前沿往外推 智谱发布GLM-5.3-Flash,重新预训练后,用更小的模型实现了接近前沿模型

图片

无图片

正文

【dcjsj】智谱GLM-5.3-Flash:继续把智能/成本帕累托前沿往外推

智谱发布GLM-5.3-Flash,重新预训练后,用更小的模型实现了接近前沿模型的能力。总参数320B、每Token激活18B,仅45层。基座模型整体超过GLM-4.5-Base,并在多数指标上接近更大的GLM-5-Base。背后用了30T Token多模态预训练、混合注意力和mHC 架构;相比GLM-5.3,注意力计算量降低约3倍,KV Cache降低4.4倍。

这与唐杰老师上周对ScalingLaw的判断正好对应。

Scaling没有结束,只是Scaling的维度不再只有参数量。总参数更多决定模型能“装多少知识”,激活参数和每次前向计算的有效深度,则决定模型能“想多深”。

GLM-5.3已经证明:基座、架构和参数量完全不变,仅扩大长程环境和RL后训练,能力仍能继续明显提升。说明后训练远没有到头,预训练得到的能力还有很大的挖掘空间;Flash 则进一步回到预训练和架构本身,提高单位参数的智能效率。

实际体验很好。我这几天一直通过OpenRouter调用,速度很快,加上原生多模态后,图片和图片型PDF的处理简单很多。但是会时常断连,暂时不好判断是流量过大,还是国产卡大规模推理仍在磨合。

另一个超预期点是这次流量全部跑在国产卡上。

官方披露,ox-alpha的流量由数万颗国产卡承载。智谱还针对国产卡重做并行通信、推理引擎和EPD分离架构,同批硬件端到端性能提升约3倍。

继续看好智谱引领国产模型最前沿。

从GLM-5.3 Scaling后训练,到Flash重新Scaling预训练、架构和推理效率,智谱实际在不断寻找“下一个最值得拧的旋钮”,把智能/成本的帕累托曲线继续往前推,让单token智能不断提升。

投资建议:1.继续看好智谱坐稳国产模型第一梯队,模型能力与推理效率持续兑现;2.关注MiniMax在ARR超预期及下一代模型能力提升下的估值修复机会(当前P/ARR仅17倍);3.同时关注前沿模型在国产算力上的规模化部署,对国产算力带来的验证与催化。

总体总结

主题正文

  1. 智谱发布GLM-5.3-Flash,重新预训练后,用更小的模型实现了接近前沿模型的能力。
  2. 基座模型整体超过GLM-4.5-Base,并在多数指标上接近更大的GLM-5-Base。
  3. GLM-5.3已经证明:基座、架构和参数量完全不变,仅扩大长程环境和RL后训练,能力仍能继续明显提升。
  4. 智谱还针对国产卡重做并行通信、推理引擎和EPD分离架构,同批硬件端到端性能提升约3倍。
  5. 从GLM-5.3 Scaling后训练,到Flash重新Scaling预训练、架构和推理效率,智谱实际在不断寻找“下一个最值得拧的旋钮”,把智能/成本的帕累托曲线继续往前推,让单token智能不断提升。
  6. 投资建议:1.继续看好智谱坐稳国产模型第一梯队,模型能力与推理效率持续兑现;
  7. 2.关注MiniMax在ARR超预期及下一代模型能力提升下的估值修复机会(当前P/ARR仅17倍);
  8. 3.同时关注前沿模型在国产算力上的规模化部署,对国产算力带来的验证与催化。