【dcjsj】智谱GLM-5.3-Flash:继续把智能/成本帕累托前沿往外推 智谱发布GLM-5.3-Flash,重新预训练后,用更小的模型实现了接近前沿模型
- 序号:442
- 星球链接:打开网页
- 附件:图片 0,音频 0,文档 0
- 音频文件:无音频
图片
无图片
正文
【dcjsj】智谱GLM-5.3-Flash:继续把智能/成本帕累托前沿往外推
智谱发布GLM-5.3-Flash,重新预训练后,用更小的模型实现了接近前沿模型的能力。总参数320B、每Token激活18B,仅45层。基座模型整体超过GLM-4.5-Base,并在多数指标上接近更大的GLM-5-Base。背后用了30T Token多模态预训练、混合注意力和mHC 架构;相比GLM-5.3,注意力计算量降低约3倍,KV Cache降低4.4倍。
这与唐杰老师上周对ScalingLaw的判断正好对应。
Scaling没有结束,只是Scaling的维度不再只有参数量。总参数更多决定模型能“装多少知识”,激活参数和每次前向计算的有效深度,则决定模型能“想多深”。
GLM-5.3已经证明:基座、架构和参数量完全不变,仅扩大长程环境和RL后训练,能力仍能继续明显提升。说明后训练远没有到头,预训练得到的能力还有很大的挖掘空间;Flash 则进一步回到预训练和架构本身,提高单位参数的智能效率。
实际体验很好。我这几天一直通过OpenRouter调用,速度很快,加上原生多模态后,图片和图片型PDF的处理简单很多。但是会时常断连,暂时不好判断是流量过大,还是国产卡大规模推理仍在磨合。
另一个超预期点是这次流量全部跑在国产卡上。
官方披露,ox-alpha的流量由数万颗国产卡承载。智谱还针对国产卡重做并行通信、推理引擎和EPD分离架构,同批硬件端到端性能提升约3倍。
继续看好智谱引领国产模型最前沿。
从GLM-5.3 Scaling后训练,到Flash重新Scaling预训练、架构和推理效率,智谱实际在不断寻找“下一个最值得拧的旋钮”,把智能/成本的帕累托曲线继续往前推,让单token智能不断提升。
投资建议:1.继续看好智谱坐稳国产模型第一梯队,模型能力与推理效率持续兑现;2.关注MiniMax在ARR超预期及下一代模型能力提升下的估值修复机会(当前P/ARR仅17倍);3.同时关注前沿模型在国产算力上的规模化部署,对国产算力带来的验证与催化。
总体总结
主题正文
- 智谱发布GLM-5.3-Flash,重新预训练后,用更小的模型实现了接近前沿模型的能力。
- 基座模型整体超过GLM-4.5-Base,并在多数指标上接近更大的GLM-5-Base。
- GLM-5.3已经证明:基座、架构和参数量完全不变,仅扩大长程环境和RL后训练,能力仍能继续明显提升。
- 智谱还针对国产卡重做并行通信、推理引擎和EPD分离架构,同批硬件端到端性能提升约3倍。
- 从GLM-5.3 Scaling后训练,到Flash重新Scaling预训练、架构和推理效率,智谱实际在不断寻找“下一个最值得拧的旋钮”,把智能/成本的帕累托曲线继续往前推,让单token智能不断提升。
- 投资建议:1.继续看好智谱坐稳国产模型第一梯队,模型能力与推理效率持续兑现;
- 2.关注MiniMax在ARR超预期及下一代模型能力提升下的估值修复机会(当前P/ARR仅17倍);
- 3.同时关注前沿模型在国产算力上的规模化部署,对国产算力带来的验证与催化。