唐杰老师上周对ScalingLaw的判断,暗示了这次Flash 的提升路径: Scaling没有结束,只是Scaling的维度不再只有参数量。总参数更多决定模型
- 序号:308
- 星球链接:打开网页
- 附件:图片 0,音频 0,文档 0
- 音频文件:无音频
图片
无图片
正文
唐杰老师上周对ScalingLaw的判断,暗示了这次Flash 的提升路径:
Scaling没有结束,只是Scaling的维度不再只有参数量。总参数更多决定模型能“装多少知识”,激活参数和每次前向计算的有效深度,则决定模型能“想多深”。
GLM-5.3证明,基座、架构和参数量完全不变,仅扩大长程环境和RL后训练,能力仍能继续明显提升。说明后训练远没有到头,预训练得到的能力还有很大的挖掘空间;Flash 则进一步回到预训练和架构本身,提高单位参数的智能效率。
总体总结
主题正文
- 唐杰老师上周对ScalingLaw的判断,暗示了这次Flash 的提升路径:
- Scaling没有结束,只是Scaling的维度不再只有参数量。
- 总参数更多决定模型能“装多少知识”,激活参数和每次前向计算的有效深度,则决定模型能“想多深”。
- GLM-5.3证明,基座、架构和参数量完全不变,仅扩大长程环境和RL后训练,能力仍能继续明显提升。
- 说明后训练远没有到头,预训练得到的能力还有很大的挖掘空间;
- Flash 则进一步回到预训练和架构本身,提高单位参数的智能效率。