智谱 “后训练仙人”的SAO操作(0824)@华泰计算机 模型能力提升,是以数据为燃料,预训练基座为大脑,后训练为行动 。Agentic时代,后训练的重要性被提
- 序号:352
- 星球链接:打开网页
- 附件:图片 0,音频 0,文档 0
- 音频文件:无音频
图片
无图片
正文
智谱 “后训练仙人”的SAO操作(0824)@华泰计算机
模型能力提升,是以数据为燃料,预训练基座为大脑,后训练为行动 。Agentic时代,后训练的重要性被提高。
智谱GLM-5.3延续5.2约700B的基座,继续靠强化后训练,已经能做到接近K3 2.8T大基座的水平,说明智谱后训练能力在国产模型中的领先性。
重温一下后训练仙人智谱 的后训练代表算法——26年7月发表的SAO 。SAO本质上升级了DeepSeek-R1的GRPO算法,顺应了Agentic时代的长/复杂推理,让不同长短的答案,在生成之后直接去做RL,并且辅以过时答案的过滤等机制,效果显著。
更有意思的是,SAO这种“一条经验回来就能学”的方式,天然更接近让Agent边干活、边学习、持续进化,也为后续的continue_learning打下了基础。如果这条路最终跑通,后训练的意义还会再上一个台阶:模型发布可能不再是一个静态终点,而是持续学习的起点。
近期ox-alpha新模型的测试也是大家的关注点,有些公开探讨说是智谱的新模型,这个目前还没有定论,不做评判。
总体总结
主题正文
- 智谱 “后训练仙人”的SAO操作(0824)@华泰计算机
- 模型能力提升,是以数据为燃料,预训练基座为大脑,后训练为行动 。
- 智谱GLM-5.3延续5.2约700B的基座,继续靠强化后训练,已经能做到接近K3 2.8T大基座的水平,说明智谱后训练能力在国产模型中的领先性。
- 重温一下后训练仙人智谱 的后训练代表算法——26年7月发表的SAO 。
- SAO本质上升级了DeepSeek-R1的GRPO算法,顺应了Agentic时代的长/复杂推理,让不同长短的答案,在生成之后直接去做RL,并且辅以过时答案的过滤等机制,效果显著。
- 更有意思的是,SAO这种“一条经验回来就能学”的方式,天然更接近让Agent边干活、边学习、持续进化,也为后续的continue_learning打下了基础。
- 如果这条路最终跑通,后训练的意义还会再上一个台阶:模型发布可能不再是一个静态终点,而是持续学习的起点。
- 近期ox-alpha新模型的测试也是大家的关注点,有些公开探讨说是智谱的新模型,这个目前还没有定论,不做评判。