智谱 “后训练仙人”的SAO操作(0824)@华泰计算机 模型能力提升,是以数据为燃料,预训练基座为大脑,后训练为行动 。Agentic时代,后训练的重要性被提

图片

无图片

正文

智谱 “后训练仙人”的SAO操作(0824)@华泰计算机

模型能力提升,是以数据为燃料,预训练基座为大脑,后训练为行动 。Agentic时代,后训练的重要性被提高。

智谱GLM-5.3延续5.2约700B的基座,继续靠强化后训练,已经能做到接近K3 2.8T大基座的水平,说明智谱后训练能力在国产模型中的领先性。

重温一下后训练仙人智谱 的后训练代表算法——26年7月发表的SAO 。SAO本质上升级了DeepSeek-R1的GRPO算法,顺应了Agentic时代的长/复杂推理,让不同长短的答案,在生成之后直接去做RL,并且辅以过时答案的过滤等机制,效果显著。

更有意思的是,SAO这种“一条经验回来就能学”的方式,天然更接近让Agent边干活、边学习、持续进化,也为后续的continue_learning打下了基础。如果这条路最终跑通,后训练的意义还会再上一个台阶:模型发布可能不再是一个静态终点,而是持续学习的起点。

近期ox-alpha新模型的测试也是大家的关注点,有些公开探讨说是智谱的新模型,这个目前还没有定论,不做评判。

总体总结

主题正文

  1. 智谱 “后训练仙人”的SAO操作(0824)@华泰计算机
  2. 模型能力提升,是以数据为燃料,预训练基座为大脑,后训练为行动 。
  3. 智谱GLM-5.3延续5.2约700B的基座,继续靠强化后训练,已经能做到接近K3 2.8T大基座的水平,说明智谱后训练能力在国产模型中的领先性。
  4. 重温一下后训练仙人智谱 的后训练代表算法——26年7月发表的SAO 。
  5. SAO本质上升级了DeepSeek-R1的GRPO算法,顺应了Agentic时代的长/复杂推理,让不同长短的答案,在生成之后直接去做RL,并且辅以过时答案的过滤等机制,效果显著。
  6. 更有意思的是,SAO这种“一条经验回来就能学”的方式,天然更接近让Agent边干活、边学习、持续进化,也为后续的continue_learning打下了基础。
  7. 如果这条路最终跑通,后训练的意义还会再上一个台阶:模型发布可能不再是一个静态终点,而是持续学习的起点。
  8. 近期ox-alpha新模型的测试也是大家的关注点,有些公开探讨说是智谱的新模型,这个目前还没有定论,不做评判。