---
title: "智谱 “后训练仙人”的SAO操作（0824）@华泰计算机 模型能力提升，是以数据为燃料，预训练基座为大脑，后训练为行动 。Agentic时代，后训练的重要性被提"
topic_id: 55521118415115584
created_at: 2026-08-24T09:22:56.928+0800
source: zsxq
type: topic
cssclasses: zsxq-vault
---

# 智谱 “后训练仙人”的SAO操作（0824）@华泰计算机 模型能力提升，是以数据为燃料，预训练基座为大脑，后训练为行动 。Agentic时代，后训练的重要性被提

- 序号：352
- 星球链接：[打开网页](https://wx.zsxq.com/group/15522451881222/topic/55521118415115584)
- 附件：图片 0，音频 0，文档 0
- 音频文件：_无音频_

## 图片

_无图片_

## 正文

智谱 “后训练仙人”的SAO操作（0824）@华泰计算机

模型能力提升，是以数据为燃料，预训练基座为大脑，后训练为行动 。Agentic时代，后训练的重要性被提高。

智谱GLM-5.3延续5.2约700B的基座，继续靠强化后训练，已经能做到接近K3 2.8T大基座的水平，说明智谱后训练能力在国产模型中的领先性。

重温一下后训练仙人智谱 的后训练代表算法——26年7月发表的SAO 。SAO本质上升级了DeepSeek-R1的GRPO算法，顺应了Agentic时代的长/复杂推理，让不同长短的答案，在生成之后直接去做RL，并且辅以过时答案的过滤等机制，效果显著。

更有意思的是，SAO这种“一条经验回来就能学”的方式，天然更接近让Agent边干活、边学习、持续进化，也为后续的continue_learning打下了基础。如果这条路最终跑通，后训练的意义还会再上一个台阶：模型发布可能不再是一个静态终点，而是持续学习的起点。

近期ox-alpha新模型的测试也是大家的关注点，有些公开探讨说是智谱的新模型，这个目前还没有定论，不做评判。

## 总体总结

主题正文
1. 智谱 “后训练仙人”的SAO操作（0824）@华泰计算机
2. 模型能力提升，是以数据为燃料，预训练基座为大脑，后训练为行动 。
3. 智谱GLM-5.3延续5.2约700B的基座，继续靠强化后训练，已经能做到接近K3 2.8T大基座的水平，说明智谱后训练能力在国产模型中的领先性。
4. 重温一下后训练仙人智谱 的后训练代表算法——26年7月发表的SAO 。
5. SAO本质上升级了DeepSeek-R1的GRPO算法，顺应了Agentic时代的长/复杂推理，让不同长短的答案，在生成之后直接去做RL，并且辅以过时答案的过滤等机制，效果显著。
6. 更有意思的是，SAO这种“一条经验回来就能学”的方式，天然更接近让Agent边干活、边学习、持续进化，也为后续的continue_learning打下了基础。
7. 如果这条路最终跑通，后训练的意义还会再上一个台阶：模型发布可能不再是一个静态终点，而是持续学习的起点。
8. 近期ox-alpha新模型的测试也是大家的关注点，有些公开探讨说是智谱的新模型，这个目前还没有定论，不做评判。
