智谱GLM5.3点评:后训练推动能力加速收敛,GLM‑5.3跻身全球Coding前沿!AI安全能力涌现【天风计算机缪欣君团队】 ❗️重点关注智谱和AI安全包括我
- 序号:053
- 星球链接:打开网页
- 附件:图片 0,音频 0,文档 0
- 音频文件:无音频
图片
无图片
正文
智谱GLM5.3点评:后训练推动能力加速收敛,GLM‑5.3跻身全球Coding前沿!AI安全能力涌现【天风计算机缪欣君团队】
❗️重点关注智谱和AI安全包括我服和绿盟
1) GLM‑5.3已进入全球Coding/Agent第一梯队,本次榜单排序大致为GPT‑5.6 Sol≈Fable 5≥GLM‑5.3>Kimi K3≈DeepSeek V4 Pro。 GLM‑5.3在Terminal-Bench 2.1达到88.2,与Sol的88.8、K3的88.3基本持平;Terminal-Bench 3.0达到28.3,仅次于Sol/Fable,HLE w/Tools、ALE和GDPval-AA v2分别达到62.5、28.5和1769,Coding与复杂知识工作能力已逼近全球前沿。
2) 本次增益全部来自后训练,Coding能力再跃迁,网安能力出现明显涌现。 GLM‑5.3完全复用5.2基础模型,通过扩张真实专业任务环境、长程Agent RL和slime异步训练,将Terminal-Bench 3.0由4.6提升至28.3、DeepSWE由46.2提升至66.9;CyberGym达到84.5、超过Sol/Fable位居第一,ExploitBench由24.4翻倍至54.4,但在完整漏洞利用链上仍落后Sol/Fable。
3) 后训练正在推动国产模型能力向全球前沿加速收敛,当前能力曲线仍未见明显放缓。 GLM‑5.3仅沿用约0.75T总参数、40B激活的基础模型,便依靠环境、数据与RL规模化获得此次跃升,验证高质量底座仍有较大后训练潜力;若后续GLM‑5.5等大版本重启预训练扩张,并叠加已经成熟的RL与环境闭环,我们看好智谱模型能力再次实现台阶式提升。
总体总结
主题正文
- ❗️重点关注智谱和AI安全包括我服和绿盟
- 1) GLM‑5.3已进入全球Coding/Agent第一梯队,本次榜单排序大致为GPT‑5.6 Sol≈Fable 5≥GLM‑5.3>Kimi K3≈DeepSeek V4 Pro。
- GLM‑5.3在Terminal-Bench 2.1达到88.2,与Sol的88.8、K3的88.3基本持平;
- Terminal-Bench 3.0达到28.3,仅次于Sol/Fable,HLE w/Tools、ALE和GDPval-AA v2分别达到62.5、28.5和1769,Coding与复杂知识工作能力已逼近全球前沿。
- GLM‑5.3完全复用5.2基础模型,通过扩张真实专业任务环境、长程Agent RL和slime异步训练,将Terminal-Bench 3.0由4.6提升至28.3、DeepSWE由46.2提升至66.9;
- CyberGym达到84.5、超过Sol/Fable位居第一,ExploitBench由24.4翻倍至54.4,但在完整漏洞利用链上仍落后Sol/Fable。
- GLM‑5.3仅沿用约0.75T总参数、40B激活的基础模型,便依靠环境、数据与RL规模化获得此次跃升,验证高质量底座仍有较大后训练潜力;
- 若后续GLM‑5.5等大版本重启预训练扩张,并叠加已经成熟的RL与环境闭环,我们看好智谱模型能力再次实现台阶式提升。