智谱GLM5.3点评:后训练推动能力加速收敛,GLM‑5.3跻身全球Coding前沿!AI安全能力涌现【天风计算机缪欣君团队】 ❗️重点关注智谱和AI安全包括我

图片

无图片

正文

智谱GLM5.3点评:后训练推动能力加速收敛,GLM‑5.3跻身全球Coding前沿!AI安全能力涌现【天风计算机缪欣君团队】

❗️重点关注智谱和AI安全包括我服和绿盟

1) GLM‑5.3已进入全球Coding/Agent第一梯队,本次榜单排序大致为GPT‑5.6 Sol≈Fable 5≥GLM‑5.3>Kimi K3≈DeepSeek V4 Pro。 GLM‑5.3在Terminal-Bench 2.1达到88.2,与Sol的88.8、K3的88.3基本持平;Terminal-Bench 3.0达到28.3,仅次于Sol/Fable,HLE w/Tools、ALE和GDPval-AA v2分别达到62.5、28.5和1769,Coding与复杂知识工作能力已逼近全球前沿。

2) 本次增益全部来自后训练,Coding能力再跃迁,网安能力出现明显涌现。 GLM‑5.3完全复用5.2基础模型,通过扩张真实专业任务环境、长程Agent RL和slime异步训练,将Terminal-Bench 3.0由4.6提升至28.3、DeepSWE由46.2提升至66.9;CyberGym达到84.5、超过Sol/Fable位居第一,ExploitBench由24.4翻倍至54.4,但在完整漏洞利用链上仍落后Sol/Fable。

3) 后训练正在推动国产模型能力向全球前沿加速收敛,当前能力曲线仍未见明显放缓。 GLM‑5.3仅沿用约0.75T总参数、40B激活的基础模型,便依靠环境、数据与RL规模化获得此次跃升,验证高质量底座仍有较大后训练潜力;若后续GLM‑5.5等大版本重启预训练扩张,并叠加已经成熟的RL与环境闭环,我们看好智谱模型能力再次实现台阶式提升。

总体总结

主题正文

  1. ❗️重点关注智谱和AI安全包括我服和绿盟
  2. 1) GLM‑5.3已进入全球Coding/Agent第一梯队,本次榜单排序大致为GPT‑5.6 Sol≈Fable 5≥GLM‑5.3>Kimi K3≈DeepSeek V4 Pro。
  3. GLM‑5.3在Terminal-Bench 2.1达到88.2,与Sol的88.8、K3的88.3基本持平;
  4. Terminal-Bench 3.0达到28.3,仅次于Sol/Fable,HLE w/Tools、ALE和GDPval-AA v2分别达到62.5、28.5和1769,Coding与复杂知识工作能力已逼近全球前沿。
  5. GLM‑5.3完全复用5.2基础模型,通过扩张真实专业任务环境、长程Agent RL和slime异步训练,将Terminal-Bench 3.0由4.6提升至28.3、DeepSWE由46.2提升至66.9;
  6. CyberGym达到84.5、超过Sol/Fable位居第一,ExploitBench由24.4翻倍至54.4,但在完整漏洞利用链上仍落后Sol/Fable。
  7. GLM‑5.3仅沿用约0.75T总参数、40B激活的基础模型,便依靠环境、数据与RL规模化获得此次跃升,验证高质量底座仍有较大后训练潜力;
  8. 若后续GLM‑5.5等大版本重启预训练扩张,并叠加已经成熟的RL与环境闭环,我们看好智谱模型能力再次实现台阶式提升。