---
title: "智谱：发布GLM-5.3，后训练Scaling推动Coding与长程Agent能力显著提升【建投通信及人工智能】 事件：8月14日，智谱正式发布GLM-5.3。"
topic_id: 45544148551818458
created_at: 2026-08-14T22:10:12.689+0800
source: zsxq
type: topic
cssclasses: zsxq-vault
---

# 智谱：发布GLM-5.3，后训练Scaling推动Coding与长程Agent能力显著提升【建投通信及人工智能】 事件：8月14日，智谱正式发布GLM-5.3。

- 序号：063
- 星球链接：[打开网页](https://wx.zsxq.com/group/15522451881222/topic/45544148551818458)
- 附件：图片 0，音频 0，文档 0
- 音频文件：_无音频_

## 图片

_无图片_

## 正文

智谱：发布GLM-5.3，后训练Scaling推动Coding与长程Agent能力显著提升【建投通信及人工智能】

事件：8月14日，智谱正式发布GLM-5.3。与GLM-5.2相比，GLM-5.3沿用相同基座模型，能力提升主要来自后训练Scaling，在多项Coding及Agent公开评测中取得开源第一，编程体感较GLM-5.2提升约50%，并涌现出接近全球前沿闭源模型的网络安全能力。

同一基座模型实现能力跃升，进一步验证后训练Scaling仍有较大空间。本轮升级没有继续扩大基座模型规模，而是将长程任务环境扩展数十倍，同时增加环境类型和后训练时长，并依托IndexShare、SAO及新一代Slime框架提高强化学习效率。我们认为，这意味着模型能力提升并不完全依赖参数规模和预训练算力扩张，通过持续增加高质量任务环境、长程轨迹和可验证奖励，现有基座模型的智能上界仍可被进一步挖掘，也有助于公司以更高的资本和算力效率推进模型迭代。

Coding仍是GLM-5.3本次最核心的能力提升方向，从几个最具代表性的长程Coding及Agent评测看：
1）在DeepSWE v1.1上，GLM-5.3得分由46.2提升至66.9，基本追平Kimi K3的67.5，高于Grok 4.6官方披露的65.9和DeepSeek V4 Pro的62.7；
2）在Agents’ Last Exam上，GLM-5.3由23.8提升至28.5，高于Kimi K3的28.3和DeepSeek V4 Pro的25.7
3）在难度更高的Terminal-Bench 3.0上，GLM-5.3由4.6大幅提升至28.3，较Kimi K3的17.4高出10.9分、领先约63%，同时超过Grok 4.6的最新公开成绩26.5。
整体来看，GLM-5.3在各项能力上已经达到开源模型的顶级水平。

真实编程体感与Token效率同步提升，模型正在由“写代码”走向“完成工程任务”。GLM-5.3每项任务平均输出约5万Tokens，而Opus 4.8约需12万Tokens。GLM-5.3不仅任务通过率更高，执行路径也更短，体现出更强的规划、工具调用、自主验证和错误修正能力。

网络安全能力显著涌现，为Coding向高价值专业Agent延伸提供了代表性场景。在白盒漏洞发现任务CyberGym上，GLM-5.3得分由77.2%提升至84.5%，高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。在ExploitGym中，两小时和六小时分别完成105项和130项任务，较GLM-5.2的29项和39项大幅提升。虽然模型在完整漏洞利用链条上与Mythos 5等闭源模型仍有差距，但在代码审查、漏洞识别和验证等更偏防御端的任务上已经达到全球前沿水平。

综合来看：1）相同基座模型通过后训练Scaling仍可实现显著能力跃升，现有模型的智能上界尚未被充分挖掘；2）Coding能力正在由代码生成升级为长程工程任务交付，模型开始具备真正可工作的Agent形态；3）Coding能力增强可以自然延伸至网络安全等高价值专业场景，打开新的商业化空间。随着GLM-5.3在自有产品、外部Coding平台和开源生态中加速落地，持续看好智谱在国产基础模型、Coding Agent及专业Agent领域的领先卡位与商业化弹性。

## 总体总结

主题正文
1. 与GLM-5.2相比，GLM-5.3沿用相同基座模型，能力提升主要来自后训练Scaling，在多项Coding及Agent公开评测中取得开源第一，编程体感较GLM-5.2提升约50%，并涌现出接近全球前沿闭源模型的网络安全能力。
2. 我们认为，这意味着模型能力提升并不完全依赖参数规模和预训练算力扩张，通过持续增加高质量任务环境、长程轨迹和可验证奖励，现有基座模型的智能上界仍可被进一步挖掘，也有助于公司以更高的资本和算力效率推进模型迭代。
3. Coding仍是GLM-5.3本次最核心的能力提升方向，从几个最具代表性的长程Coding及Agent评测看：
4. 1）在DeepSWE v1.1上，GLM-5.3得分由46.2提升至66.9，基本追平Kimi K3的67.5，高于Grok 4.6官方披露的65.9和DeepSeek V4 Pro的62.7；
5. 2）在Agents’ Last Exam上，GLM-5.3由23.8提升至28.5，高于Kimi K3的28.3和DeepSeek V4 Pro的25.7
6. 3）在难度更高的Terminal-Bench 3.0上，GLM-5.3由4.6大幅提升至28.3，较Kimi K3的17.4高出10.9分、领先约63%，同时超过Grok 4.6的最新公开成绩26.5。
7. 在白盒漏洞发现任务CyberGym上，GLM-5.3得分由77.2%提升至84.5%，高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。
8. 随着GLM-5.3在自有产品、外部Coding平台和开源生态中加速落地，持续看好智谱在国产基础模型、Coding Agent及专业Agent领域的领先卡位与商业化弹性。
