---
title: "GLM-5.3重回开源SOTA：后训练大幅提升模型能力，网络安全能力意外涌现。【天风传媒互联网&海外科技】 智谱今日正式发布 GLM-5.3： 更多加公众号：思"
topic_id: 14422825448584852
created_at: 2026-08-14T22:11:32.646+0800
source: zsxq
type: topic
cssclasses: zsxq-vault
---

# GLM-5.3重回开源SOTA：后训练大幅提升模型能力，网络安全能力意外涌现。【天风传媒互联网&海外科技】 智谱今日正式发布 GLM-5.3： 更多加公众号：思

- 序号：056
- 星球链接：[打开网页](https://wx.zsxq.com/group/15522451881222/topic/14422825448584852)
- 附件：图片 0，音频 0，文档 0
- 音频文件：_无音频_

## 图片

_无图片_

## 正文

GLM-5.3重回开源SOTA：后训练大幅提升模型能力，网络安全能力意外涌现。【天风传媒互联网&海外科技】
智谱今日正式发布 GLM-5.3： 更多加公众号：思维纪要社 本次能力提升几乎全部来自后训练Scaling，在基座模型没有继续扩大的情况下，靠大幅扩展长程任务环境、环境类型与训练时长实现明显提升。

三点看：
1️⃣ Coding 仍是核心主线 → 编程体感较 5.2 提升约 50%。Terminal-Bench 3.0 从 5.1 升至 28.3(K3 为 17.4)，GDPval-AA v2 达 1769(K3 为 1682)，Agents' Last Exam 28.5 微超 K3 的 27.6；DeepSWE 66.9 与 K3 的 67.5 基本打平。GLM-5.3已站上开源模型Coding/Agent最头部梯队、 整体能力接近最前沿闭源模型、且提升集中在长程复杂软件工程任务、而非简单写代码与Demo。

2️⃣ 意外变化：网络安全能力"涌现" → 随 Coding 与长程 Agent 能力增强，代码审计、漏洞发现与漏洞推理显著提升： CyberGym得分居全球第一（84.5 > Mythos 5: 83.8），白盒漏洞发现接近 Mythos 5 / GPT-5.6 Sol；发布前两周与国内多家安全团队合作测试，累计发现 2400+ 漏洞、其中 1000+ 为中高危。 Coding能力提升后、模型正自然延伸到更复杂的专业Agent场景。

3️⃣ 路径与商业化 → 再次验证 Coding→Agent 演进：模型开始在数万行代码、上百个文件、多个工具与系统之间持续分析、执行、验证并完成任务。GLM-5.3 同步上线 ZCode、AutoClaw 与 GLM Coding Plan，已接入多家外部 Coding/Agent 平台，API 即将上线； 模型权重将在两周安全评估与加固完成后正式开源。

落点： 智谱重回开源SOTA、后训练成为本轮能力竞赛的主战场，这延续了我们的判断(DS与Grok同样如此)，同代际能力趋同后，竞争继续转向复杂长程任务的执行质量、推理效率与成本，现有基座模型的智能上界、仍有充分的挖掘空间。

## 总体总结

主题正文
1. 智谱今日正式发布 GLM-5.3： 更多加公众号：思维纪要社 本次能力提升几乎全部来自后训练Scaling，在基座模型没有继续扩大的情况下，靠大幅扩展长程任务环境、环境类型与训练时长实现明显提升。
2. 1️⃣ Coding 仍是核心主线 → 编程体感较 5.2 提升约 50%。
3. Terminal-Bench 3.0 从 5.1 升至 28.3(K3 为 17.4)，GDPval-AA v2 达 1769(K3 为 1682)，Agents' Last Exam 28.5 微超 K3 的 27.6；
4. GLM-5.3已站上开源模型Coding/Agent最头部梯队、 整体能力接近最前沿闭源模型、且提升集中在长程复杂软件工程任务、而非简单写代码与Demo。
5. 2️⃣ 意外变化：网络安全能力"涌现" → 随 Coding 与长程 Agent 能力增强，代码审计、漏洞发现与漏洞推理显著提升： CyberGym得分居全球第一（84.5 > Mythos 5: 83.8），白盒漏洞发现接近 Mythos 5 / GPT-5.6 Sol；
6. 3️⃣ 路径与商业化 → 再次验证 Coding→Agent 演进：模型开始在数万行代码、上百个文件、多个工具与系统之间持续分析、执行、验证并完成任务。
7. GLM-5.3 同步上线 ZCode、AutoClaw 与 GLM Coding Plan，已接入多家外部 Coding/Agent 平台，API 即将上线；
8. 落点： 智谱重回开源SOTA、后训练成为本轮能力竞赛的主战场，这延续了我们的判断(DS与Grok同样如此)，同代际能力趋同后，竞争继续转向复杂长程任务的执行质量、推理效率与成本，现有基座模型的智能上界、仍有充分的挖掘空间。
