GLM-5.3重回开源SOTA:后训练大幅提升模型能力,网络安全能力意外涌现。【天风传媒互联网&海外科技】 智谱今日正式发布 GLM-5.3: 更多加公众号:思
- 序号:056
- 星球链接:打开网页
- 附件:图片 0,音频 0,文档 0
- 音频文件:无音频
图片
无图片
正文
GLM-5.3重回开源SOTA:后训练大幅提升模型能力,网络安全能力意外涌现。【天风传媒互联网&海外科技】 智谱今日正式发布 GLM-5.3: 更多加公众号:思维纪要社 本次能力提升几乎全部来自后训练Scaling,在基座模型没有继续扩大的情况下,靠大幅扩展长程任务环境、环境类型与训练时长实现明显提升。
三点看: 1️⃣ Coding 仍是核心主线 → 编程体感较 5.2 提升约 50%。Terminal-Bench 3.0 从 5.1 升至 28.3(K3 为 17.4),GDPval-AA v2 达 1769(K3 为 1682),Agents' Last Exam 28.5 微超 K3 的 27.6;DeepSWE 66.9 与 K3 的 67.5 基本打平。GLM-5.3已站上开源模型Coding/Agent最头部梯队、 整体能力接近最前沿闭源模型、且提升集中在长程复杂软件工程任务、而非简单写代码与Demo。
2️⃣ 意外变化:网络安全能力"涌现" → 随 Coding 与长程 Agent 能力增强,代码审计、漏洞发现与漏洞推理显著提升: CyberGym得分居全球第一(84.5 > Mythos 5: 83.8),白盒漏洞发现接近 Mythos 5 / GPT-5.6 Sol;发布前两周与国内多家安全团队合作测试,累计发现 2400+ 漏洞、其中 1000+ 为中高危。 Coding能力提升后、模型正自然延伸到更复杂的专业Agent场景。
3️⃣ 路径与商业化 → 再次验证 Coding→Agent 演进:模型开始在数万行代码、上百个文件、多个工具与系统之间持续分析、执行、验证并完成任务。GLM-5.3 同步上线 ZCode、AutoClaw 与 GLM Coding Plan,已接入多家外部 Coding/Agent 平台,API 即将上线; 模型权重将在两周安全评估与加固完成后正式开源。
落点: 智谱重回开源SOTA、后训练成为本轮能力竞赛的主战场,这延续了我们的判断(DS与Grok同样如此),同代际能力趋同后,竞争继续转向复杂长程任务的执行质量、推理效率与成本,现有基座模型的智能上界、仍有充分的挖掘空间。
总体总结
主题正文
- 智谱今日正式发布 GLM-5.3: 更多加公众号:思维纪要社 本次能力提升几乎全部来自后训练Scaling,在基座模型没有继续扩大的情况下,靠大幅扩展长程任务环境、环境类型与训练时长实现明显提升。
- 1️⃣ Coding 仍是核心主线 → 编程体感较 5.2 提升约 50%。
- Terminal-Bench 3.0 从 5.1 升至 28.3(K3 为 17.4),GDPval-AA v2 达 1769(K3 为 1682),Agents' Last Exam 28.5 微超 K3 的 27.6;
- GLM-5.3已站上开源模型Coding/Agent最头部梯队、 整体能力接近最前沿闭源模型、且提升集中在长程复杂软件工程任务、而非简单写代码与Demo。
- 2️⃣ 意外变化:网络安全能力"涌现" → 随 Coding 与长程 Agent 能力增强,代码审计、漏洞发现与漏洞推理显著提升: CyberGym得分居全球第一(84.5 > Mythos 5: 83.8),白盒漏洞发现接近 Mythos 5 / GPT-5.6 Sol;
- 3️⃣ 路径与商业化 → 再次验证 Coding→Agent 演进:模型开始在数万行代码、上百个文件、多个工具与系统之间持续分析、执行、验证并完成任务。
- GLM-5.3 同步上线 ZCode、AutoClaw 与 GLM Coding Plan,已接入多家外部 Coding/Agent 平台,API 即将上线;
- 落点: 智谱重回开源SOTA、后训练成为本轮能力竞赛的主战场,这延续了我们的判断(DS与Grok同样如此),同代际能力趋同后,竞争继续转向复杂长程任务的执行质量、推理效率与成本,现有基座模型的智能上界、仍有充分的挖掘空间。