GLM-5.3重回开源SOTA:后训练大幅提升模型能力,网络安全能力意外涌现。【天风传媒互联网&海外科技】 智谱今日正式发布 GLM-5.3: 更多加公众号:思

图片

无图片

正文

GLM-5.3重回开源SOTA:后训练大幅提升模型能力,网络安全能力意外涌现。【天风传媒互联网&海外科技】 智谱今日正式发布 GLM-5.3: 更多加公众号:思维纪要社 本次能力提升几乎全部来自后训练Scaling,在基座模型没有继续扩大的情况下,靠大幅扩展长程任务环境、环境类型与训练时长实现明显提升。

三点看: 1️⃣ Coding 仍是核心主线 → 编程体感较 5.2 提升约 50%。Terminal-Bench 3.0 从 5.1 升至 28.3(K3 为 17.4),GDPval-AA v2 达 1769(K3 为 1682),Agents' Last Exam 28.5 微超 K3 的 27.6;DeepSWE 66.9 与 K3 的 67.5 基本打平。GLM-5.3已站上开源模型Coding/Agent最头部梯队、 整体能力接近最前沿闭源模型、且提升集中在长程复杂软件工程任务、而非简单写代码与Demo。

2️⃣ 意外变化:网络安全能力"涌现" → 随 Coding 与长程 Agent 能力增强,代码审计、漏洞发现与漏洞推理显著提升: CyberGym得分居全球第一(84.5 > Mythos 5: 83.8),白盒漏洞发现接近 Mythos 5 / GPT-5.6 Sol;发布前两周与国内多家安全团队合作测试,累计发现 2400+ 漏洞、其中 1000+ 为中高危。 Coding能力提升后、模型正自然延伸到更复杂的专业Agent场景。

3️⃣ 路径与商业化 → 再次验证 Coding→Agent 演进:模型开始在数万行代码、上百个文件、多个工具与系统之间持续分析、执行、验证并完成任务。GLM-5.3 同步上线 ZCode、AutoClaw 与 GLM Coding Plan,已接入多家外部 Coding/Agent 平台,API 即将上线; 模型权重将在两周安全评估与加固完成后正式开源。

落点: 智谱重回开源SOTA、后训练成为本轮能力竞赛的主战场,这延续了我们的判断(DS与Grok同样如此),同代际能力趋同后,竞争继续转向复杂长程任务的执行质量、推理效率与成本,现有基座模型的智能上界、仍有充分的挖掘空间。

总体总结

主题正文

  1. 智谱今日正式发布 GLM-5.3: 更多加公众号:思维纪要社 本次能力提升几乎全部来自后训练Scaling,在基座模型没有继续扩大的情况下,靠大幅扩展长程任务环境、环境类型与训练时长实现明显提升。
  2. 1️⃣ Coding 仍是核心主线 → 编程体感较 5.2 提升约 50%。
  3. Terminal-Bench 3.0 从 5.1 升至 28.3(K3 为 17.4),GDPval-AA v2 达 1769(K3 为 1682),Agents' Last Exam 28.5 微超 K3 的 27.6;
  4. GLM-5.3已站上开源模型Coding/Agent最头部梯队、 整体能力接近最前沿闭源模型、且提升集中在长程复杂软件工程任务、而非简单写代码与Demo。
  5. 2️⃣ 意外变化:网络安全能力"涌现" → 随 Coding 与长程 Agent 能力增强,代码审计、漏洞发现与漏洞推理显著提升: CyberGym得分居全球第一(84.5 > Mythos 5: 83.8),白盒漏洞发现接近 Mythos 5 / GPT-5.6 Sol;
  6. 3️⃣ 路径与商业化 → 再次验证 Coding→Agent 演进:模型开始在数万行代码、上百个文件、多个工具与系统之间持续分析、执行、验证并完成任务。
  7. GLM-5.3 同步上线 ZCode、AutoClaw 与 GLM Coding Plan,已接入多家外部 Coding/Agent 平台,API 即将上线;
  8. 落点: 智谱重回开源SOTA、后训练成为本轮能力竞赛的主战场,这延续了我们的判断(DS与Grok同样如此),同代际能力趋同后,竞争继续转向复杂长程任务的执行质量、推理效率与成本,现有基座模型的智能上界、仍有充分的挖掘空间。