【3C计算机】GLM-5.3正式发布 GLM-5.3今天正式发布,在前沿编程能力上继续明显提升,并在网络安全能力上出现涌现 1 聚焦后训练Scaling实现能力

图片

无图片

正文

【3C计算机】GLM-5.3正式发布

GLM-5.3今天正式发布,在前沿编程能力上继续明显提升,并在网络安全能力上出现涌现

1 聚焦后训练Scaling实现能力提升,此次GLM-5.3基于先前的基座,继续扩大长程任务环境、后训练环境与时长,实现了编程等核心能力的进一步提升

2 Coding 仍是GLM-5.3核心的能力提升,多项BenchMark实现明显进步,在Terminal-Bench 3.0 中,得分从 5.1 提升至 28.3(K3 为 17.4);在聚焦长程软件工程任务的 DeepSWE 上,从 46.2 提升至 66.9(K3 为 67.5);在 Agents' Last Exam 上,从 23.8 提升至 28.5(K3 为 27.6);在高价值知识能力的GDPval-AA v2中,得分为1769(K3为1682)

3 网络安全能力实现涌现,GLM-5.3在代码审计、漏洞发现和漏洞推理上的能力也显著提升。在白盒漏洞发现等任务上,GLM-5.3 已经接近 Mythos 5 / GPT-5.6 Sol 这样的前沿闭源模型。发布前两周与国内多家安全团队合作测试中,累计发现2,400+ 个漏洞。在衡量 AI Agent 真实软件漏洞分析与复现能力的 CyberGym 上,GLM-5.3 得分84.5,高居全球第一(Mythos 5 为 83.8)

4 产品和商业化预计同步推进, GLM-5.3 今日发布后上线 ZCode、AutoClaw 和 GLM Coding Plan,并已经接入多家外部 Coding / Agent 平台;API 预计也将很快上线,且模型权重预计会在两周安全评估和加固完成后正式开源;本次更新也维持了先前5.2的价格,具有高性价比

官方blog:

总体总结

主题正文

  1. 1 聚焦后训练Scaling实现能力提升,此次GLM-5.3基于先前的基座,继续扩大长程任务环境、后训练环境与时长,实现了编程等核心能力的进一步提升
  2. 2 Coding 仍是GLM-5.3核心的能力提升,多项BenchMark实现明显进步,在Terminal-Bench 3.0 中,得分从 5.1 提升至 28.3(K3 为 17.4);
  3. 在聚焦长程软件工程任务的 DeepSWE 上,从 46.2 提升至 66.9(K3 为 67.5);
  4. 在白盒漏洞发现等任务上,GLM-5.3 已经接近 Mythos 5 / GPT-5.6 Sol 这样的前沿闭源模型。
  5. 在衡量 AI Agent 真实软件漏洞分析与复现能力的 CyberGym 上,GLM-5.3 得分84.5,高居全球第一(Mythos 5 为 83.8)
  6. GLM-5.3 今日发布后上线 ZCode、AutoClaw 和 GLM Coding Plan,并已经接入多家外部 Coding / Agent 平台;
  7. API 预计也将很快上线,且模型权重预计会在两周安全评估和加固完成后正式开源;
  8. 本次更新也维持了先前5.2的价格,具有高性价比