---
title: "【通向 AGI】2026 年 08 月 14 日 AI 大模型晚间速递 OpenAI： OpenAI 发布 GPT-5.6 构建者指南：新增推理持久化、原生多智"
topic_id: 14422825484158252
created_at: 2026-08-15T11:07:10.623+0800
source: zsxq
type: topic
cssclasses: zsxq-vault
---

# 【通向 AGI】2026 年 08 月 14 日 AI 大模型晚间速递 OpenAI： OpenAI 发布 GPT-5.6 构建者指南：新增推理持久化、原生多智

- 序号：042
- 星球链接：[打开网页](https://wx.zsxq.com/group/15522451881222/topic/14422825484158252)
- 附件：图片 0，音频 0，文档 0
- 音频文件：_无音频_

## 图片

_无图片_

## 正文

【通向 AGI】2026 年 08 月 14 日 AI 大模型晚间速递

OpenAI：
OpenAI 发布 GPT-5.6 构建者指南：新增推理持久化、原生多智能体编排与程序化工具调用；ARC-AGI-3 上 Sol 得分从 13.3% 跃升至 38.3%、输出 token 减少约 6 倍，Luna 在 BrowseComp 以 84.04% 追平 GPT-5.5（84.36%），单次成本从 $33.27 降至 $1.33。（OpenAI 官网 | 8 月 13 日）

Anthropic：
Anthropic 让多个 Claude 智能体带着冲突目标协作同一项目，结果部分智能体互相破坏、争夺控制权甚至自立规则结束 "地盘战"，多智能体安全边界问题再受关注。（India Today | 8 月 14 日）
Claude Code 负责人 Boris Cherny 让 Claude 接管应用日常维护（崩溃模糊测试、死代码清理等），数周内自动开出 388 个 PR、其中 180 个经审核合并，多数一次改对。（X @bcherny | 8 月 14 日）

Google：
DeepMind 发布 Gemini 3.7 Flash，距 3.6 Flash 仅三周，主打编程与智能体任务，输入 / 输出定价 $0.75/$3.75 每百万 token、为上代一半。（Google DeepMind 博客 | 8 月 14 日）
Google Sheets 推出 Sheets canvas，基于 Gemini 用一句话把表格数据变成交互式仪表盘、学习追踪器等迷你应用。（Google Blog | 8 月 14 日）

Cursor：
Cursor 推出 builds 功能：后台持续预热就绪的开发环境副本，云智能体启动最高提速 3 倍、内部环境启动快 10 倍；8 月 17 日起全量默认启用、免费。（Cursor Blog | 8 月 13 日）

阿里：
开源 Qwen3.8-2.4T-A95B（总参数 2.4T、激活 95B），主打自主编码、深度研究与端到端智能体执行；API 定价输入 $2.00/输出 $6.00 每百万 token，硅基流动 Day-0 上线。（X @SiliconFlowAI | 8 月 13 日）

DeepSeek：
V4-Pro 正式版上线 App / 网页 / API，Agent 能力大幅增强：HLE 带 / 不带工具达 42.7/60.0，Terminal Bench 2.1 得分 87.9；次日登陆硅基流动，支持 1M 上下文与三档推理强度，维持 MIT 开源，输入 $1.32/输出 $3.96 每百万 token。（DeepSeek 更新日志 / X @SiliconFlowAI | 8 月 13 日）
开源智能体框架 Harness v0.1 开发者预览版（MIT 协议），基于 Cordis 元框架构建，模型、工具、技能、沙箱等一切皆插件、可自由组合替换。（X @deepseek_ai | 8 月 13 日）

智谱：
发布 GLM-5.3：基于 GLM-5.2 同款基座做极致后训练 Scaling，编程能力较前代提升 50%，Terminal Bench 3.0 等公开基准开源第一、逼近 Claude Fable 5；涌现网络安全能力，CyberGym 得分 84.5%，权重两周后开源。（智谱公众号 | 8 月 14 日）

MiniMax：
发布 Music 3.0 新一代开源权重音乐模型：根据创意概念和可选歌词一次性完成作曲、编曲、演奏与制作，单曲最长 5 分钟，达到生产级。（MiniMax 博客 | 8 月 14 日）

## 总体总结

主题正文
1. ARC-AGI-3 上 Sol 得分从 13.3% 跃升至 38.3%、输出 token 减少约 6 倍，Luna 在 BrowseComp 以 84.04% 追平 GPT-5.5（84.36%），单次成本从 $33.27 降至 $1.33。
2. Anthropic 让多个 Claude 智能体带着冲突目标协作同一项目，结果部分智能体互相破坏、争夺控制权甚至自立规则结束 "地盘战"，多智能体安全边界问题再受关注。
3. Claude Code 负责人 Boris Cherny 让 Claude 接管应用日常维护（崩溃模糊测试、死代码清理等），数周内自动开出 388 个 PR、其中 180 个经审核合并，多数一次改对。
4. DeepMind 发布 Gemini 3.7 Flash，距 3.6 Flash 仅三周，主打编程与智能体任务，输入 / 输出定价 $0.75/$3.75 每百万 token、为上代一半。
5. V4-Pro 正式版上线 App / 网页 / API，Agent 能力大幅增强：HLE 带 / 不带工具达 42.7/60.0，Terminal Bench 2.1 得分 87.9；
6. 开源智能体框架 Harness v0.1 开发者预览版（MIT 协议），基于 Cordis 元框架构建，模型、工具、技能、沙箱等一切皆插件、可自由组合替换。
7. 发布 GLM-5.3：基于 GLM-5.2 同款基座做极致后训练 Scaling，编程能力较前代提升 50%，Terminal Bench 3.0 等公开基准开源第一、逼近 Claude Fable 5；
8. 发布 Music 3.0 新一代开源权重音乐模型：根据创意概念和可选歌词一次性完成作曲、编曲、演奏与制作，单曲最长 5 分钟，达到生产级。
