📰 【海外|通向 AGI】2026 年 08 月 13 日 AI 大模型晚间速递 xAI: Grok 4.6 正式发布,1.5T 参数(与 4.5 相同 V9
- 序号:315
- 星球链接:打开网页
- 附件:图片 0,音频 0,文档 0
- 音频文件:无音频
图片
无图片
正文
📰 【海外|通向 AGI】2026 年 08 月 13 日 AI 大模型晚间速递
xAI: Grok 4.6 正式发布,1.5T 参数(与 4.5 相同 V9 基座),重点改进 SFT 与 RL 后训练,在 Artificial Analysis 智能指数上追平 GPT-5.6 Sol,500K 上下文窗口,定价 $2/$6 每百万 token 输入输出,已上线 Cursor 和 Grok Build。(xAI 官方博客 | 8 月 12 日)
Anthropic: ① 发表多智能体系统研究:45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,独立并行方法仅发现 21 个(650 万 token),两者重叠仅 12 个,智能体已学会专业化分工,但研究警示个体良性怪癖可能叠加为系统性失败。(Anthropic Research | 8 月 13 日) ② Claude in Chrome 侧边栏升级为 Claude Cowork 会话,对话保存至历史记录,技能和连接器可在浏览器中工作,任务在桌面 / 网页 / 移动端无缝切换。(Claude Blog | 8 月 12 日)
Google: Google Research 发表事实性瓶颈研究:前沿 LLM(Gemini 3、GPT-5)事实编码接近饱和,但回忆能力不足,多数事实错误源于 "丢钥匙" 而非 "空货架";配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题。(Google Research Blog | 8 月 12 日)
Meta: Meta 超级智能实验室首个开放权重模型 Muse Glimmer 在 OpenRouter 上线,30B 密集文本 + 图像模型,Apache 2.0 许可证,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。(OpenRouter / X | 8 月 12 日)
DeepSeek: DeepSeek-V4-Pro 正式版上线 APP / 网页端 / API,Agent 能力大幅增强,HLE(wo/w tools)达 42.7/60.0,Terminal Bench 2.1 为 87.9,API 原生支持 OpenAI Responses API 格式并适配 Codex。(DeepSeek 官方 / API 更新日志 | 8 月 13 日)
总体总结
主题正文
- 📰 【海外|通向 AGI】2026 年 08 月 13 日 AI 大模型晚间速递
- Grok 4.6 正式发布,1.5T 参数(与 4.5 相同 V9 基座),重点改进 SFT 与 RL 后训练,在 Artificial Analysis 智能指数上追平 GPT-5.6 Sol,500K 上下文窗口,定价 $2/$6 每百万 token 输入输出,已上线 Cursor 和 Grok Build。
- ① 发表多智能体系统研究:45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,独立并行方法仅发现 21 个(650 万 token),两者重叠仅 12 个,智能体已学会专业化分工,但研究警示个体良性怪癖可能叠加为系统性失败。
- ② Claude in Chrome 侧边栏升级为 Claude Cowork 会话,对话保存至历史记录,技能和连接器可在浏览器中工作,任务在桌面 / 网页 / 移动端无缝切换。
- Google Research 发表事实性瓶颈研究:前沿 LLM(Gemini 3、GPT-5)事实编码接近饱和,但回忆能力不足,多数事实错误源于 "丢钥匙" 而非 "空货架";
- 配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题。
- Meta 超级智能实验室首个开放权重模型 Muse Glimmer 在 OpenRouter 上线,30B 密集文本 + 图像模型,Apache 2.0 许可证,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。
- DeepSeek-V4-Pro 正式版上线 APP / 网页端 / API,Agent 能力大幅增强,HLE(wo/w tools)达 42.7/60.0,Terminal Bench 2.1 为 87.9,API 原生支持 OpenAI Responses API 格式并适配 Codex。