---
title: "- SemiAnalysis通过三个LLM时代（早期扩展、推理、智能体）的基准测试数据分析发现：开源模型追赶闭源前沿模型的时间在逐代减半。第一阶段开源追赶耗时约"
topic_id: 45548881524428528
created_at: 2026-08-23T19:51:08.499+0800
source: zsxq
type: topic
cssclasses: zsxq-vault
---

# - SemiAnalysis通过三个LLM时代（早期扩展、推理、智能体）的基准测试数据分析发现：开源模型追赶闭源前沿模型的时间在逐代减半。第一阶段开源追赶耗时约

- 序号：081
- 星球链接：[打开网页](https://wx.zsxq.com/group/15522451881222/topic/45548881524428528)
- 附件：图片 0，音频 0，文档 0
- 音频文件：_无音频_

## 图片

_无图片_

## 正文

- SemiAnalysis通过三个LLM时代（早期扩展、推理、智能体）的基准测试数据分析发现：开源模型追赶闭源前沿模型的时间在逐代减半。第一阶段开源追赶耗时约12个月，第二阶段约8.5个月，第三阶段仅需4.8-6个月。尽管能力差距在缩小，但报告认为这对前沿模型厂商的冲击被夸大——Anthropic通过Claude Code等产品化能力仍保持领先，基准测试无法完美衡量实际工作价值。开源模型的崛起反而有利于AI基础设施投资。两大前沿厂商的模型发布周期也从Era 1的213天缩短至Era 3的51天，竞争烈度大幅提升。

SemiAnalysis发布了关于开源与闭源大模型能力差距演变的深度分析报告。核心结论是：——从早期扩展时代的约12个月，缩短到推理时代的约8.5个月，再到当前的智能体时代的4.8-6个月。
尽管能力差距在缩小，但报告认为这对前沿AI实验室（特别是Anthropic和OpenAI）商业前景的冲击被市场过度悲观解读了。Anthropic通过Claude Code等产品化能力在智能体时代仍保持实际使用体验的领先地位，其ARR已突破650亿美元。开源模型的兴起反而推动了AI基础设施（GPU、推理算力）的整体需求增长。

三个时代的能力差距演变

代表基准：GSM8K、HumanEval、TriviaQA、MMLU-Pro
标志性事件：Llama-2-70B（2023年6月）发布，成为首个接近前沿的开源模型
GPT-3.5 Turbo综合得分75.7 vs Llama-2-70B得分39.9，差距达35.8分
缩小历程：Mixtral-8x7B（2023年12月）→ Llama-3.1-405B（2024年7月，得分86）→ DeepSeek V3（2024年12月，得分94.1，匹配GPT-4o的95.5）
关键洞察：Qwen2.5-72B以405B参数六分之一的规模逼近前沿，凸显效率提升

代表基准：AIME、Humanity's Last Exam（HLE）等博士水平测试
标志性事件：OpenAI发布o1-preview（2024年9月12日），DeepSeek R1紧随其后
初始差距仅12.1分（远小于时代一的35.8分）
DeepSeek R1发布引发市场剧烈反应（"市场呕吐"），但AI资本开支交易迅速恢复
R1-0528（2025年5月，得分78）用8.5个月追平Gemini 2.5 Pro和o3

代表基准：Terminal-Bench 2.1、BrowseComp-Plus、τ³-banking、DeepSWE
关键转变：基准从数学问题转向长时域软件工程、深度研究、知识工作
Opus 4.5被视为智能体时代官方起点（尽管GPT-5.2基准得分更高，但实际用户体验不如Anthropic）
Kimi K2.6以56.3分在4.8个月内超越Opus 4.5
GLM-5.2以72.4分在6个月内追平GPT-5.2
OpenAI与Anthropic平均每51天发布一次新模型（时代一为213天，时代二为120天）
关键发现与深层含义
：每代开源模型的追赶时间约为上一代的一半，这一规律惊人地一致。
：
Kimi K3在综合基准上可能超过Fable 5，但SemiAnalysis团队在日常工作中仍偏好使用后者
公共基准容易被模型厂商通过创建类似RL环境来"爬山"
真实工作价值与基准得分之间存在显著脱节
：
Anthropic的核心优势不是单一模型能力，而是模型+框架（harness）的整体产品体验
Claude Code和Claude Tag等产品化投入构成了实质性壁垒
：月之暗面（Kimi）和智谱（GLM）在智能体时代已能与美国前沿模型正面竞争。

本报告为行业分析报告，并非针对单一公司的个股研究报告，因此无直接估值或评级内容。但报告涉及的间接投资含义包括：
：开源模型的普及推动整体推理token用量激增（Fireworks日处理token量已超过40万亿，是3月底OpenAI API的2倍）
：能力差距缩小不等于商业失败，产品化能力是关键差异化因素
：650亿美元+ ARR证明了"模型+产品"路线的可持续性

：报告自身承认所选基准可能存在被针对优化的风险，且无法完全反映实际生产力。
：Anthropic和OpenAI花费更多时间进行安全测试，而Moonshot和Zhipu可能更快发布。报告反驳称GPT-4训练完成到发布间隔了218天，即使假设Mythos仅延迟114天，仍不影响核心结论。
：虽然数据显示追赶时间逐代减半，但这一趋势是否会在下一代继续尚不确定——前沿模型的差距可能进一步缩小，或开源创新可能遭遇瓶颈。
：如果开源模型在能力上持续逼近且成本仅为闭源模型的一小部分，最终可能导致模型层毛利率大幅压缩。
：开源模型的跨国流动可能面临出口管制、数据安全等监管挑战，特别是中美之间的AI竞争格局。

## 总体总结

主题正文
1. 尽管能力差距在缩小，但报告认为这对前沿模型厂商的冲击被夸大——Anthropic通过Claude Code等产品化能力仍保持领先，基准测试无法完美衡量实际工作价值。
2. 核心结论是：——从早期扩展时代的约12个月，缩短到推理时代的约8.5个月，再到当前的智能体时代的4.8-6个月。
3. Anthropic通过Claude Code等产品化能力在智能体时代仍保持实际使用体验的领先地位，其ARR已突破650亿美元。
4. 缩小历程：Mixtral-8x7B（2023年12月）→ Llama-3.1-405B（2024年7月，得分86）→ DeepSeek V3（2024年12月，得分94.1，匹配GPT-4o的95.5）
5. 代表基准：Terminal-Bench 2.1、BrowseComp-Plus、τ³-banking、DeepSWE
6. Anthropic的核心优势不是单一模型能力，而是模型+框架（harness）的整体产品体验
7. ：开源模型的普及推动整体推理token用量激增（Fireworks日处理token量已超过40万亿，是3月底OpenAI API的2倍）
8. 报告反驳称GPT-4训练完成到发布间隔了218天，即使假设Mythos仅延迟114天，仍不影响核心结论。
