- SemiAnalysis通过三个LLM时代(早期扩展、推理、智能体)的基准测试数据分析发现:开源模型追赶闭源前沿模型的时间在逐代减半。第一阶段开源追赶耗时约
- 序号:081
- 星球链接:打开网页
- 附件:图片 0,音频 0,文档 0
- 音频文件:无音频
图片
无图片
正文
- SemiAnalysis通过三个LLM时代(早期扩展、推理、智能体)的基准测试数据分析发现:开源模型追赶闭源前沿模型的时间在逐代减半。第一阶段开源追赶耗时约12个月,第二阶段约8.5个月,第三阶段仅需4.8-6个月。尽管能力差距在缩小,但报告认为这对前沿模型厂商的冲击被夸大——Anthropic通过Claude Code等产品化能力仍保持领先,基准测试无法完美衡量实际工作价值。开源模型的崛起反而有利于AI基础设施投资。两大前沿厂商的模型发布周期也从Era 1的213天缩短至Era 3的51天,竞争烈度大幅提升。
SemiAnalysis发布了关于开源与闭源大模型能力差距演变的深度分析报告。核心结论是:——从早期扩展时代的约12个月,缩短到推理时代的约8.5个月,再到当前的智能体时代的4.8-6个月。 尽管能力差距在缩小,但报告认为这对前沿AI实验室(特别是Anthropic和OpenAI)商业前景的冲击被市场过度悲观解读了。Anthropic通过Claude Code等产品化能力在智能体时代仍保持实际使用体验的领先地位,其ARR已突破650亿美元。开源模型的兴起反而推动了AI基础设施(GPU、推理算力)的整体需求增长。
三个时代的能力差距演变
代表基准:GSM8K、HumanEval、TriviaQA、MMLU-Pro 标志性事件:Llama-2-70B(2023年6月)发布,成为首个接近前沿的开源模型 GPT-3.5 Turbo综合得分75.7 vs Llama-2-70B得分39.9,差距达35.8分 缩小历程:Mixtral-8x7B(2023年12月)→ Llama-3.1-405B(2024年7月,得分86)→ DeepSeek V3(2024年12月,得分94.1,匹配GPT-4o的95.5) 关键洞察:Qwen2.5-72B以405B参数六分之一的规模逼近前沿,凸显效率提升
代表基准:AIME、Humanity's Last Exam(HLE)等博士水平测试 标志性事件:OpenAI发布o1-preview(2024年9月12日),DeepSeek R1紧随其后 初始差距仅12.1分(远小于时代一的35.8分) DeepSeek R1发布引发市场剧烈反应("市场呕吐"),但AI资本开支交易迅速恢复 R1-0528(2025年5月,得分78)用8.5个月追平Gemini 2.5 Pro和o3
代表基准:Terminal-Bench 2.1、BrowseComp-Plus、τ³-banking、DeepSWE 关键转变:基准从数学问题转向长时域软件工程、深度研究、知识工作 Opus 4.5被视为智能体时代官方起点(尽管GPT-5.2基准得分更高,但实际用户体验不如Anthropic) Kimi K2.6以56.3分在4.8个月内超越Opus 4.5 GLM-5.2以72.4分在6个月内追平GPT-5.2 OpenAI与Anthropic平均每51天发布一次新模型(时代一为213天,时代二为120天) 关键发现与深层含义 :每代开源模型的追赶时间约为上一代的一半,这一规律惊人地一致。 : Kimi K3在综合基准上可能超过Fable 5,但SemiAnalysis团队在日常工作中仍偏好使用后者 公共基准容易被模型厂商通过创建类似RL环境来"爬山" 真实工作价值与基准得分之间存在显著脱节 : Anthropic的核心优势不是单一模型能力,而是模型+框架(harness)的整体产品体验 Claude Code和Claude Tag等产品化投入构成了实质性壁垒 :月之暗面(Kimi)和智谱(GLM)在智能体时代已能与美国前沿模型正面竞争。
本报告为行业分析报告,并非针对单一公司的个股研究报告,因此无直接估值或评级内容。但报告涉及的间接投资含义包括: :开源模型的普及推动整体推理token用量激增(Fireworks日处理token量已超过40万亿,是3月底OpenAI API的2倍) :能力差距缩小不等于商业失败,产品化能力是关键差异化因素 :650亿美元+ ARR证明了"模型+产品"路线的可持续性
:报告自身承认所选基准可能存在被针对优化的风险,且无法完全反映实际生产力。 :Anthropic和OpenAI花费更多时间进行安全测试,而Moonshot和Zhipu可能更快发布。报告反驳称GPT-4训练完成到发布间隔了218天,即使假设Mythos仅延迟114天,仍不影响核心结论。 :虽然数据显示追赶时间逐代减半,但这一趋势是否会在下一代继续尚不确定——前沿模型的差距可能进一步缩小,或开源创新可能遭遇瓶颈。 :如果开源模型在能力上持续逼近且成本仅为闭源模型的一小部分,最终可能导致模型层毛利率大幅压缩。 :开源模型的跨国流动可能面临出口管制、数据安全等监管挑战,特别是中美之间的AI竞争格局。
总体总结
主题正文
- 尽管能力差距在缩小,但报告认为这对前沿模型厂商的冲击被夸大——Anthropic通过Claude Code等产品化能力仍保持领先,基准测试无法完美衡量实际工作价值。
- 核心结论是:——从早期扩展时代的约12个月,缩短到推理时代的约8.5个月,再到当前的智能体时代的4.8-6个月。
- Anthropic通过Claude Code等产品化能力在智能体时代仍保持实际使用体验的领先地位,其ARR已突破650亿美元。
- 缩小历程:Mixtral-8x7B(2023年12月)→ Llama-3.1-405B(2024年7月,得分86)→ DeepSeek V3(2024年12月,得分94.1,匹配GPT-4o的95.5)
- 代表基准:Terminal-Bench 2.1、BrowseComp-Plus、τ³-banking、DeepSWE
- Anthropic的核心优势不是单一模型能力,而是模型+框架(harness)的整体产品体验
- :开源模型的普及推动整体推理token用量激增(Fireworks日处理token量已超过40万亿,是3月底OpenAI API的2倍)
- 报告反驳称GPT-4训练完成到发布间隔了218天,即使假设Mythos仅延迟114天,仍不影响核心结论。