---
title: "机器人系列对话・第十二期省流版 一句话：具身智能当前\"GPT-2之前\"状态；VLA与世界模型同构终将融合，胜负手在数据scaling演进；2—3年盯首个千万小时"
topic_id: 14425558124414842
created_at: 2026-08-24T08:07:37.763+0800
source: zsxq
type: topic
cssclasses: zsxq-vault
---

# 机器人系列对话・第十二期省流版 一句话：具身智能当前"GPT-2之前"状态；VLA与世界模型同构终将融合，胜负手在数据scaling演进；2—3年盯首个千万小时

- 序号：524
- 星球链接：[打开网页](https://wx.zsxq.com/group/15522451881222/topic/14425558124414842)
- 附件：图片 0，音频 0，文档 0
- 音频文件：_无音频_

## 图片

_无图片_

## 正文

机器人系列对话・第十二期省流版

一句话：具身智能当前"GPT-2之前"状态；VLA与世界模型同构终将融合，胜负手在数据scaling演进；2—3年盯首个千万小时级异构数据模型泛化验证，达标即陡峭上行。

一、路线与阶段：VLAvsWM同构，当前"GPT-2之前"

路线：底层均transformer+diffusion动作输出，差异仅训练模式/预测目标，可互相改造、终将融合。VLA落地领先但依赖带action标注数据，头部遥操作/UMI仅十万—数十万小时，scaling瓶颈显著；世界模型可兼容无标注海量视频，已有百万小时级数据集，与大模型"预测下一token"逻辑一致，是必然方向。涌现判断：一、举一反三；二、组合创新。

阶段：最新模型新任务成功率仅约60%，且任务多经精心挑选，无稳定强泛化。具身需理解物理世界分布、接触逻辑、长程任务分配，GPT-2→GPT-3鸿沟比语言模型更大。下一代目标：面向具身的上下文学习，新任务仅需1—2条示例即可生成控制。两大缺口：一、大规模数据闭环；二、统一评测基准（当前多仿真，与真实gap大）。

二、格局与数据：10分以内，数据scaling是胜负手

格局：满分100，所有参与者均在10分以内，未达可用标准；分水岭在规模化应用后数据指数增长，现阶段追逐路线/身位无意义。海外已有厂商公布50万—200万小时数据，Figure02发布，整体百万小时效果验证、涌现初现。

数据：规模需求百万→千万→亿→10亿小时，每提升一个数量级可能带来能力跃升，未见天花板。四大瓶颈：有效数据转化率低；多源异构视频流存储处理成本远高于文本；无统一格式标准，contact真值标注难于自动驾驶；数据通用性弱，3—5年后价值不确定。最难是contact标注，带动带触觉/关节数据手套需求。市场处"卖铲子"阶段，数采/存储/算力是确定性需求。

三、国内投入与落地拐点

投入：按本体为主/模型为主/二者兼具三类。头部本体（宇树、智元）年出货均1万台以下。头部单月资本开支大几千万元（不含人力）：数采1000万—2000万、存储数百万、算力约2000万；成本占比最高是数据。

拐点：未来2—3年核心看首个千万小时级异构数据模型泛化效果，验证显著优于百万小时级即全行业资源疯狂涌入。千万小时级数据以异构为主，含大量人类第一视角，仅约1%本体真机；预训练用千万小时异构，后训练仅需千—万小时本体数据即可激发能力。

落地：当前唯一相对成熟场景为物流分拣包裹翻转（低难度细分），更精细任务尚无法实现。模型"小学阶段"做基础预训练、不绑定场景；直接绑定场景多为demo。进入"大学阶段"后才向专业场景定向专用化。

四、盯什么（比路线之争重要）

首个千万小时级异构数据模型泛化验证→达标即行业陡峭上行；数据格式/评测标准统一进展；contact标注工具与数据手套迭代；本体出货与数采体系建设。路线选择/身位先后非核心变量。

## 总体总结

主题正文
1. 路线：底层均transformer+diffusion动作输出，差异仅训练模式/预测目标，可互相改造、终将融合。
2. VLA落地领先但依赖带action标注数据，头部遥操作/UMI仅十万—数十万小时，scaling瓶颈显著；
3. 具身需理解物理世界分布、接触逻辑、长程任务分配，GPT-2→GPT-3鸿沟比语言模型更大。
4. 分水岭在规模化应用后数据指数增长，现阶段追逐路线/身位无意义。
5. 海外已有厂商公布50万—200万小时数据，Figure02发布，整体百万小时效果验证、涌现初现。
6. 数据：规模需求百万→千万→亿→10亿小时，每提升一个数量级可能带来能力跃升，未见天花板。
7. 头部单月资本开支大几千万元（不含人力）：数采1000万—2000万、存储数百万、算力约2000万；
8. 拐点：未来2—3年核心看首个千万小时级异构数据模型泛化效果，验证显著优于百万小时级即全行业资源疯狂涌入。
