机器人系列对话・第十二期省流版 一句话:具身智能当前"GPT-2之前"状态;VLA与世界模型同构终将融合,胜负手在数据scaling演进;2—3年盯首个千万小时
- 序号:524
- 星球链接:打开网页
- 附件:图片 0,音频 0,文档 0
- 音频文件:无音频
图片
无图片
正文
机器人系列对话・第十二期省流版
一句话:具身智能当前"GPT-2之前"状态;VLA与世界模型同构终将融合,胜负手在数据scaling演进;2—3年盯首个千万小时级异构数据模型泛化验证,达标即陡峭上行。
一、路线与阶段:VLAvsWM同构,当前"GPT-2之前"
路线:底层均transformer+diffusion动作输出,差异仅训练模式/预测目标,可互相改造、终将融合。VLA落地领先但依赖带action标注数据,头部遥操作/UMI仅十万—数十万小时,scaling瓶颈显著;世界模型可兼容无标注海量视频,已有百万小时级数据集,与大模型"预测下一token"逻辑一致,是必然方向。涌现判断:一、举一反三;二、组合创新。
阶段:最新模型新任务成功率仅约60%,且任务多经精心挑选,无稳定强泛化。具身需理解物理世界分布、接触逻辑、长程任务分配,GPT-2→GPT-3鸿沟比语言模型更大。下一代目标:面向具身的上下文学习,新任务仅需1—2条示例即可生成控制。两大缺口:一、大规模数据闭环;二、统一评测基准(当前多仿真,与真实gap大)。
二、格局与数据:10分以内,数据scaling是胜负手
格局:满分100,所有参与者均在10分以内,未达可用标准;分水岭在规模化应用后数据指数增长,现阶段追逐路线/身位无意义。海外已有厂商公布50万—200万小时数据,Figure02发布,整体百万小时效果验证、涌现初现。
数据:规模需求百万→千万→亿→10亿小时,每提升一个数量级可能带来能力跃升,未见天花板。四大瓶颈:有效数据转化率低;多源异构视频流存储处理成本远高于文本;无统一格式标准,contact真值标注难于自动驾驶;数据通用性弱,3—5年后价值不确定。最难是contact标注,带动带触觉/关节数据手套需求。市场处"卖铲子"阶段,数采/存储/算力是确定性需求。
三、国内投入与落地拐点
投入:按本体为主/模型为主/二者兼具三类。头部本体(宇树、智元)年出货均1万台以下。头部单月资本开支大几千万元(不含人力):数采1000万—2000万、存储数百万、算力约2000万;成本占比最高是数据。
拐点:未来2—3年核心看首个千万小时级异构数据模型泛化效果,验证显著优于百万小时级即全行业资源疯狂涌入。千万小时级数据以异构为主,含大量人类第一视角,仅约1%本体真机;预训练用千万小时异构,后训练仅需千—万小时本体数据即可激发能力。
落地:当前唯一相对成熟场景为物流分拣包裹翻转(低难度细分),更精细任务尚无法实现。模型"小学阶段"做基础预训练、不绑定场景;直接绑定场景多为demo。进入"大学阶段"后才向专业场景定向专用化。
四、盯什么(比路线之争重要)
首个千万小时级异构数据模型泛化验证→达标即行业陡峭上行;数据格式/评测标准统一进展;contact标注工具与数据手套迭代;本体出货与数采体系建设。路线选择/身位先后非核心变量。
总体总结
主题正文
- 路线:底层均transformer+diffusion动作输出,差异仅训练模式/预测目标,可互相改造、终将融合。
- VLA落地领先但依赖带action标注数据,头部遥操作/UMI仅十万—数十万小时,scaling瓶颈显著;
- 具身需理解物理世界分布、接触逻辑、长程任务分配,GPT-2→GPT-3鸿沟比语言模型更大。
- 分水岭在规模化应用后数据指数增长,现阶段追逐路线/身位无意义。
- 海外已有厂商公布50万—200万小时数据,Figure02发布,整体百万小时效果验证、涌现初现。
- 数据:规模需求百万→千万→亿→10亿小时,每提升一个数量级可能带来能力跃升,未见天花板。
- 头部单月资本开支大几千万元(不含人力):数采1000万—2000万、存储数百万、算力约2000万;
- 拐点:未来2—3年核心看首个千万小时级异构数据模型泛化效果,验证显著优于百万小时级即全行业资源疯狂涌入。