具身智能当前处于类似GPT-2的阶段,VLA(视觉语言模型)与世界模型(WM)虽底层同构但训练模式不同,终将融合。胜负手在于数据scaling,未来2-3年需关注首个千万小时级异构数据模型的泛化验证,达标即陡峭上行。
一、路线与阶段:VLA与WM同构,当前处于"GPT-2之前"状态
- 路线:底层均基于Transformer+diffusion,差异仅训练模式/预测目标,可互相改造、终将融合。VLA领先但依赖带action标注数据(头部仅十万-数十万小时),scaling瓶颈显著;WM可兼容无标注海量视频(百万小时级),与大模型逻辑一致,是必然方向。涌现判断:举一反三、组合创新。
- 阶段:最新模型新任务成功率仅约60%(任务多经精选),无稳定强泛化。具身智能需理解物理世界、接触逻辑、长程任务分配,GPT-3→GPT-4鸿沟更大。下一代目标:面向具身的上下文学习(新任务仅需1-2条示例),两大缺口:大规模数据闭环、统一评测基准(当前多仿真,与真实差距大)。
二、格局与数据:10分以内,数据scaling是胜负手
- 格局:满分100,所有参与者均在10分以内(未达可用标准),分水岭在规模化应用后数据指数增长。海外厂商已公布50-200万小时数据,整体百万小时效果验证、涌现初现。
- 数据:规模需求百万→千万→亿→10亿小时,每提升一个数量级可能带来能力跃升(未见天花板)。四大瓶颈:有效数据转化率低;多源异构视频流存储处理成本远高于文本;无统一格式标准,contact真值标注难于自动驾驶;数据通用性弱(3-5年后价值不确定)。contact标注最难,带动带触觉/关节数据手套需求。市场处"卖铲子"阶段,数采/存储/算力是确定性需求。
三、国内投入与落地拐点
- 投入:按本体为主/模型为主/二者兼具三类。头部本体(宇树、智元)年出货均1万台以下。头部单月资本开支大几千万元(不含人力):数采1000-2000万、存储数百万、算力约2000万;成本占比最高是数据。
- 拐点:未来2-3年核心看首个千万小时级异构数据模型泛化效果,显著优于百万小时级即全行业资源涌入。千万小时级数据以异构为主(含大量人类第一视角,仅约1%本体真机),预训练用千万小时异构,后训练仅需千-万小时本体数据即可激发能力。
- 落地:当前唯一相对成熟场景为物流分拣包裹翻转(低难度细分),更精细任务尚无法实现。模型"小学阶段"做基础预训练、不绑定场景;直接绑定场景多为demo。进入"大学阶段"才向专业场景定向专用化。
四、盯什么(比路线之争重要)
- 首个千万小时级异构数据模型泛化验证→达标即行业陡峭上行;
- 数据格式/评测标准统一进展;
- contact标注工具与数据手套迭代;
- 本体出货与数采体系建设。
- 路线选择/身位先后非核心变量。