这份研报分析了具身智能行业的核心观点与关键数据,指出行业目前处于类似GPT-2之前的早期阶段,核心瓶颈在于高质量动作数据的稀缺性。报告还探讨了数据采集能力差异、技术融合趋势、行业拐点判断、训练成本结构、数据配比情况、落地场景判断等多个维度,为投资者提供了全面的行业分析视角。
具身智能赛道未来发展趋势呈现技术融合与技术迭代的态势。世界模型与视觉语言模型趋于融合,通过预测视频下一帧兼容大规模弱动作信息数据,未来可能走向统一。同时,具身智能模型迭代核心驱动方向在于数据层面和模型层面,下一代模型迭代关键变量在数据层面,包括数据规模扩大和数据训练方式优化。此外,行业拐点取决于千万小时级数据训练效果,若Scaling Law持续生效将引发行业资源涌入。
研报重点分析了具身智能行业的数据采集能力差异、技术融合趋势、行业拐点判断、训练成本结构、数据配比情况、落地场景判断等多个方向。其中,数据采集能力差异方面,Ego视角方案规模化采集能力较好,但缺乏接触密集型任务中的真值信息;技术融合趋势方面,世界模型与视觉语言模型趋于融合;行业拐点判断方面,取决于千万小时级数据训练效果;训练成本结构方面,数据成本占比最高,每月约1-2千万;数据配比情况方面,预训练与后训练数据配比约为1,000:1;落地场景判断方面,优先看好任务难度较低的物流分拣。
具身智能市场现状处于非常早期的发展阶段,所有参与者水平相近,远未达到“可用”或“及格”标准。行业仍处于通用基础能力构建阶段,数据采集与标注标准尚未统一,数据成本是目前最主要的部分,高质量数据需求旺盛。头部机器人本体公司大规模模型训练的月度资本开支约数千万元,其中数据成本约1-2千万,模型存储成本约数百万元,算力成本约2千万元。行业仍处于“卖铲子”的早期阶段,数据价值尚不明确。
研报提示了具身智能领域面临的核心挑战,包括数据采集与标注标准尚未统一,数据成本高昂且需求旺盛,行业仍处于“卖铲子”的早期阶段,数据价值尚不明确。此外,数据处理面临巨大挑战,包括视频数据质量清洗、画面对齐、管理成本等。目前行业未深度绑定特定场景,整体尚处于能力构建阶段,对于更精细、更复杂的任务,行业模型还普遍无法胜任。这些因素都可能对行业发展带来不确定性风险。