这份研报深入探讨了具身智能数据采集行业的现状与未来。报告指出当前核心技术路线以分层架构为主流,其中VLA(视觉语言模型)在短期内展现出领先效果。同时,报告预测了2026年前沿趋势将聚焦于融合世界模型与强化学习,并提及谷歌DeepMind的GeminiRobotics2已实现VLA同时控制双臂操作与双足移动/平衡的突破性进展。然而,报告也揭示了当前商用化的主要瓶颈在于大脑能力的不足,具体表现为算力与参数量倒挂问题,端侧VLA参数量最高仅7B,远低于文字大模型如月之暗面Kimi的2.8T,且数据与参数不匹配易引发灾难性遗忘。此外,报告还提供了模型预训练的数据需求标准,以10B以下模型为例,参考阿里旗下宁波科技(蚂蚁集团)的标准,需要20万-50万小时的数据进行预训练。
具身智能数据采集行业未来发展趋势呈现两大方向。短期内,分层架构下的VLA技术将保持领先地位,其视觉与语言融合的处理能力将推动行业应用创新。长期来看,2026年前沿趋势将聚焦于世界模型与强化学习的深度融合,这一方向已获得谷歌DeepMind等国际机构的验证,其GeminiRobotics2项目成功实现了VLA同时控制双臂操作与双足移动/平衡,标志着技术融合的突破。国外机构已开始布局相关融合能力,国内若能验证此路线的有效性,有望实现快速跟进。这一趋势预示着未来具身智能将更加智能化、自主化,应用场景也将进一步拓宽。
本研报重点分析了具身智能数据采集行业的核心技术路线、前沿趋势、商用瓶颈及数据需求。在核心技术方面,报告强调分层架构为主流,VLA短期效果领先;在前沿趋势上,预测2026年将融合世界模型与强化学习,并提及谷歌DeepMind的突破性进展;在商用瓶颈上,指出大脑能力不足是核心卡点,存在算力与参数量倒挂、数据与参数不匹配易引发灾难性遗忘等问题;在数据需求上,以10B以下模型为例,参考阿里旗下宁波科技(蚂蚁集团)标准,需20万-50万小时数据。这些分析为行业参与者提供了全面的技术与市场洞察。
当前具身智能数据采集市场呈现技术快速迭代但商用面临瓶颈的特点。一方面,VLA等视觉语言模型展现出短期内的领先效果,分层架构成为主流技术路线,为行业应用提供了有力支撑。另一方面,商用化进程受限于大脑能力的不足,具体表现为端侧VLA参数量(最高7B)远低于大型文字模型(如2.8T),且数据与参数不匹配易导致模型性能下降。此外,模型预训练需要大量高质量数据,以10B以下模型为例,参考阿里旗下宁波科技(蚂蚁集团)标准,需20万-50万小时数据,这也构成了商用化的一个重要门槛。总体来看,技术潜力巨大,但距离大规模商用仍需克服多重挑战。
本研报提示了具身智能数据采集行业的主要风险点。首先,大脑能力不足是当前商用化的核心瓶颈,表现为算力与参数量倒挂,端侧VLA参数量有限(最高7B)难以支撑复杂任务,且与大型文字模型存在差距。其次,数据与参数不匹配问题易引发灾难性遗忘,影响模型稳定性和长期性能。再次,技术融合路线尚在探索阶段,虽然世界模型与强化学习的融合被视为未来方向,但国内若要验证此路线的有效性仍需时日,存在技术路线不确定性风险。最后,模型预训练的数据需求极高,以10B以下模型为例,需20万-50万小时数据,这对数据采集和标注能力提出了极高要求,可能成为部分企业进入市场的障碍。