核心观点与关键数据
- 核心主题:具身智能与世界模型是本届智源大会的核心,具身智能被视为继语言模型和多模态模型之后新的算力与数据需求引擎。
- 现状:机器人已能在受控、结构化或依赖外部动捕的环境中完成“抓拿放”等“点状能力”,如串糖葫芦、酒店清洁、货架抓放和人机乒乓球对打,但泛化性仍受限。
- 瓶颈:数据采集昂贵且难规模化、物理理解不足、多模态感知不足、评测标尺不完善、安全可控性需提升。
- 突破方向:扩数据(仿真合成、人类视频、真机数据)、补大脑(世界模型与VLA融合)、强感知(多模态融合、触觉力控)、定标尺(关注系统能力和学习能力)、做分工(独立的大脑公司)。
研究结论
- 数据:人类第一人称视频预训练成为共识,但数据质量需提升。
- 物理理解:现有世界模型路线均未真正触达物理规律,需融合世界模型与VLA。
- 评测:应关注系统能力和AI的学习能力,而非单一成功率。
- 分工:全栈自研派和大脑/模型平台派并存。
- 目标:具身智能的“AlphaGo时刻”以网球等复杂任务为标志,最终实现“物理图灵测试”。
- 时间表:1-2年内基础模型显著进步,2-5年内有较大进展,但通用基础模型未必在两年内出现。
- 抵达路径:遵循“部署规模化定律”,真实部署铺开后数据飞轮将改写问题设定。
投资建议
- 受益环节:扩数据、补大脑、做分工与放量、评测与安全。
- 建议关注:AI大模型(智谱、Minimax等)、AI算力基础设施(中际旭创、新易盛等)、具身智能本体与配件(三花智控、拓普集团等)。
- 风险提示:技术路线尚未收敛、数据范式快速变化、商业化与规模化落地不及预期。