核心观点
数字AI已实现在语言、视觉与多模态任务中通用底座模型的跑通,但其难以实现物理世界的建模闭环。物理AI将在连续、实时、安全约束的真实世界中建立"感知—行动—反馈—优化"闭环,并在一段时间内与数字AI并列成为"任务通解",成为物理世界场景的AI解决方案。考虑二者的技术同源性,复盘数字AI有助于理解与预测物理AI的演进。
关键数据
- AI第一次爆发时,AlexNet将ILSVRC口径的top-5错误率由约26%降至约15%。
- CNN高引用的基础架构与训练类论文集中在2012—2016年,2017年后论文重心明显向轻量化/部署与复兴/后继迁移迁移。
- 若要在95%置信度、±20%精度下证明自动驾驶致死率达标,约需88亿英里。
- 2013年人类驾驶死亡率约为每亿英里1.09人。
- RAND以美国道路安全统计为基准测算,一个示例情形即需约88亿英里。
- Llama2、Llama3分别以2万亿、15万亿Token远超Chinchilla“最优”数据量训练。
研究结论
物理AI正从复用数字AI能力转向补齐自身底层能力。早期主要迁移Transformer等架构理念(BEV、UniAD),当前VLM、VLA进一步建立在LLM及多模态基座之上(Waymo EMMA基于Gemini、车端VLA)。但数字AI红利或已接近阶段性瓶颈,根本原因在于,物理AI面临三类差异:一是缺少天然Token,需自主构建物理世界表征;二是长尾、极端场景稀缺且采集成本高,难以直接复制互联网数据Scaling;三是模仿学习受限于人类驾驶上限,必须依赖强化学习持续试错。世界模型或更契合物理AI发展方向。物理AI从表征到部署的闭环路径与数字AI差异明显,将形成独立而统一的发展路径。随着世界模型与强化学习闭环走向成熟、云车部署逐步兑现,物理AI有望由能力展示走向大规模落地,成为AI发展当前阶段最具成长弹性的方向。