总结
数字AI能力向物理AI迁移,物理闭环决定兑现质量
- 物理AI定义与背景:物理AI指能够感知物理世界并在三维空间中完成决策与行动的人工智能系统,自动驾驶是其典型代表。黄仁勋提出AI发展分为感知AI、生成式AI、智能体AI与物理AI四个阶段,通用机器人ChatGPT时刻临近。
- 迁移阶段:
- 第一阶段(架构理念移植):Transformer注意力机制、BEV、端到端等方法被引入驾驶感知、轨迹预测和一体化规划,如VectorNet、Waymo的BEV+Transformer、UniAD等。
- 第二阶段(模型层迁移):Waymo EMMA构建于Gemini之上,理想MindVLA、小鹏世界基座模型等车端VLA实践,体现数字AI基础模型能力向物理AI扩展。
- 迁移红利收窄:越接近物理闭环(车辆控制、实时三维感知、安全攸关决策),数字AI已有成果可直接迁移的比例越低,需针对物理世界重新设计或训练。
物理AI相较数字AI的三重差异
- 表征差异:
- 数字AI:处理离散、带语义的文本、代码等,输入端已具备较强结构化基础。
- 物理AI:原始输入为连续的光子、点云等,需构建可学习的三维空间表征。代表性技术包括VectorNet、BEV+Transformer、Occupancy Network、三维高斯泼溅等。
- 核心门槛:物理世界表征构建能力是物理AI区别于数字AI的基础门槛。
- 数据差异:
- 数字AI:训练语料大量沉淀在互联网,数据获取成本相对较低,核心是抓取、清洗和压缩。
- 物理AI:高价值数据(长尾、极端、事故场景)稀疏、昂贵且危险。兰德公司测算显示,达到自动驾驶致死率达标标准需88亿英里路测里程,远超人类驾驶里程。
- 解决方案:世界模型(World Model)生成合成数据,如Wayve的GAIA系列、英伟达Cosmos、腾讯混元、小鹏云端世界基座模型等。
- 范式差异:
- 数字AI:预训练以下一词元预测为代表,模仿互联网人类知识,模仿学习边界更宽;强化学习(RL/RLHF)更多承担对齐和推理增强功能。
- 物理AI:模仿对象为平均水平人类司机,安全目标远超人类。Waymo数据显示,其无人驾驶事故率比人类低92%-83%。
- 关键环节:强化学习在物理AI中更接近突破能力边界的关键路径,而非后置修补。
结论
- 数字AI提供能力底座:数字AI为物理AI提供基础能力,但难以实现物理世界的建模闭环。
- 物理AI补足物理闭环:物理AI将成为AI增量更大的方向,智能驾驶作为最先跑通闭环的场景应重点关注。
风险提示
- 技术迭代不及预期
- 大模型厂商ARR增速放缓
- 云服务商资本开支不及预期
- 智能驾驶及机器人商业化落地不及预期