本报告聚焦自动驾驶领域VLA相关分析,核心结论为VLA的价值在于用动作头补上视觉语言模型留下的动作生成缺口。报告详细解析了头部厂商如小鹏、理想、元戎、千里和Waymo在VLA架构上的路线分化,例如小鹏第二代VLA去掉显式语言中间层,理想MindVLA保留语言层并采用扩散头等。VLA被视为自动驾驶范式演进的第四阶段,但落地面临鲁棒性、车端推理帧率、算力及三模态对齐数据稀缺等挑战。
智能驾驶VLA赛道正经历架构范式的演进,从早期的感知融合到视觉语言模型,现已进入第四阶段VLA。VLA通过动作头弥补了视觉语言模型在动作生成上的不足,头部厂商路线分化明显,如小鹏采用隐式表征与视觉CoT直接出动作,理想保留语言层并使用扩散头,元戎实现多角色共享底座等。未来VLA发展需克服鲁棒性、高帧率推理、算力及多模态数据对齐等难题,技术路线仍将持续演进。
报告重点分析了小鹏、理想、元戎、千里和Waymo等头部厂商的VLA架构路线。小鹏第二代VLA去掉了显式语言中间层,采用隐式表征与视觉CoT直接生成动作;理想MindVLA保留语言层,动作侧采用扩散头;元戎40BVLA基座实现Driver/Analyst/Critic三角色共享同一底座;千里KoVLA将思维链从文本空间搬至隐空间;WaymoEMMA基于Gemini搭建,以语言为万能中间格式,纯视觉不含激光雷达。这些差异化路线反映了厂商在技术路径上的不同选择。
当前智能驾驶VLA市场处于技术快速迭代和路线分化的阶段。虽然VLA被视为自动驾驶发展的重要方向,但尚未大规模商业化落地。各厂商在VLA架构上存在显著差异,表明技术仍处于探索期。市场面临的主要挑战包括模型鲁棒性不足、车端推理帧率需达到不低于30赫兹、算力要求高以及三模态对齐数据稀缺等问题,这些因素制约了VLA的快速应用。
投资VLA领域需关注多重风险。首先,技术路线存在不确定性,不同厂商的架构路线分化可能影响技术标准化进程。其次,VLA落地面临实际挑战,如模型鲁棒性需持续提升,车端高帧率推理对算力要求极高,且当前三模态对齐数据稀缺严重制约模型训练效果。此外,算法迭代速度快,技术更新换代可能导致现有投入贬值。这些因素均可能影响VLA技术的商业化进程和投资回报。