AI系列深度22期:智能驾驶VLA模型的架构范式与厂商路线 2026年08月07日 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn研究助理童明祺 执业证书:S0600125080005tongmq@dwzq.com.cn 增持(维持) ◼智能驾驶VLA的核心,是将视觉感知、语言理解与动作决策整合进同一策略模型,并通过显式动作头弥合VLM4AD留下的动作生成缺口。从技术演进看,自动驾驶经历模块化流水线、端到端、VLM4AD再到VLA4AD:VLM能解释场景但难以直接生成可靠控制,VLA则进一步把动作作为模型输出,使语义理解与驾驶策略更紧密耦合。 ◼VLA4AD的核心架构通常包括视觉编码器、语言处理器和动作解码器三部分。视觉编码器将摄像头、激光雷达等异构传感输入转化为隐层特征,并通过BEV、点云、体素等方式增强三维空间理解;语言处理器引入预训练大模型、LoRA或RAG等方法注入驾驶知识;动作解码器再将融合后的多模态表征转化为轨迹、控制量或动作token。 ◼VLA4AD自身可归纳为被动解释器、规划协作者、统一动作生成器、推理中枢四个阶段;主要挑战包括鲁棒性、实时性能、数据与标注、多模态对齐、多智能体协同和评测标准化。这意味着VLA并非单一固定架构,而是自动驾驶端到端路线向大模型、多模态和动作生成继续演进的总称。 相关研究 《AI系列深度17期:视觉智能为何引入Transformer?》2026-08-06 ◼厂商路线已出现差异化。Waymo EMMA以Gemini驱动纯端到端,并将导航、状态、轨迹等统一到语言空间;理想从E2E+VLM双系统升级至MindVLA统一架构,以3D高斯、MoE和扩散动作解码组织三维理解、语义推理和轨迹生成;元戎启行以40B VLA基座设置Driver、Analyst、Critic三角色;千里CoWorld-VLA则通过多专家世界模型Token构建规划相关隐空间表征。 《AI系列深度16期:语言智能为何从RNN转向Transformer?》2026-08-06 ◼小鹏第二代VLA进一步弱化显式语言中间层,以原生多模态Tokenizer和视觉思维链直达动作,本质上趋近视觉—动作路线。由此可见,头部厂商在是否保留显式语言推理层上已经分化:一类强调语言作为慢思考和可解释中枢,另一类强调隐式视觉表征和动作直出。后续竞争将集中在实时性、数据闭环、评测口径和量产可靠性。 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。 内容目录 1.1.自动驾驶技术演进:从模块化流水线到VLA4AD................................................................41.2. VLA4AD的核心架构:输入、三大模块与输出.....................................................................41.3. VLA4AD的阶段演进:从解释器到推理中枢.........................................................................51.4. VLA4AD的主要局限.................................................................................................................6 2.代表性模型:头部厂商VLA路线开始分化....................................................................................7 2.1. Waymo EMMA:基于Gemini的纯端到端架构......................................................................72.2.理想:从E2E+VLM双系统到MindVLA统一架构..............................................................72.3.元戎启行:40B VLA基座的Driver/Analyst/Critic三角色...................................................82.4.千里科技CoWorld-VLA:多专家世界模型Token................................................................8 3.小鹏第二代VLA:弱化显式语言层,强化视觉思维链.................................................................9 3.1.设计动机:标准VLA的语言转译瓶颈..................................................................................93.2.架构特征:原生多模态Tokenizer与视觉思维链.................................................................103.3.去显式语言层的边界:趋近VA的VLA变体.....................................................................113.4.工程与量产:算力、数据与落地节奏...................................................................................11 图表目录 图1:自动驾驶范式比较.......................................................................................................................4图2:VLA4AD四阶段演进时间轴......................................................................................................6图3:CoWorld-VLA在NAVSIM v1上的PDMS贡献拆解与同类对比..........................................9图4:小鹏第二代VLA对外披露的能力提升与体验改善..............................................................10 表1:VLA4AD动作解码器的三类技术路线......................................................................................5表2:VLA4AD自身的四阶段演进......................................................................................................6表3:代表性厂商VLA模型的架构与公开指标对比........................................................................9表4:小鹏第二代VLA对外披露的关键参数与指标......................................................................10 1.智驾VLA:从端到端到动作生成的范式升级 1.1.自动驾驶技术演进:从模块化流水线到VLA4AD 自动驾驶的整体技术演进可划分为四个范式。早期主流方案为经典模块化流水线,将任务拆分为感知、预测、规划、控制四个模块;其优势在于每个组件可独立开发、测试与优化,工业界早期广泛采用,缺陷是模块间误差会级联传播、信息碎片化,难以处理长尾的极端场景。 为解决模块化缺陷,研究转向端到端自动驾驶,将原始传感器输入直接映射为控制指令,核心是视觉到动作Vision-to-Action的映射。该范式消除了模块边界,可端到端优化,但在语义稳定性、可解释性和语言交互能力上仍存在不足。在此基础上,研究进一步将视觉语言模型VLM引入自动驾驶VLM4AD,把感知与自然语言推理统一到同一嵌入空间,利用大模型常识先验提升对罕见场景的泛化能力;但该路线仍以感知解释为核心,语言输出与控制耦合较弱,存在动作生成缺口,即VLM能解释场景,但难以直接生成可靠控制决策。 VLA4AD范式的关键变化,是把视觉感知、语言理解和控制决策整合到同一个策略中,通过显式动作头action head弥合上述动作生成缺口。其目标能力包括:遵循自然语言指令,例如让行救护车、超过指定卡车;输出决策理由以支持事后验证;利用互联网数据中的常识先验提升罕见场景泛化能力。 1.2.VLA4AD的核心架构:输入、三大模块与输出 VLA4AD在输入侧整合多模态信号:视觉输入已从单目前摄演进至双目、多摄环视系统,并常将图像投影为BEV表征以强化空间推理;激光雷达提供3D结构,毫米波雷达提供速度信息,IMU用于运动跟踪,GPS用于定位,自车本体数据则提供车辆状态; 语言输入包括环境查询、任务规则解析及语音交互。 VLA4AD核心模块可拆分为视觉编码器、语言处理器和动作解码器。视觉编码器将原始异构传感器数据转换为与语言空间对齐的隐层特征,常用DINOv2、ConvNeXt-V2、CLIP等骨干,并加入BEV投影、点云编码、体素等3D空间增强。语言处理器采用预训练大语言模型作为解码器,并通过LoRA低秩适应等技术微调,或利用检索增强RAG注入驾驶领域知识。动作解码器将融合后的多模态特征转换为驾驶动作,主要有三种技术路线。在输出侧,早期系统直接输出转向角、油门、刹车等原始控制信号,后续工作更多输出未来一段时间的轨迹规划,再交由下游模型预测控制MPC模块跟踪执行。 1.3.VLA4AD的阶段演进:从解释器到推理中枢 VLA4AD的内部演进可划分为四个阶段。预VLA阶段主要集中在2023年前后,多模态大模型更多充当被动解释器,代表如DriveGPT-4,可生成场景自然语言描述或抽象驾驶意图标签,实际控制仍由传统模块完成,语言不参与决策。模块化VLA阶段主要集中在2024年至2025年初,LLM由解释者升级为引导车辆控制的主动路径规划媒介,采用感知、语言理解、规划、控制的多阶段流水线,语言作为中间表示,代表如OpenDriveVLA。 统一端到端VLA阶段集中在2025年,研究者构建单一策略网络,在一次前向传播中直接将多模态传感器流与语言指令映射为控制信号,语言与视觉特征深度融合,代表如Waymo EMMA。推理增强VLA阶段是最新方向,将长时域推理、记忆与交互整合进控制循环,要求模型在执行动作前先进行逻辑推理并回顾历史状态,代表如ORION,其引入QT-Former记忆模块。 数据来源:《A Survey on Vision-Language-Action Mode