您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [东吴证券]:汽车行业深度报告:AI系列深度25期:从模仿学习到强化学习的范式跃迁 - 发现报告

汽车行业深度报告:AI系列深度25期:从模仿学习到强化学习的范式跃迁

交运设备 2026-08-07 黄细里,童明祺 东吴证券 XL
报告封面

AI系列深度25期:从模仿学习到强化学习的范式跃迁 2026年08月07日 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn研究助理童明祺 执业证书:S0600125080005tongmq@dwzq.com.cn 增持(维持) ◼模仿学习的能力上限在数字AI与物理AI之间存在结构性分野。大语言模型预训练本质上是对互联网级人类知识的规模化模仿,学习对象覆盖公开语料中的多领域知识,广度上限高于单一专家,因此可形成较高能力底座;自动驾驶端到端模型主要学习人类驾驶轨迹,而L4安全目标要求显著超越平均人类表现,模仿学习天花板约束更强。 ◼闭环驾驶会放大模仿学习的结构性缺陷。行为克隆在训练分布内表现稳定,但一旦进入示范数据未覆盖状态,模型输出偏差会推动车辆进入新的状态分布,形成协变量漂移;长尾、危险和事故场景也难以依靠真实道路主动采集。强化学习因而不只是后训练补强,而是驾驶模型突破模仿边界的重要环节。 ◼强化学习与世界模型在物理AI中形成双向共生。真实道路无法承担反复试错、失败重置和危险事件注入,世界模型因此成为策略训练、奖励设计与安全验证的闭环试错场;同时,真实数据回流与策略训练也会暴露仿真偏差,推动世界模型持续校准。 相关研究 《AI系列深度17期:视觉智能为何引入Transformer?》2026-08-06 ◼产业实践正在向“端到端+世界模型仿真+强化学习后训练”收敛,但具体路线仍有分化。特斯拉、小鹏、理想、Momenta、地平线、千里科技、卓驭、元戎启行等均已公开将强化学习纳入训练链路;小鹏、理想、元戎、千里更偏向VLA或多模态路线,华为、Momenta、地平线相对弱化语言中介,更强调世界模型构建与强化学习闭环。 《AI系列深度16期:语言智能为何从RNN转向Transformer?》2026-08-06 ◼L4 Robotaxi路线更关注大规模闭环仿真、安全冗余和超越人类驾驶水平。小马智行PonyWorld等公开表述突出强化学习范式和世界模型仿真,Waymo、文远知行则更多强调基础模型、大规模仿真和端到端能力建设。行业共性是以仿真环境承载闭环训练,差异集中在语言中介、强化学习披露程度和量产辅助驾驶/L4运营定位。 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。 内容目录 1.1.数字AI:互联网级知识语料抬高模仿学习上限.......................................................................41.2.物理AI:人类驾驶演示约束模仿学习上限...............................................................................41.3.模仿学习的结构性缺陷在闭环驾驶中被放大............................................................................41.4.强化学习在驾驶中的定位由事后增强转向关键环节................................................................5 2.强化学习与世界模型:高物理闭环下的工程共生..............................................................................6 2.1.强化学习需要可试错的环境,真实道路无法承担这一角色....................................................62.2.世界模型为强化学习提供高保真的闭环试错场........................................................................62.3.真实数据与强化学习反过来校准世界模型的保真度................................................................72.4.生成式与重建式世界模型的结合是当前主流工程取向............................................................8 3.厂商实践:端到端之上叠加强化学习后训练......................................................................................8 3.1.量产乘用车辅助驾驶:端到端之上的强化学习后训练正在收敛为共识................................83.2. L4 Robotaxi:以世界模型驱动的闭环仿真,安全冗余优先.....................................................93.3.不同路线的共性与分歧..............................................................................................................10 4.结论:强化学习从可选增强走向关键环节........................................................................................11 5.风险提示:............................................................................................................................................12 图表目录 图1:模仿学习与强化学习的能力天花板(概念示意)......................................................................5图2:强化学习与世界模型的双向共生闭环(概念示意)..................................................................8 表1:模仿学习与强化学习在数字AI与物理AI中的角色对比..........................................................6表2:代表性厂商“端到端+世界模型+强化学习”技术布局梳理........................................................11 1.强化学习成为高物理闭环任务关键环节 数字AI与物理AI均以模仿作为重要训练范式,但模仿对象差异决定了强化学习在两类系统中的角色分化。理解这一分化,是判断强化学习为何在自动驾驶中由后训练工具走向关键环节的前提。 1.1.数字AI:互联网级知识语料抬高模仿学习上限 大语言模型的预训练在机制上可视为一种模仿。其训练目标是预测下一个token,学习对象是经过筛选的互联网级人类文本语料。由于相关语料汇集了大量人类在不同领域的知识与表达,预训练可使模型在知识覆盖广度上显著高于单一个体,模仿由此可以支撑较高能力底座。 强化学习在大语言模型中更多承担事后对齐与推理增强的角色。基于人类反馈的强化学习用于让模型输出更符合人类偏好,而面向可验证任务的强化学习则用于提升推理能力。DeepSeek团队2025年发表于《自然》的研究显示,在不使用监督微调的前提下,纯强化学习可以诱发自我反思、验证与策略调整等推理行为,并在数学、编程等可验证任务上超过以人类示范做监督学习的同类模型。这一结果说明,在数字AI中强化学习能够在模仿底座之上进一步突破,但模仿本身已提供了足够高的起点。 1.2.物理AI:人类驾驶演示约束模仿学习上限 自动驾驶端到端模型的主流训练方式同样具有模仿属性,但模仿对象主要是人类驾驶演示数据。Momenta在阐述其技术路线时,将模仿学习概括为模型从人类司机驾驶行为中学习,其能力上限更容易受到示范数据质量、覆盖范围与人类驾驶分布约束;同时,人类驾驶并不完美,复杂低频场景样本稀缺,模型可学习空间因此受到约束。卓驭科技AI负责人陈晓智的表述与之相近,其认为预训练阶段本质上是模仿学习,可将系统能力推升至约80分水平,而从80分提升至95分则需要强化学习。 驾驶任务对能力上限的要求与模仿学习所能提供的上限之间存在落差。L4自动驾驶的目标是在安全性上超越人类,而非趋近人类平均水平。小马智行联合创始人楼天城在阐述PonyWorld世界模型时表示,即使完美复刻人类顶尖司机的驾驶行为,也无法满足L4级自动驾驶对安全性的苛刻要求,因为机器需要理解“为什么”,而不仅是“怎么做”。地平线创始人余凯亦认为,用户行为数据价值有限,行业头部玩家不应仅依赖司机数据学习,未来在仿真平台中通过强化学习训练可能成为关键增量。 1.3.模仿学习的结构性缺陷在闭环驾驶中被放大 行为克隆式模仿学习在闭环控制中存在协变量漂移问题。学术界对此已有长期讨论,Ross等人在2011年提出的DAgger及后续研究指出,策略在执行早期产生的微小动作偏差会使车辆进入训练分布之外的状态,误差随时间累积放大,最终导致策略在新状态下失效。该问题在自动驾驶闭环场景中尤为关键,因为驾驶是动作影响后续观测的序贯 决策过程,而非单步预测。 模仿学习从人类数据中习得的行为并非天然最优。端到端模型可能同时学习有效驾驶行为与低质量驾驶行为,强化学习则可通过奖励设置保留安全、高效、舒适的动作,并抑制不良驾驶行为。由此可见,模仿范式的另一局限在于难以自发区分被模仿行为的优劣,而强化学习可通过奖惩信号提供行为筛选机制。 特斯拉公开口径提供了量化参照。关键干预间隔里程在FSD v12.5较前代改善约100倍,并预期v13改善约1000倍。该数据为公司口径,v13为预期目标,属前瞻信息,存在不确定性。即使最终兑现程度仍待验证,目标量级仍反映行业对“远超人类干预频率”的安全目标诉求,而这一目标难以仅依赖模仿平均人类司机达成。 1.4.强化学习在驾驶中的定位由事后增强转向关键环节 强化学习在自动驾驶中的定位不同于大语言模型。在大语言模型中,强化学习主要服务于后训练、偏好对齐与可验证推理增强;在自动驾驶中,模仿底座受人类演示数据和协变量漂移制约,若要达到超越人类的安全目标,强化学习在高物理闭环、高安全约束场景中更接近突破上限的关键环节。 2.强化学习与世界模型:高物理闭环下的工程共生 强化学习要在驾驶中发挥作用,离不开可反复试错的训练环境,而真实道路难以承担这一角色。世界模型的意义在于提供可控、可重置、可注入危险事件的闭环环境,从而支撑策略训练、安全验证和模型迭代。 2.1.强化学习需要可试错的环境,真实道路无法承担这一角色 强化学习的核心机制是在与环境交互中通过奖惩信号优化策略,这要求环境能够反复复现、注入危险事件,并在失败后重置。真实道路不满足上述条件,碰撞类数据在真实道路上极难且不应主动获取,危险场景也无法随意复现。相关驾驶模仿学习研究已将世界模型作为神经模拟器,用于在训练中生成新状态,从而在降低对额外真实道路主动采集依赖的同时缓解协变量漂移,并为强化学习提供可行试错载体。