这份研报深入分析了自动驾驶领域中强化学习的核心作用。报告指出,强化学习是突破模型能力上限的关键环节,与大语言模型中作为配角的定位不同。在自动驾驶领域,大语言模型依赖互联网级人类语料构建高起点,而强化学习仅用于事后对齐与推理增强。自动驾驶模仿人类驾驶数据,其上限受限于平均人类水平,必须依赖强化学习实现超越人类安全目标。此外,报告还探讨了自动驾驶模仿学习存在的协变量漂移、长尾场景缺失等结构性缺陷,强调必须依赖强化学习突破这些边界。
自动驾驶行业正朝着强化学习与世界模型深度融合的方向发展。强化学习与世界模型是自动驾驶落地的核心工程方向,理想、华为等厂商均将世界模型作为强化学习的训练载体。量产路线中,特斯拉、小鹏、理想等已推进强化学习应用,小鹏72B模型已积累2000万次视频训练数据。供应商阵营中,Momenta、地平线等均在端到端模型中引入强化学习技术。L4阵营侧重安全冗余,小马智行以超百亿级仿真测试里程开展强化学习训练。整体来看,行业呈现分化格局,技术落地节奏存在不确定性,但强化学习已成为行业发展的关键驱动力。
研报重点分析了强化学习在自动驾驶领域的应用方向。报告指出,强化学习是突破模型能力上限的关键环节,需要依赖高保真世界模型进行训练。理想、华为等厂商已将世界模型作为强化学习的训练载体,特斯拉、小鹏、理想等已推进强化学习应用。供应商阵营中,Momenta、地平线等均在端到端模型中引入强化学习技术。L4阵营如小马智行,则通过超百亿级仿真测试里程开展强化学习训练。此外,报告还探讨了模仿学习的缺陷,强调必须依赖强化学习突破边界。
当前自动驾驶市场呈现多元化发展态势。一方面,主流车企如特斯拉、小鹏、理想等已积极推进强化学习在量产车型中的应用,积累了大量训练数据。另一方面,供应商如Momenta、地平线等也在端到端模型中引入强化学习技术,推动技术落地。L4阵营则侧重安全冗余,通过超百亿级仿真测试里程开展强化学习训练。然而,行业仍存在分化格局,技术落地节奏存在不确定性。特别是强化学习在自动驾驶中的应用依赖高保真世界模型,存在环境逼真度不足的风险,需要进一步突破。
研报提示了强化学习在自动驾驶中的应用风险。首先,强化学习在自动驾驶中的应用依赖高保真世界模型,如果环境逼真度不足,将影响训练效果和实际应用表现。其次,产业呈现分化格局,不同厂商的技术路线和应用进度存在差异,技术落地节奏存在不确定性。此外,模仿学习存在协变量漂移、长尾场景缺失等结构性缺陷,无法通过增加模仿数据解决,必须依赖强化学习突破这些边界。这些因素都可能对自动驾驶技术的商业化进程产生影响。