自动驾驶行业正从模块化算法向端到端算法演进,但现有端到端算法仍难以解决所有驾驶场景中的长尾问题。因此,未来自动驾驶技术发展的必然方向是结合世界模型和认知智能,赋予算法更强的常识和场景理解能力。
自动驾驶的三要素:算力、数据和算法。算力包括车端和云端算力;数据是训练模型的基础,需要丰富度和数量;算法决定了学习速度和理解程度。
现有端到端算法的局限性:特斯拉FSD V12虽表现优异,但仍无法处理所有场景,例如牦牛群、钉子板、潮汐车道、树木倒下、奇怪手势和下雪天无车道线等。这些场景需要模型具备常识和通识知识,而现有算法缺乏这些能力。
人类驾驶的优势:人类驾驶行为包含系统一(本能反应)和系统二(逻辑思考)两种方式,且具备强大的泛化能力。这是因为人类拥有世界模型,能够理解世界运行规律,从而快速学习和适应各种驾驶场景。
自动驾驶的未来发展方向:
- 算法端:
- 端到端与规则的结合:初期采用端到端算法结合规则进行兜底,逐步减少规则,最终仅保留少量紧急制动等规则。
- 认知驱动:引入认知智能,增强算法的常识和物理知识理解能力。理想采用端到端模型+视觉语言模型双系统方案,特斯拉则计划将大语言模型作为端到端模型的指引和解释。
- 数据端:
- 数据筛选和生成:对数据进行严格筛选,确保数据质量,并探索生成数据的方法。
- 数据来源:通过量产车收集真实世界数据,并利用仿真工具生成数据。仿真技术包括3D高斯、物理仿真与图形渲染、基于辐射场和基于世界模型等,各有优劣势。
- 算力端:推动大规模算力发展,特斯拉计划年底达到8.5万片H100算力,并推出算力更强的HW5.0芯片。
研究结论:自动驾驶行业正朝着认知智能方向发展,未来有望实现L4甚至L5级别的自动驾驶。理想、华为、小鹏等国内领先玩家将在自动驾驶性能上取得进一步突破。