世界模型的概念因多模态大型语言模型(如GPT-4)和视频生成模型(如Sora)的发展而引起广泛关注,这些模型对于追求人工通用智能至关重要。本综述全面回顾了世界模型文献,将其系统分为两大功能:构建内部表示以理解世界的机制和预测未来状态以模拟和指导决策。
世界模型的分类和功能:
- 构建内部表示以理解外部世界的机制:这类模型专注于开发能够学习和内化世界知识以支持后续决策的模型。例如,大型语言模型(LLMs)通过预训练获得了关于现实世界以及日常生活相关的广泛常识性知识,使其能够捕捉直觉性的知识,包括空间和时间理解能力,并基于此进行预测。
- 预测外部世界的未来状态:这类模型侧重于通过视觉感知增强对物理世界的预测和模拟能力。视频生成模型如Sora代表了一种专注于模拟未来世界演变的方法,能够生成符合现实物理原理的视频,并模拟数字环境。
世界模型的研究进展:
- 基于模型的强化学习(MBRL):世界模型在MBRL中扮演着构建环境模型的角色,帮助代理在模拟环境中学习并提高决策效率。通过学习状态转移动力学,MBRL能够模拟环境变化并预测未来状态,从而支持策略优化。
- 具有语言骨干的世界模型:LLMs和MLLMs可以直接部署以理解世界环境并在决策任务中使用。它们能够构建抽象的世界模型,支持行动生成,并与其他规划算法集成以提高性能。
- 模型学习的世界知识:LLMs中的世界知识可以分为全球物理世界的知识、局部物理世界的知识和人类社会的知识。研究表明,LLMs能够捕捉空间和时间知识,并嵌入类似大脑的结构化世界知识。
- 物理世界的未来预测:视频生成模型如Sora展示了生成高逼真度视频的能力,包括运动物体和形状可变的对象。然而,Sora在因果推理和模拟真实世界物理定律方面仍存在局限性。
世界模型作为具身环境:
- 室内环境:早期研究主要集中于提供视觉信息,如AI2-THOR和Matterport 3D。近年来,研究开始引入激光雷达和音频信号,以增强代理对环境感知的准确性。
- 户外环境:户外环境更具挑战性,研究主要集中在城市环境,如MetaUrban和UrbanWorld。这些研究通过提供逼真的环境设置,使代理能够在其中练习视觉导航并参与模拟现实生活家居活动的互动任务。
- 动态环境:动态环境使用生成模型创建灵活且实时的模拟,使代理能够体验到多样化的第一人称视角,提高其在复杂和不可预测的真实世界情况下的适应性和泛化能力。
世界模型的应用:
- 自动驾驶:世界模型在自动驾驶领域中被用于学习内隐表示和构建世界模拟器,以提高车辆感知和预测能力。感知模块处理来自图像、点云和其他来源的数据,以完成诸如目标检测和地图分割等任务。预测模块则在这些几何空间内运作,以预测周围环境的未来状态。
- 机器人技术:世界模型使机器人能够在复杂环境中感知、预测和有效执行任务。通过构建隐式表示和预测未来状态,机器人可以避免潜在错误并随着时间的推移提高任务性能。
- 社交仿真:世界模型被视为一种反映现实世界社会计算系统的模型。LLM代理通过存储与外部环境交互中获得的观察结果来构建其记忆,从而形成对外部世界的隐式表示和基本认知。
世界模型的挑战和未来方向:
- 物理规则和反事实模拟:世界模型需要学习模拟世界中潜在的因果关系,如环境的物理规则,以推断未观察到的反事实场景的结果。
- 丰富社会维度:设计能够模拟真实且全面的人类行为和社交互动的自主代理仍是一个开放性问题。
- 具身智能桥接仿真与现实:提高生成式人工智能模型的多模态、多任务和三维能力,并缩小模拟与现实之间的差距。
- 仿真效率:探索将较小深度学习模型与大型生成AI模型之间的协同作用,以实现显著加速。
- 道德和安全问题:关注数据隐私、模拟不安全场景和生成超逼真内容带来的社会问题,并寻求解决方案。