本文探讨了“具身智能”(Embodied AI)领域,该领域正从传统的“互联网智能”范式转向通过与环境交互进行学习的范式。文章首先概述了具身智能的兴起背景,指出当前的研究范式需要更全面的模拟环境和交互方式,以推动通用人工智能(AGI)的发展。
文章重点评估了九个具身智能模拟器,包括 DeepMind Lab、AI2-THOR、CHALET、VirtualHome、VRKitchen、Habitat-Sim、iGibson、SAPIEN 和 ThreeDWorld。通过七个关键特征(环境、物理、对象类型、对象属性、控制器、动作和多智能体)对这些模拟器进行了比较,并提出了三个次要评估特征(真实性、可扩展性和交互性)。评估结果显示,AI2-THOR、iGibson 和 Habitat-Sim 在真实性、可扩展性和交互性方面表现最佳。
文章进一步调查了具身智能的三个主要研究任务:视觉探索、视觉导航和具身问答(QA)。每个任务都被详细讨论了其方法、评估指标和数据集。视觉探索旨在让智能体通过感知和运动更新其环境内部模型;视觉导航要求智能体在有或没有外部先验或自然语言指令的情况下导航到目标位置;具身问答则结合了视觉识别、语言理解和问答能力,是当前最具挑战性的任务。
最后,文章总结了具身智能模拟器和研究任务之间的相互关系,并指出了该领域面临的挑战和未来研究方向。主要挑战包括模拟器的真实性(缺乏具有真实世界场景和高级物理特性的模拟器)、可扩展性(大规模 3D 场景和对象数据集收集困难)和交互性(缺乏对多智能体设置的重视)。未来研究方向包括开发更真实的模拟器、改进 3D 数据集收集工具以及探索多智能体系统。