核心观点与关键数据
Google DeepMind于7月30日发布了三个新一代具身智能VLM(视觉语言模型)模型,包括Gemini Robotics 2、Gemini Robotics ER 2和Gemini Robotics On-Device 2。
模型介绍
-
Gemini Robotics 2
- 最先进的VLM,能控制完整人形机器人(从脚掌到指尖)及其他双臂机器人,并在双手和夹爪末端执行器上实现新层级的灵巧操作。
- 首次解锁全身控制能力,可完成“把洒水壶放进最下层货架的绿色箱子里”等复杂任务,是迈向真实任务的重要一步。
- 在不同末端执行器(如Apollo 2机器人上的SharpaWave手)上实现精细化操作(如打结、封袋),目标达人类水平灵巧度。
-
Gemini Robotics ER 2
- 能力最强的具身推理(ER)模型,作为机器人高层大脑,处理用户指令、与人沟通、理解物理世界并规划长达数分钟的多步任务(涉及数百个决策)。
- 改进进度理解能力,能精确定位任务开始、结束及关键事件时刻。
- 实现多机器人协作,让不同类型机器人沟通协同完成复杂工作流。
-
Gemini Robotics On-Device 2
- 效率最高的VLM,优化后可在机器人设备本地运行,用数小时数据快速适配全新机器人本体。
解锁技能与突破
- 全身控制:将物理AI从上半身桌面任务扩展至全身动作,支持复杂真实任务。
- 精细化操作与跨本体迁移:不同末端执行器实现新层级灵巧度,支持Apollo 2机器人完成精细动作,目标达人类水平。
- 多机器人协作:不同机器人可沟通协同,解决单台机器人无法完成的复杂工作流。
研究结论
- 三款模型显著提升机器人自主性、灵巧度与协作能力,推动具身智能向更复杂真实任务迈进。
- Gemini Robotics ER 2的具身推理能力使机器人能理解任务进度、与人交互,并泛化到全新情境。
- Gemini Robotics On-Device 2的本地化运行能力加速机器人适配与部署。
原文链接:知识星球-安全中心