谷歌Deepmind发布的Gemini Robotics系列模型包括Gemini Robotics 2、Gemini Robotics ER 2和Gemini Robotics On-Device 2。Gemini Robotics 2能控制完整人形机器人并实现新层级的灵巧操作,首次解锁全身控制能力,完成复杂任务;Gemini Robotics ER 2作为高层大脑,处理用户指令、理解物理世界并规划多步任务;Gemini Robotics On-Device 2优化后可在设备本地运行,快速适配全新机器人本体。这些模型显著提升机器人自主性、灵巧度与协作能力,推动具身智能向更复杂真实任务迈进。
具身智能赛道未来发展趋势聚焦于提升机器人自主性、灵巧度与协作能力。随着VLM模型的进化,机器人将能完成更复杂的真实任务,如全身控制、精细化操作(如打结、封袋)、多机器人协同等。关键突破包括全身控制能力、跨本体迁移的精细化操作、以及多机器人沟通协同。这些进展将推动具身智能从上半身桌面任务向全身动作和真实任务扩展,加速机器人适配与部署,使机器人能理解任务进度、与人交互,并泛化到全新情境。
本报告重点分析了谷歌Deepmind发布的Gemini Robotics系列模型的三大核心功能:全身控制、精细化操作与跨本体迁移、多机器人协作。报告详细介绍了Gemini Robotics 2的全身控制能力、Gemini Robotics ER 2的具身推理能力(处理用户指令、理解物理世界、规划多步任务)以及Gemini Robotics On-Device 2的本地化运行能力。此外,报告还总结了这些模型对机器人自主性、灵巧度与协作能力的提升作用,以及它们推动具身智能向更复杂真实任务迈进的意义。
当前具身智能市场正处于快速发展阶段,以VLM模型为核心的技术突破显著提升了机器人的自主性和任务执行能力。谷歌Deepmind的Gemini Robotics系列模型代表了行业领先水平,其全身控制、精细化操作和多机器人协作能力标志着具身智能从上半身桌面任务向全身动作和真实任务的重要跨越。市场参与者正加速研发更高效、更通用的具身智能模型,以推动机器人技术在工业、服务、物流等领域的应用。这些进展正推动具身智能向更复杂真实任务迈进,加速机器人适配与部署。
本报告提示的风险主要集中在技术迭代速度和商业化落地挑战。具身智能技术仍处于快速发展阶段,模型性能的提升依赖于大量数据和算力资源,可能导致研发成本高昂、技术迭代速度放缓。此外,机器人商业化落地面临硬件成本、环境适应性、伦理法规等多重挑战,需要产业链各方协同解决。具身智能模型的泛化能力仍需持续验证,以确保其在不同场景下的稳定性和可靠性。这些因素可能影响具身智能技术的商业化进程和市场表现。