核心观点
人形机器人产业化落地的关键在于摆脱传统工业机器人的局限,补足对不确定性的理解与适应能力。工业机器人依赖确定性控制逻辑,缺乏感知、决策与反馈能力,导致成本高、通用性差。人形机器人以“通用智能体”为目标,强调感知—推理—执行的完整链路,必须依托大模型支撑的多模态理解与泛化能力,才能适应复杂任务与动态环境。
关键数据
- RT-1 可在家庭厨房场景中执行超过 700 项具体任务,平均成功率达 97%。
- SayCan 在真实世界的厨房环境中执行了 101 项任务,规划成功率为 81%,执行成功率为 60%。
- RT-1 使用 Transformer 编码器将图像帧与语言指令联合编码,输出动作 token。
- PaLM-E-562B 包含 540B 的语言模型与 22B 的视觉编码器。
- RT2 支持端到端训练,能够直接从输入数据到输出动作进行学习。
- Helix 采用端到端的快慢脑架构,输出 200Hz 动作序列。
- 全球首个《人形机器人智能化分级》标准将智能水平分为 L1-L5 五级,目前主流产品智能水平普遍仅在 L2 左右。
研究结论
- 当前机器人大模型已逐步具备“看图识意、理解任务、生成动作”的完整链条,但整体智能化仍处于 L2 初级阶段,通往泛化智能仍面临建模方法、数据规模与训练范式等多重挑战。
- 未来大模型将在模态扩展、推理机制与数据构成三方面持续演进,包括引入触觉、温度等感知通道,通过状态预测赋予机器人“想象力”,以及仿真与真实数据融合训练。
- 具身大模型训练高度依赖高质量真机数据,若训练场建设进度不及预期,或采集成本与效率难以有效控制,可能导致模型性能难以持续提升。
- 人形机器人作为大模型能力的重要应用载体,其商业化路径尚处早期探索阶段,若终端需求增长缓慢或应用场景拓展不达预期,将间接影响具身大模型的产业化价值空间。