智元发布首个通用具身基座模型GO-1,开创性地提出Vision-Language-Latent-Action (ViLLA) 架构。该架构由VLM(多模态大模型)+ MoE(混合专家)组成,其中VLM借助海量互联网图文数据获得通用场景感知和语言理解能力,MoE中的Latent Planner借助大量跨本体和人类操作视频数据获得通用的动作理解能力,MoE中的Action Expert借助百万真机数据获得精细的动作执行能力。三者协同工作,实现了利用人类视频学习,完成小样本快速泛化,降低了具身智能门槛,并成功部署到智元多款机器人本体。
GO-1在AgiBot World数据集及互联网大规模异构视频数据上表现优异,相比已有最优模型,平均成功率提高32%(46%- >78%)。ViLLA架构通过LAM(隐式动作模型)获取Latent Actions的Groundtruth,Latent Planner与VLM主干网络共享Transformer结构并引入Action Expert,有效增强了策略的泛化能力。
GO-1的推出标志着具身智能向通用化、开放化、智能化加速迈进,可泛化应用到各类环境和物品中,快速适应新任务、学习新技能,并支持部署到不同机器人本体,高效落地并持续进化(从单一任务到多种任务、从封闭环境到开放世界、从预设程序到指令泛化)。
投资建议:重点关注国产机器人整机厂和零部件公司,包括整机厂、执行器和电机、减速器、传感器、丝杠类。风险提示:国产设备替代进度不及预期风险、人形机器人产业化不及预期风险、产业政策不及预期风险。