智元于2025年3月10日发布首个通用具身基座模型——智元启元大模型(Genie Operator-1),其核心为创新提出的Vision-Language-Latent-Action (ViLLA) 架构。ViLLA架构通过融合多模态大模型(VLM)和混合专家系统(MoE),实现高效的场景感知、语言理解及动作规划与执行。VLM赋予模型通用场景感知和语言理解能力,而MoE中的Latent Planner和Action Expert分别负责通用动作理解和精细动作执行,通过隐式动作建模和扩散模型将动作知识转化为实际操作能力,确保信息流一致性与协同优化。
ViLLA架构在多种复杂任务中表现卓越,如在“倒水”“清理桌面”和“补充饮料”任务中,成功率较已有最优模型提升32%(从46%到78%),增加Latent Planner后成功率进一步增至78%(提升12%)。该架构具备小样本快速泛化能力,可在极少甚至零样本下适应新任务,降低具身模型使用门槛。
核心观点认为,ViLLA架构具备“一脑多形”和持续进化的特点,作为通用机器人策略模型,能快速适配不同机器人本体,支持多形态机器人迁移,实现群体升智。智元通过大脑与本体双重发力,关注产业链投资机会,相关标的包括博众精工、天准科技、中大力德、均普智能、绿的谐波、富临精工、步科股份、柯力传感等。