一、核心要点
- 智源Talk第363期主题为AI从数字世界走向真实物理世界,重点分享多模态世界模型奥卡。
- 当前AI多停留在片面维度建模,未真正理解物理规律,单一模态(文字、像素、动作)模型无法完整表征世界,奥卡作为原生多模态世界模型的早期成果。
- 奥卡采用next state prediction框架,结合无意识学习(12万小时视频数据)与有意识学习(1.6亿事件标注),构建统一世界表征。
- 奥卡在多维度评测中表现优于同尺寸模型,状态转移、物理合规性提升明显,具身控制场景泛化能力更强,三类训练目标缺一不可。
- 奥卡认为世界模型应采用原生多模态空间建模,状态转移范式具备通用性,为多模态融合、世界模型方向提供新路径。
- 当前世界模型存在模态割裂和物理量化难题,仅靠视频学习难以实现量化,需多模态输入或仿真平台支持。
- 智源院以提供通用世界表征为主干模型方向,类似BERT、GPT的通用泛化思路。
- 奥卡1.0性能与PaLM、维加帕、千问等模型相当,突破至6%-7%性能,印证了从核心出发解决问题的价值。
二、风险与关注
- 当前AI未真正理解物理规律,单一模态模型无法完整表征世界,世界模型存在模态割裂问题,物理量化难实现,仅靠视频学习无法完成。
- 量子AI是15规划重点方向,当前卡点多在QPU等硬件发展,待拓宽广义领域后再交叉微观量子研究。
三、后续规划
- 深耕基座模型,未来将拓展到生命科学、天体物理等领域,计划让世界模型具备提出经验公式等假设能力;直播内容将在智源社区上线回放。