1. 引言
物理AI模型平台(WFM)旨在解决物理AI扩展训练数据具有挑战性的问题,通过构建物理世界的数字孪生——世界基础模型(WFM),为物理AI系统提供安全交互环境。本文介绍了Cosmos World Foundation Model Platform,该平台包含视频策划流程、预训练的WFM、训练后WFM示例以及视频分词器,并开源了模型权重,以帮助开发者构建定制的物理AI应用。
2. 宇宙世界基金会物理AI模型平台
平台提供了两种预训练-后训练的WFM范式:
- 预训练WFM:利用大规模视频数据集进行训练,使模型成为通才,学习物理世界的普遍知识。
- 后训练WFM:使用特定物理AI环境的数据集对预训练WFM进行微调,得到针对特定任务的专用WFM。
平台包含两种WFM家族:
- 基于扩散的WFM:通过逐渐从高斯噪声视频中移除噪声来生成视频。
- 基于自回归的WFM:通过逐步生成视频的下一个标记来生成视频。
3. 数据整理
平台开发了可扩展的视频数据整理流程,包括:
- 分割:将长视频分割成无场景转换的镜头。
- 过滤:去除低质量、无信息或重复的视频片段。
- 标注:使用视频语言模型(VLM)为每个视频片段生成描述。
- 去重:移除语义重复的视频片段。
- 分片:将视频片段存储在数据库中,并根据分辨率和宽高比进行分块。
4. 标记化器
平台开发了Cosmos Tokenizer,一套包含连续和离散图像和视频标记器的视觉标记器工具,能够高效地处理高维视觉数据,并支持不同的压缩率。
5. 世界基础模型预训练
平台提出了两种可扩展的深度学习范式来构建预训练的WFM:
- 基于扩散的WFM:通过逐渐从高斯噪声视频中移除噪声来生成视频。
- 基于自回归的WFM:通过逐步生成视频的下一个标记来生成视频。
6. 经训练的世界基础模型
平台展示了预训练WFM在多个下游物理AI应用中的应用,包括:
- 相机控制:生成可导航的虚拟世界,用户可以通过移动虚拟视点来探索。
- 机器人操作:控制机器人执行各种任务,如视频动作序列预测。
- 自动驾驶:生成高分辨率、多视角一致性的驾驶模拟场景。
7. 安全栏
平台开发了一套全面的防护系统,分为两个阶段:
- 预防护:利用Aegis和关键词列表阻断有害输入。
- 后防护:通过视频内容安全分类器和面部模糊滤镜阻断有害输出。
8. 相关工作
平台与现有研究进行了比较,并突出了其优势,例如:
- 更高效的视频生成:基于扩散的WFM能够生成更高质量的视频。
- 更好的泛化能力:预训练WFM可以应用于各种物理AI任务。
- 更灵活的控制:后训练WFM可以根据特定任务进行调整。
9. 结论与讨论
平台为构建物理世界通用模拟器迈出了重要一步,但仍处于早期阶段,需要进一步研究和改进。未来的方向包括:
- 提高物理一致性:开发由多模态大型语言模型驱动的自动化评估器,并利用现有的物理模拟器来促进可重复性和交互式评估。
- 探索混合方法:探索扩散模型和自回归模型的混合方法,以结合两者的优点。