视觉生成大模型研究
视觉生成模型发展历程
视觉生成领域经历了快速发展,取得多个里程碑。主要方法包括:
- 变分自编码器(VAE):最大化变分下界
- 生成对抗网络(GAN):对抗性训练
- 流模型:分布的可逆变换
- 扩散模型:逐步添加高斯噪声并反向
扩散模型关键要素
扩散模型在视觉生成中的应用关键要素包括:
- 像素扩散(原始输入)
- 潜空间扩散
- UNet
- Transformer
Sora模型突破
Sora模型实现了多项突破:
- 一致性:3D渲染一致性、长程连贯性、物体恒常性
- 高保真度
- 超长视频生成:支持1分钟视频(此前系统仅秒级)
- 灵活分辨率:支持不同时长、宽高比和分辨率的视频生成
Sora关键技术包括:
- Meta的DiT框架(2022.12)
- Google的MAGViT(2022.12)
- Google DeepMind的NaViT(2023.07)
- OpenAI的DALL-E 3(2023.09)
物理世界建模挑战
物理世界建模面临复杂性和数据需求问题:
- 物理世界关键要素:外观、几何、光照、运动动画、音频
- 建模方法:高斯流(4D重建)、贝叶斯推理、概率图模型、数学方程、物理模拟、控制理论
- 挑战:
- Sora在几何、外观、光照、运动动画等方面存在失败案例
- 视频多视图生成仍需几何增强
- STAG4D在时序方面仍需改进
基于确定性条件的解决方案
通过引入确定性条件降低数据需求:
应用案例
基于确定性条件的模型包括:
- Champ:可控一致的人像图像动画(3D参数引导)
- Hallo:音频驱动的肖像图像动画(分层视觉合成)
- 动态蛋白质结构预测:参考引导时序对齐的4D扩散模型
未来工作方向
- 将确定性条件应用于概率扩散模型
- 通过几何、光照、运动动画等确定性约束减少数据和参数需求