报告主要探讨了改进扩散模型和整流流公式在高分辨率图像合成中的应用。核心贡献包括:
-
大规模系统研究:对不同的扩散模型和整流流公式进行了大规模研究,旨在确定最佳设置。研究发现,前向路径的选择对采样效果有重要影响。具体而言,前向过程的选择不仅影响训练过程,还影响采样的效率和质量。
-
新型噪声采样器:提出了一种新型的噪声采样器,相较于已知的采样器,在多个指标和人类评估中表现更优,特别是在文本到图像生成方面。这有助于提高图像合成的质量和速度。
-
扩展的文本到图像合成架构:设计了一种可扩展的架构,允许网络内部文本和图像令牌之间双向混合。与现有的骨干网相比,该架构在性能上有显著优势,尤其是在UViT和DiT等模型上。
-
缩放研究:展示了模型随着参数规模的增加而遵循的可预测的缩放趋势,低验证损失与自动和人工评估的性能提升密切相关。这为模型的扩展提供了理论基础。
-
公式改进:研究了整流流模型的改进版本,通过引入噪声尺度的重新加权,提高了采样的效率和质量。与传统的扩散公式相比,新公式在多个指标上表现更佳,尤其是在生成高分辨率图像时。
-
模型架构:采用了一种基于整流流的模型架构,结合了图像和文本标记的可学习流,实现了信息的双向流动。这种架构能够更好地融合文本和图像信息,生成高质量的图像。
综上所述,报告聚焦于扩散模型和整流流的创新应用,特别是在高分辨率文本到图像合成领域。通过深入研究和实验,提出了一系列改进策略和技术,显著提升了图像生成的质量和效率。