Seedream 3.0 是一个高性能的中英双语图像生成基础模型,针对 Seedream 2.0 中的挑战进行了多项技术改进,包括数据层、预训练阶段、后训练阶段和模型加速。
数据层改进:
- 引入缺陷感知训练范式,通过缺陷检测器保留先前被排除的样本,将有效训练数据集扩展了 21.7%。
- 提出双轴协同数据采样框架,从视觉形态和语义分布维度进行联合优化。
- 开发跨模态检索系统,为图像-文本对建立联合嵌入空间,并在所有基准测试中达到当前最佳性能。
预训练阶段改进:
- 采用混合分辨率训练,提高模型在未见过分辨率上的泛化能力。
- 引入跨模态 RoPE,增强视觉-文本标记符的对齐。
- 使用表征对齐损失,加速收敛。
- 采用分辨率感知时间步长采样,提高模型的可扩展性和泛化能力。
后训练阶段改进:
- 利用 SFT 中的多样化美学文本描述,以及基于 VLM 的带缩放奖励模型,实现与人类偏好高度一致的输出。
- 系统地将奖励模型从 1B 参数扩展至 >20B 参数,提升奖励建模性能。
模型加速改进:
- 通过采用一致的噪声期望和重要性感知时间步长采样,在保持图像质量的同时实现了 4 到 8 倍的加速。
- 引导每个数据点朝向特定实例的目标分布,实现针对每个样本的轨迹定制,减少路径碰撞,提升生成稳定性和样本多样性。
模型性能:
- Seedream 3.0 在所有评估方面均表现出色,在全球顶尖的文生图模型中排名第一,例如 GPT-4o、Imagen 3、Midjourney v6.1、FLUX1.1 Pro、Ideogram 3.0 和其他模型。
- 在人工分析领域,Seedream 3.0 在文本-图像对齐和结构保真度方面显著优于 Seedream 2.0 及竞争模型,在美观性能方面获得了高于 Midjourney 的整体评分。
- 在自动评估中,Seedream 3.0 在所有基准测试中始终排名第一,在美学评估中表现优于 Midjourney。
- Seedream 3.0 在文本渲染方面表现出色,中英文字符文本可用率均达到 94%,尤其在渲染密集文本方面展现出显著进步。
- Seedream 3.0 在照片级真实肖像生成方面也表现出色,能够有效消除不自然的外观,皮肤纹理展现出皱纹、细小的面部毛发和疤痕等逼真的特征。
与 GPT-4o 的比较:
- Seedream 3.0 在密集文本渲染方面优于 GPT-4o,能够轻松处理密集的中文字符生成,并在排版和美学构图方面优于 GPT-4o。
- 在图像编辑方面,Seedream 3.0 表现出更好的身份保留和指令遵循能力。
- 在生成质量方面,Seedream 3.0 在颜色、纹理、清晰度和审美吸引力方面始终表现出色,而 GPT-4o 则存在一些不足,例如图像呈现暗黄色调,并表现出显著的噪点。
结论:
Seedream 3.0 在多个方面实现了全面改进,提供了原生高分辨率输出、全面的性能、卓越的文本渲染质量、增强的视觉吸引力以及极快的生成速度,展现出成为跨多种工作和日常生活场景的强大生产力工具的巨大潜力。