Seedream 3.0 是字节跳动推出的一款高性能中文-英文双语图像生成基础模型,在 Seedream 2.0 的基础上进行了多项技术改进,包括数据层、预训练阶段、训练后阶段和模型加速方面的优化。
数据层改进:
- 引入缺陷感知训练范式和双轴协作数据采样框架,将数据集翻倍,提高数据质量。
- 开发跨模态检索系统,动态优化数据集,提升模型性能。
预训练阶段改进:
- 采用混合分辨率训练、跨模态 RoPE、表示对齐损失和分辨率感知时间步采样等技术,提高可扩展性和泛化能力。
训练后阶段改进:
- 利用多样化的审美标题进行强化学习,并采用基于 VLM 的奖励模型以及缩放,实现与人类偏好高度一致的结果。
- 针对不同分辨率下进行训练,增强模型在各种场景下遵循提示的能力。
模型加速改进:
- 通过一致的噪声期望和重要性感知时间步采样,在保持图像质量的同时实现 4 到 8 倍的速度提升。
性能提升:
- 与 Seedream 2.0 相比,Seedream 3.0 在整体能力上取得了显著进步,特别是在复杂汉字的文本渲染方面。
- 提供原生高分辨率输出(高达 2K),图像美学质量显著提升,在电影场景中表现出卓越的性能,并在人像生成中增强了真实感。
- 在人工分析文本到图像模型排行榜上排名第一,拥有 1158 分的 Arena ELO 得分。
关键数据:
- 文本渲染准确率达到 94%,中文文本可用率相较于 Seedream 2.0 提升了 16%。
- 在肖像评估中,Seedream 3.0 和 Midjourney v6.1 均排名第一,显著优于其他模型。
研究结论:
- Seedream 3.0 代表了针对小文本生成和美观长文本编排挑战的先锋解决方案,在图形设计输出方面超越了 Canva 等平台的人设计模板。
- Seedream 3.0 提供了全面的能力、卓越的文本渲染质量、增强的视觉吸引力和极快的生成速度,有望成为各种工作和日常场景中强大的生产力工具。