Seedream2.0:一个原生中文-英文双语图像生成基础模型
简介
随着扩散模型的快速发展,图像生成领域取得了显著进展,但现有模型仍面临模型偏差、文本渲染能力有限和对中文文化细微差别理解不足等问题。为解决这些局限性,Seedream团队提出了Seedream2.0,一个原生中文-英文双语图像生成基础模型,在多个维度上表现出色,能够巧妙地处理中英文的文本提示,支持双语图像生成和文本渲染。
主要贡献
- 强大的模型能力:通过数据构建、模型预训练和后期训练的多层次优化,模型在提示跟随、美学、文本呈现和结构正确性等方面处于前沿。
- 出色的文本呈现能力:使用针对文本呈现任务定制的字符级文本编码器,模型展现了优秀的文本生成能力,特别是在生成包含复杂汉字的长文本内容方面表现突出。
- 对中文特征的深刻理解:通过与自开发的多语言LLM文本编码器的整合,模型可以直接从大量高质量的中文数据中学习,生成具有准确文化细微差别和美学表达的图像。
- 高度符合人类偏好:经过多个迭代的RLHF优化,模型在各个后期训练模块中始终与人类偏好对齐,ELO评分显著优于其他模型。
数据预处理
数据组合
预训练数据精心策划,包括四个主要组成部分:
- 知识丰富的配对:高质量的配对,包括图像质量极高和知识内容丰富的数据。
- 一般数据:分布维护数据,通过按数据源下采样和基于聚类的采样保持原始数据的有用分布。
- 知识注入数据:使用分类法和多模态检索引擎注入知识,包括具有独特中国语境的数据。
- 针对性补充数据:用在文本到图像任务中表现不佳的数据补充数据集,例如以动作为导向的数据和反事实数据。
数据清理过程
通过逐步细化的数据过滤方法确保数据集的质量和相关性,包括:
- 第一阶段:一般质量评估,评估图像清晰度、运动模糊和无意义内容。
- 第二阶段:详细质量评估,涉及专业的美学评分、特征嵌入提取、去重和聚类。
- 第三阶段:标注和重新标注,对剩余数据进行分层,并注释标注或重新标注。
主动学习引擎
开发了一个主动学习系统来改善图像分类器,通过迭代过程逐步改进分类器,确保为训练提供高质量的数据集。
图像字幕生成
为每张图片提供有意义且在上下文中准确的描述,包括:
- 通用描述:中英文简短和长篇描述,确保准确而详细的描述。
- 专业描述:针对不同场景设计的专业标题,如艺术标题、文本标题和超现实标题。
文本渲染数据
通过过滤内部数据和使用OCR工具选择具有丰富视觉文本内容的图像,构建了一个大规模视觉文本呈现数据集。
模型预训练
扩散变换器
使用自行开发的变分自编码器(VAE)对输入图片进行编码,得到潜在空间表示,然后将潜在向量分割成多个部分,最终将输入图片转换为图像标记,这些标记与由文本编码器编码的文本标记连接,然后馈入变换器块。
文本编码器
整合自开发的双语大语言模型(LLM)作为文本编码器,通过微调LLM增强双语对齐能力,使其能够原生支持从中文和英文的原始数据中学习。
字符级文本编码器
应用ByT5字形对齐模型来编码渲染文本的字形内容,确保渲染文本的字形特征与文本提示的一致性。
模型后训练
持续训练(CT)
通过转向一个更小但质量更好的数据集进行训练,显著提高生成图像的美学质量,并保持对提示跟踪和结构准确性的基本性能。
监督微调(SFT)
进一步微调模型,以生成具有优秀艺术美感的高保真图像,使用少量精心收集的图像,并通过数据重采样算法增强美学,同时保持图像与文本对齐的能力。
人类反馈对齐(RLHF)
引入了一种针对扩散模型的开创性RLHF优化程序,结合偏好数据、奖励模型(RMs)和反馈学习算法,增强模型在各个方面的整体性能。
提示工程(PE)
利用内部微调的LLM来促进扩散模型生成更高质量的图像,通过监督微调LLM和RLHF进一步提升PE模型的表现。
精炼器
开发了一个精炼模型以扩展具有更高分辨率的图像,同时修正一些小的结构错误。
对齐到基于指令的图像编辑
SeedEditV1.0
提出了一个新的数据生成过程、一个新颖的因果扩散框架以及具有迭代优化的训练策略,保持与原始输入的高审美和构图保真度的编辑图像。
增强人脸识别
引入了多专家数据融合和面部感知损失,进一步增强模型保留面部特征的能力。
模型加速
CFG和步骤蒸馏
提出了一种新颖的引导比例嵌入策略和步骤蒸馏框架,提高扩散模型的效率。
量化
通过操作融合和对密集运算的微调显著提高了计算密度,并减少了内核内存访问。
模型性能
人类评估
通过Bench-240基准,计算整体ELO分数,对文本-图像对齐、结构修正和美学质量进行专业评估,结果显示Seedream2.0在所有评估标准上表现更加全面,获得最高总分。
自动评估
采用EvalMuse和VQAScore方法评估文本-图像对齐能力,结果显示Seedream2.0在大多数关键指标上获得了最高的综合分数。
图像质量
通过HPSv2和MPS模型评估图像质量,结果显示Seedream2.0在HPSv2上获得了最高分,在MPS分数方面紧随Midjourneyv6.1,但大幅超越其他竞争模型。
文本渲染
制定了一个专门针对文本渲染的基准,包含180个中文提示和相等数量的英文提示,结果显示Seedream2.0在中英文文本渲染方面实现了最佳的可用性,文本准确性和命中率在测试模型中排名最高或接近最高。
中文特征
构建了一个涵盖传统服饰、食物、艺术技巧、建筑和其他习俗的提示基准,结果显示Seedream2.0在响应速度和中国美学方面表现优异,尤其在食物、节日、工艺和建筑等方面。
可视化
通过多个视觉比较结果,结果显示Seedream2.0在图像文本对齐,结构连贯性,美学吸引力和文本呈现准确性等方面表现出优势。
结论
Seedream2.0在提示跟随、美学、文本呈现和结构正确性等方面表现出色,其卓越的ELO评分证明了模型与人类偏好高度契合。特别是在中文文本渲染和文化特定场景生成方面,模型表现出显著的有效性,在豆包和即梦等应用上赢得了广泛赞誉。