登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
从零开始构建大语言模型的关键要点
信息技术
2023-10-04
UTC&W&B
陳寧遠
大型语言模型(LLM)从零开始训练的最佳实践
自建与采购预训练过的LLM模型
三种选择
:
使用商业LLM的API
使用现有的开源LLM
自己或与咨询公司一起预训练LLM
选择考量
:
使用商业LLM API
:优点是技术门槛低、前期成本小、数据需求少、可利用最佳LLM、缩短上市时间;缺点是大量微调或推理任务可能成本高昂,且对服务提供商依赖度高。
使用开源LLM
:优点是成本低于自行训练,可定制性强;缺点是需要大量领域专家技能,且性能通常落后于商业模型。
自行预训练LLM
:优点是控制权最大,可定制性强,可建立持续竞争优势;缺点是成本高昂、风险大,需要跨领域知识。
适用场景
:
技术团队较少,希望利用LLM技术构建下游应用程序,或希望利用最佳LLM技术。
训练数据集有限,希望利用LLM的能力进行零/少次尝试学习。
原型设计应用程序并探索LLM的潜力。
需要从现有的预训练LLM中更改模型架构或训练数据集。
LLM是业务战略和技术护城河的核心部分,具有大量投资意愿。
缩放定律
LLM缩放定律
:
OpenAI最初认为扩大模型规模比扩大数据规模更重要。
DeepMind认为LLM训练不足,增加基础训练数据集会带来更好的性能。
DeepMind的Chinchilla模型证明,模型大小和训练分词数量应大致以相同的速率增加,以达到最佳性能。
最佳实践
: 1)根据数据集大小选择钦奇拉最佳模型大小。 2)根据训练计算预算和推理延迟要求,确定最适合模型的数据和模型大小组合。
硬件
硬件需求
:预训练LLM是硬件密集型工作,需要大量高性能GPU和高速网络。
并行技术
:
数据并行:将训练数据分成多个分区,分配给不同节点进行并行处理。
张量并行:将大型矩阵乘法划分为较小的子矩阵计算,使用多个GPU同时执行。
管道并行:将模型层划分为可并行处理的阶段。
模型并行:将模型拆分到多个GPU上,每个GPU使用相同的数据。
并行技术选择
:通常结合使用多种并行技术,如PaLM和OPT模型。
硬件成本
:利用数千个高性能GPU和高带宽网络训练LLM需要大量基础设施,例如PaLM模型的成本可能高达2300万美元。
数据集整合
数据重要性
:糟糕的数据会导致糟糕的模型,高质量、大量、多样的数据集直接有助于模型在下游任务中的性能以及模型收敛。
数据集来源
:抓取的公共数据、在线出版物或书籍库、代码数据(GitHub)、维基百科、新闻、社交媒体对话等。
数据集示例
:The Pile是一个包含来自22个数据源的流行文本语料库,分为学术写作、在线或抓取资源、散文、对话和杂项五大类。
数据集收集
:一般数据可以由非专家收集,但特定领域的数据通常需要领域专家参与。
数据集预处理
数据调整
:
数据取样:对某些数据组分进行上采样或下采样,以获得更均衡的数据分布。
数据清理:删除模板文本、HTML代码或标记,修正拼写错误,处理跨域同音异义词,和/或删除有偏差/有害的言语。
非标准文本组件处理:将非标准文本组件(如表情符号)转换为文本。
数据去重:使用模糊去重方法(如LSH)删除重复数据。
下游任务数据移除:使用n-grams等方法移除评估数据集中的训练数据,避免数据泄露。
词元化
:
基于单词的词元化:简单高效,但处理复杂语言能力有限。
基于字符的词元化:对于没有明显词界的语言非常有用,但会产生很长的序列。
基于子词的词元化:解决了前两种方法的缺点,是目前最流行的技术,包括BPE、WordPiece、Unigram和SentencePiece。
填充和截断
:填充确保张量为矩形,截断缩短过长的序列。
预训练步骤
模型架构
:通常从流行前代的模型架构和超参数开始,并进行调整以提高训练效率、扩大模型规模并提高性能。
实验和超参数搜索
:进行大量实验以找到模型性能的最佳设置,包括权重初始化、位置嵌入、优化器、激活、学习率、权重衰减、损失函数、序列长度、层数、注意力头数、参数量、密集层与稀疏层、批量大小和退出等。
超参数调整
:学习率、批量大小等超参数需要在训练期间进行调整,以平衡学习效率和训练收敛性。
训练中可能出现的问题
:
硬件故障:需要手动或自动重启训练运行。
训练不稳定性:需要采取措施提高稳定性,如使用较大的批次大小、批次归一化、学习率调度、权重初始化、模型训练起点、正则化、数据增强和训练期间的热插拔等。
模型训练环境保存
:确保模型训练环境被保存并保留在最终状态,以便将来复制或重新做任何事情。
模型评估
评估方法
:在多样化的语言模型数据集上评估预训练模型,以评估其执行逻辑推理、翻译、自然语言推理、问题解答等的能力。
评估基准
:Open-Domain Question Answering tasks、Cloze and Completion tasks、Winograd-style tasks、Common Sense Reasoning、In-context Reading Comprehension、Natural Language Inference (NLI)、Reasoning tasks、Code tasks、Translation tasks、BIG-bench、LM Evaluation Harness等。
n-shot学习
:评估模型在零样本学习和少样本学习场景下的性能,通常包括零样本、单次样本和少量样本。
评估参与者
:NLP工程师和领域专家(SMEs)都参与评估过程,并从不同角度对模型性能进行评估。
偏差和毒性
风险
:网络文本训练的LLM可能存在偏差和毒性,会延续或加剧社会成见,并可能泄露私人信息。
评估基准
:Hate speech detection、Social bias detection、Toxic language response、Dialog safety evaluations等。
减少偏差和毒性方法
:
训练集过滤:从训练数据中删除显示出偏差的元素。
训练集修改:修改训练数据以减少偏差。
提示工程:修改模型输入以避免模型出现偏差。
微调:对训练有素的模型进行再训练,以消除偏差倾向。
输出转向:在推理过程中添加一个过滤步骤来重新权衡输出值,并引导输出远离有偏倚的响应。
指令调优
目的
:使预训练的LLM能够更好地响应指令,并减少提示阶段对少量示例的需求。
优势
:在不损害模型泛化能力的情况下显著提高模型性能。
注意事项
:指令调优对全部模型参数进行调整,而不是冻结部分参数,因此不会有参数效率微调带来的成本优势。
通过人类反馈强化学习 (RLHF)
原理
:在指令调优步骤之后添加更多步骤,以进一步合并人工反馈,使预训练的LLM能够更好地遵循用户指令。
步骤
: 1)指令调优:收集标注者演示所需的模型行为的数据集,并利用这些数据集通过监督学习对预训练的LLM进行微调。 2)收集模型输出比较的数据集,训练奖励模型来预测人类偏好的输出。 3)采用训练好的奖励模型,利用强化学习优化针对奖励模式的策略。
效果
:RLHF在InstructGPT和ChatGPT上取得了非常令人鼓舞的成果,提高了真实性,减少了有毒输出的生成,同时性能退步极小。
成本
:RLHF程序的代价是模型在某些下游任务中的性能略有降低,被称为 "对齐税"。
你可能感兴趣
从零开始构建大语言模型的关键要点
UTC NETWORK PTE LTD
2023-10-04
王昕-LLMOps,基于大语言模型构建智能应用的新模式
信息技术
2023 DOIS DevOps 国际峰会 · 北京站暨 BizDevOps 企业峰会
2023-10-08
人工智能系列二:基于大语言模型的多信源舆情指数构建与应用
国泰君安期货
2025-09-05
小型训练手册:构建世界级大语言模型的秘诀
信息技术
未知机构
2025-10-30
基于大语言模型(LLM)的系统安全:关键授权实践
信息技术
CSA GCR
2025-04-24
从零开始构建音乐社交生态
文化传媒
人人都是产品经理
2016-08-05
大语言模型专家电话会议核心要点
未知机构
2026-07-19
白皮书 : 构建新许可计划的关键考虑因素
信息技术
Brand Finance
2019-09-19
加速构建以数据为关键要素的数字经济,充分释放数据要素价值,发展新质生产力
信息技术
长城证券
2024-03-26
台积电:构建产业链关键节点:去全球化背景下的半导体产业链
国元国际
2023-09-15