LLM训练包含AI数据工程、预训练、中训练、后训练四大核心环节。后训练涵盖监督微调(SFT)、偏好学习与强化学习(RL),其中强化学习包括PPO、GRPO等算法。预训练通过next token prediction损失函数更新参数形成基座模型,中训练采用自监督语言建模调整数据配比与学习率,如清华团队的decay阶段策略。监督微调依赖高质量指令数据但存在数据质量瓶颈与灾难性遗忘问题,偏好学习先训练奖励模型再通过PPO等算法引导优化。GRPO作为PPO的改进算法无需单独训练价值模型,通过组内答案相对奖励评估降低强化学习成本,适配大规模推理模型训练。
LLM与传统单任务机器学习的核心区别在于采用预训练加后训练的两阶段框架。LLM具备通用能力与跨任务泛化潜力,而传统机器学习通常针对单一任务设计。模型能力增长遵循Scaling Law,依赖参数量、数据量、算力三个维度协同扩大,当前行业已拓展至数据环境、推理计算等方向。预训练阶段通过next token prediction损失函数计算预测误差并反向传播更新参数,形成基座模型。中训练是预训练到后训练的中间优化阶段,采用自监督语言建模调整数据配比与学习率。后训练包括监督微调(SFT)和偏好学习,其中SFT依赖高质量指令数据但存在数据质量瓶颈与灾难性遗忘问题,偏好学习先训练奖励模型再通过PPO等算法引导优化。
LLM能力演进呈现两大新方向:知识蒸馏和递归式自我改进(RSI)。知识蒸馏通过让小参数学生模型学习大参数教师模型的输出概率分布,在低部署成本下逼近大模型能力,近年衍生出OPD在线策略蒸馏技术。递归式自我改进(RSI)是AI自主参与模型研发全流程,目前已进入实践阶段,如智谱拟推出全自主训练模型,Anthropic、OpenAI等海外厂商也在推进相关布局。知识蒸馏技术通过学习教师模型的输出分布,使小模型在保持较低部署成本的同时获得接近大模型的能力表现,OPD在线策略蒸馏技术进一步提升了蒸馏效率。RSI通过AI自主参与研发全流程,包括修正错误、调整数据策略等,有望带来研发效率的复利效应。
当前LLM市场呈现以下现状:1)模型训练依赖参数量、数据量、算力三维度协同扩大,但单纯扩大规模面临公开高质量数据减少、成本快速提升的瓶颈,Scaling Law的边际收益可能下降。2)预训练通过next token prediction损失函数计算预测误差并反向传播更新参数形成基座模型,中训练采用自监督语言建模调整数据配比与学习率。3)后训练包括监督微调(SFT)和偏好学习,SFT依赖高质量指令数据但存在数据质量瓶颈与灾难性遗忘问题,偏好学习先训练奖励模型再通过PPO等算法引导优化。4)强化学习包括PPO、GRPO等算法,GRPO作为PPO的改进算法无需单独训练价值模型,通过组内答案相对奖励评估降低强化学习成本。5)知识蒸馏技术通过学习教师模型的输出分布,使小模型在保持较低部署成本的同时获得接近大模型的能力表现。
LLM发展面临以下风险:1)单纯扩大模型规模面临公开高质量数据减少、成本快速提升的瓶颈,Scaling Law的边际收益可能下降。2)全自主训练的核心挑战是模型需自主判断与控制训练全流程,如修正错误、调整数据策略等,目前技术尚不成熟。3)递归式自我改进(RSI)将带来研发效率复利,可能扩大头部模型厂商与其他参与者的差距,加剧市场集中度。4)监督微调(SFT)依赖高质量指令数据但存在数据质量瓶颈与灾难性遗忘问题,偏好学习先训练奖励模型再通过PPO等算法引导优化,但奖励模型训练本身也存在挑战。5)强化学习包括PPO、GRPO等算法,虽然GRPO降低了强化学习成本,但算法优化仍需持续研究。知识蒸馏技术通过学习教师模型的输出分布,使小模型在保持较低部署成本的同时获得接近大模型的能力表现,但蒸馏效果受限于教师模型质量。