核心观点
本研报探讨了利用强化学习(RL)提升大型语言模型(LLM)推理能力的方法,并提出了 DeepSeek-R1-Zero 和 DeepSeek-R1 两个模型,它们通过纯 RL 训练实现了无需人工标注的推理能力提升。
关键数据和研究结论
- DeepSeek-R1-Zero:该模型完全基于 RL 训练,无需人工标注的推理轨迹。在数学、编程竞赛和 STEM 领域等可验证任务上,其表现优于通过人工演示进行常规监督学习的模型。模型在训练过程中展现出自我反思、验证和动态策略适应等高级推理模式。
- DeepSeek-R1:为了解决 DeepSeek-R1-Zero 可读性差、语言混合等问题,研究者引入了 DeepSeek-R1,该模型通过多阶段学习框架,集成了拒绝采样、强化学习和监督微调,提升了模型在写作和开放域问答等领域的性能。
- 模型蒸馏:为了降低 LLM 的能耗,研究者对 DeepSeek-R1 进行了模型蒸馏,得到了多个参数量更小的模型,这些模型也展现出强大的推理能力,超越了其原始的指令微调版本。
- 实验结果:DeepSeek-R1 在 MMLU、MMLU-Redux、MMLU-Pro、C-Eval 和 CMMLU 等基准测试中取得了优异的成绩,特别是在数学、编程和 STEM 领域。在 ChatbotArena 评估中,DeepSeek-R1 与 OpenAI-o1 和 Gemini-Exp-1206 并列排名第一。
- 安全性:研究者对 DeepSeek-R1 进行了全面的安全性评估,结果表明该模型的安全性水平与其他最先进的模型相当,但在结合风险控制系统后,其安全性水平更高。
研究方法
- 强化学习框架:研究者采用组相对策略优化(GRPO)作为 RL 框架,并设计了基于规则的奖励机制来引导模型进行推理。
- 多阶段学习框架:DeepSeek-R1 的训练过程包括拒绝采样、强化学习和监督微调三个阶段,以提升模型在推理和一般语言生成任务上的能力。
- 模型蒸馏:研究者使用 DeepSeek-R1 生成的 800,000 个样本对 Qwen 和 LLaMA 等基础模型进行微调,得到了参数量更小的模型,这些模型也展现出强大的推理能力。
研究意义
本研报证明了 LLM 具有通过自进化提升推理能力的潜力,为未来开发更自主、更适应的模型提供了新的思路。同时,模型蒸馏技术的应用也为降低 LLM 的能耗、促进 AI 技术的普及具有重要意义。