DeepSeek-R1技术解析
deepseek-ai/DeepSeek-R1 (github.com)
[DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning] (arxiv.org)
摘要
We introduce our first-generation reasoning models, DeepSeek-R1-Zero and DeepSeek-R1. DeepSeek-R1-Zero, a model trained via large-scale reinforcement learning (RL) without supervised fine-tuning (SFT) as a preliminary step, demonstrated remarkable performance on reasoning. With RL, DeepSeek-R1-Zero naturally emerged with numerous powerful and interesting reasoning behaviors. However, DeepSeek-R1-Zero encounters challenges such as endless repetition, poor readability, and language mixing. To address these issues and further enhance reasoning performance, we introduce DeepSeek-R1, which incorporates cold-start data before RL. DeepSeek-R1 achieves performance comparable to OpenAI-o1 across math, code, and reasoning tasks. To support the research community, we have open-sourced DeepSeek-R1-Zero, DeepSeek-R1, and six dense models distilled from DeepSeek-R1 based on Llama and Qwen. DeepSeek-R1-Distill-Qwen-32B outperforms OpenAI-o1-mini across various benchmarks, achieving new state-of-the-art results for dense models.
模型架构&训练策略
DeepSeek R1-Zero:强化学习的深度探索
DeepSeek R1-Zero的训练过程可谓独树一帜。团队采用GRPO算法,这一算法舍弃了与策略模型大小相同的评论家模型,通过群组分数来估计基线,大大节省了训练成本。
在奖励建模方面,团队采用了基于规则的奖励系统,主要包含准确性奖励和格式奖励。准确性奖励用于评估模型的回答是否正确,比如在数学问题中,模型需按指定格式给出最终答案,以便进行正确性验证;格式奖励则要求模型将思考过程放在“”和“”标签之间。这种奖励机制简单直接,有效避免了神经奖励模型可能出现的奖励作弊问题,同时也降低了训练的复杂性。
为了引导模型的训练,团队设计了一个简洁的模板。该模板要求模型先进行推理,再给出最终答案,并且尽量避免对内容进行特定限制,以便观察模型在RL过程中的自然发展。
在训练过程中,DeepSeek R1-Zero展现出了令人惊叹的自我进化能力。随着训练步数的增加,它在AIME 2024测试中的准确率稳步提升。不仅如此,模型还学会了自我反思和探索多种解题方法。在遇到复杂问题时,它会重新评估之前的步骤,尝试不同的解题思路,这种“顿悟时刻”充分体现了强化学习的魅力,让模型能够自主发展出先进的解题策略。
DeepSeek R1:融入冷启动数据的优化升级
DeepSeek R1的训练流程分为四个阶段,旨在解决DeepSeek R1-Zero存在的问题,并进一步提升模型性能。
在冷启动阶段,团队构建并收集了少量高质量的长思维链(CoT)数据,对DeepSeek-V3-Base模型进行微调,以此作为RL训练的初始演员。这些冷启动数据经过精心设计,具有良好的可读性,能够有效避免模型在训练初期出现不稳定的情况。
在推理导向的强化学习阶段,团队采用了与DeepSeek R1-Zero相同的大规模RL训练过程,但在此基础上引入了语言一致性奖励,以缓解思维链中出现的语言混合问题。虽然这一奖励机制会导致模型性能略有下降,但却使模型的输出更符合人类的阅读习惯。
当推理导向的RL训练接近收敛时,团队利用拒绝采样和监督微调(SFT)来收集更多数据。他们不仅从推理任务中收集数据,还纳入了写作、角色扮演等其他领域的数据,以增强模型的通用能力。在这个过程中,团队对数据进行了严格筛选,过滤掉了语言混合、冗长段落和代码块等难以阅读的内容。
为了使模型更好地符合人类偏好,团队还进行了全场景的强化学习。在这个阶段,他们综合运用多种奖励信号和多样化的提示分布,对模型进行进一步训练。对于推理数据,仍然采用基于规则的奖励;对于通用数据,则借助奖励模型来捕捉人类偏好。通过这种方式,模型在保证推理能力的同时,更加注重对用户的帮助和无害性。
模型蒸馏:赋予小模型强大推理能力
为了让更高效的小模型也具备强大的推理能力,研究团队从DeepSeek R1向小模型进行知识蒸馏。他们直接使用DeepSeek R1生成的800k样本对Qwen和Llama等开源模型进行微调。实验结果令人惊喜,经过蒸馏的小模型在推理能力上有了显著提升。例如,DeepSeek-R1-Distill-Qwen-7B在AIME 2024测试中取得了55.5%的成绩,超越了QwQ-32B-Preview;DeepSeek-R1-Distill-Qwen-32B在多个测试中表现优异,其成绩与o1-mini相当。这一成果表明,将大模型的推理模式蒸馏到小模型中是一种非常有效的方法,能够让小模型在保持高效性的同时,获得强大的推理能力。
重要贡献
• DeepSeek-R1-Zero :不用SFT直接进行RL,也能取得不错的效果。
• DeepSeek-R1 :加入少量(数千量级)CoT数据进行SFT作为冷启动,然后再进行RL,可以取得更优的性能。同时回答更符合人类偏好。
• 用DeepSeek-R1的样例去蒸馏小模型,能取得惊人的效果。
参考资料
DeepSeek-R1论文速读 - 知乎 (zhuanlan.zhihu.com)
DeepSeek-R1技术报告速读 (mp.weixin.qq.com)
一文读懂 DeepSeek R1:强化学习如何重塑大语言模型推理能力? • Tech Explorer 🚀 (stable-learn.com)
更多推荐


所有评论(0)