8.2 DeepSeek-R1:用强化学习让推理涌现,GRPO 去掉 critic
1.R1 的冲击:推理能力可以被"练"出来
8.1 节我们拆了 DeepSeek 的架构。这一节讲它的另一半成就,也是 2025 年初震动整个 AI 圈的那件事——DeepSeek-R1 用纯强化学习,让模型的推理能力"涌现"了出来。
在 R1 之前,业界普遍认为高级推理(长链思考、自我反思、回溯验证)是要靠海量人类标注的思维链数据 SFT 出来的,OpenAI 的 o1 就是这种路线的代表,但 o1 的训练数据完全不公开。R1(arXiv:2501.12948)展示了一个让人意外的事实:在一个有可验证奖励的任务(数学、代码)上,对基础模型做大规模 RL,推理行为会自己冒出来——不需要人类手把手教怎么思考。这个发现直接点燃了 2025 年整个开源推理模型的方向。
2.R1-Zero:纯 RL 的"aha 时刻"
R1 的故事从 R1-Zero 开始。研究者拿了 DeepSeek-V3 这个基础模型,不经过任何 SFT,直接在数学和代码这类"答案可验证"的任务上做 RL。奖励很简单——答对给正奖励,答错给负奖励,再加一点格式奖励(让模型把思考过程包在 <think> 标签里)。
让人震惊的是,随着 RL 训练推进,模型自己学会了:
- 长链思考:训练初期回答只有几十 token,到后期动辄几千 token 的推理链。
- 自我反思:会出现"等等,我刚才那步好像错了,让我重新想"这样的回溯。
- "aha 时刻":研究者专门用了这个词——模型在某次训练中突然表现出"啊我明白了"式的顿悟,把之前走偏的思路自我纠正回来。
这些行为没有任何一个是人类示范教给它的,纯粹是 RL 在可验证奖励的引导下涌现出来的。这是 R1 最核心的发现:可验证奖励 + 大规模 RL,足以让推理涌现。
R1-Zero 有个明显的短板:它的输出格式乱、经常中英文混着说、可读性差。这就引出了正式的 R1。
3.GRPO:去掉 critic 的强化学习算法
R1 能跑起来,背后靠的是一个叫 **GRPO(Group Relative Policy Optimization,组相对策略优化)**的 RL 算法。这是 DeepSeek 对 PPO 的改造,也是 R1 能大规模训 RL 的关键。我们把它讲清楚。
回忆 5.5 节的 PPO(RLHF 那一节):它要维护两个网络——策略网络(生成)和价值网络/critic(估计每个状态的价值,用来算优势函数 advantage)。critic 是个累赘:它本身是个大模型,要单独训、单独存、单独前向,显存和算力翻倍。在推理 RL 这种超长输出(几千 token 的思维链)的场景下,critic 的开销更是难以承受。
GRPO 的核心创新是干掉 critic。它的做法是:对每个 prompt,采样一组(group) 个不同的回答,然后用这一组回答的组内统计来代替 critic 估计的基线:
这里 是第 个回答的奖励, 是它的优势。直觉是:不训练一个 critic 去猜"这个回答值多少分",而是直接用同一批兄弟回答的平均分当基线——比兄弟们好就是正优势,差就是负优势。这样省掉了整个 critic 网络,显存和算力大幅下降,才让超长思维链的大规模 RL 在工程上可行。
GRPO 仍然保留 PPO 的截断(clip)机制来限制策略更新步长,保证训练稳定。它是一种"组内相对比较"的算法,所以叫 Group Relative Policy Optimization。
4.完整 R1 的训练流水线
R1-Zero 证明了纯 RL 能涌现推理,但格式太乱。正式的 R1 用了一套更完整的流水线来兼顾能力和可用性:
- 冷启动 SFT:先用少量高质量的"长思维链"数据做一点 SFT,给模型一个干净的输出格式起点。
- 推理 RL:在数学/代码/科学这类可验证任务上做大规模 RL(用 GRPO),推理能力大幅提升(这一步最接近 R1-Zero,但有了冷启动格式更稳)。
- 拒绝采样 + SFT(通用能力):从推理 RL 后的模型采样大量高质量回答(拒绝差的),再混入通用对话、写作、翻译数据,做一轮 SFT,让模型不只擅长推理,也擅长日常任务。
- 全场景 RL(RLHF):最后再用人类偏好奖励做一轮全场景 RLHF,对齐人类喜好、保证安全可用。
这套流水线产出的 R1,既有 R1-Zero 涌现出的强推理,又有干净的输出格式和良好的通用能力,还开源了权重——这就是它在 2025 年初引爆社区的原因。
5.蒸馏:把推理能力传给小模型
R1 还做了一件影响深远的事——把 R1 的推理能力蒸馏到稠密小模型。研究者用 R1 生成了大量带思维链的训练数据,拿去 SFT 训练 Qwen(1.5B–32B)和 Llama(8B–70B)这些小模型。结果这些蒸馏小模型在推理基准上超过了那些小模型自己大规模 RL 的效果。
这是个很重要的结论:大模型的推理能力,可以通过蒸馏高效地传给小模型,而且比小模型自己从头练 RL 还好。这让大家能用一个 R1 老师批量造出一堆推理小模型,部署成本低得多。
6.R1 的现状(2026 年中)
到 2026 年 7 月,R1 仍然是 DeepSeek 推理线的最新版本(2026 年初做过一次修订)。坊间传说的 R2 还没有发布。R1 的能力路线——可验证奖励 RL + 蒸馏——已经被整个开源社区广泛采用,Kimi K1.5、Qwen 的思考模式、GLM 的 RL 都借鉴了它。R1 的成果也发表在了 Nature(645:633–638, 2025)上,是少有的既开源又登上顶刊的工作。
7.练习
Q1. R1-Zero 最核心的发现是什么?为什么让人意外?
在数学/代码等可验证奖励任务上对基础模型做纯 RL(不经 SFT),长链思考、自我反思、"aha 时刻"等推理行为会自己涌现。意外在于:业界原以为这些行为必须靠人类思维链数据 SFT 教出来,R1-Zero 证明可验证奖励 + RL 就够了。
Q2. GRPO 相比 PPO 省掉了什么?它是怎么替代这个组件的?
省掉了 critic/价值网络。GRPO 对每个 prompt 采样一组 个回答,用组内奖励的均值和标准差归一化得到优势 ,用组内相对比较代替 critic 估计的基线,省掉整个 critic 网络的显存和算力。
Q3. 正式 R1 为什么要在纯 RL 之外加"冷启动 SFT"和最后的"全场景 RLHF"?
R1-Zero 推理强但格式乱、中英混杂、可读性差。冷启动 SFT 给一个干净的输出格式起点;最后的全场景 RLHF 让模型对齐人类偏好、兼顾日常任务和安全,不只擅长推理。
Q4.(面试题) R1 的蒸馏实验得出了什么重要结论?为什么这对落地有意义?
用 R1 生成的思维链数据蒸馏到 Qwen/Llama 小模型,效果超过小模型自己大规模 RL。结论是:大模型推理能力可高效蒸馏给小模型,且比小模型自训更优。落地意义是能用一个 R1 老师批量造出低成本推理小模型,部署门槛大降。
8.小结
R1 的核心贡献是两件事:证明了可验证奖励 RL 能让推理涌现(R1-Zero),提供了去掉 critic 的大规模 RL 算法 GRPO。它和 8.1 的架构创新合在一起,让 DeepSeek 成了 2024–2026 年最具影响力的开源大模型系列。下一篇我们去看另一位国产主力——Kimi,以及它在长上下文和 RL 上的独特路线。
下一章见。