本文档整理了关于“大语言模型中的强化学习”的核心概念与知识框架,适合从零开始学习的小白,也适合复习回顾。内容涵盖:为什么需要RL、RL如何应用于文本生成、两种主流范式(RLHF与RLVR)、核心算法(PPO/DPO/GRPO)以及后续学习路线图。
一、引言:为什么大语言模型需要强化学习?
1.1 传统方法的局限:SFT的“天花板”
在强化学习出现之前,训练大语言模型的主要方法是监督微调(Supervised Fine-Tuning,SFT)。
SFT是怎么做的?
简单说,就是给模型看一大堆“问题-标准答案”对,让模型模仿着写。比如给模型看“请写一首关于春天的诗”+“春风又绿江南岸…”,模型就学着写类似的诗。
SFT的问题在哪里?
SFT的本质是模仿学习——模型最多只能学到训练数据里有的东西,永远超不过“老师”(人类标注员)的水平。就像一个学生只会抄标准答案,考试时遇到没见过的题目就傻眼了。
用一个比喻来理解:
SFT阶段,模型像一个抄写员——人类怎么写,它就怎么学。抄写员写得再好,最多和老师一样好,永远超不过老师。
1.2 RL如何打破这个天花板?
强化学习(Reinforcement Learning,RL)彻底改变了这个模式。
RL是怎么做的?
模型不再只是“抄答案”,而是自己写答案,然后系统给它打分。为了拿高分,模型会自己琢磨出新招数、新推理步骤——这些新招数是人类没教过它的。
用一个比喻来理解:
RL阶段,模型像一个做题家——自己写答案,裁判打分。为了拿高分,它会自己研究解题技巧,甚至发明人类没想到的方法。
结果就是:RL-trained模型可以突破训练数据的质量上限,产生比人类标注员更优的输出。
1.3 现实中的例子
所有前沿模型都在用RL:GPT-4、Claude、Llama-3、DeepSeek-R1——它们都在SFT之后应用了RL,这是将“有能力但不可控”的模型转变为“对齐的助手”的关键一步。
二、两种主流RL范式
强化学习方法分为两大流派,目的不同,但底层原理相通。
范式一:对齐人类偏好(RLHF / DPO)
目的:让模型听话、安全、有道德——比如不教你造炸弹、不输出有害内容。
怎么打分?靠人类偏好。让人类投票“A回答比B好”,然后训练一个“裁判模型”来打分。
代表方法:
- RLHF(基于人类反馈的强化学习):训练奖励模型→用PPO优化
- DPO(直接偏好优化):跳过奖励模型,直接把偏好转化为损失函数
结果:产生“温顺的好助理”。
范式二:增强推理能力(RLVR)
目的:让模型变聪明——主要针对数学、代码、逻辑推理。
怎么打分?靠客观事实/规则(Verifiable Rewards)。比如:
- 数学题答案对不对?(答案是“32”就是“32”)
- 代码能不能跑通?(能跑就是能跑)
- 不需要人类感觉,不需要主观判断
代表方法:
- RLVR(基于可验证奖励的强化学习)
- DeepSeek-R1就是用这种方法
结果:模型自己进化出复杂的“思维链”(长推理能力),数学推理能力大幅提升。
一个震撼的例子:GPT-4o做AIME数学竞赛题原本只有12%正确率,加了RLVR后飙到93.4%。
两种范式的对比
| RLHF/DPO | RLVR | |
|---|---|---|
| 目标 | 让模型听话、安全 | 让模型变聪明、会推理 |
| 奖励来源 | 人类偏好(主观) | 客观验证(对/错) |
| 典型应用 | 聊天助手、内容审核 | 数学推理、代码生成 |
| 代表模型 | GPT-4、Claude | DeepSeek-R1 |
三、核心洞察:文本生成 = 马尔可夫决策过程(MDP)
要让RL算法能处理文字,科学家把“写作文”重新定义成了一个闯关游戏——这就是马尔可夫决策过程(Markov Decision Process,MDP)。
3.1 用游戏来理解
把大模型写答案想象成一个游戏:
| 游戏概念 | 在LLM中的对应 | 通俗解释 |
|---|---|---|
| 智能体(Agent) | 大模型本身 | 玩游戏的“玩家” |
| 状态(State) | 已经写出来的所有文字(题目+已写内容) | 游戏进行到当前的“局面” |
| 动作(Action) | 从词表里选下一个词(32K~128K个选项) | 玩家下一步“操作” |
| 状态转移(Transition) | 把选中的词贴在后面 | 完全确定,没有随机性(不像下棋,对手会变招) |
| 奖励(Reward) | 只有整篇写完才给分 | 游戏通关后才算总分 |
| 策略(Policy) | 模型内部的Softmax输出 | 玩家在不同局面下的“操作策略” |
3.2 最关键的洞察
大模型天生的“Softmax输出层”本身就是一个现成的策略网络。
什么意思?就是说:
- 传统RL需要单独搭建一个“策略网络”来决定怎么行动
- 但大语言模型本身就是一个策略网络——它在每个位置都会给所有词打分(概率分布)
- 所以我们不需要重新搭建策略网络,只需要直接调整模型内部的权重,让它倾向于把高概率分配给那些能拿高分的“选词顺序”即可
3.3 形式化定义
数学上,文本生成的MDP可以这样定义:
- 状态st=(x,y1,…,yt−1)s_t = (x, y_1, \dots, y_{t-1})st=(x,y1,…,yt−1):提示词 + 已生成的所有token
- 动作at∈{1,…,∣V∣}a_t \in \{1, \dots, |\mathcal{V}|\}at∈{1,…,∣V∣}:从词表中选择下一个token
- 转移P(st+1∣st,at)P(s_{t+1} | s_t, a_t)P(st+1∣st,at):确定性的——直接把选中的token拼上去
- 奖励rrr:通常在生成结束时才给出(稀疏奖励)
- 策略πθ(at∣st)\pi_\theta(a_t | s_t)πθ(at∣st):LLM的next-token概率分布
- 折扣因子γ=1.0\gamma = 1.0γ=1.0:因为每个episode只有一次回复,不需要折扣
四、RLHF的完整流程
经典的RLHF流程包含四个阶段:
阶段1:监督微调(SFT)
- 做什么:在高质量的人类标注数据上训练基座模型
- 产出:一个能听懂指令、能正常对话的模型πSFT\pi_{\text{SFT}}πSFT
- 类比:让模型先学会“像人一样说话”
阶段2:训练奖励模型(Reward Model)
- 做什么:收集大量人类偏好对比数据(对于同一个问题,回答A比回答B好),用 Bradley-Terry 目标训练一个奖励模型Rϕ(x,y)R_\phi(x, y)Rϕ(x,y)
- 产出:一个能对任意回答打分的“裁判模型”
- 类比:找一个“评分老师”,能判断哪个回答更好
阶段3:强化学习优化
- 做什么:用奖励模型作为信号,通过 PPO 或 GRPO 优化策略,同时加一个 KL 约束防止模型跑偏
- 类比:模型疯狂写作文,裁判打分,不断调整写作策略
- KL约束是什么:相当于一个“刹车皮”——防止模型为了拿高分不择手段(比如编造歪理邪说),强制它不能偏离原始模型太远
阶段4:评估与迭代
- 做什么:评估对齐后的模型,收集新的失败案例,再来一轮
- 类比:月考→改错→再月考
五、LLM中的RL vs 经典RL:有什么不同?
LLM里的强化学习跟传统游戏AI(比如AlphaGo下围棋)有4个关键区别:
区别1:环境没有随机性(确定性转移)
- 经典RL:环境可能有随机性(比如骰子、对手的随机策略)
- LLM RL:选“好”字,下个状态就是“加上好字”,完全确定
区别2:奖励极其稀疏(Sparse Reward)
- 经典RL:每一步都可能拿到奖励(比如游戏里每吃一个金币都有分)
- LLM RL:写几百个字,中间没人打分,只有最后一句“对了/错了”
区别3:动作空间巨大(Massive Action Space)
- 经典RL:动作空间通常很小(比如上下左右四个方向)
- LLM RL:每一步要在几万个词里选一个(32K~128K个选项)
区别4:带着“脚镣”跳舞(KL约束)
- 经典RL:追求最大化奖励,可以随便探索
- LLM RL:必须紧贴SFT时的原始模型,防止为了拿高分而胡言乱语(代价是探索能力变弱)
区别5:有时不需要“价值网络”
- 经典RL(PPO):需要一个“评论家”(Critic)网络来估算胜率
- GRPO:直接把这部分省了,用组内相对排名代替
六、核心算法一览
6.1 PPO(近端策略优化)——GPT-4和Claude背后的主力
全称:Proximal Policy Optimization
通俗理解:
PPO的本质是一种“保守的强化学习算法”。核心思路是“在安全范围内调整模型的输出策略”,避免策略突变导致模型失效。
用一个比喻来理解:
PPO像一所拥有“三堂会审”制度的精英学院——有演员(Actor,即模型本身)、评论家(Critic,评估表现)、裁判(Reward Model,打分)。三者配合,精准但昂贵。
组成:
- Actor(演员):当前正在训练的模型,负责生成回答
- Critic(评论家):一个价值网络,负责估算“这个回答能得多少分”
- Reward Model(裁判):从人类偏好训练出来的打分模型
优点:稳定、精准、效果好
缺点:需要同时跑4个模型(Actor、Reference、Critic、Reward Model),显存占用极大,训练复杂
适用场景:追求极致效果、不差钱不差算力的场景(如GPT-4、Claude)
6.2 DPO(直接偏好优化)——绕过RL的捷径
全称:Direct Preference Optimization
通俗理解:
DPO从理论上彻底消除了奖励模型(RM)和强化学习环节,直接把“人类喜欢A不喜欢B”这个偏好转化为一个对比学习的损失函数,用监督学习的方式训练模型。
用一个比喻来理解:
DPO像一本高质量的“改错本”——直接记录“好回答 vs 差回答”的对比,模型从中学习,不需要额外的裁判和复杂的RL流程。
优点:
- 不需要训练奖励模型
- 不需要在线采样
- 计算量小、稳定、高效
缺点:
- 对数据质量要求极高
- 灵活性不如在线RL(因为不能实时探索新策略)
适用场景:数据质量高、算力有限、快速验证的场景
6.3 GRPO(组相对策略优化)——DeepSeek-R1的成名绝技
全称:Group Relative Policy Optimization
通俗理解:
GRPO是DeepSeek团队的创新算法。它完全去掉了Critic(评论家)网络,改用“组内相对比较”的方式来评估表现。
用一个比喻来理解:
GRPO像一种“小组竞赛制”——让模型对同一个问题生成多個回答,放在一组里互相比较,排名高的得高分,排名低的得低分。不需要额外的“评论家”来评分。
具体怎么做的:
- 对同一个问题,让模型生成一组回答(比如8个)
- 用奖励函数给每个回答打分
- 在组内做归一化(减去均值,除以标准差)
- 用归一化后的相对优势来更新模型
优点:
- 不需要训练价值网络(Critic),省显存、省计算
- 训练更稳定
- 特别适合推理任务(数学、代码)
缺点:
- 组内比较的有效性取决于组内样本的质量分布
适用场景:推理模型训练的首选,DeepSeek-Math和DeepSeek-R1都是用它
三个算法的对比总结
| PPO | DPO | GRPO | |
|---|---|---|---|
| 需要奖励模型? | ✅ 需要 | ❌ 不需要 | ✅ 需要(但可简化) |
| 需要Critic网络? | ✅ 需要 | ❌ 不需要 | ❌ 不需要 |
| 训练复杂度 | 最高 | 最低 | 中等 |
| 显存占用 | 最高 | 最低 | 中等 |
| 效果上限 | 最高 | 中等 | 高 |
| 代表模型 | GPT-4、Claude | 各种开源模型 | DeepSeek-R1 |
七、后续学习路线图(各章 preview)
第5章:PPO —— 近端策略优化
- 讲什么:裁剪目标函数、GAE(广义优势估计)、Critic网络、完整的RLHF训练循环
- 为什么学:PPO是GPT-4和Claude背后的主力算法,是理解前沿模型训练的基础
- 理论怎么做:通过“裁剪”机制限制每次更新的幅度,防止策略突变;用GAE平衡偏差与方差来估计“优势”
- 解决什么问题:传统策略梯度算法更新步长难控制,步长太小学得慢,步太大容易崩
第6章:DPO —— 直接偏好优化
- 讲什么:如何把偏好直接转化为对比监督损失,完全绕过RL
- 为什么学:比PPO简单得多,适合快速上手和资源受限场景
- 理论怎么做:从Bradley-Terry偏好模型出发,推导出可直接优化的损失函数
- 解决什么问题:RLHF流程太复杂(4个模型、在线采样),DPO让偏好对齐变得像SFT一样简单
第7章:GRPO —— 组相对策略优化
- 讲什么:DeepSeek的无Critic算法,组级奖励归一化
- 为什么学:DeepSeek-R1背后的方法,目前训练推理模型的首选
- 理论怎么做:对同一问题采样一组回答,组内归一化奖励,用相对优势更新策略
- 解决什么问题:PPO的Critic网络耗显存、难训练,GRPO直接砍掉它
第8章:偏好优化变体
- 讲什么:在线DPO、KTO、Best-of-N采样,以及如何选择方法
- 为什么学:实际项目中需要根据场景选算法,没有万能方案
- 理论怎么做:每种方法有不同的“探索-利用”权衡和数据效率
- 解决什么问题:不同任务、不同数据量、不同算力下,该用哪种方法?
第9章:奖励建模
- 讲什么:Bradley-Terry模型、过程奖励vs结果奖励、RLVR的规则奖励、多目标组合
- 为什么学:奖励函数的设计直接决定了RL的效果上限
- 理论怎么做:如何从人类偏好数据学习奖励函数;如何设计可验证的规则奖励
- 解决什么问题:奖励信号是RL的“指挥棒”,设计不好模型会“奖励黑客”(钻空子)
第10章:SFT最佳实践
- 讲什么:序列打包、对话模板、数据混合
- 为什么学:SFT的质量直接决定了RL的天花板
- 理论怎么做:数据预处理、格式标准化、采样策略
- 解决什么问题:RL之前的基础打不好,RL也救不回来
第11章:系统工程
- 讲什么:分布式训练、并行策略、生成-训练解耦、数百张GPU的基础设施
- 为什么学:真正的LLM训练不是单卡能搞定的
- 理论怎么做:模型并行、数据并行、流水线并行;如何让生成和训练异步进行
- 解决什么问题:算法再好,工程跑不起来也是白搭
八、总结:一句话串起来
SFT教会模型“像人一样说话” →RLHF/DPO教会模型“不说坏话” →RLVR(如DeepSeek-R1)教会模型“解出难题”。
虽然“不说坏话”和“解出难题”看着不像一回事,但它们底层都是用“奖励 + 梯度更新”这一套数学公式来驱动模型进化的。
所有的前沿模型——GPT-4、Claude、Llama-3、DeepSeek-R1——都在SFT之后应用了RL,这是将“有能力但不可控”的模型转变为“真正可用”的助手的关键一步。