笔记十二:大语言模型强化学习(RL for LLMs)笔记
2026/7/23 16:48:46 网站建设 项目流程

本文档整理了关于“大语言模型中的强化学习”的核心概念与知识框架,适合从零开始学习的小白,也适合复习回顾。内容涵盖:为什么需要RL、RL如何应用于文本生成、两种主流范式(RLHF与RLVR)、核心算法(PPO/DPO/GRPO)以及后续学习路线图。

一、引言:为什么大语言模型需要强化学习?

1.1 传统方法的局限:SFT的“天花板”

在强化学习出现之前,训练大语言模型的主要方法是监督微调(Supervised Fine-Tuning,SFT)

SFT是怎么做的?
简单说,就是给模型看一大堆“问题-标准答案”对,让模型模仿着写。比如给模型看“请写一首关于春天的诗”+“春风又绿江南岸…”,模型就学着写类似的诗。

SFT的问题在哪里?
SFT的本质是模仿学习——模型最多只能学到训练数据里有的东西,永远超不过“老师”(人类标注员)的水平。就像一个学生只会抄标准答案,考试时遇到没见过的题目就傻眼了。

用一个比喻来理解:

SFT阶段,模型像一个抄写员——人类怎么写,它就怎么学。抄写员写得再好,最多和老师一样好,永远超不过老师。

1.2 RL如何打破这个天花板?

强化学习(Reinforcement Learning,RL)彻底改变了这个模式。

RL是怎么做的?
模型不再只是“抄答案”,而是自己写答案,然后系统给它打分。为了拿高分,模型会自己琢磨出新招数、新推理步骤——这些新招数是人类没教过它的。

用一个比喻来理解:

RL阶段,模型像一个做题家——自己写答案,裁判打分。为了拿高分,它会自己研究解题技巧,甚至发明人类没想到的方法。

结果就是:RL-trained模型可以突破训练数据的质量上限,产生比人类标注员更优的输出。

1.3 现实中的例子

所有前沿模型都在用RL:GPT-4、Claude、Llama-3、DeepSeek-R1——它们都在SFT之后应用了RL,这是将“有能力但不可控”的模型转变为“对齐的助手”的关键一步。

二、两种主流RL范式

强化学习方法分为两大流派,目的不同,但底层原理相通。

范式一:对齐人类偏好(RLHF / DPO)

目的:让模型听话、安全、有道德——比如不教你造炸弹、不输出有害内容。

怎么打分?人类偏好。让人类投票“A回答比B好”,然后训练一个“裁判模型”来打分。

代表方法

  • RLHF(基于人类反馈的强化学习):训练奖励模型→用PPO优化
  • DPO(直接偏好优化):跳过奖励模型,直接把偏好转化为损失函数

结果:产生“温顺的好助理”。

范式二:增强推理能力(RLVR)

目的:让模型变聪明——主要针对数学、代码、逻辑推理。

怎么打分?客观事实/规则(Verifiable Rewards)。比如:

  • 数学题答案对不对?(答案是“32”就是“32”)
  • 代码能不能跑通?(能跑就是能跑)
  • 不需要人类感觉,不需要主观判断

代表方法

  • RLVR(基于可验证奖励的强化学习)
  • DeepSeek-R1就是用这种方法

结果:模型自己进化出复杂的“思维链”(长推理能力),数学推理能力大幅提升。

一个震撼的例子:GPT-4o做AIME数学竞赛题原本只有12%正确率,加了RLVR后飙到93.4%。

两种范式的对比

RLHF/DPORLVR
目标让模型听话、安全让模型变聪明、会推理
奖励来源人类偏好(主观)客观验证(对/错)
典型应用聊天助手、内容审核数学推理、代码生成
代表模型GPT-4、ClaudeDeepSeek-R1

三、核心洞察:文本生成 = 马尔可夫决策过程(MDP)

要让RL算法能处理文字,科学家把“写作文”重新定义成了一个闯关游戏——这就是马尔可夫决策过程(Markov Decision Process,MDP)

3.1 用游戏来理解

把大模型写答案想象成一个游戏:

游戏概念在LLM中的对应通俗解释
智能体(Agent)大模型本身玩游戏的“玩家”
状态(State)已经写出来的所有文字(题目+已写内容)游戏进行到当前的“局面”
动作(Action)从词表里选下一个词(32K~128K个选项)玩家下一步“操作”
状态转移(Transition)把选中的词贴在后面完全确定,没有随机性(不像下棋,对手会变招)
奖励(Reward)只有整篇写完才给分游戏通关后才算总分
策略(Policy)模型内部的Softmax输出玩家在不同局面下的“操作策略”

3.2 最关键的洞察

大模型天生的“Softmax输出层”本身就是一个现成的策略网络

什么意思?就是说:

  • 传统RL需要单独搭建一个“策略网络”来决定怎么行动
  • 但大语言模型本身就是一个策略网络——它在每个位置都会给所有词打分(概率分布)
  • 所以我们不需要重新搭建策略网络,只需要直接调整模型内部的权重,让它倾向于把高概率分配给那些能拿高分的“选词顺序”即可

3.3 形式化定义

数学上,文本生成的MDP可以这样定义:

  • 状态st=(x,y1,…,yt−1)s_t = (x, y_1, \dots, y_{t-1})st=(x,y1,,yt1):提示词 + 已生成的所有token
  • 动作at∈{1,…,∣V∣}a_t \in \{1, \dots, |\mathcal{V}|\}at{1,,V}:从词表中选择下一个token
  • 转移P(st+1∣st,at)P(s_{t+1} | s_t, a_t)P(st+1st,at):确定性的——直接把选中的token拼上去
  • 奖励rrr:通常在生成结束时才给出(稀疏奖励)
  • 策略πθ(at∣st)\pi_\theta(a_t | s_t)πθ(atst):LLM的next-token概率分布
  • 折扣因子γ=1.0\gamma = 1.0γ=1.0:因为每个episode只有一次回复,不需要折扣

四、RLHF的完整流程

经典的RLHF流程包含四个阶段:

阶段1:监督微调(SFT)

  • 做什么:在高质量的人类标注数据上训练基座模型
  • 产出:一个能听懂指令、能正常对话的模型πSFT\pi_{\text{SFT}}πSFT
  • 类比:让模型先学会“像人一样说话”

阶段2:训练奖励模型(Reward Model)

  • 做什么:收集大量人类偏好对比数据(对于同一个问题,回答A比回答B好),用 Bradley-Terry 目标训练一个奖励模型Rϕ(x,y)R_\phi(x, y)Rϕ(x,y)
  • 产出:一个能对任意回答打分的“裁判模型”
  • 类比:找一个“评分老师”,能判断哪个回答更好

阶段3:强化学习优化

  • 做什么:用奖励模型作为信号,通过 PPO 或 GRPO 优化策略,同时加一个 KL 约束防止模型跑偏
  • 类比:模型疯狂写作文,裁判打分,不断调整写作策略
  • KL约束是什么:相当于一个“刹车皮”——防止模型为了拿高分不择手段(比如编造歪理邪说),强制它不能偏离原始模型太远

阶段4:评估与迭代

  • 做什么:评估对齐后的模型,收集新的失败案例,再来一轮
  • 类比:月考→改错→再月考

五、LLM中的RL vs 经典RL:有什么不同?

LLM里的强化学习跟传统游戏AI(比如AlphaGo下围棋)有4个关键区别

区别1:环境没有随机性(确定性转移)

  • 经典RL:环境可能有随机性(比如骰子、对手的随机策略)
  • LLM RL:选“好”字,下个状态就是“加上好字”,完全确定

区别2:奖励极其稀疏(Sparse Reward)

  • 经典RL:每一步都可能拿到奖励(比如游戏里每吃一个金币都有分)
  • LLM RL:写几百个字,中间没人打分,只有最后一句“对了/错了”

区别3:动作空间巨大(Massive Action Space)

  • 经典RL:动作空间通常很小(比如上下左右四个方向)
  • LLM RL:每一步要在几万个词里选一个(32K~128K个选项)

区别4:带着“脚镣”跳舞(KL约束)

  • 经典RL:追求最大化奖励,可以随便探索
  • LLM RL:必须紧贴SFT时的原始模型,防止为了拿高分而胡言乱语(代价是探索能力变弱)

区别5:有时不需要“价值网络”

  • 经典RL(PPO):需要一个“评论家”(Critic)网络来估算胜率
  • GRPO:直接把这部分省了,用组内相对排名代替

六、核心算法一览

6.1 PPO(近端策略优化)——GPT-4和Claude背后的主力

全称:Proximal Policy Optimization

通俗理解
PPO的本质是一种“保守的强化学习算法”。核心思路是“在安全范围内调整模型的输出策略”,避免策略突变导致模型失效。

用一个比喻来理解

PPO像一所拥有“三堂会审”制度的精英学院——有演员(Actor,即模型本身)、评论家(Critic,评估表现)、裁判(Reward Model,打分)。三者配合,精准但昂贵。

组成

  1. Actor(演员):当前正在训练的模型,负责生成回答
  2. Critic(评论家):一个价值网络,负责估算“这个回答能得多少分”
  3. Reward Model(裁判):从人类偏好训练出来的打分模型

优点:稳定、精准、效果好
缺点:需要同时跑4个模型(Actor、Reference、Critic、Reward Model),显存占用极大,训练复杂

适用场景:追求极致效果、不差钱不差算力的场景(如GPT-4、Claude)

6.2 DPO(直接偏好优化)——绕过RL的捷径

全称:Direct Preference Optimization

通俗理解
DPO从理论上彻底消除了奖励模型(RM)和强化学习环节,直接把“人类喜欢A不喜欢B”这个偏好转化为一个对比学习的损失函数,用监督学习的方式训练模型。

用一个比喻来理解

DPO像一本高质量的“改错本”——直接记录“好回答 vs 差回答”的对比,模型从中学习,不需要额外的裁判和复杂的RL流程。

优点

  • 不需要训练奖励模型
  • 不需要在线采样
  • 计算量小、稳定、高效

缺点

  • 对数据质量要求极高
  • 灵活性不如在线RL(因为不能实时探索新策略)

适用场景:数据质量高、算力有限、快速验证的场景

6.3 GRPO(组相对策略优化)——DeepSeek-R1的成名绝技

全称:Group Relative Policy Optimization

通俗理解
GRPO是DeepSeek团队的创新算法。它完全去掉了Critic(评论家)网络,改用“组内相对比较”的方式来评估表现。

用一个比喻来理解

GRPO像一种“小组竞赛制”——让模型对同一个问题生成多個回答,放在一组里互相比较,排名高的得高分,排名低的得低分。不需要额外的“评论家”来评分。

具体怎么做的

  1. 对同一个问题,让模型生成一组回答(比如8个)
  2. 用奖励函数给每个回答打分
  3. 组内做归一化(减去均值,除以标准差)
  4. 用归一化后的相对优势来更新模型

优点

  • 不需要训练价值网络(Critic),省显存、省计算
  • 训练更稳定
  • 特别适合推理任务(数学、代码)

缺点

  • 组内比较的有效性取决于组内样本的质量分布

适用场景推理模型训练的首选,DeepSeek-Math和DeepSeek-R1都是用它

三个算法的对比总结

PPODPOGRPO
需要奖励模型?✅ 需要❌ 不需要✅ 需要(但可简化)
需要Critic网络?✅ 需要❌ 不需要❌ 不需要
训练复杂度最高最低中等
显存占用最高最低中等
效果上限最高中等
代表模型GPT-4、Claude各种开源模型DeepSeek-R1

七、后续学习路线图(各章 preview)

第5章:PPO —— 近端策略优化

  • 讲什么:裁剪目标函数、GAE(广义优势估计)、Critic网络、完整的RLHF训练循环
  • 为什么学:PPO是GPT-4和Claude背后的主力算法,是理解前沿模型训练的基础
  • 理论怎么做:通过“裁剪”机制限制每次更新的幅度,防止策略突变;用GAE平衡偏差与方差来估计“优势”
  • 解决什么问题:传统策略梯度算法更新步长难控制,步长太小学得慢,步太大容易崩

第6章:DPO —— 直接偏好优化

  • 讲什么:如何把偏好直接转化为对比监督损失,完全绕过RL
  • 为什么学:比PPO简单得多,适合快速上手和资源受限场景
  • 理论怎么做:从Bradley-Terry偏好模型出发,推导出可直接优化的损失函数
  • 解决什么问题:RLHF流程太复杂(4个模型、在线采样),DPO让偏好对齐变得像SFT一样简单

第7章:GRPO —— 组相对策略优化

  • 讲什么:DeepSeek的无Critic算法,组级奖励归一化
  • 为什么学:DeepSeek-R1背后的方法,目前训练推理模型的首选
  • 理论怎么做:对同一问题采样一组回答,组内归一化奖励,用相对优势更新策略
  • 解决什么问题:PPO的Critic网络耗显存、难训练,GRPO直接砍掉它

第8章:偏好优化变体

  • 讲什么:在线DPO、KTO、Best-of-N采样,以及如何选择方法
  • 为什么学:实际项目中需要根据场景选算法,没有万能方案
  • 理论怎么做:每种方法有不同的“探索-利用”权衡和数据效率
  • 解决什么问题:不同任务、不同数据量、不同算力下,该用哪种方法?

第9章:奖励建模

  • 讲什么:Bradley-Terry模型、过程奖励vs结果奖励、RLVR的规则奖励、多目标组合
  • 为什么学奖励函数的设计直接决定了RL的效果上限
  • 理论怎么做:如何从人类偏好数据学习奖励函数;如何设计可验证的规则奖励
  • 解决什么问题:奖励信号是RL的“指挥棒”,设计不好模型会“奖励黑客”(钻空子)

第10章:SFT最佳实践

  • 讲什么:序列打包、对话模板、数据混合
  • 为什么学SFT的质量直接决定了RL的天花板
  • 理论怎么做:数据预处理、格式标准化、采样策略
  • 解决什么问题:RL之前的基础打不好,RL也救不回来

第11章:系统工程

  • 讲什么:分布式训练、并行策略、生成-训练解耦、数百张GPU的基础设施
  • 为什么学:真正的LLM训练不是单卡能搞定的
  • 理论怎么做:模型并行、数据并行、流水线并行;如何让生成和训练异步进行
  • 解决什么问题:算法再好,工程跑不起来也是白搭

八、总结:一句话串起来

SFT教会模型“像人一样说话” →RLHF/DPO教会模型“不说坏话” →RLVR(如DeepSeek-R1)教会模型“解出难题”。

虽然“不说坏话”和“解出难题”看着不像一回事,但它们底层都是用“奖励 + 梯度更新”这一套数学公式来驱动模型进化的。

所有的前沿模型——GPT-4、Claude、Llama-3、DeepSeek-R1——都在SFT之后应用了RL,这是将“有能力但不可控”的模型转变为“真正可用”的助手的关键一步

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询