RLHF 的理论视角 (1)
RLHF 的理论视角¶
1. 如何从最大熵强化学习的视角理解 RLHF 中的 KL 惩罚?¶
最大熵强化学习(MaxEnt RL)在标准 RL 的奖励最大化目标上添加了策略熵项,鼓励策略在追求高回报的同时保持随机性,以增强探索和鲁棒性。其目标为:
$$ J(\pi)=\mathbb{E}{\tau\sim\pi}\left[\sum))\right] $$ }r(s_{t},a_{t})+\alpha H(\pi(\cdot|s_{t
在 RLHF 的 PPO 目标中,我们最大化奖励模型分数,同时最小化当前策略与参考策略(SFT 模型)的 KL 散度:
$$ \begin{array}{r}{J(\pi_{\theta})=\mathbb{E}{x\sim\mathcal{D},y\sim\pi $$ }}[R(x,y)]-\beta D_{K L}(\pi_{\theta}(\cdot|x)||\pi_{\mathrm{r e f}}(\cdot|x))}\end{array
将 KL 散度展开:
$$ -D_{K L}(\pi_{\theta}||\pi_{\mathrm{r e f}})=\mathbb{E}{\pi}}\left[\log\frac{\pi_{\mathrm{r e f}}(y|x)}{\pi_{\theta}(y|x)}\right]=\mathbb{E{\pi) $$ }}[\log\pi_{\mathrm{r e f}}(y|x)]+H(\pi_{\theta
代入总目标,得到:
$$ \boldsymbol{J}(\boldsymbol{\pi}{\theta})=\mathbb{E}{\theta}}[\boldsymbol{R}(\boldsymbol{x},\boldsymbol{y})]+\boldsymbol{\beta}\mathbb{E}{\theta}}[\log\pi) $$ }}(\boldsymbol{y}|\boldsymbol{x})]+\boldsymbol{\beta}\boldsymbol{H}(\boldsymbol{\pi}_{\theta
这里, $ \beta H(\pi_\theta) $ 正是策略熵项,而 $ \beta \mathbb{E}[\log \pi_{\text{ref}}] $ 可视为额外的“先验奖励”——它鼓励策略生成在参考模型下概率高的 token。因此,RLHF 等价于在最大化一个修正奖励 $ \tilde{R}(x, y) = R(x, y) + \beta \log \pi_{\text{ref}}(y|x) $,并同时最大化熵(系数为 $ \beta $)。这完全落入 MaxEnt RL 的框架:参考模型的对数概率充当了行为先验,KL 惩罚既防止策略崩溃,又是内在的熵正则化项,实现了“追求人类偏好”与“保持语言自然度”之间的最优平衡。
直观理解:MaxEnt RL 在标准 RL 上添加了“好奇心”或“多样性”鼓励项;RLHF 的 KL 项则添加了“不偏离母语”的引力,本质上也是一种多样性和安全性鼓励,只不过基准分布不是均匀分布,而是 SFT 模型。
2. RLHF 是否可以看作是一种贝叶斯推断?偏好数据如何更新对最优策略的信念?¶
完全可以。在贝叶斯框架下,我们将最优策略 $ \pi^* $ 视为潜在变量,参考策略 $ \pi_{\text{ref}} $ 定义了先验分布 $ p(\pi) $。给定偏好数据集 $ \mathcal{D} = {(x, y_w, y_l)} $,我们通过似然函数 $ p(\mathcal{D} | \pi) $ 来更新信念,得到后验分布 $ p(\pi | \mathcal{D}) \propto p(\mathcal{D} | \pi)p(\pi) $。
- 似然模型:Bradley-Terry 模型给出偏好概率 $ P(y_w \succ y_l | x) = \sigma(r(x, y_w) - r(x, y_l)) $。
从奖励到策略:在 KL 约束的 RL 目标下,最优策略与奖励存在解析关系 $ \pi^*(y|x) \propto \pi_{\text{ref}}(y|x) \exp\left(\frac{1}{\beta} r(x, y)\right) $。由此可将奖励替换为策略的对数比,从而消去显式的奖励模型。
后验最大化:将上述关系代入 Bradley-Terry 似然,就得到了仅依赖策略和参考模型的损失函数——这正是 DPO 的损失。因此,DPO 本质上是在做最大后验(MAP)估计,寻找在给定偏好数据下最可能的最优策略。
而在 RLHF+PPO 中,我们分两步:首先用偏好数据训练一个奖励模型(近似似然),然后在策略优化时用 KL 惩罚融入先验。两者都深植根于贝叶斯推断:偏好数据通过似然更新了对“好策略”的认知,最终的对齐策略是后验分布的一个点估计。
图示:先验(宽泛的高斯)在观测到偏好数据后,收缩为一个更集中、偏向高奖励区域的分布。KL项保证后验不会离先验太远。
VS 3. 从对比学习的角度,DPO 与 SimCLR 等方法的 loss 有何相似之处?¶
$$ \mathcal{L}{\mathrm{D P O}}=-\mathbb{E}\left[\log\sigma\left(\beta\log\frac{\pi\right)\right] $$ }(y_{w}|x)}{\pi_{\mathrm{r e f}}(y_{w}|x)}-\beta\log\frac{\pi_{\theta}(y_{l}|x)}{\pi_{\mathrm{r e f}}(y_{l}|x)
定义隐式奖励 $ \hat{r}{\theta}(x, y) = \beta \log \frac{\pi $,则损失化简为:}(y|x)}{\pi_{\mathrm{ref}}(y|x)
$$ \mathcal{L}=-\log\sigma(\hat{r}{\theta}(x,y})-\hat{r{\theta}(x,y}))=-\log\frac{\exp(\hat{r{\theta}(x,y}))}{\exp(\hat{r{\theta}(x,y}))+\exp(\hat{r{\theta}(x,y $$ }))
这正是二分类交叉熵,其中 chosen 为正例,rejected 为负例。
对比 SimCLR 等自监督对比学习的 InfoNCE 损失:
$$ \mathcal{L}{\mathrm{SimCLR}}=-\log\frac{\exp(\mathrm{sim}(z $$ },z_{j})/\tau)}{\sum_{k\neq i}\exp(\mathrm{sim}(z_{i},z_{k})/\tau)
两者高度相似:
正样本对:在 DPO 中是 $ (x, y_w) $,其隐式奖励应尽可能高;在 SimCLR 中是同一图像的两个增强视图 $ (z_i, z_j) $,相似度应尽可能高。
· 负样本对:在 DPO 中是 $ (x, y_l) $;在 SimCLR 中是同一 batch 内的其他图像。
• 温度参数:DPO 的 $ \beta $ 控制奖励差异的锐度,与 SimCLR 的 $ \tau $ 作用相同——较小的 $ \beta $ 使损失聚焦于困难负样本,类似于对比学习中的 hard negative mining。
因此,DPO 可视为一种特殊的对比学习,它在隐式奖励空间中将 chosen 和 rejected 回答推开,且这种对比是在参考模型归一化后的策略概率比上进行的,使得对比有更强的“去偏”效果。
总结:DPO = 在策略隐式奖励上的成对对比学习。
4. RLHF 中策略优化与生成式流模型或扩散模型策略之间有什么联系?¶
RLHF 的最优策略具有能量基模型(EBM)的形式:
$$ \pi^{*}(y|x)=\frac{1}{Z(x)}\pi_{\mathrm{ref}}(y|x)\exp\left(\frac{1}{\beta}r(x,y)\right) $$
这定义了一个未归一化的目标分布 $ \tilde{\pi}(y|x) = \pi_{\text{ref}}(y|x) \exp(r/\beta) $。RLHF 的 PPO 更新本质上是在做变分推断,让策略 $ \pi_\theta $ 去逼近这个目标分布,而 KL 惩罚正是变分下界中的正则项。
与扩散模型的联系:扩散模型通过逐步去噪,从一个简单先验(高斯噪声)生成目标分布的样本。类似地,我们可以定义从参考策略(高熵、自然语言)到对齐策略(低熵、符合偏好)的“扩散过程”。每一步的“去噪”相当于策略的微调,DDPM中的得分函数匹配对应着RL中的策略梯度。已有工作将扩散模型作为策略,直接用于强化学习。
与流模型的联系:流模型通过可逆变换将先验分布转化为复杂后验。RLHF 中的策略微调可以看作学习一个从参考策略到对齐策略的连续归一化流,每一步参数更新是一个微分同胚。
· DPO 与对比散度:DPO 避免了显式奖励,直接优化策略匹配偏好,其梯度更新类似于能量基模型中的对比散度(Contrastive Divergence),这进一步拉近了与生成式模型训练的联系。
图示:从模糊、高熵的参考分布(云团)开始,经过RLHF的“去噪/变换”过程,逐渐凝聚成一个集中在对齐区域的尖锐分布。
5. 如何形式化定义 RLHF 的“奖励黑客”现象?有无理论上的上界或保证?¶
形式化定义:令真实人类偏好奖励为 $ R^(x, y) $(不可观测),代理奖励为 $ \tilde{R}(x, y) $(从有限偏好数据训练)。策略优化目标为最大化 $ \hat{R} $,但我们实际关心 $ R^ $。奖励黑客发生在 $ \mathbb{E}{\pi}[\hat{R}] \gg \mathbb{E}[R^] $ 时,即代理奖励与真实奖励出现背离。衡量指标是奖励过优化:随着 $ \mathbb{E}[\hat{R}] $ 的上升, $ \mathbb{E}[R^] $ 呈现倒U形,在某个点后开始下降。
理论保证:通过统计学习理论,可以在一定假设下 bound真实奖励的损失。假设奖励模型类 \(\mathcal{F}\) 的复杂度(如 Rademacher 复杂度)有限,且真实奖励 \(R^* \in \mathcal{F}\),则对于任意策略 \(\pi\),有高概率:
$$ \mathbb{E}{\pi}[R^{*}]\geq\mathbb{E}) $$ }[\hat{R}]-C\cdot\sqrt{\frac{\mathrm{C o m p l e x i t y}(\mathcal{F})}{N}}\cdot d(\pi,\pi_{\mathrm{t r a i n}
其中 $ d(\cdot,\cdot) $ 是分布距离(如总变差或 KL),N 是偏好数据量。这揭示了:
· 当策略靠近训练分布 $ \pi_{train} $ 时,代理奖励可靠,真实奖励有保证。
· 当策略远离时,奖励估计可能失效,黑客风险剧增。
KL 惩罚的作用正是限制 $ d(\pi, \pi_{\text{ref}}) $ ( $ \pi_{\text{train}} $ 通常接近 $ \pi_{\text{ref}} $),从而直接控制上述 bound 中的惩罚项,提供理论上的防护。
图示:倒U形曲线,横轴代理奖励,纵轴真实奖励。阴影区域为理论下界,峰值点对应最优KL距离。

6. 从控制论角度看,参考模型 KL 惩罚相当于什么控制器?¶
将 RLHF 的训练过程看作一个控制系统:
被控对象:策略 $ \pi_{\theta} $
设定点(参考信号):参考策略 $ \pi_{ref} $。
- 误差信号:KL 散度 $ D_{KL}(\pi_\theta |\pi_{\text{ref}}) $ 或其对数值。
控制输入:PPO 更新中的 KL 惩罚项。
KL 惩罚产生的梯度力与误差成正比(一阶近似),因此起到比例控制器(P 控制器)的作用。系数 $ \beta $ 就是比例增益:误差越大,拉回参考模型的力越强。
许多实现采用自适应 KL 系数:设定目标 KL 值,当实际 KL 超过目标时,自动增大 $ \beta $;反之减小。这引入了积分控制(I 控制),通过累积误差来调整增益,消除稳态误差,使长期 KL 稳定在目标值。
PPO 的裁剪机制则是一个饱和非线性环节:当策略变化比率在 $ 1 \pm \epsilon $ 内时,不施加额外控制;一旦超出,硬性截断,相当于一个高增益的死区控制器,防止瞬间过大偏离。
整体系统可视为一个级联控制回路:内环为 PPO 裁剪(快速响应、硬约束),外环为 KL 惩罚(慢速调节、软约束),最外层为自适应 $ \beta $ 调节(积分器,消除长期漂移)。
框图:参考模型→比较器(计算KL误差)→控制器(PPO+KL惩罚)→被控对象(策略)→反馈回比较器。

7. 分析 RLHF 中的“分布偏移”问题,它在理论上是如何被 bound 的?¶
分布偏移指策略在 RL 微调中,其输出分布逐渐偏离奖励模型训练时的分布,导致奖励评估失准。从域适应理论看,这属于协变量偏移:策略 $ \pi $ 改变了生成文本的分布,而奖励模型 $ \hat{R} $ 在源分布 $ \pi_{train} $ 上训练,在目标分布 $ \pi $ 上的泛化误差可以用分布距离 bound。
对于任意策略 $ \pi $,期望真实奖励与代理奖励之差可被控制为:
$$ \mathbb{E}{\pi}[R^{}]\geq\mathbb{E}{\pi}[\hat{R}]-\underbrace{\left(\mathbb{E}}[\hat{R}]-\mathbb{E{\pi}}[\hat{R}]\right){ 分布偏移误差 }-\underbrace{\left(\mathbb{E}}}[\hat{R}]-\mathbb{E{\pi[R^{}}]\right)} $$
第二项(分布偏移误差)可通过 IPM(积分概率度量)或 f-divergence 来 bound。例如,使用 Wasserstein 距离或总变差,有:
$$ \left|\mathbb{E}{\pi}[\hat{R}]-\mathbb{E}) $$ }}}[\hat{R}]\right|\leq\mathrm{Lip}(\hat{R})\cdot W_{1}(\pi,\pi_{\text{train}
其中 Lip( $ \hat{R} $) 是奖励函数的 Lipschitz 常数。由此,只要奖励函数足够平滑,且策略离训练分布不远,代理奖励就依然可靠。KL 惩罚限制 $ D_{KL}(\pi|\pi_{\text{train}}) $,通过 Pinsker 不等式 $ |\pi - \pi_{\text{train}}|{TV} \leq \sqrt{\frac{1}{2}D $,间接控制了总变差,从而 bound 了分布偏移误差。}
图示:源分布和目标分布两条曲线,KL 散度被标注出来,箭头指向一个公式,显示误差上界与 KL 的关系。
8. 如果人类偏好是反传递的(循环偏好),现有的 RLHF 框架会怎么处理?理论上有解吗?¶
标准 RLHF 基于 Bradley-Terry 模型,该模型隐含传递性假设。当数据中出现循环(A>B,B>C,C>A)时,模型会通过最大似然寻找一个“最一致的”奖励赋值,这本质上是在抹平矛盾,可能导致奖励函数失真。
理论处理方式:¶
-
更一般的随机效用模型:例如采用配对比较的 Mallows 模型或基于成对交互的模型,显式允许非传递性,但训练复杂度增加。
-
多维奖励函数:假设偏好由多个潜在维度(有用性、安全性等)决定,且标注者在不同时间点对不同维度的关注度不同,导致循环。通过学习多维奖励并动态加权,可以解释非传递性。
-
群体偏好聚合:循环可能源于不同标注者群体的价值观冲突。可以为每个群体训练独立的奖励模型,或使用社会福利函数进行聚合,但需要群体标签。
-
稳健损失与数据清洗:在实践中,更常见的是通过严格的数据清洗、冲突标注的仲裁、以及丢弃不可调和的三元组来减少循环。在训练时,可采用标签平滑或赋予低权重来处理剩余的矛盾数据。
尽管有这些方法,目前工程上仍以 Bradley-Terry 模型为主,因为其简单稳定。理论上非传递偏好有解,但会引入更多的复杂性和数据需求。
图示:A→B→C→A 的偏好三角,旁边展示多维空间中因权重变化导致偏好反转的示意图。
9. 是否存在一种“免训练”的对齐方法,直接从基座模型和偏好数据中推导出最优策略?这和 in-context alignment 有何联系?¶
“免训练”对齐是指不通过梯度更新修改模型参数,而是在推理时利用外部信息引导模型行为。最直接的实现是 in-context alignment(上下文对齐):在 prompt 中注入高质量的偏好示例(chosen-rejected 对)或系统指令,模型通过其强大的上下文学习能力,临时调整输出分布,生成更符合示例风格的文本。这可以看作是模型在推理时隐式构建了一个奖励函数,并执行了类似 RLHF 的优化,只不过“优化”发生在 Transformer 的前向传播中,而非权重更新。
其他免训练策略:¶
检索增强生成(RAG):从偏好数据库中检索与当前 prompt 最相似的 chosen 回答,将其作为“金标准”拼入上下文,引导模型模仿。
Best-of-N 采样:生成 N 个候选,用奖励模型或 AI 裁判评分,选最高分回答。这完全避免了训练,但推理成本线性增加。
与 RLHF 的联系:In-context alignment 相当于将 RLHF 的训练数据直接“喂”给模型,让模型在运行时完成对齐,而 RLHF 则将数据内化为权重。前者灵活、即时、无需算力,但受限于上下文长度、不稳定、易被对抗性提示劫持。后者效果更深入、稳健,但成本高。两者可以互补:RLHF 提供基线对齐,上下文对齐提供实时个性化。
图示:左侧是 RLHF 流程(数据→训练→部署),右侧是免训练流程(直接将偏好示例放入 prompt,基座模型输出对齐回答)。

10. 你如何看待“弱到强泛化”在 RLHF 中的体现:用弱奖励模型训练出强策略?¶
弱到强泛化现象:用一个能力有限(例如由普通标注员数据训练)的“弱”奖励模型去微调基础能力极强的“强”语言模型,结果强模型的表现不仅没有受限于弱奖励,反而在某些能力上超越了奖励模型自身的水平。
在 RLHF 中,这体现为:
强模型在预训练阶段已经掌握了大量的世界知识、推理能力和潜在的道德直觉。
弱奖励模型可能只在浅层特征上提供粗糙的“好坏”信号,但强模型凭借其丰富的内部表示,能够“领会”信号背后的深层意图,自动补全和完善对齐目标。
KL 惩罚的关键作用:KL 项将策略锚定在强模型自身(参考模型),防止其过度拟合弱奖励的噪声,从而保留了强模型的先验能力。本质上,RLHF 只是用弱奖励来“轻推”强模型,而非从头塑造它。
这极大地降低了对完美奖励模型的依赖,使我们可能利用大量廉价、弱监督的信号(如用户点踩、简单评分)来对齐超人类模型。但同时也有风险:如果弱奖励模型存在系统性偏见(例如偏好冗长回答),强模型可能放大这种偏见,导致“谄媚”或过度优化。因此,弱到强泛化是一把双刃剑,需要配合多样性评估和红队测试来确保对齐方向正确。
图示:一棵大树(强模型)旁有一棵小树苗(弱奖励模型),小树苗的指引激活了大树深埋的根系(预训练知识),大树因此长得更加枝繁叶茂。