跳转至

(两万万字深度解析)DeepSeek R1:从简到深全面学习如何利用强化学习训练大型语言模型(详解)-飞书云文档

本文讨论了 DeepSeek 团队推出的第一代开源推理强化学习模型 DeepSeek R1,介绍了其架构、训练流程、强化学习方法、实验结果、数学推导、应用场景以及面临的挑战和未来方向。关键要点包括:

模型简介:DeepSeek R1 是 DeepSeek 团队推出的第一代开源推理强化学习模型,采用全新训练范式,在架构上继承 DeepSeek-V3 技术栈,推理性能与 OpenAI 的闭源顶尖模型 o1 相媲美。

架构特点:继承 DeepSeek-V3 的 MoE 架构,参数达 6710 亿,每个 Token 计算约激活 370 亿参数;采用标准 Transformer 框架叠加 MoE 层,降低计算开销;融合高效训练框架、结构优化、双语支持、链式思维输出格式等技术。

训练流程:采用多阶段流水线,包括冷启动监督微调、面向推理的强化学习、拒绝采样与监督微调、面向所有场景的强化学习对齐;训练完成后还将能力迁移到多个小规模模型上。

强化学习方法:采用 GRPO 方法,无需训练额外价值网络,利用组内相对奖励稳定策略梯度估计,保证模型性能提升,避免训练中策略崩溃或退化。

实验结果:在各类标准基准上成绩出色,强化学习使 DeepSeek-R1-Zero 推理能力大幅提升,完整训练后的 DeepSeek R1 性能接近顶尖闭源模型,且具备开源开放和可解释性优势。

应用场景:可应用于教育辅导、科研与工程助理、专业问答系统、对话与决策支持等领域,其链式思维输出为用户审查模型行为提供便利。

挑战与展望:存在泛化能力、多语言支持、提示鲁棒性、强化学习效率与成本、奖励设计与安全性等方面的问题,未来需逐步解决以实现更广泛应用。

引言:DeepSeek R1 是 DeepSeek 团队推出的第一代开源推理强化学习模型,它通过纯强化学习和多阶段训练显著提升了大型语言模型在复杂推理任务上的能力(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。不同于传统依赖海量标注数据的监督学习方法,DeepSeek R1 采用了全新的训练范式:让模型在与环境交互中自主学习。该模型在架构上继承了 DeepSeek-V3 的技术栈,并在训练过程中融合了冷启动策略、强化学习优化以及蒸馏等多种技术手段,实现了与 OpenAI 的闭源顶尖模型 o1 相媲美的推理性能(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。接下来,本文将详细介绍强化学习的基础概念、DeepSeek R1 的模型架构、训练流程和强化学习方法,并解析其实验结果和数学原理,最后讨论其应用场景以及面临的挑战和未来方向。


强化学习基础

强化学习(Reinforcement Learning,RL)是一种机器学习范式,强调智能体(agent)通过与环境(environment)的反复交互来学习策略,以最大化累积奖励(cumulative reward)。在强化学习中,智能体在每一步观察环境状态,根据当前策略选择动作,环境根据动作反馈奖励值并转移到下一个状态。通过这样的试错(trial-and-error)过程,智能体逐渐改进策略,提高获得长期回报的能力。马尔可夫决策过程(MDP):强化学习通常通过马尔可夫决策过程(Markov Decision Process,MDP)建模。MDP可以形式化地表示为一个四元组(S,A,P,R)

• S 是状态空间的集合,表示环境可能处于的所有状态;

• A 是动作空间的集合,表示智能体可执行的动作;

• $ P(s'|s,a) $ 是状态转移概率分布,即在状态 $ s $ 下执行动作 $ a $ 后转移到状态 $ s' $ 的概率 (马尔可夫决策过程 - 维基百科,自由的百科全书);

• $ R(s,a,s') $ 是即时奖励函数,表示从状态 s 执行动作 a 转移到状态 $ s' $ 所得到的奖励 (马尔可夫决策过程 - 维基百科,自由的百科全书)。

当智能体在环境中按照策略反复决策时,就形成了一个轨迹(trajectory)或序列: $ s_0 \xrightarrow{a_0, r_1} s_1 \xrightarrow{a_1, r_2} \cdots $,其中 $ r_t $ 表示第 $ t $ 步执行动作后获得的奖励。强化学习的目标是找到一个最优策略,使得在这个序列中累积的期望总奖励最大(马尔可夫决策过程 - 维基百科,自由的百科全书)。

策略(Policy):策略是智能体选择动作的规则或函数。策略可以是确定性的,也可以是随机的。确定性策略直接给出状态到动作的映射 $ \pi: S \to A $,而随机策略则给出动作的概率分布 $ \pi(a|s) $,表示智能体在状态 $ s $ 时以概率 $ \pi(a|s) $ 选取动作 $ a $(马尔可夫决策过程 - 维基百科,自由的百科全书)。在强化学习中,我们通常关注随机策略,因为它更具泛化性,并方便理论推导。

状态价值函数(Value Function):在给定策略 $ \pi $ 下,状态价值函数 $ V^{\pi}(s) $ 定义为智能体从状态 s 开始遵循策略 $ \pi $ 时所期望获得的折扣累积奖励(马尔可夫决策过程 - 维基百科,自由的百科全书)。以数学形式表示:


$$ \begin{array}{c} V^{\pi}(s)~=~\mathbb{E}{\pi}\left[\left.{\displaystyle\sum $$ }^{\infty}}\gamma^{t}r_{t+1}\right|s_{0}=s\right], \end{array

其中期望由策略 $ \pi $ 和环境的状态转移概率决定, $ \gamma \in [0,1] $ 是折扣因子,用于度量未来奖励的重要性。当 $ \gamma < 1 $ 时,较远将来的奖励贡献会按指数因子递减,以确保累积和收敛。

动作价值函数(Q函数): 类似地,动作价值函数 $ Q^{\pi}(s,a) $ 表示在状态 s 执行动作 a 后,后续按照策略 $ \pi $ 行动所期望获得的折扣累积奖励:

$$ Q^{\pi}(s,a)~=~\mathbb{E}{\pi}\Big[\;\sum=a\Big]. $$ }^{\infty}\gamma^{t}r_{t+1}\;\Big|\;s_{0}=s,a_{0

价值函数满足著名的贝尔曼方程(Bellman Equation):对于任意策略 $ \pi $,

$$ V^{\pi}(s)\;=\;\sum_{a\in A}\pi(a|s)\sum_{s^{\prime}\in S}P(s^{\prime}|s,a)\left(R(s,a,s^{\prime})+\gamma V^{\pi}(s^{\prime})\right), $$

该方程揭示了当前状态的价值等于执行策略后即时奖励加未来状态价值的期望。(马尔可夫决策过程-维基百科,自由的百科全书)

在强化学习中,智能体通过估计价值函数来评价策略的好坏,并以此为基础不断改进策略。例如,策略迭代算法会反复执行策略评估(计算 $ V^{\pi} $)和策略提升(根据 $ V^{\pi} $ 改进策略)过程,直至收敛到最优策略。对应地,值迭代则直接迭代贝尔曼最优方程来逼近最优价值函数 $ V^{*}(s) $,并由此导出最优策略。

策略优化:除了基于价值函数间接优化策略,强化学习还可以直接通过优化策略的参数来最大化预期回报,这称为策略优化方法。假设策略由参数 $ \theta $ 确定,即 $ \pi_{\theta}(a|s) $。我们定义策略的性能指标为初始状态分布下的期望总回报 $ J(\theta) = \mathbb{E}{s_0 \sim p_0} \left[ V^{\pi(s_0) \right] $,目标是找到参数使得 $ J(\theta) $ 最大。利用梯度上升法可以直接优化策略参数,这引出了策略梯度定理 (Vanilla Policy Gradient — Spinning Up 文档)。根据策略梯度定理:}

$$ \nabla_{\theta}J(\pi_{\theta})=\mathbb{E}{\tau\sim\pi)\Big], $$ }}\Big[\sum_{t=0}^{\infty}\nabla_{\theta}\log\pi_{\theta}\left(a_{t}|s_{t}\right)A^{\pi_{\theta}}(s_{t},a_{t


其中 $ \tau $ 表示一次交互轨迹, $ A^{\pi}(s,a)=Q^{\pi}(s,a)-V^{\pi}(s) $ 是优势函数 (Advantage),表示动作相对于状态平均价值的好坏程度 (Vanilla Policy Gradient — Spinning Up 文档)。策略梯度定理表明,我们可以通过采样得到的轨迹数据,计算每一步 $ \nabla_{\theta}\log\pi_{\theta}(a_{t}|s_{t}) $ 乘以某种回报 (如优势估计),得到梯度的无偏估计,从而更新参数提高策略性能。

策略梯度方法的一个基本实现是REINFORCE算法,它使用每个轨迹实际获得的折扣回报 $ G_t = \sum_{k=0}^{\infty} \gamma^k r_{t+k+1} $ 作为优势的近似来更新策略。然而,直接使用总回报会导致高方差的梯度估计。为此,实际中常减去一个基线(如状态价值函数 $ V^\pi(s_t) $)来构造优势,从而降低方差且不引入偏差。常见的策略优化算法如 Actor-Critic 框架利用一个价值网络来估计 $ V^\pi(s) $ 作为基线,策略网络则根据优势进行更新,从而稳定训练过程。

总之,强化学习基础涵盖了环境建模(MDP)、策略表示、价值评估和策略改进等关键概念。这些概念为我们理解 DeepSeek R1 所采用的强化学习训练方法奠定了基础。下面将介绍 DeepSeek R1 的架构设计及其关键模块。

DeepSeek R1 的架构

DeepSeek R1 在模型架构上继承了前代模型 DeepSeek-V3 的技术栈。DeepSeek-V3 是一个混合专家(MoE)语言模型,具有 6710 亿(671B)参数,其中每个Token(词元)的计算约激活 370 亿(37B)参数 (DeepSeek是否有国运级创新?2万字解读与硬核分析V3/R1的架构_凤凰网)。这意味着模型在保持超大容量的同时,提高了推理效率,可将参数规模扩展到与 GPT-4 大致相当的量级 (DeepSeek是否有国运级创新?2万字解读与硬核分析V3/R1的架构_凤凰网)。MoE 架构的核心思想是引入多个“专家”子模型,由一个门控网络根据输入选择性地激活其中一部分专家,从而减少每次推理的计算量,提高训练和推理速度 (DeepSeek是否有国运级创新?2万字解读与硬核分析V3/R1的架构_凤凰网)。这种架构设计使 DeepSeek-R1 拥有极高的表达能力,能够容纳不同领域的知识和推理模式。

在具体实现上,DeepSeek R1 采用了标准 Transformer 框架叠加 MoE 层:包括词嵌入层、多头自注意力机制、前馈网络等基本模块,以及散布在若干层的 MoE 专家模块和对应的门控路由器。与密集架构的模型相比,MoE 专家模块可以看作并行的子网络,每个专家专长于处理输入空间的一部分特征(DeepSeek是否有国运级创新?2万字解读与硬核分析V3/R1的架构_凤凰网)。当输入通过模型时,门控路由器根据输入特征(如隐藏状态向量)计算得分,选择若干个最适合当前输入的专家来执行计算,而未被选中的专家不参与本次计算。这样一来,每次仅用到全部专家中极少的一部分,就能完成对输入的处理,大幅降低计算开销,同时因为不同专家可以学习不同知识,使模型的总体能力大幅提升。

技术栈与关键模块:DeepSeek R1的技术栈融合了多项尖端技术,以支撑如此大规模模型的训练和推理:


高效训练框架:模型的预训练和微调使用了先进的分布式训练框架(如 Huawei 的 HAI-LLM(一文纵览 DeepSeek 模型家族:从 LLM 到 R1 - 文章 - 开发者社区 - 火山引擎)等),结合优化的内存管理和通信算法,保证了数百亿参数模型的训练效率。

结构优化:DeepSeek 系列在架构上引入了分组查询注意力(Grouped Query Attention, GQA)等技术来降低多头注意力的计算和内存开销(一文纵览DeepSeek 模型家族:从LLM到R1 - 文章 - 开发者社区 - 火山引擎)。这些优化措施在不损失模型性能的情况下,减少了推理成本,提升了部署效率。

双语支持:模型使用中英双语词表和 Embedding,具备同时使用中文和英文进行推理的能力()。架构上通过共享的多语言词嵌入和统一的模型参数实现多语言支持。在训练时也采取了特殊策略确保不同语言之间的表述不会混杂(训练过程中对语言一致性进行了约束,详见下文)。

链式思维输出格式:虽然这属于应用层面的设计,但也可视为架构的一部分约束。DeepSeek R1 在对话格式上规定了特殊的(思考)和(作答)标签,用于划分模型的推理过程与最终答案(『DeepSeek论文精读』6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。模型经过微调,能够按照这种格式来组织输出:首先在标签内输出详细的推理步骤,最后在标签内给出答案。这种设计使模型的推理过程透明可查,有助于人类理解模型的决策依据,也便于后续的结果验证。

总体而言,DeepSeek R1 的架构在保持与 DeepSeek-V3 一致的超大规模 Transformer 基础上,通过混合专家等技术实现了性能与效率的平衡。它相当于一个具备推理特长的 DeepSeek-V3 (DeepSeek 是否有国运级创新?2万字解读与硬核分析V3/R1的架构_凤凰网)——模型层面的改动并不是核心差异,真正让 R1 脱颖而出的是其创新的训练流程和强化学习策略,这将在下一节详细阐述。

训练流程

DeepSeek R1 的训练采用了多阶段流水线,结合少量高质量监督数据和大规模强化学习,使模型逐步获得强大的推理能力(《DeepSeek论文精读》)6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)(《DeepSeek论文精读》)6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。整个流程可以分为四个阶段,如下所示:

阶段1:冷启动监督微调。首先从预训练得到的基础模型(DeepSeek-V3-Base)出发,研究者构建了一个小规模的长推理链数据集用于冷启动训练(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。这个数据集主要来源于先前训练的纯强化学习模型DeepSeek-R1-Zero自动生成的解题过程和答案,以及人工筛选验证的高质量推理示例,规模为数千条,内容涵盖数学题、代码问题的解答步骤等。这些样本都经过验证,保证了正确性和可读性(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。在此小数据集上对基础模型进行监督微调,可以在不大量消耗算力的情况下迅速提升模型输出连贯推理过程的能力,弥补基础模型在答案可读性方面的不足。

阶段2:面向推理的强化学习。接下来,进入强化学习(RL)训练阶段,这是整个流程的核心。此阶段使用了与DeepSeek-R1-Zero相同的大规模强化学习方法来专攻复杂推理任务(DeepSeek论文精


读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。具体而言,研究者选取了有明确评价标准的任务领域,包括编程题、数学题、科学问答和逻辑推理等。这些任务都有客观正确答案或标准输出,可以为强化学习定义明确的奖励函数(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。例如,数学题可以通过检查最后答案的对错给予奖励,编程题可以通过运行生成的代码是否通过测试用例来反馈奖励,逻辑推理题则可以基于预先定义的正确结论判定奖励。DeepSeek R1 在此阶段遵循一种被称为 GRPO(Group Relative Policy Optimization)的策略优化算法进行训练(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)(详见下一节),通过与环境反复交互采集数据、评估奖励,不断调整模型参数以最大化预期回报。为了稳定训练,模型以阶段1微调后的参数作为初始化(避免直接从原始基础模型开始RL造成的不稳定),并使用之前提到的模板要求模型输出推理过程和答案,以保证训练过程中模型行为符合期望格式。

阶段3:拒绝采样与监督微调。经过一段时间的强化学习训练,当模型在推理任务上的表现接近收敛时,研究者引入了拒绝采样(reject sampling)策略来进一步优化模型(『DeepSeek论文精读』6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。具体做法是:让阶段2得到的强化学习模型(DeepSeek R1 的中间检查点)生成大量回答,然后自动筛选出其中高质量的样本组成新的训练集。一方面,对于有标准答案的题目,直接剔除不正确的输出,只保留解答正确且过程清晰的样本;另一方面,对于开放性任务,借助一个预先训练的奖励模型(这里使用了 DeepSeek-V3 作为评估器)对模型输出进行评分,挑选可读性强、符合人类偏好的响应(『DeepSeek论文精读』6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。此外,这一阶段的训练数据还混入了一部分 DeepSeek-V3 原有的监督数据,例如一般知识问答、创意写作、自我反思等指令数据(『DeepSeek论文精读』6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。通过将模型强化学习生成的优秀推理样本与传统指令微调数据合并,形成一个覆盖广泛任务领域且注重推理过程质量的综合数据集。然后对模型再次进行有监督微调,使其不仅巩固阶段2学到的推理技能,还恢复并增强了在其它日常对话任务上的表现。经过这一步,DeepSeek R1 在保持推理能力的同时,变得更加“全能”,能够处理更广泛的问题类型。

阶段4:面向所有场景的强化学习对齐。在最后阶段,研究者对模型进行了一个多场景的强化学习微调,旨在让模型在各类用户请求下都表现出有用性和无害性(DeepSeek论文精读)6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)(DeepSeek论文精读)6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。这一阶段可被视作对模型进行类似RLHF(基于人类反馈的强化学习)的过程。具体来说,对于推理类任务,仍然沿用阶段2的基于规则的奖励函数以巩固其推理正确性;而对于开放领域的对话、问答等任务,则引入偏好模型或让强大的语言模型(如GPT-4)作为反馈者,给出评分或偏好指导,使DeepSeek R1学会更符合人类偏好的回答方式(DeepSeek论文精读)6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。例如,在有用性方面,重点奖励回答准确且对用户有帮助的行为;在安全性方面,惩罚产生偏见、有害内容或不恰当回答的倾向(DeepSeek论文精读)6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)(DeepSeek论文精读)6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。


能力-CSDN博客)。通过在多样化提示上进行此阶段的强化训练,模型进一步提升了对用户指令的遵循度和友好度,成为一个既擅长严谨推理又符合伦理和用户需求的大模型。

完成上述四个阶段的训练后,DeepSeek R1 模型即告成型。值得一提的是,在训练完成后,研究者还将 DeepSeek R1 的能力迁移到了多个小规模模型上:利用阶段3生成的80万个样本,对开源的 Qwen 和 Llama 系列模型(1.5B、7B、8B、14B、32B、70B 规模)进行了蒸馏微调,成功打造了一系列轻量级但具备强大推理能力的模型()()。这些小模型的性能在很多推理基准上接近甚至超越了同等规模的其它开源模型,为社区提供了更便捷的高性能模型选择。

强化学习方法

DeepSeek R1 的训练使用了强化学习中的前沿算法。在介绍其具体方法之前,我们可以先了解两类经典的 强化学习算法 $ ^{Q} $ 代表:值函数方法(Value-based)和策略梯度方法(Policy-based),以及它们各自的特点。

Deep Q-Network (DQN): 值迭代的深度强化实现。DQN 是典型的值函数型算法,它以 Q-learning 为基础,通过深度神经网络逼近动作价值函数 $ Q(s,a) $ (RL (十三) 深度Q网络 (DQN) _dqnl-CSDN 博客)。在DQN中,智能体在每个状态选择能使预期累计奖励 $ Q(s,a) $ 最大化的动作,同时利用神经网络不断更新对 $ Q(s,a) $ 的估计。DQN 的核心在于设计一个损失函数来学习 Q 值,使其逼近 Q-learning 的贝尔曼最优方程。具体而言,DQN 定义了以下均方误差损失来最小化目标Q值 (Target Q) 与预测Q值之间的差异 (RL (十三) 深度Q网络 (DQN) _dqnl-CSDN 博客):

$$ \begin{array}{c} L(\theta)~=~\mathbb{E}\Big[\big(y_{\mathrm{t a r g e t}}~-Q(s,a;\theta)\big)^{2}\Big], \end{array} $$


其中 $ y_{\text{target}} = r + \gamma \max_{a'} Q(s', a'; \theta^-) $ 表示当下策略下计算得到的目标Q值 (RL (十三) 深度Q 网络 (DQN) _dqnl-CSDN博客)。 $ \theta^- $ 是固定的目标网络参数 (定期从在线网络参数复制),用于提高训练稳定性。通过梯度下降最小化上述损失,DQN 不断调整网络参数,使 $ Q(s, a; \theta) $ 趋近于目标Q 值,从而逼近最优的动作价值函数 (RL (十三) 深度Q网络 (DQN) _dqnl-CSDN博客)。DQN 属于离线策略 (off-policy) 算法,能够利用经验回放等技术稳定训练,在 Atari 游戏等离散动作场景取得了超过人类水平的成绩。

Proximal Policy Optimization (PPO): 策略梯度的稳定优化。深度策略梯度方法直接优化策略的参数,以最大化长期回报。由于策略梯度更新步长难以控制,学界提出了多种改进算法,其中 PPO 是当前应用最广泛的策略优化算法之一。PPO 通过对策略更新施加限制,来平衡探索新策略和保持策略稳定之间的关系 (Proximal Policy Optimization — Spinning Up 文档) (Proximal Policy Optimization — Spinning Up 文档)。具体来说,PPO 引入了截断概率比的思想:记 $ r(\theta) = \frac{\pi_{\theta}(a|s)}{\pi_{\theta_{old}}(a|s)} $ 为新旧策略在状态 s 下选择动作 a 的概率比,那么 PPO 要最大化的目标函数可表示为:

$$ \begin{array}{r}{L_{\mathrm{P P O}}\left(\theta\right)\;=\;\mathbb{E}_{s,a}\left[\operatorname*{m i n}\Bigl(r(\theta)A(s,a),\mathrm{c l i p}\bigl(r(\theta),1-\epsilon,1+\epsilon\bigr)A(s,a)\Bigr)\right],}\end{array} $$

其中 $ A(s,a) $ 是优势估计, $ \epsilon $ 是一个很小的超参数,通常取0.1到0.2 (Proximal Policy Optimization — Spinning Up 文档) (Proximal Policy Optimization — Spinning Up 文档)。上式中的 $ \min $ 操作意味着:当策略更新幅度较小时 $ (r(\theta) $ 尚在 $ [1-\epsilon,1+\epsilon] $ 范围内 $ ,直接使用未截断的概率比 $ r(\theta)A $ 进行梯度提升;一旦 $ r(\theta) $ 超出该范围,超出部分将被截断,不再增加目标值 (Proximal Policy Optimization — Spinning Up 文档) (Proximal Policy Optimization — Spinning Up 文档)。这种策略确保了每次更新不会使新策略偏离旧策略过多,从而提高训练的稳定性 (Proximal Policy Optimization — Spinning Up 文档)。通过多轮迭代优化公式(3),PPO 实现了对策略的逐步改进。由于易于实现且效果出色,PPO 被广泛应用于需要稳定训练的场景,例如 OpenAI 的 ChatGPT 等大模型的强化学习微调过程中。

Group Relative Policy Optimization (GRPO): DeepSeek R1 的强化学习策略。DeepSeek R1 在强化学习阶段采用的正是基于 PPO 的改进算法——GRPO () (). GRPO (组内相对策略优化)最早由清华大学的研究者提出,用于在大模型推理任务中减少价值网络的开销、加速训练收敛 ()。PPO 需要一个同规模的价值函数网络来估计优势,而 GRPO 则摒弃了独立的价值网络,转而通过从组得分中估计基线的方式直接计算优势 ()。其做法是:对于每一个给定的问题(环境状态)q,使用当前策略 $ \pi_{\theta_{\text{old}}} $ 采样生成一个由 $ G $ 个候选输出组成的集合 $ {o_1, o_2, \ldots, o_G} $ ()。对这 $ G $ 个样本,分别计算其奖励值 $ {r_1, r_2, \ldots, r_G} $ (例如根据答案正确性和格式要求打分)。然后将该组样本的平均奖励 $ \bar{r} = \frac{1}{G} \sum_{i=1}^{G} r_i $ 作为基线,定义每个样本的优势为其奖励与平均值的标准差归一化差值:

$$ \begin{array}{c} A_{i}~=~\frac{r_{i}-\bar{r}}{\sqrt{\frac{1}{G}\sum_{j=1}^{G}(r_{j}-\bar{r})^{2}}}~.\end{array} $$


由此,奖励高于平均值的样本将获得正的优势,低于平均的得到负的优势。接下来,GRPO使用PPO类似的剪辑目标来更新策略,只是将优势和概率比改用上述组内样本:

$$ J_{\mathrm{GRPO}}\left(\theta\right)~=~\frac{1}{G}\sum_{i=1}^{G}\min\Big(\frac{\pi_{\theta}\left(o_{i}\mid q\right)}{\pi_{\theta_{\mathrm{old}}}\left(o_{i}\mid q\right)}A_{i},~\mathrm{clip}\big(\frac{\pi_{\theta}\left(o_{i}\mid q\right)}{\pi_{\theta_{\mathrm{old}}}\left(o_{i}\mid q\right)},1-\epsilon,1+\epsilon\big)A_{i}\Big)~-~\beta D(5) $$

其中 $ \beta $ 是控制 KL 惩罚强度的系数, $ \pi_{ref} $ 是一个参考策略(通常取初始模型),用于避免新策略过度偏离初始语言风格 ()()。上述公式中的第一项与 PPO 的目标形式类似,但用组内样本的比值和优势替代了单样本的;第二项是一个 KL 正则项,当策略分布与参考分布差异过大时会产生惩罚,鼓励策略更新保持在合理范围内 ()。

通过 GRPO,DeepSeek R1 在强化学习过程中无需训练一个额外的价值网络(这为拥有数百亿参数的模型节省了巨大的计算开销()),同时利用组内相对奖励有效稳定了策略梯度估计。简单来说,GRPO相当于每次针对同一问题让模型与“自己过去的多个回答”进行对比,只强化其中表现优于平均水平的输出(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。这种相对评价机制降低了梯度方差,避免了价值网络可能出现的欠拟合或过拟合问题,从而在大型语言模型的强化学习训练中表现出色。

综上,DeepSeek R1 通过 GRPO 方法成功地将 PPO 等策略梯度算法引入了大模型的训练,配合精心设计的奖励函数(准确性与格式并重)和 KL 控制,既保证了模型性能的提升,又避免了训练中策略崩溃或退化的现象()()。正是这些强化学习方法上的创新与实践,赋予了 DeepSeek R1 卓越的推理能力。

实验结果

DeepSeek R1 经过上述训练流程后,在各类标准基准上均取得了令人瞩目的成绩,显示出其强大的推理能力和全面的知识掌握程度。研究者分别对仅用强化学习训练的 DeepSeek-R1-Zero、完整多阶段训练的 DeepSeek-R1,以及蒸馏得到的小模型进行了评估(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)()。主要实验结果可以归纳如下:

强化学习带来的跃升:首先,纯强化学习版本的 DeepSeek-R1-Zero 就已经展现出非凡的进步。模型在美国高中数学竞赛 AIME 2024 上的平均一次答对率(pass@1)随着训练从初始的 15.6% 稳步提升到 71.0%(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN


博客);如果对同一道题让模型独立思考多次并采用多数投票,其成绩还能进一步提高到 86.7%,一举超越了 OpenAI 的参考模型 o1-0912(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。这种巨大的提升完全来自强化学习的自我优化过程,无需任何额外人工标注数据,证明了纯RL方法在提升推理能力方面的潜力。更有趣的是,在强化学习过程中,研究团队观察到了模型的“顿悟时刻”。随着训练进行,DeepSeek-R1-Zero 的中间版本日志中出现了模型自发的反思式输出:它会在推理链中突然用类似自我对话的语气说“让我重新思考一下”,然后推翻先前的思路找到更优解。这种类人格化的反思行为标志着模型学会了主动检查和改进自己的推理,是强化学习赋予模型的新能力(DeepSeek-R1 Teardown: How Reinforcement Learning Propelled It Past o1 in the AI Race - Predibase - Predibase)(DeepSeek-R1 Teardown: How Reinforcement Learning Propelled It Past o1 in the AI Race - Predibase - Predibase)。

DeepSeek R1 性能对比:完整训练后的 DeepSeek R1 在多个关键基准上达到或逼近了当前顶尖闭源模型的水平(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。在复杂推理任务上,R1 表现尤为突出:

数学推理方面,R1 在 AIME 2024 竞赛题上取得 79.8% 的一次作答正确率,略微超过了 OpenAI-o1-1217 模型 ();在更高难度的 MATH 基准测试(500 道竞赛数学题)上,R1 更是达到了 97.3% 的惊人成绩,与 OpenAI-o1-1217 不相上下 ()。

代码理解与生成方面,R1 在 Codeforces 编程竞赛中达到了 2029 的 Elo 积分,击败了约 96.3% 的人类参赛者(),表现出专家级的编程解题能力。此外,在 LiveCodeBench 等代码生成评测中,R1 的表现也处于领先水平。

常识和专业知识方面,R1 在百科问答基准 MMLU 上取得 90.8% 的准确率,在医学、法律等专业考试风格的 MMLU-Pro 上取得 84.0%,在中国高校考试基准 C-Eval 上取得 80%+ 的平均成绩,在这些任务上虽略低于 OpenAI-o1-1217,但远远领先于之前的开源模型 DeepSeek-V3()。例如,R1 在 MMLU 上比 DeepSeek-V3 提升了将近20个百分点,显示了强化学习对于增强知识问答能力的价值。

在综合能力上,R1 的表现也十分均衡。例如在复杂推理问答基准 GPQA Diamond 上达到 71.5% 的准确率,仅比 OpenAI-o1-1217 略低几个百分点 ();在简单问答 SimpleQA 上,R1 超过了前代模型 DeepSeek-V3 ()。总体而言,DeepSeek R1 的各项指标全面超越了之前的 DeepSeek-V3 模型,并在多数评测上接近 OpenAI-o1 系列模型的水准 (『DeepSeek论文精读』6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN 博客)。

模型开放性与可解释性:DeepSeek R1 的一个重大优势在于其开源开放。从性能上看,R1 相比同级别的商用模型展现出极佳的性价比——据报道其推理 API 价格仅为 OpenAI o1 的 1/27 (DeepSeek-R1 Teardown: How Reinforcement Learning Propelled It Past o1 in the AI Race - Predibase - Predibase),这使得更广泛的研究者和开发者能够以低成本使用和微调这样强大的模型。同时,R1 输出中包含的显式推理链极大增强了模型的可解释性 (DeepSeek-R1 Teardown: How Reinforcement Learning Propelled It Past o1 in the AI Race - Predibase - Predibase)。在医疗等高风险领域,专家可以通过审查 R1 给出的思维过程了解模型决策的依据,从而更好地判断模型的可靠性 (DeepSeek-R1


Teardown: How Reinforcement Learning Propelled It Past o1 in the AI Race - Predibase - Predibase)。这种透明度是许多闭源“黑箱”模型所不具备的。值得注意的是,DeepSeek团队在R1的推理日志中捕捉到模型自行产生的疑问与反思,甚至会用类似人类的措辞重新审视自己的解答步骤(DeepSeek-R1 Teardown: How Reinforcement Learning Propelled It Past o1 in the AI Race - Predibase - Predibase)。这不仅验证了强化学习在大模型中催生新能力的可能性,也为AI系统的可解释性研究提供了宝贵案例。

综上所述,DeepSeek R1 通过强化学习训练达到了与最先进闭源模型比肩的性能,在数学、编程等需要推理能力的任务上表现尤为突出。同时,它保持了开源模型的透明和可控特点,其链式思维输出使得模型的决策过程对用户可见。这些成果充分证明了强化学习在大模型训练中的价值,也让DeepSeek R1 成为了业界关注的焦点。

数学推导

在本节中,我们将对前文提到的关键公式进行简要推导,以加深对强化学习训练原理的理解。

(1) 策略梯度公式推导:我们以策略梯度定理 (Vanilla Policy Gradient — Spinning Up 文档) 为例,推导公式(1):

$$ \nabla_{\theta}J(\theta)=\mathbb{E}{\tau\sim\pi)\right]. $$ }}\left[\sum_{t=0}^{\infty}\nabla_{\theta}\log\pi_{\theta}\left(a_{t}|s_{t}\right)A^{\pi_{\theta}}(s_{t},a_{t

首先,定义策略 $ \pi_{\theta} $ 的性能指标为初始状态分布 $ D(s_{0}) $ 下的期望总回报:

$$ J(\theta)=\mathbb{E}{s}\sim D}\left[V^{\pi_{\theta}}(s_{0})\right]=\mathbb{E{s\right], $$ },\tau}\left[\sum_{t=0}^{\infty}\gamma^{t}r_{t+1

其中 $ \tau = (s_0, a_0, r_1, s_1, \ldots) $ 表示由策略 $ \pi_\theta $ 产生的一条轨迹。利用期望的性质,我们将对 $ \theta $ 的导数交换到和式内部:

$$ \nabla_{\theta}J(\theta)=\mathbb{E}{\tau}\Big[\sum(\tau)\Big], $$ }^{\infty}\gamma^{t}\nabla_{\theta}P_{\theta


其中 $ P_{\theta}(\tau) $ 是轨迹概率。由于轨迹概率可以分解为各步策略概率的乘积,即 $ P_{\theta}(\tau) = P(s_{0}) \prod_{t=0}^{\infty} \pi_{\theta}(a_{t} | s_{t}) P(s_{t+1} | s_{t}, a_{t}) $,对数导数的链式法则表明:

$$ \nabla_{\theta}\log P_{\theta}(\tau)=\sum_{t=0}^{\infty}\nabla_{\theta}\log\pi_{\theta}\left(a_{t}|s_{t}\right), $$

而环境状态转移概率不依赖 $ \theta $,故不出现于导数中。由此可得:

$$ \nabla_{\theta}P_{\theta}\left(\tau\right)=P_{\theta}\left(\tau\right)\sum_{t=0}^{\infty}\nabla_{\theta}\log\pi_{\theta}\left(a_{t}|s_{t}\right). $$

将上式代入 $ \nabla_\theta J(\theta) $ 并应用 $ \mathbb{E}[X \nabla \log P] = \mathbb{E}[X \frac{\nu r}{P}] = \nabla \mathbb{E}[X] $ 的性质(亦称“Likelihood Ratio技巧”或“REINFORCE”方法(Vanilla Policy Gradient — Spinning Up 文档)),我们得到:

$$ \begin{align}\nabla_{\theta}J(\theta)&=\mathbb{E}{\tau}\Big[\sum}^{\infty}\gamma^{t}P_{\theta}(\tau)\sum_{k=0}^{\infty}\nabla_{\theta}\log\pi_{\theta}\left(a_{k}\mid s_{k}\right)\Big]\&=\mathbb{E{\tau}\Big[P}(\tau)\sum_{k=0}^{\infty}\nabla_{\theta}\log\pi_{\theta}\left(a_{k}\mid s_{k}\right)\sum_{t=0}^{\infty}\gamma^{t}r_{t+1}\Big]\&=\mathbb{E{\tau}\Big[P\Big],\end{align}(\tau)\sum_{k=0}^{\infty}\nabla_{\theta}\log\pi_{\theta}\left(a_{k}\mid s_{k}\right)G_{k} $$

其中 $ G_{k} = \sum_{t=k}^{\infty} \gamma^{t-k} r_{t+1} $ 表示从第 k 步开始的折扣回报。注意到在期望下可以将 $ P_{\theta}(\tau) $ 消去,得到:

$$ \nabla_{\theta}J(\theta)=\mathbb{E}{\tau\sim\pi\right]. $$ }}\left[\sum_{k=0}^{\infty}\nabla_{\theta}\log\pi_{\theta}\left(a_{k}|s_{k}\right)G_{k

这就是著名的 REINFORCE 算法更新规则。如果我们进一步将 $ G_k $ 拆分为 $ Q^{\pi_\theta}(s_k, a_k) $ 和后续部分,并减去一个与状态有关的基线 $ V^{\pi_\theta}(s_k) $(减去基线不改变期望值 (Vanilla Policy Gradient — Spinning Up 文档)),就得到优势 $ A^{\pi_\theta}(s_k, a_k) = Q^{\pi_\theta}(s_k, a_k) - V^{\pi_\theta}(s_k) $,从而推导出策略梯度定理形式:

$$ \nabla_{\theta}J(\theta)=\mathbb{E}{\tau\sim\pi\right)\right], $$ }}\left[\sum_{k=0}^{\infty}\nabla_{\theta}\log\pi_{\theta}\left(a_{k}|s_{k}\right)A^{\pi_{\theta}}\left(s_{k},a_{k


与公式(1)一致。这个推导表明,通过采样一条轨迹,我们可以用 $ \sum_k \nabla_\theta \log \pi_\theta(a_k | s_k) A(s_k, a_k) $ 作为 $ \nabla_\theta J(\theta) $ 的无偏估计。实际实现中会对多个轨迹取平均,或者采用 Actor-Critic 引入价值网络来估计 $ A(s, a) $ 降低方差。

(2) DQN目标推导:DQN的损失函数公式(2)来源于Q-learning的更新规则。Q-learning的最优贝尔曼方程为:

$$ Q^{}(s,a)=\mathbb{E}\left[r+\gamma\max_{a^{\prime}}Q^{}(s^{\prime},a^{\prime})\mid s,a\right]. $$

为逼近上述不动点,DQN 定义了目标 $ y_{\text{target}} = r + \gamma \max_{a'} Q(s', a'; \theta^-) $,并希望 $ Q(s, a; \theta) $ 接近该目标值 (RL(十三)深度Q网络 (DQN) _dqnl-CSDN博客)。于是构造平方损失:

$$ L(\theta)=\mathbb{E}\Big[\big(y_{\mathrm{t a r g e t}}\mathrm{~-~}Q(s,a;\theta)\big)^{2}\Big], $$

即公式(2)。通过最小化此损失,DQN 的参数更新如同执行 Q-learning 的迭代,使网络输出逐步逼近 $ Q^{*}(s,a) $ (RL(十三)深度Q网络(DQN)dqnl-CSDN博客)。值得注意的是,引入固定的 $ \theta^{-} $(目标网络)来计算 $ y $ 是为了避免同时更新时 Q 值估计的震荡 (RL(十三)深度Q网络(DQN)_dqnl-CSDN博客),从而提升训练稳定性。

(3) PPO剪辑目标由来:PPO的目标函数(3)可以看作 Trust Region Policy Optimization (TRPO) 的一阶近似。TRPO 通过约束新旧策略的 KL 散度来确保策略更新不超出信赖域,而 PPO 则直接限制策略概率比 $ r(\theta) $ 的偏离幅度 (Proximal Policy Optimization — Spinning Up 文档)。PPO 的推导从策略梯度目标出发,引入一个剪辑函数:

$$ \begin{array}{r l r}{L_{\mathrm{P G}}\left(\theta\right)=\mathbb{E}\left[r(\theta)A\right],}&{{}}&{L_{\mathrm{C L I P}}\left(\theta\right)=\mathbb{E}\left[\operatorname*{m i n}(r(\theta)A,\mathrm{\boldmath~c l i p}(r(\theta),1\pm\epsilon)A)\right].}\end{array} $$


当 $ r(\theta) $ 在 $ [1 - \epsilon, 1 + \epsilon] $ 范围内时,剪辑不起作用, $ L_{\mathrm{CLIP}} $ 等同于策略梯度目标 $ L_{\mathrm{PG}} $;但如果 $ r(\theta) $ 尝试超出该范围,超出的部分将被截断,使目标不再随 $ r(\theta) $ 继续变大或变小 (Proximal Policy Optimization — Spinning Up 文档)。通过这种方式,PPO 有效地约束了每次策略更新的幅度。经过推导,可以证明最大化 $ L_{\mathrm{CLIP}} $ 近似地实现了对策略的信赖域优化 (Proximal Policy Optimization — Spinning Up 文档)。

(4) GRPO组内优势计算:对于 GRPO,我们重点推导公式(4)中优势的计算方式。组内优势的思路是将同一问题的候选输出放在一起比较,以它们的平均性能为参照。令组内第 $ i $ 个输出的奖励为 $ r_i $,组平均奖励为 $ \bar{r} = \frac{1}{G} \sum_{j=1}^{G} r_j $,则 $ i $ 的优势定义为:

$$ A_{i}=\frac{r_{i}-\bar{r}}{\sqrt{\frac{1}{G}\sum_{j=1}^{G}(r_{j}-\bar{r})^{2}}}, $$

即公式(4)。可以看出, $ A_{i} $ 实际是对奖励减去平均值后的标准分进行缩放:高于均值的奖励会得到正优势,低于均值则为负。这样的定义确保了 $ {A_{i}} $ 在该组样本中和为 0,这类似于使用每组的均值作为基线。基于优势定义,GRPO 的策略更新目标函数形式上与 PPO 类似,只不过将单样本扩展为组均值形式,并加入了额外的 KL 正则项用于约束策略变化幅度(公式(5))。GRPO 目标的推导过程较为复杂,这里不再赘述,但直观理解是:它将价值网络隐含在了组内评分的计算中,用相对奖励代替了绝对价值,从而避免了训练一个额外价值模型的开销 ()。

以上推导展示了 DeepSeek R1 所涉及的关键算法的数学原理。从策略梯度理论到值函数逼近,再到新颖的组内相对优化,每一步数学推导都确保了训练过程的有效性与稳定性,也解释了为何这些算法能够在实践中提升模型性能。

实际应用

作为一款具备强推理能力的大型语言模型,DeepSeek R1在诸多领域都有潜在应用价值:

教育辅导:凭借在数学和逻辑推理上的出色表现,DeepSeek R1 可用作智能教学助手,帮助学生分解复杂题目、给出步骤清晰的解题过程(【DeepSeek论文精读】6. DeepSeek R1:通过强化学习激发大语言模型的推理能力-CSDN博客)。例如,它能够为奥林匹克竞赛题生成详细的证明过程,或者指导编程初学者调试代码并解释每一步操作。这种逐步推理能力使其非常适合用于在线教育平台、作业辅导工具等。

科研与工程助理:DeepSeek R1 在代码生成和科学问答上的高水平表现意味着它可以胜任科研和工程领域的辅助工作。研究人员可以利用它来验证数学推导、探索证明思路;软件工程师则能让它根据自


然语言描述产出框架代码或者算法伪代码,并通过链式思维了解代码生成的逻辑依据。在需要严谨推理的场合(如科学分析报告、法律推理、电路设计等),R1提供的解释性答案将极具参考价值。

专业问答系统:得益于大规模知识的学习和强化学习对答案准确性的优化,DeepSeek R1 可部署为专业领域的问答系统。例如,在医疗诊断辅助中,医生可以向模型提问并得到附带推理过程的回答,模型会展示其诊断思路和依据,从而方便医生核验 (DeepSeek-R1 Teardown: How Reinforcement Learning Propelled It Past o1 in the AI Race - Predibase - Predibase);在金融分析中,模型可以对市场数据和财经新闻进行推理解读,提供带有逻辑论证的预测建议。这些应用中,R1 的输出不仅给出结论,也给出理由,提高了答案的可信度。

对话与决策支持:经过最终阶段的人类偏好对齐,DeepSeek R1 兼具善解人意的对话能力和缜密的推理能力,适合充当决策支持助手。例如,企业管理者可以询问模型某项决策的可行性分析,R1 会综合数据和经验给出利弊权衡的建议方案;普通用户也可以与之讨论复杂问题,如规划行程、评估投资选择等,R1 会一步步解释思考过程,让用户充分了解建议背后的逻辑。

需要强调的是,在这些应用中,DeepSeek R1 输出的链式思维不仅提供了答案,也为用户审查模型行为、定位潜在错误提供了便利。这种透明度对于高风险场景尤为重要,例如医疗诊断中的误答可以被医生通过审阅推理过程及时发现并纠正。因此,DeepSeek R1 不仅是一个功能强大的问题求解引擎,也可以看作一个愿意“亮出草稿过程”的智能助手,赋予用户更大的掌控权和信任感。

当然,在实际部署中还需考虑模型的响应速度、隐私安全等因素,但总体而言,DeepSeek R1展现出的推理能力和可解释特性使其在众多领域具有很高的应用前景。

挑战与未来展望

尽管取得了令人瞩目的成果,DeepSeek R1仍有一些局限和改进空间:

泛化能力尚待加强:目前 DeepSeek R1 在某些复杂交互任务上的能力仍不及前代模型 DeepSeek-V3。例如,R1 在工具使用、函数调用、长对话等场景下表现稍弱()。未来可以探索将更长链的思维(Long CoT)引入这些任务,提升模型处理多轮推理和复杂指令的能力()。

多语言支持有待完善:R1 主要针对中英文进行了优化。如果遇到其他语言的输入,可能会出现回答语言与提问语言不一致的情况(例如用户用法语提问,模型以英文思考和回答)()。后续版本中,团队计划针对多语言场景进行专项训练,确保模型在非中英文环境下也能保持思维语言与提问语言一致,不出现“语言混杂”的现象。


提示鲁棒性和用户体验:实验发现,DeepSeek R1对提示的敏感度较高——在few-shot示例的提示下性能反而有所下降,因此官方建议用户采用零样本(zero-shot)方式提问()。这透露出模型在提示泛化上的不足。未来工作将侧重于提高模型对不同提示风格的鲁棒性,可能的方法包括增加多样化提示的数据训练、引入提示优化算法等,以便用户在各种对话上下文中都能得到可靠输出。

强化学习效率与成本:虽然 GRPO 算法极大降低了价值网络的计算量,DeepSeek R1 的强化学习训练仍耗费了巨大的算力资源。特别是在需要执行外部环境的任务(如代码编写需要编译运行测试)时,评估开销极高,使大规模 RL 难以直接应用()。对此,研究者计划采用异步评估、自适应采样等策略提升强化学习效率(),例如在软件工程任务上引入并行的代码执行评估、利用拒绝采样筛除明显错误的代码再评测等手段,从而在未来版本中进一步挖掘模型在此类任务上的潜力。

奖励设计与安全性:DeepSeek R1 在训练中避免了使用复杂的神经奖励模型,从而降低了“奖励作弊(hacking)”的风险()。然而,如何为开放域对话定义理想的奖励函数仍是挑战。例如,确保模型输出既正确又符合伦理,需要综合考虑多目标的奖励信号。未来的研究可能会探索更智能的奖励模型方法,或引入人类反馈(如 RLHF 中的比较数据)来训练更可靠的偏好模型,以进一步提升模型对人类期望的对齐。

未来,随着这些问题的逐步解决,我们有理由期待 DeepSeek R1 及其后继模型在更广泛的应用场景中大放异彩。一方面,更完善的强化学习方案将使模型在推理智能上持续逼近甚至超越人类水准;另一方面,更精细的对齐和安全机制将确保模型可信可靠地服务于实际应用。DeepSeek R1 展示的成功为大模型训练开辟了新路径:通过强化学习激发潜能、通过蒸馏实现普惠。这为 AI 领域提供了新的思路,即未来的大模型发展不再完全依赖于规模和数据的堆砌,而是注重训练范式的创新。可以预见,随着强化学习与大模型架构的深度融合,下一代人工智能助手将在推理复杂度、交互能力以及自主改进能力上取得突破,为通向通用人工智能(AGI)的目标迈出坚实一步。