本文介绍了构建推理模型的四种主要方法,或者说如何增强大语言模型的推理能力。希望这能为你提供有价值的见解,并帮助你在快速发展的文献和围绕这一话题的热议中找准方向。
2024年,大语言模型领域呈现出日益专业化的趋势。除了预训练和微调,我们还见证了从RAG到代码助手等各类专业化应用的兴起。我预计这一趋势将在2025年加速,领域和应用的特定优化(即“专业化”)将受到更多重视。

推理模型的开发正是这些专业化方向之一。这意味着我们对大语言模型进行精炼,使其擅长处理那些最好通过中间步骤来解决的复杂任务,例如谜题、高等数学和编程挑战。然而,这种专业化并不会取代其他大语言模型的应用。因为将大语言模型转变为推理模型也会带来某些缺点,我将在后文讨论。
为了让你对下文内容有个简要了解,在本文中,我将:
-
解释“推理模型”的含义
-
讨论推理模型的优缺点
-
概述DeepSeek R1背后的方法论
-
描述构建和改进推理模型的四种主要方法
-
分享DeepSeek V3和R1发布后对大语言模型格局的看法
-
提供在预算有限的情况下开发推理模型的技巧
希望本文能对你有所帮助,尤其是在今年AI持续快速发展的背景下!
如果你从事AI(或广义的机器学习)工作,你可能对模糊且争议不断的定义并不陌生。“推理模型”这个词也不例外。最终,会有人在论文中给出正式定义,但紧接着又会在下一篇论文中被重新定义,如此循环往复。
在本文中,我将“推理”定义为回答那些需要复杂、多步生成并包含中间步骤的问题的过程。例如,像“法国的首都是哪里?“这样的事实性问题不涉及推理。相比之下,像”如果一列火车以60英里/小时的速度行驶3小时,它走了多远?“这样的问题则需要一些简单的推理。例如,它需要先认识到距离、速度和时间之间的关系,然后才能得出答案。

大多数现代LLM具备基础推理能力,能回答诸如“火车以60英里/小时速度行驶3小时,能走多远?“这类问题。因此,如今当我们谈论推理模型时,通常指的是擅长处理更复杂推理任务的LLM,例如解谜、猜谜和数学证明。
此外,目前大多数标榜为推理模型的LLM会在回复中包含“思考”或“思维”过程。至于LLM是否真的能“思考”以及如何“思考”,则是另一个话题。
推理模型的中间步骤有两种呈现方式:其一,如图前文所示,中间步骤会明确包含在回复中;其二,某些推理LLM(如OpenAI的o1)会运行多次迭代,但中间步骤对用户不可见。

现在我们已经定义了推理模型,可以进入更有趣的部分:如何构建和改进用于推理任务的LLM。不过在深入技术细节之前,有必要先思考何时真正需要推理模型。
何时需要推理模型? 推理模型擅长处理解谜、高等数学和复杂编程等任务,但对于摘要、翻译或知识问答等简单任务并非必需。事实上,对所有任务都使用推理模型可能既低效又昂贵。例如,推理模型通常使用成本更高、输出更冗长,有时还会因“过度思考”而更容易出错。这里同样适用简单原则:根据任务选择合适的工具(或LLM类型)。
推理模型的主要优势与局限性总结如下图所示。

在下一节讨论构建和改进推理模型的四种主要方法之前,我想先简要概述DeepSeek R1的流程(详见DeepSeek R1技术报告)。这份报告既是一个有趣的案例研究,也是开发推理LLM的蓝图。
需要注意的是,DeepSeek并未发布单一的R1推理模型,而是推出了三个不同变体:DeepSeek-R1-Zero、DeepSeek-R1和DeepSeek-R1-Distill。
根据技术报告中的描述,我将这些模型的开发过程总结如下方示意图所示。

接下来,我们简要回顾一下上图所示的过程。更多细节将在下一节中介绍,届时我们将讨论构建和改进推理模型的四种主要方法。
(1) DeepSeek-R1-Zero: 该模型基于2024年12月发布的671B预训练DeepSeek-V3基础模型。研究团队使用两种奖励类型的强化学习(RL)对其进行训练。这种方法被称为“冷启动”训练,因为它没有包含监督微调(SFT)步骤,而该步骤通常是基于人类反馈的强化学习(RLHF)的一部分。
(2) DeepSeek-R1: 这是DeepSeek的旗舰推理模型,建立在DeepSeek-R1-Zero之上。团队通过额外的SFT阶段和进一步的RL训练对其进行了优化,改进了“冷启动”的R1-Zero模型。
(3) DeepSeek-R1-Distill*: 利用前序步骤生成的SFT数据,DeepSeek团队对Qwen和Llama模型进行了微调,以增强其推理能力。虽然这不是传统意义上的蒸馏,但该过程涉及在更大的DeepSeek-R1 671B模型的输出上训练较小的模型(Llama 8B和70B,以及Qwen 1.5B–30B)。
在本节中,我将概述当前用于增强LLM推理能力以及构建专用推理模型(如DeepSeek-R1、OpenAI的o1和o3等)的关键技术。
注意:o1和o3的具体工作原理在OpenAI之外仍不为人知。但据传,它们结合了推理和训练技术。
提高LLM推理能力(或任何能力)的一种方法是推理时扩展。这个术语可能有多种含义,但在本文中,它指的是在推理过程中增加计算资源以提高输出质量。
一个粗略的类比是,人类在解决复杂问题时,如果给予更多思考时间,往往能产生更好的回答。同样,我们可以应用一些技术,鼓励LLM在生成答案时进行更多“思考”。(不过,LLM是否真的会“思考”是另一个话题。)
一种直接的推理时扩展方法是巧妙的提示工程。一个经典例子是思维链(CoT)提示,即在输入提示中包含“逐步思考”等短语。这鼓励模型生成中间推理步骤,而不是直接跳到最终答案,这通常(但并非总是)能在更复杂的问题上带来更准确的结果。(注意,对于简单的知识性问题,如“法国的首都是什么”,采用这种策略没有意义,这也是判断推理模型是否适用于给定输入查询的一个好经验法则。)

上述CoT方法可被视为推理时扩展,因为它通过生成更多输出标记使推理成本更高。
另一种推理时扩展方法是使用投票和搜索策略。一个简单的例子是多数投票,即让LLM生成多个答案,然后通过多数投票选择正确答案。类似地,我们可以使用束搜索和其他搜索算法来生成更好的响应。
我强烈推荐我在之前的《2024年值得关注的AI研究论文(第二部分)》(https://magazine.sebastianraschka.com/p/ai-research-papers-2024-part-2)文章中描述的论文《优化LLM测试时计算可比的扩展模型参数更有效》(https://arxiv.org/abs/2408.03314),以了解更多关于这些不同策略的细节。

DeepSeek R1的技术报告将常见的推理时扩展方法(如基于过程奖励模型和基于蒙特卡洛树搜索的方法)归类为“不成功的尝试”。这表明DeepSeek并未明确使用这些技术,除了R1模型自然倾向于生成更长的响应,这相对于V3基础模型而言是一种隐式的推理时扩展形式。
然而,显式的推理时扩展通常是在应用层而非LLM内部实现的,因此DeepSeek可能仍在其应用中应用此类技术。
我怀疑OpenAI的o1和o3模型使用了推理时扩展,这可以解释为什么它们相对于GPT-4o等模型来说成本较高。除了推理时扩展,o1和o3可能使用了与DeepSeek R1类似的强化学习管道进行训练。更多关于强化学习的内容将在下面两节中介绍。
我个人认为DeepSeek R1论文的一个亮点是,他们发现推理作为一种行为可以从纯粹的强化学习(RL)中涌现出来。让我们更详细地探讨这意味着什么。
如前所述,DeepSeek开发了三种类型的R1模型。第一种是DeepSeek-R1-Zero,它基于DeepSeek-V3基础模型构建,这是他们在2024年12月发布的标准预训练LLM。与典型的强化学习管道不同(通常在强化学习之前应用监督微调SFT),DeepSeek-R1-Zero仅使用强化学习进行训练,没有初始的SFT阶段,如下方图表所示。

尽管如此,这一强化学习过程与常用的RLHF方法类似,后者通常用于对LLM进行偏好微调。(我在文章《LLM训练:RLHF及其替代方案》中更详细地介绍了RLHF。)然而,如上所述,DeepSeek-R1-Zero的关键区别在于,他们跳过了用于指令微调的监督微调(SFT)阶段。这就是为什么他们称其为“纯”强化学习。(尽管在LLM语境下的强化学习与传统强化学习有很大不同,这又是另一个话题了。)
在奖励方面,他们没有使用基于人类偏好训练的奖励模型,而是采用了两种奖励:准确性奖励和格式奖励。
-
准确性奖励使用LeetCode编译器验证编程答案,并使用确定性系统评估数学回答。
-
格式奖励依赖LLM裁判来确保回答符合预期格式,例如将推理步骤放在
标签内。
令人惊讶的是,这种方法足以让LLM发展出基本的推理能力。研究人员观察到了一个“顿悟”时刻,即模型开始在其回答中生成推理轨迹,尽管并未明确训练它这样做,如下图所示。

虽然R1-Zero并非顶尖的推理模型,但它确实通过生成中间的“思考”步骤展示了推理能力,如上图所示。这证实了使用纯强化学习开发推理模型是可能的,而DeepSeek团队是首个展示(或至少发表)这一方法的团队。
接下来,我们来看DeepSeek的旗舰推理模型DeepSeek-R1的开发过程,它可作为构建推理模型的蓝图。该模型在DeepSeek-R1-Zero的基础上进行了改进,通过引入额外的监督微调(SFT)和强化学习(RL)来提升推理性能。
请注意,在RL之前加入SFT阶段实际上很常见,正如标准RLHF流程中所见。OpenAI的o1很可能也是采用类似方法开发的。

如上图所示,DeepSeek团队使用DeepSeek-R1-Zero生成了他们所谓的“冷启动”SFT数据。“冷启动”一词指的是这些数据由DeepSeek-R1-Zero生成,而该模型本身并未经过任何监督微调(SFT)数据的训练。
利用这些冷启动SFT数据,DeepSeek首先通过指令微调训练模型,随后进入另一个强化学习(RL)阶段。该RL阶段保留了DeepSeek-R1-Zero的RL流程中使用的相同准确率和格式奖励,但额外增加了一致性奖励,以防止模型在回答中混用多种语言。
RL阶段之后是另一轮SFT数据收集。在此阶段,使用最新的模型检查点生成了60万个思维链(CoT)SFT样本,同时利用DeepSeek-V3基础模型额外创建了20万个基于知识的SFT样本。
这60万+20万个SFT样本随后用于对DeepSeek-V3基础模型进行指令微调,之后再进行最后一轮RL。在这一阶段,他们再次使用基于规则的方法为数学和编码问题提供准确率奖励,而其他类型的问题则使用人类偏好标签。总体而言,这与常规的RLHF非常相似,区别在于SFT数据包含(更多)CoT样本,且RL除了基于人类偏好的奖励外,还包含可验证的奖励。
得益于额外的SFT和RL阶段,最终模型DeepSeek-R1相比DeepSeek-R1-Zero在性能上有了显著提升,如下表所示。

到目前为止,我们已经介绍了构建和改进推理模型的三种关键方法:
- 推理时扩展,一种无需训练或修改底层模型即可提升推理能力的技术。
- 纯强化学习(RL),如DeepSeek-R1-Zero所示,证明了推理能力可以在没有监督微调的情况下作为学习行为涌现。
- 监督微调(SFT)加RL,由此诞生了DeepSeek的旗舰推理模型DeepSeek-R1。
那么,还剩下什么?模型“蒸馏”。
令人惊讶的是,DeepSeek还发布了通过他们称为蒸馏的过程训练的更小模型。然而,在LLM的语境中,蒸馏并不一定遵循深度学习中传统的知识蒸馏方法。传统上,在知识蒸馏中(正如我的《机器学习Q与AI》[https://amzn.to/40YYowg]一书第6章简要描述的),较小的学生模型会在较大教师模型的对数几率以及目标数据集上进行训练。
相反,这里的蒸馏指的是在由较大LLM生成的SFT数据集上,对较小的LLM(例如Llama 8B和70B以及Qwen 2.5模型(0.5B至32B))进行指令微调。具体来说,这些较大的LLM是DeepSeek-V3和DeepSeek-R1的中间检查点。事实上,用于此蒸馏过程的SFT数据与上一节中描述的用于训练DeepSeek-R1的数据集相同。
为了澄清这一过程,我在下图中突出显示了蒸馏部分。

他们为什么要开发这些蒸馏模型?在我看来,主要有两个关键原因:
- 更小的模型效率更高。这意味着运行成本更低,同时也能在较低端的硬件上运行,这对许多像我这样的研究人员和爱好者来说尤其有吸引力。
- 纯SFT的案例研究。这些蒸馏模型作为一个有趣的基准,展示了在没有强化学习的情况下,纯监督微调(SFT)能将模型提升到何种程度。
下表比较了这些蒸馏模型与其他流行模型,以及DeepSeek-R1-Zero和DeepSeek-R1的性能。

正如我们所见,蒸馏模型明显弱于DeepSeek-R1,但与DeepSeek-R1-Zero相比却出奇地强,尽管其规模小了好几个数量级。同样有趣的是,这些模型与o1 mini相比表现如何(我怀疑o1-mini本身可能就是o1的一个类似蒸馏版本)。
在结束本节并得出结论之前,还有一个有趣的比较值得一提。DeepSeek团队测试了DeepSeek-R1-Zero中出现的涌现推理行为是否也会出现在更小的模型中。为了探究这一点,他们将DeepSeek-R1-Zero的纯RL方法直接应用于Qwen-32B。
该实验的结果总结在下表中,其中QwQ-32B-Preview作为参考推理模型,是基于Qwen 2.5 32B由Qwen团队开发的(我认为训练细节从未公开过)。这一比较提供了额外的见解,即纯RL本身是否能在远小于DeepSeek-R1-Zero的模型中诱导出推理能力。

有趣的是,结果表明,对于较小的模型,蒸馏远比纯RL有效。这与以下观点一致:仅靠RL可能不足以在此规模模型中诱导出强大的推理能力,而在处理小模型时,基于高质量推理数据的SFT可能是一种更有效的策略。
为了完整性,表中如果能包含以下额外比较会更有用:
- 使用SFT + RL训练的Qwen-32B,类似于DeepSeek-R1的开发方式。这将有助于确定当RL与SFT结合时,与纯RL和纯SFT相比,能带来多大的改进。
2. DeepSeek-V3 仅使用纯 SFT 进行训练,类似于蒸馏模型的创建方式。这样可以进行直接比较,以了解 RL + SFT 相对于纯 SFT 的效果。
在本节中,我们探讨了构建和改进推理模型的四种不同策略:
-
推理时扩展无需额外训练,但会增加推理成本,随着用户数量或查询量的增长,大规模部署的成本会更高。尽管如此,对于提升已有强模型的性能来说,这仍然是一个无需多虑的选择。我强烈怀疑 o1 利用了推理时扩展,这有助于解释为什么它在每 token 基础上比 DeepSeek-R1 更昂贵。
-
纯 RL 在研究目的上很有趣,因为它提供了对推理作为涌现行为的洞察。然而,在实际模型开发中,RL + SFT 是更受青睐的方法,因为它能产生更强的推理模型。我强烈怀疑 o1 也使用了 RL + SFT 进行训练。更准确地说,我相信 o1 从一个比 DeepSeek-R1 更弱、更小的基础模型开始,但通过 RL + SFT 和推理时扩展进行了弥补。
-
如上所述,RL + SFT 是构建高性能推理模型的关键方法。DeepSeek-R1 是一个很好的蓝图,展示了如何实现这一点。
-
蒸馏是一种有吸引力的方法,尤其适用于创建更小、更高效的模型。然而,其局限性在于蒸馏不会推动创新或产生下一代推理模型。例如,蒸馏始终依赖于现有的更强模型来生成监督微调 (SFT) 数据。
我期待看到的下一步有趣方向是将 RL + SFT(方法 3)与推理时扩展(方法 1)相结合。这很可能就是 OpenAI o1 正在做的事情,只是它可能基于一个比 DeepSeek-R1 更弱的基础模型,这解释了为什么 DeepSeek-R1 性能如此出色,同时在推理时保持相对低廉的成本。
最近几周,很多人询问我对 DeepSeek-R1 模型的看法。简而言之,我认为它们是一项了不起的成就。作为一名研究工程师,我特别欣赏那份详细的技术报告,它提供了我可以学习的方法论见解。
最令人着迷的收获之一是推理如何作为纯 RL 的行为涌现出来。而且令人印象深刻的是,DeepSeek 在宽松的开源 MIT 许可下开源了他们的模型,其限制甚至比 Meta 的 Llama 模型还要少。
与 o1 相比如何?
DeepSeek-R1 比 o1 更好吗?我认为它们大致处于同一水平。但突出的一点是,DeepSeek-R1 在推理时更高效。这表明 DeepSeek 可能在训练过程中投入了更多,而 OpenAI 可能更依赖推理时扩展来支持 o1。
话虽如此,直接比较 o1 和 DeepSeek-R1 很困难,因为 OpenAI 没有透露太多关于 o1 的信息。例如,我们不知道:
-
o1 是否也是混合专家 (MoE) 模型?
-
o1 的规模有多大?
-
o1 会不会只是 GPT-4o 的一个略微改进版本,仅经过少量 RL + SFT 和大量推理时扩展?
在不了解这些细节的情况下,直接比较仍然是不公平的。
训练 DeepSeek-R1 的成本
另一个讨论点是开发 DeepSeek-R1 的成本。有人提到约 600 万美元的训练成本,但他们可能混淆了 DeepSeek-V3(去年 12 月发布的基础模型)和 DeepSeek-R1。
这 600 万美元的估算基于假设每 GPU 小时 2 美元,以及 DeepSeek-V3 最终训练所需的 GPU 小时数,这一数据最初是在 2024 年 12 月讨论的。
然而,DeepSeek 团队从未披露过 R1 的确切 GPU 小时数或开发成本,因此任何成本估算都纯属猜测。
无论如何,DeepSeek-R1 是开放权重推理模型的一个重要里程碑,其推理时的效率使其成为 OpenAI 的 o1 的一个有趣替代方案。
开发一个 DeepSeek-R1 级别的推理模型可能需要数十万到数百万美元,即使从像 DeepSeek-V3 这样的开放权重基础模型开始也是如此。这对于预算有限的研究人员或工程师来说可能令人沮丧。
好消息:蒸馏可以大有作为
幸运的是,模型蒸馏提供了一种更具成本效益的替代方案。DeepSeek 团队通过他们的 R1 蒸馏模型展示了这一点,这些模型虽然比 DeepSeek-R1 小得多,但推理性能却出奇地强大。然而,即使这种方法也并不完全便宜。他们的蒸馏过程使用了 80 万个 SFT 样本,这需要大量的计算资源。
有趣的是,就在 DeepSeek-R1 发布前几天,我偶然看到了一篇关于 Sky-T1 的文章,这是一个引人入胜的项目,一个小团队仅使用 1.7 万个 SFT 样本就训练了一个开放权重的 32B 模型。总成本?只有 450 美元,这比大多数 AI 会议的注册费还低。
这个例子表明,虽然大规模训练仍然昂贵,但更小、更有针对性的微调工作仍然可以以极低的成本取得令人印象深刻的结果。

根据他们的基准测试,Sky-T1 的表现大致与 o1 相当,考虑到其低廉的训练成本,这令人印象深刻。
预算内的纯 RL:TinyZero
虽然 Sky-T1 专注于模型蒸馏,但我也在“纯 RL”领域发现了一些有趣的工作。一个 notable 的例子是 TinyZero,这是一个 3B 参数的模型,复制了 DeepSeek-R1-Zero 的方法(附注:训练成本不到 30 美元)。
令人惊讶的是,即使只有 3B 参数,TinyZero 也展现出一些涌现的自我验证能力,这支持了推理能力可以通过纯 RL 涌现的观点,即使在小型模型中也是如此。
TinyZero 仓库提到研究报告仍在进行中,我一定会密切关注进一步的细节。

上述两个项目表明,即使在预算有限的情况下,也能在推理模型方面做出有趣的工作。虽然这两种方法都复现了DeepSeek-R1的方法,一个专注于纯强化学习(TinyZero),另一个专注于纯监督微调(Sky-T1),但探索如何进一步扩展这些想法将非常引人入胜。
超越传统监督微调:旅程学习
我去年遇到的一个特别有趣的方法,在论文《O1复现之旅:战略进展报告——第一部分》中有所描述。尽管标题如此,这篇论文实际上并没有复现o1。相反,它引入了一种改进蒸馏(纯监督微调)过程的不同方式。
论文中的核心思想是“旅程学习”,作为“捷径学习”的替代方案。
- 捷径学习指的是指令微调中的传统方法,即仅使用正确的解决方案路径来训练模型。
- 而旅程学习则同时包含错误的解决方案路径,使模型能够从错误中学习。
这种方法与TinyZero纯强化学习训练中观察到的自我验证能力有一定关联,但它专注于完全通过监督微调来改进模型。通过让模型接触错误的推理路径及其修正,旅程学习也可能强化自我修正能力,从而有可能使推理模型更加可靠。

这可能是未来工作的一个激动人心的方向,特别是在低预算推理模型开发中,因为基于强化学习的方法可能在计算上不切实际。
无论如何,目前推理模型领域正在进行大量有趣的工作,我相信在接下来的几个月里,我们将会看到更多令人兴奋的成果!
这本杂志是我个人的热情项目。对于那些希望支持我的人,请考虑购买一本我的《从头开始构建大型语言模型》一书。(我相信你会从这本书中收获颇丰,因为它以其他地方找不到的详细程度解释了大型语言模型的工作原理。)
如果你读了这本书并且有几分钟的空闲时间,我将非常感激你能够留下一个简短的评论。这对我们作者帮助很大!
你的支持意义重大!谢谢!