最后更新:2026年1月1日
与DeepSeek V3类似,该团队在美国一个主要假日周末发布了他们的新旗舰模型。鉴于DeepSeek V3.2的出色性能(达到GPT-5和Gemini 3.0 Pro水平),并且它也是以开放权重模型的形式提供,这绝对值得深入探讨。

我在我的大型LLM架构对比文章的最开始部分介绍了其前身DeepSeek V3,随着新架构的发布,我在过去几个月里不断扩展那篇文章。原本,在感恩节与家人团聚回来后,我计划“只是”通过增加一个新章节来扩展那篇文章,加入这个新的DeepSeek V3.2版本,但我随后意识到有太多有趣的信息需要涵盖,所以我决定将其写成一篇更长的独立文章。
有很多有趣的内容需要探讨,并且从他们的技术报告中可以学到很多东西,那么让我们开始吧!
虽然DeepSeek V3在2024年12月发布时并未立即流行起来,但基于相同架构(以DeepSeek V3作为基础模型)的DeepSeek R1推理模型帮助DeepSeek成为最受欢迎的开放权重模型之一,并且是OpenAI、Google、xAI和Anthropic等公司专有模型的合法替代品。

那么,自V3/R1以来有什么新变化?我相信DeepSeek团队今年一直非常忙碌。然而,自DeepSeek R1发布以来的10-11个月里,并没有重大的版本发布。
就我个人而言,我认为大型语言模型大约一年发布一次是合理的,因为工作量非常大。但是,我在各种社交媒体平台上看到人们宣称该团队已经“消亡”(就像昙花一现的奇迹)。
我相信DeepSeek团队也一直在忙于应对从NVIDIA芯片到华为芯片的切换。顺便说一下,我与他们没有关联,也没有与他们交谈过;这里的一切都基于公开信息。据我所知,他们已经重新使用NVIDIA芯片。
最后,也并非他们没有任何发布。今年有一些较小的版本陆续推出,例如DeepSeek V3.1和V3.2-Exp。

正如我在去年九月预测的那样,DeepSeek V3.2-Exp 的发布旨在让生态系统和推理基础设施做好准备,以托管刚刚发布的 V3.2 模型。
V3.2-Exp 和 V3.2 使用了一种非标准的稀疏注意力变体,需要自定义代码,但关于这一机制的具体细节稍后会再讨论。(我本想在我之前那篇《超越标准 LLM》的文章中涵盖它,但当时 Kimi Linear 发布了,我优先将其纳入了那篇文章中关于新注意力变体的部分。)
在进一步讨论模型细节之前,或许有必要先梳理一下整体的模型类型。最初,DeepSeek V3 是作为基础模型发布的,而 DeepSeek R1 则通过额外的后训练开发成了一个专门的推理模型。这一过程总结在下图中。
你可以在我的《理解推理型 LLM》文章中阅读更多关于上图中训练流程的内容。
这里值得注意的一点是,DeepSeek V3 是一个基础模型,而 DeepSeek R1 是一个专门的推理模型。
与 DeepSeek 并行,其他团队也发布了许多非常强大的开源权重推理模型。今年最强的开源权重模型之一是 Qwen3。最初,它是作为一个混合推理模型发布的,这意味着用户可以在同一个模型中切换推理和非推理模式。(在 Qwen3 的情况下,这种切换是通过分词器添加/省略 <think></think> 标签来实现的。)
自那以后,LLM 团队发布了(有时在两者之间反复切换)专门的推理模型和指令/推理混合模型,如下面的时间线所示。

例如,Qwen3 最初是一个混合模型,但 Qwen 团队后来分别发布了独立的指令模型和推理模型,因为这样更容易开发,并且在各自的用例中表现更好。
一些模型,如 OpenAI 的 gpt-oss,仅以混合变体形式出现,用户可以通过系统提示选择推理努力程度(我怀疑 GPT-5 和 GPT-5.1 也采用了类似的处理方式)。
而在 DeepSeek 的案例中,看起来他们从专门的推理模型(R1)转向了混合模型(V3.1 和 V3.2),方向正好相反。然而,我怀疑 R1 主要是一个研究项目,旨在开发推理方法并打造当时最好的推理模型。V3.2 的发布可能更多是为了开发一个适用于不同用例的最佳整体模型。(在这里,R1 更像是一个试验台或原型模型。)
我还怀疑,虽然 DeepSeek 团队开发了具有推理能力的 V3.1 和 V3.2,但他们可能仍在开发专门的 R2 模型。
在更详细地讨论新的 DeepSeek V3.2 发布之前,我认为先概述从 V3 到 V3.1 的主要变化会很有帮助。
我在其他几篇文章中已经详细讨论过DeepSeek V3和R1。概括来说,DeepSeek V3是一个基础模型,采用了两个值得注意的架构特点:混合专家模型(MoE)和多头潜在注意力(MLA)。
我想你现在对MoE应该已经很熟悉了,所以这里就不做介绍了。不过,如果你想了解更多,我推荐阅读我的《大型架构对比》文章中的简短概述,以获取更多背景信息。
另一个值得关注的亮点是MLA的使用。MLA被用于DeepSeek V2、V3和R1,它提供了一种内存节省策略,与KV缓存配合得特别好。MLA的核心思想是,在将键和值张量存储到KV缓存之前,先将其压缩到更低维度的空间。
在推理时,这些压缩后的张量会被投影回原始大小再使用,如下图所示。这增加了一次矩阵乘法,但减少了内存使用。
(顺便提一下,查询向量也会被压缩,但仅在训练期间,推理时不会。)

上图展示了MLA背后的主要思想:键和值首先被投影到一个潜在向量中,然后可以将其存储在KV缓存中,以减少内存需求。这需要后续再向上投影回原始的键值空间,但总体而言,它提高了效率(打个比方,你可以把它想象成LoRA中的向下和向上投影)。
请注意,查询向量也被投影到一个单独的压缩空间中,类似于键和值所示的方式。不过,为简化起见,我在上图中省略了这一点。
顺便提一下,如前所述,MLA在DeepSeek V3中并非新事物,因为它的前身DeepSeek V2也使用了(甚至引入了)它。
DeepSeek R1使用了与上述DeepSeek V3相同的架构。区别在于训练方法。也就是说,以DeepSeek V3为基础模型,DeepSeek R1专注于使用可验证奖励强化学习(RLVR)方法来提升模型的推理能力。
RLVR的核心思想是让模型从那些可以通过符号或程序化方式验证的响应中学习,例如数学和代码(当然,这也可以扩展到这两个领域之外)。

GRPO算法,全称是群体相对策略优化(Group Relative Policy Optimization),本质上是近端策略优化(PPO)算法的一个更简单的变体。PPO在基于人类反馈的强化学习(RLHF)中非常流行,而RLHF常用于大语言模型的对齐。

我在我的文章《大语言模型推理的强化学习现状》中更详细地介绍了基于GRPO算法的RLVR训练(包括其背后的数学原理),如果你对更多信息感兴趣,可以查阅。
正如DeepSeek团队自己所说,DeepSeek R1-0528基本上是一个“小版本升级”。
其架构与DeepSeek V3/R1保持一致,改进主要体现在训练方面,目的是使其在当时能够与OpenAI o3和Gemini 2.5 Pro相媲美。
不幸的是,DeepSeek团队没有发布任何具体信息来说明这是如何实现的;不过,他们提到部分改进来自于其训练后流程的优化。此外,根据已分享的信息,我认为托管版本的模型在推理时很可能使用了更多的计算资源(即更长的推理过程)。
DeepSeek V3.1是一个混合模型,兼具通用聊天(指令)和推理能力。也就是说,不再需要开发两个独立的模型,而是通过一个模型,用户可以通过聊天提示模板切换模式(类似于最初的Qwen3模型)。
DeepSeek V3.1基于DeepSeek V3.1-Base,而DeepSeek V3.1-Base又基于DeepSeek V3。它们都共享相同的架构。
DeepSeek V3.2-Exp(2025年9月)则更有趣一些。
最初,DeepSeek V3.2-Exp在基准测试中并未名列前茅,因此该模型发布时并未引起太大关注。然而,正如我在九月份推测的那样,这很可能是一个早期的实验性版本,目的是为更大的版本发布准备好基础设施(特别是推理和部署工具),因为DeepSeek V3.2-Exp在架构上有一些变化。这个更大的版本就是DeepSeek V3.2(而非V4),稍后会详细介绍。
那么,DeepSeek V3.2-Exp有哪些新特性呢?首先,DeepSeek V3.2-Exp是基于DeepSeek V3.1-Terminus作为基础模型训练的。什么是DeepSeek V3.1-Terminus?它只是在上一节提到的DeepSeek V3.1检查点基础上进行的一个小改进。
技术报告指出:
DeepSeek-V3.2-Exp是一个实验性的稀疏注意力模型,它通过持续训练,为DeepSeek-V3.1-Terminus配备了DeepSeek稀疏注意力(DSA)。借助DSA(一种由闪电索引器驱动的细粒度稀疏注意力机制),DeepSeek-V3.2-Exp在训练和推理方面都实现了显著的效率提升,尤其是在长上下文场景中。
如上文所述,这里的主要创新是DeepSeek稀疏注意力(DSA)机制,该机制被添加到DeepSeek V3.1-Terminus中,随后在该检查点上进行进一步训练。
DSA由(1)一个闪电索引器和(2)一个令牌选择器组成,其目标是通过选择性缩减上下文来提高效率。
为了解释其工作原理,我们先从滑动窗口注意力说起。例如,滑动窗口注意力是一种技术(最近被Gemma 3和Olmo 3使用),它将注意力窗口限制在固定大小,如下图所示。

DSA基于与滑动窗口注意力相同的理念:只关注过去令牌的一个子集。然而,DSA并非通过固定宽度的滑动窗口来选择可被关注的令牌,而是使用一个索引器和令牌选择器来决定哪些过去的令牌可以被关注。换句话说,可被关注的令牌更具随机性,如下图所示。

然而,尽管我上面用了“随机”这个词,但选择哪些过去令牌的模式实际上并非随机,而是学习得到的。
在实践中,DSA使用其所谓的闪电索引器,基于所有之前的令牌为每个新的查询令牌计算相关性分数。对于这个计算,闪电索引器使用DeepSeek多头潜在注意力(MLA)中的压缩令牌表示,并计算该令牌与其他令牌的相似度。相似度分数基本上是查询向量和键向量经过ReLU函数后的缩放点积。
如果你对数学细节感兴趣,下面这个公式(取自论文)展示了闪电索引器相似度分数的计算方式:
\( I_{t,s} \;=\; \;\sum_{j=1}^{H^I} w_{t,j}\,\mathrm{ReLU}\!\left(q_{t,j}\cdot k_{s}\right)\)
这里,w是一个学习到的每头加权系数,用于决定每个索引器头对最终相似度分数的贡献程度。q 指查询向量,k 指键向量。下面是不同下标的意义列表:
- t:当前查询令牌的位置;
- s:序列中之前令牌的位置(0 ≤ s < t);
- j:不同索引器头的索引(为简单起见,上面的图10只显示了一个头),因此 qt, j 表示“索引器头 j 中当前令牌 t 的查询向量”。
你可能注意到,索引器只作用于查询(queries),而非键(keys)。这是因为模型只需要决定每个新查询应该考虑哪些过去的token。键已经被压缩并存储在KV缓存中,因此索引器无需在不同注意力头之间再次对它们进行评分或压缩。
这里的ReLU函数,由于是 f(x) = max(x, 0),会将负点积位置置零,理论上可以实现稀疏性,但由于不同注意力头之间存在求和操作,索引器得分实际为零的可能性不大。稀疏性实际上来自独立的token选择器。
独立的token选择器只保留少数得分较高的token(例如,top-k 位置),并构建一个稀疏注意力掩码,将未包含在所选子集中的其他token屏蔽掉。(top-k 中的 k,不要与上述公式中用于键的 k 混淆,是一个超参数,在DeepSeek团队共享的模型代码中设置为2048。)
下图以流程图形式展示了整个过程。

总结来说,索引器和token选择器使得每个token只关注模型学习到的最相关的少数过去token,而不是所有token或固定的局部窗口。
这里的目标并非提升DeepSeek V3.1-Terminus的性能,而是在受益于效率提升的同时,减少(因稀疏注意力机制导致的)性能下降。
总体而言,DSA将注意力机制的计算复杂度从二次的 O(𝐿²)(其中L是序列长度)降低到线性的 O(𝐿𝑘)(其中 𝑘 (≪𝐿) 是选中的token数量)。
讨论了DeepSeek V3.2-Exp之后,我们离本文的主题——DeepSeek V3.2——更近了。不过,首先还需要讨论另一个关键部分。
2025年11月27日(美国感恩节),也就是DeepSeek V3.2发布前仅4天,DeepSeek团队发布了基于DeepSeek V3.2-Exp-Base的DeepSeekMath V2。
该模型专门为数学领域开发,并在多项数学竞赛中取得了金牌级别的成绩。本质上,我们可以将其视为DeepSeek V3.2的一个概念验证模型,它引入了一项新技术。
关键点在于,推理模型(如DeepSeek R1等)是通过外部验证器训练的,模型会自行学习在得出最终答案之前写出解释。然而,这些解释可能是不正确的。
正如DeepSeek团队简洁指出的,常规RLVR的缺点:
[…] 正确的答案并不能保证正确的推理。
[…] 模型可能通过有缺陷的逻辑或幸运的错误得出正确答案。
DeepSeek R1 RLVR 方法旨在解决的另一个限制是:
[…] 许多数学任务(如定理证明)需要严格的逐步推导,而非数值答案,这使得最终答案奖励不适用。
因此,为了改进上述两个缺点,本文训练了两个模型:
- 一个基于 LLM 的定理证明验证器。
- 主模型(即证明生成器)使用该基于 LLM 的验证器作为奖励模型(而非符号验证器)。
除了上述通过 LLM 进行的自我验证外,他们还使用了自我精炼(详见我即将出版的《从零构建推理模型》一书第 5 章),让 LLM 迭代改进自身答案。
使用 LLM 对中间步骤进行评分并非新概念。关于所谓的过程奖励模型已有大量研究,例如 《通过过程与结果反馈解决数学应用题》(2022) 或 《让我们逐步验证》(2023),此外还有许多其他研究。
过程奖励模型面临的挑战在于,检查中间奖励是否正确并不容易,并且可能导致奖励破解。
在 2025 年 1 月的 DeepSeek R1 论文中,他们未使用过程奖励模型,因为他们发现:
在我们实验的大规模强化学习过程中,其优势相较于引入的额外计算开销而言十分有限。
在本论文中,他们以自我验证的形式成功重新审视了这一方法。其动机在于,即使没有参考解法,人类在阅读证明并识别问题时也能进行自我纠正。
因此,为了开发一个更擅长撰写数学证明的模型(下图中 LLM 1),他们构建了一个证明验证器(下图中 LLM 2),该验证器可作为 LLM 评判员,对证明生成器(LLM 1)的输出进行评分。

验证器 LLM(LLM 2)根据评分标准对生成的证明进行评分,评分标准为:
- “1 分:证明完整且严谨,所有逻辑步骤均清晰论证;”
- “0.5 分:整体逻辑合理,但存在小错误或遗漏细节;”
- “0 分:存在致命逻辑错误或关键漏洞的根本性错误证明。”
对于证明验证器模型,他们以 DeepSeek V3.2-Exp-SFT 为起点,该模型是基于 DeepSeek V3.2-Exp,通过在推理数据(包括数学和代码)上进行监督微调而创建的。随后,他们使用格式奖励(检查解答是否符合预期格式)和分数奖励(基于预测分数与实际分数——由人类数学专家标注——的接近程度),通过强化学习进一步训练该模型。
证明验证器(LLM 2)的目标是检查生成的证明(LLM 1),但谁来检查证明验证器呢?为了使证明验证器更加稳健并防止其产生幻觉问题,他们开发了第三个LLM,即元验证器。

元验证器(LLM 3)也通过强化学习进行开发,类似于LLM 2。虽然元验证器并非必需,但DeepSeek团队报告称:
验证器证明分析的平均质量分数(由元验证器评估)从0.85提高到0.96,同时保持了证明分数预测的相同准确性。
这实际上是一个非常有趣的设置。如果你熟悉生成对抗网络(GAN),你可能会看到这里的类比。例如,证明验证器(可以将其视为GAN判别器)改进了证明生成器,而证明生成器生成更好的证明,进一步推动证明验证器。
元分数在验证器(LLM 2)和生成器(LLM 1)的训练过程中使用。在自优化循环的推理阶段不会使用它,我们将在下一节讨论这一点。
在上一节中,我们讨论了自我验证,即分析解决方案的质量。这样做的目的是实现自我优化,这意味着LLM可以根据反馈采取行动并修改其答案。
传统上,在自我优化(一种成熟且流行的推理扩展技术)中,我们会使用同一个LLM来生成解决方案、验证它,然后进行优化。换句话说,在之前的图12和图13中,LLM 1和LLM 2将是同一个LLM。因此,传统的自我优化过程如下所示:

然而,DeepSeek团队观察到,在实践中使用同一个LLM进行生成和验证存在一个关键问题:
当被提示一次性生成并分析自己的证明时,生成器倾向于声称正确性,即使外部验证器很容易识别出缺陷。换句话说,虽然生成器可以根据外部反馈优化证明,但它无法像专用验证器那样严格地评估自己的工作。
作为逻辑推论,人们会认为他们使用了独立的证明生成器(LLM 1)和证明验证器(LLM 2)。因此,这里使用的自我精炼循环与下图所示的类似。请注意,我们省略了LLM 3,它仅在验证器(LLM 2)的开发过程中使用。

然而,在实践中,与图15不同,DeepSeek团队使用了与经典自我精炼循环(图14)中相同的生成器和验证器LLM:
“所有实验均使用单一模型,即我们最终的证明生成器,它同时执行证明生成和验证。”
换句话说,独立的验证器对于训练至关重要,用于改进生成器,但在推理阶段,一旦生成器足够强大,就不再使用(/需要)它。与朴素单模型自我精炼的关键区别在于,最终的证明器是在更强的验证器和元验证器指导下训练的,因此它学会了将这些标准应用于自身的输出。
此外,在推理阶段使用这种二合一的DeepSeekMath V2验证器在资源和成本方面也有优势,因为它比运行第二个LLM进行证明验证增加了更少的复杂性和计算需求。
回到图14和图15所示的通用自我精炼概念,这两张图都展示了2次迭代的自我精炼(初始答案和精炼后的答案)。当然,我们可以在此过程中增加更多迭代。这是一个经典的推理-扩展权衡:迭代次数越多,生成答案的成本就越高,但整体准确性也越高。
在论文中,DeepSeek团队使用了多达8次迭代,而且准确性似乎尚未饱和。
我们在上一节花大量时间讨论DeepSeekMath V2的原因是:a) 这是一个非常有趣的概念验证,通过自我验证和自我精炼技术进一步推动了可验证奖励强化学习(RLVR)的理念;b) 自我验证和自我精炼技术也用于DeepSeek V3.2。
但在进入这部分之前,我们先对DeepSeek V3.2进行一个总体概述。这个模型非常重要,因为与当前旗舰模型相比,它的表现非常出色。

与其他几个DeepSeek模型类似,V3.2附带了一份详细的技术报告,我将在接下来的章节中讨论。
该模型的主要动机当然是提升整体模型性能。例如,像 DeepSeekMath V2 在数学基准测试中达到了金牌级别的表现。然而,该模型也针对工具使用进行了训练,并在其他任务(如代码和智能体任务)中表现良好。
与此同时,DeepSeek 团队将计算效率作为重要的驱动因素。因此,他们结合使用了 V2 和 V3 中的多头潜在注意力(MLA)机制,以及 V3.2 中新增的 DeepSeek 稀疏注意力(DSA)机制。事实上,论文指出“DeepSeek-V3.2 使用了与 DeepSeek-V3.2-Exp 完全相同的架构”,我们在前文已讨论过这一点。

如前所述,DeepSeek V3.2-Exp 的发布很可能是为了让生态系统和推理基础设施做好准备,以托管刚刚发布的 V3.2 模型。

有趣的是,如上文论文截图所示,DeepSeek 团队重新使用了 NVIDIA 芯片(此前他们曾尝试在华为芯片上进行模型训练)。
由于架构与 DeepSeek V3.2-Exp 相同,有趣的细节在于训练方法,我们将在后续章节讨论。
总体而言,DeepSeek 团队采用了基于可验证奖励的强化学习(RLVR)流程,使用与 DeepSeek R1 类似的群体相对策略优化(GRPO)算法。不过,有一些值得讨论的有趣更新。
最初,DeepSeek R1 使用了:
- 格式奖励(确保答案格式正确);
- 语言一致性奖励(防止模型在撰写回复时在不同语言之间切换);
- 以及主要验证器奖励(判断数学或代码问题中的答案是否正确)。
对于 DeepSeek V3.2,他们更改了奖励:
对于推理和智能体任务,我们采用基于规则的结果奖励、长度惩罚和语言一致性奖励。对于通用任务,我们采用生成式奖励模型,每个提示都有其自己的评估标准。
例如,他们移除了格式奖励,但为智能体任务增加了长度惩罚。然后,对于没有符号验证器(数学)或代码解释器来验证答案的通用任务,他们使用奖励模型(另一个经过训练以输出奖励分数的 LLM)。
因此,这听起来像是流程不再像 DeepSeek R1 那样纯粹基于验证器的 RLVR,而是 RLVR(用于可验证领域)和更标准的 LLM 作为评判者的奖励建模的混合体,用于其他所有任务。
在数学领域,他们表示额外“整合了本文前面讨论过的 DeepSeekMath-V2 的数据集和奖励方法”。
至于 GRPO 本身,即 RLVR 流程中的学习算法,他们自 DeepSeek R1 论文的原始版本以来也做了一些改动。
过去几个月,已有数十篇论文提出了对 GRPO 的修改,以提升其稳定性和效率。我在今年早些时候的《大语言模型推理的强化学习现状》一文中介绍了两种流行的改进方法:DAPO 和 Dr. GRPO。
在不深入 GRPO 数学细节的前提下,简而言之,DAPO 对 GRPO 进行了修改,引入了非对称裁剪、动态采样、词元级损失和显式的基于长度的奖励塑造。而 Dr. GRPO 则改变了 GRPO 的目标函数本身,去除了长度和标准差归一化。
最近的 Olmo 3 论文也采用了类似的改动,我引用如下:
-
零梯度信号过滤: 我们移除奖励完全相同的实例组(即批次中优势标准差为零的组),以避免在提供零梯度的样本上进行训练,这与 DAPO(Yu 等人,2025)类似。[DAPO]
-
主动采样: 我们通过一种新颖、更高效的动态采样版本(Yu 等人,2025),在零梯度过滤的情况下保持一致的批次大小。详见 OlmoRL 基础设施部分。[DAPO]
-
词元级损失: 我们使用词元级损失,根据批次中的总词元数对损失进行归一化(Yu 等人,2025),而不是按样本归一化,以避免长度偏差。[DAPO]
-
无 KL 损失: 我们移除了 KL 损失,这是常见做法(GLM-4.5 团队等人,2025;Yu 等人,2025;Liu 等人,2025b),因为它允许更不受限制的策略更新,并且移除它不会导致过度优化或训练不稳定。[DAPO 和 Dr. GRPO]
-
更高裁剪: 我们将损失中的上界裁剪项设置为略高于下界的值,以便对词元进行更大的更新,正如 Yu 等人(2025)所提出的。[DAPO]
-
截断重要性采样: 为了调整推理引擎和训练引擎之间对数概率的差异,我们将损失乘以截断的重要性采样比率,遵循 Yao 等人(2025)的方法。
-
无标准差归一化: 在计算优势时,我们不按组的标准差进行归一化,遵循 Liu 等人(2025b)的方法。这消除了难度偏差,即奖励标准差较低的问题(例如,太难或太容易)会因归一化项而使其优势显著增加。[Dr. GRPO]
DeepSeek V3.2 中的 GRPO 修改则不那么激进,我按照 Olmo 3 的风格进行了总结:
-
领域特定的 KL 强度(包括数学领域的零 KL): 与 DAPO 和 Dr. GRPO 在数学风格强化学习中始终降低 KL 的做法不同,DeepSeek V3.2 在目标函数中保留了 KL 项,但按领域调整其权重。不过,他们也指出,对于数学问题,非常弱甚至为零的 KL 通常效果最佳。(但并非完全移除,而是将其作为超参数处理。)
-
无偏 KL 估计: 如上所述,DeepSeek V3.2 并未移除 KL 惩罚。除了将其作为调节旋钮外,他们还提出了一种修正 GRPO 中 KL 惩罚估计的方法:通过使用与主损失相同的重要性比率对 KL 项进行重新加权,从而使 KL 梯度与实际样本来自旧策略而非当前策略这一事实相匹配。
-
离策略序列掩码: 当跨多个梯度步骤重复使用 rollout 数据(rollout 只是模型生成完整序列的行话)时,DeepSeek V3.2 会衡量当前策略与 rollout 策略在每个完整答案上的偏离程度,并直接丢弃那些既具有负优势又“过于离策略”的序列。这样可防止模型从过于离策略或过时的数据中学习。
-
保留 MoE 模型的路由: 对于混合专家(MoE)主干网络,他们记录 rollout 期间激活了哪些专家,并在训练期间强制使用相同的路由模式,从而确保梯度更新针对的是生成采样答案的那些专家。
-
保留 top‑p / top‑k 的采样掩码: 当 rollout 使用 top‑p 或 top‑k 采样时,DeepSeek V3.2 会存储选择掩码,并在计算 GRPO 损失和 KL 时重新应用该掩码,从而确保训练时的动作空间与采样期间实际可用的动作空间一致。
-
保留原始 GRPO 优势归一化: Dr. GRPO 指出,GRPO 的长度和每组标准差归一化项会使优化偏向于过长的错误答案,并过度加权非常简单或非常困难的问题。Dr. GRPO 通过移除这两项并回归无偏的 PPO 风格目标函数来修复此问题。相比之下,DAPO 转向了标记级损失,这也改变了长答案与短答案的加权方式。而 DeepSeek V3.2 则保留了原始 GRPO 归一化,转而专注于其他修复,例如上述各项。
因此,总体而言,DeepSeek V3.2 比近期其他一些模型更接近原始 GRPO 算法,但增加了一些逻辑上的调整。
DeepSeek V3.2 还有一个极端的、扩展思考的变体,称为 DeepSeek V3.2-Speciale,该变体在强化学习阶段仅使用推理数据进行训练(更类似于 DeepSeek R1)。除了仅使用推理数据训练外,他们还减少了强化学习期间的长度惩罚,使模型能够输出更长的响应。
生成更长的响应是一种推理扩展形式,其中响应因长度增加而成本更高,但换来更好的结果。

在这篇文章中,我没有涵盖DeepSeek V3.2训练方法的所有细节,但我希望与之前DeepSeek模型的对比能帮助阐明主要观点和创新之处。
简而言之,有趣的要点包括:
-
DeepSeek V3.2采用了与自DeepSeek V3以来所有前代模型相似的架构;
-
主要的架构调整是添加了来自DeepSeek V3.2-Exp的稀疏注意力机制,以提高效率;
-
为了提升数学性能,他们采用了DeepSeekMath V2中的自我验证方法;
-
训练流程有多项改进,例如GRPO稳定性更新(注意,论文还涉及了蒸馏、长上下文训练、类似gpt-oss的工具使用集成等其他方面,这些我们未在本文中涵盖)。
无论DeepSeek模型相对于其他较小的开源权重模型或GPT-5.1、Gemini 3.0 Pro等专有模型的市场份额如何,有一点是确定的:DeepSeek的发布总是引人入胜,并且总能从伴随开源权重模型检查点发布的技术报告中学到很多东西。
希望这篇概述对你有用!
Transformer架构中的效率和性能调整通常集中在归一化、注意力和FFN模块上。 例如:
-
归一化:LayerNorm → RMSNorm → Dynamic TanH
-
注意力:分组查询注意力、滑动窗口、多头潜在注意力、稀疏注意力
-
FFN:GeLU → SiLU, SiLU → SwiGLU, 混合专家模型。
2025年12月31日,DeepSeek分享了关于改进残差路径的新有趣研究:mHC:流形约束超连接。
简而言之,它建立在超连接(HC)方法之上,该方法通过多个并行残差流拓宽残差流,并允许信息在这些并行层之间混合,从而将常规(恒等)残差连接泛化为可学习的连接。
然后,他们将HC的想法更进一步,提出了mHC,它将残差混合约束在一个结构化的、保范的流形上。他们发现这种“m”修改提高了训练稳定性。 这增加了一点点开销,但他们获得了更好的训练稳定性和收敛性。

这本杂志是我个人的热情项目,你的支持有助于它持续运营。
如果你想支持我的工作,请考虑我的《从头构建大型语言模型》一书或其续作《从头构建推理模型》。(我相信你会从中获益良多;这些书以你无法在其他地方找到的深度解释了LLM的工作原理。)
感谢阅读,并感谢你支持独立研究!
如果你读过这本书,并且有几分钟的空闲时间,我将非常感激你写一篇简短的书评。这对我们作者来说帮助很大!
你的支持意义重大!非常感谢!