如果你这个月在追踪开源权重模型的发布时感到有些吃力,这篇文章应该能帮你快速了解主要动态。
本文将按时间顺序带你回顾十项主要发布,重点分析它们在架构上的相似与差异:
- Arcee AI 的 Trinity Large(2026年1月27日)
- 月之暗面的 Kimi K2.5(2026年1月27日)
- StepFun Step 3.5 Flash(2026年2月1日)
- Qwen3-Coder-Next(2026年2月3日)
- z.AI 的 GLM-5(2026年2月12日)
- MiniMax M2.5(2026年2月12日)
- Nanbeige 4.1 3B(2026年2月13日)
- Qwen 3.5(2026年2月15日)
- 蚂蚁集团的 Ling 2.5 1T 与 Ring 2.5 1T(2026年2月16日)
- Cohere 的 Tiny Aya(2026年2月17日)
- 更新1:Sarvam 30B 与 105B(2026年3月6日)
(附注:DeepSeek V4 将在发布后补充。)
由于内容繁多,本文将引用我之前撰写的 《大型语言模型架构对比》 一文,针对某些技术主题(如混合专家模型、QK归一化、多头潜在注意力等)提供背景信息,以避免重复。
1月27日,Arcee AI(此前我并未关注这家公司)开始在 模型中心 上发布其开源权重 400B Trinity Large 大语言模型的多个版本,同时还有两个较小的变体:
- 其旗舰大模型是一个 400B 参数的 混合专家模型 (MoE),激活参数为 13B。
- 两个较小的变体是 Trinity Mini(26B,激活参数 3B)和 Trinity Nano(6B,激活参数 1B)。

除了模型权重,Arcee AI 还在 GitHub 上发布了一份详尽的 技术报告(截至2月18日,该报告也已上传至 arxiv),其中包含大量细节。
那么,让我们仔细看看这款 400B 的旗舰模型。下面的图2将其与 z.AI 的 GLM-4.5 进行了对比,后者在规模上最为接近,拥有 355B 参数。

从 Trinity 与 GLM-4.5 的对比中可以看出,Trinity 模型添加了几个有趣的架构组件。
首先,存在像 Gemma 3、Olmo 3、小米 MiMo 等模型中使用的交替局部:全局(滑动窗口)注意力层(SWA)。简而言之,SWA 是一种稀疏(局部)注意力模式,其中每个 token 仅关注固定大小的 t 个最近 token 窗口(例如 4096),而不是关注整个输入(可能多达 n=256,000 个 token)。这将每层常规注意力的成本从 O(n²) 降低到大约 O(n·t)(对于序列长度 n 而言),这也是它对长上下文模型具有吸引力的原因。

但是,Arcee 团队没有采用 Gemma 3 和小米使用的常见 5:1 局部:全局比例,而是选择了类似于 Olmo 3 的 3:1 比例,以及相对较大的滑动窗口大小 4096(同样类似于 Olmo 3)。
该架构还使用了 QK-Norm,这是一种对键和查询应用 RMSNorm 以稳定训练的技术(如下图 4 所示),并且在全局注意力层中不使用位置嵌入(NoPE),类似于 SmolLM3。
Trinity 还具有一种门控注意力形式。它并非完全成熟的 Gated DeltaNet,但使用了与 Qwen3-Next 注意力机制中类似的门控方式。
也就是说,Trinity 团队修改了标准注意力,在输出线性投影之前对缩放点积添加了逐元素门控(如下图所示),这减少了注意力汇聚并改善了长序列泛化能力。此外,这也有助于训练稳定性。

此外,Trinity 技术报告显示,Trinity Large 和 GLM-4.5 基础模型的建模性能几乎相同(我假设他们没有与更新的基础模型进行比较,因为如今许多公司只分享他们微调后的模型)。
你可能已经注意到,之前的 Trinity Large 架构图中使用了四个(而不是两个)RMSNorm 层,乍一看与 Gemma 3 类似。

总体而言,RMSNorm 的放置看起来类似于 Gemma 3,但不同之处在于,第二个 RMSNorm(在每个块中)的增益是深度缩放的,这意味着它初始化为大约 1 / sqrt(L)(其中 L 是总层数)。因此,在训练早期,残差更新从较小值开始,并随着模型学习到正确的尺度而增长。

MoE 是一种类似 DeepSeek 的 MoE,包含大量小型专家,但将其变得更粗粒度,这有助于提高推理吞吐量(我们在 Mistral 3 Large 采用 DeepSeek V3 架构时也观察到了这一点)。
最后,还有一些关于训练改进的有趣细节(一种新的 MoE 负载均衡策略和另一种使用 MuOpt 优化器的策略),但由于这主要是一篇关于架构的文章(而且还有更多开放权重的 LLM 需要介绍),这些细节不在讨论范围内。
虽然 Arcee Trinity 在建模性能上基本与较旧的 GLM-4.5 模型持平,但 Kimi K2.5 是一个开放权重模型,它在 1 月 27 日发布时树立了新的开放权重性能天花板。
令人印象深刻的是,根据其详细技术报告中的自有基准测试,它在发布时与领先的专有模型不相上下。

与之前介绍的 Arcee Trinity 或 GLM-4.5 相比,其良好的建模性能并不令人意外,因为(与其前身 K2 类似)Kimi K2.5 是一个 1 万亿参数的模型,因此比 Trinity 大 2.5 倍,比 GLM-4.5 大 2.8 倍。
总体而言,Kimi K2.5 的架构与 Kimi K2 相似,而 Kimi K2 又是 DeepSeek V3 架构的放大版本。

然而,K2 是一个纯文本模型,而 Kimi K2.5 现在是一个支持视觉的多模态模型。引用技术报告中的话:
> Kimi K2.5 是一个原生多模态模型,基于 Kimi K2,通过对大约 15 万亿混合视觉和文本 token 进行大规模联合预训练构建而成。
在训练过程中,他们采用了早期融合方法,并在早期将视觉 token 与文本 token 一起传入,正如我在之前的理解多模态 LLM 文章中所讨论的那样。

附注:在多模态论文中,“早期融合”一词不幸地被过度使用。它可能指以下两种情况之一:
- 模型在预训练期间看到视觉 token。即,视觉 token 从预训练开始(或很早)就混合进来,而不是在后期阶段。
2. 图像令牌在模型中是如何组合的。即,它们作为嵌入令牌与文本令牌一起输入。
在这种情况下,虽然报告中“早期融合”这一术语特指第1点(视觉令牌在预训练期间提供),但第2点在这里也同样成立。
此外,关于第1点,研究人员进行了一项有趣的消融研究,表明模型在预训练早期看到视觉令牌会受益,如下面标注的表格所示。

我必须承认,我之前并未关注过Step系列模型。这个模型因其有趣的规模、详细的技术报告以及快速的tokens/秒性能引起了我的注意。
Step 3.5 Flash是一个196B参数的模型,比最近的DeepSeek V3.2模型(671B)小3倍以上,同时在建模性能基准测试中略微领先。根据Step团队的说法,Step 3.5 Flash在128k上下文长度下具有100 tokens/秒的吞吐量,而根据Step模型主页上的数据,DeepSeek V3.2在Hopper GPU上仅有33 tokens/秒的吞吐量。
这种更高性能的一个原因是模型规模更小(196B参数的MoE,每个令牌激活11B参数,而671B参数的MoE每个令牌激活37B参数),如下图所示。

另一个原因,除了门控注意力(我们之前在Trinity的上下文中讨论过)之外,是多令牌预测(MTP)。DeepSeek是早期采用多令牌预测的模型之一,这是一种训练LLM在每个步骤预测多个未来令牌(而不是单个令牌)的技术。在这里,在每个位置t,小的额外头(线性层)输出t+1…t+k的logits,然后我们对这些偏移量求和交叉熵损失(在MTP论文中,研究人员推荐k=4)。
这种额外的信号加速了训练,而推理时可能仍然一次生成一个令牌,如下图所示。

DeepSeek V3 报告使用了 MTP-1,即在训练时采用包含 1 个额外 token 的 MTP(而非 3 个),并在推理时使 MTP 成为可选配置。
Step 3.5 Flash 在训练和推理时均使用包含 3 个额外 token 的 MTP(MTP-3)(注意:MTP 通常不在推理时使用,这是一个例外)。
需要注意的是,之前讨论的 Arcee Trinity 和 Kimi K2.5 并未使用 MTP,但其他架构已采用与 Step 3.5 Flash 类似的 MTP-3 配置,例如 GLM-4.7 和 MiniMax M2.1。
2026 年 2 月初,Qwen3 团队分享了 80B 参数的 Qwen3-Coder-Next 模型(3B 参数激活),该模型在编程任务上表现优于 DeepSeek V3.2(37B 激活)、Kimi K2.5 和 GLM-4.7(均为 32B 激活)等更大规模的模型,引起了广泛关注。

此外,如上图基准测试所示,Qwen3-Coder-Next 在 SWE-Bench Pro 上的性能与 Claude Sonnet 4.5 大致相当(仅略低于 Claude Opus 4.5),对于一个相对较小的开源权重模型来说,这令人印象深刻!
在本地使用 ollama 版本的 Qwen3-Coder-Next 时,该模型需要约 48.2 GB 的存储空间和 51 GB 的 RAM。

需要注意的是,Qwen3-Coder-Next 背后的架构与 Qwen3-Next 80B 完全相同(事实上,预训练的 Qwen3-Next 80B 被用作进一步中期和后期训练的基础模型)。下图 16 展示了 Qwen3-Next 架构与常规 Qwen3 235B 模型的对比,以供参考。

新的 Qwen3 Next 架构之所以突出,是因为尽管它比之前的 235B-A22B 模型小 3 倍,却引入了四倍数量的专家,甚至还增加了一个共享专家。这两项设计选择(高专家数量和包含共享专家)都是其亮点。
另一个亮点是,他们将常规注意力机制替换为 Gated DeltaNet + Gated Attention 混合架构,这有助于在内存使用方面实现原生 262k token 的上下文长度(235B-A22B 模型原生支持 32k,并通过 YaRN 缩放支持 131k)。
那么,这种新的注意力混合机制是如何工作的呢?与分组查询注意力(GQA)相比——GQA 仍然是标准的缩放点积注意力(如前所述,通过在查询头组之间共享 K/V 来减少 KV 缓存大小和内存带宽,但其解码成本和缓存仍会随序列长度增长)——他们的混合机制将门控 DeltaNet 模块与门控注意力模块按 3:1 的比例混合,如图 17 所示。

我们可以将门控注意力模块视为 GQA 中使用的标准缩放点积注意力,并在此基础上进行了一些调整。门控注意力与普通 GQA 模块的主要区别在于:
- 一个输出门(通常为逐通道的 sigmoid 控制),用于在注意力结果加回到残差之前对其进行缩放;
- 使用零中心 RMSNorm 进行 QKNorm,而非标准 RMSNorm;
- 部分 RoPE(仅应用于部分维度)。
请注意,这些本质上只是对 GQA 的稳定性改进。
门控 DeltaNet 则是一个更重大的变化。在 DeltaNet 模块中,q、k、v 以及两个门(α、β)由线性层和轻量级卷积层(含归一化)生成,并且该层用快速权重的 delta 规则 更新取代了注意力机制。
然而,其权衡之处在于,DeltaNet 提供的基于内容的检索精度不如完整注意力机制,这就是为什么仍然保留了一个门控注意力层。
由于注意力机制呈二次增长,因此添加 DeltaNet 组件是为了提高内存效率。在“线性时间、无缓存”系列中,DeltaNet 模块本质上是 Mamba 的一种替代方案。Mamba 通过一个学习到的状态空间滤波器(本质上是一个随时间变化的动态卷积)来维持一个状态。而 DeltaNet 则使用 α 和 β 来维护一个微小的快速权重记忆,并通过 q 来读取它,仅使用小型卷积来帮助形成 q、k、v、α、β。
有关注意力混合机制和 Qwen3-Next 架构的更多详细信息,请参阅我之前的文章 《超越标准大语言模型》。
由于本文主要关注大语言模型架构,因此训练细节不在讨论范围之内。不过,感兴趣的读者可以在他们详细的 GitHub 技术报告 中找到更多信息。
2 月 12 日发布的 GLM-5 意义重大,因为在发布时,它似乎与主要的旗舰大语言模型产品(包括 GPT-5.2 extra-high、Gemini Pro 3 和 Claude 4.6 Opus)不相上下。(话虽如此,基准测试性能并不一定能转化为实际性能。)

不久前(2025年12月),GLM-4.7 还是最强的开源模型之一。基于上图 Figure 18 所示的基准测试,GLM-5 展现了显著的建模性能提升。这一飞跃部分归功于训练流程的改进,但很可能主要归因于其参数量翻倍——从 GLM-4.7 的 355B 参数增加到 GLM-5 的 744B 参数。这一规模增长使得 GLM-5 在规模上介于 DeepSeek V3.2(671B)和 Kimi K2.5(1T)之间。
对比之前讨论的 Kimi K2.5(1T)的基准测试数据,较小的 GLM-5(744B)模型似乎略占优势,如下表所示。

与 GLM-4.7 一样,目前讨论的所有其他模型也都是混合专家模型。每个 token 的活跃参数量仅略有增加,从 GLM-4.7 的 32B 增加到 GLM-5 的 40B。
如下图 Figure 20 所示,GLM-5 现在采用了 DeepSeek 的多头潜在注意力以及 DeepSeek 稀疏注意力。(我在 《从 DeepSeek V3 到 V3.2:架构、稀疏注意力与 RL 更新》 一文中更详细地描述了 DeepSeek 稀疏注意力。)
这些修改很可能是为了降低处理长上下文时的推理成本。除此之外,整体架构保持相对相似。

与 GLM-4.7 相比,总规模的增加主要源于专家数量的扩展,从 160 个(GLM-4.7)增加到 256 个(GLM-5),并且略微增加了层维度(同时保持每个 token 的专家数量不变,仍为 8 个常规专家 + 1 个共享专家)。例如,嵌入维度和专家规模从 5,120 增加到 6,144,中间投影大小从 1,536 增加到 2,048。
有趣的是,Transformer 层数从 GLM-4.7 的 92 层减少到 GLM-5 的 78 层。我推测这一变化也是为了降低推理成本并改善延迟,因为层深度无法像宽度那样进行并行化处理。
此外,我还查看了一个独立基准测试(此处为幻觉排行榜),结果确实显示 GLM-5 与 Opus 4.5 和 GPT-5.2 水平相当(同时使用了更少的 token)。

此外,从最新的人工智能指数(该指数汇总了多项基准测试结果)来看,GLM-5 确实略领先于 Kimi K2.5,仅比 GPT-5.2 (xhigh) 和近期发布的 Claude Sonnet 4.6 低一分。
上述提到的 GLM-5 和 Kimi K2.5 都是热门的开源权重模型,但根据 OpenRouter 统计数据,它们与同样于 2 月 12 日发布的 MiniMax M2.5 相比,仍相形见绌。

OpenRouter 是一个平台和 API,允许开发者访问并将请求路由到来自不同提供商的众多大语言模型。请注意,虽然其使用统计数据是衡量开源权重模型受欢迎程度的一个良好指标,但它严重偏向于开源权重模型(相对于专有模型),因为大多数用户直接通过官方平台使用专有模型。此外,不同开源权重模型之间也存在使用偏差,因为许多人还通过官方开发者的 API 使用开源权重模型。无论如何,对于大多数用户来说,那些因规模过大而无法在本地运行的开源权重模型,OpenRouter 仍是一个可以大致估算其相对受欢迎程度的有趣地方。
现在,回到 MiniMax M2.5。将来自 SWE-Bench Verified 编码基准测试的 GLM-5 数据与报告的 MiniMax M2.5 数据结合起来看,后者似乎是一个稍强的模型(至少在编码方面如此)。

附注:有趣的是,Opus 4.5 和 Opus 4.6 在 SWE-Bench Verified 上的得分几乎相同。这可能表明大语言模型的进展已经停滞。不过,我认为事实并非如此,因为 Opus 4.6 的用户可以证实,该模型在实际使用中确实表现更好。因此,更可能的问题是 SWE-Bench Verified 基准测试已经饱和,它可能不再是一个有意义的基准测试(相比之下,应使用 SWE-Bench Pro 等其他基准测试)。所谓饱和,我指的是由于设计问题,它可能包含一些无法解决的问题(正如最近 Reddit 帖子 以及 OpenAI 新文章“为什么 SWE-bench Verified 不再衡量前沿编码能力”中所讨论的那样)。
无论如何,回到 MiniMax M2.5 性能的话题。根据人工智能指数汇总,从更广泛的基准测试来看,GLM-5 仍然领先。这或许并不意外,因为 GLM-5 的模型规模仍然是 M2.5 的 4 倍,尽管每秒 token 吞吐量非常相似。
我认为 MiniMax M2.5 的受欢迎程度部分归因于它是一个更小、更便宜的模型,同时具有大致相似的建模性能(即性价比高)。
在架构方面,MiniMax M2.5 是一个 230B 参数的模型,设计相当经典:仅采用普通的组查询注意力机制,没有滑动窗口注意力或其他效率改进。

到目前为止,这也是本报告中第一个没有附带详细技术报告的架构,但你可以在模型中心页面找到更多信息。
在本节中,我们将转换话题,最终介绍一个可以在笔记本电脑上本地运行的较小模型。但首先,在介绍 Nanbeige 4.1 3B 之前,我们先来了解一些背景。
Qwen 模型一直是非常流行的模型。我经常讲一个故事:几年前,我在 NeurIPS LLM 效率挑战赛中担任顾问时,大多数获胜方案都基于 Qwen 模型。
现在,Qwen3 很可能是使用最广泛的开源权重模型系列之一,因为它们涵盖了从 0.6B 到 235B 的广泛尺寸和用例。
尤其是较小的模型(80B 及以下,例如之前介绍的 Qwen3-Next),非常适合在消费级硬件上本地使用。

我之所以提到这些,是因为 Nanbeige 4.1 3B 似乎瞄准了 Qwen3 非常流行的“小型”LLM 设备端用例。根据 Nanbeige 4.1 3B 的基准测试,他们的模型远远领先于 Qwen3(考虑到 Qwen3 已经发布近一年,这或许并不令人意外)。
在架构方面,Nanbeige 4.1 3B 与 Qwen3 4B 相似,而 Qwen3 4B 又与 Llama 3.2 3B 非常相似。下面我将 Nanbeige 4.1 3B 与 Llama 3.2 3B 放在一起展示,因为它们在尺寸上最为接近。

Nanbeige 4.1 3B 使用了与 Llama 3.2 3B 相同的架构组件,仅存在一些微小的规模差异(例如略小的嵌入维度和更大的中间投影等)。上图中未显示的一个区别是:Nanbeige 没有将输入嵌入权重与输出层权重绑定,而 Llama 3.2 3B 则进行了绑定。(根据我的经验,权重绑定是减少总参数数量的好方法,但几乎总是会导致训练性能下降,具体表现为更高的训练和验证损失。)
如前所述,本文主要关注架构对比。在这种情况下,大部分性能提升(相较于前代 Nanbeige 4 3B)来自于额外的后训练,包括监督微调和强化学习。感兴趣的读者可以在详细技术报告中找到更多信息。
虽然上一节简要介绍了 Qwen3 作为最开放的权重模型系列,但它已经有些过时了,因为其发布已近一年(如果不考虑面向效率优化的 Qwen3-Next 变体)。不过,Qwen 团队于 2 月 15 日刚刚发布了一个新的 Qwen3.5 模型变体。
Qwen3.5 397B-A17B 是一个混合专家(MoE)模型,拥有 397B 参数(每个 token 激活 17B 参数),相比最大的 Qwen3 模型(235B 参数)有了显著提升。(此外还有 1 万亿参数的 Qwen3-Max 模型,但从未作为开放权重模型发布。)
标准的基准测试概览显示,Qwen3.5 全面超越了之前的 Qwen3-Max 模型,并且更加强调智能体终端编码应用(这是今年的主要主题)。在纯智能体编码性能方面(例如 SWE-Bench Verified),Qwen3.5 似乎与 GLM-5 和 MiniMax M2.5 大致相当。

由于 Qwen 团队喜欢发布独立的编码模型(例如我们之前讨论过的 Qwen3-Coder-Next),这让我很好奇潜在的 Qwen3.5-Coder 会有怎样的表现。
在架构方面,Qwen3.5 采用了 Qwen3-Next 和 Qwen3-Coder-Next(第 4 节)所使用的混合注意力模型(包含 Gated DeltaNet)。这很有趣,因为 Qwen3-Next 模型最初是全注意力 Qwen3 模型的替代方案,但这表明 Qwen 团队现在已将混合注意力机制纳入其主要模型系列中。

除了扩大模型规模,如上图所示,Qwen3.5 现在还支持多模态(此前仅在独立的 Qwen3-VL 模型中提供)。
总之,Qwen3.5 是 Qwen 系列的一次不错的更新,我也希望未来能看到更小的 Qwen3.5 变体!
编辑:就在我完成这篇文章时,Qwen团队发布了上述提到的较小模型变体:
Ling 2.5(以及推理变体 Ring 2.5)是一个拥有1万亿参数的大型语言模型,采用了与Qwen3.5和Qwen3-Next类似的混合注意力架构。
不过,它没有使用门控DeltaNet,而是采用了一种更简单的循环线性注意力变体,称为闪电注意力。此外,Ling 2.5还采用了DeepSeek的多头潜在注意力机制。

从绝对基准测试性能来看,Ling 2.5并非最强模型,但其卖点在于长上下文场景下效率极高(得益于混合注意力机制)。遗憾的是,目前没有与Qwen3.5的直接对比,但与Kimi K2(1万亿参数,与Ling 2.5规模相同)相比,Ling 2.5在序列长度为32k tokens时实现了3.5倍的吞吐量提升。

Tiny Aya于2月17日发布,是Cohere推出的一款新型“小型”LLM,据称是30亿参数规模中“能力最强的多语言开源权重模型”。(根据公告文章,Tiny Aya的性能优于Qwen3-4B、Gemma 3 4B和Ministral 3 3B。)
这是一款非常适合本地运行和实验的模型。唯一的注意事项是,虽然它是开源权重模型,但其许可条款相对严格,仅允许非商业用途。
除此之外,Aya是一个拥有33.5亿参数的模型,提供多种版本,适用于个人及(非商业)研究用途:
- tiny-aya-base(基础模型)
- tiny-aya-global(跨语言和地区的最佳平衡)
- tiny-aya-fire(针对南亚语言优化)
- tiny-aya-water(针对欧洲和亚太语言优化)
- tiny-aya-earth(针对西亚和非洲语言优化)
更具体地说,以下是各模型优化的语言列表。

在架构方面,Tiny Aya是一个经典的解码器式Transformer,除了一些显而易见的改进(如SwiGLU和分组查询注意力)之外,还包含一些值得注意的修改,如下图所示。

总体而言,该架构最值得注意的亮点是并行 Transformer 块。在这里,并行 Transformer 块从相同的归一化输入计算注意力机制和 MLP,然后在一个步骤中将两者添加到残差连接中。我推测这是为了减少层内的串行依赖关系,从而提高计算吞吐量。
对于熟悉 Cohere 的 Command-A 架构的读者来说,Tiny Aya 似乎是其一个更小的版本。此外,一个有趣的细节是,Tiny Aya 团队放弃了 QK-Norm(一种应用于注意力机制中键和查询的 RMSNorm);QK-Norm 在减少损失尖峰方面已成为提高训练稳定性的相当标准的方法。据 Cohere 团队的一位开发者称,放弃 QK-Norm 是“因为它可能会影响长上下文性能”。
如您所知,我偶尔会从头开始编写架构代码。由于我发现并行 Transformer 块非常有趣,并且该模型在低端硬件上运行良好,因此我出于教育目的从头实现了它,您可以在 GitHub 上找到它。
这篇文章是一次旋风式的旅程,涵盖了 2026 年 2 月左右主要的开放权重 LLM 发布。如果要说有什么收获的话,那就是存在各种运行良好的模型架构(都源自原始的 GPT 模型)。建模性能可能并不归因于架构设计本身,而是归因于数据集质量和训练方法(这是另一篇文章的好主题)。
话虽如此,架构设计仍然是构建成功 LLM 的重要组成部分,许多开发者似乎正朝着添加越来越多计算性能调整的方向发展。例如,这包括采用 MLA(Kimi K2.5、GLM-5、Ling 2.5)和 DeepSeek 稀疏注意力(GLM-5)来延续 Gated DeltaNet(Qwen3.5)或类似形式的线性注意力(Ling 2.5)。

此外,更经典的效率调整,如分组查询注意力和滑动窗口注意力(Arcee Trinity、Step 3.5 Flash、Tiny Aya),仍然很受欢迎。在新发布的模型中,只有 MiniMax M2.5 和 Nanbeige 4.1 在这方面保持得非常经典,仅使用分组查询注意力,没有其他效率调整。
DeepSeek V4 是大家都在期待的模型。不幸的是,截至撰写本文时,它尚未发布。不过,我计划在它发布后将其添加到本文中,发布时间很可能在 3 月的第一周或之前。
另一个有趣的模型是来自印度的 Sarvam(30B 和 100B)。该模型最近被宣布,但尚未发布。请继续关注此处的更新。
如约而至,这里带来关于 Sarvam 的简短更新。
在等待 DeepSeek V4 期间,我们收到了来自印度的两款非常强大的开源权重大语言模型。
共有两种尺寸版本,分别是 Sarvam 30B 和 Sarvam 105B 模型(均为推理模型),它们于 3 月 6 日以开源权重形式发布,同时附有一篇相当详细的公告博客。
有趣的是,较小的 30B 模型使用了“经典”的分组查询注意力(GQA),而较大的 105B 变体则切换到了 DeepSeek 风格的多头潜在注意力(MLA)。

正如我之前在分析中提到的,这两种都是流行的注意力变体,用于减少 KV 缓存大小(上下文越长,相比常规注意力节省的就越多)。

MLA 的实现更复杂,但根据 2024 年 DeepSeek V2 论文 中的消融研究(据我所知,这仍然是最近期的同类对比),它可以提供更好的建模性能。
说到建模性能,105B 模型与类似规模的大语言模型不相上下:gpt-oss 120B 和 Qwen3-Next(80B)。Sarvam 在某些任务上表现更好,在其他任务上稍逊一筹,但平均而言大致相同。

在 SWE-Bench Verified 方面,它并非最强的编码模型,但在智能体推理和任务完成(Tau2)方面却出奇地出色。它甚至优于 Deepseek R1 0528(未在上图中显示)。
考虑到较小的 Sarvam 30B,与 30B 模型最可比的模型可能是 Nemotron 3 Nano 30B,后者在 SWE-Bench Verified 编码和智能体推理(Tau2)方面略胜一筹,但在其他某些方面(Live Code Bench v6、BrowseComp)稍逊。

遗憾的是,上述基准测试中缺少 Qwen3-30B-A3B,据我所知,它是该尺寸类别中最流行的模型。不过有趣的是,Sarvam 团队在计算性能分析中将他们的 30B 模型与 Qwen3-30B-A3B 进行了比较,发现由于代码和内核优化,Sarvam 的 token/秒吞吐量比 Qwen3 高出 20-40%。
上述基准测试未能体现的一点是,Sarvam 在印度语言上的出色表现。根据一个评判模型,Sarvam 团队发现,在处理印度文本时,他们的模型在 90% 的情况下比其他模型更受青睐。(由于他们也从头构建并训练了分词器,Sarvam 在印度语言上的分词效率提高了 4 倍。)
本杂志是个人热情项目,您的支持有助于其持续发展。
如果您想支持我的工作,请考虑订阅或购买我的《从头构建大型语言模型》一书或其续作《从头构建推理模型》(From Scratch)。(我确信您会从中获益良多;这些书深入讲解了 LLM 的工作原理,这是其他地方找不到的。)
感谢您的阅读,也感谢您支持独立研究!
如果您读过这本书并且有几分钟空闲,我将非常感激您能写一篇简短评论。这对我们作者帮助很大!
您的支持意义重大!非常感谢!