Gemma 4 的发布颇为有趣,因为从架构层面看,31B 密集模型与 Gemma 3 27B 并无根本性差异。

根据 Gemma 4 模型卡Gemma 4 31B 配置,该模型沿用了 Gemma 系列熟悉的局部-全局注意力机制:

  1. 滑动窗口注意力与全局注意力的比例为 5:1
  2. 采用 QK-Norm 的分组查询注意力
  3. RMSNorm 和后 RMSNorm 模块
  4. 256k 令牌的上下文长度
  5. 262k 令牌的词汇表

因此,相较于 Gemma 3 的基准测试提升,可能更多归功于训练数据和训练方法,而非新的 Transformer 模块。截至 2026 年 4 月,绘制的基准测试结果显示,在多项常见基准上,Gemma 4 31B 的表现更接近 Qwen3.5-27B,而非 Gemma 3 27B。竞技场风格的排名是有用的信号,但我倾向于将其视为偏好偏差的结果,而非纯粹的能力度量。

此外,还有一个稀疏的 MoE 变体,Gemma 4 26B-A4B,它保留了相同的局部-全局注意力主干,但将密集前馈层替换为 MoE 层。为了保持图表对比的可读性,我未将其纳入图中,但它已收录在 LLM 架构画廊中。

许可协议也值得注意。Gemma 4 采用 Apache License 2.0 许可,对于许多用例来说,这比 Gemma 3 的自定义许可要友好得多。

Gemma 4 31B 架构图与基准测试对比

来自原始 Substack 笔记的图表,展示了 Gemma 4 31B 架构及选定的基准测试对比。

来源:根据我的 Substack 笔记 稍加编辑的网站版本。