Gemma 4 的发布颇为有趣,因为从架构层面看,31B 密集模型与 Gemma 3 27B 并无根本性差异。
根据 Gemma 4 模型卡 和 Gemma 4 31B 配置,该模型沿用了 Gemma 系列熟悉的局部-全局注意力机制:
因此,相较于 Gemma 3 的基准测试提升,可能更多归功于训练数据和训练方法,而非新的 Transformer 模块。截至 2026 年 4 月,绘制的基准测试结果显示,在多项常见基准上,Gemma 4 31B 的表现更接近 Qwen3.5-27B,而非 Gemma 3 27B。竞技场风格的排名是有用的信号,但我倾向于将其视为偏好偏差的结果,而非纯粹的能力度量。
此外,还有一个稀疏的 MoE 变体,Gemma 4 26B-A4B,它保留了相同的局部-全局注意力主干,但将密集前馈层替换为 MoE 层。为了保持图表对比的可读性,我未将其纳入图中,但它已收录在 LLM 架构画廊中。
许可协议也值得注意。Gemma 4 采用 Apache License 2.0 许可,对于许多用例来说,这比 Gemma 3 的自定义许可要友好得多。
来源:根据我的 Substack 笔记 稍加编辑的网站版本。
