对于开源权重的大语言模型来说,这是不错的一周。现在有好几款优秀的模型可以在本地运行,就连 Gemma 4 12B 也只需要不到 16 GB 的内存。
Nemotron 3 Ultra 对本地运行来说太大了,但从性能效率的角度来看,它很有意思。总的来说,它是 Nemotron 3 Super 的大号兄弟。整体设计仍然是混合 Mamba-Transformer MoE 架构,但规模扩展到了 550B 总参数,每个 token 激活 55B 参数。
我觉得最有趣的部分是 Nemotron 3 Super 中引入的 Latent MoE 概念。
在常规的 MoE 层中,路由专家直接以模型宽度运作。而在 Latent MoE 中,路由路径首先被投影到一个更小的潜在空间中,专家在其中运作,然后将结果投影回原始维度。
对于 Super 来说,这是 4096 -> 1024 -> 4096。对于 Ultra 来说,则是 8192 -> 2048 -> 8192。
所以 4 倍的压缩比保持不变,但模型规模大幅提升了。这是一个很好的架构扩展示例,通过结合多种效率机制实现:Mamba-2、GQA、Latent MoE 和 MTP。
LLM 架构图库卡片 提供了更高分辨率的架构图和详细的配置摘要。NVIDIA 的 技术报告 则包含了完整的模型和训练细节。
和往常一样,基准测试 快照应视为具有时效性。图中的人工分析数据作为 2026 年 6 月 4 日的参考点是有用的,但随着提供商更新推理栈、量化方法和服务设置,排行榜上的位置可能会迅速变化。
来源:我的 Substack 笔记 的轻微编辑版网站内容。
