NVIDIA 的 Nemotron 3 Super 120B-A12B 是一次不错的开放权重发布,因为其设计非常明确地瞄准了精度与吞吐量之间的权衡。
根据技术报告、模型配置以及我的本地架构卡片,这个总参数量120B、激活参数量12B的模型结合了多项效率优化选择:
截至2026年3月,报告的基准测试表现大致与相同激活规模的 GPT-OSS 120B 和 Qwen3.5 模型相当,而吞吐量数据则更为出色。我会将具体的基准测试排名视为对日期敏感的信息,但架构层面的要点更具持久性。Nemotron 3 Super 在设计上投入了大量精力来降低延迟和成本,而不仅仅是追求原始分数。
这使得它成为值得关注的本地智能体应用模型,因为在这些场景中,吞吐量和成本往往与峰值基准测试分数同样重要。
来源:根据我的 Substack 笔记 稍作编辑的网站版本。
