MiniMax M2系列是今年早些时候使用最广泛的开源权重LLM系列之一。其技术报告中有几个值得关注的细节。
该论文将旗舰模型M2描述为一个稀疏MoE,总参数量为2299亿,每个token激活参数为98亿。在本地架构画廊中,这对应着MiniMax M2、MiniMax M2.5和MiniMax M2.7卡片。
我最感兴趣的部分:
- 全注意力机制的反潮流选择。他们尝试了混合滑动窗口注意力变体,类似于许多其他近期模型使用的方案。尽管效率有所提升,但对M2而言,生产质量的权衡显然不值得。
- 线性与稀疏注意力的部署问题。这些注意力变体在理论上降低了长上下文注意力成本,但报告指出,它们在生产级智能体系统中难以良好运作。两个实际问题是:低精度的类KV状态,以及较弱的预填充缓存支持——这对重用大量上下文的编码智能体至关重要。
- 细粒度MoE仍然有效。报告包含了一个在20亿激活参数规模下的有用MoE消融实验。将32个专家和top-2路由的基线,与128个专家和top-8路由的细粒度设置进行了比较。细粒度设置将MATH从19.6提升至24.1,HumanEval从29.7提升至32.5。
- 智能体训练流程现已成为主要组成部分。报告描述了挖掘GitHub拉取请求、构建可运行的Docker环境、提取特定任务的测试奖励,以及将软件工程任务转化为可验证的训练轨迹。
- 交错思考对上下文管理至关重要。移除前几轮中的推理模块会损害性能,尤其是在多步智能体任务中。这是长上下文支持对智能体工作负载如此重要的另一个原因。
- 速度奖励是强化学习设计的一部分。token惩罚很常见,但MiniMax还增加了基于挂钟时间的任务完成时间奖励。目标是减少不必要的慢速工具调用。如果框架支持,这也可能鼓励更多并行的智能体行为。
- 自我进化已成为循环的一部分。报告称,M2.7处理了每日强化学习迭代工作量的30%至50%,修改了自身的脚手架,并完成了一轮100轮的自主脚手架优化循环,内部评估提升了30%。
像往常一样,我会将基准测试和内部评估数据视为2026年5月的快照。更持久的启示是:预填充缓存、工具延迟、可执行环境和脚手架迭代等生产约束,正成为模型设计的一级输入。
来源:我的Substack笔记的轻编辑网站版本。
