- Mellum2 是一个 120 亿参数的混合专家模型,从零开始在自然语言和代码上训练而成。
- 该模型每个 token 仅激活 25 亿参数,因此非常适合高吞吐量、低延迟的推理场景。Mellum2 可用于路由、RAG、摘要、子代理、高吞吐量编码功能以及私有部署。
- 基于 Apache 2.0 许可证发布。
- 与同等规模的模型相比,Mellum2 在基准测试中表现具有竞争力,同时推理速度提升超过 2 倍。
- 在 Hugging Face 上下载模型:https://huggingface.co/collections/JetBrains/mellum-2
- 有关架构细节、训练设置、基准测试和评估方法,请阅读完整技术报告:https://arxiv.org/pdf/2605.31268
今天,我们发布了 Mellum2,这是一个针对低延迟文本和代码工作负载优化的开源混合专家模型。Mellum 最初是一个代码补全模型。通过 Mellum2,我们将这一基础扩展到更广泛的自然语言和软件工程任务,同时保持模型专注于高效推理和可部署性。现代 AI 系统越来越依赖多个模型调用:路由、检索、摘要、规划、验证和工具使用。其中许多操作对延迟敏感,且不需要最大的可用模型。Mellum2 正是针对这些工作负载而设计。
基准测试亮点
在我们的技术报告中,我们在代码生成、推理、科学和数学基准测试上对 Mellum2 进行了评估。Mellum2 与同等规模的开源模型相比具有竞争力,同时推理速度提升超过 2 倍,使其适用于高吞吐量的生产工作负载。模型架构 Mellum2 是一个混合专家模型:
| 模型 | 总参数 | 每个 token 的活跃参数 | 模态 | 许可证 |
|---|---|---|---|---|
| Mellum2 | 120 亿 | 25 亿 | 文本和代码 | Apache 2.0 |
MoE 架构在保持总模型容量高的同时,仅对每个 token 激活一部分参数。这使得推理更高效,并有助于降低实时工作负载的服务成本。Mellum2 特意专注于文本和代码,而非多模态任务。这种专业化使得模型保持紧凑,并针对软件工程工作负载进行了优化。
关键用例
路由与编排
Mellum2 在多模型系统中作为轻量级路由和编排模型表现出色,包括提示分类、工具选择和中间控制流步骤。
RAG 管道
该模型非常适合对延迟敏感的检索管道,包括上下文压缩、摘要和检索后处理。
子代理
Mellum2 可用于代理子任务,如规划、验证、转换和上下文准备,从而减少在中间操作中调用更大模型的需求。
私有部署
由于 Mellum2 是开源的且服务效率高,它可以部署在涉及专有代码或内部数据的自托管环境中。
为什么范围明确的模型很重要
随着AI系统日趋成熟,最高效的架构正逐渐摆脱单一化。单个前沿模型固然强大,但生产系统往往需要多个专业化组件协同工作:检索器、路由器、代码感知模型、验证器、工具调用器以及大型推理模型。我们将Mellum2视为“焦点”模型:一种针对大型AI系统内高频任务优化的快速、边界清晰的模型。其目标并非取代技术栈中的每个模型,而是让整个技术栈更快速、更经济、更易掌控。
快速上手Mellum2
如果您正在为软件工程构建AI系统——无论是集成开发环境、RAG流水线、智能体工作流,还是私有基础设施——Mellum2现已开放试用。
