JetBrains已发布 Mellum2.1,这是一个为编码智能体和快速子智能体打造的开放模型。Mellum2.1是JetBrains推出的12B专家混合思考模型,每个token激活2.5B参数。它以Apache 2.0许可在 Hugging Face上发布。其架构与Mellum2相比没有变化。这次升级几乎完全来自真实软件环境中的强化学习(RL)。其结果是一个小型、可自托管的模型,能够探索代码库、编辑文件并检查自己的修改。
TL;DR
- 规模: 总共12B,激活2.5B(64个专家,8个激活),131,072 token上下文
- 运行环境: 通过vLLM或SGLang在你自己的GPU上运行(速度测试基于1块NVIDIA H200)。GGUF版本最低7.0 GB起,支持llama.cpp、Ollama和LM Studio。
- 性能: 在列出的17项基准测试中有15项击败Mellum2;对阵Qwen3.5-9B在17项中赢得5项
- 最佳: 在LiveCodeBench v6上得分82.0,领先于Qwen3.5-9B(75.4)和Gemma 4 E4B(69.4)
- 最差: 在Terminal-Bench 2.1上得分17.4,低于Qwen3.5-9B(21.7)
- 结论(优势): 仅凭2.5B激活参数即可实现强大的编码成绩和高吞吐量。
- 结论(劣势): 在困难的智能体软件任务和知识方面仍落后于Qwen3.5-9B。
什么是Mellum2.1?
Mellum2.1是 Mellum2 Thinking的下一个版本,JetBrains于 2026年6月开源了该模型。发布的检查点是 Mellum2.1-12B-A2.5B-Thinking。这是一个推理模型,在回答之前会先输出其思维链。JetBrains瞄准了3种用途:智能体工作节点、通用推理助手以及私有自托管部署。
Mellum2.1架构是如何工作的?
该模型有28层和64个专家。路由器为每个token激活8个专家。注意力采用分组查询注意力,包含32个查询头和4个KV头。每4层中有3层使用1,024-token滑动窗口。上下文长度为131,072个token,词表包含98,304个token。权重以bfloat16发布。
Mellum2.1是如何训练的?
几乎所有的新工作都投入到了后训练中。强化学习从短暂的最后阶段转移到了训练的主要部分。JetBrains在数学、竞赛编程、科学、工具使用和软件工程方面添加了RL任务。它对开放的RL数据集进行了过滤,剔除了损坏的测试、无法验证的答案以及过于简单或不可能完成的任务。在软件工程方面,模型在真实仓库中使用shell和文件编辑工具进行训练。当测试通过时会获得奖励。训练启动了横跨数千个环境的数百万个沙箱。
Mellum2.1在基准测试中的表现如何?
JetBrains用一个流程在思考模式下评估了Mellum2.1、Mellum2、 Qwen3.5-9B 和 Gemma 4 E4B 。所有分数均由JetBrains自行报告。
最大的提升是智能体编程。SWE-bench Verified从2.0升至47.0。SWE-bench Pro从0.0升至28.0。Terminal-Bench 2.1从0.6升至17.4。智能体运行使用了开源的Pi v0.73.1框架,上下文为114K个token。
Mellum2.1在LiveCodeBench v6(82.0)、HumanEval+(91.5)、MBPP+(79.4)和BFCL v4(62.3)上领先于该组其他模型。Qwen3.5-9B仍在SWE-bench Verified(50.0)、SWE-bench Pro(38.0)、AIME 25/26(86.7)和GPQA Diamond(77.8)上领先。安全性也有所改善:HarmBench从21.5降至8.5,数值越低越好。
评估流程也很重要。Qwen自己的模型卡列出LiveCodeBench v6为65.6,GPQA Diamond为81.7。JetBrains对同一模型测得的是75.4和77.8。
Mellum2.1有多快?
后训练没有改动架构,因此速度与Mellum2相当。在1块H200上高负载运行时,JetBrains表示Mellum2.1提供的token吞吐量几乎是Qwen3.5-9B的2倍。对于单个请求,多token预测(MTP)使其快约1.6倍。用于vLLM投机解码的MTP头标注为即将推出。
如何在本地运行Mellum2.1?
完整模型可通过vLLM部署,使用 --reasoning-parser qwen3。工具调用需要额外添加 --enable-auto-tool-choice --tool-call-parser hermes。JetBrains建议temperature为0.6、top_p为0.95、top_k为20。
JetBrains的发布说明提到GGUF版本正在制作中。一个 GGUF仓库 已经列出了5个文件:
- BF16: 24.3 GB(参考)
- Q8_0: 12.9 GB,96.1%顶部token匹配率
- Q6_K: 10.9 GB,93.9%顶部token匹配率
- Q4_K_M: 8.1 GB,88.0%顶部token匹配率(推荐)
- MXFP4_MOE: 7.0 GB,85.6% top-token 匹配率
Mellum2.1 对比 Qwen3.5-9B 对比 Gemma 4 E4B
| 特性 | Mellum2.1 | Mellum2 Thinking | Qwen3.5-9B | Gemma 4 E4B |
|---|---|---|---|---|
| 架构 | MoE,64 个专家,8 个激活 | MoE(与 2.1 相同) | Hybrid Gated DeltaNet + 门控注意力 | 密集模型,带逐层嵌入 |
| 总参数量 | 12B | 12B | 9B(语言模型) | 8B 含嵌入 |
| 激活/有效参数 | 2.5B 激活 | 2.5B 激活 | 9B(密集) | 4.5B 有效 |
| 上下文 | 131,072 | 131,072 | 262,144 原生,最高 1,010,000 | 128K |
| 模态 | 文本 | 文本 | 文本、图像、视频 | 文本、图像、音频 |
| 许可证 | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| LiveCodeBench v6* | 82.0 | 69.4 | 75.4 | 69.4 |
| SWE-bench Verified* | 47.0 | 2.0 | 50.0 | 23.0 |
| Terminal-Bench 2.1* | 17.4 | 0.6 | 21.7 | 3.4 |
| BFCL v4* | 62.3 | 49.6 | 58.5 | 52.5 |
| GPQA Diamond* | 64.6 | 51.0 | 77.8 | 53.1 |
| AIME 25/26* | 83.3 | 60.1 | 86.7 | 45.0 |
*基准测试行:来自 JetBrains 的共享流水线、思考模式,数据出自 Mellum2.1 模型卡。各厂商自己的模型卡对 Qwen3.5-9B 和 Gemma 4 E4B 报告了不同的数字。
要点
- Mellum2.1 是一款 12B MoE 思考模型,活跃参数为 2.5B,采用 Apache 2.0 许可证。
- 在真实代码仓库中的强化学习将 SWE-bench Verified 从 2.0 提升至 47.0。
- 它在受测组中领先于 LiveCodeBench v6(82.0)和 BFCL v4(62.3)。
- Qwen3.5-9B 在 SWE-bench Pro、GPQA Diamond 和 AIME 上仍然胜出。
- 7.0 GB 至 8.1 GB 的 GGUF 使本地编码子智能体变得实用。
欢迎查看 模型权重, GGUF 构建, 技术博客 以及 Mellum2 技术报告。所有功劳归于该项目的研究者。另外,欢迎关注我们的 Twitter 并加入我们的 150k+ML SubReddit 以及订阅 我们的通讯。等等!你用 Telegram 吗? 现在你也可以在 Telegram 上加入我们了。
这篇文章 JetBrains 发布 Mellum2.1:面向编程智能体的 12B MoE 开源模型 首发于 MarkTechPost.