MarkTechPost

JetBrains发布Mellum2.1:面向编码智能体的12B MoE开放模型

JetBrains发布开源编码代理模型Mellum2.1,为12B混合专家思考模型,采用Apache 2.0许可。升级主要来自在真实仓库中做强化学习,使SWE-bench Verified从2.0升至47.0,但分数为JetBrains自报。

JetBrains已发布 Mellum2.1,这是一个为编码智能体和快速子智能体打造的开放模型。Mellum2.1是JetBrains推出的12B专家混合思考模型,每个token激活2.5B参数。它以Apache 2.0许可在 Hugging Face上发布。其架构与Mellum2相比没有变化。这次升级几乎完全来自真实软件环境中的强化学习(RL)。其结果是一个小型、可自托管的模型,能够探索代码库、编辑文件并检查自己的修改。

TL;DR

  • 规模: 总共12B,激活2.5B(64个专家,8个激活),131,072 token上下文
  • 运行环境: 通过vLLM或SGLang在你自己的GPU上运行(速度测试基于1块NVIDIA H200)。GGUF版本最低7.0 GB起,支持llama.cpp、Ollama和LM Studio。
  • 性能: 在列出的17项基准测试中有15项击败Mellum2;对阵Qwen3.5-9B在17项中赢得5项
  • 最佳: 在LiveCodeBench v6上得分82.0,领先于Qwen3.5-9B(75.4)和Gemma 4 E4B(69.4)
  • 最差: 在Terminal-Bench 2.1上得分17.4,低于Qwen3.5-9B(21.7)
  • 结论(优势): 仅凭2.5B激活参数即可实现强大的编码成绩和高吞吐量。
  • 结论(劣势): 在困难的智能体软件任务和知识方面仍落后于Qwen3.5-9B。

什么是Mellum2.1?

Mellum2.1是 Mellum2 Thinking的下一个版本,JetBrains于 2026年6月开源了该模型。发布的检查点是 Mellum2.1-12B-A2.5B-Thinking。这是一个推理模型,在回答之前会先输出其思维链。JetBrains瞄准了3种用途:智能体工作节点、通用推理助手以及私有自托管部署。

Mellum2.1架构是如何工作的?

该模型有28层和64个专家。路由器为每个token激活8个专家。注意力采用分组查询注意力,包含32个查询头和4个KV头。每4层中有3层使用1,024-token滑动窗口。上下文长度为131,072个token,词表包含98,304个token。权重以bfloat16发布。

Mellum2.1是如何训练的?

几乎所有的新工作都投入到了后训练中。强化学习从短暂的最后阶段转移到了训练的主要部分。JetBrains在数学、竞赛编程、科学、工具使用和软件工程方面添加了RL任务。它对开放的RL数据集进行了过滤,剔除了损坏的测试、无法验证的答案以及过于简单或不可能完成的任务。在软件工程方面,模型在真实仓库中使用shell和文件编辑工具进行训练。当测试通过时会获得奖励。训练启动了横跨数千个环境的数百万个沙箱。

Mellum2.1在基准测试中的表现如何?

JetBrains用一个流程在思考模式下评估了Mellum2.1、Mellum2、 Qwen3.5-9B 和 Gemma 4 E4B 。所有分数均由JetBrains自行报告。

最大的提升是智能体编程。SWE-bench Verified从2.0升至47.0。SWE-bench Pro从0.0升至28.0。Terminal-Bench 2.1从0.6升至17.4。智能体运行使用了开源的Pi v0.73.1框架,上下文为114K个token。

Mellum2.1在LiveCodeBench v6(82.0)、HumanEval+(91.5)、MBPP+(79.4)和BFCL v4(62.3)上领先于该组其他模型。Qwen3.5-9B仍在SWE-bench Verified(50.0)、SWE-bench Pro(38.0)、AIME 25/26(86.7)和GPQA Diamond(77.8)上领先。安全性也有所改善:HarmBench从21.5降至8.5,数值越低越好。

评估流程也很重要。Qwen自己的模型卡列出LiveCodeBench v6为65.6,GPQA Diamond为81.7。JetBrains对同一模型测得的是75.4和77.8。

Mellum2.1有多快?

后训练没有改动架构,因此速度与Mellum2相当。在1块H200上高负载运行时,JetBrains表示Mellum2.1提供的token吞吐量几乎是Qwen3.5-9B的2倍。对于单个请求,多token预测(MTP)使其快约1.6倍。用于vLLM投机解码的MTP头标注为即将推出。

如何在本地运行Mellum2.1?

完整模型可通过vLLM部署,使用 --reasoning-parser qwen3。工具调用需要额外添加 --enable-auto-tool-choice --tool-call-parser hermes。JetBrains建议temperature为0.6、top_p为0.95、top_k为20。

JetBrains的发布说明提到GGUF版本正在制作中。一个 GGUF仓库 已经列出了5个文件:

  • BF16: 24.3 GB(参考)
  • Q8_0: 12.9 GB,96.1%顶部token匹配率
  • Q6_K: 10.9 GB,93.9%顶部token匹配率
  • Q4_K_M: 8.1 GB,88.0%顶部token匹配率(推荐)
  • MXFP4_MOE: 7.0 GB,85.6% top-token 匹配率

Mellum2.1 对比 Qwen3.5-9B 对比 Gemma 4 E4B

特性Mellum2.1Mellum2 ThinkingQwen3.5-9BGemma 4 E4B
架构MoE,64 个专家,8 个激活MoE(与 2.1 相同)Hybrid Gated DeltaNet + 门控注意力密集模型,带逐层嵌入
总参数量12B12B9B(语言模型)8B 含嵌入
激活/有效参数2.5B 激活2.5B 激活9B(密集)4.5B 有效
上下文131,072131,072262,144 原生,最高 1,010,000128K
模态文本文本文本、图像、视频文本、图像、音频
许可证Apache 2.0Apache 2.0Apache 2.0Apache 2.0
LiveCodeBench v6*82.069.475.469.4
SWE-bench Verified*47.02.050.023.0
Terminal-Bench 2.1*17.40.621.73.4
BFCL v4*62.349.658.552.5
GPQA Diamond*64.651.077.853.1
AIME 25/26*83.360.186.745.0

*基准测试行:来自 JetBrains 的共享流水线、思考模式,数据出自 Mellum2.1 模型卡。各厂商自己的模型卡对 Qwen3.5-9B 和 Gemma 4 E4B 报告了不同的数字。

要点

  • Mellum2.1 是一款 12B MoE 思考模型,活跃参数为 2.5B,采用 Apache 2.0 许可证。
  • 在真实代码仓库中的强化学习将 SWE-bench Verified 从 2.0 提升至 47.0。
  • 它在受测组中领先于 LiveCodeBench v6(82.0)和 BFCL v4(62.3)。
  • Qwen3.5-9B 在 SWE-bench Pro、GPQA Diamond 和 AIME 上仍然胜出。
  • 7.0 GB 至 8.1 GB 的 GGUF 使本地编码子智能体变得实用。


欢迎查看 模型权重, GGUF 构建, 技术博客 以及 Mellum2 技术报告。所有功劳归于该项目的研究者。另外,欢迎关注我们的 Twitter 并加入我们的 150k+ML SubReddit 以及订阅 我们的通讯。等等!你用 Telegram 吗? 现在你也可以在 Telegram 上加入我们了。

这篇文章 JetBrains 发布 Mellum2.1:面向编程智能体的 12B MoE 开源模型 首发于 MarkTechPost.

原始出处

MarkTechPost

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准