JetBrainsがリリースしました Mellum2.1コーディングエージェントや高速なサブエージェント向けに構築されたオープンモデルです。Mellum2.1は、JetBrains製の12BのMixture-of-Experts思考モデルで、トークンごとに2.5Bのパラメータを活性化します。Apache 2.0ライセンスの下で提供され、次で公開されています。 Hugging Face。アーキテクチャはMellum2から変更されていません。今回のアップグレードは、ほぼすべて実際のソフトウェア環境での強化学習(RL)によるものです。その結果、リポジトリを探索し、ファイルを編集し、自分の変更をチェックできる、小規模でセルフホスト可能なモデルが生まれました。
要約
- サイズ: 合計12B、アクティブ2.5B(64エキスパート中8個アクティブ)、131,072トークンのコンテキスト
- 動作環境: vLLMまたはSGLang経由で自身のGPU上で実行(速度はNVIDIA H200 1基でテスト済み)。GGUFビルドは7.0 GBからで、llama.cpp、Ollama、LM Studioに対応します。
- パフォーマンス: 記載されている17のベンチマークのうち15でMellum2を上回り、Qwen3.5-9Bに対しては17のうち5で勝利する
- 最良: LiveCodeBench v6で82.0を記録し、Qwen3.5-9B(75.4)およびGemma 4 E4B(69.4)を上回った。
- 最悪のケース: Terminal-Bench 2.1では17.4であり、Qwen3.5-9B(21.7)を下回る
- 結論(最良の選択): 2.5Bのアクティブパラメータのみで、高いコーディングスコアと高いスループットを実現。
- 結論(最悪のシナリオ): 依然として、難易度の高いエージェント型ソフトウェアタスクと知識の分野では Qwen3.5-9B に及ばない。
Mellum2.1とは何ですか?
Mellum 2.1は次のバージョンです Mellum2 Thinking、これはJetBrains 2026年6月にオープンソース化された。公開されたチェックポイントは Mellum2.1-12B-A2.5B-Thinking解答の前に思考の連鎖を出力する推論モデルです。JetBrainsは3つの用途を挙げています。エージェントワーカー、汎用推論アシスタント、そしてプライベートなセルフホスト環境への展開です。
Mellum2.1のアーキテクチャはどのように機能するのですか?
このモデルは28層と64エキスパートを持ちます。ルーターはトークンごとに8エキスパートを起動します。アテンションは32個のクエリヘッドと4個のKVヘッドを用いるグループクエリアテンションを使用します。4層のうち3層は1,024トークンのスライディングウィンドウを使用します。コンテキスト長は131,072トークンで、語彙は98,304トークンです。重みはbfloat16で提供されます。
Mellum2.1はどのように訓練されたのか?
新規作業のほぼすべてがポストトレーニングに費やされました。RL(強化学習)は短い最終段階から訓練の主要部分へと移行しました。JetBrainsは数学、競技プログラミング、科学、ツール使用、ソフトウェアエンジニアリングのRLタスクを追加しました。同社は壊れたテスト、検証不能な回答、簡単すぎるまたは不可能なタスクについてオープンRLデータセットをフィルタリングしました。ソフトウェアエンジニアリングでは、モデルはシェルとファイル編集ツールを備えた実際のリポジトリ内で訓練されます。テストが通過したときに報酬が与えられます。訓練では数千の環境にわたり数百万のサンドボックスが起動されました。
Mellum2.1はベンチマークでどの程度の性能を示すのか?
JetBrainsはMellum2.1、Mellum2、 Qwen3.5-9B および Gemma 4 E4B をthinkingモードの1つのパイプラインで評価しました。すべてのスコアはJetBrainsによる自己報告です。
最大の伸びはエージェント型コーディングです。SWE-bench Verifiedは2.0から47.0に上昇しました。SWE-bench Proは0.0から28.0に上昇しました。Terminal-Bench 2.1は0.6から17.4に上昇しました。エージェント実行には、114Kトークンのコンテキストを備えたオープンソースのPi v0.73.1ハーネスが使用されました。
Mellum2.1はLiveCodeBench v6(82.0)、HumanEval+(91.5)、MBPP+(79.4)、BFCL v4(62.3)でこのグループをリードしています。Qwen3.5-9Bは依然としてSWE-bench Verified(50.0)、SWE-bench Pro(38.0)、AIME 25/26(86.7)、GPQA Diamond(77.8)でリードしています。安全性も向上しました:HarmBenchは21.5から8.5に低下しました(低いほど良い)。
パイプラインも考慮すべき重要な要素です。Qwen自身のカードにはLiveCodeBench v6で65.6、GPQA Diamondで81.7と記載されています。JetBrainsは同じモデルに対して75.4と77.8を測定しました。
Mellum2.1はどの程度速いのか?
ポストトレーニングではアーキテクチャは変更されていないため、速度はMellum2と同一です。高負荷状態のH200 1基において、JetBrainsはMellum2.1がQwen3.5-9Bのほぼ2倍のトークンを処理できると述べています。単一リクエストでは、マルチトークン予測(MTP)により約1.6倍高速になります。vLLMの投機的デコード用のMTPヘッドは「近日公開」と記載されています。
Mellum2.1をローカルで実行するには?
フルモデルはvLLMで --reasoning-parser qwen3により提供されます。ツール呼び出しには --enable-auto-tool-choice --tool-call-parser hermesを追加します。JetBrainsはtemperature 0.6、top_p 0.95、top_k 20を推奨しています。
JetBrainsのリリースノートには、GGUFビルドが進行中であると記載されています。すでに GGUFリポジトリ には5つのファイルがリストされています:
- BF16: 24.3 GB(リファレンス)
- Q8_0: 12.9 GB、トップトークン一致率96.1%
- Q6_K: 10.9 GB、トップトークン一致率93.9%
- Q4_K_M: 8.1 GB、トップトークン一致率88.0%(推奨)
- MXFP4_MOE: 7.0 GB、トップトークン一致率 85.6%
Mellum2.1 vs Qwen3.5-9B vs Gemma 4 E4B
| 機能 | Mellum2.1 | Mellum2 Thinking | Qwen3.5-9B | Gemma 4 E4B |
|---|---|---|---|---|
| アーキテクチャ | MoE、64 エキスパート、アクティブ 8 | MoE(2.1 と同じ) | ハイブリッド Gated DeltaNet + ゲート付き attention | レイヤーごとの埋め込みを備えた Dense |
| 総パラメータ数 | 12B | 12B | 9B(言語モデル) | 埋め込み込みで 8B |
| アクティブ / 実効パラメータ数 | アクティブ 2.5B | アクティブ 2.5B | 9B(dense) | 実効 4.5B |
| コンテキスト | 131,072 | 131,072 | 262,144 ネイティブ、最大 1,010,000 | 128K |
| モダリティ | テキスト | テキスト | テキスト、画像、動画 | テキスト、画像、音声 |
| ライセンス | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| LiveCodeBench v6* | 82.0 | 69.4 | 75.4 | 69.4 |
| SWE-bench Verified* | 47.0 | 2.0 | 50.0 | 23.0 |
| Terminal-Bench 2.1* | 17.4 | 0.6 | 21.7 | 3.4 |
| BFCL v4* | 62.3 | 49.6 | 58.5 | 52.5 |
| GPQA Diamond* | 64.6 | 51.0 | 77.8 | 53.1 |
| AIME 25/26* | 83.3 | 60.1 | 86.7 | 45.0 |
*ベンチマーク行: JetBrainsの共有パイプライン、シンキングモード、出典は Mellum2.1モデルカード。ベンダー自身のカードでは、Qwen3.5-9BとGemma 4 E4Bについて異なる数値が報告されています。
主なポイント
- Mellum2.1は、アクティブパラメータ2.5Bの12B MoEシンキングモデルで、Apache 2.0ライセンスの下で提供されています。
- 実際のリポジトリでのRLにより、SWE-bench Verifiedが2.0から47.0に向上しました。
- テストされたグループの中で、LiveCodeBench v6(82.0)とBFCL v4(62.3)で首位を獲得しています。
- Qwen3.5-9Bは、SWE-bench Pro、GPQA Diamond、AIMEでは依然として首位を維持しています。
- 7.0 GBから8.1 GBのGGUFにより、ローカルでのコーディング・サブエージェントが実用的になります。
以下もご覧ください: モデルウェイト, GGUFビルド, 技術ブログ および Mellum2技術レポート。本プロジェクトの研究者に感謝します。また、ぜひ Twitter でフォローし、 150k以上のML SubReddit への参加と、 our Newsletterの購読もお忘れなく。お待ちください!Telegramを使っていますか? 現在、Telegramでも参加できるようになりました。
この投稿 JetBrainsがMellum2.1をリリース:コーディングエージェント向けの12B MoEオープンモデル は最初に MarkTechPostで公開されました.