MarkTechPost

JetBrains veröffentlicht Mellum2.1: Ein offenes 12B-MoE-Modell für Coding-Agents

JetBrains hat Mellum2.1 veröffentlicht, ein Apache-2.0-Denkmodell mit 12B Mixture-of-Experts und 2.5B aktiven Parametern. RL in echten Repositories hob seinen SWE-bench-Verified-Score von 2.0 auf 47.0. Der Beitrag…

JetBrains hat Mellum2.1veröffentlicht, ein offenes Modell, das für Coding-Agents und schnelle Sub-Agents gebaut wurde. Mellum2.1 ist ein 12B-Mixture-of-Experts-Denkmodell von JetBrains, das pro Token 2.5B Parameter aktiviert. Es erscheint unter Apache 2.0 auf Hugging Face. Die Architektur ist gegenüber Mellum2 unverändert. Das Upgrade kommt fast vollständig aus bestärkendem Lernen (RL) in echten Softwareumgebungen. Das Ergebnis ist ein kleines, selbst hostbares Modell, das ein Repository erkundet, Dateien bearbeitet und seine eigenen Änderungen prüft.

TL;DR

  • Größe: 12B gesamt, 2.5B aktiv (64 Experten, 8 aktiv), 131,072-Token-Kontext
  • Läuft auf: den eigenen GPUs über vLLM oder SGLang (Geschwindigkeit getestet auf 1 NVIDIA H200). GGUF-Builds beginnen bei 7.0 GB für llama.cpp, Ollama und LM Studio.
  • Leistung: schlägt Mellum2 bei 15 von 17 gelisteten Benchmarks; gewinnt 5 von 17 gegen Qwen3.5-9B
  • Bestes Ergebnis: 82.0 auf LiveCodeBench v6, vor Qwen3.5-9B (75.4) und Gemma 4 E4B (69.4)
  • Schlechtestes Ergebnis: 17.4 auf Terminal-Bench 2.1, unter Qwen3.5-9B (21.7)
  • Fazit (bestes): starke Coding-Scores und hoher Durchsatz mit nur 2.5B aktiven Parametern.
  • Fazit (schlechtestes): liegt bei schwierigen agentischen Software-Aufgaben und Wissen weiterhin hinter Qwen3.5-9B zurück.

Was ist Mellum2.1?

Mellum2.1 ist die nächste Version von Mellum2 Thinking, das JetBrains im Juni 2026 open-sourcete. Der veröffentlichte Checkpoint ist Mellum2.1-12B-A2.5B-Thinking. Es ist ein Reasoning-Modell, das vor der Antwort seine Gedankenkette ausgibt. JetBrains zielt auf 3 Einsatzbereiche ab: Agent-Worker, allgemeiner Reasoning-Assistent und private Self-Hosted-Bereitstellung.

Wie funktioniert die Mellum2.1-Architektur?

Das Modell hat 28 Layer und 64 Experten. Ein Router aktiviert 8 Experten pro Token. Die Aufmerksamkeit verwendet grouped-query attention mit 32 Query-Köpfen und 4 KV-Köpfen. 3 von 4 Layern verwenden ein gleitendes Fenster von 1,024 Token. Die Kontextlänge beträgt 131,072 Token, und der Wortschatz umfasst 98,304 Token. Die Gewichte werden in bfloat16 ausgeliefert.

Wie wurde Mellum2.1 trainiert?

Fast die gesamte neue Arbeit floss in das Post-Training. RL wechselte von einer kurzen Endphase zum Hauptteil des Trainings. JetBrains fügte RL-Aufgaben in Mathematik, Competitive Programming, Naturwissenschaften, Tool-Nutzung und Software-Engineering hinzu. Es filterte offene RL-Datensätze nach fehlerhaften Tests, nicht überprüfbaren Antworten und Aufgaben, die zu leicht oder unmöglich waren. Beim Software-Engineering trainiert das Modell in echten Repositories mit einer Shell und Dateibearbeitungs-Tools. Es wird belohnt, wenn die Tests bestehen. Das Training startete Millionen von Sandboxes über tausende Umgebungen hinweg.

Wie schlägt sich Mellum2.1 in Benchmarks?

JetBrains evaluierte Mellum2.1, Mellum2, Qwen3.5-9B und Gemma 4 E4B mit einer Pipeline im Thinking-Modus. Alle Ergebnisse werden von JetBrains selbst berichtet.

Der größte Sprung liegt beim agentischen Coding. SWE-bench Verified stieg von 2.0 auf 47.0. SWE-bench Pro stieg von 0.0 auf 28.0. Terminal-Bench 2.1 stieg von 0.6 auf 17.4. Die agentischen Läufe nutzten die Open-Source-Harness Pi v0.73.1 mit einem 114K-Token-Kontext.

Mellum2.1 führt die Gruppe bei LiveCodeBench v6 (82.0), HumanEval+ (91.5), MBPP+ (79.4) und BFCL v4 (62.3) an. Qwen3.5-9B führt weiterhin bei SWE-bench Verified (50.0), SWE-bench Pro (38.0), AIME 25/26 (86.7) und GPQA Diamond (77.8). Auch die Sicherheit verbesserte sich: HarmBench sank von 21.5 auf 8.5, wobei niedriger besser ist.

Pipelines sind wichtig zu berücksichtigen. Qwens eigene Modellkarte listet 65.6 bei LiveCodeBench v6 und 81.7 bei GPQA Diamond. JetBrains maß für dasselbe Modell 75.4 und 77.8.

Wie schnell ist Mellum2.1?

Das Post-Training ließ die Architektur unberührt, daher entspricht die Geschwindigkeit der von Mellum2. Auf 1 H200 unter hoher Last serviert JetBrains zufolge Mellum2.1 fast 2x so viele Tokens wie Qwen3.5-9B. Für eine einzelne Anfrage macht Multi-Token Prediction (MTP) es etwa 1.6x schneller. Der MTP-Kopf für vLLM speculative decoding ist als coming soon gelistet.

Wie führt man Mellum2.1 lokal aus?

Das vollständige Modell wird auf vLLM bereitgestellt mit --reasoning-parser qwen3. Tool Calling fügt --enable-auto-tool-choice --tool-call-parser hermes. JetBrains empfiehlt temperature 0.6, top_p 0.95 und top_k 20.

Die JetBrains-Release-Notes erwähnen, dass GGUF-Builds in Arbeit sind. Ein GGUF-Repository listet bereits 5 Dateien:

  • BF16: 24.3 GB (Referenz)
  • Q8_0: 12.9 GB, 96.1% Top-Token-Übereinstimmung
  • Q6_K: 10.9 GB, 93.9% Top-Token-Übereinstimmung
  • Q4_K_M: 8.1 GB, 88.0% Top-Token-Übereinstimmung (empfohlen)
  • MXFP4_MOE: 7,0 GB, 85,6 % Top-Token-Übereinstimmung

Mellum2.1 vs. Qwen3.5-9B vs. Gemma 4 E4B

MerkmalMellum2.1Mellum2 ThinkingQwen3.5-9BGemma 4 E4B
ArchitekturMoE, 64 Experten, 8 aktivMoE (wie bei 2.1)Hybrid Gated DeltaNet + gated attentionDense mit per-layer embeddings
Gesamtparameter12B12B9B (Sprachmodell)8B mit Embeddings
Aktive / effektive Parameter2.5B aktiv2.5B aktiv9B (dicht)4.5B effektiv
Kontext131,072131,072262,144 nativ, bis zu 1,010,000128K
ModalitätTextTextText, Bild, VideoText, Bild, Audio
LizenzApache 2.0Apache 2.0Apache 2.0Apache 2.0
LiveCodeBench v6*82.069.475.469.4
SWE-bench Verified*47.02.050.023.0
Terminal-Bench 2.1*17.40.621.73.4
BFCL v4*62.349.658.552.5
GPQA Diamond*64.651.077.853.1
AIME 25/26*83.360.186.745.0

*Benchmarkzeilen: JetBrains’ gemeinsame Pipeline, Thinking-Modus, aus der Mellum2.1-Modellkarte. Die eigenen Karten der Anbieter melden andere Zahlen für Qwen3.5-9B und Gemma 4 E4B.

Kernaussagen

  • Mellum2.1 ist ein 12B-MoE-Thinking-Modell mit 2.5B aktiven Parametern, unter Apache 2.0.
  • RL in echten Repositories hob SWE-bench Verified von 2.0 auf 47.0.
  • Es führt die getestete Gruppe bei LiveCodeBench v6 (82.0) und BFCL v4 (62.3) an.
  • Qwen3.5-9B gewinnt weiterhin bei SWE-bench Pro, GPQA Diamond und AIME.
  • Ein 7.0-GB-bis-8.1-GB-GGUF macht lokale Coding-Sub-Agents praktikabel.


Schauen Sie sich die Modellgewichte, GGUF-Builds, technischen Blog und den Mellum2-Technikberichtan. Der gesamte Dank gebührt dem Forscher dieses Projekts. Folgen Sie uns gerne auch auf Twitter und vergessen Sie nicht, unserem 150k+ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.

Der Beitrag JetBrains veröffentlicht Mellum2.1: Ein offenes 12B-MoE-Modell für Coding-Agents erschien zuerst auf MarkTechPost.

Originalquelle

MarkTechPost

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten