MarkTechPost

JetBrains publie Mellum2.1 : un modèle ouvert MoE 12B pour les agents de codage

JetBrains a publié Mellum2.1, un modèle de raisonnement mixture-of-experts 12B sous Apache 2.0 avec 2.5B de paramètres actifs. L'apprentissage par renforcement dans de vrais dépôts a fait passer son score SWE-bench…

JetBrains a publié Mellum2.1, un modèle ouvert conçu pour les agents de codage et les sous-agents rapides. Mellum2.1 est un modèle de raisonnement mixture-of-experts 12B de JetBrains qui active 2.5B de paramètres par token. Il est disponible sous Apache 2.0 sur Hugging Face. L'architecture est inchangée par rapport à Mellum2. L'amélioration provient presque entièrement de l'apprentissage par renforcement (RL) dans de véritables environnements logiciels. Le résultat est un modèle compact et auto-hébergeable qui explore un dépôt, modifie des fichiers et vérifie ses propres changements.

TL;DR

  • Taille : 12B au total, 2.5B actifs (64 experts, 8 actifs), contexte de 131,072 tokens
  • Fonctionne sur : vos propres GPU via vLLM ou SGLang (vitesse testée sur 1 NVIDIA H200). Les versions GGUF commencent à 7.0 GB pour llama.cpp, Ollama et LM Studio.
  • Performance : surpasse Mellum2 sur 15 des 17 benchmarks listés ; gagne 5 des 17 contre Qwen3.5-9B
  • Meilleur : 82.0 sur LiveCodeBench v6, devant Qwen3.5-9B (75.4) et Gemma 4 E4B (69.4)
  • Pire : 17.4 sur Terminal-Bench 2.1, sous Qwen3.5-9B (21.7)
  • Conclusion (meilleur) : de forts scores de codage et un haut débit avec seulement 2.5B de paramètres actifs.
  • Conclusion (pire) : reste en retrait de Qwen3.5-9B sur les tâches logicielles agentiques difficiles et les connaissances.

Qu'est-ce que Mellum2.1 ?

Mellum2.1 est la prochaine version de Mellum2 Thinking, que JetBrains a open-sourcée en juin 2026. Le checkpoint publié est Mellum2.1-12B-A2.5B-Thinking. C'est un modèle de raisonnement qui émet sa chaîne de pensée avant de répondre. JetBrains vise 3 usages : agent de travail, assistant de raisonnement général et déploiement privé auto-hébergé.

Comment fonctionne l'architecture de Mellum2.1 ?

Le modèle comporte 28 couches et 64 experts. Un routeur active 8 experts par token. L'attention utilise grouped-query attention avec 32 têtes de requête et 4 têtes KV. 3 couches sur 4 utilisent une fenêtre glissante de 1,024 tokens. La longueur de contexte est de 131,072 tokens et le vocabulaire compte 98,304 tokens. Les poids sont livrés en bfloat16.

Comment Mellum2.1 a-t-il été entraîné ?

Presque tout le nouveau travail a été consacré au post-training. Le RL est passé d'une courte étape finale à la partie principale de l'entraînement. JetBrains a ajouté des tâches de RL en mathématiques, programmation compétitive, science, utilisation d'outils et ingénierie logicielle. Elle a filtré les jeux de données RL ouverts pour éliminer les tests cassés, les réponses invérifiables et les tâches trop faciles ou impossibles. Pour l'ingénierie logicielle, le modèle s'entraîne dans de vrais dépôts avec un shell et des outils d'édition de fichiers. Il est récompensé lorsque les tests passent. L'entraînement a lancé des millions de sandboxes à travers des milliers d'environnements.

Comment Mellum2.1 se comporte-t-il sur les benchmarks ?

JetBrains a évalué Mellum2.1, Mellum2, Qwen3.5-9B et Gemma 4 E4B avec un seul pipeline en mode thinking. Tous les scores sont auto-déclarés par JetBrains.

Le plus grand saut concerne le codage agentique. SWE-bench Verified est passé de 2.0 à 47.0. SWE-bench Pro est passé de 0.0 à 28.0. Terminal-Bench 2.1 est passé de 0.6 à 17.4. Les exécutions agentiques ont utilisé le harnais open source Pi v0.73.1 avec un contexte de 114K tokens.

Mellum2.1 mène le groupe sur LiveCodeBench v6 (82.0), HumanEval+ (91.5), MBPP+ (79.4) et BFCL v4 (62.3). Qwen3.5-9B reste en tête sur SWE-bench Verified (50.0), SWE-bench Pro (38.0), AIME 25/26 (86.7) et GPQA Diamond (77.8). La sécurité s'est aussi améliorée : HarmBench est tombé de 21.5 à 8.5, où plus bas est meilleur.

Les pipelines sont importants à prendre en compte. La propre fiche de Qwen liste 65.6 sur LiveCodeBench v6 et 81.7 sur GPQA Diamond. JetBrains a mesuré 75.4 et 77.8 pour le même modèle.

Quelle est la vitesse de Mellum2.1 ?

Le post-training n'a pas modifié l'architecture, donc la vitesse correspond à celle de Mellum2. Sur 1 H200 sous forte charge, JetBrains indique que Mellum2.1 sert presque 2x les tokens de Qwen3.5-9B. Pour une requête unique, la prédiction multi-tokens (MTP) le rend environ 1.6x plus rapide. La tête MTP pour le speculative decoding de vLLM est annoncée comme arrivant bientôt.

Comment exécuter Mellum2.1 en local ?

Le modèle complet tourne sur vLLM avec --reasoning-parser qwen3. L'appel d'outils ajoute --enable-auto-tool-choice --tool-call-parser hermes. JetBrains recommande temperature 0.6, top_p 0.95 et top_k 20.

Les notes de version de JetBrains mentionnent que les builds GGUF sont en cours. Un dépôt GGUF liste déjà 5 fichiers :

  • BF16 : 24.3 GB (référence)
  • Q8_0 : 12.9 GB, 96.1% de correspondance des top-tokens
  • Q6_K : 10.9 GB, 93.9% de correspondance des top-tokens
  • Q4_K_M : 8.1 GB, 88.0% de correspondance des top-tokens (recommandé)
  • MXFP4_MOE : 7.0 GB, correspondance top-token de 85.6 %

Mellum2.1 vs Qwen3.5-9B vs Gemma 4 E4B

CaractéristiqueMellum2.1Mellum2 ThinkingQwen3.5-9BGemma 4 E4B
ArchitectureMoE, 64 experts, 8 actifsMoE (identique au 2.1)Hybride Gated DeltaNet + attention avec gatingDense avec embeddings par couche
Paramètres totaux12B12B9B (modèle de langage)8B avec embeddings
Paramètres actifs / effectifs2.5B actifs2.5B actifs9B (dense)4.5B effectifs
Contexte131,072131,072262,144 natif, jusqu'à 1,010,000128K
ModalitéTexteTexteTexte, image, vidéoTexte, image, audio
LicenceApache 2.0Apache 2.0Apache 2.0Apache 2.0
LiveCodeBench v6*82.069.475.469.4
SWE-bench Verified*47.02.050.023.0
Terminal-Bench 2.1*17.40.621.73.4
BFCL v4*62.349.658.552.5
GPQA Diamond*64.651.077.853.1
AIME 25/26*83.360.186.745.0

*Lignes de benchmarks : pipeline partagé de JetBrains, mode de réflexion, tirées de la fiche modèle Mellum2.1. Les fiches des fournisseurs rapportent des chiffres différents pour Qwen3.5-9B et Gemma 4 E4B.

Points clés

  • Mellum2.1 est un modèle de réflexion MoE de 12B avec 2.5B de paramètres actifs, sous licence Apache 2.0.
  • L'apprentissage par renforcement dans de vrais dépôts a fait passer SWE-bench Verified de 2.0 à 47.0.
  • Il domine le groupe testé sur LiveCodeBench v6 (82.0) et BFCL v4 (62.3).
  • Qwen3.5-9B l'emporte encore sur SWE-bench Pro, GPQA Diamond et AIME.
  • Un GGUF de 7.0 Go à 8.1 Go rend pratiques les sous-agents de codage en local.


Découvrez les poids du modèle, versions GGUF, blog technique ainsi que le rapport technique Mellum2. Tout le mérite revient au chercheur de ce projet. N'hésitez pas également à nous suivre sur Twitter et n'oubliez pas de rejoindre notre SubReddit ML de plus de 150k et de vous abonner à notre newsletter. Attendez ! êtes-vous sur telegram ? vous pouvez désormais nous rejoindre sur telegram également.

L’article JetBrains publie Mellum2.1 : un modèle ouvert MoE 12B pour les agents de codage est applu en premier sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original