JetBrains ha lanzado Mellum2.1, un modelo abierto creado para agentes de código y sub-agentes rápidos. Mellum2.1 es un modelo de razonamiento mixture-of-experts de 12B de JetBrains que activa 2.5B de parámetros por token. Se publica bajo Apache 2.0 en Hugging Face. La arquitectura no ha cambiado respecto a Mellum2. La mejora proviene casi por completo del aprendizaje por refuerzo (RL) en entornos de software reales. El resultado es un modelo pequeño, autoalojable, que explora un repositorio, edita archivos y verifica sus propios cambios.
TL;DR
- Tamaño: 12B en total, 2.5B activos (64 expertos, 8 activos), contexto de 131,072 tokens
- Funciona en: tus propias GPU mediante vLLM o SGLang (velocidad probada en 1 NVIDIA H200). Las compilaciones GGUF comienzan en 7.0 GB para llama.cpp, Ollama y LM Studio.
- Rendimiento: supera a Mellum2 en 15 de los 17 benchmarks listados; gana en 5 de 17 frente a Qwen3.5-9B
- Mejor resultado: 82.0 en LiveCodeBench v6, por delante de Qwen3.5-9B (75.4) y Gemma 4 E4B (69.4)
- Peor resultado: 17.4 en Terminal-Bench 2.1, por debajo de Qwen3.5-9B (21.7)
- Conclusión (mejor): fuertes puntuaciones en código y alto rendimiento con solo 2.5B de parámetros activos.
- Conclusión (peor): aún queda por detrás de Qwen3.5-9B en tareas de software agénticas difíciles y en conocimiento.
¿Qué es Mellum2.1?
Mellum2.1 es la siguiente versión de Mellum2 Thinking, que JetBrains hizo de código abierto en junio de 2026. El checkpoint publicado es Mellum2.1-12B-A2.5B-Thinking. Es un modelo de razonamiento que emite su cadena de pensamiento antes de responder. JetBrains apunta a 3 usos: trabajador de agente, asistente general de razonamiento y despliegue privado autoalojado.
¿Cómo funciona la arquitectura de Mellum2.1?
El modelo tiene 28 capas y 64 expertos. Un router activa 8 expertos por token. La atención usa grouped-query attention con 32 cabezas de consulta y 4 cabezas KV. 3 de cada 4 capas usan una ventana deslizante de 1,024 tokens. La longitud de contexto es de 131,072 tokens y el vocabulario tiene 98,304 tokens. Los pesos se distribuyen en bfloat16.
¿Cómo se entrenó Mellum2.1?
Casi todo el nuevo trabajo se dedicó al post-entrenamiento. RL pasó de ser una breve etapa final a la parte principal del entrenamiento. JetBrains añadió tareas de RL en matemáticas, programación competitiva, ciencia, uso de herramientas e ingeniería de software. Filtró conjuntos de datos de RL abiertos en busca de pruebas rotas, respuestas no verificables y tareas demasiado fáciles o imposibles. Para ingeniería de software, el modelo entrena en repositorios reales con un shell y herramientas de edición de archivos. Se le recompensa cuando las pruebas pasan. El entrenamiento lanzó millones de sandboxes a través de miles de entornos.
¿Cómo rinde Mellum2.1 en los benchmarks?
JetBrains evaluó Mellum2.1, Mellum2, Qwen3.5-9B y Gemma 4 E4B con un solo pipeline en modo de pensamiento. Todas las puntuaciones son autoinformadas por JetBrains.
El mayor salto es la codificación agéntica. SWE-bench Verified subió de 2.0 a 47.0. SWE-bench Pro subió de 0.0 a 28.0. Terminal-Bench 2.1 subió de 0.6 a 17.4. Las ejecuciones agénticas usaron el harness de código abierto Pi v0.73.1 con un contexto de 114K tokens.
Mellum2.1 lidera el grupo en LiveCodeBench v6 (82.0), HumanEval+ (91.5), MBPP+ (79.4) y BFCL v4 (62.3). Qwen3.5-9B aún lidera en SWE-bench Verified (50.0), SWE-bench Pro (38.0), AIME 25/26 (86.7) y GPQA Diamond (77.8). La seguridad también mejoró: HarmBench bajó de 21.5 a 8.5, donde un valor más bajo es mejor.
Los pipelines son importantes a considerar. La propia ficha de Qwen indica 65.6 en LiveCodeBench v6 y 81.7 en GPQA Diamond. JetBrains midió 75.4 y 77.8 para el mismo modelo.
¿Qué tan rápido es Mellum2.1?
El post-entrenamiento dejó la arquitectura intacta, por lo que la velocidad coincide con Mellum2. En 1 H200 bajo carga pesada, JetBrains dice que Mellum2.1 sirve casi 2x los tokens de Qwen3.5-9B. Para una sola solicitud, la predicción multi-token (MTP) lo hace aproximadamente 1.6x más rápido. La cabeza MTP para la decodificación especulativa de vLLM figura como próxima.
¿Cómo se ejecuta Mellum2.1 localmente?
El modelo completo se sirve en vLLM con --reasoning-parser qwen3. Las llamadas a herramientas añaden --enable-auto-tool-choice --tool-call-parser hermes. JetBrains recomienda temperature 0.6, top_p 0.95 y top_k 20.
Las notas de la versión de JetBrains mencionan que las compilaciones GGUF están en progreso. Un repositorio GGUF ya enumera 5 archivos:
- BF16: 24.3 GB (referencia)
- Q8_0: 12.9 GB, 96.1% de coincidencia de token superior
- Q6_K: 10.9 GB, 93.9% de coincidencia de token superior
- Q4_K_M: 8.1 GB, 88.0% de coincidencia de token superior (recomendado)
- MXFP4_MOE: 7.0 GB, coincidencia del 85.6% en tokens principales
Mellum2.1 vs Qwen3.5-9B vs Gemma 4 E4B
| Característica | Mellum2.1 | Mellum2 Thinking | Qwen3.5-9B | Gemma 4 E4B |
|---|---|---|---|---|
| Arquitectura | MoE, 64 expertos, 8 activos | MoE (igual que 2.1) | Hybrid Gated DeltaNet + atención con compuerta | Denso con embeddings por capa |
| Parámetros totales | 12B | 12B | 9B (modelo de lenguaje) | 8B con embeddings |
| Parámetros activos / efectivos | 2.5B activos | 2.5B activos | 9B (denso) | 4.5B efectivos |
| Contexto | 131,072 | 131,072 | 262,144 nativo, hasta 1,010,000 | 128K |
| Modalidad | Texto | Texto | Texto, imagen, video | Texto, imagen, audio |
| Licencia | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| LiveCodeBench v6* | 82.0 | 69.4 | 75.4 | 69.4 |
| SWE-bench Verified* | 47.0 | 2.0 | 50.0 | 23.0 |
| Terminal-Bench 2.1* | 17.4 | 0.6 | 21.7 | 3.4 |
| BFCL v4* | 62.3 | 49.6 | 58.5 | 52.5 |
| GPQA Diamond* | 64.6 | 51.0 | 77.8 | 53.1 |
| AIME 25/26* | 83.3 | 60.1 | 86.7 | 45.0 |
*Filas de benchmarks: pipeline compartido de JetBrains, modo de pensamiento, a partir de la ficha del modelo Mellum2.1. Las fichas propias de los proveedores reportan números diferentes para Qwen3.5-9B y Gemma 4 E4B.
Conclusiones clave
- Mellum2.1 es un modelo de pensamiento MoE de 12B con 2.5B de parámetros activos, bajo Apache 2.0.
- El RL en repositorios reales elevó SWE-bench Verified de 2.0 a 47.0.
- Lidera el grupo probado en LiveCodeBench v6 (82.0) y BFCL v4 (62.3).
- Qwen3.5-9B sigue ganando en SWE-bench Pro, GPQA Diamond y AIME.
- Un GGUF de 7.0 GB a 8.1 GB hace prácticos los sub-agentes de código locales.
Echa un vistazo a los pesos del modelo, compilaciones GGUF, blog técnico y el informe técnico de Mellum2. Todo el mérito es del investigador de este proyecto. Además, no dudes en seguirnos en Twitter y no olvides unirte a nuestro SubReddit de ML de más de 150k y suscribirte a nuestro boletín. ¡Espera! ¿estás en telegram? ahora también puedes unirte a nosotros en telegram.
La entrada JetBrains lanza Mellum2.1: un modelo abierto MoE de 12B para agentes de programación apareció primero en MarkTechPost.