أطلقت JetBrains Mellum2.1، وهو نموذج مفتوح مصمم لوكلاء البرمجة والوكلاء الفرعيين السريعين. Mellum2.1 هو نموذج تفكير من نوع mixture-of-experts بحجم 12B من JetBrains يفعّل 2.5B من البرامِترات لكل رمز (token). ويأتي برخصة Apache 2.0 على Hugging Face. لم تتغير البنية المعمارية عن Mellum2. فالترقية جاءت بالكامل تقريباً من التعلم المعزز (RL) في بيئات برمجية حقيقية. والنتيجة نموذج صغير قابل للاستضافة الذاتية يستكشف مستودعاً، ويحرر الملفات، ويفحص تغييراته بنفسه.
الخلاصة السريعة
- الحجم: 12B إجمالاً، 2.5B نشطة (64 خبيراً، 8 نشطة)، سياق بطول 131,072 رمزاً
- يعمل على: وحدات معالجة الرسومات الخاصة بك عبر vLLM أو SGLang (اختُبرت السرعة على 1 NVIDIA H200). تبدأ نسخ GGUF من 7.0 GB لبرامج llama.cpp وOllama وLM Studio.
- الأداء: يتفوق على Mellum2 في 15 من أصل 17 معياراً مذكوراً؛ ويفوز في 5 من 17 ضد Qwen3.5-9B
- الأفضل: 82.0 على LiveCodeBench v6، متقدماً على Qwen3.5-9B (75.4) وGemma 4 E4B (69.4)
- الأسوأ: 17.4 على Terminal-Bench 2.1، وهو أقل من Qwen3.5-9B (21.7)
- الخلاصة (الأفضل): نتائج قوية في البرمجة وإنتاجية عالية من 2.5B فقط من البرامِترات النشطة.
- الخلاصة (الأسوأ): لا يزال متأخراً عن Qwen3.5-9B في مهام البرمجيات الوكيلية الصعبة والمعرفة.
ما هو Mellum2.1؟
Mellum2.1 هو الإصدار التالي من Mellum2 Thinking، الذي فتحت JetBrains مصدره في يونيو 2026. والنسخة المطلقة هي Mellum2.1-12B-A2.5B-Thinkingوهو نموذج استدلال يُصدر سلسلة تفكيره قبل الإجابة. تستهدف JetBrains 3 استخدامات: عاملاً وكيلاً (agent worker)، ومساعداً عاماً للاستدلال، ونشراً خاصاً ذاتي الاستضافة.
كيف تعمل بنية Mellum2.1؟
يحتوي النموذج على 28 طبقة و64 خبيراً. يفعّل الموجّه 8 خبراء لكل رمز. تستخدم آلية الانتباه grouped-query attention مع 32 رأس استعلام و4 رؤوس KV. تستخدم 3 من كل 4 طبقات نافذة منزلقة بحجم 1,024 رمزاً. طول السياق هو 131,072 رمزاً، وتبلغ حصيلة المفردات 98,304 رمزاً. تُشحن الأوزان بصيغة bfloat16.
كيف دُرّب Mellum2.1؟
ذهب تقريباً كل العمل الجديد إلى التدريب اللاحق. انتقل التعلم المعزز (RL) من مرحلة نهائية قصيرة إلى الجزء الرئيسي من التدريب. أضافت JetBrains مهام RL في الرياضيات، والبرمجة التنافسية، والعلوم، واستخدام الأدوات، وهندسة البرمجيات. وقد رشّحت مجموعات بيانات RL المفتوحة من الاختبارات المعطوبة والإجابات غير القابلة للتحقق والمهام السهلة جداً أو المستحيلة. وفي هندسة البرمجيات، يتدرّب النموذج في مستودعات حقيقية مزودة بصدفة وأدوات لتحرير الملفات. ويُكافأ عندما تنجح الاختبارات. أطلق التدريب ملايين البيئات المعزولة عبر آلاف البيئات.
كيف يؤدي Mellum2.1 على المعايير المرجعية؟
قيّمت JetBrains Mellum2.1 وMellum2، Qwen3.5-9B و Gemma 4 E4B بخط أنابيب واحد في وضع التفكير. جميع الدرجات مُبلّغ عنها ذاتياً من JetBrains.
أكبر قفزة هي البرمجة الوكيلة. ارتفع SWE-bench Verified من 2.0 إلى 47.0. وارتفع SWE-bench Pro من 0.0 إلى 28.0. وارتفع Terminal-Bench 2.1 من 0.6 إلى 17.4. استخدمت التشغيلات الوكيلة إطار العمل مفتوح المصدر Pi v0.73.1 بسياق سعة 114K رمزاً.
يتصدر Mellum2.1 المجموعة على LiveCodeBench v6 (82.0) وHumanEval+ (91.5) وMBPP+ (79.4) وBFCL v4 (62.3). لا يزال Qwen3.5-9B متقدماً على SWE-bench Verified (50.0) وSWE-bench Pro (38.0) وAIME 25/26 (86.7) وGPQA Diamond (77.8). كما تحسّنت السلامة: انخفض HarmBench من 21.5 إلى 8.5، حيث يكون الأقل أفضل.
خطوط الأنابيب مهمة يجب أخذها في الاعتبار. تسرد بطاقة Qwen الخاصة 65.6 على LiveCodeBench v6 و81.7 على GPQA Diamond. قاست JetBrains 75.4 و77.8 للنموذج نفسه.
ما مدى سرعة Mellum2.1؟
لم يغيّر التدريب اللاحق البنية، لذا تطابق السرعة مع Mellum2. على 1 H200 تحت حِمل ثقيل، تقول JetBrains إن Mellum2.1 يقدّم ما يقارب 2x من رموز Qwen3.5-9B. ولفرد طلب واحد، يجعل التنبؤ متعدد الرموز (MTP) أسرع بنحو 1.6x. رأس MTP لفك الترميز التخميني في vLLM مُدرج على أنه قادم قريباً.
كيف تشغّل Mellum2.1 محلياً؟
يعمل النموذج الكامل على vLLM مع --reasoning-parser qwen3. ويضيف استدعاء الأدوات --enable-auto-tool-choice --tool-call-parser hermes. توصي JetBrains بدرجة حرارة 0.6 وtop_p 0.95 وtop_k 20.
تشير ملاحظات إصدار JetBrains إلى أن بنيات GGUF قيد الإنجاز. وأحد مستودعات GGUF يسرد بالفعل 5 ملفات:
- BF16: 24.3 GB (مرجعي)
- Q8_0: 12.9 GB، تطابق 96.1% للرمز الأعلى
- Q6_K: 10.9 GB، تطابق 93.9% للرمز الأعلى
- Q4_K_M: 8.1 GB، تطابق 88.0% للرمز الأعلى (موصى به)
- MXFP4_MOE: 7.0 جيجابايت، تطابق 85.6% في أعلى الرموز
Mellum2.1 مقابل Qwen3.5-9B مقابل Gemma 4 E4B
| الخاصية | Mellum2.1 | Mellum2 Thinking | Qwen3.5-9B | Gemma 4 E4B |
|---|---|---|---|---|
| البنية المعمارية | MoE، 64 خبيراً، 8 نشطة | MoE (نفس إصدار 2.1) | Hybrid Gated DeltaNet + انتباه مُبوَّب | كثيف مع تضمينات لكل طبقة |
| إجمالي المعاملات | 12B | 12B | 9B (نموذج لغوي) | 8B مع التضمينات |
| المعاملات النشطة / الفعلية | 2.5B نشطة | 2.5B نشطة | 9B (كثيف) | 4.5B فعّالة |
| السياق | 131,072 | 131,072 | 262,144 أصلياً، حتى 1,010,000 | 128K |
| النمط الإدراكي | نص | نص | نص، صورة، فيديو | نص، صورة، صوت |
| الترخيص | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| LiveCodeBench v6* | 82.0 | 69.4 | 75.4 | 69.4 |
| SWE-bench Verified* | 47.0 | 2.0 | 50.0 | 23.0 |
| Terminal-Bench 2.1* | 17.4 | 0.6 | 21.7 | 3.4 |
| BFCL v4* | 62.3 | 49.6 | 58.5 | 52.5 |
| GPQA Diamond* | 64.6 | 51.0 | 77.8 | 53.1 |
| AIME 25/26* | 83.3 | 60.1 | 86.7 | 45.0 |
*صفوف المعايير القياسية: خط أنابيب JetBrains المشترك، وضع التفكير، من بطاقة نموذج Mellum2.1. تذكر بطاقات الموردين أنفسهم أرقاماً مختلفة لـ Qwen3.5-9B و Gemma 4 E4B.
أبرز النقاط
- Mellum2.1 هو نموذج تفكير MoE بحجم 12B مع 2.5B من المعلمات النشطة، بموجب ترخيص Apache 2.0.
- رفع التعلم المعزز (RL) في مستودعات حقيقية نتيجة SWE-bench Verified من 2.0 إلى 47.0.
- يتصدر المجموعة المختبرة في LiveCodeBench v6 (82.0) و BFCL v4 (62.3).
- لا يزال Qwen3.5-9B متفوقاً في SWE-bench Pro و GPQA Diamond و AIME.
- ملفات GGUF بحجم من 7.0 GB إلى 8.1 GB تجعل الوكلاء الفرعيين للبرمجة المحلية عمليين.
اطلع على أوزان النموذج, نسخ GGUF, المدونة التقنية و التقرير التقني لـ Mellum2. كل الفضل يعود إلى الباحث المسؤول عن هذا المشروع. كما لا تترددوا في متابعتنا على تويتر ولا تنسوا الانضمام إلى مجموعة ML SubReddit التي تضم أكثر من 150k عضو و الاشتراك في نشرتنا البريدية. مهلاً! هل أنت على تيليجرام؟ الآن يمكنك أيضاً الانضمام إلينا على تيليجرام.
ظهر المنشور JetBrains تُطلق Mellum2.1: نموذج MoE مفتوح بحجم 12B لوكلاء البرمجة أول مرة على MarkTechPost.