IT之家، 9 أكتوبر: أعلنت شركة JetBrains أمس (8 أكتوبر) عن نشر نموذج Mellum2.1، مع التركيز على تعزيز قدرات برمجة الأجهزة الذكية. يستمر هذا النموذج في اتباع بنية الخبراء المختلط باستخدام 12B من نوع Mellum2، ويحتوي على 2.5B من المعلمات النشطة، كما يُنشر وفق ترخيص Apache 2.0.
Mellum2.1 تقدم التحديث الرئيسي لمرحلة التعلم المعزز بعد التدريب المسبق، حيث تتوسع من مرحلة الإنجازات قصيرة الأمد إلى كيان التدريب الأساسي، وتضيف بيانات تدريب إضافية في مهام مثل الرياضيات، ومنافسات الخوارزميات، والعلوم، واستخدام الأدوات، وهندسة البرمجيات.
قام JetBrains ببناء البنية التحتية لبيئة التعلم المعزز الداخلية لهذا النموذج، حيث تم تشغيل ملايين الشوت خلال عملية التدريب، وشمل ذلك الآلاف من البيئات. بالإضافة إلى ذلك، قبل التدريب، قام الفريق بتصفية مجموعات البيانات المفتوحة، بإزالة العيوب في الاختبار والإجابات غير القابلة للتحقق من صحتها والمهام ذات الصعوبة غير المناسبة.
بعد التحديث، يمكن لمellum2.1 استكشاف مكتبة الكود وتحرير الملفات وفحص التغييرات التي أجراها بنفسه. تقول JetBrains إن أهم التحسينات تظهر في مجال برمجة الأنظمة الذكية، حيث يمكن للنموذج التعرف على أسباب فشل الاختبارات، ووضع خطط الإصلاح وتحقق من نتائجها.
من ناحية الأداء، تتشابه إطار عمل Mellum2.1 مع Mellum2، ولا يتغير السرعة، بينما يزيد التنبؤ بالعديد من التوكنات (MTP) من سرعة الاستجابة. في سيناريو طلب واحد، يزيد MTP من سرعته بحوالي 1.6 مرة.


قامت JetBrains بمقارنة Mellum2.1 مع Mellum2، وQwen3.5-9B، وGemma 4 E4B تحت نفس إعدادات التقييم. وأظهرت النتائج أن عند الحمل العالي، يصل حجم تدفق البتات في استدلال Mellum2.1 إلى ضعف Qwen3.5-9B، وقد شهد تحسن في مجالات البرمجة، والمنافسات الخوارزمية، والرياضيات، واستدعاء الأدوات، والمعرفة العامة. وتضمّنت منصة IT Home صورًا توضيحية ذات الصلة كما يلي:

Mellum2.1 قد تم تسجيله على Hugging Face، ويدعم التثبيت على البنية الأساسية المحلية أو الخاصة، مما يسمح للشركات بالاحتفاظ بالكود والبيانات في بيئتها الخاصة. من المتوقع أن يتم إصدار الإصدارات GGUF الخاصة بـ llama.cpp وOllama وLM Studio، بالإضافة إلى مكون التشفير التخميني MTP لمشروع vLLM.
