IT之家 AI

JetBrains برمجة نموذج الذكاء الاصطناعي Mellum2.1: معدل الإنتاجية للتفكير الضخم يصل إلى ضعف Qwen3.5-9B

على موقع IT之家 في 9 أكتوبر، أعلنت شركة JetBrains أمس (8 أكتوبر) عن نشر تدوينة تعلن عن إطلاق نموذج Mellum2.1، مع التركيز على تعزيز قدرات برمجة الأنظمة الذكية. يتبع هذا النموذج بنية الخبراء المختلطة 12B لـ Mellum2، ويحتوي…

Mellum2.1 compared with Mellum2, Qwen3.5-9B, and Gemma 4 E4B
مصدر الصورة · IT之家 AI
شكرًا لمستخدمي ITHOME الذين قدموا أدلة!

IT之家، 9 أكتوبر: أعلنت شركة JetBrains أمس (8 أكتوبر) عن نشر نموذج Mellum2.1، مع التركيز على تعزيز قدرات برمجة الأجهزة الذكية. يستمر هذا النموذج في اتباع بنية الخبراء المختلط باستخدام 12B من نوع Mellum2، ويحتوي على 2.5B من المعلمات النشطة، كما يُنشر وفق ترخيص Apache 2.0.

Mellum2.1 تقدم التحديث الرئيسي لمرحلة التعلم المعزز بعد التدريب المسبق، حيث تتوسع من مرحلة الإنجازات قصيرة الأمد إلى كيان التدريب الأساسي، وتضيف بيانات تدريب إضافية في مهام مثل الرياضيات، ومنافسات الخوارزميات، والعلوم، واستخدام الأدوات، وهندسة البرمجيات.

قام JetBrains ببناء البنية التحتية لبيئة التعلم المعزز الداخلية لهذا النموذج، حيث تم تشغيل ملايين الشوت خلال عملية التدريب، وشمل ذلك الآلاف من البيئات. بالإضافة إلى ذلك، قبل التدريب، قام الفريق بتصفية مجموعات البيانات المفتوحة، بإزالة العيوب في الاختبار والإجابات غير القابلة للتحقق من صحتها والمهام ذات الصعوبة غير المناسبة.

بعد التحديث، يمكن لمellum2.1 استكشاف مكتبة الكود وتحرير الملفات وفحص التغييرات التي أجراها بنفسه. تقول JetBrains إن أهم التحسينات تظهر في مجال برمجة الأنظمة الذكية، حيث يمكن للنموذج التعرف على أسباب فشل الاختبارات، ووضع خطط الإصلاح وتحقق من نتائجها.

من ناحية الأداء، تتشابه إطار عمل Mellum2.1 مع Mellum2، ولا يتغير السرعة، بينما يزيد التنبؤ بالعديد من التوكنات (MTP) من سرعة الاستجابة. في سيناريو طلب واحد، يزيد MTP من سرعته بحوالي 1.6 مرة.

Mellum2.1 compared with Mellum2, Qwen3.5-9B, and Gemma 4 E4B

قامت JetBrains بمقارنة Mellum2.1 مع Mellum2، وQwen3.5-9B، وGemma 4 E4B تحت نفس إعدادات التقييم. وأظهرت النتائج أن عند الحمل العالي، يصل حجم تدفق البتات في استدلال Mellum2.1 إلى ضعف Qwen3.5-9B، وقد شهد تحسن في مجالات البرمجة، والمنافسات الخوارزمية، والرياضيات، واستدعاء الأدوات، والمعرفة العامة. وتضمّنت منصة IT Home صورًا توضيحية ذات الصلة كما يلي:

Output tokens per second on one H200 for Mellum2.1, Qwen3.5-9B, and Gemma 4 E4B

Mellum2.1 قد تم تسجيله على Hugging Face، ويدعم التثبيت على البنية الأساسية المحلية أو الخاصة، مما يسمح للشركات بالاحتفاظ بالكود والبيانات في بيئتها الخاصة. من المتوقع أن يتم إصدار الإصدارات GGUF الخاصة بـ llama.cpp وOllama وLM Studio، بالإضافة إلى مكون التشفير التخميني MTP لمشروع vLLM.

المصدر الأصلي

IT之家 AI

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل