Hugging Face

عائلة نموذج واحد، نتائج مستوى ذهبي اثنين: تعديل دقيق لنيموترون لصالح IOI وIMO

الأولمبياد الدولي في علوم المعلومات (IOI) والأولمبياد الدولي للرياضيات (IMO) يختبران مهارات مختلفة. يتطلب IOI خوارزميات وكودًا يخضعان لاختبارات خفية ضمن حدود زمنية ومحددة للتقديم. أما IMO فيتطلب براهي

fig_ioi_imo_gold_results_headline
مصدر الصورة · Hugging Face

الأولمبياد الدولي في علوم المعلومات (IOI) والأولمبياد الدولي للرياضيات (IMO) يختبران مهارات مختلفة. يتطلب IOI خوارزميات وكودًا يخضعان لاختبارات خفية ضمن حدود زمنية ومحددة للتقديم. أما IMO فيتطلب براهين صارمة باللغة الطبيعية. النجاح في أي من المسابقات أمر صعب. والنجاح في كليهما يعني شيئًا أوسع.

تُظهر نتائجنا الأخيرة أن Nemotron هو أساس قوي وقابل للتكيف لبناء نماذج متخصصة من الطراز العالمي. بدءًا من Nemotron 3، استخدمت فرقنا التحسين الدقيق المشرف (SFT)، والتعلم الإعادة التشغيلية (RL)، والاستدلال المدفوع بالتعليقات لإنشاء أنظمة وصلت إلى مستوى الميداليات الذهبية في الأولمبياد الدولي 2026 والأولمبياد الدولي للتكنولوجيا 2026.

fig_ioi_imo_gold_results_headline

المنافسة تخصص نيموترون النتيجة
IOI 2026 Nemotron-3-Ultra-CC مع SFT وGenCorrect 535.4/600، أي أعلى من عتبة الذهب البالغة 361.12، وأعلى درجة لشخص بحدود 498.27
في رأيي 2026 نيموترون 3 أولترا عام، SFT، ونقاط التحقق من RL في نظام توليد – التحقق – التحسين 30/42، فوق العتبة الرسمية للذهب والتي تبلغ 29

نتيجة IOI جاءت من تجربة مباشرة وطموحة، تحت نفس ظروف الوقت والوصول إلى الإنترنت والتقديم مثل المتسابقين البشريين. كانت اختبارًا غير رسمي ولا يتم إدارته، ولم تُدرج في التصنيف الرسمي لـ IOI. تم تقييم الأدلة المقدمة من نظام IMO من قبل مُقيمين رسميين.

 وصفة تخصص قابلة للاستخدام مرة أخرى

"سهولة التعديل" يجب أن تعني أكثر من مجرد إمكانية تدريب النقطة مراجعة. يجب أن تعني أن نموذج البناء القادر يمكن تكييفه مع مجال متطلب بطريقة واضحة وقابلة للاستخدام مرة أخرى.

على جانبي المشروعين، كان لهذا النظام أربعة أجزاء:

  1. ابدأ بنموذج قاعدة Nemotron القوي.
  2. جمع مشاكل متخصصة في المجال والسجلات العالية الجودة للتفكير.
  3. طبق طرق المعالجة القياسية بعد التدريب مثل SFT، وعند الضرورة، استخدم RL.
  4. اربط النموذج المتخصص بحلقة استنتاج تُنتج وتقيّم وتحسّن الإجابات المرشحة.

كانت عمليات التدريب والاستدلال كبيرة، لكن النهج الأساسي مألوف وقابل للتكرار. لم نحتاج إلى بناء نموذج أساسي جديد لكل تحدٍ. لقد تخصصنا في Nemotron لهذه المهمة.

من القدرة العامة على البرمجة إلى ذهب جائزة IOI

لبرنامجات البرمجة التنافسية، قمنا بتجميع 22,000 مسألة وخلق سجلات للتفكير الاصطناعي لتدريب متخصصين اثنين. Nemotron-3-Nano-CC، الذي يحتوي على 30 مليار معلمة إجمالية و3 مليار معلمة نشطة، تلقى كل من التدريب بالتعلم العميق والتعلم العميق بالخوارزميات. Nemotron-3-Ultra-CC، الذي يحتوي على 550 مليار معلمة إجمالية و55 مليار معلمة نشطة، تلقى التدريب بالتعلم العميق.

تطور التقدم في IOI 2025 جعل قيمة التخصص واضحة. تحسن Nano من 130 نقطة قبل التدريب إلى 280 بعد SFT، وإلى 291 بعد RL. مع استخدام GenCorrect، استراتيجيتنا التكرارية لالإنتاج والتقييم والتحسين، وصل إلى 468 نقطة وتجاوزت العتبة الذهبية البالغة 438.3. وصل Ultra-CC إلى 502 نقطة بنفس استراتيجية الاختبار.

fig_main_capability_progression_previous_style

أظهرت هذه التجارب أيضًا أن التكيف لا يحتاج إلى أن يبدو بنفس الطريقة على كل المقياسات. أدى SFT إلى تحقيق معظم مكاسب Nano، بينما أضاف RL تحسينًا أصغر ولكن مستمرًا. بالنسبة للنموذج الأقوى Ultra، كان كافيًا جلسة واحدة من SFT لتفوق النموذج Nano المُدرب بالكامل على مقياسات IOI وICPIC وLiveCodeBench Pro. وقد استرشد هذا الاكتشاف بنظام Ultra-CC الخاص بالمنافسة المستخدم في IOI 2026، الذي حقق نتيجة 535.4 من أصل 600.

تدريس نيمترون لتحقيق والتحقق من التصحيحات

طبق مشروع IMO نفس الفكرة على الرياضيات في الأولمبياد. بدءًا من Nemotron 3 Ultra، قمنا بتدريب متخصص واحد باستخدام SFT ومتخصص آخر باستخدام RL.

حوت مورد البيانات SFT 414,890 مثالًا مصحوبًا بجودة، من بين 15,818 مشكلة برهان فريدة. لقد قام بالمزيد من الأمر من خلال تعليم الإجابات النهائية فقط. شملت البيانات إنشاء البراهين، تحسينها، التحقق منها، والتحقق ما بعد التحقق، بحيث تعلم النموذج كيفية بناء الحجج، تحديد الثغرات، الاستجابة للنقد، وتقييم ما إذا كانت البرهان كاملة. تم تدريب نموذج RL على 9,597 مشكلة برهان تم اختيارها بالقرب من حدود قدرة النموذج.

تجاوز كلا نقاط التحقق بعد التدريب النهائي نموذج الإمكانية العامة في تجارب التطوير. كان نقطة التحقق SFT الأقوى في الجولة الأولى من البحث، بينما حقق نقطة التحقق RL أفضل نتيجة على مستوى النقاط التحقق الواحدة بأكملها. كانت قوتاهما متكاملة، لذلك استخدم النظام النهائي كلا الخبيرين إلى جانب النموذج العام.

للكل مشكلة من مشاكل IMO، قامت النماذج بتوليد الأدلة المرشحة، وتقييمها، وإنتاج التعليقات، وتحسين المحاولات الأكثر إثارة للإعجاب. خطوة مستقلة تتميز باستخدام كمية كبيرة من الحسابات اختارت التقديم النهائي. يعمل النظام بأكمله بلغة طبيعية، دون استخدام برامج قياسية، أدوات خارجية، أو وصول إلى الإنترنت. حصل على 30 نقطة من أصل 42 نقطة، بما في ذلك تقييم كامل على أربع من ستة مشاكل، وتجاوز حد الفوز بالميدالية الذهبية الرسمي.

image

> التهيئة الدقيقة والحسابات أثناء الاختبار تعمل معًا

مقالة IOI 2025 على Hugging Face التي نشرناها سابقًا أظهرت كيف يمكن للحوسبة أثناء الاختبار أن تدفع نماذج الوزن المفتوح إلى أداء على مستوى الذهب. وتضيف النتائج الجديدة قطعة مهمة: التخصص الأفضل يوفر للنظام الاستدلالي مرشحين أفضل، ومراقبين أفضل، وتحسينات أفضل.

في IOI، حوّلت GenCorrect المكاسب الناتجة عن التصحيح الدقيق إلى تحسينات أكبر خلال جولات الاستجابة المتعددة. وفي IMO، كان استخدام نقاط التحقق SFT وRL المكملة أكثر قيمة من إجراء عدد أكبر من العينات من نقطة تحديد واحدة فقط. في كلا الحالتين، جاءت النتيجة الأفضل من خلال دمج متخصص قادر مع نظام يمكنه البحث والتحقق والتحسين.

هذا التمييز مهم. لم تُنتج الميداليات من خلال التعديل الدقيق فقط، ولم تُنتج من خلال أخذ العينات بالقوة العنيفة فقط. جاءت من تصميم مشترك للنموذج والبيانات ودورة الاستدلال.

النماذج المفتوحة، البيانات، والوصفات على Hugging Face

نريد أن تكون هذه النتائج مفيدة أكثر من الألعاب. مجموعة Nemotron Labs IMO 2026 تجمع بين نقاط التحقق SFT وRL، وهما مجموعات تعليمية، بالإضافة إلى Nemotron-IMO-Bench، وهو اختبار جديد يتضمن 200 مشكلة على مستوى الأولمبياد. يصف الورقة البحثية IMO نهج التدريب والنظام الخاص بالتوليد والتحقق والتحسين، بينما يحتوي مستودع NeMo-Skills على خطوة الاستدلال IMO، والطلبات، والأدلة المقدمة، وبديل سريع قابل للتكرار. بالنسبة للبرمجة التنافسية، متاح نموذج Nemotron-3-Ultra-CC على Hugging Face، ويوفر الورقة البحثية IOI وصفًا لوصفة التدريب ومنهجية GenCorrect. كما أن خطوة تقييم واستدلال IOI متاحة أيضًا في NeMo-Skills.

معًا، توفر IMO وIOI أدلة مطلوبة للغاية لفكرة بسيطة: يمكن تعديل Nemotron لتصبح متخصصة في مجالات عالمية من الطراز الرفيع، ثم يتم تجميعه مع عمليات استدلال شفافة لحل المشكلات على أحد حدود المنافسة البشرية.

نحن سعداء برؤية ما ستبنيه مجتمع Hugging Face القادم.

المصدر الأصلي

Hugging Face

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل