قدّم باحثو NVIDIA، بالتعاون مع جامعة برينستون وجامعة ماريلاند، PivotOPD، وهي طريقة تقطيع على السياسة (on-policy distillation) لوكلاء نماذج اللغة الكبيرة متعددي الأدوار. يدرّب PivotOPD عبر التقطيع على السياسة الوكيل على تجنب أخطائه المبكرة الأكثر ضرراً، وعلى التعافي عندما تقع رغم ذلك. مقابل 13 خط أساس، يحقق أفضل متوسط على ALFWorld وWebShop والبحث في الأسئلة والأجوبة المبنية على البحث لطلاب Qwen3-1.7B وQwen3-8B. الخلاصة: التعافي قابل للتعلّم، والتقطيع على السياسة القياسي نادراً ما يعلّمه.
الخلاصة السريعة
- الحجم: طريقة تدريب، وليست نموذجاً. اختُبرت على طلاب Qwen3-1.7B وQwen3-8B، إضافة إلى طالب Nemotron-3.5-SFT على SWE-Bench Verified.
- يعمل على: دُرّب على عقد NVIDIA H100. يضيف 0 من تكلفة الاستدلال، لذا يعمل الوكيل المدرّب أينما يعمل نموذجه الأساسي.
- الأداء: أولاً على جميع متوسطات المعايير الـ8 مقابل 13 خط أساس، عبر 3 بذور تجريبية.
- الأفضل: يتعافى من 72.7% من الأخطاء المحورية المعاد تشغيلها، مقابل 20.3% للتقطيع على السياسة القياسي.
- الأسوأ: 55.9% على مهام "Look" في ALFWorld مع طالب 1.7B، مقابل 83.9% لـ SOD.
- الخلاصة النهائية: الأفضل: يعلّم التعافي الذي لا يستطيع التعلم المعزز المعتمد على النتائج فقط الوصول إليه. الأسوأ: يعتمد على بيئات قابلة لإعادة التشغيل ومعلم تتطابق نقاطه المحورية مع المرجع في 77.8% من عمليات التشغيل الفاشلة.
ما هو الخطأ المحوري في وكيل متعدد الأدوار؟
الخطأ المحوري هو إجراء يطيل أقصر مسار متبقٍ لإنجاز مهمة، أو يجعلها غير قابلة للحل. يقيس المرجع الرمزي لـ ALFWorld هذا في كل دور.
عبر Qwen3-8B وQwen3-30B-A3B وQwen3-235B-A22B، احتوى 59% من عمليات التشغيل الفاشلة (155 من 262) على خطأ محوري واحد. جاء الدور المحوري الأول مبكراً، بوسيط يتراوح بين الدور 8 و12 من أصل 30. ثم أهدر الوكلاء 18 إلى 21 دوراً إضافياً دون تعافٍ.
في إعادة تشغيل إخفاقات Qwen3-8B، رفع تصحيح الدور المحوري النجاح من 8% إلى 59%. وبترك الخطأ في مكانه وإجبار الإجراء الصحيح خلال الدورين الـ2 التاليين بلغ النجاح 58% رغم ذلك.
لماذا يفوّته التقطيع القياسي على السياسة؟
خفّض التقطيع القياسي على السياسة معدل الفشل المحتجَب من 79% إلى 56%. أما الإخفاقات بعد دور محوري فلم تنخفض إلا من 51% إلى 49%. وبقي الإجراء الصحيح تحت احتمال 1% في كل دور محوري، لذا نادراً ما تعيّنه 8 عمليات تشغيل.
ويتشارك التعلم المعزز القائم على النتائج نفس النقطة العمياء: إذا فشلت كل عمليات التشغيل، كانت الميزة النسبية للمجموعة 0.
كيف يعمل PivotOPD؟
يضيف PivotOPD 3 مكونات إلى التعلم المعزز القائم على المجموعات، مدمجة في تحديث PPO واحد.
- كشف المحاور: يقرأ نموذج معلّم أكبر كل عملية تشغيل ونتيجتها بأثر رجعي. يختار الأدوار المرشحة ويحدد إجراءً ذهبياً عند كل منها. ويُعد الدور محورياً عندما يختلف إجراء الطالب عن الإجراء الذهبي. على ALFWorld، تقع المحاور المكتشفة ضمن 1 دور من محور المرجع في 77.8% من عمليات التشغيل الفاشلة في المتوسط.
- التقطيع الوقائي (KL عكسي): نسخة مجمّدة من الطالب، موّلها بالإجراء الذهبي، تعيد تقييم استجابة الطالب نفسها. هذا يدفع الطالب بعيداً عن الخطأ المرتكب.
- التقطير الانتعاشي (KL الأمامي): بعد كل انعطافة، يحدد المعلم إجراء تعافٍ لما يصل إلى K من الأدوار. يكتب المعلّم المُلمَّح استجابات التعافي، ويتدرب عليها الطالب غير المُلمَّح. تقارب KL الأمامي يغطي الكتلة، لذا فهو يرفع الإجراءات التي لا يأخذها الطالب عادةً تقريبًا.
المعلم يحدد الإجراءات فقط. أما الأهداف على مستوى الرموز فتأتي من توزيع الطالب المُلمَّح الخاص به.
كيف يُدّي PivotOPD على معايير الوكلاء القياسية؟
مع الطالب بحجم 1.7B، يحقق PivotOPD في المتوسط 73.7% على ALFWorld، أي بفارق 5.5 نقطة فوق SDAR. ويحقق في المتوسط 44.5% على البحث المعتمد على الأسئلة والأجوبة، أي بفارق 5.9 نقطة فوق RLSD. وعلى WebShop يتغلب على RLSD بفارق 1.2 في النقاط لكن بفارق 14.1 في معدل النجاح (76.6%).
مع الطالب بحجم 8B، يصل إلى 93.0% على ALFWorld، و47.4% على البحث المعتمد على الأسئلة والأجوبة، و81.9% نجاح على WebShop. الهوامش أصغر، لا تقل عن 1.8 نقطة.
مع Qwen3-8B كمعلم لنفسه، لا يزال PivotOPD يفوز في جميع المعايير الـ 3 بفارق لا يقل عن 1.5 نقطة، وبمعدل 3.9 في المتوسط.
على SWE-Bench Verified, انتقل طالب Nemotron-3.5-SFT الذي علّمه Nemotron-3-Super من 62.8% إلى 66.0%. ووصل OPD القياسي إلى 63.0%، بينما يسجل المعلم 73.0%.
التعافي هو الأبرز. عبر 72 خطأ محوريًا مُعاد تشغيلها، تعافى PivotOPD بنسبة 72.7% من الحالات، مقابل 8.3% للنموذج الأساسي، و20.3% لـ OPD القياسي، و45.8% للوقائي فقط. استغرق في المتوسط 9.7 أدوارًا للتعافي، مقابل 6.2 مثالية.
Prev</button><button class="btn" id="mtp-next">Next </button></div> </div> <div class="panel" data-p="2"> <div class="tog" id="mtp-tog"><button class="on" data-m="s">Qwen3-1.7B</button><button data-m="l">Qwen3-8B</button></div> <div id="mtp-bench"></div> <p class="muted">متوسطات على 3 بذور من الجدول 1 في الورقة البحثية. بالمقارنة مع أقوى النماذج الأساسية. يحتل PivotOPD المرتبة الأولى على جميع متوسطات المعايير الثمانية (8) مقابل 13 نموذجاً أساسياً.</p> <div class="bench"><h6>معدل الحل في SWE-Bench Verified (الطالب Nemotron-3.5-SFT)</h6><div id="mtp-swe"></div></div> </div> <div class="panel" data-p="3"> <p>72 خطأً محورياً موسوماً بمصدر معتمد (oracle)، أعيد تشغيلها 8 مرات لكل سياسة. ما مدى تكرار إنجاز كل سياسة للمهمة على أي حال؟</p> <div id="mtp-rec"></div> <p class="muted">متوسط الأدوار للتعافي: PivotOPD 9.7، وOPD القياسية 12.3، والنموذج الأساسي 13.4، والأمثل 6.2.</p> <button class="btn" id="mtp-case">دراسة حالة لإعادة التشغيل</button> <div class="case"> <div class="col"><h6>النموذج الأساسي</h6><div id="mtp-ca"></div></div> <div class="col"><h6 style="color:#76B900">نموذج PivotOPD</h6><div id="mtp-cb"></div></div> </div> </div> <div class="ft"><span>المصدر: <a href="https://arxiv.org/abs/2609.40285" target="_blank" rel="noopener">arXiv 2609.40285</a></span><b>© Marktechpost</b></div> </div> <script> (function(){ var R=document.getElementById('mtp-pivotopd'); function $(s){return R.querySelector(s);} function $$(s){return R.querySelectorAll(s);} function resize(){try{parent.postMessage({mtpPivotOPDHeight:R.offsetHeight+40},'*');}catch(e){}} var shown={}; $$('.tab').forEach(function(b){b.onclick=function(){ $$('.tab'). forEach(function(x){x.classList.remove('on')});b.classList.add('on'); var p=b.getAttribute('data-p'); $$('.panel').forEach(function(x){x.classList.toggle('on',x.getAttribute('data-p')===p)}); if(p==='2')bench(mode); if(p==='3')rec(); setTimeout(resize,50);};}); /* panel 1 */ var T=$('#mtp-turns'),cells=[]; for(var i=1;i<=30;i++){var d=document.createElement('div');d.className='t';d.textContent=i;T.appendChild(d);cells.push(d);} var timer; function play(recover){clearInterval(timer);cells.forEach(function(c){c.className='t'});var k=0; timer=setInterval(function(){var c=cells[k];var n=k+1; if(n<10)c.className='t ok';else if(n===10)c.className='t pv'; else if(recover){c.className=n<=12?'t rc':(n<=16?'t ok':'t');} else c.className='t wa'; k++; if(recover&&n===16){clearInterval(timer);$('#mtp-cap').textContent='استرداد موجّه بعد الخطأ، ثم إكمال المهمة. تُظهر الإعادات أن نسبة النجاح بلغت 58% مع 2 من جولات التوجيه.';} if(k>=30){clearInterval(timer);$('#mtp-cap').textContent='بدون استرداد: الجولات الـ20 المتبقية تُهدر. أهدر الوكلاء الحقيقيون 18 إلى 21 جولة في المتوسط.';} },90);} $('#mtp-play1').onclick=function(){play(false)};$('#mtp-play2').onclick=function(){play(true)}; function count(){ $$('.stat b[data-c]').forEach(function(b){var t=+b.getAttribute('data-c'),v=0;var iv=setInterval(function(){v+=2;if(v>=t){v=t;clearInterval(iv);}b.textContent=v+'%';},20);});} /* panel 2 */ var S=[ {h:'1. اكتشاف نقطة التحول',b:'يقرأ معلّم أكبر حجمًا كل مسار تنفيذ (rollout) ونتيجته بأثر رجعي، ويختار الجولات المرشحة، ويسمّي إجراءً ذهبيًا. تُعتبر الجولة محورية عندما يختلف إجراء الطالب عنه. تقع نقاط التحول المكتشفة ضمن 1 جولة من نقاط الأوراكل في 77.8% من مسارات ALFWorld الفاشلة في المتوسط.',f:['<span class="chip">المسار + النتيجة</span>','<span class="arr">→</span>','<span class="chip">نموذج المعلم</span>','<span class="arr">→</span>','<span class="chip r">الجولة المحورية t</span>','<span class="chip g">إجراء الذهاب</span>']}, {h:'2. التقطير الوقائي (KL عكسي)',b:'يصبح الطالب المجمّد، المُلمَّح بإجراء الذهاب، معلماً ذاتياً ذا ميزة. يعيد تقييم الاستجابة التي كتبها الطالب فعلاً، مما يُزيح الاحتمالية بعيداً عن الخطأ. يُبقي الوزن w_prev صغيراً (0.001).',f:['<span class="chip">استجابة الطالب عند t</span>','<span class="arr">→</span>','<span class="chip">معلّم ذاتي + تلميح(gold)</span>','<span class="arr">→</span>','<span class="chip g">تحديث KL عكسي</span>']}, {h:'3. تقطير التعافي (KL أمامي)',b:'بعد نقطة التحول، يحدد المعلّم إجراء تعافٍ لكل من الأدوار الـK التالية. يكتب المعلّم الذاتي المُلمَّح استجابة التعافي ويتدرّب الطالب غير المُلمَّح عليها. تُغطي الـKL الأمامية الكتلة، لذا فهي ترفع الإجراءات التي لا يأخذها الطالب بالكاد أبداً. أفضل K: 2 على ALFWorld، و1 على WebShop وSearch QA.',f:['<span class="chip r">حالة ما بعد الخطأ</span>','<span class="arr">→</span>','<span class="chip">المعلّم: إجراء التعافي</span>','<span class="arr">→</span>','<span class="chip">المعلّم الذاتي يكتب الاستجابة</span>','<span class="arr">→</span>','<span class="chip g">تحديث KL أمامي</span>']} ]; var si=0; function step(i){si=(i+3)%3;$$('.step').forEach(function(x){x.classList.toggle('on',+x.getAttribute('data-s')===si)}); var s=S[si];$('#mtp-detail').innerHTML='<h5>'+s.h+'</h5><p style="margin:0">'+s.b+'</p><div class="flow">'+s.f.join('')+'</div>';setTimeout(resize,30);} $$('.step').forEach(function(x){x.onclick=function(){step(+x.getAttribute('data-s'))}}); $('#mtp-prev').onclick=function(){step(si-1)};$('#mtp-next').onclick=function(){step(si+1)};step(0); /* panel 3 */ var B={s:[ ['ALFWorld متوسط النجاح (%)',[['PivotOPD',73.7],['SDAR',68.2],['OPID',61.3],['RLSD',60.7],['GRPO',42. 7]]], ['متوسط دقة الأسئلة والأجوبة القائمة على البحث (%)',[['PivotOPD',44.5],['RLSD',38.6],['SOD',38.2],['GRPO',37.7]]], ['معدل نجاح WebShop (%)',[['PivotOPD',76.6],['OPID',68.0],['RLSD',62.5],['GRPO',57.0]]]], l:[ ['متوسط نجاح ALFWorld (%)',[['PivotOPD',93.0],['RLSD',90.8],['Skill-SD',88.6],['GRPO',35.3]]], ['متوسط دقة الأسئلة والأجوبة القائمة على البحث (%)',[['PivotOPD',47.4],['OPID',45.6],['OPSD',43.3],['GRPO',37.5]]], ['معدل نجاح WebShop (%)',[['PivotOPD',81.9],['SDAR',79.7],['RLSD',78.9],['GRPO',75.0]]]]}; function bars(el,rows,max){el.innerHTML=rows.map(function(r){return '<div class="row'+(r[0]==='PivotOPD'?' me':'')+'"><span class="lb">'+r[0]+'</span><span class="tr"><span class="bar" data-w="'+(r[1]/max*100)+'"></span></span><span class="v">'+r[1].toFixed(1)+'</span></div>'}).join(''); requestAnimationFrame(function(){setTimeout(function(){el.querySelectorAll('.bar').forEach(function(b){b.style.width=b.getAttribute('data-w')+'%'})},40)});} var mode='s'; function bench(m){mode=m;var W=$('#mtp-bench');W.innerHTML='';B[m].forEach(function(g){var d=document.createElement('div');d.className='bench';d.innerHTML='<h6>'+g[0]+'</h6><div></div>';W.appendChild(d);bars(d.lastChild,g[1],100);}); bars($('#mtp-swe'),[['المعلم',73.0],['PivotOPD',66.0],['OPD القياسي',63.0],['الطالب',62.8]],100);setTimeout(resize,60);} $$('#mtp-tog button').forEach(function(b){b.onclick=function(){$$('#mtp-tog button').forEach(function(x){x.classList.remove('on')});b.classList.add('on');bench(b.getAttribute('data-m'));}}); /* panel 4 */ function rec(){bars($('#mtp-rec'),[['PivotOPD',72.7],['السابق فقط',45.8],['OPD القياسي',20.3],['الأساس',8.3]],100);setTimeout(resize,60);} var CA=[['الدورتان 1-2: لا توجد بيضة في ',''],['الدورة 3: يأخذ الطماطم من الثلاجة','bad'],['الدورة 4: يذهب إلى الميكروويف',''],['الدورة 5: ينقل الطماطم إلى الميكروويف','bad'],['الدورتان 6-30: لا يجد البيضة أبداً','bad'],['✕ فشل','bad']]; var CB=[['الدورتان 1-2: لا توجد بيضة في الثلاجة',''],['الدورة 3: يأخذ الطماطم من الثلاجة','bad'],['الدورة 4: يبدأ التعافي، يذهب إلى الطاولة','good'],['الدورة 5: يضع الطماطم جانباً','good'],['الدورة 6: يأخذ البيضة من الطاولة','good'],['الدورتان 7-11: يبرد البيضة، وينقلها إلى الميكروويف','good'],['✓ نجاح','good']]; function fill(el,arr){el.innerHTML=arr.map(function(a){return '<div class="ln '+a[1]+'">'+a[0]+'</div>'}).join('');} function caseplay(){fill($('#mtp-ca'),CA);fill($('#mtp-cb'),CB);var a=$$('#mtp-ca .ln'),b=$$('#mtp-cb .ln');var k=0;var iv=setInterval(function(){if(a[k])a[k].classList.add('show');if(b[k])b[k].classList.add('show');k++;if(k>7)clearInterval(iv);},380);setTimeout(resize,60);} $('#mtp-case').onclick=caseplay; fill($('#mtp-ca'),CA);fill($('#mtp-cb'),CB);$$('#mtp-pivotopd .ln').forEach(function(x){x.classList.add('show')}); count(); window.addEventListener('load',resize);window.addEventListener('resize',resize);setTimeout(resize,300); })(); </script> </body></html> ">كيف يقارن PivotOPD بطرق تقطيع الوكلاء الأخرى؟
| المقاييس | PivotOPD | OPSD (OPD قياسي) | OPID | SDAR | RLSD |
|---|---|---|---|---|---|
| الفكرة الأساسية | الوقاية والتعافي عند المنعطفات المحورية التي يكتشفها المعلم | معلم ذاتي مميز في كل استجابة | مهارات هرمية من الاسترجاع الاستعادي على السياسة | OPSD كخسارة مساعدة ببوابة سينية | التقطيع الذاتي يحدد حجم التحديث، وRLVR يحدد الاتجاه |
| يُدرَّب على استجابات التعافي المكتوبة من المعلم | نعم (KL أمامي) | لا | لا | لا | لا |
| متوسط ALFWorld، Qwen3-1.7B | 73.7 | 12.4 | 61.3 | 68.2 | 60.7 |
| متوسط QA البحثي، Qwen3-1.7B | 44.5 | 36.8 | 37.5 | 37.1 | 38.6 |
| نجاح WebShop، Qwen3-1.7B | 76.6 | 10.1 | 68.0 | 57.0 | 62.5 |
| متوسط ALFWorld، Qwen3-8B | 93.0 | 46.7 | 83.7 | 83.8 | 90.8 |
| الشيفرة | قريبًا | GitHub | GitHub | غير معلن | غير معلن |
مصدر النتيجة: الجدول 1 من PivotOPD.
ما هي تكلفة تدريبه، وهل يمكنك تشغيله؟
يغيّر PivotOPD التدريب فقط، لذا لا يستدل الاستدلال (التنبؤ) بأي تكلفة إضافية. على ALFWorld مع الطالب بحجم 1.7B، وعلى 4 وحدات معالجة رسومية H100، تبلغ التكلفة الإضافية مقارنة بـ GRPO نسبة 12.4% عند K = 1. وترتفع إلى 94.2% عند K = 2، لأن محاولات التعافي اللاحقة تتطلب إعادة تشغيل البيئة. الميزانية المختارة هي K = 2 على ALFWorld و K = 1 على WebShop والأسئلة والأجوبة القائمة على البحث.
أهم الخلاصات
- يعتمد أكثر من نصف عمليات تنفيذ الوكلاء الفاشلة على 1 خطأ مبكر وقابل للتعافي.
- OPD القياسي نادراً ما يعالج هذه الإخفاقات: من 51% إلى 49%.
- يتعافى PivotOPD من 72.7% من الأخطاء المعاد تشغيلها، مقابل 20.3% لـ OPD.
- أفضل متوسط مقابل 13 نموذجًا أساسيًا على ALFWorld وWebShop والأسئلة والأجوبة القائمة على البحث.
- تكلفة استدلال إضافية تبلغ 0، لكن الشيفرة البرمجية لم تُطلق بعد.
اطّلع على الورقة البحثية و صفحة المشروع. كل الفضل يعود إلى باحث هذا المشروع. كما لا تترددوا في متابعتنا على تويتر ولا تنسوا الانضمام إلى موقع ريديت الفرعي ML الذي يضم أكثر من 150k عضو و الاشتراك في نشرتنا البريدية. مهلاً! هل أنت على تيليجرام؟ يمكنك الآن الانضمام إلينا على تيليجرام أيضًا.
ظهر المنشور NVIDIA PivotOPD يُعلّم وكلاء الذكاء الاصطناعي متعددي الأدوار كيفية التعافي من الأخطاء المحورية أول مرة على MarkTechPost.