MarkTechPost

NVIDIA PivotOPD apprend aux agents d'IA multi-tours à se remettre d'erreurs décisives

Les chercheurs de NVIDIA ont présenté PivotOPD, une méthode de distillation on-policy qui entraîne des agents LLM multi-tours à éviter les premières erreurs décisives et à s'en remettre, obtenant la meilleure moyenne…

Les chercheurs de NVIDIA, avec l'Université de Princeton et l'Université du Maryland, ont présenté PivotOPD, une méthode de distillation on-policy pour les agents LLM multi-tours. La distillation on-policy de PivotOPD entraîne un agent à éviter son erreur précoce la plus dommageable et à s'en remettre quand elle se produit malgré tout. Face à 13 lignes de base, elle obtient la meilleure moyenne sur ALFWorld, WebShop et Search-based QA pour les étudiants Qwen3-1.7B et Qwen3-8B. À retenir : le rétablissement est apprenable, et l'OPD standard ne l'enseigne que rarement.

TL;DR

  • Taille : Une méthode d'entraînement, pas un modèle. Testée sur des étudiants Qwen3-1.7B et Qwen3-8B, plus un étudiant Nemotron-3.5-SFT sur SWE-Bench Verified.
  • Fonctionne sur : Entraîné sur des nœuds NVIDIA H100. Ajoute 0 coût d'inférence, si bien que l'agent entraîné s'exécute partout où son modèle de base s'exécute.
  • Performance : Première sur les 8 moyennes par benchmark contre 13 lignes de base, sur 3 graines aléatoires.
  • Meilleur : Se remet de 72.7% des erreurs décisives rejouées, contre 20.3% pour l'OPD standard.
  • Pire : 55.9% sur les tâches « Look » d'ALFWorld avec l'étudiant 1.7B, contre 83.9% pour SOD.
  • En résumé : Meilleur : enseigne un rétablissement que la RL basée uniquement sur les résultats ne peut pas atteindre. Pire : dépend d'environnements rejouables et d'un enseignant dont les pivots correspondent à l'oracle dans 77.8% des rollouts échoués.

Qu'est-ce qu'une erreur décisive dans un agent multi-tours ?

Une erreur décisive est une action qui allonge le plus court chemin restant pour terminer une tâche, ou qui la rend insoluble. L'oracle symbolique d'ALFWorld mesure cela à chaque tour.

Sur Qwen3-8B, Qwen3-30B-A3B et Qwen3-235B-A22B, 59% des rollouts échoués (155 sur 262) en contenaient une. Le premier tour décisif arrivait tôt, à un tour médian de 8 à 12 sur 30. Les agents perdaient ensuite 18 à 21 tours de plus sans se rétablir.

Dans les rejeux des échecs de Qwen3-8B, corriger le tour décisif faisait passer le succès de 8% à 59%. Laisser l'erreur en place et imposer la bonne action pendant les 2 tours suivants atteignait tout de même 58%.

Pourquoi la distillation on-policy standard passe-t-elle à côté ?

L'OPD standard a fait baisser le taux d'échec en validation de 79% à 56%. Les échecs après un tour décisif ne sont passés que de 51% à 49%. La bonne action restait en dessous de 1% de probabilité à chaque tour décisif, si bien que 8 rollouts l'échantillonnent rarement.

La RL basée sur les résultats partage ce point aveugle : si chaque rollout échoue, l'avantage relatif au groupe est de 0.

Comment fonctionne PivotOPD ?

PivotOPD ajoute 3 composants à la RL basée sur les groupes, combinés en une seule mise à jour PPO.

  1. Détection des pivots: Un modèle enseignant plus grand lit chaque rollout et son résultat a posteriori. Il sélectionne les tours candidats et nomme une action de référence à chacun. Un tour compte comme décisif lorsque l'action de l'étudiant diffère de l'action de référence. Sur ALFWorld, les pivots détectés se situent à 1 tour ou moins du pivot de l'oracle dans 77.8% des rollouts échoués en moyenne.
  2. Distillation préventive (KL inverse): Une copie gelée de l'étudiant, indicée avec l'action de référence, re-évalue la propre réponse de l'étudiant. Cela pousse l'étudiant à s'éloigner de l'erreur commise.
  3. Distillation de récupération (KL forward): Après chaque pivot, le teacher nomme une action de récupération pendant jusqu'à K tours. Le self-teacher avec indices rédige les réponses de récupération, et l'étudiant sans indices s'entraîne dessus. La KL forward couvre la masse de probabilité, donc elle renforce des actions que l'étudiant échantillonne presque jamais.

Le teacher ne nomme que des actions. Les cibles au niveau des tokens proviennent de la propre distribution avec indices de l'étudiant.

Comment PivotOPD se comporte-t-il sur les benchmarks d'agents ?

Avec l'étudiant 1.7B, PivotOPD atteint en moyenne 73.7% sur ALFWorld, soit 5.5 points de plus que SDAR. Il atteint en moyenne 44.5% sur Search-based QA, soit 5.9 points de plus que RLSD. Sur WebShop, il bat RLSD de 1.2 en score mais de 14.1 en taux de succès (76.6%).

Avec l'étudiant 8B, il atteint 93.0% sur ALFWorld, 47.4% sur Search-based QA et 81.9% de succès sur WebShop. Les marges sont plus faibles, au moins 1.8 points.

Avec Qwen3-8B comme son propre teacher, PivotOPD gagne toujours sur les 3 benchmarks d'au moins 1.5 points, 3.9 en moyenne.

Sur SWE-Bench Verified, un étudiant Nemotron-3.5-SFT enseigné par Nemotron-3-Super est passé de 62.8% à 66.0%. L'OPD standard a atteint 63.0%, et le teacher obtient 73.0%.

La récupération est le point fort. Sur 72 erreurs pivots rejouées, PivotOPD a récupéré 72.7% du temps, contre 8.3% pour le modèle de base, 20.3% pour l'OPD standard et 45.8% pour la seule variante préventive. Il a nécessité en moyenne 9.7 tours pour récupérer, contre un optimal de 6.2.

Prev</button><button class="btn" id="mtp-next">Next </button></div> </div> <div class="panel" data-p="2"> <div class="tog" id="mtp-tog"><button class="on" data-m="s">Qwen3-1.7B</button><button data-m="l">Qwen3-8B</button></div> <div id="mtp-bench"></div> <p class="muted">Moyennes sur 3 graines d'après le Tableau 1 de l'article. Comparaison avec les baselines les plus performantes. PivotOPD se classe premier sur les 8 moyennes par benchmark contre 13 baselines.</p> <div class="bench"><h6>Taux de résolution de SWE-Bench Verified (étudiant Nemotron-3.5-SFT)</h6><div id="mtp-swe"></div></div> </div> <div class="panel" data-p="3"> <p>72 erreurs pivotales étiquetées par un oracle, rejouées 8 fois par politique. À quelle fréquence chaque politique termine-t-elle tout de même la tâche ?</p> <div id="mtp-rec"></div> <p class="muted">Nombre moyen de tours pour se rétablir : PivotOPD 9.7, OPD standard 12.3, modèle de base 13.4, optimal 6.2.</p> <button class="btn" id="mtp-case">Étude de cas par rejeu</button> <div class="case"> <div class="col"><h6>Modèle de base</h6><div id="mtp-ca"></div></div> <div class="col"><h6 style="color:#76B900">Modèle PivotOPD</h6><div id="mtp-cb"></div></div> </div> </div> <div class="ft"><span>Source : <a href="https://arxiv.org/abs/2609.40285" target="_blank" rel="noopener">arXiv 2609.40285</a></span><b>© Marktechpost</b></div> </div> <script> (function(){ var R=document.getElementById('mtp-pivotopd'); function $(s){return R.querySelector(s);} function $$(s){return R.querySelectorAll(s);} function resize(){try{parent.postMessage({mtpPivotOPDHeight:R.offsetHeight+40},'*');}catch(e){}} var shown={}; $$('.tab').forEach(function(b){b.onclick=function(){ $$('.tab'). forEach(function(x){x.classList.remove('on')});b.classList.add('on'); var p=b.getAttribute('data-p'); $$('.panel').forEach(function(x){x.classList.toggle('on',x.getAttribute('data-p')===p)}); if(p==='2')bench(mode); if(p==='3')rec(); setTimeout(resize,50);}); /* panel 1 */ var T=$('#mtp-turns'),cells=[]; for(var i=1;i<=30;i++){var d=document.createElement('div');d.className='t';d.textContent=i;T.appendChild(d);cells.push(d);} var timer; function play(recover){clearInterval(timer);cells.forEach(function(c){c.className='t'});var k=0; timer=setInterval(function(){var c=cells[k];var n=k+1; if(n<10)c.className='t ok';else if(n===10)c.className='t pv'; else if(recover){c.className=n<=12?'t rc':(n<=16?'t ok':'t');} else c.className='t wa'; k++; if(recover&&n===16){clearInterval(timer);$('#mtp-cap').textContent='Récupération guidée après l\'erreur, puis tâche menée à terme. Les rediffusions montrent 58% de réussite avec 2 tours guidés.';} if(k>=30){clearInterval(timer);$('#mtp-cap').textContent='Aucune récupération : les 20 tours restants sont gaspillés. Les agents réels ont gaspillé en moyenne 18 à 21 tours.';} },90);} $('#mtp-play1').onclick=function(){play(false)};$('#mtp-play2').onclick=function(){play(true)}; function count(){ $$('.stat b[data-c]').forEach(function(b){var t=+b.getAttribute('data-c'),v=0;var iv=setInterval(function(){v+=2;if(v>=t){v=t;clearInterval(iv);}b.textContent=v+'%';},20);});} /* panel 2 */ var S=[ {h:'1. Détection des tours pivots',b:'Un modèle enseignant plus grand lit chaque déploiement et son issue a posteriori, sélectionne les tours candidats et nomme une action idéale. Un tour est pivot lorsque l\'action de l\'étudiant diffère. Les pivots détectés se situent à moins de 1 tour de ceux de l\'oracle dans 77,8% des déploiements ALFWorld échoués en moyenne.',f:['<span class="chip">Déploiement + issue</span>','<span class="arr">→</span>','<span class="chip">Modèle enseignant</span>','<span class="arr">→</span>','<span class="chip r">Tour pivot t</span>','<span class="chip g">Action en or</span>']}, {h:'2. Distillation préventive (KL inverse)',b:'L’étudiant gelé, indicé par l’action en or, devient un auto-enseignant privilégié. Il re-note la réponse que l’étudiant a effectivement écrite, ce qui déplace la probabilité loin de l’erreur. Le poids w_prev est maintenu petit (0.001).',f:['<span class="chip">Réponse de l’étudiant à t</span>','<span class="arr">→</span>','<span class="chip">Auto-enseignant + indice(or)</span>','<span class="arr">→</span>','<span class="chip g">Mise à jour KL inverse</span>']}, {h:'3. Distillation de récupération (KL direct)',b:'Après le pivot, l’enseignant nomme une action de récupération pour chacun des K tours suivants. L’auto-enseignant avec indice écrit la réponse de récupération et l’étudiant sans indice s’entraîne dessus. Le KL direct couvre la masse de probabilité, donc il renforce des actions que l’étudiant n’échantillonne presque jamais. Meilleur K : 2 sur ALFWorld, 1 sur WebShop et Search QA.',f:['<span class="chip r">État après erreur</span>','<span class="arr">→</span>','<span class="chip">Enseignant : action de récupération</span>','<span class="arr">→</span>','<span class="chip">L’auto-enseignant écrit la réponse</span>','<span class="arr">→</span>','<span class="chip g">Mise à jour KL direct</span>']} ]; var si=0; function step(i){si=(i+3)%3;$$('.step').forEach(function(x){x.classList.toggle('on',+x.getAttribute('data-s')===si)}); var s=S[si];$('#mtp-detail').innerHTML='<h5>'+s.h+'</h5><p style="margin:0">'+s.b+'</p><div class="flow">'+s.f.join('')+'</div>';setTimeout(resize,30);} $$('.step').forEach(function(x){x.onclick=function(){step(+x.getAttribute('data-s'))}}); $('#mtp-prev').onclick=function(){step(si-1)};$('#mtp-next').onclick=function(){step(si+1)};step(0); /* panneau 3 */ var B={s:[ ['ALFWorld taux de réussite moyen (%)',[['PivotOPD',73.7],['SDAR',68.2],['OPID',61.3],['RLSD',60.7],['GRPO',42. 7]]], ['Précision moyenne QA basée sur la recherche (%)',[['PivotOPD',44.5],['RLSD',38.6],['SOD',38.2],['GRPO',37.7]]], ['Taux de réussite WebShop (%)',[['PivotOPD',76.6],['OPID',68.0],['RLSD',62.5],['GRPO',57.0]]]], l:[ ['Réussite moyenne ALFWorld (%)',[['PivotOPD',93.0],['RLSD',90.8],['Skill-SD',88.6],['GRPO',35.3]]], ['Précision moyenne QA basée sur la recherche (%)',[['PivotOPD',47.4],['OPID',45.6],['OPSD',43.3],['GRPO',37.5]]], ['Taux de réussite WebShop (%)',[['PivotOPD',81.9],['SDAR',79.7],['RLSD',78.9],['GRPO',75.0]]]]}; function bars(el,rows,max){el.innerHTML=rows.map(function(r){return '<div class="row'+(r[0]==='PivotOPD'?' me':'')+'"><span class="lb">'+r[0]+'</span><span class="tr"><span class="bar" data-w="'+(r[1]/max*100)+'"></span></span><span class="v">'+r[1].toFixed(1)+'</span></div>'}).join(''); requestAnimationFrame(function(){setTimeout(function(){el.querySelectorAll('.bar').forEach(function(b){b.style.width=b.getAttribute('data-w')+'%'})},40)});} var mode='s'; function bench(m){mode=m;var W=$('#mtp-bench');W.innerHTML='';B[m].forEach(function(g){var d=document.createElement('div');d.className='bench';d.innerHTML='<h6>'+g[0]+'</h6><div></div>';W.appendChild(d);bars(d.lastChild,g[1],100);}); bars($('#mtp-swe'),[['Enseignant',73.0],['PivotOPD',66.0],['OPD std',63.0],['Étudiant',62.8]],100);setTimeout(resize,60);} $$('#mtp-tog button').forEach(function(b){b.onclick=function(){$$('#mtp-tog button').forEach(function(x){x.classList.remove('on')});b.classList.add('on');bench(b.getAttribute('data-m'));}}); /* panel 4 */ function rec(){bars($('#mtp-rec'),[['PivotOPD',72.7],['Préc. seulement',45.8],['OPD std',20.3],['Base',8.3]],100);setTimeout(resize,60);} var CA=[['Tours 1-2 : pas d'œuf dans le réfrigérateur',''],['Tour 3 : prend la tomate dans le réfrigérateur','bad'],['Tour 4 : va vers le micro-ondes',''],['Tour 5 : déplace la tomate vers le micro-ondes','bad'],['Tours 6-30 : ne trouve jamais l'œuf','bad'],['✕ Échec','bad']]; var CB=[['Tours 1-2 : pas d'œuf dans le réfrigérateur',''],['Tour 3 : prend la tomate dans le réfrigérateur','bad'],['Tour 4 : la récupération commence, va vers la table','good'],['Tour 5 : met la tomate de côté','good'],['Tour 6 : prend l'œuf sur la table','good'],['Tours 7-11 : refroidit l'œuf, le déplace vers le micro-ondes','good'],['✓ Réussite','good']]; function fill(el,arr){el.innerHTML=arr.map(function(a){return '<div class="ln '+a[1]+'">'+a[0]+'</div>'}).join('');} function caseplay(){fill($('#mtp-ca'),CA);fill($('#mtp-cb'),CB);var a=$$('#mtp-ca .ln'),b=$$('#mtp-cb .ln');var k=0;var iv=setInterval(function(){if(a[k])a[k].classList.add('show');if(b[k])b[k].classList.add('show');k++;if(k>7)clearInterval(iv);},380);setTimeout(resize,60);} $('#mtp-case').onclick=caseplay; fill($('#mtp-ca'),CA);fill($('#mtp-cb'),CB);$$('#mtp-pivotopd .ln').forEach(function(x){x.classList.add('show')}); count(); window.addEventListener('load',resize);window.addEventListener('resize',resize);setTimeout(resize,300); })(); </script> </body></html> ">

Comment PivotOPD se compare-t-il aux autres méthodes de distillation d'agents ?

MétriquesPivotOPDOPSD (OPD standard)OPIDSDARRLSD
Idée centralePrévenir et récupérer aux tournants pivots détectés par le teacherAuto-teacher privilégié sur chaque réponseCompétences hiérarchiques issues du hindsight on-policyOPSD comme perte auxiliaire à porte sigmoïdeL'auto-distillation fixe la taille de mise à jour, le RLVR fixe la direction
S'entraîne sur des réponses de récupération écrites par le teacherOui (forward KL)NonNonNonNon
ALFWorld moy., Qwen3-1.7B73.712.461.368.260.7
Search QA moy., Qwen3-1.7B44.536.837.537.138.6
WebShop réussite, Qwen3-1.7B76.610.168.057.062.5
ALFWorld moy., Qwen3-8B93.046.783.783.890.8
CodeBientôt disponibleGitHubGitHubNon divulguéNon divulgué

Source des scores : Tableau 1 PivotOPD.

Combien coûte l'entraînement, et pouvez-vous l'exécuter ?

PivotOPD ne modifie que l'entraînement, donc l'inférence ne coûte rien de plus. Sur ALFWorld avec l'étudiant 1.7B, sur 4 GPU H100, le surcoût par rapport à GRPO est de 12.4% à K = 1. Il monte à 94.2% à K = 2, car les tours de récupération ultérieurs nécessitent un replay de l'environnement. Le budget sélectionné est K = 2 sur ALFWorld et K = 1 sur WebShop et le QA basé sur la recherche.

Points clés

  • Plus de la moitié des rollouts d'agents échoués dépendent d'1 erreur précoce et récupérable.
  • L'OPD standard touche à peine à ces échecs : de 51% à 49%.
  • PivotOPD se rétablit de 72.7% des erreurs rejouées, contre 20.3% pour OPD.
  • Meilleure moyenne contre 13 baselines sur ALFWorld, WebShop et le Search QA.
  • 0 surcoût d'inférence, mais le code n'est pas encore publié.


Découvrez le paper et la project page. Tout le mérite revient au chercheur de ce projet. Aussi, n'hésitez pas à nous suivre sur Twitter et n'oubliez pas de rejoindre notre 150k+ML SubReddit et de vous abonner à notre Newsletter. Attendez ! êtes-vous sur telegram ? vous pouvez maintenant nous rejoindre sur telegram également.

[Sponsorisé] Le web est l'API qui manque le plus aux agents. Les bases de données, les calendriers et les dépôts ont des API. Le web ouvert, pour l'essentiel, non. Le serveur MCP TinyFish offre à tout client MCP quatre outils : TinySearch, TinyFetch (pages complètes en markdown, JavaScript inclus), TinyBrowser pour les connexions et les formulaires, et TinyAgent pour les tâches multi-étapes. Search et Fetch sont gratuits.

L'article NVIDIA PivotOPD apprend aux agents IA multi-tours à se remettre des erreurs cruciales est applu en premier sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original