NVIDIA PivotOPD apprend aux agents IA multi-tours à se rattraper après des erreurs décisives
Des chercheurs de NVIDIA, de l'Université de Princeton et de l'Université du Maryland ont présenté PivotOPD, une méthode de distillation « on-policy » destinée aux agents LLM qui interagissent sur plusieurs tours. Il s'agit d'une méthode d'entraînement, pas d'un modèle. Elle apprend à l'agent à éviter son erreur la plus coûteuse en début de tâche, et à s'en remettre quand elle survient malgré tout. Testée sur des élèves Qwen3-1.7B et Qwen3-8B, elle obtient la meilleure moyenne face à 13 méthodes de référence sur ALFWorld, WebShop et les questions-réponses avec recherche, sur 3 graines aléatoires. Avec le modèle de 1,7 milliard de paramètres, elle atteint 73,7 % sur ALFWorld (5,5 points devant SDAR) et 44,5 % en questions-réponses avec recherche (5,9 points devant RLSD). Sur WebShop, elle dépasse RLSD de 1,2 point en score et de 14,1 points en taux de succès, à 76,6 %. Avec le modèle de 8 milliards, elle monte à 93,0 % sur ALFWorld, 47,4 % en questions-réponses et 81,9 % de succès sur WebShop. Sur SWE-Bench Verified, un élève Nemotron-3.5-SFT guidé par Nemotron-3-Super passe de 62,8 % à 66,0 %, contre 63,0 % pour la distillation standard. Le professeur plafonne à 73,0 %.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
L'enjeu tient à la capacité de récupération. Sur des erreurs décisives rejouées, PivotOPD permet de rattraper 72,7 % des cas, contre 20,3 % pour la distillation on-policy classique. L'entraînement n'ajoute aucun coût à l'inférence : l'agent s'exécute partout où son modèle de base fonctionne. Les auteurs définissent l'erreur décisive comme une action qui allonge le chemin restant vers la réussite ou rend la tâche impossible. Dans ALFWorld, 59 % des échecs (155 sur 262) en contiennent une, apparue en général entre le tour 8 et le tour 12 sur 30. L'agent gaspille ensuite 18 à 21 tours sans se corriger. Rejouer les échecs de Qwen3-8B en corrigeant ce seul tour fait passer le succès de 8 % à 59 %. Les limites existent toutefois : la méthode suppose des environnements rejouables et un professeur dont les pivots coïncident avec ceux de l'oracle dans 77,8 % des échecs. Elle reste aussi moins performante sur certaines sous-tâches, comme les tâches « Look » d'ALFWorld avec le petit modèle (55,9 % de récupération, contre 83,9 % pour SOD).
Le problème vient d'un angle mort partagé par les approches actuelles. La distillation standard a fait baisser le taux d'échec de 79 % à 56 % sur des cas non vus, mais celui des échecs survenant après une erreur décisive n'a reculé que de 51 % à 49 %. La bonne action restait sous 1 % de probabilité à ces tours, si bien que 8 déroulements l'échantillonnent rarement. L'apprentissage par renforcement fondé sur le seul résultat souffre du même défaut : quand tous les essais échouent, l'avantage relatif au groupe est nul. PivotOPD ajoute trois briques à un apprentissage par renforcement de groupe, combinées dans une seule mise à jour PPO. Un professeur plus grand relit chaque déroulement et nomme l'action correcte aux tours suspects. Une distillation préventive, par divergence KL inverse, éloigne l'élève de l'erreur commise. Une distillation de récupération, par KL directe, qui couvre mieux les actions rares, lui apprend à rebondir pendant quelques tours. Le professeur ne fournit que des actions, et les cibles au niveau des tokens viennent d'une copie figée de l'élève guidée par ces indices.
Pas d\'impact direct sur la France/UE