Aller au contenu principal
Recherche · Paper ·

NVIDIA lance SoL-Pi : des boucles de recherche automatique qui réduisent jusqu'à 49% le trafic de tokens des agents de code

Une équipe de chercheurs de NVIDIA, de l'université technologique de Nanyang (NTU) et du MIT a publié SoL-Pi, un ensemble de quatre mécanismes d'optimisation destinés à l'agent de codage open source Pi. Ces mécanismes ont été découverts par une IA menant des boucles de recherche automatisées directement au niveau du harnais, la couche logicielle qui gère les appels d'outils, le contexte et la délégation entre l'agent et le modèle. Sur l'évaluation EdgeBench, qui compte 51 tâches, SoL-Pi réduit le volume de tokens consommés de 44,7% à 49% par rapport à Pi standard et fait baisser le coût d'API d'environ 33%, tout en conservant des scores de performance proches de ceux de Pi sur les modèles GPT-5.6 Sol et Opus 5. Le projet est publié sur GitHub sous l'organisation NVlabs, sous licence MIT, et fonctionne sur une version non modifiée de Pi, testée avec la version 0.85.1 et Node.js 22.19 ou supérieur. La recherche automatisée a exploré 152 pistes réparties en six familles (contexte, progression, outils, délégation, prompts, politique), testées sur 535 environnements exécutables, dont 495 construits à partir de paires issue/pull request GitHub et 40 tâches synthétiques, pour un total de plus de 3 000 exécutions et 60 000 interactions agent-environnement.

2 min de lecturePertinence 54

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Les agents de codage tournent désormais pendant des heures, accumulant dans leur contexte chaque modification de fichier, chaque test et chaque log, ce qui fait exploser les coûts en tokens à mesure que les tâches se prolongent. Contrairement aux approches classiques qui réduisent le coût par token via des modèles moins chers ou des techniques de quantification, SoL-Pi s'attaque directement au volume de tokens nécessaires pour accomplir une tâche, en optimisant la façon dont l'agent interagit avec son environnement. Sur les chiffres publiés, un run avec Pi sur GPT-5.6 Sol coûte 1 339 dollars et consomme 2,15 milliards de tokens pour un score de 44,8, tandis que la version SoL-Pi orientée performance atteint un score de 47,2 pour 1 271 dollars, et la version orientée efficacité descend à 894 dollars pour un score de 42. Sur Opus 5, la version performance de SoL-Pi grimpe même à un score de 50,5, contre 44,8 pour Pi seul. Pour les équipes qui déploient des agents de codage à grande échelle, ces gains représentent une réduction directe et significative des coûts d'infrastructure, sans sacrifice notable de qualité.

Cette publication s'inscrit dans un mouvement plus large où les laboratoires cherchent à automatiser l'optimisation des harnais d'agents plutôt que de les régler manuellement, un travail lent et sujet à des effets de bord entre composants couplés. Des systèmes comme Meta-Harness ont déjà exploré cette voie, mais une étude récente a montré que les harnais issus de recherches automatisées avaient tendance à sur-optimiser pour leurs tâches d'entraînement, avec des gains marginaux sur des tâches inédites. Pour éviter ce piège, les auteurs de SoL-Pi ont figé leurs règles d'acceptation avant le début de la recherche et ont maintenu EdgeBench totalement isolé du processus d'optimisation, n'utilisant que 11 tâches pour une validation à sens unique et 40 pour l'évaluation finale. Les quatre mécanismes retenus, nommés Action Fusion, Online Context Compact, ObservationPack et Evidence-Preserving Reducer, ciblent chacun une source précise de gaspillage de tokens, de la fusion des appels d'outils à la compression intelligente des logs de test via un modèle moins coûteux, GPT-5.6 Luna.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Pourquoi les agents de recherche en apprentissage automatique ne sur-apprennent-ils pas ?36Amazon ScienceRecherche 02Des chercheurs automatisent la conception de stratégies de raisonnement pour LLM et réduisent l'utilisation de tokens de 69,5 %46VentureBeat AIRecherche 03Une nouvelle étude de Harvard et Perplexity révèle que les agents IA effectuent 26 minutes de travail autonome par session, contre 33 secondes pour la recherche46MarkTechPostRecherche 
Dossier · GPT-5Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.