Aller au contenu principal
Recherche · Paper ·

Google Research publie RRSI en open source : des agents IA qui améliorent leur propre structure sans surapprentissage

Google Cloud AI Research, en collaboration avec l'UNC-Chapel Hill, Stanford et la Washington University de Saint-Louis, publie RRSI (Regularized Recursive Self-Improvement), un cadre open source sous licence Apache 2.0 qui permet à un agent LLM de réécrire son propre « harnais » : prompts, outils, mémoire, flux de contrôle et sous-agents, sans jamais toucher aux poids du modèle. Le code exige Python 3.10 ou plus récent et accepte toute chaîne de modèle LiteLLM, avec Claude Opus 4.8 sur Vertex AI comme configuration par défaut. Sur huit benchmarks, Terminal-Bench 2.1 passe de 74,2 % à 80,2 % sur le jeu d'évolution, et SWE-bench Verified, jamais utilisé pour la sélection, de 82,0 % à 83,8 %. Hors distribution, les gains atteignent 4,7 points sur JobBench, 3,5 sur GDPval et 3,7 sur APEX-Agents. Les six jeux de test réservés progressent tous. Avec Gemini 3.5 Flash comme modèle, Terminal-Bench 2.1 bondit de 64,6 à 78,7 et SWE-bench Verified de 76,8 à 79,0. Le harnais est aussi plus léger : 2,42 millions de tokens par essai contre 3,80 millions pour une évolution non régularisée, soit 30 % de moins selon le résumé de l'étude et 36 % selon la page du projet.

2 min de lecturePertinence 59

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

L'enjeu est l'un des principaux défauts des boucles d'auto-amélioration : elles proposent des modifications, les notent sur un jeu fixe de tâches et gardent la meilleure, mais comme les mêmes tâches reviennent à chaque tour, la boucle finit par les mémoriser. Les chercheurs identifient trois travers : l'ajustement à un benchmark précis, la poursuite du bruit statistique et l'accumulation de complexité. Chacun creuse l'écart entre les scores d'évolution et la capacité réelle à généraliser. Pour les équipes qui déploient des agents, RRSI montre qu'on peut obtenir des gains qui tiennent sur des tâches jamais vues, tout en réduisant le coût d'inférence, sans réentraîner de modèle.

Plutôt que de restreindre ce que l'agent peut modifier, RRSI régularise la manière dont la recherche avance, en s'inspirant des régularisations classiques. Côté proposition, un budget d'édition suit un calendrier en cosinus : de nombreuses modifications groupées au début, une seule modification attribuable en fin de course, ce que les auteurs rapprochent d'une norme L0. Un registre consigne pour chaque candidat le composant, l'hypothèse, le diff, la variation de score et de coût, afin de ne pas réessayer des idées réfutées, et l'exploration se déplace vers des composants intacts quand les progrès stagnent. Côté sélection, un critique de fuite rejette les noms de tâches, entités ou réponses codés en dur avant tout score. Un seuil tenant compte du bruit exige que le gain dépasse la variance mesurée sur le harnais de base. Une règle de coût, analogue à Ridge (L2), impose que les tokens supplémentaires soient payés par un gain mesuré, et l'élagage, analogue à Lasso (L1), cible les composants devenus inutiles. Face à Meta-Harness, AHE, TTHE et HarnessX, partis du même harnais, RRSI affiche le plus faible gain sur le jeu d'évolution de Harvey LAB (90,5 contre 93,0 pour Meta-Harness) mais la seule moyenne hors distribution nettement supérieure à la base : 43,6 contre 39,7, les concurrents restant entre 38,0 et 40,6.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Hexo Labs publie SIA en open source : un agent capable d'améliorer son propre cadre et ses poids de modèle43MarkTechPostRecherche 02Capture des ID de tokens pendant les interactions à base d'agents pour améliorer l'apprentissage par renforcement35Amazon ScienceRecherche 03Des chercheurs ont entraîné un agent de recherche IA open source, Harness-1, qui surpasse GPT-4.5 dans le rappel d'informations pertinentes51VentureBeat AIRecherche 
Dossier · Google CloudSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.