Google Research : guide du RRSI pour maîtriser les agents d'IA capables de s'améliorer seuls
Google Research a publié RRSI (Regularized Recursive Self-Improvement), une méthode qui permet à un agent fondé sur un grand modèle de langage de réécrire lui-même son « harnais » (prompts, outils, mémoire, flux de contrôle, sous-agents) autour d'un modèle figé, sans que ce harnais ne s'ajuste trop étroitement aux tâches sur lesquelles il évolue. Un tutoriel en détaille la mise en œuvre. La boucle complète génère les modifications avec Claude Opus sur Vertex AI et les évalue dans des benchmarks sous Docker, ce qui dépasse ce qu'un notebook gratuit peut exécuter. Le tutoriel se concentre donc sur la partie qui porte l'idée centrale du papier, les règles qui décident quelles modifications conserver, écrites en Python pur. Le paquet s'installe depuis le dépôt officiel, épinglé sur un commit précis car il n'est pas sur PyPI. Le tutoriel parcourt l'estimateur, la bande de bruit calibrée, les deux branches de l'algorithme de sélection, le budget de modifications progressivement réduit, le filtre déterministe de fuite d'information et l'historique des éditions. Il branche ensuite un agent simulé sur l'interface Domain propre à RRSI. Les valeurs par défaut incluent T tours, k essais par tâche, m candidats par tour, un budget b borné entre bmin et bmax, ainsi que des coefficients beta0, beta1, ws, wc, wn et deltaz. Aucune clé d'API, GPU ou téléchargement de jeu de données n'est requis.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
L'intérêt de cette approche tient à ce qu'elle rend auditable une question épineuse de l'auto-amélioration des agents : une modification qui score mieux est-elle réellement meilleure, ou profite-t-elle simplement du hasard et des particularités du jeu de tâches ? Comme l'environnement simulé est construit par l'auteur, l'effet réel de chaque modification est connu. Cela permet de comparer les décisions de RRSI à la vérité terrain, puis à une recherche non régularisée qui garde systématiquement ce qui obtient le meilleur score. Pour les équipes qui développent des agents, c'est une démonstration concrète des risques de surapprentissage du harnais et des garde-fous nécessaires : marge de bruit, plafonnement du nombre de changements par tour, détection des fuites vers les données d'évaluation. L'absence de dépendances lourdes rend ces mécanismes reproductibles par n'importe quel praticien.
Ce travail s'inscrit dans le mouvement des systèmes qui améliorent leur propre scaffolding plutôt que leurs poids, une voie attractive puisque le modèle reste figé et que les modifications sont lisibles. Le danger classique est qu'une boucle d'optimisation exploite le bruit des évaluations ou mémorise les tâches de test. RRSI y répond par des composantes d'inspiration statistique : estimation de succès et de coût, seuil de bruit calibré, historique des modifications avec détection de stagnation et mesure de nouveauté structurelle. Le tutoriel cartographie chacune de ces notions du papier vers son module de code. Les suites possibles passent par l'exécution de la boucle complète sur de vrais benchmarks avec Claude Opus, là où l'on pourra vérifier si les garanties observées en simulation se maintiennent face à des environnements réels, plus bruités et moins bien connus.
Pas d'impact direct sur la France/UE