Des chercheurs de Google trouvent comment empêcher les agents IA auto-améliorants de mémoriser leurs tests
Des chercheurs de Google ont mis au point RRSI, une méthode qui empêche les agents d'IA capables de s'améliorer eux-mêmes de mémoriser les tâches sur lesquelles ils sont testés. Ces agents ajustent leur propre fonctionnement à partir de leurs résultats sur un ensemble de tâches. Ils ont toutefois tendance à retenir ces tâches précises plutôt qu'à progresser de façon générale. Leurs gains diminuent alors, voire disparaissent, dès qu'ils affrontent des problèmes nouveaux. Grâce à RRSI, qui agit comme une régularisation du processus d'auto-amélioration, les scores sur des benchmarks jamais vus par l'agent progressent jusqu'à 4,7 points. La méthode consomme aussi environ 30 % de tokens en moins qu'une version non régularisée.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Ce résultat compte parce qu'un agent qui s'améliore uniquement sur ses tests donne une image trompeuse de ses capacités. Les équipes qui déploient ces systèmes risquent de croire à des progrès qui ne se reproduiront pas en conditions réelles. Une méthode qui rend les gains transférables rend l'auto-amélioration plus fiable. La baisse de 30 % des tokens réduit en outre le coût de calcul, un critère décisif pour les entreprises qui font tourner des agents à grande échelle.
Ce travail s'inscrit dans l'intérêt croissant pour les agents capables de modifier leurs propres instructions ou stratégies, une piste jugée prometteuse pour réduire l'intervention humaine. Le surapprentissage est un défaut ancien de l'apprentissage automatique, et la régularisation est l'un de ses remèdes classiques. RRSI applique cette logique aux agents qui se réécrivent eux-mêmes. La suite dépendra de sa validation sur d'autres benchmarks et d'autres types d'agents, ainsi que de son adoption par la communauté.
Pas d'impact direct sur la France/UE