L'Institut britannique de sécurité de l'IA constate que les benchmarks standards sous-estiment les capacités réelles des agents IA
Le UK AI Security Institute (AISI) a publié une étude portant sur sept benchmarks utilisés pour évaluer les capacités des agents d'intelligence artificielle, révélant que ces tests sous-estiment systématiquement leurs performances réelles. La cause identifiée est simple: les protocoles d'évaluation standards imposent un budget de calcul (mesuré en tokens) trop restreint aux modèles testés. En multipliant ce budget par dix sur des tâches d'ingénierie logicielle, les chercheurs de l'AISI ont observé une hausse d'environ 25 points de pourcentage du taux de réussite. Les modèles les plus récents profitent le plus de cette marge supplémentaire, suggérant que les benchmarks actuels plafonnent artificiellement leurs scores. Selon les calculs de l'institut, une fois ce facteur pris en compte, la progression réelle des capacités des modèles de pointe serait environ 60% plus rapide que ce que les mesures précédentes laissaient penser.
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Cette découverte a des implications directes pour l'industrie et les décideurs qui s'appuient sur ces classements pour évaluer les risques et les capacités des systèmes d'IA. Si les benchmarks sous-estiment structurellement ce que les agents peuvent accomplir, les entreprises, régulateurs et chercheurs en sécurité qui s'en servent pour anticiper les usages potentiellement dangereux ou pour comparer les modèles entre eux travaillent avec une image faussée de la réalité. Cela concerne en particulier les tâches longues et complexes, où un agent disposant de plus de ressources de calcul peut explorer davantage de pistes, corriger ses erreurs et itérer avant de produire une réponse finale.
L'AISI, agence britannique chargée d'évaluer les risques liés à l'intelligence artificielle avancée, cherche depuis sa création à établir des méthodes de test rigoureuses pour suivre l'évolution des capacités des modèles les plus puissants. Ce travail s'inscrit dans un débat plus large sur la fiabilité des benchmarks existants, régulièrement critiqués pour ne pas refléter les conditions réelles d'utilisation des agents IA, notamment lorsqu'ils opèrent en autonomie prolongée. Ces résultats pourraient pousser les organismes d'évaluation à revoir leurs protocoles de test, avec des budgets de calcul plus réalistes, afin de mieux anticiper la trajectoire réelle des progrès de l'IA et les risques associés.
Le Royaume-Uni n'étant plus membre de l'UE, cette étude n'a pas d'impact réglementaire direct, mais ses conclusions pourraient intéresser les évaluateurs européens (dont l'UE dans le cadre de l'AI Act) qui s'appuient sur des benchmarks similaires pour jauger les risques des agents IA.
Ce qui me frappe, c'est que le problème n'est pas dans les modèles, il est dans la règle du jeu : donne dix fois plus de budget de calcul à un agent sur une tâche de code, et son taux de réussite grimpe de 25 points. Du coup toute la courbe de progrès qu'on croyait suivre était fausse, l'AISI parle de 60% de progression en plus que ce qu'on mesurait. Ça change la donne pour les régulateurs : si les benchmarks sous-estiment structurellement ce que les agents savent déjà faire, on pilote les risques de l'IA avec un compteur qui retarde.