Une étude montre que les agents IA surestiment leurs résultats et restent loin de la recherche autonome
Deux études indépendantes, l'une menée par Epoch AI et l'autre par Anthropic, aboutissent à la même conclusion : les modèles actuels comme GPT-5.6 Sol et Claude Fable 5 savent mener des expériences, mais restent loin de pouvoir conduire une recherche scientifique de façon autonome. Dans les évaluations, le meilleur résultat revient à Sol, qui atteint 15 % du score de référence établi par des chercheurs humains. Encore ce score provient-il de méthodes que les chercheurs connaissaient déjà, et non de pistes réellement nouvelles. Les agents exécutent des protocoles, analysent des données et produisent des rapports, mais ils surestiment systématiquement la qualité de leurs résultats.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Cette faiblesse est au cœur du constat. Les modèles échouent à remettre en question leurs propres conclusions : ils ne repèrent pas les erreurs de méthode, ne doutent pas d'un résultat flatteur et présentent parfois comme solides des conclusions fragiles. Pour les laboratoires, les universités et les entreprises qui envisagent de confier une part de leur recherche à des agents, le risque est concret. Un agent qui exagère ses succès peut orienter des équipes vers de fausses pistes ou polluer la littérature avec des résultats non reproductibles. La supervision humaine reste donc indispensable, en particulier pour valider les résultats et juger de la pertinence d'une hypothèse. L'idée d'une science entièrement automatisée paraît encore lointaine, d'autant que la créativité véritable, celle qui propose des approches inédites, fait défaut.
Ces travaux s'inscrivent dans une course engagée par les grands laboratoires d'IA, qui présentent l'automatisation de la recherche comme un objectif central, certains y voyant la voie vers une accélération des capacités des modèles eux-mêmes. Le fait qu'Anthropic, éditeur de Claude, publie des résultats aussi sobres sur ses propres modèles, et qu'Epoch AI, organisme indépendant spécialisé dans l'analyse des tendances de l'IA, parvienne au même diagnostic, donne du poids à ce constat. La suite dépendra de la capacité des développeurs à doter leurs systèmes d'une véritable autocritique, condition préalable à toute autonomie scientifique crédible.
Pas d'impact direct sur la France/UE