Aller au contenu principal
Recherche · Paper ·

L'étude contredit les affirmations d'Anthropic et OpenAI sur une recherche en IA autonome à portée de main

L'agence de sécurité de l'IA du Royaume-Uni (UK AI Security Institute) et l'Université de Princeton ont mené une étude testant la capacité des agents d'intelligence artificielle à mener des recherches scientifiques de façon autonome. Des agents équipés de Claude Opus 4.8 et de GPT-5.6 Sol ont reçu six jours, 3 000 dollars de crédits d'API et un accès à des GPU pour rédiger de manière indépendante des articles de recherche en IA. Les auteurs originaux d'articles non publiés soumis à NeurIPS, la principale conférence du domaine, ont ensuite évalué ces travaux produits par les agents et les ont jugés dignes d'un "Reject", c'est-à-dire d'un rejet pur et simple.

1 min de lecturePertinence 61
Source

Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →

Ce résultat contredit directement les affirmations récentes d'Anthropic et d'OpenAI selon lesquelles une recherche en IA totalement autonome serait à portée de main. Pour l'industrie, cela signifie que les modèles les plus avancés, malgré leurs progrès techniques, ne peuvent pas encore remplacer les chercheurs humains sur les tâches qui exigent du discernement scientifique. Les entreprises qui envisagent d'automatiser leurs laboratoires de recherche doivent donc revoir leurs attentes, au moins à court terme, et continuer à s'appuyer sur une supervision humaine étroite pour les décisions stratégiques de recherche.

L'étude précise que les modèles de pointe maîtrisent bien l'ingénierie complète du processus de recherche, comme l'écriture de code, l'exécution d'expériences ou la mise en forme des résultats. En revanche, ils échouent sur le jugement scientifique, la résolution créative de problèmes et surtout la capacité à abandonner une approche qui ne fonctionne pas, un réflexe pourtant essentiel chez tout chercheur expérimenté. Ces conclusions surviennent alors qu'Anthropic et OpenAI multiplient les annonces sur l'automatisation de la recherche en IA par l'IA elle-même, une promesse centrale de leur discours sur l'accélération du progrès scientifique. Ce travail invite à la prudence face à ce narratif et laisse ouverte la question de savoir combien de temps sera encore nécessaire avant que ces lacunes de jugement soient comblées.

Impact France / UEChamp produit par Le Fil IA

Etude menee par une institution britannique et non europeenne, mais ses conclusions nourrissent le debat europeen sur les methodes d'evaluation des capacites de l'IA, pertinent pour la mise en oeuvre de l'AI Act.

À lire ensuite

01Mais pourquoi les IA semblent avoir des émotions ? L’étonnante étude d’Anthropic46Le Big DataRecherche 02Une nouvelle étude de Harvard et Perplexity révèle que les agents IA effectuent 26 minutes de travail autonome par session, contre 33 secondes pour la recherche46MarkTechPostRecherche 03Import AI 454 : automatiser la recherche sur l'alignement, étude de sécurité d'un modèle chinois, HiFloat443Import AIRecherche 
Dossier · OpenAISuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.