Le système de relecture par LLM de Sakana AI détecte 73 % des erreurs sur les affirmations centrales
Sakana AI a publié « Beyond Imitation », un article accepté par TMLR sur la relecture scientifique assistée par LLM, centrée sur la détection d'erreurs plutôt que sur l'imitation des relecteurs humains. L'équipe propose deux éléments : un Contradiction Benchmark et un système baptisé Multi-Layered Review (MLR). Le benchmark compte 1 164 contradictions insérées dans 257 articles issus de cinq conférences (ACL, AISTATS, CVPR et ICML 2025, NeurIPS 2024). Gemini 2.5 Pro construit un graphe des affirmations, preuves et méthodes de chaque papier, la distance d'un nœud à l'affirmation principale définissant la gravité, puis GPT-4.1 réécrit un nœud par distance en contradiction. Un juge o3 note chaque relecture dix fois. MLR repose sur trois agents tournant sur des modèles Claude du commerce : un agent d'annexes (Claude Haiku 3.5), un agent de revue de littérature optionnel avec recherche web (Claude Sonnet 4) et un agent de relecture (Claude Sonnet 4) qui procède en trois passes inspirées de la méthode de Keshav, du plan général à la synthèse finale avec forces, faiblesses, questions, score et liste d'actions. Le PDF est transmis directement, ce qui préserve figures et équations.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Les résultats sont nets. Avec quatre relectures, MLR détecte 73,43 % des contradictions touchant une affirmation centrale (distance 0) et 40,95 % au total, contre 14,81 % à la distance 0 pour le meilleur concurrent, AgentReview. Une seule relecture MLR en attrape déjà 60,79 %. Le juge o3 affiche 99,9 % de précision sur des papiers sains et 86,8 % de sensibilité sur les détections confirmées manuellement, ce qui suggère que les scores sont plutôt prudents. Le coût reste modeste : environ 0,47 dollar par relecture, avec 189 062 jetons en entrée, soit moitié moins que l'AI Reviewer (403 654). Aucun GPU ni ajustement fin n'est nécessaire, ce qui rend l'approche accessible à quiconque construit des agents de recherche.
L'étude distingue aussi l'effet du modèle de celui de l'architecture. Remplacer GPT-4.1 par Claude Sonnet 4 dans LLM-Review fait passer la détection à la distance 0 de 14,56 % à 35,40 %, tandis que la conception de MLR ajoute environ 25 points sur une relecture unique. Les limites sont réelles : sur 211 articles réellement rétractés (WithdrarXiv-Check), MLR ne retrouve que 26,07 % des erreurs en correspondance « similaire » et 16,11 % en correspondance exacte, contre 18,48 % et 9,00 % pour les meilleures références. Le système reste en outre vulnérable aux injections de prompt cachées. Côté notes, la corrélation de Pearson avec les évaluateurs humains atteint 0,586 sur ICLR 2025 (0,742 entre humains) et 0,439 sur ICML 2025 contre 0,429 pour l'AI Reviewer. MLR insiste davantage sur la validité et les expériences, les humains sur la clarté et la nouveauté, d'où une complémentarité plutôt qu'un remplacement.
Ce travail s'inscrit dans l'engorgement des comités de lecture, submergés par la hausse des soumissions, et dans la multiplication des relecteurs automatisés, généralement évalués à leur ressemblance avec les avis humains, un critère qui ne garantit pas la détection de fautes réelles. En plantant des erreurs graduées, Sakana AI propose une mesure plus directe de la rigueur. L'écart entre le benchmark synthétique et les rétractations réelles montre toutefois que le problème reste ouvert. Les suites probables concernent le durcissement face aux injections de prompt et l'élargissement à des erreurs plus subtiles, comme celles des données ou du code.
Pas d'impact direct sur la France/UE