Aller au contenu principal
Recherche · Paper ·

Zuck sceptique sur l'IA, avec un simulateur RSI et une IA au service de la science

Un nouveau benchmark baptisé DiG-bench (Discovery in Games) vient d'être publié pour évaluer la capacité des systèmes d'intelligence artificielle à découvrir par eux-mêmes les règles cachées d'un environnement, plutôt que de les recevoir explicitement. L'outil rassemble 70 jeux textuels, dont 21 ont été rendus publics, les autres étant conservés secrets pour éviter que les modèles ne s'entraînent dessus. Chaque jeu constitue un monde miniature autonome dont les règles et l'objectif restent dissimulés au joueur, qui doit les déduire par l'expérimentation, un principe proche du benchmark visuel ARC. Le projet est accessible en ligne sur digbench.ai et a été conçu par des chercheurs de Thinking About Thinking, de l'université d'Oxford, de Princeton, de la King Abdullah University of Science and Technology, du Swiss AI Lab, d'Inria et du MIT, avec la participation de Juergen Schmidhuber, figure historique de la recherche en IA. Les jeux sont répartis en sept niveaux de difficulté croissante, avec un nombre d'actions possibles par étape allant de 2 à 34. Selon les résultats publiés, Opus 5 et Fable 5 associés à Claude Code dominent le classement, suivis par GPT-5.5. Seuls Opus 5 et Fable 5 sont parvenus à résoudre certaines tâches du niveau 7, le plus difficile, avec un taux de réussite d'environ 20 %. Opus 5, GPT-5.5 et Kimi K3 ont réussi quelques tâches du niveau 6 lorsqu'ils disposaient d'un environnement d'exécution comme Claude Code, tandis que GLM-5.2 et Gemini 3.1 Pro plafonnent au niveau 4.

2 min de lecturePertinence 56
Source

Résumé et traduction réalisés par Le Fil IA à partir de Import AI. Lire l'article original →

Ce type de test cherche à isoler une composante clé de la créativité : la capacité à repérer de façon autonome des informations utiles et non documentées dans une situation inédite. Or l'écart avec les performances humaines reste marqué, puisque des joueurs humains individuels ont atteint 100 % de réussite sur l'ensemble des niveaux, contre à peine 20 % pour les meilleurs modèles sur le niveau le plus difficile. Ce résultat suggère que si les modèles de pointe progressent dans l'exploration et l'inférence de règles implicites, ils demeurent nettement en retrait sur les tâches exigeant une véritable intuition face à l'inconnu, un enjeu central pour les usages en agent autonome ou en robotique.

La démarche s'inscrit dans une tendance plus large de la recherche en IA, qui cherche à dépasser les benchmarks de connaissances factuelles pour mesurer des capacités cognitives plus fondamentales comme la découverte et l'adaptation. En gardant la majorité des jeux privés, les concepteurs de DiG-bench cherchent à limiter la contamination des données d'entraînement, un problème récurrent qui fausse l'évaluation réelle des progrès des modèles. À mesure que les laboratoires intègrent des environnements d'exécution comme Claude Code à leurs modèles, l'écart de performance observé entre les niveaux 4 et 7 pourrait se resserrer rapidement, les auteurs de l'étude anticipant eux-mêmes une progression vers la parité avec les performances humaines dans un avenir relativement proche.

Impact France / UEChamp produit par Le Fil IA

Inria, institut de recherche francais, fait partie des concepteurs de ce benchmark, marquant une contribution francaise a l'evaluation des capacites d'IA.

À lire ensuite

01L'IA au service de la compréhension du cerveau : explications et expériences42Microsoft ResearchRecherche 02NeurIPS 2026 : la conférence où se joue l’avenir scientifique, industriel et géopolitique de l’IA44FrenchWebRecherche 03Xiaomi dévoile RC-S et RC-T, des métriques de suppression d'objets alignées sur la perception humaine, avec un benchmark vidéo réel48MarkTechPostRecherche 
Dossier · Claude Fable 5Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.