Aller au contenu principal
Recherche · Paper ·

Ces tests de QI donnent du fil à retordre aux IA : ferez-vous mieux ?

Les tests de logique et les jeux occupent une place centrale dans le développement de l'intelligence artificielle depuis ses débuts, le terme "machine learning" ayant été popularisé en 1959 dans un article du chercheur d'IBM Arthur Samuel consacré à un algorithme apprenant à jouer aux dames. Les échecs et le jeu de go chinois ont ensuite servi de bancs d'essai emblématiques. Sur ce terrain précis des puzzles, les progrès des modèles d'IA sont rapides et mesurables : fin 2024, une équipe de l'université Columbia a montré que même les meilleurs modèles ne résolvaient que 18 % des célèbres puzzles Connections du New York Times ; début 2025, certains modèles les résolvaient presque parfaitement à chaque tentative. Mais des faiblesses persistent, en particulier sur les puzzles de rotation mentale, une épreuve classique des tests de QI où il faut reconnaître un même objet vu sous des angles différents. Une étude de 2024 menée par des chercheurs de Google et de l'université de l'Illinois à Urbana-Champaign a aussi révélé que les modèles échouent souvent sur des variantes du puzzle des chevaliers et des chevaliers noirs quand celles-ci s'écartent légèrement des versions rencontrées pendant l'entraînement, un phénomène également observé sur le benchmark SimpleBench et sur ARC-AGI, dédié au raisonnement abstrait et visuel.

2 min de lecturePertinence 52
Source

Résumé et traduction réalisés par Le Fil IA à partir de MIT Technology Review. Lire l'article original →

Ces résultats importent parce qu'ils révèlent où la cognition des machines diverge encore fortement de celle des humains, au-delà des scores impressionnants affichés sur les tâches de mémorisation pure. Les grands modèles de langage disposent d'une mémoire considérable, forgée sur des volumes de données massifs, ce qui leur donne un net avantage sur les quiz de culture générale. Mais cet atout devient un handicap face à des variations subtiles d'un problème connu : le modèle reconnaît un schéma familier et restitue une réponse mémorisée plutôt que de raisonner sur les différences réelles. Cette faille est particulièrement marquée pour le raisonnement spatial en trois dimensions, un domaine où les architectes et ingénieurs mécaniciens excellent naturellement, mais où les IA, même dotées de capacités d'analyse d'images, échouent de façon abyssale. Cela questionne directement la fiabilité de ces systèmes pour des tâches exigeant une véritable manipulation mentale de l'espace, au-delà du simple traitement statistique de texte ou d'image.

Ce constat s'inscrit dans un débat plus large sur ce que mesurent réellement les benchmarks d'IA et sur le risque de contamination des données d'entraînement, qui peut donner une illusion de raisonnement là où il n'y a que reconnaissance de motifs mémorisés. Des initiatives comme le concours ARC-AGI cherchent justement à isoler la capacité d'abstraction générale des modèles de leur simple aptitude à réciter des connaissances. À mesure que les entreprises intègrent l'IA dans des tâches critiques, comprendre précisément où elle excelle et où l'humain garde l'avantage, notamment sur le raisonnement spatial et l'adaptabilité face à la nouveauté, devient un enjeu clé pour calibrer la confiance qu'on peut lui accorder.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Paris sportifs : Ce qui risque de vous arriver en demandant conseil à l’IA41Le Big DataRecherche 02Les agents de recherche IA n'échouent pas à chercher, mais à poser les bonnes questions face aux requêtes ambiguës39The DecoderRecherche 03Deux assistants IA parviennent à accomplir des tâches de repositionnement de médicaments47Ars Technica AIRecherche 

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.