L'IA reste peu performante en perception visuelle, confirme un nouveau benchmark
Moonshot AI, le laboratoire chinois derrière les modèles Kimi, a publié un nouveau benchmark baptisé PerceptionBench, conçu pour mesurer la capacité des modèles d'IA multimodaux à réellement "voir" une image, indépendamment de leurs capacités de raisonnement logique. Les résultats sont sans appel : aucun modèle de pointe actuel ne dépasse 60% de précision sur ce test. GPT-5.6 Sol arrive en tête du classement, mais avec une marge très étroite sur ses concurrents directs, ce qui indique que le problème touche l'ensemble de l'industrie et non un acteur isolé.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Ce résultat est important car il remet en cause la manière dont les erreurs des modèles d'IA sont généralement analysées. De nombreuses erreurs jusqu'ici attribuées à des défauts de raisonnement logique se produisent en réalité bien plus tôt, dès l'étape de lecture de l'image elle-même. Autrement dit, le modèle se trompe avant même de commencer à raisonner, simplement parce qu'il n'a pas correctement perçu ce qui se trouve dans l'image. Pour les entreprises qui développent ces systèmes, cela signifie que renforcer uniquement les capacités de raisonnement ne suffira pas à améliorer les performances globales : c'est la perception visuelle elle-même qui doit être retravaillée en priorité.
Ce constat s'inscrit dans un débat plus large sur la fiabilité des benchmarks existants pour les modèles multimodaux, souvent critiqués pour saturer rapidement ou pour mal distinguer les compétences de perception de celles de raisonnement. En isolant spécifiquement la capacité à "voir", PerceptionBench propose une méthodologie d'évaluation plus fine, susceptible d'orienter les futurs efforts d'entraînement des laboratoires d'IA vers des architectures capables de mieux ancrer leur raisonnement dans une lecture visuelle fiable.
Pas d'impact direct sur la France/UE
Ce que révèle ce PerceptionBench, c'est que le goulot d'étranglement de l'IA multimodale n'est pas là où on le cherchait. On a passé deux ans à muscler le raisonnement des modèles pendant que le vrai problème restait en amont, dans la lecture brute de l'image. Résultat, aucun modèle ne passe 60% sur ce test, GPT-5.6 Sol en tête mais à peine devant les autres, ce qui confirme que c'est un plafond de toute l'industrie, pas un raté isolé. Bon, sur le papier ça remet les priorités d'entraînement à plat, reste à voir si les labos suivent vraiment ce signal plutôt que d'empiler encore du raisonnement par-dessus une perception bancale.