L'IA reste peu performante en perception visuelle, confirme un nouveau benchmark
Moonshot AI, le laboratoire chinois derrière les modèles Kimi, a publié un nouveau benchmark baptisé PerceptionBench, conçu pour mesurer la capacité des modèles d'IA multimodaux à réellement "voir" une image, indépendamment de leurs capacités de raisonnement logique. Les résultats sont sans appel : aucun modèle de pointe actuel ne dépasse 60% de précision sur ce test. GPT-5.6 Sol arrive en tête du classement, mais avec une marge très étroite sur ses concurrents directs, ce qui indique que le problème touche l'ensemble de l'industrie et non un acteur isolé.
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Ce résultat est important car il remet en cause la manière dont les erreurs des modèles d'IA sont généralement analysées. De nombreuses erreurs jusqu'ici attribuées à des défauts de raisonnement logique se produisent en réalité bien plus tôt, dès l'étape de lecture de l'image elle-même. Autrement dit, le modèle se trompe avant même de commencer à raisonner, simplement parce qu'il n'a pas correctement perçu ce qui se trouve dans l'image. Pour les entreprises qui développent ces systèmes, cela signifie que renforcer uniquement les capacités de raisonnement ne suffira pas à améliorer les performances globales : c'est la perception visuelle elle-même qui doit être retravaillée en priorité.
Ce constat s'inscrit dans un débat plus large sur la fiabilité des benchmarks existants pour les modèles multimodaux, souvent critiqués pour saturer rapidement ou pour mal distinguer les compétences de perception de celles de raisonnement. En isolant spécifiquement la capacité à "voir", PerceptionBench propose une méthodologie d'évaluation plus fine, susceptible d'orienter les futurs efforts d'entraînement des laboratoires d'IA vers des architectures capables de mieux ancrer leur raisonnement dans une lecture visuelle fiable.
Pas d'impact direct sur la France/UE