Les benchmarks divergent sur GPT-6 Astra, mais son efficacité surhumaine sur ARC-AGI-3 avance les prévisions d'AGI de Chollet
Les benchmarks livrent des verdicts contradictoires sur GPT-6 Astra, le dernier modèle d'OpenAI. Epoch AI le place en tête avec un score de 169 points, tandis qu'Artificial Analysis estime qu'il ne fait pas mieux que son prédécesseur et le classe même derrière Claude Fable 5.1. La surprise la plus notable vient du test ARC-AGI-3 : pour la première fois, un modèle, en l'occurrence Astra, s'y montre plus efficace que la moyenne des humains. François Chollet, responsable du prix ARC, a réagi à ce résultat sans pour autant y voir une preuve d'intelligence artificielle générale (AGI).
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Cette efficacité inédite sur ARC-AGI-3 pèse lourd car ce benchmark a précisément été conçu pour résister à la mémorisation et mesurer un raisonnement adaptatif proche de celui d'un humain face à des problèmes inédits. Que Astra dépasse l'humain moyen sur ce terrain, même sans valider l'arrivée de l'AGI, change la perception du rythme des progrès pour les chercheurs, les investisseurs et les entreprises qui calibrent leurs feuilles de route sur ces jalons. Chollet lui-même juge que l'avancée va "deux fois plus vite" que ce qu'il anticipait, ce qui l'amène à avancer sa propre prévision du moment où l'AGI pourrait être atteinte.
Ces résultats divergents illustrent une tension plus large dans l'évaluation des grands modèles de langage : selon la méthodologie et les tâches retenues, un même modèle peut apparaître comme une avancée majeure ou comme un simple ajustement marginal. Le fait qu'Artificial Analysis positionne Astra derrière Claude Fable 5.1 alors qu'Epoch AI le classe premier souligne l'absence de consensus sur ce qui constitue réellement un progrès en intelligence artificielle. Dans ce contexte, les déclarations de figures reconnues comme Chollet, qui suit ARC-AGI depuis sa création comme test de résistance à la mémorisation, prennent un poids particulier et pourraient influencer la manière dont OpenAI, ses concurrents et la communauté scientifique orientent leurs prochains développements.
Pas d'impact direct sur la France/UE