Aller au contenu principal
LLMs · Opinion ·

Les benchmarks divergent sur GPT-6 Astra, mais son efficacité surhumaine sur ARC-AGI-3 avance les prévisions d'AGI de Chollet

Les benchmarks livrent des verdicts contradictoires sur GPT-6 Astra, le dernier modèle d'OpenAI. Epoch AI le place en tête avec un score de 169 points, tandis qu'Artificial Analysis estime qu'il ne fait pas mieux que son prédécesseur et le classe même derrière Claude Fable 5.1. La surprise la plus notable vient du test ARC-AGI-3 : pour la première fois, un modèle, en l'occurrence Astra, s'y montre plus efficace que la moyenne des humains. François Chollet, responsable du prix ARC, a réagi à ce résultat sans pour autant y voir une preuve d'intelligence artificielle générale (AGI).

1 min de lecturePertinence 58

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →

Cette efficacité inédite sur ARC-AGI-3 pèse lourd car ce benchmark a précisément été conçu pour résister à la mémorisation et mesurer un raisonnement adaptatif proche de celui d'un humain face à des problèmes inédits. Que Astra dépasse l'humain moyen sur ce terrain, même sans valider l'arrivée de l'AGI, change la perception du rythme des progrès pour les chercheurs, les investisseurs et les entreprises qui calibrent leurs feuilles de route sur ces jalons. Chollet lui-même juge que l'avancée va "deux fois plus vite" que ce qu'il anticipait, ce qui l'amène à avancer sa propre prévision du moment où l'AGI pourrait être atteinte.

Ces résultats divergents illustrent une tension plus large dans l'évaluation des grands modèles de langage : selon la méthodologie et les tâches retenues, un même modèle peut apparaître comme une avancée majeure ou comme un simple ajustement marginal. Le fait qu'Artificial Analysis positionne Astra derrière Claude Fable 5.1 alors qu'Epoch AI le classe premier souligne l'absence de consensus sur ce qui constitue réellement un progrès en intelligence artificielle. Dans ce contexte, les déclarations de figures reconnues comme Chollet, qui suit ARC-AGI depuis sa création comme test de résistance à la mémorisation, prennent un poids particulier et pourraient influencer la manière dont OpenAI, ses concurrents et la communauté scientifique orientent leurs prochains développements.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Opus 5 d'Anthropic devance largement Fable 5 et GPT-5.6 Sol sur le benchmark conçu pour mesurer l'intelligence réelle49The DecoderLLMs 02GPT-6, Fable 5.1 : comment lire les benchmarks de Claude et GPT sans se faire avoir64FrandroidLLMs 03GPT-5.6 Sol égale presque Fable 5 sur les benchmarks agrégés, pour un tiers du coût47The DecoderLLMs 
Dossier · Claude Fable 5Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.