Aller au contenu principal
LLMs · Paper ·

OpenAI affirme que GPT-5.6 Sol dépasse Opus 5 sur ARC-AGI-3 avec sa dernière API et deux réglages supplémentaires

OpenAI affirme que son modèle GPT-5.6 Sol dépasse Opus 5 d'Anthropic sur le benchmark ARC-AGI-3, mais uniquement en utilisant sa propre API et deux réglages supplémentaires non prévus dans le protocole officiel. Dans cette configuration personnalisée, GPT-5.6 Sol obtient un score de 38,3 %. En revanche, testé selon l'environnement standard défini par ARC Prize, l'organisation qui gère ce benchmark, le même modèle ne récolte que 7,8 %, un écart considérable qui interroge sur la validité de la comparaison mise en avant par OpenAI. ARC Prize, de son côté, affirme que son environnement de test est neutre et ne favorise aucun fournisseur, mais reconnaît avoir potentiellement utilisé une version obsolète de l'API d'OpenAI, ce qui aurait faussé la comparaison initiale avec Opus 5.

1 min de lecturePertinence 42

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →

Cet épisode illustre les tensions croissantes autour des benchmarks censés mesurer les capacités de raisonnement des grands modèles de langage. Pour les entreprises et développeurs qui choisissent leur fournisseur d'IA en fonction de ces classements, la fiabilité des méthodologies de test devient un enjeu critique : un score gonflé par des paramètres non standards peut orienter des décisions d'achat ou d'intégration sur des bases trompeuses.

ARC-AGI-3 s'est imposé comme une référence pour évaluer le raisonnement abstrait des modèles, au-delà de la simple mémorisation de motifs. La rivalité entre OpenAI et Anthropic sur ce terrain reflète une course plus large à la démonstration de supériorité technique, où chaque acteur cherche à optimiser ses résultats via des configurations spécifiques. Cette controverse pourrait pousser ARC Prize à revoir ses protocoles de test pour garantir une comparaison réellement équitable entre fournisseurs, à mesure que ces benchmarks gagnent en influence sur le marché.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Qwen3.8-Max affirme surpasser GPT-5.6 Sol Max et Fable 5 sur l'usage d'ordinateur à base d'agents48VentureBeat AILLMs 02OpenAI dévoile GPT-5.6 en plein débat réglementaire sur l'IA aux États-Unis55The Verge AILLMs 03OpenAI GPT-5.6 Sol / Terra / Luna : réservé aux partenaires de confiance57Latent SpaceLLMs 
Dossier · OpenAISuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.