OpenAI affirme que GPT-5.6 Sol dépasse Opus 5 sur ARC-AGI-3 avec sa dernière API et deux réglages supplémentaires
OpenAI affirme que son modèle GPT-5.6 Sol dépasse Opus 5 d'Anthropic sur le benchmark ARC-AGI-3, mais uniquement en utilisant sa propre API et deux réglages supplémentaires non prévus dans le protocole officiel. Dans cette configuration personnalisée, GPT-5.6 Sol obtient un score de 38,3 %. En revanche, testé selon l'environnement standard défini par ARC Prize, l'organisation qui gère ce benchmark, le même modèle ne récolte que 7,8 %, un écart considérable qui interroge sur la validité de la comparaison mise en avant par OpenAI. ARC Prize, de son côté, affirme que son environnement de test est neutre et ne favorise aucun fournisseur, mais reconnaît avoir potentiellement utilisé une version obsolète de l'API d'OpenAI, ce qui aurait faussé la comparaison initiale avec Opus 5.
Cet épisode illustre les tensions croissantes autour des benchmarks censés mesurer les capacités de raisonnement des grands modèles de langage. Pour les entreprises et développeurs qui choisissent leur fournisseur d'IA en fonction de ces classements, la fiabilité des méthodologies de test devient un enjeu critique : un score gonflé par des paramètres non standards peut orienter des décisions d'achat ou d'intégration sur des bases trompeuses.
ARC-AGI-3 s'est imposé comme une référence pour évaluer le raisonnement abstrait des modèles, au-delà de la simple mémorisation de motifs. La rivalité entre OpenAI et Anthropic sur ce terrain reflète une course plus large à la démonstration de supériorité technique, où chaque acteur cherche à optimiser ses résultats via des configurations spécifiques. Cette controverse pourrait pousser ARC Prize à revoir ses protocoles de test pour garantir une comparaison réellement équitable entre fournisseurs, à mesure que ces benchmarks gagnent en influence sur le marché.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




