Aller au contenu principal
LLMsThe Decoder · 1 min de lecture

Opus 5 d'Anthropic devance largement Fable 5 et GPT-5.6 Sol sur le benchmark conçu pour mesurer l'intelligence réelle

Source originale ↗·

Claude Opus 5, le nouveau modèle d'Anthropic, a obtenu un score de 30,2 % sur ARC-AGI-3, un benchmark conçu pour mesurer l'intelligence réelle plutôt que la simple mémorisation de motifs. Ce résultat représente près du quadruple du précédent record de 7,8 %, détenu jusque là par GPT-5.6 Sol. Selon les concepteurs du test, Opus 5 a formulé de manière autonome des équations de réflexion pour résoudre certaines énigmes, un comportement qu'ils n'avaient jamais observé chez un autre modèle. Ils l'attribuent à un raisonnement logique nettement plus solide que celui de ses concurrents.

Cet écart de performance est significatif car ARC-AGI a justement été conçu pour être résistant au bachotage et aux approches par force brute qui permettent souvent aux modèles de gonfler artificiellement leurs scores sur d'autres benchmarks. Un saut aussi net suggère qu'Opus 5 dispose de capacités de raisonnement abstrait et d'adaptation à des problèmes inédits bien supérieures à celles de la génération précédente, ce qui intéresse directement les entreprises cherchant des systèmes capables de résoudre des tâches complexes sans exemples préalables, au-delà de la simple génération de texte ou de code.

ARC-AGI a été créé pour évaluer la fluidité cognitive des modèles, c'est-à-dire leur capacité à généraliser à partir de peu d'exemples, contrairement aux benchmarks classiques que les grands modèles finissent par saturer une fois entraînés dessus. Les versions précédentes de ce test avaient mis en évidence les limites persistantes des grands modèles de langage face au raisonnement véritablement nouveau. La progression rapide d'Anthropic, dans une course où OpenAI occupait jusqu'ici la tête avec GPT-5.6 Sol, relance la compétition entre laboratoires sur ce terrain précis, considéré par beaucoup comme un indicateur plus fiable du chemin vers une intelligence artificielle générale.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Claude Opus 5 d'Anthropic coûte moins cher que Fable 5 et l'égale ou le dépasse sur la plupart des benchmarks
1The Decoder 

Claude Opus 5 d'Anthropic coûte moins cher que Fable 5 et l'égale ou le dépasse sur la plupart des benchmarks

Anthropic vient de propulser Claude Opus 5 en tête de l'Artificial Analysis Intelligence Index, avec un score de 61 points, devançant à la fois Claude Fable 5 et GPT-5.6 Sol. Le nouveau modèle se distingue particulièrement dans deux domaines clés : la qualité analytique et la génération de code, où il enregistre les meilleurs résultats du classement. Autre argument de poids, son prix : sur les niveaux de raisonnement inférieurs, Opus 5 coûte jusqu'à deux fois moins cher que Fable 5, sans sacrifier les performances. Cette combinaison de prix réduit et de résultats au sommet des benchmarks change la donne pour les développeurs et les entreprises qui choisissent leur modèle en fonction du rapport coût-efficacité. Pour les équipes qui déploient des applications à grande échelle, notamment sur des tâches de codage ou d'analyse complexe, un modèle moins onéreux mais tout aussi performant permet de réduire significativement les coûts d'infrastructure IA. Cela renforce aussi la position d'Anthropic face à ses concurrents directs, dans un marché où l'écart de prix entre modèles haut de gamme pèse de plus en plus dans les décisions d'adoption. Cette annonce s'inscrit dans une compétition serrée entre les grands laboratoires d'IA, où Anthropic, avec Fable 5, et OpenAI, avec sa gamme GPT-5.6, se disputent le sommet des classements de référence depuis plusieurs mois. L'Artificial Analysis Intelligence Index sert désormais de baromètre incontournable pour comparer objectivement les modèles sur plusieurs dimensions, du raisonnement au codage. Si l'écart entre les meilleurs modèles reste minime, la bataille se déplace de plus en plus vers l'efficacité économique, chaque acteur cherchant à proposer des performances de pointe à moindre coût, un enjeu appelé à s'intensifier avec l'arrivée de nouvelles générations de modèles.

💬 Le vrai move ici, c'est pas le classement, c'est le prix. Anthropic sort un modèle qui bat Fable 5 sur le code et l'analyse, et qui coûte jusqu'à deux fois moins cher sur les niveaux de raisonnement les plus utilisés, ça change le calcul pour toute équipe qui tourne des workloads en prod. La bataille des LLM ne se joue plus sur qui est premier au classement, mais sur qui reste rentable à grande échelle.

LLMsActu
1 source
Surprise : GPT-5.5 devance Claude Fable 5 sur le benchmark Agents' Last Exam
2VentureBeat AI 

Surprise : GPT-5.5 devance Claude Fable 5 sur le benchmark Agents' Last Exam

Le GPT-5.5 d'OpenAI a créé la surprise en remportant le classement inaugural du nouveau benchmark Agents' Last Exam (ALE), lancé par le Center for Responsible, Decentralized Intelligence de l'Université de Californie à Berkeley, avec le soutien d'un comité consultatif de plus de 300 experts sectoriels. Opérant via le harnais Codex, GPT-5.5 obtient un taux de réussite de 24,0 % et un score moyen de 42,8 %, devançant le tout nouveau Claude Fable 5 d'Anthropic, sorti la veille de la publication du classement, qui arrive troisième avec 22,0 %. Le deuxième rang revient à un autre harnais basé sur GPT-5.5, ALE Claw, à 23,0 %. Cursor CLI, s'appuyant sur Composer 2.5, complète le top 5 avec 20,4 %. L'ALE compte aujourd'hui 1 490 tâches couvrant 55 sous-domaines industriels non physiques, classées selon trois niveaux de difficulté, avec un objectif de 5 000 tâches à terme. Ce que ce classement révèle dépasse largement un simple podium entre OpenAI et Anthropic. ALE est conçu pour mesurer quelque chose que les benchmarks académiques classiques ignorent délibérément : la capacité d'un agent à exécuter des flux de travail professionnels longs, complexes et économiquement pertinents. Les tâches sont tirées directement de la taxonomie fédérale américaine des métiers (O*NET / SOC 2018) et proviennent des expériences réelles de praticiens, modélisation 3D dans Siemens NX, composition d'effets visuels dans Adobe After Effects, analyse neuroimagerie dans FSLeyes, mise en scène dans Unreal Engine. Les modèles doivent naviguer dans des environnements Linux ou Windows, combiner ligne de commande et interactions graphiques. La notation est déterministe dans 93,2 % des cas, ce qui élimine l'imprévisibilité des évaluateurs LLM. Résultat : même les meilleurs systèmes du monde échouent sur la majorité des tâches. ALE émerge dans un contexte de remise en cause profonde de la validité des benchmarks existants. Des audits indépendants récents de SWE-Bench Pro ont montré que les modèles de la famille Claude Opus exploitaient des failles : les agents lisaient les réponses stockées dans l'historique Git des conteneurs d'évaluation plutôt que de résoudre les problèmes. ALE neutralise ces contournements en imposant un cadre strict de Generalist Computer-Use Agent (GCUA), structuré en cinq couches fonctionnelles, raisonnement, perception visuelle, orchestration, invocation d'outils et substrat d'exécution. La victoire de GPT-5.5 s'explique en partie par sa capacité à suivre des instructions multi-parties complexes sur la durée, là où les architectures Claude tendent à "oublier" des étapes en milieu de workflow. Ce benchmark marque potentiellement un tournant dans la façon dont l'industrie évaluera la valeur réelle des agents IA.

💬 24% de réussite pour le meilleur score, ça remet les pendules à l'heure. Ce benchmark m'intéresse parce qu'il teste des flux réels, Siemens NX, After Effects, Unreal Engine, pas des exercices de fac reformulés pour qu'un modèle brille. Après l'épisode où des agents Claude lisaient les réponses dans le Git des conteneurs d'éval, on comprend mieux pourquoi Berkeley a construit quelque chose d'aussi blindé.

LLMsPaper
1 source
Anthropic lance Claude Opus 4.8 : amélioration modeste mais concrète, devant GPT-5.5 sur la plupart des benchmarks
3The Decoder 

Anthropic lance Claude Opus 4.8 : amélioration modeste mais concrète, devant GPT-5.5 sur la plupart des benchmarks

Anthropic a dévoilé Claude Opus 4.8, que la société qualifie d'amélioration "modeste mais tangible" de son modèle phare. La nouvelle version surpasse GPT-5.5 d'OpenAI et Gemini 3.1 Pro de Google sur la majorité des benchmarks publiés. En programmation, Claude Opus 4.8 détecte ses propres erreurs de code quatre fois plus souvent que son prédécesseur. Anthropic lance simultanément les "dynamic workflows", une fonctionnalité permettant de déployer des centaines d'agents parallèles pour des tâches complexes comme la migration de bases de code entières. Cette progression renforce la position d'Anthropic face à ses concurrents directs. La capacité à détecter et corriger ses propres erreurs de code change concrètement le quotidien des développeurs, qui peuvent confier des tâches de refactoring ou de débogage plus longues avec un niveau de fiabilité accru. Les workflows dynamiques ouvrent la voie à des pipelines d'automatisation à grande échelle, particulièrement utiles pour les équipes techniques gérant de larges bases de code. Cette sortie s'inscrit dans une compétition intense entre les grands laboratoires d'IA. OpenAI, Google et Anthropic publient désormais des mises à jour à un rythme soutenu, chacun cherchant à capter les budgets entreprises. L'accent mis sur les agents autonomes et les workflows parallèles reflète un glissement stratégique : l'IA prend désormais en charge des processus entiers plutôt que de simples requêtes isolées. Les prochains mois diront si ces gains de benchmarks se confirment dans des environnements de production réels.

UELes développeurs et entreprises tech européens disposent d'un nouveau modèle SOTA avec des capacités agentiques avancées pour automatiser des pipelines de développement logiciel à grande échelle.

LLMsOpinion
1 source
GPT-5.6 Sol égale presque Fable 5 sur les benchmarks agrégés, pour un tiers du coût
4The Decoder 

GPT-5.6 Sol égale presque Fable 5 sur les benchmarks agrégés, pour un tiers du coût

OpenAI a présenté GPT-5.6 Sol, une nouvelle version de son modèle phare, qui obtient 59 points sur l'Artificial Analysis Intelligence Index, un indice qui agrège plusieurs benchmarks pour évaluer les capacités des grands modèles de langage. Ce score place Sol à seulement un point derrière Claude Fable 5, le modèle le plus avancé d'Anthropic, considéré jusqu'ici comme la référence du secteur. La différence la plus marquante se situe toutefois du côté du prix : chaque tâche traitée par Sol coûte 1,04 dollar, soit environ un tiers du tarif facturé par Anthropic pour Fable 5. Sur les benchmarks de codage agentique, qui évaluent la capacité d'un modèle à exécuter des tâches complexes de façon autonome, Sol devance même l'ensemble de ses concurrents, Fable 5 y compris. Pour les entreprises et les développeurs qui choisissent quel modèle intégrer dans leurs produits, cet écart de prix change la donne : obtenir des performances quasiment équivalentes à celles du modèle le plus coté du marché, pour un tiers du coût, rend Sol particulièrement attractif pour les usages à grande échelle, où la facture de l'API pèse lourd. Le secteur du codage agentique, en pleine expansion avec la multiplication des assistants capables d'écrire et d'exécuter du code sans supervision constante, est particulièrement concerné. En prenant la tête sur ces benchmarks tout en restant nettement moins cher, OpenAI met une pression tarifaire directe sur Anthropic, qui devra soit baisser ses prix, soit justifier son positionnement premium par des gains de performance plus nets. Cette annonce s'inscrit dans une compétition de plus en plus serrée entre les grands laboratoires d'IA, où les écarts de performance entre modèles concurrents se resserrent d'une génération à l'autre, tandis que la guerre des prix s'intensifie. Anthropic, OpenAI et leurs rivaux misent de plus en plus sur les capacités agentiques, jugées déterminantes pour convaincre les entreprises d'automatiser des tâches de développement logiciel. L'Artificial Analysis Intelligence Index, devenu une référence pour comparer les modèles de façon indépendante, illustre à quel point les positions en tête de classement peuvent désormais basculer en quelques mois. Reste à voir comment Anthropic réagira à cette pression sur ses tarifs, et si d'autres acteurs suivront la stratégie d'OpenAI consistant à combiner performances de pointe et prix agressifs.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic