Aller au contenu principal
[AINews] Claude Opus 5 : performances dignes de Fable, au prix d'Opus (moitié moins cher que Fable)
LLMsLatent Space · 2 min de lecture

[AINews] Claude Opus 5 : performances dignes de Fable, au prix d'Opus (moitié moins cher que Fable)

Source originale ↗·
[AINews] Claude Opus 5 : performances dignes de Fable, au prix d'Opus (moitié moins cher que Fable)
▶ Voir sur YouTube

Anthropic a lancé Claude Opus 5 vendredi dernier, une date de sortie inhabituelle pour l'entreprise. Selon l'Epoch Capabilities Index (ECI), Opus 5 obtient un score de 159, légèrement inférieur aux 161 de Fable 5, mais les deux modèles font jeu égal sur le SWE-ECI, l'indice dédié à l'ingénierie logicielle, avec 161 points chacun selon Epoch AI Research. Une partie de la communauté a jugé ce résultat trompeur : le compte @scaling01 a qualifié le score d'"incroyablement sous-évalué", notant qu'Opus 5 ne dépasse Opus 4.8 que d'un point sur l'ECI alors qu'il paraît nettement supérieur en usage réel. Un autre utilisateur, @jerhadf, a relevé une anomalie sur le benchmark FrontierCode : Opus 5 obtient de meilleurs résultats à effort de calcul moyen qu'à effort élevé, alors que sur les autres évaluations, davantage de calcul améliore généralement les performances. Mikhail Parakhin a salué les capacités de codage du modèle, affirmant qu'il surpassait clairement Fable en mathématiques et sur la plupart des tâches. La plateforme Nous Portal a annoncé l'intégration d'Opus 5 avec une remise de 20% sur l'ensemble de ses modèles, tandis que plusieurs utilisateurs ont mis en avant les capacités agentiques du modèle, notamment sa capacité à piloter un navigateur web de façon autonome, un utilisateur rapportant qu'Opus 5 avait résilié seul un abonnement ChatGPT Pro.

Cette sortie relance le débat sur la pertinence des benchmarks publics face aux gains réels ressentis par les utilisateurs. La communication officielle d'Anthropic reste prudente, indiquant qu'Opus 5 "se rapproche" de Fable 5 plutôt que de revendiquer une supériorité nette, ce qui traduit la difficulté à mesurer objectivement ce que les praticiens appellent le "big model smell", cette impression qualitative de robustesse et d'intelligence pratique que les scores chiffrés peinent à capturer. Le positionnement tarifaire d'Opus 5, à moitié prix de Fable pour des performances jugées comparables voire supérieures dans certains cas d'usage, en fait une option particulièrement attractive pour les équipes de développement travaillant avec des agents de codage automatisés, où le rapport coût-performance pèse lourd dans les décisions d'adoption.

Ce lancement s'inscrit dans une compétition permanente entre les grands laboratoires d'IA pour repousser les limites du codage assisté, de l'usage d'outils et du contrôle autonome d'ordinateurs. Les démonstrations d'agents capables de naviguer sur le web et d'exécuter des tâches concrètes, comme l'annulation d'un abonnement, illustrent l'orientation croissante du secteur vers des systèmes véritablement autonomes plutôt que de simples assistants conversationnels. Les prochaines semaines devraient voir affluer des évaluations communautaires plus poussées, notamment sur les plateformes de classement basées sur l'usage réel, qui permettront de trancher plus précisément le débat entre performances mesurées et performances perçues.

💬 L'analyse de Mathieu

Ce qui compte ici, c'est pas les deux points d'écart sur l'ECI, c'est le prix. Moitié moins cher que Fable pour un niveau de code quasi identique, ça pèse plus lourd dans une décision d'équipe que n'importe quel benchmark. Le signal à surveiller, ce sont pas les leaderboards mais l'usage réel des agents en prod, genre un modèle qui va résilier tout seul un abonnement concurrent : c'est là que se joue la bascule vers l'autonomie, pas dans les tableaux de scores.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Claude Opus 5 d'Anthropic coûte moins cher que Fable 5 et l'égale ou le dépasse sur la plupart des benchmarks
1The Decoder 

Claude Opus 5 d'Anthropic coûte moins cher que Fable 5 et l'égale ou le dépasse sur la plupart des benchmarks

Anthropic vient de propulser Claude Opus 5 en tête de l'Artificial Analysis Intelligence Index, avec un score de 61 points, devançant à la fois Claude Fable 5 et GPT-5.6 Sol. Le nouveau modèle se distingue particulièrement dans deux domaines clés : la qualité analytique et la génération de code, où il enregistre les meilleurs résultats du classement. Autre argument de poids, son prix : sur les niveaux de raisonnement inférieurs, Opus 5 coûte jusqu'à deux fois moins cher que Fable 5, sans sacrifier les performances. Cette combinaison de prix réduit et de résultats au sommet des benchmarks change la donne pour les développeurs et les entreprises qui choisissent leur modèle en fonction du rapport coût-efficacité. Pour les équipes qui déploient des applications à grande échelle, notamment sur des tâches de codage ou d'analyse complexe, un modèle moins onéreux mais tout aussi performant permet de réduire significativement les coûts d'infrastructure IA. Cela renforce aussi la position d'Anthropic face à ses concurrents directs, dans un marché où l'écart de prix entre modèles haut de gamme pèse de plus en plus dans les décisions d'adoption. Cette annonce s'inscrit dans une compétition serrée entre les grands laboratoires d'IA, où Anthropic, avec Fable 5, et OpenAI, avec sa gamme GPT-5.6, se disputent le sommet des classements de référence depuis plusieurs mois. L'Artificial Analysis Intelligence Index sert désormais de baromètre incontournable pour comparer objectivement les modèles sur plusieurs dimensions, du raisonnement au codage. Si l'écart entre les meilleurs modèles reste minime, la bataille se déplace de plus en plus vers l'efficacité économique, chaque acteur cherchant à proposer des performances de pointe à moindre coût, un enjeu appelé à s'intensifier avec l'arrivée de nouvelles générations de modèles.

💬 Le vrai move ici, c'est pas le classement, c'est le prix. Anthropic sort un modèle qui bat Fable 5 sur le code et l'analyse, et qui coûte jusqu'à deux fois moins cher sur les niveaux de raisonnement les plus utilisés, ça change le calcul pour toute équipe qui tourne des workloads en prod. La bataille des LLM ne se joue plus sur qui est premier au classement, mais sur qui reste rentable à grande échelle.

LLMsActu
1 source
Claude Sonnet 5, Sonnet 4.6 et Opus 4.8 : benchmarks de codage autonome, prix API et coût-performance comparés
2MarkTechPost 

Claude Sonnet 5, Sonnet 4.6 et Opus 4.8 : benchmarks de codage autonome, prix API et coût-performance comparés

Anthropic a lancé Claude Sonnet 5 le 30 juin 2026, présenté comme son modèle Sonnet le plus agentique à ce jour, capable de planifier des tâches, de piloter des navigateurs et des terminaux, et de fonctionner de façon autonome sur des missions longues. Il devient le modèle par défaut des offres Free et Pro, tandis que les utilisateurs Max, Team et Enterprise peuvent le sélectionner manuellement ; il est également disponible dans Claude Code et sur la Claude Platform. Sur les benchmarks publiés par Anthropic, Sonnet 5 dépasse son prédécesseur Sonnet 4.6 sur tous les tests : 63,2% contre 58,1% sur SWE-bench Pro (l'évaluation de codage agentique), 81,2% contre 78,5% sur OSWorld-Verified (usage d'ordinateur), et 80,4% contre 67,0% sur Terminal-Bench 2.1. Sur Humanity's Last Exam avec outils, il atteint 57,4%, un score qui talonne celui d'Opus 4.8, le modèle haut de gamme d'Anthropic, à 57,9%. Fait notable, sur le benchmark de travail de connaissance GDPval-AA v2, Sonnet 5 devance même Opus 4.8, avec 1 618 points contre 1 615. Cette montée en puissance intervient à un prix inférieur à celui du modèle phare de la firme. Anthropic propose un tarif de lancement de 2 dollars pour un million de tokens en entrée et 10 dollars en sortie, valable jusqu'au 31 août 2026, avant de passer à 3 et 15 dollars ; Opus 4.8, lui, reste à 5 et 25 dollars. Le modèle expose quatre niveaux d'effort de raisonnement (bas, moyen, élevé et extra-élevé), chaque palier supplémentaire augmentant à la fois la qualité des réponses et leur coût en tokens. Pour les développeurs, cela dessine une politique de routage claire : confier la majorité des tâches de codage agentique, d'utilisation d'outils et de travail de connaissance à Sonnet 5 aux niveaux d'effort bas ou moyen, où il offre le meilleur rapport qualité-prix, et réserver Opus 4.8 aux tâches critiques nécessitant une précision maximale, d'autant qu'à l'effort le plus élevé, Sonnet 5 peut finir par coûter plus cher qu'Opus pour une qualité comparable. Anthropic indique aussi avoir volontairement limité les capacités offensives en cybersécurité du modèle, le rendant plus sûr que Sonnet 4.6 mais moins fiable qu'Opus sur les usages où l'exactitude prime. Sonnet 5 succède à Sonnet 4.6, lancé en février 2026, et occupe la position intermédiaire de la gamme d'Anthropic, au-dessus du modèle économique Haiku 4.5 et en dessous d'Opus 4.8. Il utilise un tokenizer mis à jour, identique à celui introduit avec Opus 4.7, qui peut faire gonfler le nombre de tokens nécessaires pour un même texte d'un facteur allant jusqu'à 1,35, un détail à prendre en compte dans le calcul des coûts réels. Cette sortie illustre la stratégie d'Anthropic consistant à concentrer l'innovation sur la fiabilité agentique plutôt que sur un seul score record, dans un marché où la concurrence entre modèles se joue de plus en plus sur l'autonomie et l'efficacité économique en production, plus que sur la performance brute isolée.

LLMsOpinion
1 source
Anthropic lance Claude Opus 5, un modèle IA moins cher pour le code, les agents et les entreprises
3VentureBeat AI 

Anthropic lance Claude Opus 5, un modèle IA moins cher pour le code, les agents et les entreprises

Anthropic a lancé Claude Opus 5 vendredi, un modèle que l'entreprise présente comme délivrant presque toute l'intelligence de son modèle phare Claude Fable 5, mais à moitié prix. Disponible immédiatement sur toutes les plateformes d'Anthropic, Opus 5 est facturé 5 dollars par million de tokens en entrée et 25 dollars par million en sortie, un tarif inchangé par rapport à son prédécesseur Opus 4.8. Il devient le modèle par défaut sur Claude Max, l'offre premium grand public, et le modèle le plus puissant accessible sur Claude Pro. Sur le plan des performances, Anthropic annonce de nouveaux records sur plusieurs évaluations de codage et de travail de connaissance, dont Frontier-Bench et GDPval-AA. Sur Frontier-Bench v0.1, un benchmark de codage agentique en ligne de commande, Opus 5 obtient un score de 43,3%, plus du double des 18,7% d'Opus 4.8 et nettement devant les 33,7% de Fable 5, tout en coûtant moins cher par tâche. Sur ARC-AGI 3, qui évalue la résolution de problèmes inédits, le score serait trois fois supérieur à celui du meilleur modèle concurrent. Sur OSWorld 2.0, un test d'usage informatique autonome, Opus 5 dépasserait le meilleur résultat de Fable 5 pour un peu plus d'un tiers du coût. Anthropic reconnaît toutefois qu'Opus 5 reste derrière Mythos 5, un modèle concurrent, sur les tâches de cybersécurité et de recherche en biologie, et qu'un modèle de la famille OpenAI garde l'avantage sur un benchmark de codage agentique. Ce lancement traduit un changement de stratégie dans la course à l'IA, qui glisse de la pure performance vers l'économie de l'usage quotidien. Pour Anthropic, l'essentiel du travail professionnel se situe dans une zone intermédiaire de difficulté, où une intelligence proche de la pointe mais délivrée à moindre coût l'emporte sur une intelligence maximale mais coûteuse. L'entreprise positionne désormais sa gamme par usage: Fable 5 pour les projets autonomes de plusieurs jours, Opus 5 comme modèle de référence pour le travail complexe quotidien, Sonnet 5 pour les usages à grande échelle où le coût par appel prime, et Haiku 4.5 pour les sous-agents et réponses instantanées. Un réglage d'effort ajustable permet aussi aux entreprises d'arbitrer entre intelligence, vitesse et consommation de tokens. Cette annonce s'inscrit dans un contexte où les benchmarks classiques atteignent leurs limites, poussant les laboratoires à distinguer les tâches bornées, avec un résultat précis et mesurable, des missions longues et autonomes s'étalant sur plusieurs jours. Anthropic lui-même admet que ses évaluations ne mesurent pas la durée ni la capacité à rester cohérent sur des étapes multiples, un terrain où Fable 5 garde l'avantage. Cette frontière entre tâches ponctuelles et travail agentique prolongé pourrait devenir, en 2026, le principal axe de différenciation entre Anthropic, OpenAI et les autres acteurs du secteur.

💬 Opus 5 au même prix que son prédécesseur mais avec un score qui double sur Frontier-Bench, c'est le vrai signal : la course à l'IA ne se joue plus sur qui a le modèle le plus intelligent, mais sur qui livre le plus d'intelligence par dollar dépensé. Anthropic vient d'admettre à voix haute ce que tout le monde pressentait, l'essentiel du taf pro ne demande pas une IA au sommet absolu, juste une IA solide et pas ruineuse à faire tourner en boucle toute la journée. Reste que sur les tâches longues et autonomes, celles qui s'étalent sur plusieurs jours, Fable 5 garde la main, et c'est là que la vraie bataille de 2026 va se jouer.

LLMsActu
1 source
Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8 : benchmarks de codage à base d'agents, prix API et coût-performance
4MarkTechPost 

Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8 : benchmarks de codage à base d'agents, prix API et coût-performance

Anthropic a lancé Claude Sonnet 5 le 30 juin 2026, présenté comme son modèle Sonnet le plus agentique à ce jour, capable de planifier des tâches, de piloter des navigateurs et des terminaux, et de fonctionner de façon autonome sur des missions longues. Il devient le modèle par défaut des offres Free et Pro, reste disponible en option pour les abonnements Max, Team et Enterprise, et est déjà intégré à Claude Code ainsi qu'à la plateforme Claude. Sur le plan des performances, Sonnet 5 dépasse son prédécesseur Sonnet 4.6 sur tous les benchmarks publiés : 63,2% contre 58,1% sur SWE-bench Pro (codage agentique), 81,2% contre 78,5% sur OSWorld-Verified (usage d'ordinateur), 80,4% contre 67% sur Terminal-Bench 2.1, et 57,4% contre un score proche de celui d'Opus 4.8 (57,9%) sur Humanity's Last Exam avec outils. Il devance même Opus 4.8 sur le benchmark de travail de connaissance GDPval-AA v2, avec 1618 points contre 1615. Côté tarifs, Anthropic propose un prix de lancement à 2 dollars par million de tokens en entrée et 10 dollars en sortie jusqu'au 31 août 2026, avant de passer à 3 et 15 dollars, contre 5 et 25 dollars pour Opus 4.8. Le modèle utilise par ailleurs un nouveau tokenizer, identique à celui d'Opus 4.7, qui peut faire gonfler de 1 à 1,35 fois le nombre de tokens nécessaires pour un même texte. Cette mise à jour vise avant tout la fiabilité sur la durée plutôt qu'un seul score record : des chaînes de tâches plus longues sans perte de contexte, une meilleure autocorrection quand un appel d'outil échoue, et un comportement plus stable lors de sessions prolongées dans Claude Code ou Cowork. Pour les développeurs, l'enjeu principal se joue au niveau des quatre paliers d'effort proposés (low, medium, high, xhigh) : Sonnet 5 offre le meilleur rapport qualité-prix aux niveaux faible et moyen, mais devient parfois plus coûteux qu'Opus 4.8 pour une qualité comparable au niveau xhigh. Le modèle a aussi été rendu délibérément moins capable sur le plan cyber, ce qui le rend plus sûr mais laisse Opus comme référence pour les tâches où la précision est critique. Ce lancement s'inscrit dans la stratégie de gamme d'Anthropic, où Sonnet occupe le milieu entre le modèle économique Haiku 4.5 et le modèle phare Opus 4.8, et succède à Sonnet 4.6 sorti en février 2026. La recommandation pratique qui se dégage est une politique de routage par tâche : confier l'essentiel du codage agentique, de l'usage d'outils et du travail de connaissance à Sonnet 5, et réserver Opus 4.8 aux missions où l'exactitude prime sur le coût.

💬 Le point important ici, c'est pas le score qui écrase Sonnet 4.6 sur tous les benchmarks. C'est qu'Anthropic officialise le routage par tâche : Sonnet 5 pour l'essentiel du codage agentique et de l'usage d'outils, Opus réservé aux missions où l'erreur coûte cher. Sur le papier le rapport qualité-prix est imbattable en low et medium, mais gare au xhigh, ça peut vite revenir plus cher qu'Opus pour un résultat équivalent.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic