Aller au contenu principal
LLMsLatent Space · 2 min de lecture

[AINews] Claude Opus 5 : performances dignes de Fable, au prix d'Opus (moitié moins cher que Fable)

Résumé IASources croisées · 3Impact UE
Source originale ↗·
Egalement couvert par :The DecoderZDNET AI
[AINews] Claude Opus 5 : performances dignes de Fable, au prix d'Opus (moitié moins cher que Fable)
▶ Voir sur YouTube

Anthropic a lancé Claude Opus 5 vendredi dernier, une date de sortie inhabituelle pour l'entreprise. Selon l'Epoch Capabilities Index (ECI), Opus 5 obtient un score de 159, légèrement inférieur aux 161 de Fable 5, mais les deux modèles font jeu égal sur le SWE-ECI, l'indice dédié à l'ingénierie logicielle, avec 161 points chacun selon Epoch AI Research. Une partie de la communauté a jugé ce résultat trompeur : le compte @scaling01 a qualifié le score d'"incroyablement sous-évalué", notant qu'Opus 5 ne dépasse Opus 4.8 que d'un point sur l'ECI alors qu'il paraît nettement supérieur en usage réel. Un autre utilisateur, @jerhadf, a relevé une anomalie sur le benchmark FrontierCode : Opus 5 obtient de meilleurs résultats à effort de calcul moyen qu'à effort élevé, alors que sur les autres évaluations, davantage de calcul améliore généralement les performances. Mikhail Parakhin a salué les capacités de codage du modèle, affirmant qu'il surpassait clairement Fable en mathématiques et sur la plupart des tâches. La plateforme Nous Portal a annoncé l'intégration d'Opus 5 avec une remise de 20% sur l'ensemble de ses modèles, tandis que plusieurs utilisateurs ont mis en avant les capacités agentiques du modèle, notamment sa capacité à piloter un navigateur web de façon autonome, un utilisateur rapportant qu'Opus 5 avait résilié seul un abonnement ChatGPT Pro.

Cette sortie relance le débat sur la pertinence des benchmarks publics face aux gains réels ressentis par les utilisateurs. La communication officielle d'Anthropic reste prudente, indiquant qu'Opus 5 "se rapproche" de Fable 5 plutôt que de revendiquer une supériorité nette, ce qui traduit la difficulté à mesurer objectivement ce que les praticiens appellent le "big model smell", cette impression qualitative de robustesse et d'intelligence pratique que les scores chiffrés peinent à capturer. Le positionnement tarifaire d'Opus 5, à moitié prix de Fable pour des performances jugées comparables voire supérieures dans certains cas d'usage, en fait une option particulièrement attractive pour les équipes de développement travaillant avec des agents de codage automatisés, où le rapport coût-performance pèse lourd dans les décisions d'adoption.

Ce lancement s'inscrit dans une compétition permanente entre les grands laboratoires d'IA pour repousser les limites du codage assisté, de l'usage d'outils et du contrôle autonome d'ordinateurs. Les démonstrations d'agents capables de naviguer sur le web et d'exécuter des tâches concrètes, comme l'annulation d'un abonnement, illustrent l'orientation croissante du secteur vers des systèmes véritablement autonomes plutôt que de simples assistants conversationnels. Les prochaines semaines devraient voir affluer des évaluations communautaires plus poussées, notamment sur les plateformes de classement basées sur l'usage réel, qui permettront de trancher plus précisément le débat entre performances mesurées et performances perçues.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Claude Sonnet 5, Sonnet 4.6 et Opus 4.8 : benchmarks de codage autonome, prix API et coût-performance comparés
1MarkTechPost 

Claude Sonnet 5, Sonnet 4.6 et Opus 4.8 : benchmarks de codage autonome, prix API et coût-performance comparés

Anthropic a lancé Claude Sonnet 5 le 30 juin 2026, présenté comme son modèle Sonnet le plus agentique à ce jour, capable de planifier des tâches, de piloter des navigateurs et des terminaux, et de fonctionner de façon autonome sur des missions longues. Il devient le modèle par défaut des offres Free et Pro, tandis que les utilisateurs Max, Team et Enterprise peuvent le sélectionner manuellement ; il est également disponible dans Claude Code et sur la Claude Platform. Sur les benchmarks publiés par Anthropic, Sonnet 5 dépasse son prédécesseur Sonnet 4.6 sur tous les tests : 63,2% contre 58,1% sur SWE-bench Pro (l'évaluation de codage agentique), 81,2% contre 78,5% sur OSWorld-Verified (usage d'ordinateur), et 80,4% contre 67,0% sur Terminal-Bench 2.1. Sur Humanity's Last Exam avec outils, il atteint 57,4%, un score qui talonne celui d'Opus 4.8, le modèle haut de gamme d'Anthropic, à 57,9%. Fait notable, sur le benchmark de travail de connaissance GDPval-AA v2, Sonnet 5 devance même Opus 4.8, avec 1 618 points contre 1 615. Cette montée en puissance intervient à un prix inférieur à celui du modèle phare de la firme. Anthropic propose un tarif de lancement de 2 dollars pour un million de tokens en entrée et 10 dollars en sortie, valable jusqu'au 31 août 2026, avant de passer à 3 et 15 dollars ; Opus 4.8, lui, reste à 5 et 25 dollars. Le modèle expose quatre niveaux d'effort de raisonnement (bas, moyen, élevé et extra-élevé), chaque palier supplémentaire augmentant à la fois la qualité des réponses et leur coût en tokens. Pour les développeurs, cela dessine une politique de routage claire : confier la majorité des tâches de codage agentique, d'utilisation d'outils et de travail de connaissance à Sonnet 5 aux niveaux d'effort bas ou moyen, où il offre le meilleur rapport qualité-prix, et réserver Opus 4.8 aux tâches critiques nécessitant une précision maximale, d'autant qu'à l'effort le plus élevé, Sonnet 5 peut finir par coûter plus cher qu'Opus pour une qualité comparable. Anthropic indique aussi avoir volontairement limité les capacités offensives en cybersécurité du modèle, le rendant plus sûr que Sonnet 4.6 mais moins fiable qu'Opus sur les usages où l'exactitude prime. Sonnet 5 succède à Sonnet 4.6, lancé en février 2026, et occupe la position intermédiaire de la gamme d'Anthropic, au-dessus du modèle économique Haiku 4.5 et en dessous d'Opus 4.8. Il utilise un tokenizer mis à jour, identique à celui introduit avec Opus 4.7, qui peut faire gonfler le nombre de tokens nécessaires pour un même texte d'un facteur allant jusqu'à 1,35, un détail à prendre en compte dans le calcul des coûts réels. Cette sortie illustre la stratégie d'Anthropic consistant à concentrer l'innovation sur la fiabilité agentique plutôt que sur un seul score record, dans un marché où la concurrence entre modèles se joue de plus en plus sur l'autonomie et l'efficacité économique en production, plus que sur la performance brute isolée.

LLMsOpinion
1 source
2VentureBeat AI 

Anthropic lance Claude Opus 5, un modèle IA moins cher pour le code, les agents et les entreprises

Anthropic a lancé Claude Opus 5 vendredi, un modèle que l'entreprise présente comme délivrant presque toute l'intelligence de son modèle phare Claude Fable 5, mais à moitié prix. Disponible immédiatement sur toutes les plateformes d'Anthropic, Opus 5 est facturé 5 dollars par million de tokens en entrée et 25 dollars par million en sortie, un tarif inchangé par rapport à son prédécesseur Opus 4.8. Il devient le modèle par défaut sur Claude Max, l'offre premium grand public, et le modèle le plus puissant accessible sur Claude Pro. Sur le plan des performances, Anthropic annonce de nouveaux records sur plusieurs évaluations de codage et de travail de connaissance, dont Frontier-Bench et GDPval-AA. Sur Frontier-Bench v0.1, un benchmark de codage agentique en ligne de commande, Opus 5 obtient un score de 43,3%, plus du double des 18,7% d'Opus 4.8 et nettement devant les 33,7% de Fable 5, tout en coûtant moins cher par tâche. Sur ARC-AGI 3, qui évalue la résolution de problèmes inédits, le score serait trois fois supérieur à celui du meilleur modèle concurrent. Sur OSWorld 2.0, un test d'usage informatique autonome, Opus 5 dépasserait le meilleur résultat de Fable 5 pour un peu plus d'un tiers du coût. Anthropic reconnaît toutefois qu'Opus 5 reste derrière Mythos 5, un modèle concurrent, sur les tâches de cybersécurité et de recherche en biologie, et qu'un modèle de la famille OpenAI garde l'avantage sur un benchmark de codage agentique. Ce lancement traduit un changement de stratégie dans la course à l'IA, qui glisse de la pure performance vers l'économie de l'usage quotidien. Pour Anthropic, l'essentiel du travail professionnel se situe dans une zone intermédiaire de difficulté, où une intelligence proche de la pointe mais délivrée à moindre coût l'emporte sur une intelligence maximale mais coûteuse. L'entreprise positionne désormais sa gamme par usage: Fable 5 pour les projets autonomes de plusieurs jours, Opus 5 comme modèle de référence pour le travail complexe quotidien, Sonnet 5 pour les usages à grande échelle où le coût par appel prime, et Haiku 4.5 pour les sous-agents et réponses instantanées. Un réglage d'effort ajustable permet aussi aux entreprises d'arbitrer entre intelligence, vitesse et consommation de tokens. Cette annonce s'inscrit dans un contexte où les benchmarks classiques atteignent leurs limites, poussant les laboratoires à distinguer les tâches bornées, avec un résultat précis et mesurable, des missions longues et autonomes s'étalant sur plusieurs jours. Anthropic lui-même admet que ses évaluations ne mesurent pas la durée ni la capacité à rester cohérent sur des étapes multiples, un terrain où Fable 5 garde l'avantage. Cette frontière entre tâches ponctuelles et travail agentique prolongé pourrait devenir, en 2026, le principal axe de différenciation entre Anthropic, OpenAI et les autres acteurs du secteur.

💬 Opus 5 au même prix que son prédécesseur mais avec un score qui double sur Frontier-Bench, c'est le vrai signal : la course à l'IA ne se joue plus sur qui a le modèle le plus intelligent, mais sur qui livre le plus d'intelligence par dollar dépensé. Anthropic vient d'admettre à voix haute ce que tout le monde pressentait, l'essentiel du taf pro ne demande pas une IA au sommet absolu, juste une IA solide et pas ruineuse à faire tourner en boucle toute la journée. Reste que sur les tâches longues et autonomes, celles qui s'étalent sur plusieurs jours, Fable 5 garde la main, et c'est là que la vraie bataille de 2026 va se jouer.

LLMsActu
1 source
Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8 : benchmarks de codage à base d'agents, prix API et coût-performance
3MarkTechPost 

Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8 : benchmarks de codage à base d'agents, prix API et coût-performance

Anthropic a lancé Claude Sonnet 5 le 30 juin 2026, présenté comme son modèle Sonnet le plus agentique à ce jour, capable de planifier des tâches, de piloter des navigateurs et des terminaux, et de fonctionner de façon autonome sur des missions longues. Il devient le modèle par défaut des offres Free et Pro, reste disponible en option pour les abonnements Max, Team et Enterprise, et est déjà intégré à Claude Code ainsi qu'à la plateforme Claude. Sur le plan des performances, Sonnet 5 dépasse son prédécesseur Sonnet 4.6 sur tous les benchmarks publiés : 63,2% contre 58,1% sur SWE-bench Pro (codage agentique), 81,2% contre 78,5% sur OSWorld-Verified (usage d'ordinateur), 80,4% contre 67% sur Terminal-Bench 2.1, et 57,4% contre un score proche de celui d'Opus 4.8 (57,9%) sur Humanity's Last Exam avec outils. Il devance même Opus 4.8 sur le benchmark de travail de connaissance GDPval-AA v2, avec 1618 points contre 1615. Côté tarifs, Anthropic propose un prix de lancement à 2 dollars par million de tokens en entrée et 10 dollars en sortie jusqu'au 31 août 2026, avant de passer à 3 et 15 dollars, contre 5 et 25 dollars pour Opus 4.8. Le modèle utilise par ailleurs un nouveau tokenizer, identique à celui d'Opus 4.7, qui peut faire gonfler de 1 à 1,35 fois le nombre de tokens nécessaires pour un même texte. Cette mise à jour vise avant tout la fiabilité sur la durée plutôt qu'un seul score record : des chaînes de tâches plus longues sans perte de contexte, une meilleure autocorrection quand un appel d'outil échoue, et un comportement plus stable lors de sessions prolongées dans Claude Code ou Cowork. Pour les développeurs, l'enjeu principal se joue au niveau des quatre paliers d'effort proposés (low, medium, high, xhigh) : Sonnet 5 offre le meilleur rapport qualité-prix aux niveaux faible et moyen, mais devient parfois plus coûteux qu'Opus 4.8 pour une qualité comparable au niveau xhigh. Le modèle a aussi été rendu délibérément moins capable sur le plan cyber, ce qui le rend plus sûr mais laisse Opus comme référence pour les tâches où la précision est critique. Ce lancement s'inscrit dans la stratégie de gamme d'Anthropic, où Sonnet occupe le milieu entre le modèle économique Haiku 4.5 et le modèle phare Opus 4.8, et succède à Sonnet 4.6 sorti en février 2026. La recommandation pratique qui se dégage est une politique de routage par tâche : confier l'essentiel du codage agentique, de l'usage d'outils et du travail de connaissance à Sonnet 5, et réserver Opus 4.8 aux missions où l'exactitude prime sur le coût.

💬 Le point important ici, c'est pas le score qui écrase Sonnet 4.6 sur tous les benchmarks. C'est qu'Anthropic officialise le routage par tâche : Sonnet 5 pour l'essentiel du codage agentique et de l'usage d'outils, Opus réservé aux missions où l'erreur coûte cher. Sur le papier le rapport qualité-prix est imbattable en low et medium, mais gare au xhigh, ça peut vite revenir plus cher qu'Opus pour un résultat équivalent.

LLMsOpinion
1 source
Claude Opus 4.8 d'Anthropic disponible : mode rapide 3 fois moins cher et alignement proche de Mythos
4VentureBeat AI 

Claude Opus 4.8 d'Anthropic disponible : mode rapide 3 fois moins cher et alignement proche de Mythos

Anthropic a lancé le 28 mai 2026 Claude Opus 4.8, une mise à jour de son modèle phare, disponible immédiatement sur claude.ai, Claude Code, l'API et Cowork. La tarification standard reste inchangée par rapport à Opus 4.7 : 5 dollars par million de tokens en entrée et 25 dollars par million de tokens en sortie. La grande nouveauté est le mode rapide ("fast mode"), qui génère les tokens à environ 2,5 fois la vitesse normale et voit son prix chuter à 10 dollars par million de tokens en entrée et 50 dollars en sortie, soit une réduction de trois fois par rapport aux 30/150 dollars du mode rapide d'Opus 4.7. Sur les benchmarks, les progrès sont réels mais modestes : 88,6 % sur SWE-bench Verified (contre 87,6 % pour Opus 4.7), 69,2 % sur SWE-bench Pro (contre 64,3 %) et 74,6 % sur Terminal-Bench 2.1 (contre 66,1 %). Opus 4.8 surpasse également GPT-5.5 d'OpenAI sur au moins 12 benchmarks, notamment en raisonnement, en codage et en utilisation d'outils agentiques. Cette baisse tarifaire sur le mode rapide est significative pour l'industrie : elle rend l'inférence à haut débit accessible aux applications de production sensibles à la latence, un segment jusqu'ici réservé aux modèles moins puissants. Databricks a rapporté une réduction de 61 % du coût en tokens par rapport à Opus 4.7, grâce à une meilleure efficacité multimodale sur les PDF et diagrammes. La startup Cognition, éditrice de Devin, confirme que le modèle corrige des problèmes de verbosité et d'appels d'outils présents dans Opus 4.7. Un fournisseur spécialisé en computer-use a atteint 84 % sur le benchmark Online-Mind2Web, dépassant à la fois Opus 4.7 et GPT-5.5. Anthropic introduit également en préversion les "dynamic workflows" dans Claude Code, permettant de lancer des centaines de sous-agents en parallèle pour des tâches dépassant la capacité d'une seule fenêtre de contexte. Opus 4.8 s'inscrit dans une trajectoire d'accélération chez Anthropic, qui positionne ce modèle entre Opus 4.7 et Claude Mythos Preview, un modèle plus puissant actuellement limité à un petit nombre d'organisations dans le cadre du Project Glasswing, dédié à la cybersécurité. Anthropic a annoncé vouloir mettre des "modèles de classe Mythos" à la disposition de l'ensemble de ses clients dans les prochaines semaines, une fois des garde-fous cyber supplémentaires en place. La course au sommet se joue désormais sur plusieurs fronts simultanément : la puissance brute, le coût d'inférence et les capacités agentiques, trois axes où OpenAI, Google et les acteurs chinois comme DeepSeek ou Alibaba exercent une pression croissante sur Anthropic.

UELa réduction tarifaire du mode rapide (3x moins cher) rend l'inférence haute performance directement accessible aux développeurs et entreprises européens qui déploient des LLMs en production.

💬 Le vrai truc, c'est pas les benchmarks (modestes, clairement), c'est le fast mode à 10 dollars le million de tokens, trois fois moins cher qu'Opus 4.7 : ça rend enfin l'inférence haute vitesse viable en prod sans sacrifier un modèle plus faible. Les dynamic workflows dans Claude Code, des centaines de sous-agents en parallèle, c'est le genre de truc qu'on attendait depuis 2 ans. Et Mythos pour tout le monde dans les semaines qui viennent, bon, sur le papier c'est prometteur.

LLMsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic