
Claude Opus 5 arrive : codage à base d'agents de pointe et utilisation d'ordinateur, au même prix
Anthropic a annoncé le lancement de Claude Opus 5, qui remplace Claude Opus 4.8 au sommet de sa gamme. Les tarifs restent inchangés, à 5 dollars par million de tokens en entrée et 25 dollars par million en sortie, l'entreprise affirmant que ce nouveau modèle approche l'intelligence de Claude Fable 5 pour moitié moins cher. Opus 5 devient le modèle par défaut sur Claude Max et le plus performant disponible sur Claude Pro. Plusieurs changements techniques accompagnent ce lancement : le raisonnement approfondi ("thinking") est désormais activé par défaut, alors qu'il fallait auparavant l'activer manuellement, et la profondeur se règle via un paramètre d'effort. Une modification cassante mérite attention : désactiver le raisonnement tout en demandant un effort élevé ou maximal renvoie désormais une erreur. La fenêtre de contexte atteint 1 million de tokens, la sortie maximale grimpe à 128 000 tokens sur l'API standard et jusqu'à 300 000 en traitement par lots, et le seuil minimal pour la mise en cache des prompts descend à 512 tokens.
Sur le plan des performances, les gains sont particulièrement nets pour les tâches agentiques et le code. Sur FrontierBench, Opus 5 obtient 43,3%, plus du double du score d'Opus 4.8 (18,7%) et devant Fable 5 (33,7%) et GPT-5.6 Sol (37,5%). Il atteint 96% sur SWE-bench Verified et bondit à 59,4% sur la variante multimodale, contre 38,4% pour la génération précédente. Sur OSWorld 2.0, qui évalue l'usage d'ordinateurs par un agent, le score passe de 55,7% à plus de 70%. Fait notable, les classificateurs de sécurité d'Opus 5 ne bloquent que 5% des appels API contre 42% pour Fable 5, signe d'une meilleure calibration entre prudence et efficacité. Le modèle a aussi résolu les six problèmes de l'Olympiade internationale de mathématiques 2026, avec un score parfait validé à la fois par un panel de juges et par des experts humains, soit un niveau de médaille d'or.
Ces résultats s'inscrivent dans une course serrée entre Anthropic, OpenAI avec GPT-5.6 Sol, et les autres modèles de la gamme Claude comme Fable 5 et Mythos 5. Un enseignement transversal ressort des tests multimodaux : donner au modèle des outils, comme le recadrage d'image, améliore davantage les résultats que d'augmenter simplement l'effort de raisonnement. Autre point à surveiller, les capacités offensives en cybersécurité progressent mécaniquement avec la montée en compétence générale du modèle, alors même qu'Anthropic n'a pas entraîné Opus 5 spécifiquement sur ces tâches, ce qui relance les questions sur l'encadrement des usages malveillants potentiels à mesure que ces systèmes deviennent plus capables.
Anthropic arrête de traiter chaque appel API comme suspect par défaut, le taux de blocage des classificateurs de sécurité tombe de 42% à 5% entre Fable 5 et Opus 5, et ça va changer plus de choses en prod que n'importe quel benchmark de code. Le score qui double sur FrontierBench, c'est flatteur sur le papier, mais c'est cette histoire de calibration qui me parle vraiment pour qui bosse avec l'API tous les jours. Prix identique, contexte à un million de tokens, bon sur le papier c'est du solide, reste à voir si les agents tiennent la route sans exploser le budget en tokens de sortie.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.



