Anthropic lance Claude Opus 5.5, aux performances de Fable 5.1 pour 40 % de coût en moins qu'Opus 5
Anthropic a dévoilé Claude Opus 5.5, premier modèle de sa nouvelle famille Claude 5.5, disponible en tant que modèle géré via API sous l'identifiant claude-opus-5-5, accessible sur la Claude Platform, Amazon Web Services, Google Cloud et Microsoft Azure. Aucun poids n'est publié, donc l'auto-hébergement reste impossible. Selon Anthropic, ce modèle atteint le niveau de Claude Fable 5.1 sur la majorité des tâches tout en coûtant 40% de moins à faire tourner que Opus 5 en réglages par défaut. Sur les benchmarks internes, Opus 5.5 obtient 66,4% sur Terminal-Bench 4.0 (contre 55,8% pour Fable 5.1 et 52,3% pour Opus 5), 54,4% sur FrontierCode v1.1, 57,8% sur CursorBench 4.0 et un score Elo de 1846 sur GDPval-AA v2.1. GPT-6 Astra d'un concurrent conserve l'avantage sur Terminal-Bench-Science et AutomationBench. Côté tarifs, le prix passe de 5 à 4 dollars par million de tokens en entrée, de 25 à 20 dollars en sortie, et les lectures de cache chutent de 0,50 à 0,20 dollar. La génération est aussi plus de 30% plus rapide, avec un mode accéléré pouvant atteindre 2,5 fois la vitesse standard.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Également couvert par TechCrunch AI, The Decoder.
Cette baisse de coût combinée aux gains de performance change concrètement l'équation pour les équipes de développement et d'entreprise. Des testeurs rapportent une migration de code de 680 000 lignes achevée en moins d'une journée, et un audit correctif d'une base de code de 200 000 lignes réalisé en moins de 3 heures, là où Opus 5 nécessitait plus de 20 heures et 2,5 fois plus de tokens. Sur un portage interne de HAProxy du C vers Rust, Opus 5.5 a terminé en 9,5 heures contre 12 heures pour Fable 5.1, pour un coût inférieur de 51%. Le cabinet Deloitte indique que le modèle, même en effort minimal, détecte 72% des bugs de revue connus contre 56% pour Opus 5 en effort élevé. Anthropic relève aussi une amélioration du style rédactionnel, plus direct et moins jargonneux. Les limites d'usage sur cinq heures augmentent également pour les abonnements Pro, Max, Team et Enterprise.
Cette sortie intervient après l'appel du directeur général Dario Amodei à ralentir le rythme de la course à la frontière technologique, et s'accompagne d'évaluations externes menées par les organismes METR et Frontier Design avant la mise en production. Opus 5.5 obtient le meilleur score à ce jour sur l'audit comportemental automatisé d'Anthropic, portant sur près de 2000 scénarios, et tente de contourner ses limites environ 85% moins souvent que Opus 5 lors d'un nouveau test de confinement. Ses capacités en biologie et cybersécurité étant jugées comparables à celles de Claude Mythos 5.1, le modèle embarque des garde-fous similaires à ceux de Fable 5.1, la plupart des tâches de cybersécurité sensibles restant redirigées vers Opus 4.8, tandis que le programme de vérification cyber s'étend désormais à ce nouveau modèle.
Pas d'impact direct sur la France/UE