Anthropic lance Claude Sonnet 5.5 : 70,6 % sur Terminal-Bench 4.0, au même prix de 2 $/10 $
Anthropic a lancé Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5 après Opus 5.5. Il est disponible sous l'identifiant claude-sonnet-5-5 sur la Claude Platform, ainsi que sur AWS, Google Cloud et Microsoft Azure. Ses poids restent fermés. Par rapport à Sonnet 5, Anthropic revendique une génération de sortie plus de 30 % plus rapide, un coût par tâche jusqu'à 30 % inférieur grâce à moins de jetons et d'appels d'outils, une prose plus claire et de meilleures capacités visuelles : c'est le premier Sonnet à terminer Pokémon Rouge à partir de simples captures d'écran. Il offre un contexte d'un million de jetons, 128 000 jetons de sortie maximum, une coupure de connaissances fiable en juin 2026 et cinq niveaux d'effort (de low à max). Les scores, publiés par Anthropic, affichent 70,6 % sur Terminal-Bench 4.0 (contre 10,3 % pour Sonnet 5 et 66,4 % pour Opus 5.5 en xhigh), 55,5 % sur CursorBench 4.0 (Opus 5.5 : 57,8 %), 80,1 % sur OSWorld 2.1 (Opus 5.5 : 81,8 %) et 64,5 % à Humanity's Last Exam avec outils, contre 54,9 % auparavant. Sur GDPval-AA v2.1, il obtient 1844 points, contre 1846 pour Opus 5.5.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Le tarif ne change pas : 2 dollars par million de jetons en entrée et 10 dollars en sortie, soit la moitié du prix d'Opus 5.5 (4 et 20 dollars). Les lectures de cache coûtent 0,20 dollar et les écritures 2,50 dollars par million. L'économie réelle vient donc de l'efficacité en jetons plutôt que d'une baisse de prix. Balyasny Asset Management mesure environ 121 000 jetons par réponse, contre 497 000 avec Sonnet 5. Base44 a besoin de 3,6 itérations par application, là où Opus 5 en demandait 7,7, et Zendesk traite ses tickets 20 % plus vite. Pour les développeurs, le modèle vise les tâches bien délimitées du quotidien, la correction de bugs et la production de documents, présentations et tableurs soignés. Anthropic reconnaît toutefois qu'Opus 5.5 reste nettement supérieur sur le travail complexe et ouvert.
Le modèle arrive face à une concurrence serrée. Sur FrontierCode 1.1, Sonnet 5.5 atteint 52,1 % en xhigh, devant GPT-6 Sol d'OpenAI (49,3 %) mais derrière Opus 5.5 (54,4 %). Sur GDPval-AA, il dépasse largement GPT-6 Sol (1487). GPT-6 Sol est facturé au même tarif de 2 et 10 dollars pour les requêtes jusqu'à 272 000 jetons, tandis que Gemini 3.1 Pro Preview de Google coûte 2 et 12 dollars jusqu'à 200 000 jetons. Un détail éclaire ces mesures : à l'effort max, le score FrontierCode retombe à 46,2 %, car le modèle lance plus souvent des revues de code multi-agents, ce qui provoque des délais dépassés ou des modifications hors périmètre, pénalisées par le test. Les niveaux d'effort par défaut varient selon l'interface : medium dans Claude Code et les applications Claude, high sur la Claude Platform. Tous les résultats sont fournis par Anthropic, à l'exception de GDPval-AA, exécuté par Artificial Analysis, et la méthodologie figure dans la fiche système du modèle.
Le modèle est disponible via AWS, Google Cloud et Microsoft Azure, ce qui le rend accessible aux développeurs et entreprises français et européens au même tarif que dans le reste du monde.