Aller au contenu principal
LLMs · Actu ·

Anthropic lance Claude Haiku 5.5 : un petit modèle à 1M de contexte, facturé 0,10 $ par million de tokens en entrée

Anthropic a lancé Claude Haiku 5.5, son modèle compact le moins cher et le plus rapide à ce jour, conçu pour les tâches à fort volume comme les résumés, la compaction de contexte, la classification et le travail de sous-agents. Il conserve une fenêtre de contexte d'un million de jetons et peut produire jusqu'à 128 000 jetons en sortie, avec une limite portée à 300 000 en bêta pour les traitements par lots. La tarification démarre à 0,10 dollar par million de jetons en entrée et 0,50 dollar en sortie pour les prompts de moins de 100 000 jetons, soit 90 % de moins que Haiku 4.5, facturé 1 et 5 dollars. Au-delà de ce seuil, les tarifs passent à 0,50 et 2,50 dollars. Les lectures de cache coûtent 0,01 dollar et les écritures de cache de 5 minutes 0,125 dollar. Le modèle est disponible sur l'API Claude, Amazon Bedrock, Google Cloud, Microsoft Foundry et Claude Platform sur AWS. C'est le premier Haiku doté d'un réglage d'effort, réglé par défaut sur « medium », avec réflexion adaptative activée. Il accepte texte et images, produit du texte, et sa connaissance s'arrête en juin 2026. Selon les chiffres publiés par Anthropic, il atteint 72,4 % sur OSWorld 2.1 (sous-ensemble hors ligne), contre 48,9 % pour GPT-6 Luna et 15,7 % pour Haiku 4.5, et 39,2 % sur Terminal-Bench 4.0, contre 16,4 % pour Luna. Il obtient aussi 46,4 % sur FrontierCode 1.1, 45,9 % à Humanity's Last Exam sans outils (57,4 % avec) et 1620 sur GDPval-AA v2.1.

3 min de lecturePertinence 55

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Pour les entreprises qui traitent de gros volumes, la baisse de prix change l'équation économique. Anthropic indique qu'environ 90 % des requêtes adressées à Haiku 4.5 restaient sous 100 000 jetons, et estime que Haiku 5.5 coûte en moyenne 75 % de moins une fois corrigé l'effet du nouveau tokenizer, qui compte environ 30 % de jetons en plus pour un même texte. Le traitement par lots offre encore 50 % de remise. Trois usages sont mis en avant : les sous-agents travaillant sous Opus 5.5 ou Sonnet 5.5, comme chez Rogo où Haiku extrait une ligne de chiffre d'affaires d'un 10-K pendant qu'un modèle plus puissant construit la présentation ; les questions-réponses et résumés de documents à grande échelle, testés par AlphaSense sur une fonction traitant environ 8 millions d'appels par semaine ; et les tâches sensibles à la latence, comme le support client en direct ou l'usage d'un navigateur. Les développeurs doivent toutefois anticiper des changements : toute valeur non par défaut de température, topp ou topk renvoie une erreur 400, et le guide de migration détaille ces points. Anthropic recommande d'ailleurs Sonnet 5.5, qui obtient 70,6 % sur Terminal-Bench 4.0, et Opus 5.5 pour le code agentique complexe.

Cette sortie s'inscrit dans une guerre des prix sur les petits modèles. GPT-6 Luna d'OpenAI affiche les mêmes tarifs de base, 0,10 et 0,50 dollar, mais son palier supérieur ne s'applique qu'au-delà de 272 000 jetons, à 0,20 et 0,75 dollar : pour un prompt de 150 000 jetons, Luna reste donc moins cher au tarif catalogue. Gemini 3.5 Flash-Lite de Google se positionne à 0,30 et 2,50 dollars avec un tarif unique, mais accepte aussi la vidéo, l'audio et les PDF, avec une sortie limitée à 65 536 jetons. Les trois acteurs offrent désormais contexte d'environ un million de jetons, contrôle du raisonnement et remise de 50 % en traitement par lots. Anthropic mise sur des architectures où un grand modèle orchestre des modèles légers, ce qui fait de Haiku 5.5 une brique d'infrastructure autant qu'un produit. La suite dépendra de la réaction d'OpenAI et de Google sur les prix, ainsi que de la validation indépendante de résultats qui, pour l'instant, proviennent uniquement d'Anthropic.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Pokee AI lance Pokee-Isaac 28B, un modèle à agents avec un contexte de 10 millions de tokens conçu pour tourner chez le client44MarkTechPostLLMs 02Qwen lance Qwen3.7-Max : un modèle agent de raisonnement avec une fenêtre de contexte d'un million de tokens42MarkTechPostLLMs 03Anthropic lance Claude Opus 5, un modèle IA moins cher pour le code, les agents et les entreprises48VentureBeat AILLMs 
Dossier · AnthropicSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.