Aller au contenu principal
LLMsLatent Space · 2 min de lecture

« GPT 5.6 fait baisser les prix de 20 à 80 % : le coût de l'intelligence de GPT 5.4 a chuté de 13x en 4 mois »

Source originale ↗·

GPT-5.6 d'OpenAI a permis une baisse de prix spectaculaire, comprise entre 20% et 80% selon les modèles, révélée cette semaine dans une note technique publiée par l'entreprise. Le modèle a été utilisé pour optimiser sa propre infrastructure de service : rebaptisé Sol dans ce rôle, GPT-5.6 a analysé le trafic de production, ajusté la répartition de charge et réécrit de façon autonome des noyaux de calcul en Triton et Gluon, les langages internes d'OpenAI, ce qui a réduit les coûts de service de bout en bout de 20%. L'entreprise a aussi amélioré le décodage spéculatif en perfectionnant son modèle brouillon via des centaines d'expériences pilotées automatiquement, gagnant plus de 15% en efficacité de génération de tokens, et optimisé la gestion du cache KV pour les charges de travail spécifiques à des outils comme Codex. Côté harnais agentique, la couche d'orchestration en Rust a été revue pour limiter la découverte d'outils au strict nécessaire et plafonner les sorties d'outils à 10 000 tokens, tandis que l'historique visible par le modèle est désormais traité comme strictement additif afin de maximiser la réutilisation du cache de prompts. Résultat concret : le modèle Luna voit son prix chuter de 80%, Terra de 20%, et un nouveau mode Sol Fast offre une latence 2,5 fois plus faible pour le double du prix standard.

L'observation la plus frappante vient d'une comparaison de performance : GPT-5.4 en version complète, en mode de raisonnement maximal, obtenait un score de 51 sur un benchmark donné en mars, un score aujourd'hui atteint par Luna, une version bien moins chère du nouveau modèle. Or GPT-5.4 coûtait 2,50 dollars par million de tokens en entrée et 15 dollars en sortie, contre 0,20 et 1,20 dollar pour Luna aujourd'hui, soit un coût treize fois inférieur pour un niveau d'intelligence équivalent en seulement quatre mois, un rythme annualisé proche de 2000x. Cette baisse dépasse même l'accélération déjà spectaculaire notée un an plus tôt, quand une analyse largement reprise, y compris par le dirigeant de Google DeepMind Demis Hassabis, montrait qu'un niveau d'intelligence équivalent à GPT-4 avait vu son coût divisé par 1000 en dix-huit mois.

Cette dynamique confirme que la baisse des coûts à intelligence constante n'était pas un simple effet de rattrapage lié au passage des modèles denses aux architectures mixtes ou du texte brut au raisonnement, comme certains le pensaient il y a un an. Sur le seul critère du coût d'une intelligence non spécialisée, sans besoin de fine-tuning, OpenAI distance désormais des modèles ouverts comme DeepSeek, GLM ou MiniMax ainsi que des modèles économiques concurrents comme Gemini Flash-Lite, même si des modèles ouverts comme Laguna de Poolside ou Inkling de Thinky Labs conservent l'avantage pour les organisations qui exigent un contrôle total et la souveraineté sur leurs modèles.

Impact France/UE

Les entreprises européennes utilisant l'API OpenAI bénéficient indirectement de cette baisse des coûts, sans impact réglementaire ou structurel direct sur le marché français ou européen.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1VentureBeat AI 

OpenAI baisse de 80% les prix de GPT-5.6 Luna, la concurrence se déplace désormais sur les coûts

OpenAI a annoncé une baisse spectaculaire des prix de deux modèles de sa gamme GPT-5.6 : GPT-5.6 Luna, le plus petit et le plus rapide de la série, voit son tarif chuter de 80%, tandis que GPT-5.6 Terra, le modèle intermédiaire, baisse de 20%. Luna passe désormais à 0,20 dollar par million de tokens en entrée et 1,20 dollar en sortie, soit un total combiné de 1,40 dollar par million de tokens, contre 7 dollars auparavant (1 dollar en entrée, 6 dollars en sortie). Terra coûte maintenant 2 dollars en entrée et 12 dollars en sortie, pour un total de 14 dollars. Le prix de GPT-5.6 Sol en mode Standard reste inchangé à 35 dollars au total, mais OpenAI introduit un nouveau mode Fast, facturé deux fois plus cher (10 dollars en entrée, 60 dollars en sortie, soit 70 dollars au total), qui promet jusqu'à 2,5 fois plus de débit sans changer l'intelligence sous-jacente du modèle. Sam Altman, cofondateur et PDG d'OpenAI, a annoncé ces changements sur X en évoquant de "importantes baisses de prix". Cette annonce intervient seulement quelques jours après le lancement de Claude Opus 5 par Anthropic, au même prix que son prédécesseur Opus 4.8, et après l'introduction par Google de Gemini 3.6 Flash et Gemini 3.5 Flash-Lite, deux modèles pensés pour réduire les coûts d'inférence et accélérer l'exécution des tâches agentiques. Avec cette révision tarifaire, OpenAI positionne Luna sous Gemini 3.5 Flash-Lite (2,80 dollars au total) et très loin sous Gemini 3.6 Flash (9 dollars), tout en cherchant à séduire les utilisateurs d'Anthropic grâce à la vitesse plutôt qu'au prix. La stratégie illustre une bascule nette de la compétition entre grands modèles de langage : after des mois centrés sur les capacités brutes, la bataille se joue désormais sur le rapport performance-coût, un critère décisif pour les entreprises qui déploient ces modèles à grande échelle dans des applications agentiques ou des volumes massifs de requêtes. Ce mouvement s'inscrit dans une guerre des prix plus large qui agite tout le secteur. Le marché reste dominé par des acteurs encore moins chers : le MiMo-V2.5 Flash de Xiaomi (0,40 dollar au total) et le DeepSeek-V4-Flash (0,42 dollar) restent sous la barre du dollar par million de tokens, loin devant Luna. Les modèles chinois, notamment ceux de Xiaomi, DeepSeek, Alibaba et MiniMax, tirent les prix vers le bas sur l'ensemble du marché, forçant les géants américains à réagir. À l'autre extrémité du spectre, les modèles les plus puissants comme GPT-5.6 Sol en mode Fast, Claude Fable 5 ou Claude Mythos 5 restent facturés entre 60 et 70 dollars par million de tokens, réservés aux usages les plus exigeants. Cette segmentation croissante entre modèles ultra-économiques et modèles premium à haute performance pourrait redéfinir la manière dont les entreprises choisissent leurs fournisseurs d'intelligence artificielle dans les mois à venir.

LLMsOpinion
1 source
GPT-5.5 : le modèle à base d'agents le plus puissant d'OpenAI, à deux fois le prix de l'API
2AI News 

GPT-5.5 : le modèle à base d'agents le plus puissant d'OpenAI, à deux fois le prix de l'API

OpenAI a lancé GPT-5.5 le 23 avril 2026, présenté comme son modèle d'intelligence artificielle agentique le plus capable à ce jour. Conçu dès la base pour planifier, utiliser des outils, vérifier ses propres résultats et exécuter des tâches de façon autonome, il s'agit du premier modèle de base ré-entraîné depuis GPT-4.5, développé en coopération avec les systèmes rack NVIDIA GB200 et GB300 NVL72. Le déploiement a commencé pour les abonnés Plus, Pro, Business et Enterprise dans ChatGPT et Codex, avec un accès API ouvert dès le 24 avril. Sur Terminal-Bench 2.0, un benchmark mesurant les workflows en ligne de commande, GPT-5.5 atteint 82,7 % contre 75,1 % pour GPT-5.4 et 69,4 % pour Claude Opus 4.7. Sur SWE-Bench Pro, qui évalue la résolution de tickets GitHub, il plafonne à 58,6 %, et sur MRCR v2 à un million de tokens, il grimpe à 74,0 % contre seulement 36,6 % pour son prédécesseur. L'API est facturée 5 dollars par million de tokens en entrée et 30 dollars en sortie, soit exactement le double de GPT-5.4. La version Pro, réservée aux abonnements payants, monte à 30 dollars en entrée et 180 dollars en sortie. Ce doublement tarifaire est le principal point de friction, mais OpenAI avance un argument concret : GPT-5.5 accomplit les mêmes tâches Codex avec moins de tokens que son prédécesseur, ce qui ramène le surcoût réel à environ 20 % selon le laboratoire indépendant Artificial Analysis. Pour les entreprises qui déploient des agents automatisés traitant des volumes importants, la différence n'est donc pas nécessairement linéaire avec le prix affiché. En interne, OpenAI affirme que plus de 85 % de ses employés utilisent Codex chaque semaine, y compris les équipes marketing, qui ont notamment utilisé GPT-5.5 pour analyser six mois de demandes de prises de parole et construire un cadre de scoring automatisant les approbations à faible risque. GPT-5.5 s'inscrit dans une course à l'agentique qui structure désormais toute la compétition entre les grands labos d'IA. Le co-fondateur Greg Brockman y voit "un vrai pas vers le type de calcul qu'on attend pour le futur", tandis que le chief scientist Jakub Pachocki concède que les deux dernières années de progrès avaient semblé "étonnamment lentes". Un point reste ouvert : sur MCP Atlas, le benchmark de Scale AI mesurant l'utilisation d'outils via le Model Context Protocol, Claude Opus 4.7 d'Anthropic mène avec 79,1 % et GPT-5.5 n'affiche aucun score, ce qu'OpenAI a néanmoins inclus dans son propre tableau comparatif. Pour les équipes qui construisent des pipelines agentiques en production, les prochaines semaines permettront de déterminer si les performances en benchmark se traduisent en gains réels, notamment pour les agents terminaux non supervisés et l'automatisation DevOps.

UELes développeurs et entreprises européens utilisant l'API OpenAI devront arbitrer entre le gain de performance agentique de GPT-5.5 et son coût doublé (5 $/M tokens en entrée, 30 $ en sortie) pour leurs pipelines en production.

💬 Le doublement affiché fait frémir, mais si le coût réel en prod tourne à +20% grâce à l'efficience sur les tokens, l'arbitrage change du tout au tout. Ce qui accroche plus, c'est que GPT-5.5 n'a aucun score sur MCP Atlas et qu'OpenAI l'a quand même glissé dans son tableau comparatif avec une case vide. Avant de migrer des pipelines agentiques vers GPT-5.5, c'est ce trou-là qu'il faut creuser, pas les benchmarks terminal.

LLMsOpinion
1 source
Opus 5 d'Anthropic devance largement Fable 5 et GPT-5.6 Sol sur le benchmark conçu pour mesurer l'intelligence réelle
3The Decoder 

Opus 5 d'Anthropic devance largement Fable 5 et GPT-5.6 Sol sur le benchmark conçu pour mesurer l'intelligence réelle

Claude Opus 5, le nouveau modèle d'Anthropic, a obtenu un score de 30,2 % sur ARC-AGI-3, un benchmark conçu pour mesurer l'intelligence réelle plutôt que la simple mémorisation de motifs. Ce résultat représente près du quadruple du précédent record de 7,8 %, détenu jusque là par GPT-5.6 Sol. Selon les concepteurs du test, Opus 5 a formulé de manière autonome des équations de réflexion pour résoudre certaines énigmes, un comportement qu'ils n'avaient jamais observé chez un autre modèle. Ils l'attribuent à un raisonnement logique nettement plus solide que celui de ses concurrents. Cet écart de performance est significatif car ARC-AGI a justement été conçu pour être résistant au bachotage et aux approches par force brute qui permettent souvent aux modèles de gonfler artificiellement leurs scores sur d'autres benchmarks. Un saut aussi net suggère qu'Opus 5 dispose de capacités de raisonnement abstrait et d'adaptation à des problèmes inédits bien supérieures à celles de la génération précédente, ce qui intéresse directement les entreprises cherchant des systèmes capables de résoudre des tâches complexes sans exemples préalables, au-delà de la simple génération de texte ou de code. ARC-AGI a été créé pour évaluer la fluidité cognitive des modèles, c'est-à-dire leur capacité à généraliser à partir de peu d'exemples, contrairement aux benchmarks classiques que les grands modèles finissent par saturer une fois entraînés dessus. Les versions précédentes de ce test avaient mis en évidence les limites persistantes des grands modèles de langage face au raisonnement véritablement nouveau. La progression rapide d'Anthropic, dans une course où OpenAI occupait jusqu'ici la tête avec GPT-5.6 Sol, relance la compétition entre laboratoires sur ce terrain précis, considéré par beaucoup comme un indicateur plus fiable du chemin vers une intelligence artificielle générale.

💬 Quadrupler le record sur un benchmark pensé justement pour résister au bachotage, ça ne s'explique pas par un peu plus de données ou un prompt mieux tourné. Le signal fort, c'est qu'Opus 5 invente ses propres équations pour résoudre les énigmes, un raisonnement qui n'était écrit nulle part dans son entraînement. Bon, sur le papier ça sent l'AGI qui approche, mais ARC-AGI teste des puzzles abstraits, pas la gestion d'un vrai projet client, donc je garde deux doigts de prudence avant de crier victoire.

LLMsActu
1 source
Grok 4.5 est tellement moins cher que Fable 5 et GPT 5.5 que les écarts de benchmarks comptent peu
4The Decoder 

Grok 4.5 est tellement moins cher que Fable 5 et GPT 5.5 que les écarts de benchmarks comptent peu

xAI a dévoilé Grok 4.5, sa nouvelle génération de modèle entraînée sur des dizaines de milliers de GPU Nvidia GB300. Sur les benchmarks de codage, le modèle reste derrière Fable 5 et GPT-5.5 en termes de résultats bruts, mais il se distingue par son efficacité : il nécessite 4,2 fois moins de tokens qu'Opus 4.8 pour traiter une même tâche. Côté tarification, xAI affiche un prix de 2 dollars par million de tokens en entrée, très inférieur à celui de ses concurrents directs. La disponibilité du modèle en Europe est annoncée pour la mi-juillet. Cette différence de coût pourrait peser plus lourd que les écarts de performance mesurés sur les benchmarks. Pour les développeurs et les entreprises qui déploient des agents de codage à grande échelle, la facture liée aux tokens consommés peut rapidement dépasser l'importance du score obtenu sur un test isolé. Un modèle moins performant mais nettement moins gourmand en tokens et moins cher à l'usage peut donc s'avérer plus rentable en production, notamment pour des tâches répétitives ou du traitement en volume. Cela redistribue les cartes dans un marché où la course aux benchmarks ne garantit plus à elle seule l'adoption commerciale. Cette sortie s'inscrit dans la compétition intense que se livrent les grands laboratoires d'IA sur le terrain du codage, considéré comme l'un des usages les plus lucratifs des modèles de langage. xAI mise sur une infrastructure Nvidia GB300 dernier cri pour entraîner Grok 4.5, tout en cherchant à se démarquer par le rapport coût-efficacité plutôt que par la seule performance brute face à des rivaux comme Anthropic et OpenAI. L'arrivée prévue en Europe mi-juillet permettra de tester en conditions réelles si cette stratégie tarifaire agressive suffit à convaincre les entreprises européennes, dans un contexte où la question du coût d'exploitation des modèles devient centrale pour la rentabilité des produits basés sur l'IA générative.

UELa disponibilité annoncée de Grok 4.5 en Europe mi-juillet permettra aux entreprises françaises et européennes de tester ce modèle pour leurs usages de codage à grande échelle.

💬 Deux dollars le million de tokens et 4,2 fois moins de tokens consommés qu'Opus 4.8 pour la même tâche, ça pèse plus lourd que trois points d'écart sur un benchmark de code. En prod, sur des agents qui tournent en continu, c'est la facture qui tranche, pas le classement : le coût par tâche est en train de redistribuer les cartes du marché des modèles de langage. Reste à voir si xAI tient la promesse une fois le modèle dispo en Europe, mi-juillet.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic