« GPT 5.6 fait baisser les prix de 20 à 80 % : le coût de l'intelligence de GPT 5.4 a chuté de 13x en 4 mois »
GPT-5.6 d'OpenAI a permis une baisse de prix spectaculaire, comprise entre 20% et 80% selon les modèles, révélée cette semaine dans une note technique publiée par l'entreprise. Le modèle a été utilisé pour optimiser sa propre infrastructure de service : rebaptisé Sol dans ce rôle, GPT-5.6 a analysé le trafic de production, ajusté la répartition de charge et réécrit de façon autonome des noyaux de calcul en Triton et Gluon, les langages internes d'OpenAI, ce qui a réduit les coûts de service de bout en bout de 20%. L'entreprise a aussi amélioré le décodage spéculatif en perfectionnant son modèle brouillon via des centaines d'expériences pilotées automatiquement, gagnant plus de 15% en efficacité de génération de tokens, et optimisé la gestion du cache KV pour les charges de travail spécifiques à des outils comme Codex. Côté harnais agentique, la couche d'orchestration en Rust a été revue pour limiter la découverte d'outils au strict nécessaire et plafonner les sorties d'outils à 10 000 tokens, tandis que l'historique visible par le modèle est désormais traité comme strictement additif afin de maximiser la réutilisation du cache de prompts. Résultat concret : le modèle Luna voit son prix chuter de 80%, Terra de 20%, et un nouveau mode Sol Fast offre une latence 2,5 fois plus faible pour le double du prix standard.
L'observation la plus frappante vient d'une comparaison de performance : GPT-5.4 en version complète, en mode de raisonnement maximal, obtenait un score de 51 sur un benchmark donné en mars, un score aujourd'hui atteint par Luna, une version bien moins chère du nouveau modèle. Or GPT-5.4 coûtait 2,50 dollars par million de tokens en entrée et 15 dollars en sortie, contre 0,20 et 1,20 dollar pour Luna aujourd'hui, soit un coût treize fois inférieur pour un niveau d'intelligence équivalent en seulement quatre mois, un rythme annualisé proche de 2000x. Cette baisse dépasse même l'accélération déjà spectaculaire notée un an plus tôt, quand une analyse largement reprise, y compris par le dirigeant de Google DeepMind Demis Hassabis, montrait qu'un niveau d'intelligence équivalent à GPT-4 avait vu son coût divisé par 1000 en dix-huit mois.
Cette dynamique confirme que la baisse des coûts à intelligence constante n'était pas un simple effet de rattrapage lié au passage des modèles denses aux architectures mixtes ou du texte brut au raisonnement, comme certains le pensaient il y a un an. Sur le seul critère du coût d'une intelligence non spécialisée, sans besoin de fine-tuning, OpenAI distance désormais des modèles ouverts comme DeepSeek, GLM ou MiniMax ainsi que des modèles économiques concurrents comme Gemini Flash-Lite, même si des modèles ouverts comme Laguna de Poolside ou Inkling de Thinky Labs conservent l'avantage pour les organisations qui exigent un contrôle total et la souveraineté sur leurs modèles.
Les entreprises européennes utilisant l'API OpenAI bénéficient indirectement de cette baisse des coûts, sans impact réglementaire ou structurel direct sur le marché français ou européen.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.



