Aller au contenu principal
LLMsVentureBeat AI · 2 min de lecture

OpenAI baisse de 80% les prix de GPT-5.6 Luna, la concurrence se déplace désormais sur les coûts

Source originale ↗·

OpenAI a annoncé une baisse spectaculaire des prix de deux modèles de sa gamme GPT-5.6 : GPT-5.6 Luna, le plus petit et le plus rapide de la série, voit son tarif chuter de 80%, tandis que GPT-5.6 Terra, le modèle intermédiaire, baisse de 20%. Luna passe désormais à 0,20 dollar par million de tokens en entrée et 1,20 dollar en sortie, soit un total combiné de 1,40 dollar par million de tokens, contre 7 dollars auparavant (1 dollar en entrée, 6 dollars en sortie). Terra coûte maintenant 2 dollars en entrée et 12 dollars en sortie, pour un total de 14 dollars. Le prix de GPT-5.6 Sol en mode Standard reste inchangé à 35 dollars au total, mais OpenAI introduit un nouveau mode Fast, facturé deux fois plus cher (10 dollars en entrée, 60 dollars en sortie, soit 70 dollars au total), qui promet jusqu'à 2,5 fois plus de débit sans changer l'intelligence sous-jacente du modèle. Sam Altman, cofondateur et PDG d'OpenAI, a annoncé ces changements sur X en évoquant de "importantes baisses de prix".

Cette annonce intervient seulement quelques jours après le lancement de Claude Opus 5 par Anthropic, au même prix que son prédécesseur Opus 4.8, et après l'introduction par Google de Gemini 3.6 Flash et Gemini 3.5 Flash-Lite, deux modèles pensés pour réduire les coûts d'inférence et accélérer l'exécution des tâches agentiques. Avec cette révision tarifaire, OpenAI positionne Luna sous Gemini 3.5 Flash-Lite (2,80 dollars au total) et très loin sous Gemini 3.6 Flash (9 dollars), tout en cherchant à séduire les utilisateurs d'Anthropic grâce à la vitesse plutôt qu'au prix. La stratégie illustre une bascule nette de la compétition entre grands modèles de langage : after des mois centrés sur les capacités brutes, la bataille se joue désormais sur le rapport performance-coût, un critère décisif pour les entreprises qui déploient ces modèles à grande échelle dans des applications agentiques ou des volumes massifs de requêtes.

Ce mouvement s'inscrit dans une guerre des prix plus large qui agite tout le secteur. Le marché reste dominé par des acteurs encore moins chers : le MiMo-V2.5 Flash de Xiaomi (0,40 dollar au total) et le DeepSeek-V4-Flash (0,42 dollar) restent sous la barre du dollar par million de tokens, loin devant Luna. Les modèles chinois, notamment ceux de Xiaomi, DeepSeek, Alibaba et MiniMax, tirent les prix vers le bas sur l'ensemble du marché, forçant les géants américains à réagir. À l'autre extrémité du spectre, les modèles les plus puissants comme GPT-5.6 Sol en mode Fast, Claude Fable 5 ou Claude Mythos 5 restent facturés entre 60 et 70 dollars par million de tokens, réservés aux usages les plus exigeants. Cette segmentation croissante entre modèles ultra-économiques et modèles premium à haute performance pourrait redéfinir la manière dont les entreprises choisissent leurs fournisseurs d'intelligence artificielle dans les mois à venir.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

OpenAI GPT-5.6 Sol, Terra et Luna sont désormais disponibles sur Amazon Bedrock
1AWS ML Blog 

OpenAI GPT-5.6 Sol, Terra et Luna sont désormais disponibles sur Amazon Bedrock

OpenAI a annoncé la disponibilité générale de sa nouvelle famille de modèles GPT-5.6, baptisée Sol, Terra et Luna, sur Amazon Bedrock, le service d'inférence cloud d'AWS. Cette annonce marque un changement de nomenclature chez OpenAI : le chiffre 5.6 identifie la génération, tandis que les noms Sol, Terra et Luna désignent des niveaux de capacité distincts pouvant évoluer selon leur propre calendrier. Sol, le modèle phare de raisonnement, atteint un score record de 80 points sur l'index Artificial Analysis Coding Agent, soit 2,8 points de plus que le meilleur concurrent, tout en utilisant moins de la moitié des tokens de sortie, un temps d'exécution divisé par deux et un coût inférieur d'environ un tiers. Sur ExploitBench, un test dédié à la recherche en cybersécurité, Sol obtient 73,5%, contre 47,9% pour GPT-5.5 à budget de tokens comparable. Sur Agents' Last Exam, une évaluation portant sur des flux de travail professionnels de longue durée dans 55 domaines, Sol établit un nouveau record de 53,6, devançant son plus proche rival de 13,1 points. Terra, positionné comme le modèle équilibré pour la production quotidienne, surpasse GPT-5.5 à moindre coût, tandis que Luna cible les tâches à fort volume comme la classification ou le routage, où la latence et le coût par token priment. Les tarifs correspondent aux prix directs d'OpenAI et l'usage s'impute sur les engagements AWS existants des clients. Cette mise à disposition répond aux besoins d'entreprises qui déploient des agents autonomes sur des centaines d'étapes consécutives, que ce soit pour générer du code en production, mener des recherches sur des failles de sécurité ou analyser des séquences génétiques complètes. Ces charges de travail traitent souvent des données sensibles et exigent un débit stable même en cas de pics d'usage imprévisibles, dans des environnements où la résidence des données et la sécurité ne souffrent aucun compromis. En proposant trois niveaux de modèles aux performances et coûts différenciés, Amazon Bedrock permet aux équipes techniques d'ajuster précisément la puissance de calcul à chaque tâche, réduisant les dépenses inutiles sur les usages simples tout en réservant la puissance maximale aux problèmes complexes. Le nouveau moteur d'inférence d'Amazon Bedrock a été conçu pour absorber la nature imprévisible du trafic généré par les agents, où une seule requête utilisateur peut déclencher des centaines d'appels au modèle. Le système mutualise la capacité tout en isolant le débit de chaque client, et l'inférence reste cantonnée à la région AWS choisie pour répondre aux exigences réglementaires de résidence des données. Autre nouveauté clé : la mise en cache des prompts avec des points de rupture explicites, qui permet de réutiliser le contexte déjà traité, comme les instructions système ou les définitions d'outils, lors des appels suivants. Cette fonctionnalité vise directement les charges de travail agentiques et multi-étapes, où une grande partie du contexte se répète d'un appel à l'autre, réduisant ainsi coûts et latence pour les architectures d'intelligence artificielle les plus exigeantes.

💬 Ce qui m'accroche ici c'est pas les 80 points sur l'index de code, c'est le bond sur ExploitBench : 73,5% contre 47,9% pour GPT-5.5, sur un test taillé pour la recherche de failles de sécurité. Tu vois où ça mène : un modèle qui trouve mieux les vulnérabilités, ça sert la défense autant que l'attaque, et personne n'en parle vraiment. Le vrai coup, lui, c'est la distribution : atterrir sur Bedrock au prix OpenAI direct, c'est vendre la techno via la ligne AWS que les boîtes ont déjà signée, sans nouveau contrat à faire approuver.

LLMsActu
1 source
SpaceX lance Grok 4.5 a moitie prix de la concurrence, un defi pour Anthropic et OpenAI
2VentureBeat AI 

SpaceX lance Grok 4.5 a moitie prix de la concurrence, un defi pour Anthropic et OpenAI

SpaceX a dévoilé mercredi Grok 4.5, le tout premier modèle d'intelligence artificielle qu'elle a entraîné spécifiquement pour la programmation et les agents autonomes. Il s'agit du premier produit concret issu du rachat pour 60 milliards de dollars de la startup de coding Cursor, finalisé quelques semaines plus tôt. Sur X, l'entreprise a présenté Grok 4.5 comme un modèle offrant "une intelligence de pointe avec une vitesse et une efficacité de coût inégalées", entraîné en partie avec les données de Cursor. Côté tarifs, SpaceX facture 2 dollars par million de tokens en entrée et 6 dollars par million en sortie, soit moins de la moitié du prix des offres haut de gamme d'Anthropic (Claude Opus) et d'OpenAI, tout en consommant deux fois moins de tokens par tâche. Elon Musk a lui-même reconnu que Grok 4.5 est "à peu près comparable à Opus 4.7, mais bien plus rapide". Le cabinet d'évaluation indépendant Artificial Analysis a classé le modèle quatrième sur son indice GDPval-AA v2, qui mesure les performances sur des tâches réelles de travail agentique, avec un score Elo de 1543, juste derrière les dernières versions de Claude. En revanche, sur le plan du coût, Grok 4.5 se démarque nettement : 0,49 dollar par tâche accomplie, près de 90% moins cher que les modèles qui le devancent au classement. Cet écart de prix pourrait bousculer l'équilibre du marché des agents IA en entreprise. Les charges de travail agentiques, où un modèle opère seul pendant plusieurs minutes voire plusieurs heures en lisant du code, en appelant des outils et en itérant sur ses propres résultats, consomment énormément de tokens. Un modèle 90% moins cher par tâche, même légèrement moins performant, change radicalement les calculs économiques pour toute organisation qui déploie des agents auprès de centaines de développeurs. L'investisseur Gavin Baker a résumé cette dynamique en évoquant un modèle "dominant au sens de Pareto" pour le coding, tout en restant prudent sur le ressenti réel des utilisateurs. Ce lancement s'inscrit dans une stratégie bâtie en plusieurs étapes. En avril, SpaceX avait obtenu le droit de racheter Cursor pour 60 milliards de dollars, ou de verser des milliards en frais et en capacité de calcul en cas de désistement. Quelques jours après son entrée en bourse au Nasdaq en juin, l'entreprise a exercé cette option via une opération entièrement en actions, entraînant une dilution d'environ 3,4% à la valorisation de l'introduction, tandis que le titre SpaceX bondissait de 16%. L'intérêt stratégique tient autant aux données qu'au produit : l'éditeur de code de Cursor génère un flux massif d'interactions de développeurs expérimentés, directement injecté dans l'entraînement de Grok, tandis que Cursor a obtenu en retour l'accès au supercalculateur Colossus de SpaceX à Memphis.

UEImpact indirect : la baisse du cout des agents IA pourrait bénéficier les entreprises européennes qui déploient ces outils, sans lien direct avec une entité ou réglementation française ou européenne.

💬 Le vrai coup ici, c'est pas la perf, c'est le prix : 90% moins cher par tâche que les modèles qui le devancent au classement, ça change le calcul économique pour toute boîte qui fait tourner des agents à l'échelle. Sur le papier Grok 4.5 reste juste derrière Claude en qualité, mais en pratique une entreprise qui fait bosser des agents des heures durant va regarder la facture avant le score Elo. Anthropic et OpenAI ont un problème de marge à gérer, pas un problème technique.

LLMsActu
1 source
3Latent Space 

« GPT 5.6 fait baisser les prix de 20 à 80 % : le coût de l'intelligence de GPT 5.4 a chuté de 13x en 4 mois »

GPT-5.6 d'OpenAI a permis une baisse de prix spectaculaire, comprise entre 20% et 80% selon les modèles, révélée cette semaine dans une note technique publiée par l'entreprise. Le modèle a été utilisé pour optimiser sa propre infrastructure de service : rebaptisé Sol dans ce rôle, GPT-5.6 a analysé le trafic de production, ajusté la répartition de charge et réécrit de façon autonome des noyaux de calcul en Triton et Gluon, les langages internes d'OpenAI, ce qui a réduit les coûts de service de bout en bout de 20%. L'entreprise a aussi amélioré le décodage spéculatif en perfectionnant son modèle brouillon via des centaines d'expériences pilotées automatiquement, gagnant plus de 15% en efficacité de génération de tokens, et optimisé la gestion du cache KV pour les charges de travail spécifiques à des outils comme Codex. Côté harnais agentique, la couche d'orchestration en Rust a été revue pour limiter la découverte d'outils au strict nécessaire et plafonner les sorties d'outils à 10 000 tokens, tandis que l'historique visible par le modèle est désormais traité comme strictement additif afin de maximiser la réutilisation du cache de prompts. Résultat concret : le modèle Luna voit son prix chuter de 80%, Terra de 20%, et un nouveau mode Sol Fast offre une latence 2,5 fois plus faible pour le double du prix standard. L'observation la plus frappante vient d'une comparaison de performance : GPT-5.4 en version complète, en mode de raisonnement maximal, obtenait un score de 51 sur un benchmark donné en mars, un score aujourd'hui atteint par Luna, une version bien moins chère du nouveau modèle. Or GPT-5.4 coûtait 2,50 dollars par million de tokens en entrée et 15 dollars en sortie, contre 0,20 et 1,20 dollar pour Luna aujourd'hui, soit un coût treize fois inférieur pour un niveau d'intelligence équivalent en seulement quatre mois, un rythme annualisé proche de 2000x. Cette baisse dépasse même l'accélération déjà spectaculaire notée un an plus tôt, quand une analyse largement reprise, y compris par le dirigeant de Google DeepMind Demis Hassabis, montrait qu'un niveau d'intelligence équivalent à GPT-4 avait vu son coût divisé par 1000 en dix-huit mois. Cette dynamique confirme que la baisse des coûts à intelligence constante n'était pas un simple effet de rattrapage lié au passage des modèles denses aux architectures mixtes ou du texte brut au raisonnement, comme certains le pensaient il y a un an. Sur le seul critère du coût d'une intelligence non spécialisée, sans besoin de fine-tuning, OpenAI distance désormais des modèles ouverts comme DeepSeek, GLM ou MiniMax ainsi que des modèles économiques concurrents comme Gemini Flash-Lite, même si des modèles ouverts comme Laguna de Poolside ou Inkling de Thinky Labs conservent l'avantage pour les organisations qui exigent un contrôle total et la souveraineté sur leurs modèles.

UELes entreprises européennes utilisant l'API OpenAI bénéficient indirectement de cette baisse des coûts, sans impact réglementaire ou structurel direct sur le marché français ou européen.

LLMsOpinion
1 source
OpenAI GPT-5.6 Sol / Terra / Luna : réservé aux partenaires de confiance
4Latent Space 

OpenAI GPT-5.6 Sol / Terra / Luna : réservé aux partenaires de confiance

OpenAI a lancé le 25 juin 2026 une nouvelle famille de modèles baptisée GPT-5.6, composée de trois variantes : Sol (flagship), Terra (milieu de gamme) et Luna (rapide et économique). Le déploiement est volontairement restreint : seul un groupe d'environ vingt entreprises considérées comme "partenaires de confiance" y a accès via Codex et l'API, avec un élargissement prévu "dans les prochaines semaines". Sam Altman a confirmé qu'OpenAI avait initialement prévu un lancement grand public, mais a modifié ses plans à la demande explicite du gouvernement américain. La tarification est structurée : Sol coûte 5 dollars pour un million de tokens en entrée et 30 dollars en sortie, Terra 2,50 et 15 dollars, Luna 1 et 6 dollars. Sur le plan des performances, OpenAI revendique que Sol Ultra atteint 91,9 % sur le benchmark Terminal-Bench 2.1, dépassant selon certains observateurs Claude Mythos 5, tandis que Terra serait le premier modèle de taille intermédiaire à franchir les 80 % sur ce même test. Deux nouvelles fonctionnalités ont également été introduites : le "max reasoning" pour des raisonnements prolongés et un "ultra mode" mobilisant des sous-agents pour des tâches complexes. Ce lancement marque un tournant dans la manière dont les grands modèles de langage atteignent le marché : pour la première fois, un déploiement frontier est ouvertement conditionné par une décision gouvernementale, transformant ce qui était jusqu'ici un processus commercial en un mécanisme de contrôle public. Pour les développeurs et entreprises qui comptaient sur un accès immédiat, cela signifie des semaines d'attente supplémentaires. Pour l'écosystème plus large, cela établit un précédent : les gouvernements peuvent désormais influencer directement le calendrier de mise à disposition des modèles les plus puissants. Sur le plan tarifaire, la famille GPT-5.6 challenge directement Anthropic : Sol se positionne en dessous de Claude Mythos 5 (10/50 dollars) tout en revendiquant des performances supérieures sur certains benchmarks, ce qui pourrait accélérer une guerre des prix sur le segment haut de gamme. Ce lancement s'inscrit dans un contexte de tensions croissantes autour de la sécurité des IA frontier. OpenAI a pris soin de préciser que Sol ne franchit pas le seuil "Cyber Critical" de son cadre de préparation aux risques : dans des évaluations sur Chromium et Firefox, le modèle a identifié des failles et des primitives d'exploitation, mais n'a pas produit de chaîne d'exploit fonctionnelle de manière autonome. Ce soin dans la communication signale que la pression réglementaire s'intensifie autour des capacités offensives des modèles. En parallèle, la négociation en cours entre Anthropic et ses investisseurs autour de Fable, et l'assouplissement des contrôles Mythos, suggèrent que tous les grands laboratoires naviguent simultanément entre course aux performances et contraintes institutionnelles grandissantes.

UELe déploiement restreint aux partenaires de confiance retarde l'accès des développeurs et entreprises européens, et le précédent d'une intervention gouvernementale américaine sur le calendrier de lancement pourrait influencer les approches réglementaires de l'UE en matière de diffusion des modèles frontier.

💬 Ce qui compte ici, c'est pas les trois variantes Sol/Terra/Luna. C'est qu'OpenAI a officiellement acquiescé à une demande du gouvernement américain pour retarder son lancement, et l'a dit publiquement, ce qui établit un précédent réel : les gouvernements ont désormais une prise directe sur le calendrier des modèles frontier. Sur les prix, Sol à 5/30 dollars face à Mythos à 10/50, c'est agressif, reste à voir si ça tient hors benchmarks maison.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic