Aller au contenu principal
Analyse hebdomadairePublié le 18 août 2026

Prix en chute libre : la semaine où le modèle seul a cessé d'être le produit

Trois labos ont sorti une version majeure sans repartir d'un pré-entraînement complet, des modèles en poids ouverts tiennent désormais sur une seule carte de 24 à 32 Go, et DeepSeek relève ses tarifs à contre-courant : la valeur n'a pas disparu, elle a changé d'étage.

Mathieu Bocquillon|24 min de lecture|73 articles de 15 sources|4 927 mots

En 30 secondes

Trois labos ont sorti une version majeure sans repartir d'un pré-entraînement complet, des modèles en poids ouverts tiennent désormais sur une seule carte de 24 à 32 Go, et DeepSeek relève ses tarifs à contre-courant : la valeur n'a pas disparu, elle a changé d'étage.

Une halle industrielle sombre sur deux niveaux : en bas, un tapis roulant fait défiler des cubes translucides bleus rigoureusement identiques, chacun renfermant un réseau de points lumineux, et une paroi entière de jetons métalliques s'aligne derrière eux ; au-dessus, une colonne de lumière orange remonte du tapis vers un moyeu de machine d'où partent d'épais conduits incandescents, à gauche vers la porte blindée d'un coffre-fort, à droite vers une constellation de nœuds suspendus reliés entre eux, de sorte que la matière produite en série reste froide en bas pendant que toute la valeur circule en haut


Google a publié Gemini 3.7 Flash trois semaines après Gemini 3.6 Flash, avec un tarif d'appel divisé par deux jusqu'au 31 décembre. La promotion est réelle. Le rythme de sortie, lui, révèle quelque chose de plus durable : une nouvelle version n'exige plus nécessairement un nouveau pré-entraînement complet.

GLM-5.3 réutilise explicitement le socle de GLM-5.2. Grok 4.6 prolonge l'entraînement de 4.5 avant de reprendre ses étapes de fine-tuning et de renforcement. Gemini 3.7 reste fondé sur 3.6. Trois méthodes différentes, un même résultat économique : les labos peuvent désormais améliorer, segmenter et remettre leurs modèles sur le marché beaucoup plus vite.

J'ai lu 73 articles sur ce sujet en sept jours. Pris un par un, ce sont des annonces produit banales : un modèle par-ci, une baisse de tarif par-là. Pris ensemble, ils racontent une seule histoire, et elle n'est pas celle qu'on te vend dans les communiqués.

Le prix de l'inférence généraliste baisse. La dépense totale, elle, ne suit pas nécessairement : les agents multiplient les appels, les reprises et les contextes relus. Voilà l'inversion qu'il faut comprendre.


Pourquoi trois labos ont-ils sorti une version majeure sans repartir d'un pré-entraînement complet ?

Commençons par le fait le plus technique de la semaine, parce que c'est lui qui explique tout le reste.

Z.ai a dévoilé GLM-5.3 le 14 août. Le modèle est bâti sur exactement le même socle de 743 milliards de paramètres que GLM-5.2, sans nouveau pré-entraînement. Tous les gains viennent du post-entraînement : plus d'environnements de tâches, des sessions d'apprentissage allongées. Résultat, le score sur Terminal-Bench 3.0 passe de 4,6 à 28,3, et de 46,2 à 66,9 sur DeepSWE (Z.ai lance GLM-5.3 sans réentraîner le modèle de base).

Grok 4.6 suit une recette voisine, pas identique. SpaceXAI l'a présenté comme une mise à jour post-entraînement de Grok 4.5 : même socle annoncé, entraînement prolongé, trajectoires de fine-tuning régénérées, apprentissage par renforcement dans des environnements agentiques. L'indice Artificial Analysis passe de 56 à 61, à égalité avec GPT-5.6 Sol Max (Grok 4.6 de SpaceXAI).

Gemini 3.7 Flash, trois semaines après le 3.6. Google le présente explicitement comme basé sur Gemini 3.6 Flash. Le détail des étapes d'entraînement intermédiaires n'est pas publié, mais la continuité du socle, elle, est documentée (Google annonce Gemini 3.7 Flash).

Et Qwen 3.8 d'Alibaba arrive dans la même fenêtre, sous licence Apache 2.0, avec un modèle dense de 27 milliards de paramètres qui bat Qwen 3.7 Plus, la variante propriétaire de la génération précédente, dont Alibaba ne publie pas la taille (Alibaba dévoile Qwen 3.8).

À retenir : pré-entraînement vs post-entraînement. Le pré-entraînement fabrique le socle, des mois de calcul, des centaines de millions de dollars. Le post-entraînement (fine-tuning, apprentissage par renforcement, distillation) sculpte le comportement sur ce socle. Les labos n'en publient pas le coût, et une campagne de renforcement agentique peut être lourde, mais elle n'engage pas le même ordre de dépense qu'un pré-entraînement complet. Quand un labo annonce une version majeure sans nouveau socle, il te vend du post-entraînement.

Voilà le point que personne n'a relié cette semaine : la cadence de publication se découple progressivement de celle des grands pré-entraînements.

Cette évolution ne suffit pas à expliquer la guerre des prix. Le tarif d'une API dépend d'abord du coût marginal d'inférence, du taux d'occupation des GPU et du regroupement des requêtes, de la taille du modèle réellement servi, du cache et du routage, et surtout d'un choix commercial entre conquête et rentabilisation.

Mais elle change ce qui est possible. Tant qu'une nouvelle génération imposait un pré-entraînement complet, le calendrier commercial restait contraint par le calendrier de calcul. Il ne l'est plus. Les labos peuvent multiplier les versions, segmenter leurs gammes et répondre à un concurrent en semaines plutôt qu'en trimestres.


La baisse des prix est-elle réelle, ou simplement déplacée ?

Les chiffres bruts sont spectaculaires. OpenAI a coupé 80 % sur GPT-5.6 Luna. Anthropic a lancé Claude Opus 5 à moitié prix par rapport à Fable 5 (OpenAI et Anthropic baissent leurs prix). Gemini 3.7 Flash arrive à 0,75 dollar par million de tokens en entrée, moitié moins que son prédécesseur (Google lance Gemini 3.7 Flash avec 50 % de réduction).

Regarde maintenant ce qui se passe en parallèle.

OpenAI annonce des sièges Premium pour ChatGPT Business à 125 dollars par mois et par utilisateur, cinq fois le tarif du siège standard. La promesse affichée : cinq fois plus d'usage et la suppression de la limite de cinq heures (OpenAI lance des sièges Premium à 125 $ pour ChatGPT Business).

Tu vois le mécanisme ? Le prix unitaire baisse et le volume explose. Un agent qui tourne en boucle relit son contexte, rejoue ses outils, recommence quand il échoue. Une baisse de 80 % sur le token ne compense pas un facteur dix sur le nombre de tokens consommés.

Deuxième chose à regarder de près : la remise de 50 % sur Gemini 3.7 Flash expire fin 2026. Ce n'est pas un prix, c'est une fenêtre de migration subventionnée. Tu portes ton code, tu t'habitues, et en janvier la facture double.

Troisième signal, plus discret : l'adoption lente de Fable 5 en entreprise. Elle dessine un plafond de consentement à payer pour le très haut de gamme, ce qui pousse la valeur vers le milieu de gamme rapide. Le mode Ultrafast d'OpenAI à 750 tokens par seconde, Grok 4.6 à moins de la moitié du tarif de GPT-5.6 Sol. La performance suffisante bat la performance maximale dès que le prix entre dans l'équation.

À retenir : coût par million de tokens vs coût par tâche résolue. La première métrique est celle du vendeur, la seconde celle de l'acheteur. Un agent qui fait trois allers-retours de plus pour aboutir annule une baisse de 50 % du token. La seule unité qui compte en production est le coût complet d'une tâche menée à terme, taux d'échec et reprises inclus.

Là où les gains sont réels, ils ne viennent pas du modèle. Ils viennent de l'orchestration.

Writer mesure 52 % d'économie sur ses agents avec Palmyra X6 en ne modifiant que son moteur d'orchestration (Writer réduit les coûts des agents IA de 52 %). Le chiffre qui compte davantage est ailleurs : sur six modèles différents, dont Claude, Gemini, Qwen et GLM, le même changement de harnais rend 41 % d'économie moyenne, à qualité comparable. L'effet ne tient donc pas au modèle maison. Deux réserves : l'étude porte sur 22 tâches et elle est signée par Writer. Nvidia publie NeMo Switchyard, une bibliothèque de routage qui envoie chaque étape vers le modèle le mieux adapté. Testé avec LangChain sur 145 tâches agentiques multi-étapes, un routage entre Nemotron Lightning et Claude Opus 4.8 réduit le coût de 74 %, en n'envoyant que 7 % des appels au modèle de pointe, pour environ six points de précision perdus (Le routeur Switchyard de Nvidia, Nvidia lance Nemotron 3.5 Lightning).

Ces résultats montrent que la couche au-dessus du modèle peut déplacer la facture autant que le choix du modèle lui-même. Retiens-le, on y revient.


Pourquoi DeepSeek augmente-t-il ses prix quand tout le monde les casse ?

Un seul acteur a fait l'inverse cette semaine, et c'est le plus intéressant de tous.

DeepSeek a confirmé le 13 août une hausse importante sur la gamme V4, annoncée dès le 6, entrée en vigueur le 16 août à 16 h UTC, soit le 17 en heure chinoise. V4-Flash passe de 0,28 à 1,32 dollar par million de tokens de sortie aux heures de pointe, soit plus de quatre fois (DeepSeek augmente brutalement le prix de ses modèles V4).

Mais le vrai chiffre est ailleurs : le prix des cache hits est multiplié par six (DeepSeek améliore V4 Pro et augmente les prix de son API).

À retenir : cache hit. Quand une partie du prompt (instructions système, documents de contexte) a déjà été traitée récemment, le fournisseur la facture bien moins cher. Les agents rejouent en permanence le même contexte, mais la part des tokens mis en cache dépend entièrement de l'orchestrateur : dans les tests de Composio elle va de 1,5 % avec Claude Code à près de 70 % avec Codex. Multiplier ce prix par six ne touche donc pas tous les clients de la même façon, et frappe le plus fort ceux dont la pile relit le plus.

L'acteur qui a déclenché la guerre des prix en 2025 en sort au moment où il doit montrer des marges, dans la perspective d'une possible introduction en bourse. Cette hausse suggère que la discipline financière commence à remplacer la conquête de parts de marché. C'est banal en soi, sauf que le timing est parfaitement contra-cyclique.

Et il y a plus gênant. Le même modèle vedette, V4 Flash, domine les classements et trébuche sur le terrain. Sur 240 exécutions, soit 30 tâches multi-étapes rejouées dans huit orchestrateurs différents avec de vrais outils, Composio mesure 129 réussites, 53,8 %. Mais la moyenne cache l'essentiel : le taux va de 46,7 % avec OpenCode à 66,7 % avec Pi Agent, et six scénarios seulement sur trente ont été menés à bien par tous les environnements (DeepSeek V4 Flash échoue sur des tâches d'agent réelles).

Ce n'est donc pas un score intrinsèque du modèle. Vingt points d'écart selon le harnais qui l'exécute, c'est la mesure la plus directe de ce que vaut la couche d'orchestration.

En parallèle, DeepSeek publie Harness v0.1 sous licence MIT. Donner l'outillage d'agents, faire payer l'inférence. C'est exactement le modèle économique inverse de celui des poids ouverts : Meta et Alibaba donnent le modèle et monétisent ailleurs, DeepSeek donne l'outil et monétise le modèle.

Effet collatéral : MAI Code 1.1 Flash de Microsoft, annoncé comme 25 % plus efficace en tokens, reste derrière DeepSeek sur le prix et la performance, hausse comprise. Quand le concurrent qui augmente ses prix reste devant toi, tu n'as pas un problème de tarif, tu as un problème de produit.


Qu'est-ce qui définit vraiment la nouvelle classe de modèles à poids ouverts ?

Plusieurs publications récentes convergent vers la même cible matérielle, et la convergence est trop nette pour être fortuite.

Muse Glimmer de Meta : 30 milliards de paramètres, licence Apache 2.0, distillé de Muse Spark, quantifié en 4 bits, moins de 20 Go de VRAM. Meta recommande un Mac M4/M5 Max ou une RTX 5090 (Meta revient aux poids ouverts, Meta lance Muse Glimmer, des agents IA locaux).

Nemotron 3.5 Lightning de Nvidia : 30 milliards de paramètres dont 3 activés par token. Son architecture accepte jusqu'à un million de tokens sur des configurations adaptées, un DGX Spark ou une H100 ; sur une carte grand public de 24 à 32 Go, les déploiements locaux documentés visent plutôt 32 000 à 40 000 tokens de contexte. Il tient tête à gpt-oss-120b, quatre fois plus gros, sur l'Intelligence Index (Nvidia mise sur la vitesse avec Nemotron 3.5 Lightning, Nvidia lance Nemotron 3.5 Lightning).

Deux entreprises que tout oppose visent exactement la même cible matérielle : une seule carte de 24 à 32 Go. Grand public au sens du circuit de vente, pas du prix.

À retenir : mélange d'experts (MoE) et quantification 4 bits. Un modèle MoE contient beaucoup de paramètres mais n'en active qu'une partie à chaque token (3 milliards sur 30 pour Nemotron 3.5 Lightning), ce qui réduit le CALCUL nécessaire. Il ne réduit pas la mémoire : les experts inactifs doivent en général rester chargés. C'est la quantification 4 bits qui divise environ par quatre la place occupée par les poids. Et il faut encore réserver de la VRAM au contexte et au cache : faire tenir un modèle sur une carte ne veut pas dire pouvoir utiliser sa fenêtre de contexte maximale.

En haut de la gamme, Qwen 3.8 complète le tableau sous Apache 2.0. GLM-5.3, lui, n'y figure pas encore : Z.ai annonce la publication des poids après une période de vérification de deux semaines, il n'est donc pas téléchargeable au moment où j'écris.

Sous les 30 milliards, une deuxième vague arrive, et elle est spécialisée :

  • Shieldstral-1.0-3B de Mistral pour la modération, testé sur un million de commentaires du site français Next, en local sur une RTX 4000 Ada de 20 Go (on a testé Shieldstral sur un million de commentaires)
  • LFM2.5-VL-3B de Liquid AI pour la vision et l'appel d'outils sur appareil
  • Needle 2 de Cactus : 45 millions de paramètres, binaire de 14 Mo, 28 Mo de RAM
  • TwIL-LM de webAI pour la logique formelle, sous licence non commerciale : tout usage générant des revenus exige un accord distinct (webAI lance TwIL-LM)
  • VoiceChat 11B de Nvidia, duplex intégral à 450 ms
  • LTX-2.5 pour la vidéo, 6,8 secondes pour générer 10 secondes de vidéo, donc plus rapide que le temps réel (LTX-2.5)

Le critère commun n'est plus la taille. Ce n'est plus le score sur un classement. C'est la capacité agentique locale : appeler des outils, tenir une boucle, sans sortir de la machine.

Meta assume le virage politique qui va avec. Mark Zuckerberg a publié un essai de plus de 6 000 mots pour défendre la distillation des modèles concurrents et réclamer un allègement des restrictions (Meta revient aux modèles ouverts, Meta relance sa stratégie IA). C'est le premier modèle ouvert issu de Superintelligence Labs, après un pari fermé qui n'a pas payé.


Qui gagne réellement quand les poids deviennent gratuits ?

Nvidia joue sur deux tableaux, et c'est cohérent.

Il vend l'infrastructure qui fait tourner les modèles fermés. Et il offre au même client Nemotron plus le routeur Switchyard pour s'en passer. Il investit même dans Nemotron 4, un modèle en poids ouverts ambitieux visant le niveau des meilleurs mondiaux (Comment Nvidia veut développer les meilleurs modèles open source).

Ça ressemble à du mécénat. C'est de la stratégie : commoditiser la couche modèle maximise la demande de calcul.

Le point de vue contraire : le vrai produit Nvidia de la semaine n'est pas Lightning. C'est Switchyard. Un modèle "30 % plus rapide qu'Untel" sur son propre banc d'essai, ça se dément en deux jours en production. Une couche de routage qui décide quel modèle exécute quelle étape s'installe au cœur de ta pile, et elle y reste. Nvidia ouvre les deux, le modèle comme le routeur, et c'est cohérent : le levier économique n'est ni l'un ni l'autre, ce sont les GPU, CUDA, NeMo et les services de déploiement. Ouvrir la couche logicielle rend la couche matérielle plus difficile à quitter.

Pendant ce temps, une chaîne d'approvisionnement invisible se met en place.

Palmyra X6 de Writer est bâti sur les poids de GLM-5.2. Writer compte Accenture, Uber et Vanguard parmi ses clients, sans que l'on sache lesquels ont déjà basculé sur ce modèle précis. Capital One a construit sa plateforme multi-agents sur des poids ouverts.

Lis la phrase précédente une deuxième fois. Des piles logicielles d'entreprise occidentales roulent déjà sur des socles chinois, et la traçabilité du modèle de base est rarement exigée dans les processus d'achat généralistes.

Ce n'est pas un problème de sécurité au sens naïf du terme : un modèle exécuté en local n'envoie rien nulle part. C'est un problème de documentation, de conformité et de dépendance. Si tu ne sais pas sur quoi repose le produit que tu achètes, tu ne peux ni l'auditer ni le remplacer.

À retenir : la distillation consiste à entraîner un petit modèle à imiter les sorties d'un grand. Muse Glimmer est distillé de Muse Spark. La distillation transforme un actif coûteux en produit dérivé bon marché, et la lignée peut devenir invisible si le fournisseur ne la documente pas : rien dans une réponse d'agent n'indique de quel socle elle vient.

Les marchés, eux, commencent à trier, et pas en faveur des modèles (La bulle IA existe peut-être, mais pas là où tout le monde la cherche). Microsoft a gagné 450 milliards de capitalisation en une séance sur la croissance d'Azure. Les investisseurs ne parient plus sur les poids, ils parient sur ceux qui les font tourner et sur ceux qui les mettent au travail.

Chez Google, la réorganisation de DeepMind envoie un signal parallèle : Jeff Dean part fonder son propre labo, Demis Hassabis se retire de la direction opérationnelle (Google veut-elle vraiment gagner la course à l'IA ?). Au moment où Gemini atteint le milliard d'utilisateurs actifs mensuels, plus vite qu'aucun produit Google avant lui (Gemini devient le produit à la croissance la plus rapide de l'histoire de Google).


Pourquoi le cyber résiste-t-il à la commoditisation ?

Trois annonces récentes dessinent une verticale cyber distincte. Deux portent sur des modèles spécialisés à accès restreint ; la troisième, GLM-5.3, montre que ces capacités émergent aussi dans des modèles généralistes destinés à devenir ouverts.

OpenAI a lancé GPT-5.6-Cyber, réservé à des équipes de défense agréées. Le chiffre mis en avant, 95 %, est un taux de complétion sur son propre banc d'essai interne, l'Advanced Cybersecurity Completion Rate : il mesure la proportion de requêtes cyber avancées auxquelles le modèle répond sans les refuser, sans rien démontrer sur la justesse de la réponse ni sur l'aboutissement de l'opération demandée. OpenAI note d'ailleurs que GPT-5.6 Sol le devance sur certaines épreuves, dont un exercice de découverte et de rédaction de vulnérabilités : moins de refus ne veut pas dire meilleur partout. Le reste de l'annonce tient en deux mots : moins de refus (OpenAI lance GPT-5.6-Cyber). Google DeepMind a présenté Gemini 3.5 Flash Cyber, intégré à son agent CodeMender (Gemini 3.5 Flash Cyber). Et GLM-5.3 embarque des capacités cyber avancées.

Quand le généraliste se commoditise, les labos fuient vers les verticales où l'acheteur ne compare pas les tarifs au million de tokens. Un RSSI ne négocie pas 20 centimes.

Mais regarde l'asymétrie. GPT-5.6-Cyber est verrouillé derrière une vérification d'identité. GLM-5.3 aurait découvert une vulnérabilité potentiellement sérieuse dans Cursor, et Z.ai annonce en publier les poids après deux semaines de vérification (GLM-5.3 arrive avec des capacités cyber avancées).

Le contrôle par la distribution ne fonctionne que tant que la capacité reste fermée. Ce verrou a une date d'expiration annoncée : Z.ai prévoit de publier les poids vers la fin août.

Le "moins de refus" revendiqué par OpenAI est le vrai signal, pas le taux de complétion. C'est l'aveu que les garde-fous bloquaient aussi le red teaming légitime, et que la concurrence ouverte rend ce compromis intenable commercialement.


Si l'accès aux poids se banalise, où se déplace la valeur ?

Vers les données propriétaires, licenciées ou difficilement reproductibles. Et là, la semaine a été très parlante.

L'information sort cette semaine, mais l'approche remonte à fin juin : huit jours après l'annonce du rachat de Warmly par HubSpot, Mercor a contacté Maximus Greenwald, le PDG de Warmly, pour acheter ou licencier ses archives de travail, conversations Slack, tickets et historiques de tâches. Pas pour reprendre la startup : pour récupérer le corpus produit par ses équipes (Startups misent sur les vieux fils Slack et tickets IT).

Twitch a activé par défaut l'entraînement des modèles d'Amazon sur les contenus des chaînes le 12 août. Streams, VOD, clips, chats, images, textes. Puis a ouvert un opt-out enfoui dans les paramètres de chaîne (Twitch permet aux streamers de refuser, Twitch regrette mais assume). Quand une plateforme accepte ce niveau d'inconfort public, c'est que le corpus vaut plus cher que la mauvaise presse.

Spotify attache un badge "AI Persona" aux artistes non humains et coupe leurs recommandations à la mi-septembre (Sur Spotify, les artistes IA vont gagner un badge et perdre des recommandations). Deezer détecte déjà des dizaines de milliers de morceaux IA par jour. La provenance devient une variable de distribution, donc de revenu.

Apple discuterait avec des éditeurs d'accords pluriannuels adossés à un budget total à neuf chiffres, avec une rémunération variable selon l'usage réel, pour fiabiliser Siri sur l'actualité (Apple veut éviter que Siri raconte n'importe quoi). Et développe avec Alibaba un modèle sur mesure pour la Chine (Apple a conçu son propre modèle d'IA pour la Chine). Payer la donnée plutôt que la générer.

Côté opérationnel, un chiffre mérite d'être encadré. Anthropic a mesuré Claude Code sur son propre code : 388 pull requests générées, 46 % fusionnées (Claude Code assure la maintenance quotidienne du logiciel d'Anthropic).

46 % avaient été fusionnées au moment du bilan. Anthropic ne détaille pas le sort des autres, qui peuvent être encore ouvertes, remplacées ou devenues sans objet, donc « non fusionnée » ne veut pas dire « rejetée ». C'est malgré tout le chiffre de terrain qui manque à tous les bancs d'essai publics, et il vient du labo qui avait le plus intérêt à ne pas le publier.


Ce que ça signifie pour toi

Pour les développeurs et équipes techniques

Arrête de choisir un modèle sur un classement. DeepSeek V4 Flash est en tête des classements et tombe à 53,8 % de réussite en conditions réelles, avec vingt points d'écart selon l'orchestrateur qui l'exécute. Construis une évaluation maison sur tes dix tâches de production, dans TON harnais, avant tout arbitrage de coût.

Abstrais le modèle derrière une couche de routage plutôt que de le câbler en dur. Le routage a permis jusqu'à 74 % d'économie dans un test Nvidia et LangChain, au prix d'environ six points de précision : à toi de fixer le compromis acceptable sur tes propres tâches. Le gain vient du routage entre modèles, pas d'une baisse de tarif consentie par un fournisseur unique, et cette couche te protège du prochain changement de prix. Tu vas en subir plusieurs.

Enfin, teste la cible 20 Go de VRAM. La modération (Shieldstral), l'appel d'outils (Needle 2, 28 Mo de RAM) et la vision sur écran (LFM2.5-VL-3B) n'ont plus besoin de sortir de ton infrastructure.

Pour les décideurs et dirigeants

Négocie sur le coût par tâche aboutie, pas sur le prix au million de tokens. La baisse de 50 à 80 % annoncée par OpenAI et Anthropic coexiste avec l'annonce d'un siège Premium à 125 dollars, cinq fois le tarif standard. Les deux chiffres sont vrais en même temps.

Date tes remises. Les 50 % de Gemini 3.7 Flash expirent fin 2026, ce qui transforme une économie affichée en coût de migration différé. À budgéter maintenant, pas en décembre.

Ajoute la provenance des poids à ta due diligence fournisseur. Si un produit d'entreprise que tu achètes repose sur un socle ouvert chinois, comme Palmyra X6 sur GLM-5.2, tu dois le savoir avant ton comité de risque, pas après.

Pour l'écosystème français et européen

Shieldstral montre où l'Europe peut réellement gagner : un modèle de modération de 3 milliards de paramètres, testé sur un million de commentaires français, qui tourne en local et ne fait sortir aucune donnée du territoire. La conformité (DSA, RGPD) est un différenciateur produit, pas une contrainte à subir.

Le ticket d'entrée bascule de l'entraînement vers l'hébergement et l'adaptation. Pour spécialiser un modèle compact sur un domaine, on parle désormais de quelques GPU, pas de quelques milliards. Ça rend crédibles des acteurs publics et des ETI qui n'auront jamais les moyens d'un pré-entraînement. Mais adapter un modèle n'est pas être souverain : il reste à réunir les données, les compétences, les évaluations, la sécurité et la capacité à exploiter le tout dans la durée. Le ticket a baissé, il n'a pas disparu.

Point d'alerte : la chaîne d'approvisionnement des socles ouverts est aujourd'hui sino-américaine, et les cadres de commande publique européens n'exigent pas, à ma connaissance, la traçabilité du modèle de base sous un produit d'IA. On achète des boîtes noires empilées sur d'autres boîtes noires.


Le méta-signal de la semaine

Le prix d'un modèle s'effondre parce que le modèle seul a cessé d'être le produit. Les poids restent un actif stratégique ; ce qui disparaît, c'est la possibilité de capturer toute la valeur avec eux ou avec le seul tarif d'API.

Quand une version majeure n'impose plus systématiquement un pré-entraînement complet (GLM-5.3, Grok 4.6, Gemini 3.7 Flash), les poids cessent d'être le point de rareté. Et la valeur remonte d'un étage : vers le routage (Switchyard), vers les données propriétaires ou licenciées (Mercor, Twitch, Apple), vers la distribution (le badge Spotify).

Deux chiffres de terrain résistent à l'enthousiasme, et ce sont les plus utiles de la semaine. 53,8 % de réussite en moyenne pour DeepSeek V4 Flash sur 240 exécutions d'agent réelles. 46 % de taux de fusion pour Claude Code sur le code d'Anthropic lui-même.

La démo se commoditise. Le terrain résiste.

Le token devient moins cher. Le travail automatisé, lui, se facture ailleurs.


Sélection de sources

35 articles cités ci-dessous, sur 73 analysés cette semaine (15 médias).

Nos prédictions

PrédictionHorizonÉchéanceConfianceStatut
Au 18 février 2027, le tarif catalogue du modèle Flash de référence de Google (Gemini 3.7 Flash ou son successeur direct) sera au moins 30 % inférieur à l'ancien tarif catalogue de Gemini 3.6 Flash, pour les tokens d'entrée comme de sortie.6 mois18 févr. 2027hauteEn cours
Au moins deux éditeurs occidentaux distincts, hors Writer, documenteront publiquement un produit commercial dont le modèle principal est dérivé par fine-tuning ou distillation de poids ouverts chinois (GLM, Qwen ou DeepSeek). La simple compatibilité avec ces modèles ne comptera pas.6 mois18 févr. 2027hauteEn cours
Au 18 février 2027, aucun des tarifs catalogue de l'API DeepSeek V4 (entrée non cachée, cache hit ou sortie) ne sera revenu à son niveau antérieur au 13 août 2026, aux heures de pointe comme aux heures creuses.6 mois18 févr. 2027moyenneEn cours
Google annoncera une offre agentique destinée aux entreprises facturée soit plus de trois fois le prix mensuel de son siège standard comparable, soit selon une unité explicitement liée au temps d'exécution d'un agent. OpenAI et Anthropic ont déjà annoncé des sièges Premium à 125 dollars par mois.6 mois18 févr. 2027moyenneEn cours
Aucun modèle en poids ouverts de moins de 40 milliards de paramètres n'atteindra 80 % de réussite sur une évaluation indépendante comprenant au moins 100 exécutions de tâches multi-étapes avec de vrais outils et un protocole public.1 an18 août 2027moyenneEn cours

Une prévision n'est considérée comme réalisée ou invalidée que sur la base d'un tarif public, d'une documentation du fournisseur ou d'une évaluation dont le protocole et les résultats détaillés sont accessibles. L'absence d'une évaluation qualifiante ne validera pas automatiquement la dernière prévision : elle la laissera non résolue.

Questions fréquentes

Pourquoi les prix des API d'IA baissent-ils autant en 2026 ?
Parce que le coût de production d'une nouvelle version s'est effondré. GLM-5.3 et Grok 4.6 sont sortis sans nouveau pré-entraînement du socle, uniquement par post-entraînement. Quand une génération ne coûte plus des mois de calcul, le prix suit. La pression des poids ouverts chinois fait le reste.
Quel modèle open source tourne sur un seul GPU grand public ?
Muse Glimmer de Meta et Nemotron 3.5 Lightning de Nvidia, tous deux à 30 milliards de paramètres, tiennent sous 20 Go de VRAM une fois quantifiés en 4 bits, la quantification faisant le travail sur la mémoire, pas le mélange d'experts ; il faut ensuite réserver de la place au contexte et au cache. Plus léger encore : Shieldstral-1.0-3B pour la modération, LFM2.5-VL-3B pour la vision, et Needle 2 qui fonctionne avec 28 Mo de RAM.
Quelle est la différence entre poids ouverts et open source ?
Les poids ouverts donnent accès aux paramètres du modèle, téléchargeables et exécutables en local. L'open source au sens strict suppose aussi les données et le code d'entraînement, ce que presque personne ne publie. Muse Glimmer et Qwen 3.8 sont sous Apache 2.0, une licence permissive, mais restent des poids ouverts, pas des modèles entièrement open source.
DeepSeek est-il toujours le moins cher du marché ?
Plus systématiquement. DeepSeek a augmenté ses tarifs V4 le 13 août 2026, avec un prix des cache hits multiplié par six, dans la perspective d'une possible introduction en bourse. Il reste compétitif face à MAI Code 1.1 Flash de Microsoft, mais Gemini 3.7 Flash et Grok 4.6 ont resserré l'écart de façon nette.
Peut-on utiliser un modèle chinois à poids ouverts en entreprise en Europe ?
Techniquement oui, et cela se fait déjà : Palmyra X6 de Writer repose sur les poids de GLM-5.2. Exécuté en local ou sur une infrastructure européenne, aucune donnée ne part en Chine. Le vrai enjeu est la traçabilité du socle et la documentation exigée par l'AI Act, pas la nationalité du modèle.
Cette analyse vous a été utile ?

Les chiffres derrière l'analyse

Le Baromètre IA mesure chaque semaine qui domine la couverture médiatique — entités, concepts et tendances.

Suivi en continu

Cette analyse touche les sujets suivants — chaque hub agrège l'actualité quotidienne de l'entité.

Une analyse comme celle-ci chaque semaine

Abonnez-vous pour recevoir l'analyse hebdomadaire directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic