Aller au contenu principal
LLMsLatent Space · 1 min de lecture

[AINews] MiniMax 2.7 : GLM-5 atteint l'état de l'art à un tiers du coût

Source originale ↗·

MiniMax frappe fort avec le lancement de M2.7, son nouveau modèle de langage positionné comme une percée dans l'efficience des modèles ouverts chinois. À peine deux mois après son introduction en bourse, la startup rivalise désormais avec GLM-5 de Z.ai, considéré comme l'état de l'art open source du moment, tout en affichant un coût d'inférence inférieur au tiers.

L'enjeu dépasse la simple performance brute. Dans un secteur où les coûts d'API pèsent lourd sur les décisions d'adoption, M2.7 s'impose sur la frontière coût/performance établie par Artificial Analysis : 0,30 $ / 1,20 $ par million de tokens en entrée/sortie, contre plus du triple pour GLM-5. Pour les équipes qui déploient des agents en production, ce différentiel change concrètement les calculs de rentabilité.

Sur le plan technique, M2.7 revendique 56,22 % sur SWE-Pro, 57,0 % sur Terminal Bench 2 et 97 % d'adhérence aux compétences sur plus de 40 skills. L'Elo GDPval-AA atteint 1 494, devançant MiMo-V2-Pro (1 426) de Xiaomi, GLM-5 (1 406) et Kimi K2.5 (1 283). MiniMax met également en avant une réduction significative des hallucinations par rapport à M2.5. Le modèle est immédiatement disponible sur Ollama, OpenRouter, Vercel et plusieurs autres plateformes. En parallèle, Xiaomi entre dans la course avec MiMo-V2-Pro, un modèle API-only noté 49 sur l'Intelligence Index, avec 1 million de tokens de contexte et une efficience token revendiquée supérieure aux pairs.

La particularité narrative de M2.7 réside dans ce que MiniMax appelle les "Early Echoes of Self-Evolution" : le modèle aurait participé activement à sa propre évolution, en collectant des retours, construisant des jeux d'évaluation et itérant sur ses propres skills et architecture MCP. Une affirmation ambitieuse, nuancée par l'équipe elle-même, M2.7 ne couvrirait que 30 à 50 % du workflow de cette auto-amélioration. Un signal fort néanmoins, qui s'inscrit dans la tendance plus large du secteur : le vrai différenciateur n'est plus le modèle seul, mais l'infrastructure d'exécution, ce que les praticiens appellent désormais le harness engineering.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

GLM-5.2 à poids ouverts de Z.ai surpasse GPT-5.5 sur plusieurs benchmarks de codage long terme, pour un sixième du coût
1VentureBeat AI 

GLM-5.2 à poids ouverts de Z.ai surpasse GPT-5.5 sur plusieurs benchmarks de codage long terme, pour un sixième du coût

La startup chinoise Z.ai (anciennement Zhipu AI) a annoncé le 17 juin 2026 la disponibilité immédiate de GLM-5.2, un modèle de langage open-weights de 753 milliards de paramètres conçu spécifiquement pour les tâches de développement logiciel autonomes et de longue durée. Le modèle est accessible dès maintenant sur Hugging Face, via l'API Z.ai et dans plus de 20 environnements de développement tiers. Il dispose d'une fenêtre de contexte stable d'un million de tokens et des abonnements entreprise démarrent à 12,60 dollars par mois. Ses poids sont publiés sous licence MIT sans restriction, permettant à quiconque de le télécharger, de le personnaliser et de le déployer localement. Sur les benchmarks industriels, GLM-5.2 surpasse GPT-5.5 d'OpenAI sur plusieurs épreuves clés : SWE-bench Pro (62,1 contre 58,6), FrontierSWE (74,4 % contre 72,6 %), MCP-Atlas (77,0 contre 75,3) et PostTrainBench (34,3 % contre 25,0 %). Il talonne Claude Opus 4.8 d'Anthropic sur la quasi-totalité de ces tests. La sortie de GLM-5.2 arrive à un moment stratégiquement décisif pour les entreprises qui dépendent de modèles d'IA de pointe. La semaine précédente, l'administration Trump a publié une directive de contrôle des exportations interdisant aux ressortissants étrangers d'utiliser Claude Fable 5 d'Anthropic, ce qui a conduit Anthropic à retirer ce modèle de l'accès global pour tous les utilisateurs. Pour les responsables techniques en dehors des États-Unis, GLM-5.2 offre une alternative concrète : un modèle de niveau frontier hébergeable en interne, hors de portée des restrictions géographiques et des aléas réglementaires américains. Son coût d'exploitation réduit à un sixième de celui des modèles propriétaires équivalents renforce encore son attrait pour les organisations soucieuses de maîtriser leur infrastructure IA. Sur le plan architectural, GLM-5.2 introduit une optimisation appelée IndexShare, qui réutilise un même indexeur pour quatre couches d'attention sparse consécutives, réduisant de 2,9 fois le nombre de FLOPs par token à longueur de contexte maximale. Le modèle intègre également une couche Multi-Token Prediction améliorée, qui accroît de 20 % la longueur des tokens acceptés lors de l'inférence, ainsi que des modes de raisonnement sélectionnables, "Max" pour la puissance maximale, "High" pour un équilibre performance-latence. Z.ai s'inscrit ainsi dans une tendance de fond portée par des acteurs chinois comme DeepSeek, qui misent sur l'open-source et l'efficacité architecturale pour rivaliser avec les laboratoires occidentaux disposant de budgets bien supérieurs. Avec GLM-5.2, la compétition pour le leadership en IA agentic se déplace clairement au-delà des frontières américaines.

UELes entreprises et développeurs français et européens disposent désormais d'une alternative frontier auto-hébergeable sous licence MIT, hors de portée des restrictions d'exportation américaines qui ont récemment limité l'accès aux modèles de pointe d'Anthropic.

💬 Le moment est trop bien choisi pour être un hasard. Z.ai sort un 753 milliards de paramètres open-weights qui passe devant GPT-5.5 sur le code, MIT, hébergeable où tu veux, pile une semaine après qu'Anthropic a dû couper Fable 5 globalement sur pression de Washington. Pour les boîtes européennes qui cherchaient une sortie de la dépendance cloud américaine, bon, la voilà.

LLMsOpinion
1 source
MiniMax-M3 surpasse GPT-5.5 et Gemini 3.1 Pro sur des benchmarks clés, pour 5 à 10 % du coût
2VentureBeat AI 

MiniMax-M3 surpasse GPT-5.5 et Gemini 3.1 Pro sur des benchmarks clés, pour 5 à 10 % du coût

La startup chinoise MiniMax a lancé dimanche soir son modèle de langage MiniMax-M3, se positionnant d'emblée comme une alternative redoutable aux modèles propriétaires américains. Disponible via l'API MiniMax à un tarif promotionnel de 0,30 dollar par million de tokens en entrée et 1,20 dollar par million en sortie, le modèle affiche des performances supérieures à GPT-5.5 d'OpenAI et à Gemini 3.1 Pro de Google sur plusieurs benchmarks clés, pour 5 à 10 % de leur coût. Même à plein tarif, 0,60 dollar l'entrée et 2,40 dollars la sortie, M3 revient à seulement 8 à 20 % du prix des grands modèles propriétaires concurrents. L'entreprise a également annoncé la mise à disposition sous licence open source avec poids ouverts dans les dix prochains jours, permettant aux entreprises de télécharger et personnaliser le modèle gratuitement. M3 intègre par ailleurs une fenêtre de contexte d'un million de tokens, une multimodalité native, et des capacités avancées en codage et en traitement de tâches agentiques, avec un abonnement mensuel à partir de 20 dollars. Ce lancement remet en question une règle non écrite du secteur : les développeurs devaient jusqu'ici choisir entre des modèles fermés très performants mais coûteux, ou des modèles open source accessibles mais limités sur les raisonnements complexes et les longues séquences. MiniMax-M3 brouille cette frontière en combinant performance de pointe et coût marginal, ce qui pourrait redistribuer les cartes pour les équipes de développement cherchant à intégrer des capacités d'IA avancées sans exploser leurs budgets d'inférence. La possibilité de déployer les poids en local renforce encore l'intérêt pour les entreprises soucieuses de confidentialité ou cherchant à s'affranchir de dépendances API. Cette percée s'inscrit dans un mouvement plus large de rattrapage des laboratoires chinois face aux géants américains. DeepSeek, Alibaba avec Qwen, Moonshot via Kimi et désormais MiniMax publient à un rythme soutenu des modèles compétitifs à des prix agressifs, alimentant une guerre tarifaire qui contraint OpenAI, Google et Anthropic à revoir leurs propres grilles. Sur le plan technique, M3 repose sur une architecture originale baptisée MiniMax Sparse Attention, qui rompt avec les mécanismes d'attention traditionnels dont le coût de calcul croît quadratiquement avec la longueur des séquences. En découpant les matrices clé-valeur en blocs ciblés lus une seule fois, cette approche permet d'être plus de quatre fois plus rapide que des alternatives open source comparables sur de longues séquences. La disponibilité imminente des poids ouverts pourrait transformer M3 en référence de facto pour les entreprises cherchant un modèle frontier déployable en interne.

UELes développeurs et entreprises européens disposent d'une alternative frontier open source déployable localement, réduisant la dépendance aux API américaines et les coûts d'inférence de 80 à 95 %.

💬 C'est le lancement qui va forcer OpenAI et Google à bouger leurs prix, et cette fois c'est difficile à ignorer. 5 à 10 % du coût avec les benchmarks qui suivent, et les poids ouverts dans dix jours pour déployer en local, si tu travailles avec des LLMs tu vas regarder ça de près. Reste à voir ce que ça donne en conditions réelles, mais l'architecture Sparse Attention sur les longues séquences, c'est une vraie proposition technique, pas juste du dumping tarifaire.

LLMsOpinion
1 source
GPT-5.6 Sol égale presque Fable 5 sur les benchmarks agrégés, pour un tiers du coût
3The Decoder 

GPT-5.6 Sol égale presque Fable 5 sur les benchmarks agrégés, pour un tiers du coût

OpenAI a présenté GPT-5.6 Sol, une nouvelle version de son modèle phare, qui obtient 59 points sur l'Artificial Analysis Intelligence Index, un indice qui agrège plusieurs benchmarks pour évaluer les capacités des grands modèles de langage. Ce score place Sol à seulement un point derrière Claude Fable 5, le modèle le plus avancé d'Anthropic, considéré jusqu'ici comme la référence du secteur. La différence la plus marquante se situe toutefois du côté du prix : chaque tâche traitée par Sol coûte 1,04 dollar, soit environ un tiers du tarif facturé par Anthropic pour Fable 5. Sur les benchmarks de codage agentique, qui évaluent la capacité d'un modèle à exécuter des tâches complexes de façon autonome, Sol devance même l'ensemble de ses concurrents, Fable 5 y compris. Pour les entreprises et les développeurs qui choisissent quel modèle intégrer dans leurs produits, cet écart de prix change la donne : obtenir des performances quasiment équivalentes à celles du modèle le plus coté du marché, pour un tiers du coût, rend Sol particulièrement attractif pour les usages à grande échelle, où la facture de l'API pèse lourd. Le secteur du codage agentique, en pleine expansion avec la multiplication des assistants capables d'écrire et d'exécuter du code sans supervision constante, est particulièrement concerné. En prenant la tête sur ces benchmarks tout en restant nettement moins cher, OpenAI met une pression tarifaire directe sur Anthropic, qui devra soit baisser ses prix, soit justifier son positionnement premium par des gains de performance plus nets. Cette annonce s'inscrit dans une compétition de plus en plus serrée entre les grands laboratoires d'IA, où les écarts de performance entre modèles concurrents se resserrent d'une génération à l'autre, tandis que la guerre des prix s'intensifie. Anthropic, OpenAI et leurs rivaux misent de plus en plus sur les capacités agentiques, jugées déterminantes pour convaincre les entreprises d'automatiser des tâches de développement logiciel. L'Artificial Analysis Intelligence Index, devenu une référence pour comparer les modèles de façon indépendante, illustre à quel point les positions en tête de classement peuvent désormais basculer en quelques mois. Reste à voir comment Anthropic réagira à cette pression sur ses tarifs, et si d'autres acteurs suivront la stratégie d'OpenAI consistant à combiner performances de pointe et prix agressifs.

LLMsOpinion
1 source
Databricks fait de GLM 5.2, un modèle open-source chinois, son moteur de code par défaut après l'avoir vu égaler Opus à moindre coût
4The Decoder 

Databricks fait de GLM 5.2, un modèle open-source chinois, son moteur de code par défaut après l'avoir vu égaler Opus à moindre coût

Databricks a comparé plusieurs agents de codage IA en les testant directement sur sa propre base de code, longue de plusieurs millions de lignes. Résultat : le modèle chinois en open source GLM 5.2 a égalé les performances d'Opus 4.8 d'Anthropic, tout en coûtant 1,28 dollar par tâche contre 1,94 dollar pour son concurrent américain. Face à ce résultat, l'entreprise a décidé d'adopter GLM 5.2 comme moteur de codage par défaut pour un usage quotidien. Ce choix a une portée qui dépasse la simple question du prix. Pour les entreprises qui déploient des agents de codage IA à grande échelle, chaque dollar économisé par tâche se multiplie rapidement sur des milliers d'exécutions quotidiennes. Le fait qu'un modèle open source chinois puisse rivaliser avec les meilleures offres propriétaires américaines change la donne pour les équipes techniques qui cherchaient jusqu'ici à limiter leurs coûts sans sacrifier la qualité du code produit. Cela ouvre aussi la voie à une diversification des fournisseurs, réduisant la dépendance à un seul acteur. Cette décision s'inscrit dans un contexte où la concurrence entre modèles de langage s'intensifie, notamment avec la montée en puissance des modèles chinois open source face aux géants américains comme Anthropic ou OpenAI. La conclusion la plus significative que tire Databricks de son étude n'est pas tant le choix de GLM 5.2 en lui-même, mais la remise en cause des benchmarks publics habituels : aucun fournisseur ne domine systématiquement toutes les tâches, et les résultats varient fortement selon le cas d'usage réel. L'entreprise recommande donc aux équipes techniques de construire leurs propres évaluations, adaptées à leur code et à leurs besoins spécifiques, plutôt que de se fier aux classements génériques disponibles publiquement.

💬 Ce qui saute aux yeux ici, ce n'est pas GLM 5.2 en lui-même, c'est que Databricks a jeté les benchmarks publics à la poubelle pour tester sur son propre code. Et c'est ça la vraie leçon : aucun modèle ne domine partout, ça dépend du cas d'usage réel, donc arrêtez de choisir un LLM sur un classement générique. Pour le prix par contre, 1,28 dollar contre 1,94, ça reste un détail sympa mais pas la révolution qu'on nous vend.

LLMsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic