Aller au contenu principal
LLMsMarkTechPost · 2 min de lecture

Alibaba dévoile Qwen3.8-Max, un modèle MoE de 2,4 billions de paramètres, le plus performant de la famille Qwen à ce jour

Source originale ↗·

Alibaba a annoncé la disponibilité générale de Qwen3.8-Max, un modèle de mélange d'experts (MoE) de 2,4 billions de paramètres, le plus puissant à ce jour dans la famille Qwen. L'entreprise a confirmé que les poids ouverts du modèle seront publiés la semaine prochaine, tout comme ceux d'un second modèle, Qwen3.8-27B, plus adapté à un déploiement sur des serveurs GPU classiques. Qwen3.8-Max accepte du texte, des images et de la vidéo en entrée et produit du texte en sortie. Son API hébergée, compatible avec les formats OpenAI et DashScope, est utilisable dès aujourd'hui par toute entreprise, l'intégration se limitant à un changement d'URL de base et d'identifiant de modèle. Le modèle propose une fenêtre de contexte d'un million de tokens, avec une entrée maximale de 991 000 tokens (983 000 en mode réflexion) et une sortie maximale de 131 000 tokens. Les limites de débit sont fixées à 2 millions de tokens par minute et 15 000 requêtes par minute. Côté tarifs, comptez 2 dollars par million de tokens en entrée, 6 dollars en sortie, et 0,25 dollar pour la lecture en cache implicite, un cache huit fois moins cher que les tokens frais. Le modèle intègre nativement cinq outils via l'API Responses, dont un interpréteur de code et la recherche web.

Cette annonce est significative parce qu'elle cible directement des usages professionnels concrets: l'ingénierie logicielle à l'échelle d'un dépôt entier, la revue de documents juridiques et financiers, l'indexation de vidéos longues, l'extraction de données structurées et les assistants de recherche multi-étapes. Mais l'ampleur du modèle pose une vraie question de déploiement. Avec 2,4 billions de paramètres au total, Qwen3.8-Max reste un artefact réservé aux infrastructures de datacenter multi-nœuds, Alibaba n'ayant pas communiqué le nombre de paramètres réellement activés, ce qui empêche pour l'instant d'estimer son coût de service. C'est donc Qwen3.8-27B qui représente la voie réaliste pour un déploiement sur site chez la plupart des entreprises. Les gains de performance les plus nets se situent dans le multimodal et les tâches agentiques plutôt que dans le raisonnement pur: le modèle passe de 21,6 à 56,6 sur DeepSWE 1.1 et de 40,7 à 73,5 sur FrontierSWE par rapport à Qwen3.7-Max.

Sur les benchmarks publiés par Alibaba, Qwen3.8-Max obtient 86,6 sur Terminal-Bench 2.1, devançant Claude Opus 4.8 et Claude Fable 5 (84,6) mais restant derrière GPT-5.6 Sol en mode maximal (88,8). Il domine en revanche sur PaperBench (93,0) et sur plusieurs tests de vision comme OSWorld-Verified (86,1) et OmniDocBench 1.5 (92,1). Deux réserves s'imposent toutefois: la comparaison multimodale se fait face à Qwen3.7-Plus et non Qwen3.7-Max, ce qui gonfle artificiellement les progrès affichés, et la courbe d'apprentissage par renforcement d'Alibaba plafonne à 0,725 avant de redescendre à 0,689, signe que la mise à l'échelle atteint ses limites. Aucune licence ni tableau de benchmark complet n'accompagne pour l'instant l'annonce des poids ouverts, prévus la semaine prochaine.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Alibaba dévoile Qwen3.8-Max, un modèle multimodal de 2 400 milliards de paramètres, quelques jours après le lancement du modèle ouvert Kimi K3 de Moonshot
1MarkTechPost 

Alibaba dévoile Qwen3.8-Max, un modèle multimodal de 2 400 milliards de paramètres, quelques jours après le lancement du modèle ouvert Kimi K3 de Moonshot

Alibaba a dévoilé le 19 juillet 2026, lors de la World AI Conference (WAIC) de Shanghai, une version de démonstration de Qwen3.8-Max, présentée par l'équipe Qwen comme le prochain modèle phare du groupe. Selon Alibaba, il compterait 2 400 milliards de paramètres et se classerait juste derrière Fable 5 parmi les systèmes évalués en interne, mais aucun tableau de benchmarks, aucune fiche technique et aucune licence n'ont été publiés pour étayer ce chiffre. L'accès à cette préversion est déjà ouvert via l'abonnement Token Plan d'Alibaba, ainsi que via Qoder et QoderWork, à 10 % du tarif standard. Le développeur Qwen Shuai Bai a précisé qu'il s'agit du premier modèle multimodal de l'équipe dépassant les 1 000 milliards de paramètres, capable de traiter texte, images, vidéo et documents, et censé surpasser Qwen3.7-Max en codage, développement full-stack, analyse de données et tâches bureautiques. L'annonce est tombée deux jours seulement après le lancement par Moonshot AI de Kimi K3, un modèle à poids ouverts de 2 800 milliards de paramètres, ce qui situe clairement Qwen3.8 dans une course de vitesse entre laboratoires chinois plutôt que dans une simple mise à jour de gamme. Ce que cette annonce change concrètement reste flou tant que les chiffres ne sont pas vérifiés. Le nombre total de paramètres ne reflète pas la puissance de calcul réellement utilisée: Alibaba n'a toujours pas communiqué le nombre de paramètres activés par token, la donnée qui détermine le coût réel de mise en production d'un modèle à mélange d'experts épars (MoE). L'historique de la famille Qwen invite à la prudence: Qwen3-235B-A22B n'active que 22 milliards de paramètres sur ses 235 milliards, et Qwen3-30B-A3B environ 3 milliards seulement. La compatibilité annoncée avec les protocoles OpenAI et Anthropic est en revanche un argument concret pour les développeurs, puisque les agents de codage existants pourraient basculer vers Qwen3.8 sans reconstruire leur infrastructure. Pour l'instant, la seule base vérifiable reste Qwen3.7-Max, lancé en mai 2026 en poids fermés: 92,4 sur GPQA Diamond, 80,4 % sur SWE-bench Verified, 69,7 sur Terminal-Bench 2.0, une fenêtre de contexte d'un million de tokens, à 1,25 dollar par million de tokens en entrée et 3,75 dollars en sortie. Cette annonce s'inscrit dans une compétition de plus en plus frontale entre laboratoires chinois pour la position de leader sur les modèles ouverts, Alibaba et Moonshot AI cherchant chacun à occuper le devant de la scène lors des grands rendez-vous comme la WAIC. Alibaba avait déjà promis l'ouverture des poids pour ses précédents modèles Max sans jamais tenir cette promesse, ce qui pousse à attendre une date précise, une licence et surtout la publication d'un vrai tableau de benchmarks avant de valider les affirmations sur les performances de Qwen3.8.

💬 2 400 milliards de paramètres annoncés sans un seul benchmark publié, c'est une annonce de com', pas un lancement de modèle. Le chiffre qui compte vraiment dans un MoE, c'est le nombre de paramètres activés par token, celui qu'Alibaba ne donne jamais, et l'historique Qwen (22 milliards actifs sur 235, 3 sur 30) laisse penser que Qwen3.8 sera bien plus léger à faire tourner que son total ne le suggère. Reste un vrai plus, la compatibilité annoncée avec les API OpenAI et Anthropic, qui permettrait aux devs de basculer sans tout reconstruire, si elle tient la route en prod.

LLMsOpinion
1 source
Moonshot AI dévoile Kimi K3, un modèle open MoE de 2,8 billions de paramètres avec Kimi Delta Attention et un contexte d'1M tokens
2MarkTechPost 

Moonshot AI dévoile Kimi K3, un modèle open MoE de 2,8 billions de paramètres avec Kimi Delta Attention et un contexte d'1M tokens

Moonshot AI a publié le 17 juillet 2026 son nouveau modèle Kimi K3, un système à 2,8 billions de paramètres doté d'une vision native et d'une fenêtre de contexte d'un million de tokens. L'entreprise chinoise le présente comme le premier modèle ouvert à franchir la barre des 3 000 milliards de paramètres, une taille encore inédite en open source. K3 repose sur une architecture Mixture-of-Experts éparse combinant deux innovations : Kimi Delta Attention (KDA), un mécanisme d'attention linéaire hybride qui accélérerait le décodage jusqu'à 6,3 fois sur des contextes d'un million de tokens, et Attention Residuals (AttnRes), qui optimise la circulation de l'information à travers la profondeur du réseau pour un gain d'efficacité d'entraînement d'environ 25 %, moyennant moins de 2 % de coût supplémentaire. Le modèle n'active que 16 de ses 896 experts à la fois grâce à un système baptisé Stable LatentMoE, avec un mécanisme de répartition appelé Quantile Balancing qui élimine les réglages heuristiques habituels. Combinées à d'autres innovations comme Per-Head Muon ou Gated MLA, ces optimisations offrent selon Moonshot une efficacité d'apprentissage 2,5 fois supérieure à celle de son prédécesseur Kimi K2. Pour le déploiement, K3 utilise une quantification en MXFP4 et MXFP8, et Moonshot recommande des configurations d'au moins 64 accélérateurs ; l'entreprise a également contribué une implémentation de KDA au projet vLLM. Sur le plan des performances, Kimi K3 reste globalement en retrait par rapport aux modèles propriétaires les plus puissants du marché, Claude Fable 5 d'Anthropic et GPT 5.6 Sol d'OpenAI, mais il les dépasse sur plusieurs benchmarks spécifiques : Program Bench, SWE Marathon, BrowseComp, Automation Bench et OmniDocBench, ce dernier mesurant l'analyse de documents avec un score de 91,1. Il reste derrière Fable 5 sur les tâches d'ingénierie logicielle complexes (FrontierSWE) et de raisonnement expert (HLE-Full), et derrière GPT 5.6 Sol sur DeepSWE. Pour les développeurs et les entreprises, cela signifie l'arrivée d'une alternative ouverte capable de rivaliser avec les meilleurs modèles fermés sur des cas d'usage concrets comme l'ingénierie logicielle à l'échelle d'un dépôt entier, la recherche automatisée ou le traitement de documents complexes, sans les coûts de licence ni les contraintes d'accès des API propriétaires. Ce lancement s'inscrit dans une course effrénée à la taille et à l'efficacité des modèles ouverts, où Moonshot a occupé neuf des douze derniers mois la position de plus gros modèle disponible en open source. Face à des géants comme Anthropic, OpenAI ou Google, mais aussi face à d'autres acteurs chinois comme Zhipu avec sa gamme GLM, l'entreprise mise sur la sparsité et des architectures d'attention plus efficaces pour compenser l'écart de ressources de calcul. Les cas d'usage mis en avant, agents de codage autonomes fonctionnant sur de longues sessions avec un minimum de supervision humaine, itération entre code et captures d'écran grâce à la vision intégrée, ou encore production de rapports de recherche approfondis s'appuyant sur des milliers de pages consultées, dessinent une trajectoire claire vers des systèmes d'IA capables de mener des tâches complexes en autonomie prolongée. La suite dépendra de l'adoption par la communauté open source et de la capacité de Moonshot à maintenir ce rythme d'innovation architecturale.

💬 Kimi K3 franchit les 2,8 billions de paramètres, mais le chiffre qui compte c'est le 6,3x sur le décodage long contexte, c'est ça qui rend un million de tokens réellement exploitable en prod et pas juste un chiffre marketing. Moonshot tient le rythme depuis neuf mois sur douze en tête de l'open source, et ça commence à ressembler à une stratégie plus qu'à un coup ponctuel. Reste que sur les tâches d'ingénierie complexe, Fable 5 et GPT 5.6 Sol gardent l'avance, l'open source rattrape sur les cas d'usage concrets, pas encore sur le raisonnement pur.

LLMsActu
1 source
Alibaba lance Qwen3.7-Plus : texte, vidéo et images pour 0,4 $/1,6 $ par million de tokens, mais en source fermée
3VentureBeat AI 

Alibaba lance Qwen3.7-Plus : texte, vidéo et images pour 0,4 $/1,6 $ par million de tokens, mais en source fermée

Alibaba a lancé cette semaine Qwen3.7-Plus, son dernier grand modèle de langage multimodal, capable de traiter simultanément du texte, des vidéos et des images. Le modèle est proposé à 0,40 dollar par million de tokens en entrée et 1,60 dollar en sortie, soit 60 % moins cher que son prédécesseur Qwen3.7-Max, sorti quelques semaines plus tôt mais limité au texte seul. Avec une fenêtre de contexte d'un million de tokens et jusqu'à 256 000 tokens dédiés au raisonnement interne, Qwen3.7-Plus cible explicitement les usages agentiques complexes, comme la migration de bases de code ou l'analyse automatisée de documents visuels. Le modèle intègre aussi un paramètre API baptisé "preservethinking", qui conserve les blocs de raisonnement internes entre les tours de conversation, évitant à l'agent de perdre le fil de sa logique au milieu d'une tâche longue. La rupture la plus notable n'est pas technique : Qwen3.7-Plus est distribué sous licence commerciale fermée, uniquement via l'API Alibaba Cloud et le service Qwen Chat. C'est un virage stratégique majeur pour un groupe qui avait construit sa réputation internationale sur la publication de modèles open source puissants, proches de l'état de l'art. Des entreprises comme Airbnb s'appuyaient justement sur ces modèles en accès libre. Pour les développeurs et organisations qui avaient intégré l'open source Qwen dans leurs infrastructures, ce changement de cap impose soit de migrer vers l'API payante d'Alibaba, soit de se tourner vers un concurrent. Sur le plan tarifaire, Qwen3.7-Plus reste compétitif face à des modèles comme MiniMax-M3 (0,30/1,20 dollar) ou Gemini 3.1 Flash-Lite de Google (0,25/1,50 dollar), mais il est dépassé en prix bas par DeepSeek-V4-Flash (0,14/0,28 dollar). Ce lancement s'inscrit dans une dynamique de consolidation des stratégies de monétisation chez les grands labos chinois. Après avoir inondé le marché de modèles open source pour gagner en adoption et en réputation, Alibaba suit une trajectoire similaire à celle d'OpenAI ou Anthropic : garder les modèles les plus capables derrière un accès payant. La fonctionnalité "preservethinking" avait déjà été introduite avec la génération Qwen 3.6, sur les modèles open weight Qwen3.6-27B et le Max propriétaire, signe que la stratégie de différenciation entre open et closed s'élabore depuis plusieurs mois. Avec la course aux modèles multimodaux et agentiques qui s'accélère, l'enjeu pour Alibaba est de ne pas perdre les développeurs séduits par l'ouverture, tout en capturant les revenus que seule une offre cloud fermée peut générer à grande échelle.

UELes développeurs et organisations européennes ayant intégré les modèles Qwen open source dans leurs infrastructures devront migrer vers l'API payante d'Alibaba Cloud ou se tourner vers des alternatives, représentant une contrainte opérationnelle et potentiellement financière concrète.

LLMsOpinion
1 source
550 milliards de paramètres : NVIDIA dévoile son plus gros modèle open source
4Le Big Data 

550 milliards de paramètres : NVIDIA dévoile son plus gros modèle open source

NVIDIA a lancé le 4 juin 2026 Nemotron 3 Ultra, son plus grand modèle open source à ce jour avec 550 milliards de paramètres. Ce modèle repose sur une architecture hybride Mamba-2 et Transformer organisée en système Mixture-of-Experts (MoE), ce qui lui permet de n'activer que les ressources nécessaires à chaque instant. Selon NVIDIA, cette conception permet une inférence jusqu'à cinq fois plus rapide que certains modèles ouverts concurrents, tout en réduisant le coût des tâches agentiques complexes jusqu'à 30 %. Sur les benchmarks de productivité pour agents IA, Nemotron 3 Ultra atteint 91 %, avec des résultats solides également sur le suivi d'instructions, le travail professionnel et la gestion de très longs contextes. Le modèle est disponible dès maintenant et optimisé pour les frameworks Hermes Agent, LangChain et OpenClaw. Ce lancement marque un pari stratégique clair de NVIDIA sur le marché des agents IA autonomes, considéré comme la prochaine rupture majeure du secteur. Contrairement à un chatbot classique, un agent IA peut planifier ses actions en séquence, utiliser des outils externes, corriger ses erreurs en cours d'exécution et mener des tâches complexes avec une intervention humaine minimale. En rendant un modèle de cette envergure accessible en open source, NVIDIA permet aux développeurs de le modifier, l'affiner et l'intégrer dans des projets de programmation, de recherche ou d'automatisation sans dépendance à une API propriétaire. C'est un argument de poids face aux modèles fermés de OpenAI ou Anthropic, et une invitation directe aux entreprises souhaitant garder le contrôle de leur infrastructure IA. NVIDIA s'inscrit dans une course effrénée au modèle frontier open source qui s'est intensifiée depuis que Meta a popularisé le format avec la série LLaMA. L'entreprise, dont la domination sur le matériel GPU lui confère une position unique, cherche désormais à peser aussi sur la couche logicielle et modèles. Nemotron 3 Ultra n'est toutefois pas sans limites : sur des benchmarks spécialisés en programmation ou en planification à très long terme, des modèles comme GLM 5.1 ou Kimi K2.6 conservent des avantages mesurables. Aucun acteur ne détient encore la formule universelle pour les agents autonomes, et la compétition reste ouverte. Les prochains mois diront si Nemotron 3 Ultra trouve une adoption réelle dans les projets d'infrastructure IA, ou s'il reste une vitrine de puissance technique dans un catalogue déjà très encombré.

UELes développeurs et entreprises européens peuvent déployer Nemotron 3 Ultra en local sans dépendance à une API propriétaire américaine, ce qui s'inscrit dans les enjeux de souveraineté numérique portés par l'UE.

💬 NVIDIA avait les GPU, ils veulent maintenant les modèles aussi. L'architecture MoE, la compatibilité native LangChain et Hermes Agent, 550 milliards de paramètres sans dépendance à une API fermée : pour les équipes qui cherchent à garder le contrôle de leur infra, l'offre est vraiment difficile à contourner. Sur la prog avancée et la planification longue, GLM 5.1 ou Kimi K2.6 gardent une longueur d'avance sur certains benchmarks, mais NVIDIA vient de se poser sérieusement sur la couche modèle, pas juste sur le silicium.

LLMsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic