Aller au contenu principal
LLMs · Tuto ·

Déploiement de Qwen3.8-2.4T-A95B sur Amazon SageMaker HyperPod avec vLLM

Alibaba a publié le 12 août 2026, via son équipe Qwen, le modèle Qwen3.8-2.4T-A95B, première déclinaison en poids ouverts d'un modèle de la classe Qwen-Max. Il totalise 2,4 billions de paramètres, dont seulement 95 milliards sont activés par token, grâce à une architecture de mélange d'experts fine (512 experts routés plus un expert partagé, 10 activés par passage) répartie sur 92 couches. Sa conception hybride combine des couches Gated DeltaNet à attention linéaire, à mémoire récurrente de taille fixe, et des couches Gated Attention à attention complète classique, selon un ratio de 3 pour 1 sur l'ensemble du réseau. Le modèle gère nativement un contexte de 262 144 tokens, extensible jusqu'à 1 010 000, et peut produire jusqu'à 128 000 tokens en sortie. Il intègre aussi un mécanisme natif de prédiction multi-token qui permet du décodage spéculatif sans modèle auxiliaire séparé. Des quantifications communautaires MXFP4 et NVFP4 ramènent son empreinte à environ 1,2 téraoctet, ce qui le rend déployable sur un seul nœud à huit GPU. Amazon a détaillé, dans un billet technique, comment l'installer sur son infrastructure SageMaker HyperPod avec le moteur d'inférence vLLM, sur une instance ml.p6-b300 équipée de huit GPU NVIDIA B300 Blackwell Ultra.

2 min de lecturePertinence 55

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

L'enjeu dépasse la simple prouesse technique. En rendant public un modèle de cette envergure, comparable en capacités à Qwen-Max, Alibaba donne aux entreprises la possibilité d'héberger elles-mêmes un système de raisonnement de pointe, sans dépendre d'une API facturée à l'usage ni faire transiter leurs données par un tiers. Le paramètre reasoning_effort, réglable sur trois niveaux, permet en outre d'ajuster la profondeur de raisonnement selon la tâche, ce qui optimise les coûts de calcul pour des usages agentiques comme le codage multi-étapes, la planification longue durée ou l'utilisation autonome d'outils. La contrepartie reste opérationnelle : faire tourner un modèle de 2,4 billions de paramètres exige une infrastructure GPU spécialisée et une pile logicielle optimisée, un frein que peu d'organisations peuvent lever seules.

Ce lancement s'inscrit dans une compétition mondiale entre laboratoires chinois et américains pour dominer l'IA en poids ouverts destinée aux charges de travail agentiques les plus exigeantes. Il fait suite à un précédent billet d'Amazon consacré au déploiement du modèle Kimi K3 sur SageMaker HyperPod et Amazon EKS, signe d'une stratégie suivie pour industrialiser l'hébergement de modèles à un billion de paramètres ou plus. Sur les bancs d'essai cités par l'éditeur, Qwen3.8-2.4T-A95B affiche de solides performances en recherche (score de 93,0 sur PaperBench), en respect des instructions (82,8 sur IFBench) et en codage en environnement terminal (86,6), tout en restant en retrait des meilleurs modèles fermés sur les tâches complexes à l'échelle d'un dépôt logiciel complet, mesurées par SWE-bench Pro.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

Notre lecture

Alibaba met un Qwen-Max en poids ouverts sur la table, zéro facture à l'usage, zéro donnée qui part chez un tiers. Sauf que pour le faire tourner il te faut huit GPU B300 rien que pour un nœud, donc ce cadeau reste réservé à ceux qui ont déjà l'infra ou le budget pour la louer chez AWS. Ce genre de sortie, c'est surtout un coup de plus dans la course entre labos chinois et américains à qui contrôle l'IA agentique en poids ouverts, celle qui pilote les outils toute seule.

À lire ensuite

01Déploiement de Kimi K3 sur Amazon SageMaker HyperPod et Amazon EKS44AWS ML BlogInfrastructure 02Améliorez la précision des appels d'outils de vos agents avec SFT et DPO sur Amazon SageMaker AI41AWS ML BlogLLMs 03Affiner un LLM avec Databricks Unity Catalog et Amazon SageMaker AI42AWS ML BlogLLMs 
Dossier · Qwen3Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.