Aller au contenu principal
LLMs · Actu ·

Alibaba dévoile Qwen3.8-Flash-Next, un modèle MoE multimodal de 125 milliards de paramètres qui préfigure Qwen4

L'équipe Qwen d'Alibaba a dévoilé Qwen3.8-Flash-Next, un modèle multimodal à mélange d'experts (MoE) publié en poids ouverts et conçu pour minimiser le coût par token. Il combine un socle de 125 milliards de paramètres, une table d'embeddings N-gram de 51 milliards de paramètres et un module de prédiction multi-token de 4 milliards, pour un total de 180 milliards de paramètres sur disque, dont seulement 6 milliards s'activent réellement à chaque token. Alibaba présente ce modèle comme un aperçu de l'architecture qui équipera Qwen4, sur le même principe que Qwen3-Next avait préfiguré Qwen3.5. Quatre nouveautés portent cette version : une attention hybride associant Gated DeltaNet et Qwen Sparse Attention, un mécanisme de résidu à portes (Gated Residual), l'embedding N-gram, et l'optimiseur Muon. Le coût d'entraînement serait environ neuf fois inférieur à celui de Qwen3.7-Plus. Côté déploiement, la version FP8 pèse 172,78 Gio et la version BF16 335,28 Gio ; il faut au minimum deux GPU en parallélisme tensoriel (TP2) sur des puces GB300, quatre étant recommandés, et une configuration TEP8 sur un nœud à huit GPU H200. Le contexte natif atteint 262 144 tokens, extensible à un million via YaRN. Sur les benchmarks, le modèle obtient 58,7 sur DeepSWE 1.1, 62,5 sur SWE-bench Pro, 81,0 sur SWE-bench Multilingual et 91,9 sur LiveCodeBench v6, ainsi que 84,5 sur AndroidWorld et 95,7 sur MathVision avec interpréteur de code.

2 min de lecturePertinence 57
Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette annonce illustre une tendance de fond : réduire drastiquement le coût de calcul des grands modèles sans sacrifier leurs capacités, grâce à une activation clairsemée des paramètres. Les gains annoncés en matière de service sont significatifs, jusqu'à 7,6 fois plus rapide en préremplissage et 4,9 fois en décodage à un million de tokens selon Qwen, avec des chiffres encore plus élevés cités par les recettes SGLang et vLLM, même si ces performances restent pour l'instant des annonces du fournisseur, non vérifiées de façon indépendante. Un débit de préremplissage multiplié par 8,6 par rapport à Qwen3.7-Plus est également revendiqué. Pour les entreprises et développeurs, cela signifie un modèle de pointe accessible via vLLM, SGLang, TokenSpeed, transformers serve ou llama.cpp, avec un fine-tuning possible via Unsloth, Swift ou LLaMA-Factory, déjà intégré au mode « Standard » de QwenWork et à Qwen Code. Il reste toutefois hors de portée d'une simple station de travail, nécessitant des clusters de GPU haut de gamme.

Ce lancement s'inscrit dans la compétition mondiale sur les modèles de codage et d'agents autonomes, où Alibaba cherche à rivaliser avec Anthropic et DeepSeek. Sur ce terrain, Qwen3.8-Flash-Next reste compétitif sans dominer partout : Claude Opus 4.6 le devance sur le test de raisonnement HLE (40,0 contre 35,9) et DeepSeek-V4-Flash-0731 fait mieux sur NL2Repo-Bench (54,2 contre 48,1), signe que le raisonnement de pointe demeure un point faible. Ce modèle sert avant tout de démonstrateur technique avant l'arrivée de Qwen4, dans une course où chaque acteur cherche à combiner puissance, contexte étendu et coût de calcul réduit pour équiper agents logiciels et assistants professionnels.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Alibaba dévoile Qwen3.8-Max, un modèle multimodal de 2 400 milliards de paramètres, quelques jours après le lancement du modèle ouvert Kimi K3 de Moonshot42MarkTechPostLLMs 02Alibaba dévoile Qwen3.8-Max, un modèle MoE de 2,4 billions de paramètres, le plus performant de la famille Qwen à ce jour45MarkTechPostLLMs 03Thinking Machines Lab publie Inkling-Small, un modèle multimodal MoE en open weights (276 milliards de paramètres, 12 milliards actifs)44MarkTechPostLLMs 
Dossier · Qwen3Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.