Alibaba dévoile Qwen3.8-Max, un modèle MoE de 2,4 billions de paramètres, le plus performant de la famille Qwen à ce jour
Alibaba a annoncé la disponibilité générale de Qwen3.8-Max, un modèle de mélange d'experts (MoE) de 2,4 billions de paramètres, le plus puissant à ce jour dans la famille Qwen. L'entreprise a confirmé que les poids ouverts du modèle seront publiés la semaine prochaine, tout comme ceux d'un second modèle, Qwen3.8-27B, plus adapté à un déploiement sur des serveurs GPU classiques. Qwen3.8-Max accepte du texte, des images et de la vidéo en entrée et produit du texte en sortie. Son API hébergée, compatible avec les formats OpenAI et DashScope, est utilisable dès aujourd'hui par toute entreprise, l'intégration se limitant à un changement d'URL de base et d'identifiant de modèle. Le modèle propose une fenêtre de contexte d'un million de tokens, avec une entrée maximale de 991 000 tokens (983 000 en mode réflexion) et une sortie maximale de 131 000 tokens. Les limites de débit sont fixées à 2 millions de tokens par minute et 15 000 requêtes par minute. Côté tarifs, comptez 2 dollars par million de tokens en entrée, 6 dollars en sortie, et 0,25 dollar pour la lecture en cache implicite, un cache huit fois moins cher que les tokens frais. Le modèle intègre nativement cinq outils via l'API Responses, dont un interpréteur de code et la recherche web.
Cette annonce est significative parce qu'elle cible directement des usages professionnels concrets: l'ingénierie logicielle à l'échelle d'un dépôt entier, la revue de documents juridiques et financiers, l'indexation de vidéos longues, l'extraction de données structurées et les assistants de recherche multi-étapes. Mais l'ampleur du modèle pose une vraie question de déploiement. Avec 2,4 billions de paramètres au total, Qwen3.8-Max reste un artefact réservé aux infrastructures de datacenter multi-nœuds, Alibaba n'ayant pas communiqué le nombre de paramètres réellement activés, ce qui empêche pour l'instant d'estimer son coût de service. C'est donc Qwen3.8-27B qui représente la voie réaliste pour un déploiement sur site chez la plupart des entreprises. Les gains de performance les plus nets se situent dans le multimodal et les tâches agentiques plutôt que dans le raisonnement pur: le modèle passe de 21,6 à 56,6 sur DeepSWE 1.1 et de 40,7 à 73,5 sur FrontierSWE par rapport à Qwen3.7-Max.
Sur les benchmarks publiés par Alibaba, Qwen3.8-Max obtient 86,6 sur Terminal-Bench 2.1, devançant Claude Opus 4.8 et Claude Fable 5 (84,6) mais restant derrière GPT-5.6 Sol en mode maximal (88,8). Il domine en revanche sur PaperBench (93,0) et sur plusieurs tests de vision comme OSWorld-Verified (86,1) et OmniDocBench 1.5 (92,1). Deux réserves s'imposent toutefois: la comparaison multimodale se fait face à Qwen3.7-Plus et non Qwen3.7-Max, ce qui gonfle artificiellement les progrès affichés, et la courbe d'apprentissage par renforcement d'Alibaba plafonne à 0,725 avant de redescendre à 0,689, signe que la mise à l'échelle atteint ses limites. Aucune licence ni tableau de benchmark complet n'accompagne pour l'instant l'annonce des poids ouverts, prévus la semaine prochaine.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




