Aller au contenu principal
LLMsNext INpact · 2 min de lecture

Qwen3.8-Max : Alibaba revient dans la course pour rivaliser avec Fable 5 et Kimi K3

Source originale ↗·

Alibaba a dévoilé Qwen3.8-Max, un modèle de langage doté de 2 400 milliards de paramètres, quinze jours seulement après le lancement de Kimi K3 par Moonshot AI, un autre acteur chinois du secteur. Contrairement à Kimi K3 et ses 2 800 milliards de paramètres et 104,2 milliards de paramètres actifs par token, Qwen3.8-Max repose sur une architecture Mixture of Experts activant 95 milliards de paramètres par token, tout en nécessitant le chargement complet du modèle en mémoire. Alibaba revendique, benchmarks à l'appui, des performances comparables à Gemini 3.1-Pro, GPT-5.6 Sol et Fable 5 sur le raisonnement multimodal, l'analyse d'images en tant qu'« agent visuel », le code et l'analyse de documents. Comme Moonshot AI l'avait fait avec Kimi K3, Alibaba promet de rendre les poids du modèle disponibles en open source sur Hugging Face et ModelScope dans la semaine, après une exclusivité initiale sur sa propre plateforme QwenCloud. Côté tarifs, l'entreprise affiche 2 dollars par million de tokens en entrée et 6 dollars en sortie, des prix inférieurs à ceux de Kimi K3 (3 et 15 dollars), GPT-5.6 Sol (5 et 30 dollars), Opus 4.8 (5 et 25 dollars) et Fable 5 (10 et 50 dollars).

Cette sortie confirme que les entreprises chinoises de l'IA générative continuent de talonner les leaders américains, un an après le « moment DeepSeek » qui avait déjà bousculé le secteur. En ciblant explicitement le code et l'automatisation des tâches de bureau, Alibaba se positionne frontalement contre Anthropic, un terrain jusque-là dominé par cette dernière. Pour appuyer sa démonstration, l'entreprise met en avant trois défis réalisés sans intervention humaine, écriture et exécution de code exclues : la génération du projet « oh-my-cli » en dix jours, la reproduction du code d'un article scientifique, et un concours de compréhension des besoins clients. Alibaba insiste sur le fait que son modèle ne se contente pas de suivre un plan prédéfini mais s'adapte grâce à des boucles de rétroaction, un argument destiné à convaincre les développeurs et les entreprises cherchant à automatiser des tâches complexes. Les prix cassés renforcent l'attractivité du modèle pour les usages à grande échelle.

Reste que la comparaison des prix par million de tokens masque une réalité plus complexe, comme le montre l'exemple d'Opus 4.7 qui consommait ses tokens bien plus rapidement qu'Opus 4.6 sans que cela soit reflété dans le tarif affiché. Plusieurs utilisateurs de Qwen3.8-Max rapportent déjà avoir épuisé leur quota en quelques prompts seulement, ce qui interroge sur l'écart entre le prix nominal et le coût réel d'usage. Cette question de la consommation de tokens devient centrale dans un marché où les modèles surenchérissent sur les benchmarks et les tarifs, sans que les utilisateurs disposent toujours d'outils fiables pour comparer l'efficacité réelle de chaque système face à leurs besoins concrets.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1Le Big Data 

Qwen 3.8-Max : Alibaba clash la Silicon Valley avec une IA puissante et… open weight

Alibaba a dévoilé le 3 août 2026 Qwen 3.8-Max, le modèle le plus puissant de toute la famille Qwen à ce jour. Contrairement aux modèles fermés d'OpenAI ou d'Anthropic, celui-ci sera open-weight : ses poids seront publiés la semaine prochaine, et Qwen3.8-27B suivra le même chemin. Le modèle est déjà accessible sur la plateforme officielle Qwen et le sera bientôt sur Model Studio, la plateforme cloud d'Alibaba. Techniquement, il s'agit d'un modèle multimodal capable de traiter texte, images et vidéo dans une même conversation, avec une fenêtre de contexte d'un million de tokens. Alibaba affirme qu'il peut analyser des rapports financiers de plusieurs centaines de pages en comprenant simultanément texte, graphiques et tableaux, ou encore parcourir plus de 100 heures de vidéo pour identifier personnages, événements et changements de scène. Le modèle repose sur une architecture Mixture of Experts avec 2 400 milliards de paramètres au total, dont seulement 95 milliards activés à chaque requête. Cette approche change la donne pour l'accès à l'IA de pointe. En rendant public un modèle qui rivalise avec les meilleures offres américaines, Alibaba permet à des chercheurs et développeurs du monde entier de télécharger, étudier et adapter le modèle sur leurs propres infrastructures, sans dépendre d'une API propriétaire. Les résultats publiés sont significatifs : sur PaperBench, qui évalue la capacité à reproduire un article scientifique en code, Qwen 3.8-Max obtient 93 sur 100, devançant Fable 5 (88,8) et Claude Opus 4.8 (80,3). Sur OSWorld, qui mesure l'usage d'un ordinateur comme le ferait un humain, il prend la première place mondiale avec 86,1. Pour les entreprises et développeurs, cela signifie un accès à des capacités de pointe en codage autonome et en automatisation, à moindre coût grâce à l'architecture MoE qui limite les ressources mobilisées par requête. Ce lancement s'inscrit dans une compétition de plus en plus vive entre laboratoires chinois et américains. Sur Arena.AI, Qwen 3.8-Max s'est immédiatement classé premier modèle chinois pour les tâches textuelles, même s'il reste derrière Claude Fable 5 au niveau mondial. En vision par ordinateur, il se classe deuxième, juste derrière une variante de Claude Fable 5. Alibaba le compare directement à Kimi K3, le modèle de Moonshot AI doté de 2 800 milliards de paramètres, signe que plusieurs acteurs chinois jouent désormais dans la même catégorie que les géants américains. Reste que les benchmarks ne disent pas tout : l'usage en conditions réelles déterminera si cette avance open source chinoise se confirme face à des modèles fermés qui gardent, pour l'instant, une légère longueur d'avance sur certains terrains.

LLMsActu
1 source
2VentureBeat AI 

Qwen3.8-Max affirme surpasser GPT-5.6 Sol Max et Fable 5 sur l'usage d'ordinateur à base d'agents

L'équipe Qwen d'Alibaba a dévoilé son nouveau modèle phare Qwen3.8-Max, un grand modèle de langage multimodal de type mixture-of-experts doté de 2 400 milliards de paramètres, conçu pour l'ingénierie logicielle autonome et les tâches d'entreprise à long horizon. Sur le benchmark OSWorld-Verified, qui évalue les agents capables d'utiliser un ordinateur de bureau, Qwen3.8-Max obtient un score de 86,1, devant GPT-5.6 Sol Max (83,2), Fable 5 (85,0) et Gemini 3.1 Pro (76,2). Le modèle affiche également les meilleurs résultats publiés sur PaperBench (93,0), TerminalBench 2.1 (86,6), Vision2Web (69,0), LVBench (81,8) et ERQA (77,8). Alibaba a par ailleurs annoncé la publication des poids ouverts de Qwen3.8-Max la semaine prochaine, accompagnés d'une version plus légère, Qwen3.8-27B, sans toutefois préciser les termes exacts de la licence. Cette annonce marque un tournant potentiellement important pour Alibaba, qui positionne son modèle non pas comme un assistant conversationnel mais comme un collègue autonome capable de mener à bien des projets s'étalant sur plusieurs jours plutôt que quelques minutes. Selon l'entreprise, Qwen3.8-Max peut réaliser seul des projets logiciels de plus de dix jours, reproduire des articles de recherche impliquant des milliers de lignes de code, optimiser de manière itérative la conception de puces électroniques et réviser continuellement ses plans à partir de retours multimodaux. Si la licence s'avère réellement permissive, comme Apache 2.0, il s'agirait de la première fois qu'un modèle Qwen de catégorie Max devient disponible pour un déploiement auto-hébergé, ce qui pourrait bouleverser l'adoption en entreprise face aux modèles propriétaires d'OpenAI, d'Anthropic ou de Google. Ces démonstrations restent toutefois produites par Alibaba elle-même et n'ont pas encore été vérifiées de façon indépendante. Cette sortie illustre une tendance de fond du secteur: la compétition entre modèles de pointe se spécialise de plus en plus. OpenAI concentre sa gamme GPT sur le raisonnement général et la productivité multimodale, Anthropic mise sur le code et la fiabilité en contexte long avec Claude, Google pousse Gemini vers des flux de travail multimodaux natifs du web, tandis que Moonshot AI a récemment introduit son modèle ouvert Kimi K3. Qwen3.8-Max tente de réunir plusieurs de ces atouts en un seul modèle, dans un contexte où les benchmarks récompensent désormais autant la capacité à mener à terme un flux de travail complet que la simple exactitude d'une réponse ponctuelle. La domination du modèle chinois n'est cependant pas totale: OpenAI conserve la tête sur le benchmark d'ingénierie logicielle professionnelle SWE-Pro, et Opus 4.8 reste devant sur certaines évaluations de développement ainsi que sur Agents' Last Exam, signe que la course aux modèles frontières se fragmente plutôt qu'elle ne désigne un vainqueur unique.

💬 Le score sur OSWorld, c'est Alibaba qui le mesure sur son propre modèle, donc je garde une réserve tant que personne d'indépendant ne l'a reproduit. Ce qui compte vraiment ici, c'est ailleurs : si la licence des poids ouverts s'avère bien permissive la semaine prochaine, ce sera la première fois qu'un Qwen catégorie Max devient auto-hébergeable, et ça change le rapport de force pour toute boîte qui ne veut plus dépendre d'un abonnement OpenAI ou Anthropic pour faire tourner un agent de code. Reste que la course aux modèles frontières ne désigne plus un vainqueur unique, elle se fragmente benchmark par benchmark.

LLMsActu
1 source
GLM-5.2 rivalise avec GPT ; Z.ai prévoit la sortie d'Open Fable en décembre
3Latent Space 

GLM-5.2 rivalise avec GPT ; Z.ai prévoit la sortie d'Open Fable en décembre

GLM-5.2, le dernier modèle de langage de Zhipu AI, filiale de Z.ai, s'est imposé cette semaine comme l'événement open source majeur du moment. Plusieurs praticiens indépendants l'ont qualifié de premier modèle en accès libre réellement comparable aux meilleurs systèmes propriétaires. Jeremy Howard, chercheur réputé peu enclin aux effusions, a déclaré qu'il lui semblait « au moins aussi bon qu'Opus 4.8 et GPT-5.5 » pour ses usages quotidiens, soulignant néanmoins l'absence de support visuel comme principale lacune. Le cabinet Artificial Analysis l'a quant à lui classé entre GPT-5.5 et Opus 4.8 sur son nouveau benchmark de travail de connaissance agentique. Côté architecture, GLM-5.2 introduit une innovation appelée IndexShare, qui réutilise les indices d'attention sparse entre groupes de couches pour réduire considérablement le coût de l'inférence sur des contextes de un million de tokens. Sur les tâches internes de Zhipu, il passe de 21 à 48 tâches réussies sur 70 par rapport à son prédécesseur GLM-5.1. Le modèle est disponible gratuitement via les fournisseurs d'inférence Hugging Face pour une durée limitée, et en local via llama.cpp et Unsloth au format GGUF. Ce résultat est important parce qu'il marque un seuil symbolique : pour la première fois, un modèle open weight franchit ce que la communauté appelle le « vibe check frontier », c'est-à-dire la conviction, confirmée par des utilisateurs exigeants, qu'un modèle open source est utilisable en production comme alternative sérieuse aux systèmes fermés de premier rang. Cela change les calculs pour les entreprises, les développeurs et les chercheurs qui cherchent à s'affranchir des API commerciales et des contraintes de confidentialité qui les accompagnent. Z.ai, la société mère, se positionne désormais comme un laboratoire de recherche frontier à part entière, ce qui était encore contestable il y a quelques mois. La même semaine, Poolside AI a publié les poids de Laguna M.1 sous licence Apache 2.0 : un modèle sparse MoE de 225 milliards de paramètres en total et 23 milliards actifs, 256 experts avec top-k=16, 70 couches, contexte de 256 000 tokens, optimisé pour le codage agentique longue durée. L'ascension de Z.ai intervient dans un contexte de forte tension autour des modèles ouverts chinois. En février 2026, Anthropic avait publié un rapport dénonçant une « distillation à l'échelle industrielle » par plusieurs laboratoires chinois, mais Z.ai était notamment absent de cette liste, ce qui renforce sa crédibilité auprès de la communauté occidentale. La question qui domine désormais les discussions est celle du calendrier : Z.ai a laissé entendre qu'un modèle open source de classe Fable, soit l'équivalent du modèle le plus puissant d'Anthropic, pourrait être disponible d'ici décembre 2026. Pendant ce temps, l'incertitude plane sur la capacité des quatre grands laboratoires américains à maintenir leur avance, dans un contexte réglementaire tendu autour de ce que la newsletter appelle le « Mythos ban », qui pourrait freiner leurs prochaines publications majeures.

UELa disponibilité d'un modèle open weight de niveau frontier permet aux entreprises européennes d'auto-héberger une IA compétitive sans dépendre d'API commerciales américaines, facilitant la conformité RGPD.

💬 Ce que Jeremy Howard dit de GLM-5.2, ça m'intéresse plus que les benchmarks : c'est la première fois qu'un praticien exigeant dit qu'il l'utilise au quotidien à la place des modèles fermés. Le vibe check frontier, c'est ça, pas un score sur un leaderboard, la conviction que ça tient en prod. Si t'as des contraintes RGPD et que tu hésitais encore à auto-héberger, les calculs changent là.

LLMsOpinion
1 source
Alibaba dévoile Qwen3.8-Max, un modèle MoE de 2,4 billions de paramètres, le plus performant de la famille Qwen à ce jour
4MarkTechPost 

Alibaba dévoile Qwen3.8-Max, un modèle MoE de 2,4 billions de paramètres, le plus performant de la famille Qwen à ce jour

Alibaba a annoncé la disponibilité générale de Qwen3.8-Max, un modèle de mélange d'experts (MoE) de 2,4 billions de paramètres, le plus puissant à ce jour dans la famille Qwen. L'entreprise a confirmé que les poids ouverts du modèle seront publiés la semaine prochaine, tout comme ceux d'un second modèle, Qwen3.8-27B, plus adapté à un déploiement sur des serveurs GPU classiques. Qwen3.8-Max accepte du texte, des images et de la vidéo en entrée et produit du texte en sortie. Son API hébergée, compatible avec les formats OpenAI et DashScope, est utilisable dès aujourd'hui par toute entreprise, l'intégration se limitant à un changement d'URL de base et d'identifiant de modèle. Le modèle propose une fenêtre de contexte d'un million de tokens, avec une entrée maximale de 991 000 tokens (983 000 en mode réflexion) et une sortie maximale de 131 000 tokens. Les limites de débit sont fixées à 2 millions de tokens par minute et 15 000 requêtes par minute. Côté tarifs, comptez 2 dollars par million de tokens en entrée, 6 dollars en sortie, et 0,25 dollar pour la lecture en cache implicite, un cache huit fois moins cher que les tokens frais. Le modèle intègre nativement cinq outils via l'API Responses, dont un interpréteur de code et la recherche web. Cette annonce est significative parce qu'elle cible directement des usages professionnels concrets: l'ingénierie logicielle à l'échelle d'un dépôt entier, la revue de documents juridiques et financiers, l'indexation de vidéos longues, l'extraction de données structurées et les assistants de recherche multi-étapes. Mais l'ampleur du modèle pose une vraie question de déploiement. Avec 2,4 billions de paramètres au total, Qwen3.8-Max reste un artefact réservé aux infrastructures de datacenter multi-nœuds, Alibaba n'ayant pas communiqué le nombre de paramètres réellement activés, ce qui empêche pour l'instant d'estimer son coût de service. C'est donc Qwen3.8-27B qui représente la voie réaliste pour un déploiement sur site chez la plupart des entreprises. Les gains de performance les plus nets se situent dans le multimodal et les tâches agentiques plutôt que dans le raisonnement pur: le modèle passe de 21,6 à 56,6 sur DeepSWE 1.1 et de 40,7 à 73,5 sur FrontierSWE par rapport à Qwen3.7-Max. Sur les benchmarks publiés par Alibaba, Qwen3.8-Max obtient 86,6 sur Terminal-Bench 2.1, devançant Claude Opus 4.8 et Claude Fable 5 (84,6) mais restant derrière GPT-5.6 Sol en mode maximal (88,8). Il domine en revanche sur PaperBench (93,0) et sur plusieurs tests de vision comme OSWorld-Verified (86,1) et OmniDocBench 1.5 (92,1). Deux réserves s'imposent toutefois: la comparaison multimodale se fait face à Qwen3.7-Plus et non Qwen3.7-Max, ce qui gonfle artificiellement les progrès affichés, et la courbe d'apprentissage par renforcement d'Alibaba plafonne à 0,725 avant de redescendre à 0,689, signe que la mise à l'échelle atteint ses limites. Aucune licence ni tableau de benchmark complet n'accompagne pour l'instant l'annonce des poids ouverts, prévus la semaine prochaine.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic