Qwen3.8-Max affirme surpasser GPT-5.6 Sol Max et Fable 5 sur l'usage d'ordinateur à base d'agents
L'équipe Qwen d'Alibaba a dévoilé son nouveau modèle phare Qwen3.8-Max, un grand modèle de langage multimodal de type mixture-of-experts doté de 2 400 milliards de paramètres, conçu pour l'ingénierie logicielle autonome et les tâches d'entreprise à long horizon. Sur le benchmark OSWorld-Verified, qui évalue les agents capables d'utiliser un ordinateur de bureau, Qwen3.8-Max obtient un score de 86,1, devant GPT-5.6 Sol Max (83,2), Fable 5 (85,0) et Gemini 3.1 Pro (76,2). Le modèle affiche également les meilleurs résultats publiés sur PaperBench (93,0), TerminalBench 2.1 (86,6), Vision2Web (69,0), LVBench (81,8) et ERQA (77,8). Alibaba a par ailleurs annoncé la publication des poids ouverts de Qwen3.8-Max la semaine prochaine, accompagnés d'une version plus légère, Qwen3.8-27B, sans toutefois préciser les termes exacts de la licence.
Cette annonce marque un tournant potentiellement important pour Alibaba, qui positionne son modèle non pas comme un assistant conversationnel mais comme un collègue autonome capable de mener à bien des projets s'étalant sur plusieurs jours plutôt que quelques minutes. Selon l'entreprise, Qwen3.8-Max peut réaliser seul des projets logiciels de plus de dix jours, reproduire des articles de recherche impliquant des milliers de lignes de code, optimiser de manière itérative la conception de puces électroniques et réviser continuellement ses plans à partir de retours multimodaux. Si la licence s'avère réellement permissive, comme Apache 2.0, il s'agirait de la première fois qu'un modèle Qwen de catégorie Max devient disponible pour un déploiement auto-hébergé, ce qui pourrait bouleverser l'adoption en entreprise face aux modèles propriétaires d'OpenAI, d'Anthropic ou de Google. Ces démonstrations restent toutefois produites par Alibaba elle-même et n'ont pas encore été vérifiées de façon indépendante.
Cette sortie illustre une tendance de fond du secteur: la compétition entre modèles de pointe se spécialise de plus en plus. OpenAI concentre sa gamme GPT sur le raisonnement général et la productivité multimodale, Anthropic mise sur le code et la fiabilité en contexte long avec Claude, Google pousse Gemini vers des flux de travail multimodaux natifs du web, tandis que Moonshot AI a récemment introduit son modèle ouvert Kimi K3. Qwen3.8-Max tente de réunir plusieurs de ces atouts en un seul modèle, dans un contexte où les benchmarks récompensent désormais autant la capacité à mener à terme un flux de travail complet que la simple exactitude d'une réponse ponctuelle. La domination du modèle chinois n'est cependant pas totale: OpenAI conserve la tête sur le benchmark d'ingénierie logicielle professionnelle SWE-Pro, et Opus 4.8 reste devant sur certaines évaluations de développement ainsi que sur Agents' Last Exam, signe que la course aux modèles frontières se fragmente plutôt qu'elle ne désigne un vainqueur unique.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




