Qwen3.8-27B fait tourner localement des agents de codage et du raisonnement de pointe, sans API cloud
Alibaba a mis en ligne vendredi sur Hugging Face les poids de Qwen3.8-27B, un modèle dense multimodal de 27 milliards de paramètres, sous licence libre Apache 2.0. Présenté comme une version compacte de la génération Qwen3.8, il intègre nativement la compréhension d'images et de vidéos, une fenêtre de contexte de 262 144 tokens, un raisonnement configurable ainsi qu'un support pour le code et les workflows agentiques. Son empreinte matérielle reste réduite : environ 56 Go de mémoire GPU en précision 16 bits, 28 Go en FP8, et seulement 17 Go environ une fois quantifié en 4 bits, un format accessible à un PC de jeu haut de gamme ou à un ordinateur portable bien équipé. Alibaba revendique des scores de 61,7 sur SWE-bench Pro, 90,3 sur LiveCodeBench v6, 70,7 sur son propre benchmark CoWorkBench et 84,3 sur OSWorld-Verified, des résultats qui, selon son tableau comparatif, dépassent ceux de Claude Opus 4.6 Max sur SWE-bench Pro et LiveCodeBench, même si Opus garde l'avantage sur Terminal-Bench, GPQA Diamond et Humanity's Last Exam. Ces chiffres proviennent en partie de tests internes et les protocoles d'évaluation diffèrent d'un comparatif à l'autre, ce qui limite leur valeur comme preuve définitive.
Résumé et traduction réalisés par Le Fil IA à partir de VentureBeat AI. Lire l'article original →
Le lundi suivant, le cabinet indépendant Artificial Analysis a en partie confirmé ces résultats : Qwen3.8-27B obtient un score de 52 sur son Intelligence Index, un indice composite couvrant neuf évaluations en code, sciences, raisonnement et tâches professionnelles, soit exactement le score attribué au modèle propriétaire GPT-5.6 Luna d'OpenAI en mode raisonnement maximal, un service accessible uniquement via le cloud. Sur l'Agentic Index, qui mesure la performance sur des tâches agentiques, Qwen3.8-27B atteint 51 points, devançant Claude Opus 4.8 en raisonnement maximal, un modèle qu'Anthropic n'avait publié que trois mois plus tôt. L'agent de code open source Cline a résumé l'événement sur X en notant qu'il s'agissait de la première fois qu'un modèle local atteignait un niveau de capacité comparable aux modèles de pointe. Pour l'industrie, la nouvelle pèse lourd : un modèle téléchargeable, modifiable et exécutable localement s'approche des performances de systèmes propriétaires jusque-là réservés aux API payantes, ce qui pourrait redistribuer le rapport de force entre laboratoires fermés et écosystème open source, et réduire la dépendance des développeurs aux fournisseurs cloud pour des tâches de codage et de raisonnement avancées.
Plusieurs développeurs ont illustré l'ampleur du changement. Sharif Cherf, connu sous le pseudonyme Sero (@0xSero), a souligné sur X qu'un modèle tournant sur environ 3 000 dollars de matériel surpassait désormais des systèmes vieux de quatre mois à peine, Opus inclus. Joshua « Xenova » Lochner, connu pour porter des modèles de machine learning dans le navigateur, a fait tourner Qwen3.8-27B avec des noyaux WebGPU personnalisés. Simon Willison, développeur et chroniqueur spécialisé en IA, a testé une version quantifiée Q4KM d'environ 17 Go sur un MacBook Pro équipé d'une puce M5 Max ainsi que sur un Nvidia DGX Spark : le modèle s'est montré capable d'écrire du code, d'interpréter des images et de piloter une boucle d'agent de codage via le framework Pi. Cette progression rapide des modèles open source de taille réduite s'inscrit dans une compétition mondiale entre laboratoires chinois, dont Alibaba, et acteurs américains comme OpenAI et Anthropic, chacun cherchant à dominer à la fois les benchmarks de raisonnement et l'accessibilité matérielle. Reste à voir si Qwen3.8-27B confirmera ces promesses à plus grande échelle et dans des usages professionnels réels, au-delà des benchmarks et des premiers essais de la communauté.
Les developpeurs et entreprises europeennes soucieux de souverainete numerique pourraient reduire leur dependance aux API cloud americaines grace a ce modele executable localement, mais aucune entite francaise ou europeenne n'est directement impliquee.