GLM-5.3-Flash face à Qwen3.8-Flash-Next : deux labos chinois convergent séparément vers la même architecture
Deux laboratoires chinois, Z.ai et l'équipe Qwen d'Alibaba, ont publié cette semaine, à moins de 24 heures d'intervalle, deux modèles ouverts aux architectures étonnamment convergentes. Z.ai a dévoilé GLM-5.3-Flash, un modèle multimodal à mélange d'experts de 320 milliards de paramètres dont 18 milliards actifs par requête, publié sous licence MIT sur Hugging Face et entraîné sur un corpus de 30 000 milliards de tokens, avec une fenêtre de contexte d'un million de tokens. Testé anonymement sous le nom "Ox Alpha" sur OpenRouter, il en est devenu le modèle le plus utilisé de la semaine; Z.ai affirme qu'il dépasse GLM-5.2 sur l'ensemble des benchmarks pour un dixième du prix, tout en approchant Claude Opus 4.8 sur le code et les tâches agentiques, pour 0,15 dollar par million de tokens en entrée et 0,50 dollar en sortie. Alibaba a de son côté lancé Qwen3.8-Flash-Next, aperçu public de la future architecture Qwen4, avec 125 milliards de paramètres plus une table d'embeddings n-gramme de 51 milliards, 6 milliards de paramètres activés par token, un contexte natif de 262 144 tokens extensible à un million via YaRN, et un entraînement qui n'aurait mobilisé qu'environ un neuvième du calcul consacré à Qwen3.7-Plus.
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Le plus notable n'est pas la performance de chaque modèle pris isolément, mais le fait que les deux équipes, en travaillant séparément, aient abouti à la même recette technique: un ratio de trois couches d'attention linéaire pour une couche d'attention complète, et un indexeur compressant l'historique par quatre avant de plafonner l'attention effective à 2048 tokens retenus. Cette convergence indépendante suggère que cette combinaison constitue désormais une solution quasi optimale pour bâtir des modèles à contexte long, rapides et peu coûteux à exploiter. Pour l'industrie, cela se traduit par une pression accrue sur les prix: à 0,15 dollar par million de tokens en entrée, GLM-5.3-Flash s'approche des performances de modèles propriétaires nettement plus onéreux, tandis que Qwen revendique des gains allant jusqu'à 7,6 fois en préremplissage et 4,9 fois en décodage à un million de tokens de contexte, un atout direct pour les usages agentiques et les applications de très longue portée.
Cette architecture partagée s'inscrit dans une même lignée de recherche. L'attention linéaire de GLM, appelée Kimi Delta Attention, reprend le mécanisme introduit par Kimi Linear, le modèle du laboratoire Moonshot AI, tandis que Qwen utilise sa propre variante, Gated DeltaNet; leurs indexeurs compressés descendent tous deux de l'approche DSA développée par DeepSeek, et les deux équipes recourent à l'optimiseur Muon. Ce foisonnement reflète une compétition intense entre laboratoires chinois, Z.ai, Alibaba, Moonshot AI et DeepSeek, qui partagent des idées architecturales tout en rivalisant sur les prix face aux modèles occidentaux fermés. Qwen3.8-Flash-Next joue par ailleurs pour Qwen4 le même rôle que Qwen3-Next avait joué pour Qwen3.5, celui d'un banc d'essai public avant une génération complète, laissant présager l'arrivée prochaine d'une architecture Qwen4 pleinement déployée.
Ces modèles ouverts sous licence MIT sont librement accessibles aux développeurs et entreprises européennes via Hugging Face et OpenRouter, mais aucun acteur ni régulation français ou européen n'intervient dans cette annonce.