Aller au contenu principal
Création · Opinion ·

Alibaba Qwen lance Qwen-Image-2.1, un modèle open-weight de 7 milliards de paramètres pour la génération et l'édition d'images

L'équipe Qwen d'Alibaba a dévoilé Qwen-Image-2.1, un modèle unifié de génération et d'édition d'images qui combine dans un seul jeu de poids ce que l'entreprise proposait jusqu'ici via deux modèles séparés. Le composant de génération visuelle compte 7 milliards de paramètres répartis sur 32 couches DiT à flux unique, contre 20 milliards pour le Qwen-Image original publié en août 2025 sous licence Apache 2.0, qui séparait alors génération et édition dans deux checkpoints distincts. Le nouveau modèle s'appuie sur un encodeur de texte Qwen3-VL de 8 milliards de paramètres, un VAE 64 canaux gérant nativement la transparence RGBA avec une compression spatiale de 16x, et un planificateur Flow Matching à discrétisation Euler. Il gère jusqu'à 10 images de référence simultanées, produit des visuels en 2048x2048 pixels par défaut (jusqu'à 2752x1536 selon sept ratios d'aspect pris en charge) et permet des retouches localisées via cercles, masques peints ou zones désignées. Sur le benchmark maison Qwen-Image-Bench, il obtient un score de 60,28, devançant Nano Banana 2.0 (59,82) et le modèle ouvert FLUX 2 Max de 32 milliards de paramètres (55,33), tout en restant derrière six modèles propriétaires, le meilleur étant GPT Image 2.5 Sunburst avec 67,01.

2 min de lecturePertinence 57

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette réduction de taille, à performances égales voire supérieures à des concurrents plus lourds, change la donne pour le coût de déploiement des générateurs d'images en entreprise et dans la recherche. La technique clé réside dans une attention dite à granularité mixte, qui applique un masque causal aux jetons de texte et un masque bidirectionnel par blocs aux jetons d'image : les représentations du texte et des images de référence, calculées une seule fois, sont ensuite réutilisées à chaque étape de débruitage via un cache, ce qui accélère nettement le traitement à mesure que le nombre d'images de référence augmente. Concrètement, cela ouvre la voie à des usages comme la création de trombinoscopes à partir de plusieurs portraits, la composition de tenues à partir de références multiples, ou l'extraction de sujets détourés avec transparence native, autant de tâches jusqu'ici réservées à des outils fermés comme Nano Banana ou GPT Image.

Le modèle est disponible dès son lancement sur Diffusers, ComfyUI, vLLM-Omni, SGLang et LightX2V, avec un usage libre pour la recherche mais une licence commerciale séparée exigée par Qwen pour tout déploiement à but lucratif. Alibaba étend aussi son empreinte matérielle au-delà de Nvidia, avec un support des GPU AMD Radeon via ROCm et de huit plateformes de puces via FlagOS, signe d'une stratégie de diversification des infrastructures en Chine. Cette sortie s'inscrit dans une course accélérée entre laboratoires chinois et occidentaux sur la génération d'images multimodales, où Alibaba cherche à imposer Qwen comme alternative ouverte crédible face aux offres fermées de Google, OpenAI et Black Forest Labs.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01NVIDIA lance SANA-WM : un modèle mondial open source de 2,6 milliards de paramètres capable de générer des vidéos 720p de plusieurs minutes sur un seul GPU46MarkTechPostCréation 02Qwen-Image-2.0 d'Alibaba divise par deux la compression et réduit les étapes de génération de 40 à 447The DecoderCréation 03Microsoft lance MAI-Image-2-Efficient, un modèle de génération d'images plus rapide et moins coûteux48VentureBeat AICréation 
Dossier · Qwen3Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.