Aller au contenu principal
CréationThe Decoder · 1 min de lecture

Alibaba dévoile Qwen-Image-3.0, capable de générer grilles d'infographies complètes et texte lisible dès dix pixels en une seule passe

Source originale ↗·

Alibaba a présenté Qwen-Image-3.0, un nouveau générateur d'images développé par son équipe Qwen, capable d'accepter des instructions textuelles allant jusqu'à 4 500 tokens. Le modèle sait produire du texte lisible dans l'image jusqu'à une taille de dix pixels seulement, et prend en charge nativement douze langues. Il peut générer en une seule passe des compositions complexes comme des infographies détaillées, des documents mis en page façon LaTeX ou encore des reproductions de pages de journaux, avec une grille d'éléments cohérente et du texte intégré fidèle à la demande initiale.

Cette avancée marque une étape dans la capacité des générateurs d'images à gérer du texte long et structuré, un point faible traditionnel de ces modèles qui produisaient souvent des caractères déformés ou illisibles au-delà de quelques mots. Pour les professionnels du design, du marketing ou de l'édition, la possibilité de générer directement des mises en page complexes avec du texte net pourrait accélérer certains prototypages visuels. Toutefois, l'utilité pratique reste limitée par un obstacle de taille: le résultat final est une image pixelisée, non un fichier éditable, ce qui empêche toute modification fine du texte ou de la mise en page une fois l'image produite, contrairement à des outils de conception vectorielle ou de traitement de texte classiques.

Cette sortie s'inscrit dans la compétition intense que se livrent les laboratoires chinois et occidentaux sur la génération d'images par IA, où Alibaba cherche à consolider la position de sa famille de modèles Qwen face à des concurrents comme Midjourney, Stable Diffusion ou les outils d'OpenAI et de Google. La gestion de texte long et multilingue, ainsi que la composition de documents structurés, représentent un axe de différenciation stratégique alors que ces modèles visent des usages professionnels au-delà de la simple illustration. Reste à voir si Alibaba proposera à terme des formats de sortie éditables, ce qui déterminera l'adoption réelle de cette technologie dans des flux de travail créatifs concrets.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Qwen-Image-2.0 d'Alibaba divise par deux la compression et réduit les étapes de génération de 40 à 4
1The Decoder 

Qwen-Image-2.0 d'Alibaba divise par deux la compression et réduit les étapes de génération de 40 à 4

Alibaba a publié un rapport technique détaillant les innovations architecturales de Qwen-Image-2.0, son nouveau modèle de génération d'images. Le modèle compresse les images deux fois plus agressivement que la majorité de ses concurrents, s'appuie sur un transformeur remanié pour stabiliser l'entraînement, et intègre un module dédié qui étend automatiquement les prompts courts des utilisateurs en descriptions détaillées. Une version distillée du modèle ramène le nombre d'étapes de débruitage de 40 à seulement 4, sans sacrifier la qualité de sortie. Sur LMArena, plateforme de comparaisons en aveugle où des utilisateurs réels évaluent les modèles côte à côte, Qwen-Image-2.0 se classe actuellement 9e. Ce gain de vitesse est significatif pour les applications industrielles : passer de 40 à 4 étapes de débruitage réduit drastiquement le coût de calcul et le temps de réponse, rendant le modèle viable pour des usages en temps réel ou à grande échelle. L'expansion automatique des prompts abaisse aussi la barrière d'entrée pour les utilisateurs non experts, qui obtiennent de meilleurs résultats sans avoir à maîtriser l'art du prompt engineering. Alibaba s'inscrit dans une course intense à la génération d'images où Midjourney, Stability AI, Adobe Firefly et les modèles de Google et Meta rivalisent pour la suprématie technique. La stratégie de Qwen combine efficacité computationnelle et facilité d'usage, deux axes devenus centraux pour séduire les développeurs et les entreprises. La publication du rapport technique suggère qu'Alibaba cherche à attirer l'adoption internationale, notamment hors de Chine, en jouant la carte de la transparence.

UELes développeurs et entreprises européens peuvent bénéficier d'un modèle de génération d'images significativement plus rapide et moins coûteux en calcul, mais aucun impact réglementaire ou institutionnel direct sur la France ou l'UE.

💬 40 étapes à 4, sans perte de qualité, c'est le genre d'annonce qui mérite qu'on s'y arrête. L'extension automatique des prompts, c'est moins impressionnant que ça en a l'air (d'autres le font déjà), mais combinée au gain de vitesse, ça ouvre des usages temps réel qui n'étaient pas viables avant. Le 9e rang sur LMArena tempère un peu l'enthousiasme, faut pas se mentir.

CréationOpinion
1 source
ChatGPT Images 2.0 d'OpenAI gère le texte multilingue, les infographies, les diapositives, les cartes et le manga
2VentureBeat AI 

ChatGPT Images 2.0 d'OpenAI gère le texte multilingue, les infographies, les diapositives, les cartes et le manga

OpenAI a officiellement lancé ChatGPT Images 2.0 ce mois d'avril 2026, quelques mois seulement après la sortie de GPT-Image-1.5 en décembre 2025. Le nouveau modèle, baptisé en interne "duct tape" lors de semaines de tests discrets sur la plateforme LM Arena AI, est désormais accessible à tous les abonnés ChatGPT, tous niveaux confondus. Pour les développeurs, il est disponible via l'API sous le nom gpt-image-2. Ses capacités dépassent largement celles de son prédécesseur : génération de longs blocs de texte multilingues intégrés dans une image, création d'infographies complètes, de diapositives, de cartes, de mangas, de plans d'appartement, de grilles d'images multiples et de modèles de personnages sous différents angles. Le modèle peut également reproduire avec une fidélité troublante des interfaces utilisateur et des captures d'écran de sites réels, intégrer des résultats de recherche web directement dans une image, et s'appliquer aux photos téléversées par les utilisateurs. OpenAI a aussi introduit une suite de fonctionnalités baptisée "Thinking" pour les abonnés ChatGPT. Ce lancement marque un tournant dans la manière dont OpenAI conçoit la création visuelle. La philosophie revendiquée par l'entreprise est explicite dans ses notes de version : "Les images sont un langage, pas une décoration. Une bonne image fait ce que fait une bonne phrase : elle sélectionne, organise et révèle." En pratique, cela signifie que des professionnels du marketing, de la communication, du journalisme ou de la formation peuvent désormais produire des visuels informationnels complexes sans compétences en design. La capacité à reproduire des figures publiques réelles, comme le PDG Sam Altman, soulève aussi des questions sur l'usage de cet outil à des fins de désinformation, notamment dans le contexte de campagnes d'influence politique utilisant des personnages fictifs présentés comme de "vrais Américains" soutenant Donald Trump, un phénomène récemment documenté par le New York Times. La sortie de ChatGPT Images 2.0 intervient dans un marché de la génération d'images IA de plus en plus disputé. Google avait lancé en février 2026 son propre modèle Nano Banana 2, aussi connu sous le nom Gemini 3 Pro Image, capable lui aussi d'intégrer du texte dense dans les images. Mais selon les premiers tests comparatifs, la solution d'OpenAI surpasse Google sur la fidélité des interfaces et la gestion de compositions multi-images. Face aux risques d'abus, Adele Li, responsable produit ChatGPT Images chez OpenAI, a réaffirmé lors d'un briefing presse l'engagement de l'entreprise en matière de sécurité : les images générées sont taguées avec des métadonnées indiquant leur origine artificielle, et des garde-fous spécifiques visent à prévenir toute interférence électorale. OpenAI insiste sur le fait que ces protections distinguent ChatGPT des nouveaux entrants du secteur, qui opèrent avec "des standards et des philosophies différents".

UELes capacités avancées de reproduction d'interfaces réelles et de personnages publics accroissent les risques de désinformation en Europe, notamment à l'approche d'échéances électorales.

CréationActu
1 source
Google dévoile Gemini 3.1 Flash-Lite pour générer des images d'entreprise en 4 secondes à moindre coût
3VentureBeat AI 

Google dévoile Gemini 3.1 Flash-Lite pour générer des images d'entreprise en 4 secondes à moindre coût

Google a lancé ce jour un nouveau modèle de génération d'images baptisé Nano Banana 2 Lite, officiellement désigné Gemini 3.1 Flash-Lite Image dans son API. Ce modèle est immédiatement disponible pour les développeurs entreprise via Google AI Studio, l'API Gemini et la plateforme GEAP (Gemini Enterprise Agent Platform). Sa promesse principale est double : vitesse et faible coût. Il génère une image en 4 secondes au format 1024x1024 pixels, pour un tarif fixe de 0,034 dollar par tranche de mille images. Construit sur l'architecture Gemini 3.1 Flash Lite, il succède à Nano Banana 1 (Gemini 2.5 Flash Image) avec des améliorations ciblées : meilleure cohérence des personnages sur des séquences continues, rendu typographique localisé, et connaissance générale du monde renforcée pour générer des visualisations de données ou des mises en scène contextuelles. Dans les benchmarks internes, il obtient un score Elo de 1 251 en génération texte-vers-image, dépassant à la fois le modèle précédent (1 151) et même le Nano Banana Pro, plus lourd et plus coûteux (1 245). La seule limitation assumée est la résolution : contrairement aux modèles NB2 standard et NB Pro qui supportent 1k, 2k et 4k, ce modèle Lite se cantonne au 1k. L'enjeu commercial est clair. Google ne positionne pas ce modèle comme un outil créatif artistique, mais comme une couche utilitaire invisible pour les flux de travail automatisés à grand volume. Les ingénieurs logiciels, les plateformes publicitaires programmatiques et les applications de commerce numérique sont les cibles directes. Concrètement, cela signifie des milliers de variantes visuelles pour des tests A/B publicitaires en temps réel, des ajustements instantanés de visuels pour des vitrines localisées, ou encore la génération automatique d'assets pour des prototypes. À 0,034 dollar le millier d'images, le modèle change radicalement l'équation économique pour les applications qui génèrent des images à l'échelle industrielle. Cette sortie s'inscrit dans une période d'intense compétition sur le segment des modèles d'image rapides et bon marché. Google annonce également en parallèle la préversion publique de Gemini Omni Flash, un modèle multimodal orienté génération et édition vidéo conversationnelle. Nano Banana 2 Lite complète donc une offre stratifiée : d'un côté, des modèles puissants et flexibles pour la création complexe, de l'autre un moteur léger optimisé pour l'infrastructure. Le comparatif avec Krea 2 Turbo de la startup Krea est instructif : ce concurrent propose une licence partiellement ouverte et des capacités de personnalisation plus larges pour les petites entreprises, là où Google mise sur l'intégration native à son écosystème Workspace et ses offres IA d'entreprise. La bataille se joue autant sur le prix que sur l'écosystème, et Google dispose ici d'un avantage structurel considérable auprès de ses clients existants.

UELes entreprises européennes opérant à grand volume dans la publicité programmatique ou le e-commerce peuvent immédiatement réduire leurs coûts de génération d'images en adoptant ce modèle via l'API Gemini.

💬 Le calcul est simple, et c'est ça qui change tout : 0,034 dollar les mille images, c'est moins cher que de stocker les fichiers eux-mêmes. Google ne vend plus un outil créatif, il vend une commodité, comme l'électricité. Reste à voir si les boîtes de pub programmatique sautent vraiment le pas ou si elles se contentent de tester sur un coin de campagne.

CréationActu
1 source
4MarkTechPost 

Alibaba lance Qwen-Audio-3.0-TTS, un modèle de synthèse vocale hébergé en versions Flash et Plus dans 16 langues

Tongyi Lab, le laboratoire de recherche d'Alibaba, a lancé Qwen-Audio-3.0-TTS, un système de synthèse vocale conçu pour la production, disponible en deux versions hébergées sur Alibaba Cloud Model Studio plutôt qu'en modèles téléchargeables. La version Flash, identifiée qwen-audio-3.0-tts-flash, cible les interactions en temps réel avec une latence au premier paquet audio de l'ordre de 300 millisecondes, tandis que la version Plus, qwen-audio-3.0-tts-plus, privilégie la qualité et le naturel de la voix. Les deux s'appuient sur un protocole WebSocket bidirectionnel en streaming, prennent en charge les formats PCM, WAV, MP3 et Opus jusqu'à 48 kHz, et proposent le clonage vocal, la création de voix sur mesure (Voice Design) et le contrôle par instructions. Le modèle couvre désormais 16 langues, dont sept nouvelles par rapport à la génération précédente, parmi lesquelles le français, l'allemand, l'espagnol, le russe, le japonais et le coréen, ainsi que 20 variantes dialectales chinoises. Sur le plan des performances, Flash affiche un taux d'erreur moyen de 3,87 sur l'ensemble des langues et Plus de 3,96, avec les meilleurs résultats obtenus dans 10 des 16 langues testées. Pour la similarité vocale, Plus atteint un score moyen de 82,75 sur les 16 langues, contre 80,44 pour Flash. Qwen-Audio-3.0-TTS-Plus occupe par ailleurs la première place du classement indépendant Artificial Analysis dédié à la synthèse vocale. Cette annonce s'adresse directement aux équipes qui déploient des applications vocales en production, un secteur où la latence, la robustesse face à des enregistrements de référence imparfaits et le contrôle fin du ton restent des obstacles fréquents. L'ajout de 86 balises intégrables directement dans le texte, comme [excited], [whispers] ou [laughing], permet aux développeurs d'insuler des variations d'émotion ou des sons non verbaux tels que le rire, la respiration ou la toux, sans recourir à un post-traitement audio séparé. Une bibliothèque de voix prédéfinies dans les 16 langues supportées permet également de lancer un produit sans passer par une étape de clonage vocal, ce qui réduit le temps de mise sur le marché pour les équipes produit. Techniquement, le système repose sur un tokenizer vocal à basse fréquence de 12,5 Hz, qui réduit le coût de calcul du décodage tout en conservant les informations de contenu et de timbre, combiné à un entraînement en cinq étapes progressives associant modèle de langage et techniques de flow-matching. Cette architecture permet une synthèse continue allant jusqu'à trois minutes en une seule passe et une résolution audio améliorée en sortie 48 kHz. Le mouvement s'inscrit dans la compétition intense que se livrent les grands groupes technologiques chinois et américains sur la synthèse vocale de qualité professionnelle, un marché en forte croissance porté par les assistants vocaux, le doublage automatisé et les agents conversationnels.

CréationActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic