Aller au contenu principal

Création

50 sur 166 articles

IA créative : génération d'images, vidéo, musique, art et outils créatifs (Midjourney, Sora, Runway...).

WorldPrompt de Runway : comment concevoir des mondes en temps réel
Illustration générée par IA
1Latent Space CréationOpinion

WorldPrompt de Runway : comment concevoir des mondes en temps réel

La société de "modèles du monde" Runway a présenté début septembre 2026 GWM Worlds 2, une preview de recherche qui transforme la génération vidéo et audio haute fidélité en simulation interactive en temps réel, à l'aide d'un modèle de "diffusion autorégressive" qui produit le contenu image par image plutôt que d'un bloc. Sa nouveauté phare s'appelle WorldPrompt : un format qui permet de fixer certains paramètres d'un monde généré, comme sa première image, puis d'y injecter une série d'événements horodatés, pouvant même être déclenchés en temps réel pendant la simulation. Pour comprendre les implications de cet outil, la publication a interrogé Kamil Sindi, directeur technique de Runway, et Robin Kahlow, responsable de la recherche sur la vidéo générative et l'IA multimodale, et cite des propos d'Anastasis Germanidis, cofondateur et co-PDG de l'entreprise, recueillis lors d'un podcast animé par swyx et Vibhu. Runway, valorisée à 5,3 milliards de dollars après une levée de 315 millions de dollars en février 2026, avait lancé une première version, GWM Worlds, en décembre 2025. Elle affronte désormais Genie 3 de Google DeepMind (720p, 24 images par seconde), Odyssey-2 Pro et RTFM de World Labs sur ce même terrain. WorldPrompt agit comme une couche de contrôle sur les personnages, les caméras et l'environnement d'une scène générée, un peu à la manière d'un moteur de jeu vidéo qui ferait parler ou bouger un personnage non joueur. Contrairement à des mondes scriptés comme Minecraft ou Roblox, il ne s'agit pas d'un langage de programmation mais d'un mécanisme de prompt : impossible donc de coder un état persistant ou une règle physique de façon garantie. Selon Kahlow, la fiabilité dépend de la complexité de l'action demandée, le mouvement fonctionnant déjà "de façon assez fiable", tandis que davantage d'entraînement et de données permettent d'améliorer progressivement le respect des instructions. Cette approche ouvre la voie à des expériences et jeux entièrement générés à la demande, en vidéo et audio synchronisés, sur n'importe quel univers imaginé, sans développement préalable. Le défi technique reste immense : il faut que le modèle génère chaque image en continu, en cohérence avec les précédentes, tout en absorbant en temps réel de nouvelles instructions, un problème de latence et d'ingénierie que Google reconnaît lui-même pour Genie 3, limité à quelques minutes d'interaction continue contre des heures visées à terme. La course entre Runway, Google DeepMind, Odyssey et World Labs illustre l'émergence d'un nouveau champ de bataille dans l'IA générative, où la vidéo temps réel pourrait à terme remplacer la conception manuelle de mondes virtuels pour le jeu, la simulation ou l'entraînement de systèmes autonomes.

1 source
Google lance Gemini 3.8 Flash TTS et Flash-Lite TTS, avec conception vocale par prompt
Illustration générée par IA
2MarkTechPost 

Google lance Gemini 3.8 Flash TTS et Flash-Lite TTS, avec conception vocale par prompt

Google a mis en ligne Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux nouveaux modèles de synthèse vocale de sa famille Gemini Audio, présentés comme ses modèles audio les plus expressifs à ce jour. Les deux versions sont accessibles dès maintenant via l'API Gemini et Google AI Studio, sous les identifiants gemini-3.8-flash-tts et gemini-3.8-flash-lite-tts, sans poids ouverts pour un hébergement local ; l'accès entreprise via Gemini Enterprise est annoncé comme prochain. Flash TTS cible la direction créative et la conception de personnages pour le jeu vidéo, les livres audio immersifs, les podcasts et les médias interactifs, avec un contrôle fin sur le jeu d'acteur, le rythme et les changements de dialecte. Flash-Lite TTS vise la production à grande échelle et à coût réduit pour le doublage et les agents vocaux. Alors que la génération précédente proposait 30 voix originales, Flash TTS peut désormais créer des voix inédites à partir d'un simple prompt décrivant rôle, accent et caractéristiques, dans plus de 100 langues et dialectes, et les développeurs disposent d'une bibliothèque de plus de 2 000 voix prêtes à l'emploi, couvrant des variantes régionales comme l'espagnol mexicain, le français québécois ou l'anglais écossais. Sur le benchmark Hume AI Voice Design, Flash TTS se classe numéro un avec un score de 71,4. Cette montée en gamme s'inscrit dans une bataille industrielle autour de la voix synthétique, où la qualité d'interprétation et la diversité linguistique deviennent des critères de différenciation aussi importants que la puissance brute des modèles de texte. Pour les studios de jeux vidéo, les plateformes de podcasts ou les créateurs de livres audio, la possibilité de générer des voix sur mesure à partir d'un texte, avec des indications scéniques directement intégrées au script, réduit fortement le recours à des comédiens de doublage pour les productions de masse ou multilingues. Les fonctions de mise en scène vocale, comme les deux voix distinctes dans un dialogue généré à partir d'un seul script, les bruitages non verbaux tels que les rires ou soupirs, et les interjections d'écoute active, rapprochent la synthèse vocale d'une véritable direction d'acteur automatisée, ce qui ouvre la voie à des contenus audio produits à très grande échelle et à moindre coût. Cette évolution s'accompagne toutefois d'un encadrement renforcé de la réplication vocale, un sujet sensible depuis l'essor des deepfakes audio. Google exige un échantillon de 30 secondes de la voix concernée, accompagné d'un enregistrement de consentement verbal du propriétaire de la voix, comparé à l'échantillon de référence. Chaque extrait généré par les modèles Gemini Audio embarque un filigrane invisible SynthID, et les voix répliquées portent en plus des identifiants de provenance C2PA. Une fonction de remixage vocal, permettant d'ajuster timbre, hauteur et accent d'une voix existante via un prompt, est annoncée comme à venir. Cette sortie place Google en concurrence directe avec les autres acteurs de la synthèse vocale générative, dans un secteur où les questions d'authentification et de traçabilité du contenu deviennent aussi centrales que la qualité audio elle-même.

💬 Ce qui change, c'est le passage d'un catalogue de 30 voix à un truc qu'on décrit en langage naturel, avec accent et personnalité, et ça se sent dans le classement Hume. La bibliothèque de 2000 voix régionales (québécois, écossais, mexicain), c'est ce qui va vraiment faire mal aux studios de doublage low-cost. Reste que le watermark SynthID et le consentement vocal obligatoire, c'est la vraie nouvelle : Google a compris qu'il ne peut plus sortir un outil de clonage sans blindage anti-deepfake dès le jour 1.

Google lance des modèles Flash TTS pour créer des voix IA sur mesure à partir de descriptions textuelles
Illustration générée par IA
3The Decoder 

Google lance des modèles Flash TTS pour créer des voix IA sur mesure à partir de descriptions textuelles

Google déploie deux nouveaux modèles de synthèse vocale, Gemini 3.8 Flash TTS et Flash-Lite TTS, capables de gérer plus de 100 langues. Le modèle Flash TTS introduit une fonctionnalité inédite : la création de voix entièrement nouvelles à partir de simples descriptions textuelles, permettant de définir un timbre ou un style vocal sans partir d'un enregistrement existant. Les deux modèles permettent également d'ajouter des indications de jeu, ou "stage directions", ligne par ligne, pour préciser le ton, l'émotion ou le rythme de chaque réplique, ainsi que de générer des dialogues à deux voix à partir d'un seul script. Une fonction de clonage vocal complète l'offre, capable de construire un profil de voix à partir d'un échantillon audio de seulement 30 secondes. Cette avancée renforce la position de Google dans la course aux outils de génération audio par IA, un secteur de plus en plus disputé face à des acteurs comme ElevenLabs ou OpenAI. La possibilité de concevoir une voix sur la seule base d'une description textuelle simplifie considérablement le travail des développeurs, créateurs de contenu et studios qui doivent produire des voix sur mesure sans recourir à des acteurs vocaux professionnels. Le clonage rapide à partir de 30 secondes d'audio abaisse encore la barrière technique et financière, ouvrant la personnalisation vocale à un public plus large, des podcasteurs indépendants aux entreprises développant des assistants virtuels. Ces modèles s'inscrivent dans une tendance de fond où les grands éditeurs de modèles de langage étendent leurs capacités au-delà du texte pur pour couvrir la voix, avec des implications directes sur les métiers du doublage, de la production audio et de l'accessibilité numérique. La possibilité de scripter des dialogues à plusieurs voix directement dans un modèle de langage ouvre la voie à des usages comme les livres audio automatisés, les assistants conversationnels multilingues ou la localisation rapide de contenus. Reste à voir comment Google encadrera les usages de ces outils, notamment sur les questions de consentement et de détection des voix synthétiques clonées.

UECes outils seront accessibles aux créateurs et entreprises européens et pourraient impacter les métiers du doublage et de la production audio en France, sans annonce de réglementation locale spécifique.

CréationActu
1 source
Alibaba Qwen lance Qwen-Image-2.1, un modèle open-weight de 7 milliards de paramètres pour la génération et l'édition d'images
Illustration générée par IA
4MarkTechPost 

Alibaba Qwen lance Qwen-Image-2.1, un modèle open-weight de 7 milliards de paramètres pour la génération et l'édition d'images

L'équipe Qwen d'Alibaba a dévoilé Qwen-Image-2.1, un modèle unifié de génération et d'édition d'images qui combine dans un seul jeu de poids ce que l'entreprise proposait jusqu'ici via deux modèles séparés. Le composant de génération visuelle compte 7 milliards de paramètres répartis sur 32 couches DiT à flux unique, contre 20 milliards pour le Qwen-Image original publié en août 2025 sous licence Apache 2.0, qui séparait alors génération et édition dans deux checkpoints distincts. Le nouveau modèle s'appuie sur un encodeur de texte Qwen3-VL de 8 milliards de paramètres, un VAE 64 canaux gérant nativement la transparence RGBA avec une compression spatiale de 16x, et un planificateur Flow Matching à discrétisation Euler. Il gère jusqu'à 10 images de référence simultanées, produit des visuels en 2048x2048 pixels par défaut (jusqu'à 2752x1536 selon sept ratios d'aspect pris en charge) et permet des retouches localisées via cercles, masques peints ou zones désignées. Sur le benchmark maison Qwen-Image-Bench, il obtient un score de 60,28, devançant Nano Banana 2.0 (59,82) et le modèle ouvert FLUX 2 Max de 32 milliards de paramètres (55,33), tout en restant derrière six modèles propriétaires, le meilleur étant GPT Image 2.5 Sunburst avec 67,01. Cette réduction de taille, à performances égales voire supérieures à des concurrents plus lourds, change la donne pour le coût de déploiement des générateurs d'images en entreprise et dans la recherche. La technique clé réside dans une attention dite à granularité mixte, qui applique un masque causal aux jetons de texte et un masque bidirectionnel par blocs aux jetons d'image : les représentations du texte et des images de référence, calculées une seule fois, sont ensuite réutilisées à chaque étape de débruitage via un cache, ce qui accélère nettement le traitement à mesure que le nombre d'images de référence augmente. Concrètement, cela ouvre la voie à des usages comme la création de trombinoscopes à partir de plusieurs portraits, la composition de tenues à partir de références multiples, ou l'extraction de sujets détourés avec transparence native, autant de tâches jusqu'ici réservées à des outils fermés comme Nano Banana ou GPT Image. Le modèle est disponible dès son lancement sur Diffusers, ComfyUI, vLLM-Omni, SGLang et LightX2V, avec un usage libre pour la recherche mais une licence commerciale séparée exigée par Qwen pour tout déploiement à but lucratif. Alibaba étend aussi son empreinte matérielle au-delà de Nvidia, avec un support des GPU AMD Radeon via ROCm et de huit plateformes de puces via FlagOS, signe d'une stratégie de diversification des infrastructures en Chine. Cette sortie s'inscrit dans une course accélérée entre laboratoires chinois et occidentaux sur la génération d'images multimodales, où Alibaba cherche à imposer Qwen comme alternative ouverte crédible face aux offres fermées de Google, OpenAI et Black Forest Labs.

CréationOpinion
1 source
Meilleures API de clonage vocal en 2026 : similarité de voix, vérification du consentement et prix au million de caractères
Illustration générée par IA
5MarkTechPost 

Meilleures API de clonage vocal en 2026 : similarité de voix, vérification du consentement et prix au million de caractères

Sept fournisseurs de clonage vocal, ElevenLabs, Cartesia, Inworld, Gradium, Fish Audio, Resemble AI et Hume, ont été comparés dans un test dont les tarifs ont été vérifiés le 20 septembre 2026. Chaque plateforme a reçu le même clip de référence de 10 secondes, une voix enregistrée en pièce silencieuse au format WAV, pour cloner deux phrases identiques via son mode de clonage instantané. Hume, qui exige un minimum de 15 secondes, a dû utiliser un extrait rallongé, tandis qu'ElevenLabs, qui recommande pourtant 1 à 2 minutes pour son Instant Voice Cloning, a été testé à 10 secondes, en dessous de ses propres consignes. Sur la fidélité vocale, Hume a publié le 10 septembre 2026 un classement indépendant, le Voice Replication Leaderboard, évaluant 11 modèles sur 25 voix de référence et 7 prompts, notés de 1 à 5 par trois évaluateurs humains. Fish Audio, avec son modèle s2-pro, arrive en tête à 4,03, devant Cartesia sonic-3,5 (3,70) et ElevenLabs Multilingual v2 (3,68). Eleven v3, le modèle le plus récent d'ElevenLabs, termine pourtant dernier des onze avec 2,91. Les tarifs vont de 12,50 dollars le million de caractères chez Inworld à 100 dollars chez ElevenLabs pour Eleven v3. Ce comparatif révèle qu'un score global de qualité audio ne garantit pas la ressemblance avec la voix source: Cartesia sonic-3,6-beta obtient la meilleure note de naturel (4,36) mais chute au huitième rang sur l'identité vocale, et Inworld TTS-2 domine la qualité audio (4,61) sans dominer la fidélité au locuteur. Pour les entreprises qui déploient des assistants vocaux, du doublage ou des interfaces personnalisées, ce découplage impose de choisir un fournisseur selon l'usage réel plutôt que sur un score marketing unique. La vérification du consentement pèse tout autant: face au risque de deepfakes vocaux, les approches divergent fortement, d'une simple attestation de droits chez Cartesia ou Inworld à un test Voice Captcha en direct chez ElevenLabs pour les clones professionnels, ou une vérification de propriété en temps réel chez Fish Audio. Sur un marché encore jeune, ces garde-fous pourraient peser autant que le prix ou le nombre de langues disponibles dans le choix d'un fournisseur. Ce marché s'est structuré rapidement avec l'essor de la synthèse vocale neuronale, chaque acteur adoptant un positionnement distinct. ElevenLabs, pionnier grand public fort de plus de 70 langues, impose une vérification stricte pour ses clones professionnels, quitte à afficher des scores de similarité plus faibles en test indépendant. Inworld vise la couverture linguistique la plus large, plus de 200 langues et dialectes, cohérente avec son ancrage dans les agents conversationnels et le jeu vidéo. Cartesia et Fish Audio misent sur la rapidité de clonage, dès 10 secondes d'audio, avec des tarifs compétitifs facturés au caractère ou à l'octet. La publication par Hume de son propre classement, en libre accès sur Hugging Face, illustre l'absence de norme industrielle pour mesurer la ressemblance vocale: chaque acteur produit ses propres benchmarks, ce qui complique la comparaison mais accroît la pression sur la transparence des fournisseurs. Avec la multiplication des usages commerciaux, la vérification du consentement et la traçabilité des voix clonées devraient rester au cœur des arbitrages réglementaires dans les mois à venir.

UELes entreprises européennes déployant des assistants vocaux ou du doublage peuvent utiliser ce comparatif pour choisir un fournisseur, mais aucune entité ou réglementation française ou européenne n'est directement concernée.

CréationOutil
1 source
Le film Odyssey généré par IA dure 2h30, soit 2h30 de trop
Illustration générée par IA
6The Verge AI 

Le film Odyssey généré par IA dure 2h30, soit 2h30 de trop

Christopher Nolan a signé une adaptation de L'Odyssée qui a dominé le box-office et relancé l'intérêt du public pour l'œuvre d'Homère. Dans son sillage est sorti un film concurrent entièrement généré par intelligence artificielle, intitulé Odysseus: The Fall, d'une durée de deux heures et demie. Il est produit par le studio Fountain 0 et réalisé par son cofondateur Ash Koosha, qui a également prêté son visage au personnage principal et composé l'intégralité de la musique du film. Le générique de fin, très court, reflète le nombre limité de personnes impliquées dans la production. Il s'agit du deuxième long métrage du studio après Dreams of Violets, un autre film généré par IA qui avait été sélectionné au festival de Tribeca plus tôt cette année. Selon la critique parue dans The Verge, le résultat est si médiocre qu'il risque de détourner les spectateurs du récit original plutôt que de les y intéresser, à rebours de l'effet produit par le film de Nolan. Cet épisode illustre les limites actuelles des outils d'IA générative appliqués à la production cinématographique complète, à un moment où l'industrie du divertissement observe de près si des œuvres majoritairement automatisées peuvent rivaliser avec des productions traditionnelles à gros budget. Le contraste entre les deux adaptations sorties presque simultanément met en lumière les tensions actuelles autour de l'IA à Hollywood, où scénaristes et acteurs restent vigilants face à l'automatisation de la création après les grèves de 2023. La progression rapide de studios comme Fountain 0, qui enchaînent les longs métrages générés par IA et décrochent des sélections dans des festivals reconnus comme Tribeca, alimente le débat sur la place que ces productions pourraient occuper face au cinéma traditionnel dans les années à venir.

CréationOpinion
1 source
ChatGPT vous envoie en 1985 : on a testé le prompt viral sur Sydney Sweeney
Illustration générée par IA
7Le Big Data 

ChatGPT vous envoie en 1985 : on a testé le prompt viral sur Sydney Sweeney

Une nouvelle tendance virale invite les utilisateurs de ChatGPT à transformer n'importe quelle photo récente en cliché typique des années 1980, grâce à ChatGPT Images 2.5, le modèle de génération d'images qu'OpenAI vient d'intégrer à son chatbot. OpenAI elle-même met en avant ce prompt, qu'elle qualifie d'actuellement viral. Le procédé a été testé sur des photos de Sydney Sweeney, Timothée Chalamet et Margot Robbie, dont un cliché de Sweeney pris au Toronto International Film Festival en 2025. Il suffit d'ouvrir ChatGPT sur ordinateur, mobile ou web, d'y déposer une photo nette avec le visage bien visible, puis de demander au modèle de recréer la scène comme si elle avait été photographiée au milieu des années 1980, avec coiffures volumineuses, vestes aux épaules marquées, flash frontal et grain de pellicule. OpenAI annonce que ChatGPT Images 2.5 est jusqu'à 50 % plus rapide que la précédente version 2.0, avec une meilleure fidélité aux photos de référence, des textures et des lumières plus naturelles, et une capacité accrue à préserver l'identité des personnes photographiées même lorsque leur environnement, leurs vêtements ou leur style changent radicalement. Cette évolution marque un progrès concret pour les usages grand public de l'IA générative d'images : contrairement à un simple filtre rétro qui se contente de jaunir une photo, le modèle reconstruit intégralement les cheveux, les vêtements, le décor et l'ambiance tout en conservant les traits du sujet, un équilibre que les générateurs d'images peinaient jusque-là à tenir de façon fiable. Le procédé ne nécessite aucun logiciel de retouche comme Photoshop et reste accessible depuis une simple conversation, avec la possibilité de corriger le résultat par itérations successives, par exemple en demandant de renforcer la ressemblance ou de rendre une coiffure plus crédible pour l'époque visée. Cette itération conversationnelle change la façon dont le grand public aborde la retouche photo, en la rendant accessible sans compétence technique, tout en questionnant l'usage de portraits de célébrités dans des générations d'images sans leur consentement explicite. Cette tendance s'inscrit dans une succession de modes virales autour de la génération d'images par IA, après des vagues similaires comme les transformations en style animé ou en figurines miniatures, qui ont chacune démontré la viralité de ces outils sur les réseaux sociaux. Elle intervient alors qu'OpenAI cherche à consolider sa position face à des concurrents comme Google et son modèle Gemini, ou Midjourney, sur le terrain de la génération et de l'édition d'images fidèles à une référence. La disponibilité de ChatGPT Images 2.5 sur l'ensemble des formules de ChatGPT, avec des limites de génération variables selon les abonnements, laisse présager une diffusion rapide de la fonctionnalité auprès d'un public large. Reste à voir comment OpenAI encadrera l'usage de portraits de personnalités publiques dans ce type de génération, alors que ces tendances virales soulèvent régulièrement des questions de droit à l'image et de désinformation visuelle.

UELes utilisateurs français ont accès à cette fonctionnalité comme le reste du monde, ce qui ravive les questions de droit à l'image et de consentement pour l'usage de portraits de célébrités, un sujet particulièrement sensible en droit français et européen.

💬 Le vrai saut technique ici, c'est pas le grain vintage, c'est qu'OpenAI a réussi à faire tenir ensemble reconstruction totale du décor (cheveux, fringues, lumière) et fidélité du visage, un équilibre que les générateurs d'images ratent depuis des années. Sur Sydney Sweeney ça fait son effet, mais le vrai test c'est le jour où n'importe qui balance la photo de sa mère : si l'identité tient, c'est plus un jouet viral, c'est un outil de retouche grand public qui enterre Photoshop pour ce genre d'usage. Reste que personne n'a réglé la question du droit à l'image des célébrités transformées sans leur accord, et ce n'est pas un filtre rétro qui va trancher ça à notre place.

CréationOutil
1 source
Prime Video teste une IA pour synchroniser les lèvres des acteurs avec les voix doublées
Illustration générée par IA
8Le Big Data 

Prime Video teste une IA pour synchroniser les lèvres des acteurs avec les voix doublées

Amazon expérimente une nouvelle technologie baptisée « visual dubbing » sur sa plateforme Prime Video, destinée à corriger le décalage visuel classique du doublage entre les mouvements de bouche des acteurs et les voix traduites. Le principe : l'intelligence artificielle intervient sur l'image pour ajuster les lèvres des comédiens afin qu'elles correspondent aux dialogues doublés, tandis que les voix elles-mêmes restent celles de véritables comédiens de doublage, sans recours à une synthèse vocale artificielle. Le premier test porte sur Maxton Hall, série allemande à succès, dont les deux premières saisons bénéficient déjà de cette synchronisation labiale par IA, mais uniquement pour la version doublée en anglais. La troisième et dernière saison, prévue pour le 9 décembre 2026, profitera également de cette technologie dès sa sortie. Amazon indique vouloir étendre ce procédé à d'autres productions de son catalogue, sans toutefois préciser lesquelles, et n'a communiqué aucune date pour un déploiement sur les doublages français. Cette innovation s'attaque à un défaut du doublage identifié depuis des décennies mais jamais vraiment résolu : ce léger différé entre le son et l'image qui trahit immédiatement qu'une scène a été doublée. En le corrigeant par l'IA plutôt que par un nouveau tournage ou une adaptation forcée des traductions, Prime Video pourrait rendre les versions doublées nettement plus immersives, un enjeu commercial important pour une plateforme qui diffuse ses contenus dans des dizaines de pays et de langues. Pour l'industrie de l'audiovisuel, cette avancée soulève cependant des questions sensibles : quelle part du travail reste humaine, quels accords ont été négociés avec les acteurs et les ayants droit dont l'image est numériquement modifiée, et quelles garanties existent pour préserver l'intégrité artistique des œuvres originales. Amazon affirme que des équipes créatives supervisent le procédé, mais n'a détaillé ni l'ampleur de l'intervention de l'IA ni les termes contractuels associés à cette utilisation de l'image des comédiens. Amazon n'est pas seul sur ce terrain : Meta et YouTube proposent déjà des fonctions de doublage avec synchronisation labiale pilotée par IA, bien que selon des approches et des cas d'usage différents de ceux de Prime Video, davantage tournés vers le contenu créé par les utilisateurs que vers des productions audiovisuelles premium. Ce mouvement s'inscrit dans une tendance plus large de l'industrie du streaming et des réseaux sociaux à recourir à l'intelligence artificielle générative pour fluidifier la localisation de contenus à l'échelle mondiale, un chantier jusqu'ici coûteux et lent. Reste à voir comment les guildes d'acteurs, les studios de doublage et les régulateurs réagiront à cette manipulation numérique de l'image des interprètes, alors que les débats sur les droits liés à l'IA générative et à la ressemblance des acteurs restent vifs dans le secteur.

UEAucun déploiement annoncé pour le doublage français, mais la technologie interroge directement l'industrie française du doublage et les droits des comédiens sur leur image.

CréationOutil
1 source
Universal Music lance une plateforme musicale IA avec ElevenLabs
Illustration générée par IA
9The Verge AI 

Universal Music lance une plateforme musicale IA avec ElevenLabs

Universal Music Group a annoncé jeudi le lancement d'une nouvelle plateforme musicale reposant sur l'intelligence artificielle, développée dans le cadre d'un accord de licence pluriannuel avec ElevenLabs, entreprise spécialisée dans la génération vocale et musicale par IA. Cette plateforme permettra aux utilisateurs de puiser dans le catalogue de titres sous licence d'UMG pour créer des remixes, des mashups et de nouvelles versions de morceaux existants. Chaque artiste du label pourra choisir librement de participer ou non à ce projet, préservant ainsi un droit de regard sur l'utilisation de son répertoire. Cet accord marque une nouvelle étape dans la stratégie d'UMG visant à encadrer, plutôt que combattre, l'essor de la musique générée par IA. En offrant un cadre légal et rémunéré pour la création de contenus dérivés, le label cherche à protéger les droits des artistes tout en captant une part de la valeur créée par ces nouveaux usages, à un moment où des outils d'IA non autorisés menacent de diluer la propriété intellectuelle du secteur musical. Pour les utilisateurs, cela ouvre la possibilité de manipuler légalement des titres populaires, une pratique jusqu'ici largement confinée à des zones grises juridiques. Ce partenariat s'inscrit dans une série d'initiatives similaires menées par UMG, qui développe déjà une plateforme d'IA musicale avec Udio et a conclu des accords de licence avec Spotify, Nvidia et Klay. Face à la multiplication des outils de génération musicale par IA, les grands labels tentent ainsi de négocier leur place plutôt que de subir la disruption, en s'associant directement avec les développeurs technologiques. La réussite de cette stratégie dépendra largement de l'adhésion des artistes et de la capacité d'UMG à démontrer que ces nouveaux usages génèrent des revenus équitablement partagés.

UEUniversal Music Group, coté à Amsterdam, représente aussi des artistes français dont les titres pourront être proposés sur cette plateforme si le label le décide.

💬 Universal ne combat plus l'IA musicale, il la monétise. C'est la vraie bascule de cet accord avec ElevenLabs, après Udio, Spotify et Nvidia : le label construit un système où chaque usage IA de son catalogue passe par sa caisse. L'opt-in par artiste rassure sur le papier, mais tu remarqueras que c'est toujours UMG qui fixe les règles, pas les musiciens, et reste à voir si les revenus partagés valent le coup une fois qu'on connaîtra les chiffres.

CréationOutil
1 source
Suno lance ses modèles musicaux v6, développés avec Warner, BMG et Believe
Illustration générée par IA
10The Decoder 

Suno lance ses modèles musicaux v6, développés avec Warner, BMG et Believe

Suno a dévoilé la sixième génération de ses modèles de création musicale par intelligence artificielle, baptisée v6, disponible en trois versions distinctes. Fait notable, ces modèles ont été développés en collaboration avec Warner Music Group, BMG et Believe, trois acteurs majeurs de l'industrie musicale. Tous les anciens modèles de la plateforme sont progressivement retirés au profit de cette nouvelle génération. Sur le plan technique, v6 introduit deux capacités majeures : la possibilité de modifier partiellement une chanson existante via de simples commandes textuelles, et la génération multimodale de morceaux à partir d'une combinaison de texte, d'audio et d'images. Suno n'a en revanche pas précisé quels catalogues musicaux ont servi à entraîner ces modèles. Ce partenariat marque un tournant pour Suno, longtemps critiquée pour avoir entraîné ses modèles sans licence explicite sur des œuvres protégées. En s'associant officiellement à Warner, BMG et Believe, l'entreprise cherche à légitimer sa technologie et à sécuriser son accès à des catalogues musicaux de qualité, tout en offrant à ces labels une nouvelle source de revenus liée à l'IA générative. Pour les utilisateurs, les nouvelles fonctionnalités d'édition ciblée et de génération multimodale élargissent considérablement les usages créatifs possibles, rapprochant les outils d'IA musicale des standards de production professionnelle. Ce virage s'inscrit dans un contexte juridique tendu pour l'industrie de la musique générée par IA. Alors que Warner, BMG et Believe choisissent la voie du partenariat, Universal Music Group et Sony Music continuent de poursuivre Suno en justice pour violation présumée de droits d'auteur. Cette divergence stratégique entre grands labels illustre les tensions actuelles autour de l'entraînement des modèles d'IA sur des contenus protégés, et pourrait influencer la manière dont l'ensemble du secteur musical négociera à l'avenir avec les entreprises d'intelligence artificielle générative.

UEBelieve, société française de distribution musicale, figure parmi les partenaires officiels ayant collaboré au développement de ces modèles, impliquant directement un acteur français dans l'IA musicale générative.

💬 Suno qui signe avec Warner, BMG et Believe, c'est l'aveu que l'entraînement sauvage ne tenait plus la route. Les labels ne se battent plus contre l'IA générative, ils monétisent l'accès à leur catalogue, et c'est exactement ce qui va trier le marché entre boîtes qui paient et boîtes qui se font poursuivre. Universal et Sony continuent leur procès pendant que Believe encaisse, la fracture entre labels ne porte plus sur l'IA elle-même mais sur qui négocie et qui plaide.

CréationActu
1 source
ChatGPT Sketch transforme vos dessins maladroits en images IA détaillées
Illustration générée par IA
11The Verge AI 

ChatGPT Sketch transforme vos dessins maladroits en images IA détaillées

OpenAI a annoncé mardi le déploiement de ChatGPT Images 2.5, une mise à jour qui introduit un nouvel outil baptisé Sketch. Concrètement, l'utilisateur tape "@Sketch" dans la fenêtre de conversation de ChatGPT, ce qui fait apparaître une zone de dessin directement intégrée à l'interface. Il peut alors y tracer un croquis, même sommaire, puis indiquer par texte comment il souhaite que ce dessin soit transformé en image. Le site The Verge, qui a testé la fonctionnalité, explique avoir dessiné un chat à la souris de son ordinateur, un gribouillis volontairement imparfait, et avoir obtenu en retour une photo réaliste de l'animal conforme à ses instructions. La mise à jour ajoute également la possibilité de laisser des commentaires directement sur certaines zones d'une image déjà générée, plutôt que de devoir réécrire l'ensemble de la consigne. Cette évolution abaisse la barrière d'entrée à la génération d'images par IA pour les personnes qui peinent à décrire précisément avec des mots ce qu'elles imaginent visuellement. En combinant dessin approximatif et instructions textuelles, ChatGPT se rapproche d'un outil de conception assisté plus intuitif, utile aussi bien pour des créateurs occasionnels que pour des professionnels du design ou du marketing cherchant à itérer rapidement sur une idée visuelle. La possibilité de commenter des zones précises d'une image facilite en outre les retouches ciblées, sans repartir d'un prompt entier. Cette annonce s'inscrit dans la compétition intense que se livrent OpenAI, Google avec ses modèles Imagen et Gemini, ainsi que Midjourney, pour proposer des interfaces de génération d'images toujours plus naturelles et contrôlables. Depuis le lancement de ChatGPT Images, OpenAI a régulièrement enrichi l'outil de fonctions d'édition avancées. Sketch illustre une tendance plus large vers des entrées multimodales mêlant croquis, texte et annotations ciblées, une direction que d'autres acteurs du secteur pourraient rapidement chercher à égaler.

💬 Sketch, c'est la barrière du "je sais pas dessiner" qui saute enfin pour la génération d'images. OpenAI a compris un truc simple : personne ne décrit bien une image avec des mots, tout le monde sait vaguement gribouiller un chat ou une flèche. Reste à voir si les pros du design l'adoptent vraiment ou si ça reste un gadget pour dépanner un brief foireux.

CréationOutil
1 source
ChatGPT Images 2.5 : transformez vos croquis en illustrations ou laissez l’IA décider pour vous
Illustration générée par IA
12Frandroid 

ChatGPT Images 2.5 : transformez vos croquis en illustrations ou laissez l’IA décider pour vous

OpenAI a déployé le 8 septembre 2026 la version 2.5 de son générateur d'images intégré à ChatGPT, baptisé ChatGPT Images. Cette mise à jour introduit deux fonctionnalités principales : la possibilité de dessiner soi-même une esquisse à main levée pour que l'IA la transforme en illustration finalisée, et un système de modèles prédéfinis permettant de générer des visuels à partir de gabarits déjà construits par OpenAI. L'objectif affiché est de fluidifier la création d'images en réduisant le temps passé à formuler des prompts textuels complexes, au profit d'une interaction plus directe et visuelle avec l'outil. Cette évolution s'inscrit dans une logique d'accessibilité accrue pour les utilisateurs peu familiers avec l'art du prompt, en leur offrant un point de départ concret, un croquis ou un modèle, plutôt qu'une page blanche textuelle. Pour les créateurs de contenu, designers et professionnels du marketing, cela représente un gain de temps potentiel non négligeable dans la production de visuels. Le revers de la médaille, souligné par les premiers retours, est le risque d'une homogénéisation esthétique : en s'appuyant sur des modèles tout faits, les images générées par différents utilisateurs tendent à converger vers des styles similaires, ce qui pourrait diluer la singularité visuelle que promettait initialement la génération d'images par IA. Cette annonce s'inscrit dans la compétition intense que se livrent les géants de l'IA générative sur le terrain de l'image, face à des concurrents comme Google avec Imagen ou Midjourney. OpenAI cherche ainsi à consolider ChatGPT comme plateforme tout-en-un, combinant texte, code et création visuelle, plutôt que de laisser les utilisateurs se tourner vers des outils spécialisés. La question de la différenciation créative face à la standardisation des rendus générés par IA devrait rester un enjeu central pour les prochaines itérations de l'outil, à mesure que ces technologies se démocratisent auprès d'un public non technique.

CréationOutil
1 source
Flux : tout savoir sur le générateur d’images open source qui défie Midjourney
Illustration générée par IA
13Le Big Data 

Flux : tout savoir sur le générateur d’images open source qui défie Midjourney

Black Forest Labs, une startup allemande fondée par d'anciens chercheurs de l'équipe originelle de Stable Diffusion, a lancé son générateur d'images Flux en août 2024, avec l'ambition affichée de concurrencer Midjourney sur le terrain de la création visuelle par intelligence artificielle. L'outil repose sur une architecture appelée "flow matching", qui remplace la diffusion classique et améliore la fidélité aux descriptions textuelles ainsi que le rendu des anatomies humaines. La première génération, Flux.1, se déclinait en trois versions : Pro, fermée et accessible uniquement par serveur ; Dev, aux poids ouverts mais réservée à un usage non commercial ; et Schnell, distribuée sous licence permissive Apache/MIT, rapide même sur des cartes graphiques grand public et exploitable pour des projets commerciaux. Fin novembre 2025, Black Forest Labs a lancé Flux.2, une deuxième génération déclinée en versions pro, flex, dev, et depuis janvier 2026 klein, pensée pour une génération d'images en moins d'une seconde. La version premium atteint désormais une résolution native de quatre mégapixels et peut intégrer simultanément huit à dix images de référence. Cette montée en puissance change concrètement la donne pour les professionnels de la création visuelle. La disparition des défauts classiques des générateurs d'images, comme les mains difformes ou les visages peu naturels, rend l'outil crédible pour des usages professionnels et commerciaux, du design de personnages à la production de contenu de marque. La gestion simultanée de plusieurs images de référence permet notamment de conserver la cohérence visuelle d'un personnage ou d'un produit à travers différentes générations, un besoin central pour les marques et les studios créatifs. Surtout, le caractère open source de la version Schnell, déployable localement sur du matériel modeste, démocratise l'accès à une technologie jusque là dominée par des services propriétaires payants comme Midjourney, en donnant aux développeurs et créateurs indépendants un contrôle total sur leurs usages, y compris commerciaux. Ce positionnement s'inscrit dans un marché de la génération d'images par IA devenu extrêmement concurrentiel en 2026, où les acteurs fermés côtoient un écosystème open source de plus en plus mature. Black Forest Labs mise sur son ouverture et sa rapidité d'itération, portée par l'expérience de ses fondateurs sur Stable Diffusion, pour s'imposer comme une alternative européenne crédible face aux géants américains du secteur. L'arrivée rapprochée de nouvelles variantes, dont la version klein orientée vitesse d'exécution, illustre une cadence de développement soutenue et une volonté de couvrir tous les segments d'utilisateurs, du hobbyiste au studio professionnel, laissant présager de nouvelles itérations dans les mois à venir.

UEBlack Forest Labs, startup allemande fondée par d'anciens chercheurs de Stable Diffusion, positionne l'Europe comme actrice crédible face aux géants américains de la génération d'images par IA.

CréationActu
1 source
[Vidéo] Seedance 2.5 : jusqu’à 30 secondes de vidéo avec un seul prompt (audio intégré)
Illustration générée par IA
14Le Big Data 

[Vidéo] Seedance 2.5 : jusqu’à 30 secondes de vidéo avec un seul prompt (audio intégré)

Seedance 2.5, un nouveau modèle de génération vidéo par intelligence artificielle, permet désormais de produire jusqu'à 30 secondes de vidéo à partir d'un seul prompt, contre 10 à 15 secondes habituellement pour la plupart des générateurs concurrents. Sa particularité majeure réside dans la génération d'audio synchronisée : dialogues, bruitages, musique et ambiance sonore sont créés simultanément à l'image plutôt qu'ajoutés a posteriori, le tout pilotable directement depuis le texte du prompt. Le modèle intègre également un système de montage vidéo assisté par IA ainsi qu'une gestion étendue des références visuelles, désormais fixée à 50 images ou vidéos par génération, contre 9 images et 3 vidéos seulement sur la version précédente de l'outil. Trois démonstrations illustrent ces capacités : une scène d'action avec dialogues en français, un concert live avec chanson intégrée, et la transformation d'une séquence en scène d'horreur. Cette avancée marque un tournant pour les créateurs de contenu vidéo assistée par IA, car elle réduit fortement les étapes de post-production habituellement nécessaires. Jusqu'ici, l'ajout d'un son cohérent et synchronisé restait l'un des obstacles principaux à des vidéos IA convaincantes, un audio mal calé ou artificiel pouvant ruiner un rendu visuel par ailleurs réussi. En automatisant cette synchronisation dès la génération, Seedance 2.5 simplifie le flux de travail pour les créateurs, monteurs et professionnels du marketing vidéo. L'augmentation du nombre de références autorisées permet en outre de maintenir une cohérence visuelle sur des projets plus longs et plus ambitieux, avec des personnages et décors stables d'une scène à l'autre, un enjeu clé pour toute production narrative sérielle. Cette évolution s'inscrit dans une course technologique intense entre les différents générateurs vidéo par IA, où la durée des séquences, la cohérence visuelle et désormais l'intégration audio deviennent des critères de différenciation majeurs. Les versions précédentes de ce type d'outils se limitaient souvent à de courts clips silencieux ou nécessitaient un doublage ajouté manuellement en post-production. À mesure que ces modèles gagnent en autonomie créative, ils redessinent les usages possibles pour la publicité, le cinéma indépendant ou la création de contenu sur les réseaux sociaux, tout en posant la question de la maîtrise du prompt comme nouvelle compétence technique pour exploiter pleinement ces outils sans multiplier les tentatives coûteuses en crédits.

CréationActu
1 source
Google intègre la génération de musique par IA dans Gemini avec son nouveau modèle Lyria 3.5
Illustration générée par IA
15The Decoder 

Google intègre la génération de musique par IA dans Gemini avec son nouveau modèle Lyria 3.5

Google a lancé Lyria 3.5, son nouveau modèle de génération musicale par intelligence artificielle, directement intégré dans l'application Gemini ainsi que via son API. Le modèle promet des voix plus expressives et des arrangements plus riches que ses versions précédentes. Au delà de Gemini, Lyria 3.5 est également accessible via Flow Music, AI Studio et Google Vids, couvrant ainsi plusieurs points d'entrée dans l'écosystème Google. L'entreprise précise que le modèle a été entraîné exclusivement sur du contenu sous licence, une distinction qu'elle met en avant explicitement. Cette intégration marque une étape supplémentaire dans la bataille des géants technologiques pour dominer la création musicale assistée par IA, un segment jusque là dominé par des acteurs spécialisés comme Suno ou Udio. En rendant Lyria 3.5 disponible directement dans Gemini, l'application d'assistant IA grand public de Google, l'entreprise abaisse considérablement la barrière d'entrée pour des millions d'utilisateurs qui n'auraient pas cherché un outil de génération musicale dédié. Pour les créateurs de contenu, les développeurs et les professionnels du marketing, cela signifie un accès simplifié à la composition musicale sans compétence technique particulière, directement intégré dans des flux de travail existants via l'API et des outils comme Google Vids pour la vidéo. La mise en avant de l'entraînement sur contenu licencié s'inscrit dans un contexte de tensions juridiques persistantes autour de l'IA générative musicale, où plusieurs maisons de disques ont engagé des poursuites contre des start-ups accusées d'avoir utilisé des enregistrements protégés sans autorisation. En choisissant cette approche, Google cherche à se positionner comme un acteur plus sûr juridiquement pour les entreprises et les créateurs soucieux des droits d'auteur. Cette stratégie pourrait influencer la manière dont l'industrie musicale négocie avec les géants de la tech, tout en intensifiant la concurrence face aux modèles spécialisés qui devront eux aussi clarifier l'origine de leurs données d'entraînement.

💬 Le coup de force, c'est pas Lyria 3.5 comme modèle, c'est de le glisser direct dans Gemini, l'appli que tu ouvres déjà tous les jours. Suno et Udio ont beau avoir de l'avance technique, ils vont se battre contre une distribution que personne ne peut égaler. Et l'argument du contenu 100% licencié, c'est moins une posture éthique qu'un argument de vente pour les boîtes qui n'ont pas envie de se retrouver devant un juge à cause d'une maison de disques.

CréationActu
1 source
Ils font des millions de vues avec des vidéos IA : 7 créateurs révèlent ce qui se passe vraiment derrière les prompts
Illustration générée par IA
16Le Big Data 

Ils font des millions de vues avec des vidéos IA : 7 créateurs révèlent ce qui se passe vraiment derrière les prompts

Le média LeBigData a interrogé sept créateurs de vidéos générées par intelligence artificielle pour comprendre le travail réel derrière ces contenus viraux. Parmi eux, Alina Mi, une Ukrainienne installée à Londres, forte de plus de dix ans d'expérience dans la mode et la direction artistique, a découvert ChatGPT début 2023 puis Midjourney et Runway. Son succès vient d'une tendance détournée : inspirée d'une scène de cheval mécanique du film Career Opportunities, où les créateurs plaçaient habituellement des femmes, elle a eu l'idée d'y installer des célébrités masculines torse nu. Grâce aux Trial Reels d'Instagram, qui testent un contenu auprès de non-abonnés, plusieurs vidéos ont dépassé le million de vues, celle consacrée à Henry Cavill atteignant 5,8 millions. Au total, ses créations ont cumulé plus de 30 millions de vues organiques en un mois. D'autres créateurs évoquent des films bouclés en deux jours, des centaines de générations jetées et des budgets pouvant grimper à six chiffres, avec des outils comme Seedance, Kling ou Veo. Ce décalage entre audience et rentabilité est révélateur pour toute l'industrie naissante de la vidéo générative. Malgré ses dizaines de millions de vues, Alina Mi n'a reçu que des commandes modestes : des particuliers lui ont payé environ 70 livres sterling pour des variantes de la vidéo du cheval, et une entreprise lui a commandé des productions plus ambitieuses pour environ 300 livres. Produire coûte cher : lors d'un mois intensif, elle a dépensé environ 900 livres supplémentaires en crédits et générations IA, en plus de ses abonnements habituels. La viralité ne se traduit donc pas mécaniquement en revenus, contredisant l'idée d'un « bouton magique » rentable. Pour les créateurs qui veulent vivre de ce médium, cela signifie construire une activité au-delà des compteurs de vues, un enjeu qui concerne aussi bien les marques que les plateformes cherchant à monétiser ces nouveaux formats. Ce constat s'inscrit dans un contexte où le fantasme du texte transformé instantanément en film se heurte à la réalité du terrain. Les créateurs interrogés viennent d'horizons variés : certains cumulent dix, vingt, voire près de trente ans d'expérience dans le cinéma ou le motion design, d'autres se sont formés seuls, l'IA générative leur ayant donné accès pour la première fois à un médium jusque-là trop coûteux. Tous utilisent des combinaisons d'outils différentes, sans cesse renouvelées au gré des mises à jour de Midjourney, Kling, Seedance ou Veo, et décrivent un processus d'essais-erreurs intensif, avec un grand nombre de générations abandonnées avant d'obtenir un résultat exploitable. Aucun n'affirme avoir trouvé la formule garantissant la viralité. L'enquête souligne que la vidéo générative reste un métier exigeant en compétences artistiques et en investissement financier, alors que plateformes et studios cherchent encore le modèle économique capable d'en faire une activité pérenne.

CréationOutil
1 source
Lyria 3.5 débarque dans GeminiApp : créez vos morceaux en quelques clics !
Illustration générée par IA
17Le Big Data 

Lyria 3.5 débarque dans GeminiApp : créez vos morceaux en quelques clics !

Google a annoncé le 4 septembre 2026 le déploiement mondial de Lyria 3.5, son modèle génératif musical, au sein de l'application GeminiApp. Développé avec Google DeepMind, ce système avait été lancé fin juillet 2026 avant d'être désormais intégré à Gemini et à son API. Lyria 3.5 permet de générer des chansons complètes à partir d'une simple commande textuelle, sans nécessiter de compétences en musique assistée par ordinateur ni de logiciels de montage. Le rendu audio atteint une qualité studio de 44,1 kHz, avec une structure musicale avancée, des transitions fluides entre les parties du morceau et des voix synthétiques capables de restituer une expressivité proche de celle d'un chanteur humain. Le modèle respecte fidèlement les consignes données pour les paroles et laisse à l'utilisateur un contrôle sur le tempo, le rythme et le style. Au delà de GeminiApp mobile, l'outil est accessible sur le web via gemini.google, mais aussi via Google Flow Music pour les artistes professionnels, via Google AI Studio pour les développeurs souhaitant l'intégrer par API, et via Google Vids pour les équipes de production vidéo. Cette annonce marque une nouvelle étape dans la démocratisation de la création musicale assistée par IA, en rendant un outil auparavant réservé aux initiés accessible au grand public en quelques clics. Pour les créateurs de contenu, les vidéastes ou les amateurs, cela signifie la possibilité de produire une bande originale, un jingle ou une chanson complète en quelques secondes, sans budget ni matériel spécialisé. Pour l'industrie musicale, l'enjeu est plus sensible: la multiplication de ces générateurs interroge la place des compositeurs, interprètes et maisons de disques face à des voix synthétiques de plus en plus réalistes, ainsi que les questions de droits d'auteur sur les œuvres utilisées pour entraîner ces modèles. En intégrant Lyria 3.5 directement dans une application grand public utilisée par des centaines de millions de personnes, Google accélère la banalisation de cette technologie et met la pression sur ses concurrents. Ce lancement s'inscrit dans une course plus large entre grands acteurs de l'IA générative sur le terrain de la musique, où Google cherche à consolider son avance après plusieurs générations de Lyria depuis son introduction initiale. L'entreprise mise sur une stratégie de diffusion multicanal, entre application grand public, plateforme créative professionnelle et outils pour développeurs, afin de couvrir l'ensemble de la chaîne de création musicale. Les prochains mois devraient permettre de mesurer l'adoption réelle de l'outil par les créateurs amateurs et professionnels, ainsi que les réactions de l'industrie musicale et des régulateurs concernant l'usage de contenus protégés dans l'entraînement de ces modèles, un sujet qui reste au cœur des tensions entre géants technologiques et ayants droit.

UELes créateurs français et européens ont accès à l'outil via GeminiApp, mais les questions de droits d'auteur pour l'industrie musicale locale restent en suspens.

💬 Ce qui change la donne ici, c'est pas la qualité audio, c'est la distribution : Google embarque un générateur de chansons complet dans une appli que des centaines de millions de gens ouvrent chaque jour. Pour le vidéaste ou l'amateur qui veut un jingle en trente secondes, c'est enfin du concret, plus besoin de logiciel ni de compétences. Mais plus la voix synthétique sonne juste, plus la question des droits d'auteur devient centrale, et sur ce point-là Google reste très discret.

CréationActu
1 source
Roland se lance dans la musique générée par IA avec Melody Flip
Illustration générée par IA
18The Verge AI 

Roland se lance dans la musique générée par IA avec Melody Flip

Roland vient de lancer Melody Flip, un plug-in d'intelligence artificielle générative destiné aux stations de travail audionumériques (DAW). L'outil propose environ 250 "Palettes", des collections thématiques d'idées musicales classées par genre. Les utilisateurs peuvent partir de zéro et demander la génération de mélodies, de progressions d'accords, de lignes de basse ou de rythmes, dans n'importe quelle combinaison. Ils peuvent aussi importer un morceau de référence pour que l'outil développe de nouvelles idées à partir de ses motifs mélodiques. Contrairement à Suno ou Udio, Melody Flip ne produit pas de chansons entièrement finalisées avec voix et arrangement complet. Cette approche distingue Roland des géants de la génération musicale par IA qui visent le "bouton unique" produisant un morceau prêt à l'écoute. En se positionnant comme un outil d'assistance à la composition plutôt que comme un générateur de chansons complètes, l'entreprise japonaise s'adresse directement aux musiciens et producteurs déjà équipés de logiciels professionnels, plutôt qu'aux créateurs de contenu cherchant une piste instantanée. Cela pourrait rassurer une partie de l'industrie musicale inquiète de voir l'IA remplacer entièrement le travail créatif, en présentant Melody Flip comme un outil d'aide à l'écriture plutôt qu'un substitut à l'artiste. Ce lancement s'inscrit dans une vague plus large où les fabricants d'instruments et de matériel audio traditionnels intègrent l'IA générative à leurs gammes, après des années dominées par des start-ups comme Suno et Udio, elles-mêmes visées par des poursuites pour violation de droits d'auteur de la part des maisons de disques. Roland, connue pour ses synthétiseurs et boîtes à rythmes, mise sur son ancrage dans les studios professionnels pour se différencier. Reste à voir comment les musiciens accueilleront cette approche plus modeste mais potentiellement plus compatible avec les usages créatifs établis.

💬 Roland ne vise pas le tube en un clic, il vise le musicien qui bosse déjà dans son DAW, et c'est exactement ce qui manquait dans ce marché saturé de générateurs "bouton unique". Là où Suno ou Udio inquiètent l'industrie en sortant des morceaux finis voix comprise, un outil qui propose juste des mélodies ou des lignes de basse à greffer dans un vrai projet, ça reste un instrument, pas un remplaçant. Reste à voir si les 250 palettes tiennent la comparaison avec un vrai sens mélodique, parce que sur le papier c'est malin, mais l'assistance à la composition, ça se juge à l'oreille, pas sur une fiche produit.

CréationOutil
1 source
Pourquoi la nourriture generee par IA a toujours cette apparence
Illustration générée par IA
19The Verge AI 

Pourquoi la nourriture generee par IA a toujours cette apparence

Un nombre croissant de restaurants, cafés et marques alimentaires utilisent désormais des générateurs d'images par IA pour illustrer leurs produits sur les réseaux sociaux et leurs menus, avec des résultats jugés grotesques par de nombreux internautes. The Verge recense une collection d'images virales ratées : des crevettes en forme de donuts, un sandwich Reuben aux allures monstrueuses, des nouilles filandreuses ressemblant à des vers, du poulet effiloché à la texture douteuse, ainsi que des glaces qui évoquent tantôt du béton, tantôt des cerveaux humains. D'autres visuels montrent un burger difforme ou un burrito couvert de bosses et de trous évoquant des larves, au point de déclencher chez certains spectateurs une réaction de trypophobie. Ce déferlement d'images ratées, surnommé "AI slop" dans l'industrie, pose un problème concret pour les commerces qui l'utilisent : au lieu d'attirer les clients, ces visuels générés automatiquement suscitent moquerie et méfiance en ligne, ternissant l'image de marque plutôt que de la renforcer. Le phénomène illustre les limites persistantes des modèles de diffusion, technologie derrière la plupart des générateurs d'images actuels, qui peinent encore à reproduire de façon crédible les textures organiques complexes de la nourriture, comme la fonte du fromage, le grain de la viande ou la structure d'une pâte. Ce recours croissant à l'IA s'explique par la recherche d'économies sur la photographie culinaire professionnelle, traditionnellement coûteuse. Mais l'écart entre l'ambition marketing et le rendu visuel obtenu alimente un débat plus large sur la précipitation des entreprises à adopter l'IA générative sans contrôle qualité suffisant, un phénomène observé bien au-delà du seul secteur de la restauration.

UELe phénomène concerne aussi les restaurants et enseignes alimentaires en France qui recourent aux mêmes générateurs d'images IA pour leur communication.

💬 Le vrai problème, c'est pas que l'IA rate la bouffe, c'est qu'elle rate ce qui coûte cher à faire à la main : la texture. Le fromage qui fond, le grain d'une viande grillée, ça demande de la lumière, un vrai plat, un vrai photographe, et c'est exactement ce que les modèles de diffusion n'ont jamais appris à simuler. Du coup les enseignes qui pensaient économiser sur la photo culinaire se retrouvent avec des burgers qui donnent envie de vomir plutôt que de commander, et ça, niveau retour sur investissement, c'est raté.

CréationActu
1 source
Créer une vidéo de groupe avec l’IA : 8 idées originales à tester entre amis
Illustration générée par IA
20Le Big Data 

Créer une vidéo de groupe avec l’IA : 8 idées originales à tester entre amis

Créer des vidéos personnalisées avec l'intelligence artificielle devient un loisir accessible entre amis, selon un article qui détaille huit façons d'utiliser ces outils pour transformer des séquences filmées au téléphone. La nouveauté mise en avant concerne la possibilité de modifier plusieurs visages au sein d'une même vidéo, et non plus seulement celui d'un personnage principal. VidMage propose ainsi un outil dédié au remplacement de plusieurs visages dans une vidéo, permettant d'attribuer un rôle différent à chaque participant d'un groupe sans avoir à traiter chaque visage séparément. Parmi les idées proposées figurent la recréation d'une scène de film culte avec les membres d'un groupe d'amis dans les rôles principaux, la transformation d'une vidéo de vacances en scénario totalement différent tout en conservant le décor original, l'adaptation personnalisée de formats populaires sur TikTok, Instagram Reels ou YouTube Shorts, la création de vidéos surprises pour des anniversaires, ou encore l'attribution volontairement décalée de rôles à contre-emploi, comme confier le rôle du héros d'action à la personne la plus calme du groupe. Cette évolution illustre la démocratisation rapide des outils de montage vidéo basés sur l'IA générative, qui ne nécessitent plus de compétences techniques particulières pour produire des effets auparavant réservés aux professionnels. Pour les utilisateurs, cela ouvre un nouveau terrain de création sociale : des vidéos courtes, personnalisées et facilement partageables sur les réseaux sociaux, où le format et la rapidité de production comptent davantage que la qualité cinématographique. Pour les plateformes comme TikTok ou Instagram, cette accessibilité alimente un flux constant de contenus originaux susceptibles de générer de l'engagement. Elle marque aussi une étape supplémentaire dans la normalisation des technologies de remplacement facial, autrefois associées principalement aux deepfakes, désormais présentées comme des outils ludiques d'usage courant entre proches. Ce type d'application s'inscrit dans la vague plus large des outils grand public de génération et de manipulation vidéo par IA, portée par une multiplication de start-up et de services en ligne qui simplifient des techniques complexes comme le face-swap multi-personnages. À mesure que ces outils se banalisent, les questions de consentement et d'usage responsable de l'image d'autrui, même dans un cadre amical et non malveillant, restent en toile de fond. La compétition entre plateformes spécialisées dans l'édition vidéo par IA devrait continuer de s'intensifier, chacune cherchant à simplifier davantage la création de contenus collectifs personnalisés pour capter les usages sociaux et divertissants qui dominent aujourd'hui les réseaux.

CréationOutil
1 source
Transformer une photo avec l’IA : comment donner une nouvelle vie à une image existante
Illustration générée par IA
21Le Big Data 

Transformer une photo avec l’IA : comment donner une nouvelle vie à une image existante

La transformation d'image par intelligence artificielle, ou génération image-to-image, permet de partir d'une photographie existante plutôt que d'une simple description textuelle pour créer une toute nouvelle image. Contrairement à la retouche photo classique, qui se limite à ajuster la lumière, les couleurs ou à supprimer un élément indésirable, cette technologie autorise des transformations beaucoup plus radicales : changer le style visuel d'une photo, placer un sujet dans un environnement totalement différent, modifier les matières et les textures, transformer une personne en figurine 3D stylisée, ou encore réinventer une scène du quotidien en décor cinématographique. Le principe technique repose sur une combinaison entre une image source, qui fournit au système des informations sur le sujet, la composition et les objets présents, et un prompt textuel qui indique la direction créative à suivre. Le processus est généralement itératif : importer une photo, décrire la transformation souhaitée en précisant les éléments à conserver, le style, l'environnement et la lumière, générer un premier résultat, puis l'affiner par des ajustements successifs jusqu'à obtenir le rendu recherché. La photo de départ n'a pas besoin d'être professionnelle : un cliché personnel, un paysage ou une photo de produit suffisent comme point de départ. Cette évolution change concrètement la manière dont les créateurs, les marques et les particuliers peuvent exploiter leurs images. Pour les professionnels du marketing et de la publicité, elle ouvre la possibilité de générer des visuels de campagne originaux à partir de simples photos de produits, sans recourir à des séances photo coûteuses ou à des décors physiques. Pour les créateurs de contenu et les artistes, elle permet d'explorer des directions visuelles impossibles à obtenir avec des outils de retouche traditionnels, en réinterprétant une image tout en conservant la reconnaissabilité du sujet principal. Pour le grand public, elle démocratise des effets visuels auparavant réservés à des studios spécialisés, qu'il s'agisse de scènes de jeu vidéo, de créatures imaginaires ou d'univers stylisés. L'enjeu dépasse donc la simple retouche esthétique : c'est la capacité de l'IA à modifier le contexte et la signification visuelle d'une image, et pas seulement son apparence de surface, qui constitue la véritable rupture. Cette approche s'inscrit dans la continuité des avancées de l'IA générative visuelle, qui est passée en quelques années de la génération d'images purement textuelle à des systèmes capables de manipuler des images réelles avec une grande finesse. Elle répond aussi à une limite concrète des premiers générateurs texte-image : la difficulté à contrôler précisément la composition ou à conserver un sujet reconnaissable d'une génération à l'autre. En s'appuyant sur une photo existante comme ancrage visuel, les outils image-to-image offrent davantage de contrôle créatif tout en réduisant la part d'aléatoire. À mesure que ces technologies se perfectionnent, la question du contrôle fin du prompt, de la fidélité au sujet d'origine et des usages commerciaux ou détournés de ces transformations restera au cœur des débats entourant l'IA générative appliquée à l'image.

CréationTuto
1 source
Google Pics : le nouvel outil IA de Google pour modifier vos images élément par élément
Illustration générée par IA
22Le Big Data 

Google Pics : le nouvel outil IA de Google pour modifier vos images élément par élément

Google a présenté Google Pics, un nouvel outil de génération et de retouche d'images par intelligence artificielle, annoncé le 1er septembre 2026 via le compte X officiel de Google Workspace. L'outil est déployé progressivement auprès des clients Google Workspace ainsi que des abonnés Google AI Pro et Ultra. Sa particularité est de permettre l'édition ciblée d'un visuel généré par IA : plutôt que de relancer une génération complète à partir d'un prompt modifié, l'utilisateur peut sélectionner un objet précis, une zone ou une couleur, décrire la modification souhaitée, et l'IA l'applique sans toucher au reste de l'image. Plusieurs commentaires ciblés peuvent même être déposés simultanément à différents endroits du visuel pour lancer une série de retouches en une seule fois. L'outil intègre aussi une fonction de modification et de traduction du texte incrusté dans une image, en conservant la police et le design d'origine. Google Pics fonctionne comme outil autonome mais s'intègre nativement à Google Slides, Docs et Drive. Cette annonce répond à une frustration courante des utilisateurs de générateurs d'images IA : un seul détail imparfait obligeait jusqu'ici à réécrire le prompt et à tout régénérer, au risque de perdre le reste de la composition. En rapprochant la génération d'images d'un véritable outil de retouche professionnelle, Google s'attaque directement à la marche à suivre des créateurs de contenu, des équipes marketing et des utilisateurs de bureautique qui doivent produire des visuels rapidement sans maîtriser des logiciels comme Photoshop. L'intégration native à Slides, Docs et Drive supprime aussi les allers-retours entre outils de retouche externes et environnement de travail, un gain de temps concret pour les usages professionnels quotidiens. La fonction de génération de plusieurs versions à partir d'un même prompt et le partage collaboratif des créations renforcent cette logique d'outil de production intégré plutôt que de simple gadget créatif isolé. Cette sortie s'inscrit dans la stratégie plus large de Google visant à infuser l'intelligence artificielle générative dans l'ensemble de son écosystème Workspace, plutôt qu'à proposer des outils IA détachés de la suite bureautique. Elle intervient dans un contexte de concurrence intense entre géants technologiques sur la génération d'images par IA, où la précision de l'édition et la fidélité au visuel d'origine deviennent des arguments différenciants face aux outils qui régénèrent l'image entière à chaque ajustement. En misant sur la collaboration en équipe et l'intégration native à ses applications phares, Google cherche à ancrer Pics dans les habitudes professionnelles existantes plutôt qu'à le positionner comme un produit grand public isolé. Le déploiement progressif laissera voir dans les prochaines semaines l'ampleur réelle des fonctionnalités disponibles et la réaction des utilisateurs professionnels face à cette nouvelle approche de la retouche assistée par IA.

UELes entreprises et professionnels français utilisant Google Workspace pourront accéder progressivement a cet outil de retouche d'image sans régulation spécifique déclenchée.

CréationOutil
1 source
Google Pics ressemble à Canva, mais avec encore plus d'IA
Illustration générée par IA
23The Verge AI 

Google Pics ressemble à Canva, mais avec encore plus d'IA

Google a lancé Google Pics, une nouvelle suite d'outils de création destinée aux utilisateurs de Workspace, conçue pour simplifier l'édition et la génération d'images "de qualité professionnelle" grâce à l'intelligence artificielle. L'outil s'appuie sur Gemini et sur le modèle de génération d'images Nano Banana. Google Pics offre un contrôle plus précis que les chatbots classiques : les utilisateurs peuvent cliquer directement sur un objet ou un texte présent dans l'image et décrire ce qu'ils souhaitent modifier, plutôt que de reformuler un prompt entier. L'objectif affiché est d'éviter les résultats maladroits ou peu convaincants que produisent souvent les générateurs d'images quand ils sont utilisés pour du contenu marketing. Cette annonce s'adresse directement aux entreprises, un segment où l'IA générative d'images peinait jusqu'ici à convaincre malgré son succès massif auprès du grand public. Pour les équipes marketing, communication ou design de petite taille, un outil intégré à Workspace qui permet de retoucher visuels et textes promotionnels sans recourir à un designer ni maîtriser des logiciels complexes comme Photoshop pourrait représenter un gain de temps et de coûts significatif. En positionnant Pics comme un concurrent direct de Canva, Google cherche à capter une part du marché de la création visuelle professionnelle, un secteur jusqu'ici dominé par des outils spécialisés plutôt que par les suites bureautiques traditionnelles. Ce lancement s'inscrit dans la stratégie plus large de Google visant à infuser Gemini dans l'ensemble de sa suite Workspace, aux côtés d'outils comme Docs, Sheets ou Slides. Il traduit aussi une reconnaissance implicite des limites actuelles des chatbots d'IA générative pour les usages professionnels, où la précision et la contrôlabilité comptent davantage que la rapidité de génération. Reste à voir comment Canva, Adobe et Microsoft, eux aussi engagés dans une course à l'intégration de l'IA générative dans leurs outils de design, réagiront à cette concurrence directe de Google sur leur terrain.

💬 Google Pics, c'est l'aveu que le chatbot pour générer des visuels marketing, ça a fait pschitt en entreprise : trop aléatoire, pas assez pilotable. Cliquer sur l'objet à changer plutôt que réécrire un prompt entier, c'est exactement ce qui manquait pour que ce soit utilisable par une équipe qui n'a pas de designer sous la main. Reste que Google débarque sur un terrain où Canva et Adobe ont dix ans d'avance en ergonomie, l'IA seule ne suffira pas à faire basculer les habitudes.

DLSS 5 : Nvidia dévoile son rendu neuronal en action avec NBA 2K27
Illustration générée par IA
24Le Big Data 

DLSS 5 : Nvidia dévoile son rendu neuronal en action avec NBA 2K27

Nvidia a dévoilé le 1er septembre 2026 les détails de son DLSS 5, dont la fonctionnalité phare s'appelle le rendu neuronal guidé en 3D. NBA 2K27 sera le tout premier jeu à intégrer officiellement cette technologie, à partir du 3 septembre. Ce choix n'est pas anodin : la simulation de basket mise déjà lourdement sur le réalisme visuel de ses joueurs, ce qui en fait une vitrine idéale pour Nvidia. Concrètement, l'intelligence artificielle intervient directement pendant la création de l'image, en analysant les surfaces, les sources lumineuses et la composition globale de la scène, pour ensuite ajuster l'éclairage, les matériaux et certains détails visuels comme les pores de la peau ou la transpiration des joueurs. Le journaliste Tom Warren, de The Verge, a toutefois relevé sur X que l'impact sur les performances était considérable, suggérant que la technologie vise davantage le matériel graphique de demain que les cartes actuelles. Cette annonce marque un tournant dans la manière dont Nvidia entend démontrer les capacités de son intelligence artificielle appliquée au rendu graphique. Contrairement à une IA qui générerait librement chaque image, le DLSS 5 reste guidé par le rendu initial produit par le moteur du jeu, et les développeurs conservent la main sur la direction artistique finale, via des paramètres ajustables sur l'occlusion ambiante, les réflexions ou certains matériaux, ainsi que des systèmes de masques pour cibler des zones précises de l'image. Pour l'industrie du jeu vidéo, cela ouvre la voie à un réalisme visuel inédit, mais au prix d'une puissance de calcul nettement supérieure, ce qui pourrait accélérer le renouvellement du parc de cartes graphiques haut de gamme chez les joueurs les plus exigeants. Cette sortie officielle intervient après plusieurs mois de rumeurs et de fuites. Des fichiers du DLSS 5 avaient en effet circulé avant son lancement, permettant à des moddeurs de l'intégrer de manière non officielle dans des jeux comme Control, Forza Horizon 5 ou Ghost of Tsushima, avec des résultats très inégaux d'un titre à l'autre. En reprenant le contrôle avec une intégration native et maîtrisée dans NBA 2K27, Nvidia cherche aussi à répondre aux critiques et rumeurs infondées qui avaient accompagné ces essais bricolés, en insistant publiquement sur le fait qu'aucun changement de géométrie n'est opéré par cette IA. La suite dépendra désormais de l'adoption de la technologie par d'autres studios et de sa compatibilité avec les futures générations de cartes graphiques Nvidia.

Fal lance H3 Max Live et repousse la limite de la génération vidéo infinie
Illustration générée par IA
25Latent Space 

Fal lance H3 Max Live et repousse la limite de la génération vidéo infinie

Fal, spécialiste de l'inférence pour la génération vidéo par IA, a franchi ce que ses équipes qualifient de barrière de la vidéo infinie en temps réel. En reprenant le modèle H3 de Minimax publié le mois précédent, Fal l'a d'abord réentraîné pour améliorer coût et qualité, puis optimisé pour son moteur d'inférence maison, atteignant une vitesse 35 fois supérieure à celle du point d'accès officiel de Minimax. Le résultat dépasse la vitesse de génération en temps réel, un seuil jusque là jamais franchi durablement pour la vidéo générative. La percée a d'abord été repérée par le chercheur Ethan Mollick, avant que des employés de Fal ne la transforment en flux Twitch infini généré par IA. Twitch et YouTube ont rapidement banni ce flux de leurs plateformes, poussant Fal à lancer son propre service de diffusion en direct, une sorte de "Twitch Plays Pokémon" propulsé par IA générative. Cette semaine a aussi vu Meta faire sortir son agent de codage Muse Code de bêta avec un SDK pour développeurs et des abonnements mensuels, tandis que DeepSeek publiait les poids ouverts de V4 Flash Vision et que Tencent dévoilait Hy4 Preview, un modèle open source à mixture d'experts de 770 milliards de paramètres. Cette avancée technique, même si le contenu produit reste qualifié de "slop" par ses propres promoteurs, un magma vidéo sans scénario ni cohérence, constitue une preuve de concept majeure pour l'industrie de la génération de médias par IA. Jusqu'à présent, générer de la vidéo demandait un temps de calcul incompressible, limitant les applications à des rendus différés même avec les modèles de cohérence les plus rapides. Le fait que Fal démontre une vitesse de génération supérieure au temps réel change la donne pour toute conception de produits vidéo génératifs interactifs, du streaming automatisé aux expériences de divertissement adaptatives. Pour les plateformes comme Twitch et YouTube, cela pose immédiatement des questions de modération de contenu à grande échelle, comme l'illustre leur bannissement immédiat du flux de Fal. Pour les développeurs et entrepreneurs du secteur, le signal est que la qualité s'améliorera rapidement à partir de cette base technique désormais validée. Cette percée s'inscrit dans une compétition plus large entre laboratoires sur l'infrastructure d'inférence et les modèles ouverts. GLM-5.3 Flash de Zhipu s'est classé 19e au classement général de l'Agent Arena et 4e parmi les modèles ouverts, avec un coût médian de 0,12 dollar par tâche et un score de 95,4% sur SWE-bench, tandis que Qwen3.8-Flash-Next de Alibaba s'est positionné 24e. Ces publications concurrentes, combinées à l'accélération de Tencent qui a comblé une grande partie de son retard sur Hy3 en seulement sept semaines grâce au post-entraînement, illustrent une course effrénée entre laboratoires chinois et américains sur le rapport coût-performance des agents. La démonstration de Fal, aussi rudimentaire soit son contenu actuel, ouvre la voie à des applications futures de streaming vidéo génératif en temps réel, un terrain que davantage d'acteurs vont désormais chercher à occuper.

💬 35 fois plus rapide que le point d'accès officiel de Minimax, et surtout plus rapide que le temps réel : c'est la première fois qu'un labo casse vraiment ce plafond sur la vidéo générative, pas juste sur le papier. Le contenu, c'est du slop, ils le disent eux-mêmes, un flux Twitch sans queue ni tête que les plateformes ont banni en quelques heures. Mais la vitesse de génération, elle, est acquise : maintenant que ce seuil est franchi, toute l'industrie du streaming génératif va s'y engouffrer, et c'est la qualité qui devient le seul problème restant.

CréationActu
1 source
Gradium AI lance un nouveau modèle TTS par défaut : 81 % de réussite sur cas difficiles, 216 ms avant premier audio
Illustration générée par IA
26MarkTechPost 

Gradium AI lance un nouveau modèle TTS par défaut : 81 % de réussite sur cas difficiles, 216 ms avant premier audio

Gradium AI a annoncé le 31 août 2026 le déploiement de son nouveau modèle de synthèse vocale (text-to-speech) comme option par défaut sur l'ensemble de son API et de sa plateforme Studio. La société affiche un taux de réussite de 81,0 % évalué par des locuteurs natifs sur un ensemble de 500 phrases jugées difficiles, couvrant cinq langues (anglais, allemand, français, espagnol, portugais). Ce score dépasse celui de Cartesia Sonic 3.6 (75,1 %), ElevenLabs v3 Conversational (65,4 %), Fish Audio S2.1 Pro (49,5 %) et Inworld TTS 1.5 Max (46,5 %). Côté latence, le modèle atteint un temps avant premier son de 216 millisecondes en médiane (P50) sur le benchmark de Coval, soit 170 ms de moins que la version précédente, avec un écart interquartile de seulement 30 ms sur 480 tests, la variabilité la plus faible des cinq modèles comparés. La bascule s'est faite sans migration requise : les voix existantes, y compris les clones personnalisés, continuent de fonctionner sans modification. Cette annonce cible un point de friction bien identifié des agents vocaux automatisés : la restitution fiable des éléments critiques d'un appel, comme un numéro de commande, des chiffres de rappel ou une adresse email dictée par un interlocuteur. Une seule syllabe ou un chiffre mal prononcé peut faire échouer toute une interaction avec un client, ce qui explique pourquoi Gradium a construit une méthodologie d'évaluation stricte : une phrase n'est validée que si un évaluateur natif entend chaque élément prononcé correctement et intégralement. Pour les entreprises qui déploient des centres d'appels automatisés, des assistants de support ou des agents de prise de commande, ce genre d'amélioration a un impact direct sur le taux de résolution des appels et la satisfaction client, sans nécessiter de refonte technique. La combinaison d'une précision élevée et d'une latence courte et stable est particulièrement recherchée dans les conversations vocales en temps réel, où les utilisateurs perçoivent immédiatement les temps de réponse irréguliers. Ce lancement s'inscrit dans une compétition croissante entre fournisseurs de synthèse vocale pour les agents conversationnels, un segment où Cartesia, ElevenLabs, Fish Audio et Inworld sont déjà positionnés. Gradium a choisi de rendre son protocole d'évaluation transparent en publiant l'ensemble des 500 phrases de test sur Hugging Face sous licence CC BY 4.0, une démarche destinée à crédibiliser ses résultats face à des benchmarks habituellement propriétaires et donc invérifiables par des tiers. La entreprise reconnaît elle-même qu'il s'agit d'un benchmark mené en interne, ce qui appelle à la prudence dans son interprétation. Pour encourager la détection de défauts persistants, Gradium propose désormais une récompense d'un million de crédits à quiconque signale, via son serveur Discord, un cas d'échec complet sur ses critères de test. L'accès au nouveau modèle se fait via le SDK Python existant et le point de terminaison WebSocket TTS, sans changement pour les identifiants de voix déjà utilisés par les clients.

💬 81% de réussite sur des phrases piégeuses (numéros, adresses email dictées), c'est le premier chiffre de TTS qui parle vraiment aux boîtes qui font tourner des call centers automatisés, parce que c'est exactement là que ça foire d'habitude, sur un chiffre mal prononcé qui plante tout l'appel. La latence à 216 ms avec un écart-type ridicule, c'est ce qui manquait pour du vocal temps réel crédible. Reste que c'est un benchmark maison, même transparent sur Hugging Face, donc j'attends de voir si les 81% tiennent hors du labo.

CréationActu
1 source
Gemini Omni 1.1 Flash de Google : extension de scène de 40 secondes, contrôle image de début/fin et upscaling 4K
Illustration générée par IA
27MarkTechPost 

Gemini Omni 1.1 Flash de Google : extension de scène de 40 secondes, contrôle image de début/fin et upscaling 4K

Google a lancé Gemini Omni 1.1 Flash (gemini-omni-1.1-flash), une mise à jour de production de son modèle multimodal natif de génération et d'édition vidéo. La nouveauté principale concerne l'extension de scène : le modèle analyse désormais jusqu'à 10 secondes de contexte précédent, contre une seule dernière image auparavant, et peut enchaîner les extensions par tranches de 10 secondes jusqu'à un total cumulé de 40 secondes, chaque appel générant entre 3 et 10 secondes de continuation. Les utilisateurs peuvent aussi fixer une première et une dernière image pour contrôler les mouvements de caméra, via des balises de prompt comme FIRSTFRAME, LASTFRAME, IMAGEREFN et VIDEOREFN, ces dernières acceptant jusqu'à trois clips de référence de trois secondes maximum chacun. Côté tarifs, l'entrée coûte 1,50 dollar par million de tokens, la sortie 9 dollars par million de tokens texte et 17,50 dollars par million de tokens vidéo, soit environ 0,10 dollar par seconde de vidéo en 720p. Le modèle est disponible via l'API Gemini dans Google AI Studio et la Gemini Enterprise Agent Platform, ainsi que dans Google Flow pour les abonnés AI Plus, Pro et Ultra. Cette mise à jour transforme Omni d'un simple générateur en un outil réellement pilotable pour les professionnels de la vidéo, ce qui compte directement pour les studios créatifs et les développeurs d'applications. La possibilité de faire des brouillons en basse résolution avant de produire la version finale change concrètement les workflows de production : Google indique que les aperçus en 360p sont générés jusqu'à 60% plus vite et coûtent trois fois moins cher qu'en 720p, ce qui encourage un cycle d'itération économique suivi d'un rendu final en 4K. L'édition conversationnelle et persistante, via l'API Interactions et l'identifiant previousinteractionid, permet de modifier une vidéo sans tout retélécharger, en ne touchant qu'à ce qui a été explicitement demandé. Des entreprises comme Adobe, Figma Weave, GMI Cloud et Runway utilisent déjà Omni Flash en production, ce qui signale une adoption concrète au-delà des démonstrations techniques. Ce lancement s'inscrit dans la course entre grands acteurs de l'IA pour équiper les outils créatifs professionnels de capacités vidéo génératives plus fiables et contrôlables, un terrain où la cohérence temporelle et la maîtrise de la caméra restent des défis techniques majeurs. Le système reste toutefois limité sur certains points : aucune instruction système, pas de réglage de température ni de négative prompts dédiés, l'édition vocale et les références audio ne sont pas prises en charge, et les URL YouTube ne peuvent pas servir de source. Chaque vidéo générée porte un filigrane SynthID invisible mais détectable, un mécanisme de traçabilité de plus en plus standard face aux inquiétudes sur les contenus synthétiques. Le support linguistique reste concentré sur l'anglais, les autres langues n'étant pas encore évaluées, ce qui laisse présager de futures itérations pour élargir la couverture géographique et fonctionnelle de l'outil.

💬 Le vrai changement, c'est le brouillon en 360p avant le rendu final en 4K : ça transforme la génération vidéo en vrai cycle d'itération, pas en pari à l'aveugle à 0,10 dollar la seconde. 40 secondes de continuation cohérente et un contrôle début/fin de plan, c'est le niveau de contrôle qu'Adobe ou Runway attendaient pour sortir du gadget. Reste que tout ça carbure quasi exclusivement à l'anglais, donc pour les studios français, c'est encore un outil à tester avant de l'intégrer en prod.

CréationActu
1 source
Gemini Omni 1.1 Flash de Google rend la génération de vidéos par IA moins chère et plus flexible
Illustration générée par IA
28The Decoder 

Gemini Omni 1.1 Flash de Google rend la génération de vidéos par IA moins chère et plus flexible

Google a mis à jour son modèle de génération vidéo Gemini Omni 1.1 Flash, avec une amélioration technique centrée sur la cohérence des extensions de scènes. Le modèle peut désormais analyser jusqu'à dix secondes de séquence existante pour générer la suite d'une vidéo, contre une seule seconde auparavant. Cette mémoire contextuelle élargie permet d'enchaîner les extensions par blocs de dix secondes, jusqu'à un total de quarante secondes de vidéo générée. Google introduit également un nouveau mode brouillon en résolution 360p, jusqu'à 60 % plus rapide et facturé au tiers du prix des générations standards. Cette évolution répond à l'un des principaux points faibles des générateurs vidéo par IA : la rupture de continuité entre les segments successifs, quand les personnages, décors ou mouvements changent brusquement d'une extension à l'autre. En multipliant par dix la fenêtre d'analyse du contexte visuel, Google cherche à produire des séquences plus longues sans que la cohérence visuelle ne se dégrade. Le mode brouillon à bas coût, lui, vise les usages de prototypage rapide, permettant aux créateurs et développeurs de tester des idées ou des prompts avant de lancer un rendu final en haute définition, plus coûteux en calcul. Ces ajustements s'inscrivent dans la compétition intense que se livrent les grands acteurs de l'IA générative vidéo, aux côtés d'OpenAI avec Sora ou de Runway, où la durée des clips, leur cohérence temporelle et le coût de génération constituent des critères déterminants pour l'adoption professionnelle. En abaissant les coûts via son mode brouillon et en repoussant la limite de continuité narrative, Google Gemini Omni 1.1 Flash cible directement les studios et créateurs de contenu qui cherchent à produire des vidéos plus longues et plus stables sans multiplier les dépenses de calcul.

CréationActu
1 source
☕️ Apple Music va étiqueter la musique IA
Illustration générée par IA
29Next INpact 

☕️ Apple Music va étiqueter la musique IA

Apple Music va apposer d'ici la fin de l'année 2026 une étiquette « Made With AI » sur les morceaux jugés « largement générés à l'aide de l'IA ». L'information provient d'un courriel envoyé aux partenaires de l'industrie musicale, obtenu par Billboard. Ce dispositif s'appuie sur le système « AI Transparency Tags » dévoilé par Apple en mars 2026, qui impose aux maisons de disques et distributeurs de signaler tout usage « significatif » de l'intelligence artificielle, que ce soit dans la composition, le chant, les visuels ou le clip vidéo. Selon Olivier Schusser, directeur d'Apple Music, la firme a développé une technologie capable d'identifier précisément le modèle d'IA employé dans un contenu envoyé sur ses serveurs. Il a précisé que la musique générée par IA ne représente actuellement que 0,5 % des écoutes sur la plateforme, mais que plus d'un tiers des morceaux téléversés sur ses serveurs sont produits avec l'aide de l'IA. Cette mesure vise à donner davantage de transparence aux auditeurs face à la déferlante de contenus générés artificiellement, un enjeu central pour une industrie qui redoute la dilution de la valeur artistique et la confusion entre créations humaines et productions automatisées. En reportant la responsabilité du signalement sur les maisons de disques et distributeurs plutôt que de l'assumer unilatéralement, Apple met la filière face à ses obligations tout en se réservant la possibilité de vérifier techniquement les déclarations. Le décalage entre la part encore marginale des écoutes IA et la proportion bien plus élevée des dépôts laisse présager une croissance rapide de ce type de contenu dans les mois à venir. Cette initiative s'inscrit dans un mouvement plus large du secteur du streaming : Apple Music rejoint ainsi Spotify, Deezer et Tidal, qui ont déjà mis en place des systèmes similaires de signalement des morceaux IA. Deezer avait notamment qualifié cette problématique de « problème pour toute la filière musicale ». Reste à savoir comment Apple traitera les distributeurs récalcitrants ou négligents, malgré les outils de détection dont la plateforme affirme disposer, et si l'ensemble de l'industrie parviendra à s'harmoniser autour de standards communs de transparence face à l'essor de la musique générée par intelligence artificielle.

UEDeezer, plateforme européenne de streaming, applique déjà un dispositif similaire, mais la mesure d'Apple ne créé aucune obligation réglementaire pour la France ou l'UE.

💬 Bon, sur le papier c'est de la transparence, mais en vrai Apple protège surtout sa filière : un tiers des morceaux déposés sont déjà faits avec de l'IA contre 0,5% des écoutes, l'étiquette arrive juste avant que l'écart se referme. Ce que révèle vraiment ce chiffre, c'est que la musique IA n'a pas encore trouvé son public, elle a juste trouvé ses producteurs. Reste à voir si Apple ira vraiment sanctionner les labels qui trichent sur l'étiquetage, parce que détecter c'est facile, faire appliquer c'est autre chose.

CréationActu
1 source
Après Deezer et Spotify, Apple Music s’attaque aux morceaux entièrement générés par IA
Illustration générée par IA
30Frandroid 

Après Deezer et Spotify, Apple Music s’attaque aux morceaux entièrement générés par IA

Apple Music a annoncé son intention d'étiqueter les morceaux entièrement générés par intelligence artificielle disponibles sur sa plateforme, avec une mise en œuvre prévue dans l'année à venir. Cette décision a été révélée par le vice-président d'Apple Music, qui a également livré un chiffre marquant : plus d'un tiers des titres mis en ligne chaque mois sur le service proviendraient désormais entièrement de générateurs IA. Apple rejoint ainsi Deezer et Spotify, deux plateformes concurrentes qui avaient déjà pris des mesures similaires pour signaler ce type de contenu à leurs utilisateurs. Cette annonce marque un tournant pour l'industrie musicale, confrontée à un afflux massif de morceaux produits sans intervention humaine directe. Pour les auditeurs, cet étiquetage doit permettre de distinguer plus facilement les créations d'artistes des productions automatisées, un enjeu de transparence de plus en plus réclamé. Pour les ayants droit et les maisons de disques, la question touche aussi à la rémunération et à la répartition des revenus de streaming, potentiellement dilués par des catalogues saturés de contenus IA à faible coût de production. Ce mouvement s'inscrit dans une tendance de fond du secteur, où les plateformes de streaming peinent à filtrer un volume croissant de titres générés automatiquement, parfois utilisés pour manipuler les algorithmes de recommandation ou capter frauduleusement des revenus. Deezer avait été pionnier sur ce terrain en mettant en place un système de détection et d'étiquetage dès 2025. L'initiative d'Apple pourrait accentuer la pression sur les autres acteurs du marché et relancer le débat sur une régulation plus stricte de l'IA générative dans l'industrie musicale.

UEDeezer, plateforme française pionnière de l'étiquetage IA des 2025, voit sa démarche validée par Apple, mais aucune régulation européenne n'impose cet étiquetage.

💬 Le chiffre qui compte ici c'est le tiers, pas l'étiquette : quand un mois sur trois de nouveaux morceaux sort tout droit d'un générateur, l'étiquetage devient un outil anti-fraude pour les revenus de streaming, pas une simple information pour l'auditeur. Apple qui emboîte le pas à Deezer et Spotify, ça sent moins la conviction éthique que la peur de voir son catalogue dilué par du contenu à coût zéro. Reste que tout ça se fait sans aucune obligation légale en Europe : les plateformes s'autorégulent parce que ça les arrange, pas parce qu'on les y force.

CréationActu
1 source
Higgsfield Text-to-Video : les règles d’or pour bien débuter sur la plateforme
Illustration générée par IA
31Le Big Data 

Higgsfield Text-to-Video : les règles d’or pour bien débuter sur la plateforme

Higgsfield Text-to-Video, la fonctionnalité phare de la plateforme Higgsfield AI, permet de générer des vidéos à partir d'une simple description écrite, en s'appuyant sur plusieurs moteurs vidéo accessibles depuis une interface unique. Selon le guide officiel publié par Higgsfield pour 2026, l'utilisateur peut choisir entre plusieurs modèles, dont Veo 3.1, Kling 3.0 et Wan, chacun interprétant différemment un même prompt en matière de réalisme, de mouvements humains, de son, de durée et de stabilité du sujet filmé. La plateforme organise son offre autour de trois espaces distincts, Image, Video et Cinema Studio, que l'utilisateur découvre dès la création de son compte. Le guide recommande de commencer les essais en définition 720p plutôt qu'en haute définition, afin de limiter le coût des tests tout en validant la caméra, le rythme et le mouvement avant de passer à une résolution supérieure. Il conseille également de fixer le format de la vidéo, horizontal ou vertical, avant tout essai, un plan pensé pour YouTube ne se recadrant pas correctement en format vertical sans perte de cadrage sur un visage ou un produit. Cette méthode a une portée concrète pour les créateurs et les professionnels qui utilisent l'IA générative vidéo au quotidien : elle réduit le nombre d'essais inutiles et donc le coût réel de production, chaque génération représentant une dépense de crédits ou de temps de calcul. En orientant les utilisateurs vers un choix de modèle adapté à la scène recherché, plutôt qu'un moteur unique appliqué à tous les projets, Higgsfield cherche à rapprocher ses outils d'un usage professionnel structuré, comparable à un choix d'objectif ou de pellicule en tournage traditionnel. Cette approche illustre une tendance plus large du secteur : les plateformes de génération vidéo par IA évoluent vers des interfaces multi-modèles, où la valeur ajoutée ne tient plus seulement à la qualité d'un seul moteur, mais à la capacité de l'utilisateur à sélectionner le bon outil pour chaque tâche. Cette évolution s'inscrit dans une concurrence croissante entre fournisseurs de modèles vidéo texte-vers-vidéo, où des moteurs comme Veo, Kling ou Wan progressent rapidement sur le rendu humain, la synchronisation audio et le contrôle image par image. En misant sur l'agrégation de plusieurs modèles plutôt que sur le développement d'un moteur propriétaire unique, Higgsfield AI se positionne comme un intermédiaire entre ces technologies et les créateurs, un modèle économique qui dépendra de sa capacité à intégrer rapidement les futures générations de modèles vidéo à mesure qu'elles apparaîtront sur le marché.

CréationTuto
1 source
Cartesia lance Sonic-3.6, un modèle de synthèse vocale en flux en tête des deux classements d'Artificial Analysis
Illustration générée par IA
32MarkTechPost 

Cartesia lance Sonic-3.6, un modèle de synthèse vocale en flux en tête des deux classements d'Artificial Analysis

Cartesia a dévoilé Sonic-3.6, sa nouvelle version de synthèse vocale en temps réel, environ trois mois après Sonic-3.5. Le modèle occupe désormais la première place sur les deux classements d'Artificial Analysis dédiés à la voix, avec un score Elo de 1 283 sur le tableau Provider Voice et de 1 123 sur le tableau Controlled Voice, ce dernier étant jugé plus significatif puisqu'il clone chaque modèle sur les huit mêmes voix de référence, isolant ainsi la qualité du moteur de synthèse de celle du catalogue de voix. Sur ce classement contrôlé, Sonic-3.6 devance Sonic-3.5, suivi d'Eleven v3 d'ElevenLabs en troisième position. Le modèle repose sur une architecture à base de modèles à espace d'états plutôt que sur des transformeurs, et Cartesia annonce un délai avant premier son inférieur à 90 millisecondes. Il est disponible en version bêta uniquement via l'API hébergée de Cartesia, sans poids ouverts ni dépôt Hugging Face. Les tarifs s'échelonnent d'un accès gratuit à un plan Pro à 5 dollars, puis Startup à 49 dollars et Scale à 299 dollars par mois pour environ 10 667 minutes de synthèse vocale, avec une facturation séparée à 0,06 dollar la minute pour les agents vocaux téléphoniques. Cette avancée compte parce qu'elle valide un choix architectural risqué face aux transformeurs dominants du secteur, et parce qu'elle cible directement les usages professionnels d'automatisation vocale : centres d'appels, agents de support entrants, qualification d'appels sortants, remplacement de serveurs vocaux interactifs, rappels de rendez-vous ou encore localisation audio. Des secteurs comme la finance, la santé, le commerce de détail, la logistique et le recrutement sont explicitement visés, avec des garanties de conformité (accords de traitement des données, conformité HIPAA, authentification unique) pour les entreprises réglementées. Le prix normalisé de 49 dollars par million de caractères place Sonic-3.6 à la moitié du tarif d'ElevenLabs Eleven v3, tout en restant nettement plus cher que Speechify Simba 3.2, facturé 10 dollars pour un score de 1 240 Elo, ce qui illustre une bataille tarifaire intense dans un marché encore jeune. Le lancement s'inscrit dans une course accélérée entre fournisseurs de synthèse vocale, où la latence, le réalisme et le contrôle fin de l'expression deviennent les principaux terrains de différenciation depuis l'essor des agents vocaux d'entreprise. Sonic expose des fonctionnalités pensées pour les transcriptions d'agents plutôt que pour la narration classique : balises d'expression non verbale comme le rire insérées directement dans le texte, clonage vocal instantané à partir d'environ dix secondes d'audio, dictionnaires de prononciation personnalisés avec substitutions IPA, et lecture native des chiffres et codes alphanumériques sans prétraitement. Les documents techniques de Cartesia listent toutefois encore Sonic-3.5 comme version stable, plusieurs partenaires continuant d'utiliser cette ancienne mouture en attendant la sortie officielle de la 3.6. Les chiffres de latence restent des mesures fournies par le fabricant, non des tests de bout en bout indépendants, ce qui invite les entreprises intéressées à vérifier elles-mêmes les performances réelles avant tout déploiement à grande échelle.

CréationActu
1 source
MiniMax lance MiniMax-Music3, un modèle musical en poids ouverts générant des morceaux complets de cinq minutes
Illustration générée par IA
33MarkTechPost 

MiniMax lance MiniMax-Music3, un modèle musical en poids ouverts générant des morceaux complets de cinq minutes

Le 13 août 2026, la société chinoise MiniMax a publié MiniMax-Music3, un modèle texte-vers-musique à poids ouverts. Il prend en entrée des paroles balisées par section (couplet, refrain, pont) et une description musicale détaillée, la "Structured Caption", précisant métadonnées, voix et arrangement. En une seule génération, il produit un morceau complet de jusqu'à cinq minutes, au format WAV stéréo 16 bits/32 kHz. Son architecture associe un "Hybrid-LM", un modèle de 8 milliards de paramètres pour la structure générale et un second de 0,6 milliard pour le détail au sein de chaque frame, à un module de flow matching de 2,4 milliards de paramètres et un Flow-VAE de 123 millions de paramètres hérité de MiniMax Speech. MiniMax a publié le même jour les poids, le code d'inférence et trois méthodes de déploiement : un serveur SGLang-Omni nécessitant deux GPU, un pipeline diffusers fonctionnant dès 8 Go de VRAM, et un template ComfyUI en FP16/INT8. La licence communautaire de MiniMax-Music3 autorise un usage commercial, à condition d'afficher la mention "MiniMax-Music3" dans l'interface du produit ; toute entreprise dont les revenus annuels dépassent 20 millions de dollars doit obtenir une autorisation écrite préalable, et quiconque héberge la génération pour des tiers doit mettre en place des garde-fous contre les contenus contrefaisants. Le modèle vise en priorité les créateurs indépendants et les équipes de taille moyenne, dans le jeu vidéo, la publicité, la vidéo courte, l'e-learning, le podcast, le bien-être ou le SaaS musical, pour produire des musiques de fond, des bandes sonores adaptatives, des habillages publicitaires ou des maquettes de composition. En livrant des poids directement exploitables plutôt qu'un simple aperçu de recherche, MiniMax abaisse la barrière d'entrée pour produire des morceaux complets et cohérents, un terrain jusque-là dominé par des services propriétaires fermés. Le choix technique le plus notable porte sur l'étage de synthèse : au lieu de décoder les tokens discrets issus d'une quantification vectorielle résiduelle à huit couches, dont un codebook sémantique de 16 384 entrées et sept codebooks acoustiques de 1 024 entrées chacun, MiniMax-Music3 fusionne les états cachés des deux modèles de langage pour alimenter directement le module de flow matching, sans jamais charger le décodeur discret à l'inférence. Une incertitude demeure sur le modèle de base du grand modèle de langage : la fiche du modèle et la licence citent Qwen3-8B, tandis que le billet de recherche de MiniMax mentionne Qwen3.5-8B. L'entreprise fournit aussi un agent auxiliaire capable de transformer une description courte en légende structurée complète, dans un marché de la génération musicale par IA où qualité audio, degré de contrôle utilisateur et conditions de licence deviennent les principaux terrains de différenciation entre plateformes.

UELes créateurs et studios européens peuvent télécharger et utiliser librement ces poids ouverts pour produire de la musique, sans qu'aucune entité française ou européenne ne soit impliquée dans ce lancement.

💬 MiniMax fait le pari inverse de tout le monde : au lieu de peaufiner un décodeur audio à codebooks, ils le suppriment carrément et branchent le flow matching direct sur les états cachés du LLM. Sur le papier ça simplifie le pipeline, reste à voir si la qualité audio tient la route face à Suno ou Udio en écoute réelle. Ce qui compte surtout : des poids ouverts qui tournent dès 8 Go de VRAM, ça change la donne pour un studio indé qui voulait des jingles sans souscrire à un service fermé, tant que son chiffre d'affaires reste sous les 20 millions.

CréationActu
1 source
Roku lance sa chaîne 100 % IA et le résultat est déjà catastrophique
Illustration générée par IA
34Le Big Data 

Roku lance sa chaîne 100 % IA et le résultat est déjà catastrophique

Roku a lancé la semaine dernière Fairground AI Creator TV, présentée comme la première chaîne gratuite entièrement consacrée à des contenus générés par intelligence artificielle, diffusée 24 heures sur 24 et 7 jours sur 7. Le projet, annoncé le 30 juillet 2026 par le compte Fairground Entertainment (@fairground_tv) sur X, est disponible dès août sur au moins cinq plateformes de télévision connectée et de streaming gratuit financé par la publicité, dites FAST. Une centaine de créateurs répartis dans le monde alimentent cette programmation, mêlant animes, drames historiques et pastiches de films hollywoodiens. Roku, déjà connu pour multiplier les chaînes thématiques ultra spécialisées, de La Petite Maison dans la prairie à Duck Dynasty, franchit ainsi une nouvelle étape en ouvrant une catégorie inédite dédiée exclusivement à l'IA générative. The Verge a comparé l'initiative à une simple auge à contenu, tandis que Futurism l'a qualifiée de véritable flop après plusieurs heures de visionnage. Ce lancement illustre un changement de modèle économique pour l'industrie télévisuelle. Alors qu'un épisode d'une série comme Stranger Things peut coûter plusieurs dizaines de millions de dollars, Fairground repose sur des budgets de production dérisoires, ce qui rend la rentabilité atteignable même avec une audience marginale, par exemple quelques spectateurs nocturnes plutôt qu'un large public. Cette logique inquiète les créatifs humains, scénaristes, acteurs et techniciens, qui voient dans ce type de chaîne un signal que les diffuseurs pourraient privilégier le volume et le coût minimal au détriment de la qualité narrative. Le phénomène s'inscrit dans une tendance plus large où l'IA générative s'invite dans le divertissement grand public, à l'image de Tilly Norwood, actrice entièrement virtuelle dont un film doit prochainement sortir en salles. Pour les téléspectateurs, cela signifie un accès à du contenu gratuit en abondance, mais dont la cohérence narrative et l'intérêt artistique restent, selon les premiers retours, très limités. Cette initiative arrive alors que les outils de génération vidéo par IA ont fait des progrès techniques notables depuis 2023, époque où des vidéos virales montraient des aberrations visuelles, comme un Will Smith numérique dévorant des spaghettis de façon grotesque. Les défauts les plus criants ont reculé sans disparaître : lèvres mal synchronisées, physique irréaliste, bruitages incohérents, à l'image d'une scène où des pas dans la neige produisent des bruits de sabots. Le contenu de Fairground souffre surtout d'un manque de direction éditoriale, enchaînant sans transition un anime, un drame allemand sur la bureaucratie nazie puis une imitation de Gladiator, avec une esthétique récurrente d'hommes massifs au regard sévère baignés d'une lumière crépusculaire. Roku n'a communiqué ni chiffres d'audience ni détails sur la pérennité du projet, mais ce pari s'inscrit dans une course plus large de l'industrie du streaming pour intégrer l'IA générative afin de réduire les coûts de production, une tendance que d'autres plateformes surveillent de près avant de s'y engager à leur tour.

CréationOutil
1 source
Sur Spotify, les « artistes IA » vont gagner un badge et perdre des recommandations
Illustration générée par IA
35Next INpact 

Sur Spotify, les « artistes IA » vont gagner un badge et perdre des recommandations

Spotify a annoncé le déploiement, à partir de la mi-septembre, d'un nouveau badge « AI Persona » destiné à identifier les profils d'artistes qui ne sont pas des humains. Les créateurs de ces personnages générés par intelligence artificielle pourront eux-mêmes déclarer leur statut à la plateforme, mais Spotify se réserve aussi le droit d'attribuer ce badge de son propre chef, sous la mention « Likely AI Persona », lorsqu'un profil affiche une identité, un nom ou des visuels photoréalistes jugés suspects. Le badge apparaîtra sur la page de l'artiste, dans les résultats de recherche et à côté des titres dans les playlists. Dans les prochains mois, les abonnés pourront également signaler eux-mêmes les profils qu'ils soupçonnent d'être des personas IA, et les artistes concernés pourront confirmer ou contester la classification. Cette mesure intervient alors que le phénomène prend une ampleur considérable : Deezer a révélé le 21 juillet dernier que plus de la moitié des nouvelles chansons téléversées chaque jour sur sa plateforme, soit environ 90 000 morceaux, sont générées par IA, après avoir détecté 13,4 millions de titres de ce type sur l'année écoulée. La conséquence la plus concrète de ce badge concerne la visibilité : les morceaux publiés par un profil identifié comme IA seront exclus des recommandations éditoriales et algorithmiques de Spotify, sauf si l'auditeur a explicitement choisi de suivre cet artiste. Pour un créateur de contenu généré par IA, cela équivaut de fait à une invisibilisation, et donc à une perte de revenus, puisque les recommandations constituent l'un des principaux leviers de découverte et d'écoute sur la plateforme. Cette approche s'inscrit dans une logique déjà amorcée par Deezer, qui démonétise purement et simplement les écoutes de morceaux IA. Pour l'industrie musicale, ces mesures marquent un tournant : les plateformes de streaming, jusqu'ici plutôt permissives face à l'afflux de contenus générés par IA, commencent à distinguer explicitement les artistes qui construisent une carrière authentique de ceux qui exploitent la production automatisée à grande échelle, souvent à des fins de spam ou de captation de revenus. Ce badge « AI Persona » vient compléter le dispositif de « profil vérifié » déjà utilisé par Spotify, qui atteste à l'inverse qu'un être humain réel se cache derrière un artiste, un statut déjà accordé à des centaines de milliers de profils selon l'entreprise. Spotify précise que cette nouvelle classification porte uniquement sur l'identité publique de l'artiste, et non sur la manière dont la musique elle-même a été fabriquée : pour cet aspect, la plateforme mise sur un système distinct de crédits d'IA et l'outil SongDNA, censés permettre aux artistes de détailler la part de l'intelligence artificielle dans leur processus de création. Reste à voir si cette distinction entre identité de l'artiste et méthode de production suffira à répondre à la pression croissante de l'industrie musicale, qui réclame davantage de transparence face à la déferlante de contenus IA sur les plateformes de streaming.

UEDeezer, plateforme de streaming française, a révélé détecter des dizaines de milliers de morceaux générés par IA chaque jour et applique déjà une démonétisation similaire, plaçant un acteur français au cœur de cette évolution du secteur musical.

💬 Sur Spotify, un artiste passé du côté "AI Persona" perd d'un coup l'accès aux recommandations, donc aux écoutes, donc au fric : c'est la première fois qu'une plateforme de streaming punit vraiment le spam IA au lieu de le tolérer poliment. Deezer détecte déjà 90 000 morceaux IA par jour sur sa plateforme, alors ce badge n'arrive pas en avance, il arrive après l'inondation. Reste un trou énorme : Spotify labellise l'identité de l'artiste, pas la façon dont la musique est fabriquée, donc un humain qui balance de la musique 100% générée par IA passe complètement à travers les mailles du filet.

LTX-2.5 : les poids ouverts d'un modèle monde accélérés par NVIDIA tiennent sur un seul bureau
Illustration générée par IA
36MarkTechPost 

LTX-2.5 : les poids ouverts d'un modèle monde accélérés par NVIDIA tiennent sur un seul bureau

La société LTX a lancé LTX-2.5, un modèle de génération vidéo dit "world model" à poids ouverts, conçu pour la production créative, les applications temps réel et l'IA physique. Optimisé pour tourner localement sur les cartes graphiques grand public NVIDIA RTX ainsi que sur le NVIDIA DGX Spark, il réduit fortement les besoins en mémoire vidéo (VRAM), permettant à un modèle de pointe de fonctionner sur du matériel que les créateurs possèdent déjà, directement dans l'interface ComfyUI. La sortie s'inscrit dans une série d'annonces de NVIDIA consacrée à l'IA locale tout au long du mois d'août, et coïncide avec le lancement, le même jour, du modèle d'agents ouvert Nemotron 3.5 Lightning. LTX-2.5 introduit une génération multishot native qui garantit la cohérence d'un personnage ou d'un style sur toute une séquence, s'appuie sur un backbone linguistique Gemma 4 amélioré et un nouveau décodeur limitant les artefacts dans les scènes à mouvement rapide. Sur le plan des performances, LTX affirme qu'un clip de 10 secondes est généré en 6,8 secondes en local sur deux GPU NVIDIA GB200, contre 23,7 secondes via son API. À titre de comparaison, les modèles fermés Omni Flash, Grok 1.5 et Veo 3.1 mettent entre 52 et 70 secondes, tandis que Seedance 2.0, FLUX 3, Seedance 2.5 et Kling 3.0 Pro nécessitent respectivement 196, 259, 317 et 398 secondes, soit un modèle jusqu'à 58 fois plus rapide que le plus lent. Cette rapidité change concrètement la manière de produire du contenu vidéo. Un créateur seul ou une petite équipe peut désormais générer, sans frais par clip ni abonnement au cloud, des dizaines de variantes d'une même publicité en une nuit, tester plusieurs accroches et adapter des campagnes à différents marchés avant même que la lassitude publicitaire, qui s'installe généralement en sept à dix jours selon LTX, ne s'installe. La propriété intellectuelle reste sur la machine locale, un argument de poids pour les studios et marques soucieux de confidentialité. Ce qui exigeait auparavant une équipe de tournage, une salle de rendu et une facture cloud tient désormais sur un seul poste équipé d'une carte RTX, avec un fine-tuning LoRA rapide suffisant pour verrouiller un style de marque. Ce lancement illustre une stratégie plus large de NVIDIA, qui pousse ses modèles ouverts accélérés du PC de bureau aux centres de données. Le même jour, l'entreprise a dévoilé Nemotron 3.5 Lightning, un modèle d'agents à mélange d'experts de 30 milliards de paramètres, ainsi que NeMo Switchyard, une bibliothèque open source qui répartit chaque étape d'un flux d'agents vers le modèle le plus adapté. LTX décrit sa famille de modèles comme fondatrice pour le cinéma, la publicité, le jeu vidéo, la simulation et la robotique, les "world models" cherchant à prédire non pas le mot suivant, comme les modèles de langage, mais le prochain instant d'un environnement simulé.

UELes studios et créateurs européens peuvent adopter gratuitement cet outil open source pour produire des vidéos en local, sans régulation ou acteur français/européen implique.

CréationActu
1 source
Votre première vidéo IA avec Higgsfield : de l’idée au rendu final
Illustration générée par IA
37Le Big Data 

Votre première vidéo IA avec Higgsfield : de l’idée au rendu final

Higgsfield, une plateforme de génération vidéo par intelligence artificielle, propose une nouvelle approche pour créer des vidéos à partir d'une simple idée textuelle. Plutôt que de s'appuyer sur un seul modèle, elle orchestre plus de quinze modèles de langage et modèles de vision sous une infrastructure unifiée, chacun spécialisé dans une tâche précise. Le rendu photoréaliste est confié à Veo 3.1, la gestion de la géométrie complexe et des expressions faciales à Kling 3.0, tandis que Seedance 2.5 assure la cohésion globale de la scène. L'interface propose plusieurs modules selon l'usage visé, dont un espace de génération basique pour des tests rapides, un Marketing Studio dédié aux flux publicitaires, et un Cinema Studio pour les projets les plus ambitieux. La plateforme s'interface également avec le protocole MCP (Model Context Protocol), permettant une exécution asynchrone via des agents externes comme Claude, ce qui autorise l'automatisation de la création de nombreux plans vidéo par script sans bloquer la machine de l'utilisateur. Cette architecture change concrètement la manière dont les créateurs abordent la vidéo générative. Jusqu'ici, la production de contenus par IA relevait souvent d'un processus imprévisible, où chaque tentative pouvait produire des résultats radicalement différents malgré une requête identique. En superposant plusieurs modèles neuronaux qui se corrigent mutuellement, la plateforme réduit les erreurs d'interprétation et les incohérences visuelles, un peu à la manière des studios d'effets spéciaux traditionnels où chaque département se concentre sur sa spécialité. Pour les professionnels du marketing, du cinéma ou du développement, cela signifie un gain de temps significatif et une meilleure prévisibilité du résultat final, deux qualités qui manquaient cruellement aux premières générations d'outils de génération vidéo par IA. L'intégration avec des agents comme Claude ouvre également la voie à une production vidéo automatisée à grande échelle, un enjeu déterminant pour les studios et agences qui doivent produire de gros volumes de contenu. Cette évolution s'inscrit dans une accélération générale du secteur de l'intelligence artificielle générative, où la simple qualité du rendu ne suffit plus à distinguer les plateformes entre elles : c'est désormais la maîtrise du contrôle créatif qui fait la différence. Higgsfield mise sur une approche proche du langage cinématique professionnel, poussant les utilisateurs à structurer leurs requêtes comme de véritables listes de plans de tournage, articulées autour du sujet, du mouvement de caméra, de l'environnement et de l'atmosphère lumineuse. Cette exigence de précision marque un tournant : les outils de génération vidéo ne sont plus de simples générateurs de contenu aléatoire, mais des instruments de production complets, comparables à des studios virtuels. Reste à savoir comment les concurrents, engagés dans une course technologique effrénée, répondront à cette montée en sophistication, et si cette complexité accrue restera accessible aux créateurs indépendants ou finira par favoriser les acteurs disposant de ressources techniques plus importantes.

CréationTuto
1 source
Spotify s’y met aussi : la plateforme va signaler les artistes IA et limiter leur visibilité
Illustration générée par IA
38Le Big Data 

Spotify s’y met aussi : la plateforme va signaler les artistes IA et limiter leur visibilité

Spotify a annoncé le 11 août 2026 le déploiement d'un nouveau badge « AI Persona » destiné à signaler les profils d'artistes générés par intelligence artificielle sur sa plateforme. Cette étiquette sera visible sur les profils concernés, dans les résultats de recherche et sur certaines lignes de titres à partir de la mi-septembre 2026. Dès le 11 août, les créateurs pourront eux-mêmes déclarer leurs artistes comme des Personas IA via l'interface Spotify for Artists. Spotify précise qu'elle ne se contentera pas des déclarations volontaires : la plateforme examinera aussi les profils, en particulier ceux affichant des noms suspects ou des images au rendu photoréaliste, en commençant par les comptes ayant déjà atteint un certain seuil d'audience. Parallèlement à ce marquage, Spotify annonce que ces Personas IA seront écartés par défaut des recommandations éditoriales et algorithmiques ainsi que des suggestions personnalisées, sauf si un utilisateur choisit explicitement de suivre l'un de ces profils. Cette décision illustre la difficulté croissante des plateformes de streaming à gérer la prolifération de contenus musicaux générés en masse grâce à l'IA, qui menace de submerger les catalogues et de fausser les mécanismes de découverte musicale. En reléguant ces artistes virtuels hors des algorithmes de recommandation par défaut, Spotify cherche à protéger la visibilité des artistes humains tout en évitant d'interdire purement et simplement la musique produite avec l'aide de l'IA, un compromis qui pourrait servir de modèle pour d'autres plateformes confrontées au même problème. Pour les auditeurs, la mesure promet davantage de transparence sur l'identité des créateurs qu'ils écoutent, un enjeu de confiance de plus en plus sensible à mesure que les contenus synthétiques deviennent difficiles à distinguer des productions humaines. Pour l'industrie musicale, elle pourrait aussi limiter l'exploitation commerciale rapide de personnages IA construits uniquement pour maximiser les écoutes automatiques. Cette initiative s'inscrit dans une tendance plus large de scepticisme envers les contenus IA non signalés, qui touche aussi bien la musique que d'autres médias. Spotify prend soin de distinguer l'identité de l'artiste, visée par le badge, de la méthode de production des morceaux : un Persona IA n'implique pas nécessairement une composition assistée par IA, et inversement, une musique créée avec l'aide de l'IA peut être publiée par un artiste humain. Pour clarifier ce processus de création, l'entreprise met en avant ses outils existants, AI Credits et SongDNA, et prévoit d'ajouter dans les prochains mois une fonction permettant aux utilisateurs de signaler eux-mêmes les profils suspects. Ce virage intervient alors que Spotify multiplie par ailleurs les accords autorisant des remixes et reprises assistés par IA, révélant une stratégie d'équilibre entre l'intégration progressive de ces technologies dans son catalogue et la volonté de ne pas laisser les artistes virtuels supplanter les créateurs humains dans les découvertes musicales.

UESpotify étant très utilise en France et en UE, cette mesure améliore la transparence pour les auditeurs européens sans impliquer de régulation locale spécifique.

CréationActu
1 source
Test de DeepAI : le générateur d’image qui veut tout faire en un seul abonnement
Illustration générée par IA
39Le Big Data 

Test de DeepAI : le générateur d’image qui veut tout faire en un seul abonnement

Un test approfondi de la plateforme américaine DeepAI a été mené sur plusieurs jours pour évaluer ses capacités de génération d'images, en comparant ses performances à celles de références du secteur telles que Midjourney, DALL-E et Artspace ai. Fondée en 2017, l'entreprise proposait à l'origine des interfaces de programmation destinées aux développeurs souhaitant intégrer de l'apprentissage automatique sans compétences avancées. Elle s'est depuis transformée en plateforme tout-en-un, accessible à partir de 9,99 dollars par mois, regroupant génération d'images, retouche visuelle, création de vidéos, un module musical et un assistant conversationnel. Selon les chiffres cités dans le test, DeepAI enregistre près de 15 millions de visites mensuelles et un chiffre d'affaires estimé à plus de deux millions de dollars, ce qui la place parmi les trois mille sites les plus visités aux États-Unis. Cette offre tout-en-un répond à une problématique concrète pour les créateurs qui multiplient habituellement les abonnements à des outils spécialisés. En centralisant plusieurs usages créatifs sous une seule formule payante, DeepAI permet de réduire les coûts pour les utilisateurs réguliers, notamment les débutants, les étudiants et les créateurs indépendants qui n'ont pas besoin d'une précision graphique extrême. Le test souligne toutefois que la qualité des images reste en retrait sur les détails complexes par rapport aux références du marché, et que l'interface paraît datée. Pour les professionnels exigeants sur le rendu final, comme les studios ou les agences créatives, DeepAI ne constitue donc pas une alternative suffisante aux outils spécialisés haut de gamme. L'enjeu dépasse le simple choix d'un logiciel : il touche à la démocratisation des outils d'IA générative auprès d'un public non technique, au prix d'un compromis assumé sur la finesse visuelle. Ce positionnement s'inscrit dans un marché de la génération d'images par IA de plus en plus saturé, où de nouveaux outils apparaissent régulièrement aux côtés d'acteurs établis comme Midjourney ou OpenAI avec DALL-E. Contrairement à des solutions ciblant le photoréalisme ou l'excellence artistique, DeepAI mise sur la rapidité d'accès et la simplicité d'usage, sans nécessiter d'apprentissage technique préalable. Cette stratégie, née d'outils pour développeurs avant de s'orienter vers le grand public, illustre une tendance plus large du secteur : consolider plusieurs briques de création (image, vidéo, musique, texte) dans une interface unique plutôt que de rester un service mono-fonction. Reste à voir si l'entreprise parviendra à moderniser son interface et à améliorer la qualité de ses rendus pour convaincre un public professionnel plus exigeant, alors que la concurrence continue d'investir massivement dans le photoréalisme et la cohérence visuelle de ses modèles.

CréationOutil
1 source
LTX-2.5 génère une vidéo IA de 10 secondes à partir d'une image en 6,8 secondes sur les superpuces Nvidia, et c'est open weights
Illustration générée par IA
40VentureBeat AI 

LTX-2.5 génère une vidéo IA de 10 secondes à partir d'une image en 6,8 secondes sur les superpuces Nvidia, et c'est open weights

LTX, la société de modèles de monde en open source issue de Lightricks, a lancé LTX-2.5, la nouvelle version de son modèle vidéo et de monde à poids ouverts. Le modèle s'intègre nativement dans ComfyUI, l'outil de workflow par nœuds devenu la référence pour prototyper des générations open source, dans le cadre d'un partenariat de lancement entre les deux entreprises. LTX-2.5 est disponible en accès libre sur Hugging Face, dans ComfyUI, et via l'API de LTX pour les équipes qui veulent une génération managée : gratuit pour les organisations sous 10 millions de dollars de revenus récurrents annuels, avec licence négociée au-delà. LTX revendique déjà 33 millions de téléchargements pour sa famille de modèles, ce qui en ferait la ligne de "modèles de monde" open source la plus utilisée du marché. Le co-fondateur et PDG de LTX, Zeev Farbman, a présenté en exclusivité à VentureBeat les nouveautés : un nouveau décodeur vidéo par diffusion qui réduit les artefacts visuels sur les scènes à fort mouvement, un support natif du multi-plans qui garde personnages, décor et voix cohérents sur une séquence entière, un socle de langage Gemma 4 personnalisé pour mieux traiter les prompts complexes, un checkpoint pré-entraîné pour l'IA physique et la robotique, ainsi qu'un modèle distillé amélioré tournant localement sur les GPU Nvidia RTX. Sur le plan des performances, LTX annonce la génération d'un clip de 10 secondes en 720p à partir d'une image en 6,8 secondes sur deux puces Nvidia GB200 haut de gamme auto-hébergées, plus rapide que le temps réel, contre 23,7 secondes via son API managée en 1080p. Cette accélération et cette ouverture des poids changent la donne pour les studios, développeurs indépendants et équipes de recherche qui veulent générer de la vidéo par IA sans dépendre exclusivement d'API fermées et coûteuses. LTX affirme que son modèle coûte environ huit fois moins cher et rend sept fois plus vite que des modèles comparables, avec un fonctionnement possible aussi bien sur des GPU de datacenter que sur un Mac. Dans des tests de préférence humaine à l'aveugle, LTX-2.5 obtient un taux de victoire de 67%, devant Seedance 2.5 (65%), Gemini Omni Flash de Google (55%), MiniMax H3 (50%), Seedance 2.0 (44%), Wan 2.6 (42%) et FLUX 3 (28%). Comparé à la concurrence sur la vitesse de génération, LTX cite des temps nettement supérieurs pour Gemini Omni Flash (52 secondes), Grok 1.5 de xAI (63 secondes), Veo 3.1 de Google (70 secondes pour un clip de 8 secondes), MiniMax H3 (180 secondes), Seedance 2.5 de ByteDance (317 secondes) et Kling 3.0 Pro de Kuaishou (398 secondes). Ce lancement s'inscrit dans une bataille plus large entre modèles vidéo à poids ouverts et API fermées, où LTX et ComfyUI parient que l'accessibilité et la personnalisation locale l'emporteront sur les services propriétaires verrouillés de géants comme Google, xAI, ByteDance ou Kuaishou. L'ajout d'un checkpoint dédié à la robotique et à l'IA physique signale aussi une ambition dépassant la simple génération de vidéos cinématographiques, en visant des usages industriels où les équipes pourront affiner le modèle sur leurs propres données. Toutes les mesures de vitesse et de qualité citées proviennent de LTX lui-même ou de tests commandités par l'entreprise, ce qui invite à la prudence en attendant des comparatifs indépendants. Reste à voir si l'écosystème ComfyUI, déjà central dans la communauté open source de génération d'images et de vidéos, parviendra à consolider LTX comme standard face à la pression des géants du cloud qui investissent massivement dans leurs propres modèles fermés.

💬 Ce qui compte ici c'est le chiffre : 6,8 secondes pour générer 10 secondes de vidéo, donc plus rapide que le temps réel. Sur le papier c'est la première fois qu'un modèle open weights bat ce seuil, et ça change le calcul pour les studios qui hésitaient entre API fermée et self-hosting. Reste que tous les benchmarks viennent de LTX elle-même, alors j'attends les tests indépendants avant de crier victoire, mais l'intégration ComfyUI day one, ça sent le vrai lancement, pas juste un paper.

CréationActu
1 source
Implémentation d'un pipeline de génération vidéo et audio multimodal MiniMax-H3 avec les API ComfyUI
Illustration générée par IA
41MarkTechPost 

Implémentation d'un pipeline de génération vidéo et audio multimodal MiniMax-H3 avec les API ComfyUI

Un tutoriel technique publié début août 2026 détaille la mise en place d'un pipeline complet de génération vidéo et audio avec le modèle MiniMax-H3, en pilotant ComfyUI comme moteur d'inférence sans interface graphique, entièrement via ses API HTTP et WebSocket. Le code source, hébergé sur le dépôt Hugging Face Comfy-Org/MiniMax-H3, télécharge automatiquement les poids nécessaires : les modèles de diffusion, l'encodeur de texte (basé sur Qwen3VL-32B) et deux VAE distincts, l'un pour la vidéo (minimaxh3videovaefp16), l'autre pour l'audio (minimaxh3audiovaefp32). Le script sélectionne dynamiquement l'un des trois profils de poids selon la mémoire GPU disponible : un profil "quality" en bf16 nécessitant au moins 70 Go de VRAM, un profil "balanced" en int8 à partir de 38 Go, et un profil "squeeze" en fp8/nvfp4 fonctionnant dès 20 Go. Le pipeline construit directement en Python le graphe d'exécution de ComfyUI, valide les schémas de chaque nœud via l'endpoint /objectinfo, puis génère des vidéos de quelques secondes (exemple donné : 5 secondes en 16:9, 20 étapes d'échantillonnage avec le sampler resmultistep) à partir d'un prompt texte détaillé décrivant plans de caméra, dialogue et ambiance sonore. Cette approche répond à un besoin concret pour les développeurs et équipes techniques qui veulent intégrer la génération vidéo par IA dans des workflows automatisés, sans dépendre d'une interface graphique ni d'interventions manuelles. En rendant le pipeline scriptable de bout en bout, incluant le décodage joint de la vidéo et de l'audio et le suivi de progression en temps réel, le tutoriel ouvre la voie à une utilisation industrielle de MiniMax-H3 dans des chaînes de production de contenu, des tests automatisés ou des systèmes de génération à la demande. La capacité à basculer entre plusieurs profils matériels selon la VRAM disponible élargit aussi l'accessibilité du modèle, permettant de le faire tourner sur des configurations allant de simples GPU grand public à des cartes professionnelles haut de gamme, ce qui reste un enjeu majeur pour la démocratisation des modèles génératifs vidéo particulièrement gourmands en ressources. Ce type de tutoriel s'inscrit dans une tendance plus large de la communauté ComfyUI, qui s'est imposée comme une infrastructure de référence pour orchestrer des modèles de génération multimodale complexes, au-delà de son usage initial pour la génération d'images fixes. MiniMax-H3 illustre la montée en puissance des modèles capables de produire simultanément vidéo et audio synchronisés, avec plusieurs modes de génération (texte vers vidéo, conditionnement par première et dernière image, ou par image de référence), une polyvalence de plus en plus recherchée par les studios et créateurs de contenu. La publication de poids quantifiés à différents niveaux de précision, du bf16 complet au nvfp4, traduit également un effort continu pour rendre ces modèles exploitables en dehors des seuls centres de données équipés de GPU haut de gamme.

💬 Le vrai signal ici, c'est que ComfyUI arrête d'être "juste" un outil pour bidouiller des images et devient un moteur d'inférence headless qu'on pilote en pur code, avec sélection auto du profil selon la VRAM dispo. Ça change la donne pour qui veut industrialiser de la génération vidéo+audio sans dépendre d'un humain qui clique dans une interface. Reste que 70 Go de VRAM pour le profil qualité, c'est un mur pour la plupart des équipes, le vrai test sera de voir si le mode "squeeze" à 20 Go tient la comparaison en prod.

CréationTuto
1 source
Comment l’IA augmente la qualité d’une image ? Le guide complet
Illustration générée par IA
42Le Big Data 

Comment l’IA augmente la qualité d’une image ? Le guide complet

L'intelligence artificielle s'impose désormais comme la méthode de référence pour augmenter la qualité d'une image, qu'il s'agisse de restaurer une photo ancienne, de préparer un visuel pour une impression grand format ou de rattraper un cliché pris en basse lumière avec un smartphone. Cette approche repose sur des algorithmes de super-résolution et des réseaux de neurones profonds, entraînés sur des millions de paires d'images en basse et haute définition. Concrètement, deux grandes familles de systèmes coexistent : d'un côté des outils de génération pure comme Midjourney ou DALL-E, qui créent des visuels à partir de rien, et de l'autre des technologies spécialisées qui améliorent des images déjà existantes en les débruitant et en multipliant leur résolution jusqu'à des standards 4K ou 8K, sans dégrader la netteté d'origine. Le cœur de cette révolution technique repose notamment sur les réseaux antagonistes génératifs, ou GAN, qui font collaborer deux réseaux de neurones : un générateur qui reconstitue les pixels manquants, et un discriminateur qui compare le résultat à des milliers de photos réelles en haute définition jusqu'à obtenir un rendu crédible. Cette avancée change concrètement la donne pour les photographes, les créateurs de contenu, les équipes marketing et les professionnels du e-commerce, qui peuvent désormais obtenir un visuel impeccable à partir d'un fichier d'origine médiocre sans avoir à refaire une séance photo ni abandonner un projet visuel prometteur. Pour les entreprises qui dépendent de catalogues produits ou de bibliothèques d'images volumineuses, la possibilité de sauver des fichiers basse résolution représente un gain de temps et de budget significatif. Plus largement, cette technologie démocratise l'accès à des rendus professionnels haute définition, jusque là réservés à des équipements ou des compétences de retouche coûteuses. Cette évolution marque une rupture avec des décennies de pratiques en retouche d'image. Les logiciels traditionnels comme Photoshop s'appuyaient sur l'interpolation bicubique ou au plus proche voisin, des calculs mathématiques qui se contentaient d'étirer les pixels existants en faisant une moyenne des couleurs environnantes, sans jamais comprendre le contenu de l'image. Le résultat produisait inévitablement du flou, une perte de netteté sur les contours et l'apparition de blocs de pixels visibles au moindre zoom. À l'inverse, les modèles d'IA actuels analysent le contexte du sujet, qu'il s'agisse d'un visage, d'un paysage ou d'un texte, pour redessiner intelligemment les détails manquants, ouvrant la voie à une adoption plus large de ces outils dans les usages professionnels comme grand public.

CréationTuto
1 source
NVIDIA lance NemotronLabs VoiceChat 11B, un modèle vocal en duplex intégral avec 450 ms de latence et appel d'outils en direct
Illustration générée par IA
43MarkTechPost 

NVIDIA lance NemotronLabs VoiceChat 11B, un modèle vocal en duplex intégral avec 450 ms de latence et appel d'outils en direct

NVIDIA a publié NemotronLabs VoiceChat 11B, un modèle ouvert de 11 milliards de paramètres capable de conversation vocale en duplex intégral, c'est à dire que l'agent écoute pendant qu'il parle. Contrairement aux architectures classiques qui enchaînent reconnaissance vocale, modèle de langage et synthèse vocale dans trois systèmes séparés, ce modèle traite la compréhension et la génération de parole dans un seul réseau unifié, ce qui supprime les échanges entre API et réduit la latence. Sur le benchmark Full-Duplex-Bench 1.0, la latence de transition de tour de parole mesurée est de 448 millisecondes, et le taux de prise de parole lorsqu'un utilisateur interrompt l'agent atteint 1,00 en 480 millisecondes. Le modèle est le premier système ouvert en duplex intégral à permettre l'appel d'outils pendant que la conversation continue, via un canal de sortie séparé dédié aux scripts au format TOOLCALL, complété par des phrases d'attente prédéfinies par l'opérateur pour éviter les silences pendant qu'une requête API s'exécute. L'architecture combine un encodeur vocal Fast Conformer issu de Nemotron-Speech-Streaming-En-0.6b, le modèle de langage Nemotron Nano v2 comme colonne vertébrale, et un décodeur de synthèse vocale NVIDIA produisant de l'audio à 22,05 kHz. L'entraînement a mobilisé environ 550 000 heures d'audio réel et synthétique, en s'appuyant sur les travaux SALM-Duplex et Audio Flamingo 3. Cette sortie compte parce qu'elle abaisse concrètement la barrière technique pour construire des agents vocaux réactifs capables d'interruption naturelle et d'actions en temps réel, un défi resté largement non résolu dans l'écosystème open source. Les secteurs visés sont nombreux: centres d'appels, assistants embarqués dans les véhicules, commande vocale en restauration rapide, modernisation des serveurs vocaux télécoms, dialogues de personnages non joueurs dans le jeu vidéo, et outils d'accessibilité. Mais NVIDIA précise que le modèle reste destiné à la recherche uniquement, pas à la production: le contexte audio est plafonné à deux minutes, le système peut dégénérer en réponses incohérentes après plusieurs tours d'échange, et des erreurs de transcription ou des prises de parole intempestives de l'agent après la fin d'un tour ont été documentées. L'accès reste réservé aux équipes disposant d'au moins un GPU de 80 Go de VRAM, comme les puces A100, H100, RTX 6000 Pro ou B200 sous Linux x86_64, puisqu'aucune API hébergée ni fournisseur d'inférence ne propose actuellement le modèle. Sur les benchmarks d'appel d'outils vocaux BFCL-v3, les scores restent modestes, avec 58,5% de réussite sur les appels simples et seulement 27,5% sur les appels multiples et parallèles combinés, tandis que NVIDIA recommande de limiter chaque session à cinq outils maximum. Le modèle se classe deuxième parmi les systèmes ouverts en duplex intégral sur les classements VoiceBench et Full-Duplex-Bench 1.0, ce qui en fait une base de travail prometteuse mais encore expérimentale pour les laboratoires de recherche, startups spécialisées en IA vocale et fournisseurs de cloud GPU qui voudront l'affiner avant tout déploiement réel.

💬 Le duplex intégral qui marche à 448 ms, c'est le vrai déblocage ici, pas le nombre de paramètres. Ça fait des années que l'appel d'outils en conversation vocale butait sur le silence gênant pendant qu'une API répond, et là ils le masquent avec des phrases d'attente, c'est bricolé mais ça fonctionne. Reste que "recherche uniquement", contexte à deux minutes et 27,5% de réussite sur les appels d'outils multiples, faut pas se leurrer, on est encore loin d'un centre d'appels en prod avec ça.

CréationActu
1 source
xAI's Imagine 2.0 se classe juste derrière GPT-Image-2 d'OpenAI dans les benchmarks Arena
Illustration générée par IA
44The Decoder 

xAI's Imagine 2.0 se classe juste derrière GPT-Image-2 d'OpenAI dans les benchmarks Arena

xAI a lancé Imagine Image 2.0, son nouveau générateur d'images intégré à Grok, l'assistant IA de la plateforme X. Selon les classements Arena, qui mesurent les préférences des utilisateurs via des comparaisons directes entre modèles, cette nouvelle version se positionne en deuxième place, juste derrière GPT-Image-2 d'OpenAI. Le modèle s'accompagne de plusieurs outils d'édition inédits, dont Magic Wand, une fonction de retouche rapide, et Multi-Ref Editing, qui permet de combiner plusieurs images de référence pour guider la génération. xAI propose également des modèles préconfigurés pensés pour des cas d'usage créatifs concrets, plutôt que pour la seule performance technique brute. Cette progression confirme que xAI ne se contente plus de rattraper son retard face aux ténors du secteur, mais rivalise désormais directement avec OpenAI sur un terrain hautement concurrentiel. Pour les utilisateurs de Grok, cela signifie un accès à des outils de création visuelle plus sophistiqués sans quitter l'écosystème X. Pour l'industrie, ce classement Arena illustre à quel point la génération d'images est devenue un champ de bataille central dans la course à l'IA générative, où chaque acteur cherche à combiner qualité esthétique et fonctionnalités pratiques pour les créateurs. Cette sortie s'inscrit dans la stratégie plus large de xAI, la société d'Elon Musk, qui cherche à faire de Grok une plateforme complète rivalisant avec ChatGPT sur tous les fronts, texte comme image. Face à OpenAI, Google ou Midjourney, la compétition s'intensifie autour des outils d'édition avancés, désormais perçus comme un critère de différenciation aussi important que la qualité brute des images générées. De nouvelles itérations sont probables des deux côtés dans les prochains mois.

💬 Xai rattrape OpenAI sur l'image, et c'est pas juste de la com. Deuxième place Arena, avec du multi-référence natif et un Magic Wand qui vise l'usage réel plutôt que le score de bench, ça place Grok dans le trio de tête créatif aux côtés d'OpenAI et Midjourney. Reste à voir si ça tient face aux nouvelles versions qui arrivent des deux côtés, le classement Arena bouge vite.

CréationOutil
1 source
Suno veut se légitimer avec des filigranes pour la musique générée par IA
Illustration générée par IA
45Ars Technica AI 

Suno veut se légitimer avec des filigranes pour la musique générée par IA

Suno, une des plateformes les plus utilisées pour générer de la musique par intelligence artificielle, annonce l'ajout de filigranes (watermarks) sur l'ensemble des morceaux produits par ses modèles. Dans un billet de blog, le PDG et cofondateur de l'entreprise, Mikey Shulman, explique que ce changement répond aux "normes émergentes" du secteur en matière d'étiquetage des contenus générés par IA. Concrètement, les plateformes de streaming pourront bientôt identifier automatiquement les morceaux issus de Suno grâce à ces marqueurs invisibles, et choisir soit de les signaler comme contenu IA, soit de les bloquer purement et simplement. Shulman n'a pas précisé si Suno développera sa propre technologie de filigrane ou s'appuiera sur une solution existante, comme SynthID de Google, que la firme de Mountain View a récemment commencé à concéder sous licence à d'autres entreprises. Cette décision intervient alors que les services de streaming comme Spotify sont submergés par un flot croissant de morceaux générés par IA, dont une part significative provient justement de Suno. En s'imposant volontairement des filigranes, l'entreprise cherche à se positionner comme un acteur responsable face à la multiplication des contenus IA de mauvaise qualité, souvent qualifiés de "slop", qui inondent les plateformes musicales et brouillent la frontière entre créations humaines et artificielles. Pour les auditeurs comme pour les ayants droit, cette traçabilité pourrait permettre de mieux distinguer les productions authentiques et de limiter la dilution de la valeur créative dans un marché déjà saturé. L'initiative de Suno s'inscrit dans une tendance plus large de régulation volontaire du contenu généré par IA, à l'image de Google, qui affirme avoir utilisé SynthID pour étiqueter l'équivalent de 60 000 années de contenu audio produit par ses modèles Gemini, ainsi que plus de 100 milliards d'images et de vidéos. Face à la pression croissante des plateformes, des artistes et des régulateurs, ces mécanismes de marquage pourraient devenir un standard incontournable de l'industrie, forçant les autres générateurs de musique par IA à emboîter le pas pour conserver l'accès aux grandes plateformes de streaming.

UESpotify, plateforme suédoise largement utilisée en France et en Europe, est directement concernée par l'afflux de morceaux générés par IA, et pourrait s'appuyer sur ces filigranes pour identifier ou filtrer ce contenu auprès des auditeurs européens.

💬 Suno s'auto-impose des filigranes avant qu'on le lui impose, c'est malin. Ça sent la stratégie de survie plus que l'éthique pure : Spotify croule sous le slop généré par IA, et Suno en est un des plus gros fournisseurs. Selon Le Fil IA, le vrai signal ici, c'est que la traçabilité des contenus IA ne viendra pas d'une loi mais d'un rapport de force entre plateformes de streaming et générateurs, celui qui accepte le marquage en premier dicte la norme aux autres.

Suno dévoile son plan pour lutter contre la musique IA indésirable
Illustration générée par IA
46The Verge AI 

Suno dévoile son plan pour lutter contre la musique IA indésirable

Suno, la startup spécialisée dans la génération musicale par intelligence artificielle, a annoncé de nouvelles mesures pour lutter contre la prolifération de morceaux IA de mauvaise qualité ou frauduleux sur les plateformes de streaming. Dans un long billet de blog, le PDG et cofondateur Mikey Shulman a détaillé les principes de l'entreprise et les prochaines étapes de sa stratégie, alors que Suno cherche à asseoir sa légitimité dans l'industrie musicale. Concrètement, la société va déployer de nouveaux outils de transparence ainsi que des technologies de filigrane numérique et d'empreinte permettant d'identifier plus facilement les morceaux générés par Suno, accompagnées d'une nouvelle politique de téléchargement. Selon Shulman, cette démarche s'aligne sur des standards émergents de l'industrie visant à faciliter la traçabilité des contenus produits par IA. L'entreprise dit aussi vouloir nouer des partenariats avec des plateformes de distribution musicale pour lutter conjointement contre la fraude et les usages abusifs de sa technologie. Cette initiative répond à une critique récurrente adressée à Suno et à des concurrents comme Udio : la facilité avec laquelle leurs outils permettent de générer en masse des morceaux qui inondent ensuite des plateformes comme Spotify, souvent dans le but de capter des revenus publicitaires ou de streaming sans réel travail créatif. Pour les artistes et les labels, ce phénomène de spam musical dilue la découvrabilité et pose des questions de rémunération équitable. En rendant les morceaux générés par IA identifiables grâce à un filigrane technique, Suno espère donner aux plateformes de distribution les moyens de détecter et filtrer les contenus frauduleux ou de faible qualité, tout en évitant que l'ensemble du secteur de la musique générative ne soit stigmatisé à cause d'un usage minoritaire mais très visible. Suno a levé des centaines de millions de dollars et fait face depuis ses débuts à des poursuites judiciaires de grandes maisons de disques, qui l'accusent d'avoir entraîné ses modèles sur des enregistrements protégés par le droit d'auteur sans autorisation. Dans ce climat de tension avec l'industrie musicale traditionnelle, regagner la confiance des plateformes de streaming et des ayants droit devient une priorité stratégique. L'adoption de standards de traçabilité comme le watermarking s'inscrit dans un mouvement plus large observé chez d'autres acteurs de l'IA générative, confrontés à des pressions similaires pour distinguer contenus humains et contenus synthétiques. Reste à voir si ces mesures suffiront à convaincre plateformes et régulateurs, alors que l'encadrement légal de la musique générée par IA reste largement à construire.

CréationActu
1 source
« Black Forest Labs déploie FLUX 3 Video en disponibilité générale et affirme dépasser Seedance 2.0 »
Illustration générée par IA
47The Decoder 

« Black Forest Labs déploie FLUX 3 Video en disponibilité générale et affirme dépasser Seedance 2.0 »

Black Forest Labs a annoncé la disponibilité générale de FLUX 3 Video, son nouveau modèle de génération de vidéos par intelligence artificielle. L'outil produit des clips en Full HD pouvant atteindre 20 secondes, intégrant un audio natif et une synchronisation labiale des dialogues dans plus de 14 langues. FLUX 3 Video peut également incruster du texte lisible directement dans les scènes générées, une prouesse technique que peu de générateurs vidéo maîtrisent encore. Selon les classements Elo internes publiés par l'entreprise, ce nouveau modèle devance Gemini Omni Flash de Google ainsi que Seedance 2.0, le générateur vidéo de ByteDance. Cette annonce marque une étape importante pour Black Forest Labs, qui cherche à s'imposer face aux géants technologiques sur un marché de la vidéo générative en pleine effervescence. La synchronisation labiale multilingue ouvre la voie à des usages concrets comme le doublage automatisé de contenus publicitaires ou de formats courts pour les réseaux sociaux, sans recourir à des équipes de production classiques. La capacité à générer du texte lisible dans l'image, longtemps un point faible des modèles vidéo, pourrait aussi séduire les équipes marketing cherchant à produire rapidement des visuels avec incrustations textuelles. Fondée par d'anciens chercheurs à l'origine de Stable Diffusion, Black Forest Labs s'est fait connaître avec sa famille de modèles d'images FLUX, largement adoptée dans l'industrie. L'entreprise allemande s'attaque désormais frontalement au segment vidéo, dominé jusqu'ici par Google, ByteDance et OpenAI avec Sora. Les classements Elo mis en avant restent toutefois auto-rapportés par Black Forest Labs elle-même, sans validation indépendante pour l'instant, une réserve à garder à l'esprit avant de conclure à une suprématie technique établie face à ses concurrents.

UEBlack Forest Labs est une entreprise allemande, ce qui illustre la capacité d'un acteur européen a rivaliser avec les géants américains et chinois de la vidéo générative, même si l'impact direct sur le marche français reste limite.

💬 Reste à voir si Sora et Seedance vont laisser une boîte allemande de dix personnes leur piquer la vedette, mais sur le papier FLUX 3 Video coche des cases que personne d'autre ne coche vraiment, texte lisible dans l'image et lip-sync en 14 langues, c'est du concret pour le doublage automatisé. Les chiffres viennent de Black Forest Labs elle-même, donc je prends le "meilleur que Seedance 2.0" avec des pincettes tant qu'un labo externe n'a pas reproduit ça. Ce qui compte vraiment ici, c'est que Black Forest Labs prouve qu'un acteur européen peut sortir un modèle vidéo de premier plan sans les moyens de Google ou ByteDance, ça change la lecture qu'on avait du rapport de force sur ce marché.

CréationActu
1 source
ByteDance Seedance 2.5 génère des clips vidéo de 30 secondes avec audio intégré
Illustration générée par IA
48The Decoder 

ByteDance Seedance 2.5 génère des clips vidéo de 30 secondes avec audio intégré

ByteDance vient de lancer Seedance 2.5, un modèle d'intelligence artificielle capable de générer simultanément la vidéo et l'audio d'un clip, en une seule opération. Chaque séquence peut atteindre 30 secondes, soit trois fois la durée maximale proposée par Gemini Omni Flash de Google. L'outil permet aux utilisateurs d'importer des dizaines d'images, de vidéos et de fichiers audio en référence, afin de guider précisément le style, le contenu ou l'ambiance sonore du résultat final. Cette combinaison de génération audiovisuelle intégrée et de durée étendue place Seedance 2.5 parmi les modèles les plus avancés du secteur à ce jour. Pour les équipes de production publicitaire, cette avancée pourrait bouleverser des méthodes de travail bien établies. Jusqu'ici, la création d'une vidéo promotionnelle nécessitait souvent d'assembler plusieurs clips courts, générés séparément puis montés bout à bout, avec la synchronisation audio ajoutée dans un second temps. Avec Seedance 2.5, ce processus fragmenté pourrait devenir obsolète : un seul clip cohérent de 30 secondes, son compris, suffirait à couvrir ce qui demandait auparavant plusieurs étapes distinctes de production et de post-production. Cette sortie s'inscrit dans la compétition intense que se livrent les géants technologiques autour de la génération vidéo par IA, un terrain où Google, OpenAI et désormais ByteDance rivalisent d'innovations sur la durée des clips, la qualité visuelle et l'intégration native du son. À mesure que ces outils gagnent en autonomie créative, les métiers de la production audiovisuelle et de la publicité devront s'adapter à des flux de travail radicalement raccourcis, tout en composant avec les questions de droits d'auteur et d'authenticité que soulève cette automatisation croissante.

💬 Bon, là ByteDance sort clairement une génération d'avance, 30 secondes avec l'audio calé dedans, c'est trois fois ce que propose Google. Ce qui se joue en vrai, c'est la fin du montage bout à bout, un métier entier de post-prod publicitaire qui se fait doubler par un prompt. Reste à voir si la synchro audio tient la route sur un vrai brief client, parce que sur le papier c'est propre, mais la démo et la prod ce sont deux mondes différents.

CréationActu
1 source
MiniMax dévoile H3, un modèle vidéo omnimodal générant des clips de 15 secondes en 2K avec audio stéréo natif
Illustration générée par IA
49MarkTechPost 

MiniMax dévoile H3, un modèle vidéo omnimodal générant des clips de 15 secondes en 2K avec audio stéréo natif

MiniMax a dévoilé le 31 juillet 2026 son nouveau modèle H3, un système de génération multimodale qui produit des vidéos en résolution 2K, d'une durée de 4 à 15 secondes (uniquement en valeurs entières), avec un son stéréo natif intégré directement dans la génération. Contrairement aux générations précédentes d'outils vidéo, souvent fragmentées entre modèles spécialisés distincts pour le texte-vers-vidéo, l'image-vers-vidéo, la génération à partir de première et dernière image, la référence de sujet ou de mouvement, et le montage vidéo, MiniMax H3 unifie l'ensemble dans un seul modèle capable de lire texte, images, vidéo et audio comme un contexte unique. Les relations de référence et d'édition s'expriment désormais en langage naturel, l'entreprise citant en exemple une consigne du type reprendre le mouvement de caméra d'une première vidéo, faire chanter un personnage issu d'une image, et synchroniser les paroles sur un extrait audio fourni séparément. Le modèle est déjà accessible via l'API sous l'identifiant MiniMax-H3 et dans l'application grand public Hailuo AI, mais reste indisponible pour un déploiement local sur du matériel propre. Cette unification change concrètement la donne pour la publicité, l'e-commerce, le design produit, les interfaces UI/UX, le jeu vidéo et la pré-visualisation cinématographique, en permettant de produire depuis un seul outil des variantes publicitaires, des vidéos de fiches produits, des séquences de titre, des animations de site web ou des cinématiques de jeu à personnages cohérents. Sur le plan tarifaire, MiniMax affirme que le prix à la seconde en 2K représente moins d'un tiers de celui des modèles concurrents, et moins de la moitié en 768p face aux offres 720p classiques ; des estimations relayées par des observateurs tiers évoquent un tarif de 0,13 dollar par seconde en 2K, soit environ 1,95 dollar pour un clip de 15 secondes, un chiffre que MiniMax n'a pas encore confirmé sur sa propre page de tarification, laquelle n'affiche pour l'instant que les paliers de son modèle précédent Hailuo 2.3. Techniquement, quatre innovations soutiennent cette avancée. Le système de description contextuelle compresse environ 100 000 tokens d'inférence en seulement 4 000 tokens en moyenne, en décrivant la relation entre le contexte source et la vidéo cible plutôt que la seule cible. Un nouvel encodeur, baptisé H3-VAE, offre un gain de compression multiplié par quatre en longueur de séquence effective, réduisant les coûts d'entraînement et d'inférence tout en rendant possible la résolution 2K. L'architecture de transformeur H3-Omni, développée en rupture avec celle du précédent modèle Hailuo-02, sépare les traitements de compréhension et de génération pour mieux exploiter le matériel, avec un gain de débit d'entraînement annoncé de près de 30 %. Enfin, une régénération en contexte permet au modèle de reconstruire lui-même sa sortie basse résolution en relisant le contexte multimodal d'origine, ce qui améliore le rendu du texte fin et des détails, un atout pour les usages liés aux marques et aux produits. Selon Artificial Analysis, cité par le South China Morning Post, H3 se positionnerait déjà en tête des classements de qualité vidéo générative.

💬 Bon, sur le papier ça sent le coup marketing habituel, mais le détail technique tient la route : compresser 100 000 tokens de contexte en 4 000 tout en gardant la cohérence entre plans, c'est ce qui manquait pour sortir de la génération vidéo "un prompt, un clip isolé". Le vrai signal, c'est le prix : à moins de 2 dollars le clip de 15 secondes en 2K, MiniMax rend la vidéo générative jetable comme un asset publicitaire, plus comme une prouesse technique qu'on montre une fois. Reste à voir si ça tient en prod hors des démos triées sur le volet, mais si les chiffres se confirment, le coût cesse d'être l'obstacle pour la pub et l'e-commerce.

CréationActu
1 source
MiniMax H3 casse les prix : 15 secondes en 2K pour 1,95 dollar
Illustration générée par IA
50Le Big Data 

MiniMax H3 casse les prix : 15 secondes en 2K pour 1,95 dollar

MiniMax a dévoilé H3, un nouveau modèle de génération vidéo capable de produire jusqu'à 15 secondes en résolution 2K avec son stéréo intégré, pour un prix facturé à 0,13 dollar la seconde via l'API de l'entreprise, soit 1,95 dollar pour un clip complet de 15 secondes. Une version en 768p, moins onéreuse à 0,09 dollar la seconde, restait en bêta fermée au moment du lancement, et des frais supplémentaires s'appliquent lorsque l'utilisateur fournit des références vidéo. Le modèle accepte jusqu'à douze fichiers de référence combinant images, trois clips vidéo maximum et pistes audio, permettant d'imposer une première et une dernière image, une voix, un mouvement de caméra ou un rythme de montage précis. Pour atteindre la 2K, H3 ne se contente pas d'agrandir une vidéo basse définition : il régénère l'intégralité du résultat en relisant le contexte d'origine, une méthode censée éviter les détails et textes inventés par les techniques classiques de super-résolution. MiniMax affirme que ce tarif représente moins d'un tiers du coût des modèles concurrents, une comparaison qui vient de l'entreprise elle-même et non d'un audit indépendant. Cette agressivité tarifaire vise directement les secteurs où chaque variante supplémentaire d'une publicité, d'une fiche produit ou d'un décor de jeu vidéo pèse sur les budgets de production. En unifiant génération, édition et gestion des références dans une seule architecture au lieu d'empiler des modèles spécialisés, MiniMax cherche à transformer H3 en outil de production courant plutôt qu'en simple curiosité technologique. Les premiers classements indépendants, notamment ceux d'Artificial Analysis, nuancent toutefois le tableau : H3 arrive deuxième en génération texte-vers-vidéo avec audio, derrière Gemini Omni Flash, et troisième en image-vers-vidéo avec audio, derrière Seedance 2.0 et Gemini. Sa vraie force se situe dans l'édition vidéo avec audio, catégorie où il prend la première place, un atout qui parle davantage aux studios soucieux de modifier une séquence ou de préserver une identité visuelle entre plusieurs plans qu'aux amateurs de démonstrations spectaculaires. MiniMax présente H3 comme un modèle à poids ouverts, mais les fichiers n'étaient pas encore disponibles au lancement, l'entreprise promettant leur publication dans les jours suivants sous réserve des lois applicables. Cette promesse non tenue immédiatement mérite d'être suivie de près, car des poids réellement téléchargeables permettraient aux entreprises de personnaliser le modèle et de l'exécuter sur leur propre infrastructure, réduisant leur dépendance à une API commerciale. Reuters rapporte par ailleurs que MiniMax a conçu H3 pour fonctionner sur plusieurs puces chinoises, un détail qui inscrit ce lancement dans la compétition plus large que se livrent les acteurs chinois de l'IA, dont Seedance, pour construire une indépendance technologique face aux modèles occidentaux comme Gemini.

UELes studios et agences françaises de production audiovisuelle et publicitaire pourraient profiter de cette baisse des coûts de génération vidéo, mais aucune entreprise ou régulation européenne n'est directement concernée.

💬 MiniMax vise juste : c'est dans le montage vidéo avec audio qu'H3 prend la première place, pas dans la génération brute où il reste deuxième ou troisième. Le vrai signal, c'est que la baisse de prix cible directement le coût des variantes en pub et jeu vidéo, là où chaque déclinaison plombait le budget. Reste que le "poids ouvert" promis n'est toujours pas livré, donc pour l'instant on paie une API chinoise et on croise les doigts sur le reste.

CréationActu
1 source