Aller au contenu principal
CréationThe Decoder · 1 min de lecture

ByteDance Seedance 2.5 génère des clips vidéo de 30 secondes avec audio intégré

Source originale ↗·

ByteDance vient de lancer Seedance 2.5, un modèle d'intelligence artificielle capable de générer simultanément la vidéo et l'audio d'un clip, en une seule opération. Chaque séquence peut atteindre 30 secondes, soit trois fois la durée maximale proposée par Gemini Omni Flash de Google. L'outil permet aux utilisateurs d'importer des dizaines d'images, de vidéos et de fichiers audio en référence, afin de guider précisément le style, le contenu ou l'ambiance sonore du résultat final. Cette combinaison de génération audiovisuelle intégrée et de durée étendue place Seedance 2.5 parmi les modèles les plus avancés du secteur à ce jour.

Pour les équipes de production publicitaire, cette avancée pourrait bouleverser des méthodes de travail bien établies. Jusqu'ici, la création d'une vidéo promotionnelle nécessitait souvent d'assembler plusieurs clips courts, générés séparément puis montés bout à bout, avec la synchronisation audio ajoutée dans un second temps. Avec Seedance 2.5, ce processus fragmenté pourrait devenir obsolète : un seul clip cohérent de 30 secondes, son compris, suffirait à couvrir ce qui demandait auparavant plusieurs étapes distinctes de production et de post-production.

Cette sortie s'inscrit dans la compétition intense que se livrent les géants technologiques autour de la génération vidéo par IA, un terrain où Google, OpenAI et désormais ByteDance rivalisent d'innovations sur la durée des clips, la qualité visuelle et l'intégration native du son. À mesure que ces outils gagnent en autonomie créative, les métiers de la production audiovisuelle et de la publicité devront s'adapter à des flux de travail radicalement raccourcis, tout en composant avec les questions de droits d'auteur et d'authenticité que soulève cette automatisation croissante.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Seedance 2.0 : Comment créer des vidéos TikTok avec l’IA ?
1Le Big Data 

Seedance 2.0 : Comment créer des vidéos TikTok avec l’IA ?

Seedance 2.0, la nouvelle version du générateur vidéo IA développé par ByteDance, s'est imposée comme un outil de référence pour la création de contenu vertical destiné à TikTok. La mise à jour introduit deux avancées majeures : un moteur de mouvement de caméra piloté par prompt textuel, et un système de cohérence de personnage capable de mémoriser les traits faciaux, vêtements et détails graphiques d'un sujet d'une scène à l'autre. Concrètement, le créateur intègre des commandes comme « Zoom », « Pan » ou « Tilt » directement dans sa description textuelle, et le modèle génère automatiquement des séquences animées au format 9:16, sans studio ni équipe de production. Une image de référence ou un identifiant suffit pour que le système reproduise un personnage avec une précision quasi identique sur plusieurs épisodes. Ces fonctionnalités répondent à deux problèmes chroniques des créateurs de contenu sur TikTok : la qualité visuelle insuffisante des outils accessibles au grand public, et l'incohérence visuelle qui brise la narration dans les formats sériels. Jusqu'ici, maintenir l'apparence d'un personnage entre plusieurs séquences générées par IA nécessitait un travail manuel fastidieux ou des compétences techniques avancées. Seedance 2.0 automatise ce processus, ce qui ouvre la création de storytelling long terme à des créateurs solo, sans budget de production. Pour les marques et les créateurs qui construisent une identité visuelle sur la plateforme, l'outil permet de standardiser un univers graphique cohérent à grande échelle, un avantage compétitif direct dans un environnement où l'attention se gagne en moins d'une seconde. Seedance s'inscrit dans une course effrénée entre les grandes plateformes et startups à proposer des générateurs vidéo IA crédibles : Sora d'OpenAI, Veo de Google, Kling, Runway ou encore Pika Labs occupent le même terrain. ByteDance, maison mère de TikTok, dispose d'un avantage structurel évident : sa connaissance intime des formats qui performent sur sa propre plateforme et l'accès à des données d'entraînement massives issues des millions de vidéos publiées chaque jour. La version 2.0 marque une montée en gamme délibérée vers les créateurs professionnels et semi-professionnels, avec un positionnement qui cherche à dépasser le statut d'outil expérimental pour devenir un composant réel du workflow de production. La question qui reste ouverte est celle des droits : à mesure que ces outils génèrent des personnages de plus en plus réalistes et persistants, les enjeux juridiques autour de la ressemblance, du consentement et de la propriété des identités numériques vont inévitablement s'intensifier.

UELes enjeux de consentement et de droits sur les personnages générés de manière persistante entrent directement en résonance avec l'AI Act européen et le RGPD sur le traitement des données biométriques.

CréationOutil
1 source
Flux 3 génère des vidéos avec audio natif jusqu'à 20 secondes, une première pour Black Forest Labs
2The Decoder 

Flux 3 génère des vidéos avec audio natif jusqu'à 20 secondes, une première pour Black Forest Labs

Black Forest Labs a dévoilé Flux 3, un nouveau modèle de fondation multimodal capable de générer des vidéos accompagnées d'un son natif, une première pour l'entreprise. Le système a été entraîné conjointement sur des images, des vidéos et de l'audio, et peut produire des séquences allant jusqu'à 20 secondes avec une bande sonore synchronisée générée directement par le modèle, sans étape de post-production séparée. Selon les tests internes menés par Black Forest Labs, Flux 3 dépasse légèrement Seedance 2.0, actuellement considéré comme la référence du marché sur ce segment. Aucun benchmark indépendant n'est toutefois disponible à ce stade pour confirmer ces résultats. Cette avancée marque une étape importante dans la génération vidéo par intelligence artificielle, où l'intégration native du son représente un défi technique majeur que peu d'acteurs ont réussi à surmonter. Pour les créateurs de contenu, studios et professionnels du marketing, la possibilité de générer simultanément image et audio cohérents réduit considérablement le temps de production et les coûts associés aux outils de doublage ou de sonorisation séparés. Cette capacité pourrait aussi accélérer l'adoption de la vidéo générative dans des usages professionnels où la qualité sonore est aussi critique que la qualité visuelle. Au-delà de la vidéo, Black Forest Labs affiche une ambition plus large : construire un "world model", un modèle capable de comprendre et de simuler la dynamique du monde physique. L'entreprise teste déjà Flux 3 sur des tâches liées à la robotique, ce qui suggère une stratégie visant à dépasser la simple génération de contenu créatif pour s'attaquer à des applications de simulation et de perception plus larges. Cette orientation place Black Forest Labs en concurrence directe avec d'autres laboratoires développant des modèles de fondation multimodaux à vocation générale, dans une course où la maîtrise conjointe de la vision, du son et du mouvement devient un enjeu stratégique central.

UEBlack Forest Labs est une entreprise européenne (Allemagne), ce qui renforce la position du continent dans la course a la génération vidéo multimodale face aux laboratoires américains et chinois.

CréationActu
1 source
MiniMax dévoile H3, un modèle vidéo omnimodal générant des clips de 15 secondes en 2K avec audio stéréo natif
3MarkTechPost 

MiniMax dévoile H3, un modèle vidéo omnimodal générant des clips de 15 secondes en 2K avec audio stéréo natif

MiniMax a dévoilé le 31 juillet 2026 son nouveau modèle H3, un système de génération multimodale qui produit des vidéos en résolution 2K, d'une durée de 4 à 15 secondes (uniquement en valeurs entières), avec un son stéréo natif intégré directement dans la génération. Contrairement aux générations précédentes d'outils vidéo, souvent fragmentées entre modèles spécialisés distincts pour le texte-vers-vidéo, l'image-vers-vidéo, la génération à partir de première et dernière image, la référence de sujet ou de mouvement, et le montage vidéo, MiniMax H3 unifie l'ensemble dans un seul modèle capable de lire texte, images, vidéo et audio comme un contexte unique. Les relations de référence et d'édition s'expriment désormais en langage naturel, l'entreprise citant en exemple une consigne du type reprendre le mouvement de caméra d'une première vidéo, faire chanter un personnage issu d'une image, et synchroniser les paroles sur un extrait audio fourni séparément. Le modèle est déjà accessible via l'API sous l'identifiant MiniMax-H3 et dans l'application grand public Hailuo AI, mais reste indisponible pour un déploiement local sur du matériel propre. Cette unification change concrètement la donne pour la publicité, l'e-commerce, le design produit, les interfaces UI/UX, le jeu vidéo et la pré-visualisation cinématographique, en permettant de produire depuis un seul outil des variantes publicitaires, des vidéos de fiches produits, des séquences de titre, des animations de site web ou des cinématiques de jeu à personnages cohérents. Sur le plan tarifaire, MiniMax affirme que le prix à la seconde en 2K représente moins d'un tiers de celui des modèles concurrents, et moins de la moitié en 768p face aux offres 720p classiques ; des estimations relayées par des observateurs tiers évoquent un tarif de 0,13 dollar par seconde en 2K, soit environ 1,95 dollar pour un clip de 15 secondes, un chiffre que MiniMax n'a pas encore confirmé sur sa propre page de tarification, laquelle n'affiche pour l'instant que les paliers de son modèle précédent Hailuo 2.3. Techniquement, quatre innovations soutiennent cette avancée. Le système de description contextuelle compresse environ 100 000 tokens d'inférence en seulement 4 000 tokens en moyenne, en décrivant la relation entre le contexte source et la vidéo cible plutôt que la seule cible. Un nouvel encodeur, baptisé H3-VAE, offre un gain de compression multiplié par quatre en longueur de séquence effective, réduisant les coûts d'entraînement et d'inférence tout en rendant possible la résolution 2K. L'architecture de transformeur H3-Omni, développée en rupture avec celle du précédent modèle Hailuo-02, sépare les traitements de compréhension et de génération pour mieux exploiter le matériel, avec un gain de débit d'entraînement annoncé de près de 30 %. Enfin, une régénération en contexte permet au modèle de reconstruire lui-même sa sortie basse résolution en relisant le contexte multimodal d'origine, ce qui améliore le rendu du texte fin et des détails, un atout pour les usages liés aux marques et aux produits. Selon Artificial Analysis, cité par le South China Morning Post, H3 se positionnerait déjà en tête des classements de qualité vidéo générative.

💬 Bon, sur le papier ça sent le coup marketing habituel, mais le détail technique tient la route : compresser 100 000 tokens de contexte en 4 000 tout en gardant la cohérence entre plans, c'est ce qui manquait pour sortir de la génération vidéo "un prompt, un clip isolé". Le vrai signal, c'est le prix : à moins de 2 dollars le clip de 15 secondes en 2K, MiniMax rend la vidéo générative jetable comme un asset publicitaire, plus comme une prouesse technique qu'on montre une fois. Reste à voir si ça tient en prod hors des démos triées sur le volet, mais si les chiffres se confirment, le coût cesse d'être l'obstacle pour la pub et l'e-commerce.

CréationActu
1 source
Grok Imagine Video 1.5 : cette IA génère maintenant des vidéos avec le son
4Le Big Data 

Grok Imagine Video 1.5 : cette IA génère maintenant des vidéos avec le son

xAI, la société d'intelligence artificielle fondée par Elon Musk, a annoncé le 17 juin 2026 la disponibilité générale de Grok Imagine Video 1.5, son modèle de génération de vidéo par image. Disponible sur le web via grok.com/imagine, sur les applications mobiles iOS et Android, et via l'API sous le nom grok-imagine-video-1.5, le modèle sort officiellement de sa phase de prévisualisation lancée début juin. La nouveauté la plus marquante de cette version finale est l'intégration du son natif : effets sonores, ambiances sonores et dialogues sont désormais générés simultanément à la vidéo, sans étape supplémentaire. Pour les utilisateurs grand public, xAI déploie en parallèle une version Video 1.5 Fast qui ramène le temps de génération d'une vidéo six secondes en 720p à environ 25 secondes, contre plus de 40 secondes avec le modèle précédent, soit un gain de performance de près de 40%. La synchronisation audio-vidéo native représente un changement concret pour les créateurs de contenu, qui devaient auparavant assembler son et image dans des outils tiers. La génération simultanée améliore la cohérence entre l'action et le son, et xAI indique que les voix gagnent en naturalité. Sur le plan visuel, le modèle corrige plusieurs faiblesses récurrentes des générateurs vidéo : meilleure cohérence des personnages et objets entre les images, réduction des déformations visuelles, et simulation plus réaliste de la physique, notamment le poids et l'élan. Le flux de travail créatif est également repensé avec l'ajout de projets organisables depuis une barre latérale, la possibilité de lancer plusieurs générations en parallèle via des agents simultanés, et un moteur de recherche intégré à la bibliothèque personnelle de l'utilisateur. xAI s'inscrit dans une course à la génération vidéo IA qui oppose désormais des acteurs comme Runway, Sora d'OpenAI, Veo de Google et Kling de Kuaishou. En intégrant le son directement dans le pipeline de génération, la société cherche à se différencier sur un marché où la qualité de production cinématographique devient un argument central. Pour illustrer le potentiel du modèle, xAI met en avant le projet "Odyssey" du créateur David Thompson, qui a réalisé une bande-annonce à l'esthétique cinématographique entièrement avec Grok Imagine 1.5. La disponibilité via API ouvre également la voie à des intégrations dans des outils professionnels de production. La prochaine étape pour xAI sera probablement d'étendre les durées de vidéo et la résolution maximale, deux limites encore non précisées officiellement, pour rivaliser avec les offres premium de ses concurrents.

CréationActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic