Aller au contenu principal
MiniMax dévoile H3, un modèle vidéo omnimodal générant des clips de 15 secondes en 2K avec audio stéréo natif
CréationMarkTechPost · 2 min de lecture

MiniMax dévoile H3, un modèle vidéo omnimodal générant des clips de 15 secondes en 2K avec audio stéréo natif

Source originale ↗·

MiniMax a dévoilé le 31 juillet 2026 son nouveau modèle H3, un système de génération multimodale qui produit des vidéos en résolution 2K, d'une durée de 4 à 15 secondes (uniquement en valeurs entières), avec un son stéréo natif intégré directement dans la génération. Contrairement aux générations précédentes d'outils vidéo, souvent fragmentées entre modèles spécialisés distincts pour le texte-vers-vidéo, l'image-vers-vidéo, la génération à partir de première et dernière image, la référence de sujet ou de mouvement, et le montage vidéo, MiniMax H3 unifie l'ensemble dans un seul modèle capable de lire texte, images, vidéo et audio comme un contexte unique. Les relations de référence et d'édition s'expriment désormais en langage naturel, l'entreprise citant en exemple une consigne du type reprendre le mouvement de caméra d'une première vidéo, faire chanter un personnage issu d'une image, et synchroniser les paroles sur un extrait audio fourni séparément. Le modèle est déjà accessible via l'API sous l'identifiant MiniMax-H3 et dans l'application grand public Hailuo AI, mais reste indisponible pour un déploiement local sur du matériel propre.

Cette unification change concrètement la donne pour la publicité, l'e-commerce, le design produit, les interfaces UI/UX, le jeu vidéo et la pré-visualisation cinématographique, en permettant de produire depuis un seul outil des variantes publicitaires, des vidéos de fiches produits, des séquences de titre, des animations de site web ou des cinématiques de jeu à personnages cohérents. Sur le plan tarifaire, MiniMax affirme que le prix à la seconde en 2K représente moins d'un tiers de celui des modèles concurrents, et moins de la moitié en 768p face aux offres 720p classiques ; des estimations relayées par des observateurs tiers évoquent un tarif de 0,13 dollar par seconde en 2K, soit environ 1,95 dollar pour un clip de 15 secondes, un chiffre que MiniMax n'a pas encore confirmé sur sa propre page de tarification, laquelle n'affiche pour l'instant que les paliers de son modèle précédent Hailuo 2.3.

Techniquement, quatre innovations soutiennent cette avancée. Le système de description contextuelle compresse environ 100 000 tokens d'inférence en seulement 4 000 tokens en moyenne, en décrivant la relation entre le contexte source et la vidéo cible plutôt que la seule cible. Un nouvel encodeur, baptisé H3-VAE, offre un gain de compression multiplié par quatre en longueur de séquence effective, réduisant les coûts d'entraînement et d'inférence tout en rendant possible la résolution 2K. L'architecture de transformeur H3-Omni, développée en rupture avec celle du précédent modèle Hailuo-02, sépare les traitements de compréhension et de génération pour mieux exploiter le matériel, avec un gain de débit d'entraînement annoncé de près de 30 %. Enfin, une régénération en contexte permet au modèle de reconstruire lui-même sa sortie basse résolution en relisant le contexte multimodal d'origine, ce qui améliore le rendu du texte fin et des détails, un atout pour les usages liés aux marques et aux produits. Selon Artificial Analysis, cité par le South China Morning Post, H3 se positionnerait déjà en tête des classements de qualité vidéo générative.

💬 L'analyse de Mathieu

Bon, sur le papier ça sent le coup marketing habituel, mais le détail technique tient la route : compresser 100 000 tokens de contexte en 4 000 tout en gardant la cohérence entre plans, c'est ce qui manquait pour sortir de la génération vidéo "un prompt, un clip isolé". Le vrai signal, c'est le prix : à moins de 2 dollars le clip de 15 secondes en 2K, MiniMax rend la vidéo générative jetable comme un asset publicitaire, plus comme une prouesse technique qu'on montre une fois. Reste à voir si ça tient en prod hors des démos triées sur le volet, mais si les chiffres se confirment, le coût cesse d'être l'obstacle pour la pub et l'e-commerce.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

MiniMax H3 casse les prix : 15 secondes en 2K pour 1,95 dollar
1Le Big Data 

MiniMax H3 casse les prix : 15 secondes en 2K pour 1,95 dollar

MiniMax a dévoilé H3, un nouveau modèle de génération vidéo capable de produire jusqu'à 15 secondes en résolution 2K avec son stéréo intégré, pour un prix facturé à 0,13 dollar la seconde via l'API de l'entreprise, soit 1,95 dollar pour un clip complet de 15 secondes. Une version en 768p, moins onéreuse à 0,09 dollar la seconde, restait en bêta fermée au moment du lancement, et des frais supplémentaires s'appliquent lorsque l'utilisateur fournit des références vidéo. Le modèle accepte jusqu'à douze fichiers de référence combinant images, trois clips vidéo maximum et pistes audio, permettant d'imposer une première et une dernière image, une voix, un mouvement de caméra ou un rythme de montage précis. Pour atteindre la 2K, H3 ne se contente pas d'agrandir une vidéo basse définition : il régénère l'intégralité du résultat en relisant le contexte d'origine, une méthode censée éviter les détails et textes inventés par les techniques classiques de super-résolution. MiniMax affirme que ce tarif représente moins d'un tiers du coût des modèles concurrents, une comparaison qui vient de l'entreprise elle-même et non d'un audit indépendant. Cette agressivité tarifaire vise directement les secteurs où chaque variante supplémentaire d'une publicité, d'une fiche produit ou d'un décor de jeu vidéo pèse sur les budgets de production. En unifiant génération, édition et gestion des références dans une seule architecture au lieu d'empiler des modèles spécialisés, MiniMax cherche à transformer H3 en outil de production courant plutôt qu'en simple curiosité technologique. Les premiers classements indépendants, notamment ceux d'Artificial Analysis, nuancent toutefois le tableau : H3 arrive deuxième en génération texte-vers-vidéo avec audio, derrière Gemini Omni Flash, et troisième en image-vers-vidéo avec audio, derrière Seedance 2.0 et Gemini. Sa vraie force se situe dans l'édition vidéo avec audio, catégorie où il prend la première place, un atout qui parle davantage aux studios soucieux de modifier une séquence ou de préserver une identité visuelle entre plusieurs plans qu'aux amateurs de démonstrations spectaculaires. MiniMax présente H3 comme un modèle à poids ouverts, mais les fichiers n'étaient pas encore disponibles au lancement, l'entreprise promettant leur publication dans les jours suivants sous réserve des lois applicables. Cette promesse non tenue immédiatement mérite d'être suivie de près, car des poids réellement téléchargeables permettraient aux entreprises de personnaliser le modèle et de l'exécuter sur leur propre infrastructure, réduisant leur dépendance à une API commerciale. Reuters rapporte par ailleurs que MiniMax a conçu H3 pour fonctionner sur plusieurs puces chinoises, un détail qui inscrit ce lancement dans la compétition plus large que se livrent les acteurs chinois de l'IA, dont Seedance, pour construire une indépendance technologique face aux modèles occidentaux comme Gemini.

UELes studios et agences françaises de production audiovisuelle et publicitaire pourraient profiter de cette baisse des coûts de génération vidéo, mais aucune entreprise ou régulation européenne n'est directement concernée.

💬 MiniMax vise juste : c'est dans le montage vidéo avec audio qu'H3 prend la première place, pas dans la génération brute où il reste deuxième ou troisième. Le vrai signal, c'est que la baisse de prix cible directement le coût des variantes en pub et jeu vidéo, là où chaque déclinaison plombait le budget. Reste que le "poids ouvert" promis n'est toujours pas livré, donc pour l'instant on paie une API chinoise et on croise les doigts sur le reste.

CréationActu
1 source
ByteDance Seedance 2.5 génère des clips vidéo de 30 secondes avec audio intégré
2The Decoder 

ByteDance Seedance 2.5 génère des clips vidéo de 30 secondes avec audio intégré

ByteDance vient de lancer Seedance 2.5, un modèle d'intelligence artificielle capable de générer simultanément la vidéo et l'audio d'un clip, en une seule opération. Chaque séquence peut atteindre 30 secondes, soit trois fois la durée maximale proposée par Gemini Omni Flash de Google. L'outil permet aux utilisateurs d'importer des dizaines d'images, de vidéos et de fichiers audio en référence, afin de guider précisément le style, le contenu ou l'ambiance sonore du résultat final. Cette combinaison de génération audiovisuelle intégrée et de durée étendue place Seedance 2.5 parmi les modèles les plus avancés du secteur à ce jour. Pour les équipes de production publicitaire, cette avancée pourrait bouleverser des méthodes de travail bien établies. Jusqu'ici, la création d'une vidéo promotionnelle nécessitait souvent d'assembler plusieurs clips courts, générés séparément puis montés bout à bout, avec la synchronisation audio ajoutée dans un second temps. Avec Seedance 2.5, ce processus fragmenté pourrait devenir obsolète : un seul clip cohérent de 30 secondes, son compris, suffirait à couvrir ce qui demandait auparavant plusieurs étapes distinctes de production et de post-production. Cette sortie s'inscrit dans la compétition intense que se livrent les géants technologiques autour de la génération vidéo par IA, un terrain où Google, OpenAI et désormais ByteDance rivalisent d'innovations sur la durée des clips, la qualité visuelle et l'intégration native du son. À mesure que ces outils gagnent en autonomie créative, les métiers de la production audiovisuelle et de la publicité devront s'adapter à des flux de travail radicalement raccourcis, tout en composant avec les questions de droits d'auteur et d'authenticité que soulève cette automatisation croissante.

💬 Bon, là ByteDance sort clairement une génération d'avance, 30 secondes avec l'audio calé dedans, c'est trois fois ce que propose Google. Ce qui se joue en vrai, c'est la fin du montage bout à bout, un métier entier de post-prod publicitaire qui se fait doubler par un prompt. Reste à voir si la synchro audio tient la route sur un vrai brief client, parce que sur le papier c'est propre, mais la démo et la prod ce sont deux mondes différents.

CréationActu
1 source
Flux 3 génère des vidéos avec audio natif jusqu'à 20 secondes, une première pour Black Forest Labs
3The Decoder 

Flux 3 génère des vidéos avec audio natif jusqu'à 20 secondes, une première pour Black Forest Labs

Black Forest Labs a dévoilé Flux 3, un nouveau modèle de fondation multimodal capable de générer des vidéos accompagnées d'un son natif, une première pour l'entreprise. Le système a été entraîné conjointement sur des images, des vidéos et de l'audio, et peut produire des séquences allant jusqu'à 20 secondes avec une bande sonore synchronisée générée directement par le modèle, sans étape de post-production séparée. Selon les tests internes menés par Black Forest Labs, Flux 3 dépasse légèrement Seedance 2.0, actuellement considéré comme la référence du marché sur ce segment. Aucun benchmark indépendant n'est toutefois disponible à ce stade pour confirmer ces résultats. Cette avancée marque une étape importante dans la génération vidéo par intelligence artificielle, où l'intégration native du son représente un défi technique majeur que peu d'acteurs ont réussi à surmonter. Pour les créateurs de contenu, studios et professionnels du marketing, la possibilité de générer simultanément image et audio cohérents réduit considérablement le temps de production et les coûts associés aux outils de doublage ou de sonorisation séparés. Cette capacité pourrait aussi accélérer l'adoption de la vidéo générative dans des usages professionnels où la qualité sonore est aussi critique que la qualité visuelle. Au-delà de la vidéo, Black Forest Labs affiche une ambition plus large : construire un "world model", un modèle capable de comprendre et de simuler la dynamique du monde physique. L'entreprise teste déjà Flux 3 sur des tâches liées à la robotique, ce qui suggère une stratégie visant à dépasser la simple génération de contenu créatif pour s'attaquer à des applications de simulation et de perception plus larges. Cette orientation place Black Forest Labs en concurrence directe avec d'autres laboratoires développant des modèles de fondation multimodaux à vocation générale, dans une course où la maîtrise conjointe de la vision, du son et du mouvement devient un enjeu stratégique central.

UEBlack Forest Labs est une entreprise européenne (Allemagne), ce qui renforce la position du continent dans la course a la génération vidéo multimodale face aux laboratoires américains et chinois.

CréationActu
1 source
Gemini Omni vs Seedance 2.0 : quelle est la meilleure IA de génération vidéo en 2026 ?
4Le Big Data 

Gemini Omni vs Seedance 2.0 : quelle est la meilleure IA de génération vidéo en 2026 ?

Google a officiellement lancé Gemini Omni le 19 mai 2026 lors de son Google I/O annuel, entrant directement en concurrence avec Seedance 2.0 de ByteDance, sorti dès le 12 février 2026. Ces deux modèles représentent aujourd'hui le sommet de la génération vidéo par IA. Gemini Omni remplace Veo 3.1 dans l'application Gemini et introduit une nouveauté de fond : l'édition conversationnelle. L'utilisateur génère un clip, puis demande en langage naturel de modifier l'arrière-plan, de changer un personnage ou de stabiliser une séquence, sans passer par une timeline ou des calques. Seedance 2.0, lui, trône en tête du classement Artificial Analysis Video Arena avec un score Elo de 1 269 en texte-vers-vidéo et 1 351 en image-vers-vidéo, devant Kling 3.0, Veo 3.1 et Sora 2. Sa signature technique est la génération audio native et synchronisée en une seule passe : chaque son d'impact, chaque ambiance musicale est produit automatiquement au bon moment, sans post-production. L'enjeu commercial est clair : la vidéo générée par IA sort du stade expérimental pour devenir un outil de production réel. Pour les créateurs de contenu, les agences et les entreprises, le choix entre ces deux plateformes aura des conséquences concrètes sur les flux de travail. Gemini Omni cible les utilisateurs déjà dans l'écosystème Google, avec une intégration native à Google Photos, Workspace, YouTube et Android, ainsi que la possibilité de créer des avatars numériques réutilisables. Seedance 2.0 s'adresse davantage aux professionnels qui cherchent une qualité visuelle maximale et un contrôle précis via des références multiples et des keyframes. Sur le plan tarifaire, Google propose Gemini Omni dès 19,99 dollars par mois (plan Pro), avec un plan Ultra redescendu à 99,99 dollars lors du Google I/O, après avoir été affiché à 249 dollars. L'API, attendue dans les semaines à venir, devrait coûter environ 0,10 dollar par seconde en qualité standard. Cette confrontation s'inscrit dans une bataille plus large entre les grandes plateformes technologiques pour contrôler les outils de création vidéo à l'ère de l'IA générative. ByteDance bénéficie d'un avantage structurel : Seedance 2.0 a été entraîné sur des milliards de vidéos TikTok et Douyin, lui conférant une compréhension fine des dynamiques corporelles et des esthétiques populaires. Google, de son côté, mise sur l'intégration écosystème et la facilité d'usage conversationnel pour compenser un léger retard sur la qualité brute de génération, reconnu par les premières analyses indépendantes. L'API Gemini Omni n'étant pas encore disponible, le déploiement est encore partiel, ce qui laisse à Seedance 2.0 quelques semaines supplémentaires pour consolider sa position de référence sur le marché.

UELes professionnels européens de la création vidéo ont accès à deux nouvelles plateformes de génération vidéo IA de niveau production, susceptibles de transformer leurs flux de travail et de réduire les coûts de post-production.

💬 Seedance 2.0 écrase les benchmarks, c'est factuel. Mais Google joue un jeu différent : l'édition conversationnelle sans timeline, intégrée nativement dans l'écosystème que tout le monde utilise déjà, c'est le genre de truc qui fait bouger les usages en masse, même avec un léger retard sur la qualité brute. L'API Gemini pas encore dispo, ByteDance entraîné sur des milliards de TikToks : les prochaines semaines vont être intéressantes à suivre.

CréationOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic