Aller au contenu principal
CréationLe Big Data · 2 min de lecture

MiniMax H3 casse les prix : 15 secondes en 2K pour 1,95 dollar

Source originale ↗·

MiniMax a dévoilé H3, un nouveau modèle de génération vidéo capable de produire jusqu'à 15 secondes en résolution 2K avec son stéréo intégré, pour un prix facturé à 0,13 dollar la seconde via l'API de l'entreprise, soit 1,95 dollar pour un clip complet de 15 secondes. Une version en 768p, moins onéreuse à 0,09 dollar la seconde, restait en bêta fermée au moment du lancement, et des frais supplémentaires s'appliquent lorsque l'utilisateur fournit des références vidéo. Le modèle accepte jusqu'à douze fichiers de référence combinant images, trois clips vidéo maximum et pistes audio, permettant d'imposer une première et une dernière image, une voix, un mouvement de caméra ou un rythme de montage précis. Pour atteindre la 2K, H3 ne se contente pas d'agrandir une vidéo basse définition : il régénère l'intégralité du résultat en relisant le contexte d'origine, une méthode censée éviter les détails et textes inventés par les techniques classiques de super-résolution. MiniMax affirme que ce tarif représente moins d'un tiers du coût des modèles concurrents, une comparaison qui vient de l'entreprise elle-même et non d'un audit indépendant.

Cette agressivité tarifaire vise directement les secteurs où chaque variante supplémentaire d'une publicité, d'une fiche produit ou d'un décor de jeu vidéo pèse sur les budgets de production. En unifiant génération, édition et gestion des références dans une seule architecture au lieu d'empiler des modèles spécialisés, MiniMax cherche à transformer H3 en outil de production courant plutôt qu'en simple curiosité technologique. Les premiers classements indépendants, notamment ceux d'Artificial Analysis, nuancent toutefois le tableau : H3 arrive deuxième en génération texte-vers-vidéo avec audio, derrière Gemini Omni Flash, et troisième en image-vers-vidéo avec audio, derrière Seedance 2.0 et Gemini. Sa vraie force se situe dans l'édition vidéo avec audio, catégorie où il prend la première place, un atout qui parle davantage aux studios soucieux de modifier une séquence ou de préserver une identité visuelle entre plusieurs plans qu'aux amateurs de démonstrations spectaculaires.

MiniMax présente H3 comme un modèle à poids ouverts, mais les fichiers n'étaient pas encore disponibles au lancement, l'entreprise promettant leur publication dans les jours suivants sous réserve des lois applicables. Cette promesse non tenue immédiatement mérite d'être suivie de près, car des poids réellement téléchargeables permettraient aux entreprises de personnaliser le modèle et de l'exécuter sur leur propre infrastructure, réduisant leur dépendance à une API commerciale. Reuters rapporte par ailleurs que MiniMax a conçu H3 pour fonctionner sur plusieurs puces chinoises, un détail qui inscrit ce lancement dans la compétition plus large que se livrent les acteurs chinois de l'IA, dont Seedance, pour construire une indépendance technologique face aux modèles occidentaux comme Gemini.

Impact France/UE

Les studios et agences françaises de production audiovisuelle et publicitaire pourraient profiter de cette baisse des coûts de génération vidéo, mais aucune entreprise ou régulation européenne n'est directement concernée.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Google dévoile Gemini 3.1 Flash-Lite pour générer des images d'entreprise en 4 secondes à moindre coût
1VentureBeat AI 

Google dévoile Gemini 3.1 Flash-Lite pour générer des images d'entreprise en 4 secondes à moindre coût

Google a lancé ce jour un nouveau modèle de génération d'images baptisé Nano Banana 2 Lite, officiellement désigné Gemini 3.1 Flash-Lite Image dans son API. Ce modèle est immédiatement disponible pour les développeurs entreprise via Google AI Studio, l'API Gemini et la plateforme GEAP (Gemini Enterprise Agent Platform). Sa promesse principale est double : vitesse et faible coût. Il génère une image en 4 secondes au format 1024x1024 pixels, pour un tarif fixe de 0,034 dollar par tranche de mille images. Construit sur l'architecture Gemini 3.1 Flash Lite, il succède à Nano Banana 1 (Gemini 2.5 Flash Image) avec des améliorations ciblées : meilleure cohérence des personnages sur des séquences continues, rendu typographique localisé, et connaissance générale du monde renforcée pour générer des visualisations de données ou des mises en scène contextuelles. Dans les benchmarks internes, il obtient un score Elo de 1 251 en génération texte-vers-image, dépassant à la fois le modèle précédent (1 151) et même le Nano Banana Pro, plus lourd et plus coûteux (1 245). La seule limitation assumée est la résolution : contrairement aux modèles NB2 standard et NB Pro qui supportent 1k, 2k et 4k, ce modèle Lite se cantonne au 1k. L'enjeu commercial est clair. Google ne positionne pas ce modèle comme un outil créatif artistique, mais comme une couche utilitaire invisible pour les flux de travail automatisés à grand volume. Les ingénieurs logiciels, les plateformes publicitaires programmatiques et les applications de commerce numérique sont les cibles directes. Concrètement, cela signifie des milliers de variantes visuelles pour des tests A/B publicitaires en temps réel, des ajustements instantanés de visuels pour des vitrines localisées, ou encore la génération automatique d'assets pour des prototypes. À 0,034 dollar le millier d'images, le modèle change radicalement l'équation économique pour les applications qui génèrent des images à l'échelle industrielle. Cette sortie s'inscrit dans une période d'intense compétition sur le segment des modèles d'image rapides et bon marché. Google annonce également en parallèle la préversion publique de Gemini Omni Flash, un modèle multimodal orienté génération et édition vidéo conversationnelle. Nano Banana 2 Lite complète donc une offre stratifiée : d'un côté, des modèles puissants et flexibles pour la création complexe, de l'autre un moteur léger optimisé pour l'infrastructure. Le comparatif avec Krea 2 Turbo de la startup Krea est instructif : ce concurrent propose une licence partiellement ouverte et des capacités de personnalisation plus larges pour les petites entreprises, là où Google mise sur l'intégration native à son écosystème Workspace et ses offres IA d'entreprise. La bataille se joue autant sur le prix que sur l'écosystème, et Google dispose ici d'un avantage structurel considérable auprès de ses clients existants.

UELes entreprises européennes opérant à grand volume dans la publicité programmatique ou le e-commerce peuvent immédiatement réduire leurs coûts de génération d'images en adoptant ce modèle via l'API Gemini.

💬 Le calcul est simple, et c'est ça qui change tout : 0,034 dollar les mille images, c'est moins cher que de stocker les fichiers eux-mêmes. Google ne vend plus un outil créatif, il vend une commodité, comme l'électricité. Reste à voir si les boîtes de pub programmatique sautent vraiment le pas ou si elles se contentent de tester sur un coin de campagne.

CréationActu
1 source
Les meilleurs modèles de synthèse vocale en 2026 : comparaison par benchmarks
2MarkTechPost 

Les meilleurs modèles de synthèse vocale en 2026 : comparaison par benchmarks

La synthèse vocale par intelligence artificielle a connu une accélération spectaculaire en 2026, au point que la frontière entre voix humaine et voix synthétique est devenue difficile à percevoir. Les deux références de l'industrie pour comparer ces modèles sont le classement Artificial Analysis Speech Arena, qui attribue un score ELO basé sur les préférences humaines en aveugle, et le TTS Arena de Hugging Face, qui fonctionne sur le même principe de vote A/B. Au 30 mai 2026, le top 5 de l'Artificial Analysis Speech Arena est occupé par Gemini 3.1 Flash TTS de Google, Realtime TTS-2 d'Inworld (en Research Preview), Sonic 3.5, Realtime TTS 1.5 Max et Fun-Realtime-TTS-Preview. Parmi les acteurs les plus remarquables, Inworld AI, un laboratoire fondé par des anciens de Google et DeepMind, a lancé TTS-1.5 le 21 janvier 2026, suivi de Realtime TTS-2 plus tard dans l'année. Son modèle propose deux niveaux : Mini, optimisé pour la latence avec un temps avant premier audio inférieur à 130 millisecondes au 90e percentile, et Max, sous 250 millisecondes. La tarification va de 25 dollars par million de caractères pour le Mini jusqu'à 5 dollars en offre Enterprise. Google DeepMind, de son côté, a publié Gemini 3.1 Flash TTS le 15 avril 2026, accessible via l'API Gemini, AI Studio et Vertex AI. Ces évolutions ont des implications directes pour les développeurs et les entreprises qui intègrent la voix dans leurs produits. Une latence sous les 100 millisecondes est désormais atteignable pour certains systèmes temps réel, ce qui rend les agents vocaux réellement utilisables dans des contextes grand public, comme le service client automatisé ou les jeux vidéo. Inworld revendique 30 % de plage expressive supplémentaire et 40 % de stabilité en plus par rapport à sa génération précédente, deux critères critiques pour des applications qui ne peuvent se permettre ni monotonie ni erreurs de prononciation. Les tarifs agressifs, notamment l'offre Enterprise à 5 dollars le million de caractères, signalent une course vers la commoditisation du TTS, similaire à ce que le marché des LLM a vécu entre 2023 et 2025. La comparaison entre modèles reste néanmoins complexe, car aucun benchmark ne capture l'ensemble des dimensions pertinentes. La qualité perçue, le taux d'erreur de caractères mesuré par méthode aller-retour (transcription ASR puis comparaison avec l'entrée), la latence de queue et la couverture linguistique obéissent à des logiques distinctes. Inworld couvre 15 langues pour TTS-1.5 mais plus de 100 pour TTS-2, tandis que les classements ELO fluctuent d'une semaine à l'autre. L'enjeu pour les équipes produit est d'identifier l'axe non négociable de leur application, qu'il s'agisse de la latence pour un assistant vocal ou de la fidélité phonétique pour un usage éditorial, avant de choisir leur fournisseur dans un marché qui reste en recomposition permanente.

💬 Le TTS vit ce que les LLM ont traversé entre 2023 et 2025. 5 dollars le million de caractères en Enterprise chez Inworld, Gemini Flash TTS qui s'installe en tête des classements, la course vers la commoditisation est enclenchée et ça va aller vite. La vraie nouveauté, c'est la latence sous 100ms qui rend enfin les agents vocaux utilisables en vrai, pas juste en démo.

CréationOutil
1 source
Génération d'images IA d'entreprise en 2 secondes : Krea 2 Raw et Turbo en open weights sous licence personnalisée
3VentureBeat AI 

Génération d'images IA d'entreprise en 2 secondes : Krea 2 Raw et Turbo en open weights sous licence personnalisée

La startup américaine Krea vient d'ouvrir les poids de son nouveau modèle de génération d'images Krea 2, disponible en deux variantes sur Hugging Face : « Krea 2 Raw », orienté qualité maximale, et « Krea 2 Turbo », capable de produire une image en seulement 2 secondes. Le modèle est publié sous une licence personnalisée qui impose des conditions précises : les entreprises de plus de 50 utilisateurs doivent souscrire à une offre Enterprise payante, et tous les utilisateurs, quelle que soit leur taille, sont tenus de mettre en place des garde-fous techniques pour empêcher la génération de contenus illégaux, d'images intimes non consenties (NCII), de matériel pédopornographique (CSAM) ou de contenus diffamatoires. Au-delà de la vitesse, Krea met en avant une variété visuelle supérieure aux générateurs habituels, une meilleure fidélité aux prompts, et des capacités de personnalisation étendues, notamment la compatibilité avec les LoRA et les références de style. L'enjeu est de taille pour les entreprises qui intègrent déjà la génération d'images dans leurs workflows de production. Une critique récurrente dans l'industrie pointe la monotonie esthétique de l'imagerie IA, ce que les anglophones appellent désormais l'« AI slop » : des visuels interchangeables, sans personnalité, incapables de différencier une marque de ses concurrentes. Krea tente de répondre directement à ce problème en offrant un modèle ouvert qui permet aux équipes techniques d'affiner les sorties selon leur identité visuelle. La vitesse de Krea 2 Turbo le positionne également comme un outil viable pour les pipelines à fort débit : à 2 secondes par image, il devance des références comme Midjourney v8.1 en mode Turbo (3 à 6 secondes) ou FLUX.2 [klein] de Black Forest Labs (3,9 à 4,6 secondes selon la variante), et ne se retrouve dépassé que par des modèles très optimisés comme FLUX.1 [schnell] de Prodia (0,5 seconde) ou Z-Image Turbo sur Replicate et fal.ai (1,8 seconde). Ce lancement s'inscrit dans une dynamique plus large de démocratisation des modèles de génération d'images, où les acteurs open source cherchent à concurrencer directement des plateformes propriétaires comme Midjourney ou les solutions cloud de Microsoft (MAI Image 2 via Azure) et Google. En adoptant un modèle hybride, poids ouverts pour les petits utilisateurs, licence commerciale pour les grandes organisations, Krea suit une stratégie similaire à celle de Black Forest Labs avec la famille FLUX, tentant de capter simultanément la communauté des développeurs et les budgets des entreprises. La contrainte de safeguards techniques imposée à tous les utilisateurs reflète aussi une pression réglementaire croissante, notamment en Europe, sur la responsabilité des fournisseurs d'outils génératifs face aux contenus préjudiciables.

UELa licence imposant des garde-fous techniques contre les contenus illégaux s'aligne avec les obligations de l'AI Act européen, facilitant l'adoption de ce modèle ouvert dans les workflows d'entreprises soumises à la réglementation européenne.

CréationOpinion
1 source
Les mini-séries chinoises devenues des usines à contenu IA
4MIT Technology Review 

Les mini-séries chinoises devenues des usines à contenu IA

En janvier 2026, 470 séries courtes générées entièrement par intelligence artificielle étaient publiées chaque jour sur des plateformes comme DramaWave et ReelShort, selon le cabinet d'analyse DataEye. Ces mini-dramas de une à deux minutes par épisode, conçus pour être consommés sur smartphone, forment désormais une industrie pesant 6,9 milliards de dollars en Chine en 2024, surpassant pour la première fois les recettes annuelles du box-office national. Des sociétés comme Kunlun Tech et FlexTV ont engagé une transformation radicale de leur chaîne de production: scénarisation, casting, tournage et montage, qui nécessitaient auparavant trois à quatre mois et environ 200 000 dollars pour une production nord-américaine, peuvent désormais être réalisés en moins d'un mois pour un coût réduit de 80 à 90%, selon Tang Tang, vice-président de FlexTV. Résultat: plus aucun acteur, opérateur caméra, ni spécialiste des effets visuels n'est nécessaire. Ce changement d'échelle redéfinit l'économie du divertissement mobile à l'échelle mondiale. Avec près d'un milliard de téléchargements cumulés, les applications de short drama ont fait des États-Unis leur premier marché hors de Chine, représentant environ 50% des revenus internationaux. L'IA n'est plus un outil auxiliaire: elle constitue désormais la colonne vertébrale de la production pour certains studios. La vitesse est devenue la métrique centrale. "En Chine, si une série ne rentre pas dans ses frais en un mois, l'industrie la considère comme un échec", explique Tang Tang. Pour les travailleurs du secteur, scénaristes et techniciens en premier lieu, cette automatisation accélérée soulève des questions directes sur l'avenir de leurs métiers, à une cadence que peu d'industries ont connue aussi brutalement. L'industrie du short drama chinois existe depuis 2018 mais a connu son essor à partir de 2022, quand les sociétés ont commencé à exporter leurs formats à l'international, en traduisant leurs succès et en produisant des séries localisées avec des acteurs étrangers. La stratégie d'acquisition est systématique: acheter massivement du trafic sur TikTok, Facebook et YouTube via des publicités à effet de suspense, offrir quelques épisodes gratuits, puis monétiser via abonnement dans l'application. Les décisions éditoriales reposent moins sur l'intuition créative que sur l'analyse de données de performance, les projets étant classifiés selon des mots-clés très précis couvrant genre, cadre et structure narrative. L'adoption de l'IA générative n'est que la prochaine itération de cette logique d'optimisation algorithmique, et laisse anticiper une montée en puissance encore plus rapide du volume de contenu disponible à l'international.

UEL'expansion internationale des plateformes chinoises de short drama vers les marchés européens représente une menace indirecte pour les scénaristes et techniciens audiovisuels français et européens.

💬 470 séries générées par IA par jour, c'est pas une stat anecdotique, c'est le nouveau plancher. Ce qui coûtait 200 000 dollars et trois mois de tournage sort maintenant en quelques semaines pour vingt fois moins cher, et la chaîne entière, scénarisation, casting, montage, est absorbée par les algorithmes. Les scénaristes français qui regardent ça de loin ont tort : ReelShort est déjà premier marché aux États-Unis.

CréationOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic