Aller au contenu principal
Google veut réussir avec Veo 3.1 lite là où OpenAI a échoué avec Sora
CréationFrandroid · 1 min de lecture

Google veut réussir avec Veo 3.1 lite là où OpenAI a échoué avec Sora

Source originale ↗·

Google a dévoilé Veo 3.1 lite, une version allégée de son modèle de génération vidéo par intelligence artificielle, destinée en priorité aux professionnels et créateurs de contenu. Contrairement aux versions précédentes positionnées sur les capacités brutes, ce nouveau modèle mise sur un équilibre entre performance et accessibilité tarifaire — un pivot stratégique explicitement assumé par la firme de Mountain View.

L'enjeu est directement lié à l'échec relatif de Sora, le modèle vidéo d'OpenAI lancé avec fracas fin 2024 : malgré des démonstrations impressionnantes, Sora n'a jamais réussi à s'imposer auprès du grand public ni des professionnels, freiné par des coûts élevés, des limitations d'accès et des résultats inégaux en production réelle. Google tente d'éviter ce piège en rendant Veo 3.1 lite plus économique à l'usage, ce qui pourrait lui ouvrir les workflows de studios, agences et indépendants que Sora n'a pas su conquérir.

La compétition dans la génération vidéo IA s'est considérablement intensifiée ces derniers mois, avec des acteurs comme Runway, Kling ou Pika qui occupent déjà le terrain professionnel. Google, fort de son infrastructure et de son intégration dans l'écosystème Workspace et YouTube, dispose d'un levier de distribution que ses concurrents n'ont pas. Veo 3.1 lite s'inscrit dans une stratégie plus large visant à ancrer Gemini et les outils génératifs Google dans les usages quotidiens des créateurs, avant que le marché ne se cristallise autour d'un ou deux acteurs dominants.

Impact France/UE

Les créateurs et studios européens pourraient adopter Veo 3.1 lite comme alternative abordable aux outils vidéo IA existants, notamment via l'intégration dans Google Workspace déjà répandu en entreprise.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

OpenAI s'attaque à Google avec son nouveau modèle d'image
1The Information AI 

OpenAI s'attaque à Google avec son nouveau modèle d'image

OpenAI prépare discrètement un nouveau modèle de génération d'images, officieusement baptisé "gpt-image-2" par la communauté en ligne. Depuis plusieurs semaines, des images produites par ce modèle circulent sur X et Reddit, repérées par des utilisateurs attentifs qui ont identifié des tests en cours auprès d'une sélection de comptes ChatGPT et sur des plateformes de classement anonymes. Les résultats sont frappants : les images générées atteignent un niveau de photoréalisme tel qu'elles sont, dans certains cas, pratiquement impossibles à distinguer de photographies authentiques. L'enjeu dépasse largement la prouesse technique. OpenAI vise explicitement 1 milliard d'utilisateurs actifs hebdomadaires sur ChatGPT, un seuil symbolique que l'entreprise espérait franchir avant fin 2025. Elle a manqué cet objectif et stagne depuis dans une fourchette autour de 920 millions d'utilisateurs par semaine. Un modèle d'image nettement supérieur aux solutions existantes pourrait constituer le levier capable de débloquer cette croissance, en attirant une nouvelle vague d'utilisateurs grand public, créatifs et professionnels, qui restent encore sur des outils concurrents comme Midjourney ou les offres de Google. La bataille des modèles d'image s'intensifie à mesure que les grands acteurs de l'IA cherchent à consolider leur position. Google, avec Imagen, et les plateformes spécialisées font face à une OpenAI qui cherche à intégrer toujours davantage de capacités directement dans ChatGPT pour en faire un point d'entrée unique. Le lancement officiel de gpt-image-2 n'a pas encore été annoncé, mais la stratégie de tests progressifs suggère une sortie imminente. Si le modèle tient ses promesses de photoréalisme à grande échelle, il pourrait redistribuer significativement les parts de marché dans un secteur où la qualité visuelle est devenue le principal critère de différenciation.

CréationOpinion
1 source
Google AI publie Veo 3.1 Lite : génération vidéo rapide et économique via l'API Gemini
2MarkTechPost 

Google AI publie Veo 3.1 Lite : génération vidéo rapide et économique via l'API Gemini

Google a lancé Veo 3.1 Lite, un nouveau palier de son portefeuille de génération vidéo par IA, désormais disponible via l'API Gemini et Google AI Studio pour les utilisateurs en abonnement payant. Ce modèle se distingue par son positionnement tarifaire agressif : il offre la même vitesse de génération que le modèle Veo 3.1 Fast existant, mais à environ moitié moins cher. Concrètement, la génération en 720p est facturée 0,05 dollar par seconde, et 0,08 dollar par seconde en 1080p — des tarifs qui contrastent avec les plusieurs dollars par minute couramment pratiqués sur le marché de la vidéo IA haute qualité. Le modèle prend en charge des clips de 4, 6 ou 8 secondes, aux formats 16:9 et 9:16, avec une résolution maximale de 1080p (contrairement au Veo 3.1 flagship qui monte jusqu'au 4K). Il reconnaît également des directives cinématographiques précises dans les prompts, comme les instructions de panoramique, d'inclinaison ou d'éclairage. Pour les développeurs qui construisent des applications à fort volume — génération dynamique de publicités, automatisation de contenus pour les réseaux sociaux, prototypage itératif — le coût a longtemps constitué le principal frein à l'adoption industrielle de la vidéo générative. En divisant approximativement la facture par deux sans sacrifier la latence, Google ouvre la voie à des cas d'usage jusqu'ici économiquement inviables. L'intégration passe par l'API Gemini en REST ou gRPC, compatible avec les stacks Python et Node.js existants, ce qui réduit la friction d'adoption pour les équipes déjà dans l'écosystème Google. Chaque vidéo générée intègre également SynthID, le filigrane numérique invisible développé par Google DeepMind : imperceptible à l'œil nu, il reste détectable par des logiciels spécialisés, ce qui répond aux exigences croissantes de traçabilité du contenu synthétique. Sur le plan technique, Veo 3.1 Lite repose sur une architecture Diffusion Transformer (DiT), qui supplante les approches U-Net traditionnelles en traitant les frames vidéo non pas comme des images 2D statiques, mais comme des séquences de tokens dans un espace latent compressé. L'auto-attention appliquée à ces patches spatio-temporels améliore la cohérence temporelle — objets, lumières et textures restent stables tout au long du clip, un problème récurrent des modèles antérieurs. En opérant dans l'espace latent plutôt que dans l'espace pixel, le modèle contient l'empreinte mémoire et évite l'explosion du temps de calcul lors du passage en haute définition. Ce lancement s'inscrit dans une course à la démocratisation de la vidéo IA où Google, face à Sora d'OpenAI et Runway, cherche à consolider sa position en ciblant explicitement les développeurs plutôt que les créatifs, en faisant de la scalabilité économique son principal argument différenciateur.

UELes développeurs européens peuvent intégrer la génération vidéo IA à tarif réduit via l'API Gemini, sans impact réglementaire spécifique à l'UE.

CréationOpinion
1 source
Grok Imagine Video 1.5 : cette IA génère maintenant des vidéos avec le son
3Le Big Data 

Grok Imagine Video 1.5 : cette IA génère maintenant des vidéos avec le son

xAI, la société d'intelligence artificielle fondée par Elon Musk, a annoncé le 17 juin 2026 la disponibilité générale de Grok Imagine Video 1.5, son modèle de génération de vidéo par image. Disponible sur le web via grok.com/imagine, sur les applications mobiles iOS et Android, et via l'API sous le nom grok-imagine-video-1.5, le modèle sort officiellement de sa phase de prévisualisation lancée début juin. La nouveauté la plus marquante de cette version finale est l'intégration du son natif : effets sonores, ambiances sonores et dialogues sont désormais générés simultanément à la vidéo, sans étape supplémentaire. Pour les utilisateurs grand public, xAI déploie en parallèle une version Video 1.5 Fast qui ramène le temps de génération d'une vidéo six secondes en 720p à environ 25 secondes, contre plus de 40 secondes avec le modèle précédent, soit un gain de performance de près de 40%. La synchronisation audio-vidéo native représente un changement concret pour les créateurs de contenu, qui devaient auparavant assembler son et image dans des outils tiers. La génération simultanée améliore la cohérence entre l'action et le son, et xAI indique que les voix gagnent en naturalité. Sur le plan visuel, le modèle corrige plusieurs faiblesses récurrentes des générateurs vidéo : meilleure cohérence des personnages et objets entre les images, réduction des déformations visuelles, et simulation plus réaliste de la physique, notamment le poids et l'élan. Le flux de travail créatif est également repensé avec l'ajout de projets organisables depuis une barre latérale, la possibilité de lancer plusieurs générations en parallèle via des agents simultanés, et un moteur de recherche intégré à la bibliothèque personnelle de l'utilisateur. xAI s'inscrit dans une course à la génération vidéo IA qui oppose désormais des acteurs comme Runway, Sora d'OpenAI, Veo de Google et Kling de Kuaishou. En intégrant le son directement dans le pipeline de génération, la société cherche à se différencier sur un marché où la qualité de production cinématographique devient un argument central. Pour illustrer le potentiel du modèle, xAI met en avant le projet "Odyssey" du créateur David Thompson, qui a réalisé une bande-annonce à l'esthétique cinématographique entièrement avec Grok Imagine 1.5. La disponibilité via API ouvre également la voie à des intégrations dans des outils professionnels de production. La prochaine étape pour xAI sera probablement d'étendre les durées de vidéo et la résolution maximale, deux limites encore non précisées officiellement, pour rivaliser avec les offres premium de ses concurrents.

CréationActu
1 source
Google dévoile Gemini 3.1 Flash-Lite pour générer des images d'entreprise en 4 secondes à moindre coût
4VentureBeat AI 

Google dévoile Gemini 3.1 Flash-Lite pour générer des images d'entreprise en 4 secondes à moindre coût

Google a lancé ce jour un nouveau modèle de génération d'images baptisé Nano Banana 2 Lite, officiellement désigné Gemini 3.1 Flash-Lite Image dans son API. Ce modèle est immédiatement disponible pour les développeurs entreprise via Google AI Studio, l'API Gemini et la plateforme GEAP (Gemini Enterprise Agent Platform). Sa promesse principale est double : vitesse et faible coût. Il génère une image en 4 secondes au format 1024x1024 pixels, pour un tarif fixe de 0,034 dollar par tranche de mille images. Construit sur l'architecture Gemini 3.1 Flash Lite, il succède à Nano Banana 1 (Gemini 2.5 Flash Image) avec des améliorations ciblées : meilleure cohérence des personnages sur des séquences continues, rendu typographique localisé, et connaissance générale du monde renforcée pour générer des visualisations de données ou des mises en scène contextuelles. Dans les benchmarks internes, il obtient un score Elo de 1 251 en génération texte-vers-image, dépassant à la fois le modèle précédent (1 151) et même le Nano Banana Pro, plus lourd et plus coûteux (1 245). La seule limitation assumée est la résolution : contrairement aux modèles NB2 standard et NB Pro qui supportent 1k, 2k et 4k, ce modèle Lite se cantonne au 1k. L'enjeu commercial est clair. Google ne positionne pas ce modèle comme un outil créatif artistique, mais comme une couche utilitaire invisible pour les flux de travail automatisés à grand volume. Les ingénieurs logiciels, les plateformes publicitaires programmatiques et les applications de commerce numérique sont les cibles directes. Concrètement, cela signifie des milliers de variantes visuelles pour des tests A/B publicitaires en temps réel, des ajustements instantanés de visuels pour des vitrines localisées, ou encore la génération automatique d'assets pour des prototypes. À 0,034 dollar le millier d'images, le modèle change radicalement l'équation économique pour les applications qui génèrent des images à l'échelle industrielle. Cette sortie s'inscrit dans une période d'intense compétition sur le segment des modèles d'image rapides et bon marché. Google annonce également en parallèle la préversion publique de Gemini Omni Flash, un modèle multimodal orienté génération et édition vidéo conversationnelle. Nano Banana 2 Lite complète donc une offre stratifiée : d'un côté, des modèles puissants et flexibles pour la création complexe, de l'autre un moteur léger optimisé pour l'infrastructure. Le comparatif avec Krea 2 Turbo de la startup Krea est instructif : ce concurrent propose une licence partiellement ouverte et des capacités de personnalisation plus larges pour les petites entreprises, là où Google mise sur l'intégration native à son écosystème Workspace et ses offres IA d'entreprise. La bataille se joue autant sur le prix que sur l'écosystème, et Google dispose ici d'un avantage structurel considérable auprès de ses clients existants.

UELes entreprises européennes opérant à grand volume dans la publicité programmatique ou le e-commerce peuvent immédiatement réduire leurs coûts de génération d'images en adoptant ce modèle via l'API Gemini.

💬 Le calcul est simple, et c'est ça qui change tout : 0,034 dollar les mille images, c'est moins cher que de stocker les fichiers eux-mêmes. Google ne vend plus un outil créatif, il vend une commodité, comme l'électricité. Reste à voir si les boîtes de pub programmatique sautent vraiment le pas ou si elles se contentent de tester sur un coin de campagne.

CréationActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic