Aller au contenu principal
Recherche · Paper ·

Google Research présente un co-réalisateur vidéo IA : 4 frameworks à base d'agents pour des vidéos cohérentes de plusieurs minutes

Google Research a présenté une suite de quatre frameworks agentiques baptisée AI Video Co-Director, conçue pour transformer de courts clips générés par IA en récits vidéo cohérents de plusieurs minutes. Le système s'appuie sur les modèles Gemini et Veo de Google, tout en restant compatible avec d'autres générateurs ; les vidéos produites héritent du filigrane SynthID. Le premier module, Co-Director, accepté à la conférence COLM 2026, utilise un algorithme de bandit manchot multi-bras : un agent orchestrateur choisit une stratégie créative et un style esthétique, un agent de pré-production construit le storyboard, puis des sous-agents dédiés aux images clés, à la vidéo et à l'audio produisent le contenu, noté par un juge multimodal. Le deuxième, CANVAS, accepté à EMNLP 2026, maintient une mémoire visuelle persistante des personnages, lieux et objets ; lors d'un test de casse de musée, il a conservé intacts la casquette du voleur et la pierre précieuse, là où les systèmes concurrents AutoStudio et Gemini-3.1-Pro perdaient ces détails. Le troisième, A²RD (Agentic Autoregressive Diffusion), fonctionne sans entraînement supplémentaire via une boucle de récupération, synthèse, raffinement et mise à jour, et a permis de générer un film de dix minutes. Le quatrième, VQQA, affine les prompts en boucle fermée grâce à des questions visuelles automatiques et des critiques de modèles vision-langage. Google a aussi créé trois nouveaux benchmarks : GenAD-Bench (400 scénarios publicitaires sur 200 produits fictifs de 50 marques), HardContinuityBench et LVBench-C (120 scénarios où des éléments clés disparaissent pendant au moins dix segments).

2 min de lecturePertinence 57

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette avancée s'attaque à deux défauts qui plombent la production vidéo IA multi-plans : la dérive sémantique, quand une tenue ou un décor change d'un plan à l'autre, et les erreurs en cascade, quand un élément défectueux corrompt tous les plans suivants. L'équipe de Google qualifie ce phénomène de problème d'attribution de crédit, qui rend aujourd'hui difficile toute production fiable de publicités, de courts métrages ou de contenus narratifs à partir de générateurs IA. Avec des gains mesurés jusqu'à 30% de cohérence visuelle et 20% de cohérence narrative en plus sur des vidéos d'une à dix minutes, ces frameworks rapprochent la génération vidéo automatisée d'un usage professionnel réel, pour la publicité, le cinéma ou les contenus de marque, sans supervision humaine constante à chaque plan.

Sur les benchmarks, Co-Director atteint une moyenne de 81,4 sur GenAD-Bench et une note de 3,96 sur 5 en évaluation humaine, face à des références comme Veo 3.1, Kling 3.0 Omni, Wan 2.6 et MovieAgent. CANVAS améliore la continuité des arrière-plans de 21,6%, la cohérence des personnages de 9,6% et celle des accessoires de 7,6%, tandis que VQQA gagne 11,57 points sur T2V-CompBench et 8,43 points sur VBench2. Ces travaux s'inscrivent dans une compétition intense sur la génération vidéo longue et cohérente, où Google fait face à ByteDance et l'université de Nanyang, auteurs de StoryMem, à Show Lab et la National University of Singapore derrière MovieAgent, ainsi qu'à AutoStudio. Contrairement à ces approches fondées sur des chaînes de raisonnement fixes ou de simples banques de mémoire, Google mise sur une couche d'orchestration hiérarchique combinant plusieurs mécanismes de mémoire et de correction, une direction qui préfigure probablement les futurs outils de génération vidéo grand public.

VidéoVoir la vidéo de cet article sur YouTube →
Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

Notre lecture

Le vrai problème de la vidéo IA n'a jamais été la qualité d'un plan isolé, tu peux déjà sortir des images superbes. C'est de garder le même perso, la même casquette, le même décor sur dix plans d'affilée sans que tout parte en vrille au plan 4, ce que Google appelle un problème d'attribution de crédit. Les gains affichés sont sérieux, 30% de cohérence en plus sur des vidéos de dix minutes, mais empiler quatre frameworks d'agents sur Gemini et Veo, ça fait beaucoup de plomberie à faire tenir en prod avant de remplacer un monteur.

À lire ensuite

01Google Research présente SensorFM, un modèle de fondation santé portable entraîné sur mille milliards de minutes de données de capteurs47MarkTechPostRecherche 02Google présente Simula : un framework de raisonnement pour générer des datasets synthétiques contrôlables dans des domaines IA spécialisés46MarkTechPostRecherche 03Google AI Research présente PaperOrchestra, un cadre multi-agents pour la rédaction automatisée d'articles de recherche42MarkTechPostRecherche 
Dossier · GeminiSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.