Google lance la compréhension vidéo à base d'agents pour Gemini Flash, réduisant les tokens vidéo de 88%
Google a lancé cette semaine la « compréhension vidéo agentique » sur ses modèles Gemini Flash, une nouvelle méthode de traitement vidéo disponible via l'API Gemini dans Google AI Studio et la Gemini Enterprise Agent Platform. Jusqu'ici, un modèle Gemini analysait une vidéo en extrayant systématiquement une image par seconde sur toute sa durée, que la question posée porte sur un résumé global ou un détail précis, comme le moment où un intervenant change de diapositive lors d'une conférence de 90 minutes. Avec le nouveau mode agentique, le modèle ne charge plus l'intégralité de la timeline mais navigue dedans, décidant lui-même quels segments regarder, à quelle fréquence d'images et via quelle modalité (image, audio ou transcription). Google annonce jusqu'à 88% de tokens en moins, jusqu'à 66% de coûts réduits et jusqu'à 7% de précision supplémentaire sur des benchmarks vidéo standards. La fonctionnalité est disponible sur Gemini 3.8, 3.7, 3.6 Flash et 3.5 Flash-Lite, s'active via un simple paramètre « processing: agentic » sur la partie vidéo de la requête, fonctionne aussi bien avec des fichiers uploadés qu'avec des URL YouTube publiques, et se facture au tarif standard de l'API sans surcoût.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Cette avancée s'attaque à ce qui était jusqu'à présent le point faible économique du traitement vidéo par les modèles de langage : contrairement au texte, la vidéo imposait un compromis pénalisant entre tout ingérer en contexte, au prix fort, ou découper la vidéo en amont au risque de perdre le passage pertinent. En laissant le modèle décider lui-même quoi charger, Google supprime le travail d'ingénierie que les développeurs devaient auparavant assembler manuellement pour obtenir un résultat similaire. Les gains se concentrent sur les contenus longs, des tutoriels de dix minutes aux enregistrements de plusieurs heures, ce qui ouvre la voie à des usages jusqu'ici trop coûteux : interrogation de conférences entières, recherche de moments précis dans des heures d'enregistrements de réunions ou de cours, analyse de contenus vidéo volumineux pour des entreprises ou des plateformes éducatives. Selon Google, Gemini 3.7 Flash avec ce mode agentique se positionne sur la frontière de Pareto coût-précision pour l'analyse vidéo parmi les modèles testés, un argument commercial direct face à la concurrence sur ce segment.
Techniquement, le mode agentique ajoute deux nouveaux types d'étapes dans la réponse de l'API, "processingcall" et "processingresult", qui permettent de suivre en temps réel les segments que le modèle choisit de charger, et distingue désormais les tokens de raisonnement (« thought tokens ») des tokens liés au chargement effectif de contenu (« tool-use tokens »). Il reste toutefois possible de mélanger les modes au sein d'une même requête, en gardant le traitement statique classique pour les clips courts, où Google recommande toujours cette approche, la précision image par image restant supérieure pour les vidéos de moins de cinq minutes. Cette évolution s'inscrit dans une course plus large entre grands fournisseurs de modèles, dont OpenAI et Google, pour rendre les modalités longues (vidéo, audio, documents volumineux) économiquement viables à grande échelle, un enjeu clé pour les usages professionnels comme l'analyse de réunions, la surveillance de contenus ou l'indexation de bibliothèques multimédias. Aucun poids ouvert n'est proposé : la fonctionnalité reste exclusivement accessible via l'API hébergée de Google, ce qui maintient les entreprises dépendantes de son infrastructure cloud pour en bénéficier.
Les entreprises et plateformes éducatives européennes utilisant l'API Gemini pourraient réduire leurs couts d'analyse vidéo, mais aucun acteur ou cadre réglementaire français ou européen n'est directement concerne.