Recherche vidéo et image dans Amazon Bedrock Knowledge Base avec Marengo 3.0
Amazon Web Services a annoncé la disponibilité générale de TwelveLabs Marengo Embed 3.0 comme modèle d'embedding dans Amazon Bedrock Knowledge Bases, son service managé de recherche augmentée par récupération. Ce modèle multimodal encode conjointement vidéo, audio, image et texte dans un espace vectoriel compact de 512 dimensions. Amazon Bedrock Knowledge Bases prend en charge les formats vidéo MP4 et MOV, les images JPEG et PNG, ainsi que les pistes audio, avec des connecteurs natifs vers Amazon S3, SharePoint et Confluence. AWS a illustré la fonctionnalité avec un cas pratique portant sur un extrait de dix minutes de la finale de la Coupe du monde de football 2022, ingéré dans une base de connaissances puis interrogé en langage naturel, par exemple pour retrouver le penalty de la seconde mi-temps. Le paramétrage par défaut segmente l'audio et la vidéo par tranches de quatre secondes, et l'ensemble du traitement, extraction d'images, transcription, génération d'embeddings et indexation vectorielle, s'exécute automatiquement dès le dépôt des fichiers dans un bucket S3, sans prétraitement manuel de la part de l'utilisateur.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Cette annonce change concrètement la donne pour les équipes qui exploitent de gros volumes de contenus vidéo, médias, diffuseurs sportifs, plateformes éducatives, sécurité et retail, qui devaient jusqu'ici assembler elles-mêmes une chaîne complexe combinant services de transcription, extraction d'images, modèles d'embedding, bases vectorielles et logique de synchronisation. En intégrant Marengo Embed 3.0 directement dans Bedrock Knowledge Bases aux côtés du modèle Amazon Titan Text proposé par défaut, AWS transforme la recherche sémantique dans la vidéo en une fonctionnalité clé en main, accessible via la console sans expertise poussée en ingénierie de données. Pour l'analyse sportive, cela permet de localiser un instant précis dans des heures de rushes sans visionnage manuel ; pour la sécurité, de retrouver un évènement dans de longues heures de vidéosurveillance ; pour l'e-commerce, d'indexer des catalogues de vidéos produits par leur contenu visuel réel plutôt que par leurs seules métadonnées textuelles.
Cette intégration s'inscrit dans l'élargissement plus large d'Amazon Bedrock Knowledge Bases, initialement pensé pour la recherche documentaire textuelle, vers des cas d'usage multimodaux, à mesure que les entreprises accumulent des volumes croissants de contenus vidéo largement sous-exploités faute d'outils de recherche adaptés. TwelveLabs, spécialiste de l'intelligence vidéo dont la gamme de modèles Marengo sert déjà à l'indexation et à la recherche multimodale, devient ainsi un partenaire d'embedding proposé nativement sur l'infrastructure cloud d'AWS, aux côtés des modèles maison comme Titan. Cette annonce illustre la concurrence croissante entre fournisseurs cloud pour équiper les entreprises d'outils de RAG capables de traiter au-delà du texte, alors que la demande explose pour des systèmes interrogeant nativement l'image, le son et la vidéo. Les prochaines étapes attendues concernent l'élargissement de la disponibilité régionale du modèle, ainsi que son association avec des modèles de langage capables de générer des réponses à partir des contenus retrouvés, pour transformer non seulement la recherche mais aussi l'exploitation analytique de ces archives vidéo.
Pas d'impact direct sur la France/UE