Comment Condé Nast a construit un système de recherche vidéo multimodale avec Amazon Bedrock
Condé Nast, l'éditeur de Vogue, GQ, Vanity Fair et Wired, a mis en place avec l'AWS Generative AI Innovation Center (GenAIIC) un système de recherche vidéo multimodale qui ramène le temps de découverte de contenu de 250 minutes à moins de 2 minutes par tâche. Jusqu'ici, les équipes éditoriales parcouraient à la main une bibliothèque de plus de 140 000 vidéos en s'appuyant uniquement sur les titres et les descriptions. La solution repose sur Amazon Bedrock et Amazon OpenSearch Service. Elle lance des recherches sémantiques fondées sur l'intention, à travers les transcriptions, les éléments visuels et l'audio. Le modèle d'embedding Marengo de TwelveLabs a été retenu parce qu'il encode conjointement les signaux visuels, sonores et textuels. Il alimente les cinq fonctions du système, dont la recherche par intention, et la couche de requête renvoie des horodatages précis dans les vidéos.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
L'enjeu est d'abord économique. Dans un secteur où la rapidité de mise en ligne détermine les revenus captés, chaque tâche de recherche à 250 minutes représentait une perte mesurable de productivité dans toutes les marques du groupe. Les outils existants ne pouvaient pas regarder à l'intérieur des vidéos. Les équipes dépendaient donc de la mémoire de certains collaborateurs, ce qui créait des points de défaillance uniques dès qu'une personne clé était absente. De nombreux contenus dormaient en outre dans les archives, introuvables faute de mot-clé reliant leur titre ou leur description aux requêtes réelles des éditeurs. Les journalistes ne cherchent pas « yogatutorialmarch_2024.mp4 » mais « du contenu de yoga pour débutants avec des arrière-plans apaisants » ou « des moments en coulisses de la fashion week ». Une recherche par chaînes de caractères ne pouvait pas répondre à ce type de demande.
Deux contraintes ont dicté l'architecture. La recherche par mots-clés étant insuffisante, il fallait des vecteurs sémantiques couvrant toutes les modalités, ce que des métadonnées rédigées par des humains ne pouvaient pas offrir. Par ailleurs, la taille de la bibliothèque imposait de séparer la génération des embeddings, coûteuse en calcul, du service des résultats, qui exige une faible latence. Découpler ces deux plans permet à chacun de monter en charge, de tomber en panne et d'évoluer indépendamment, un choix jugé décisif pendant le traitement du stock existant. Bedrock donne accès à plusieurs modèles de fondation via une API unique, avec les contrôles de gouvernance d'AWS : IAM pour les accès, Amazon VPC pour l'isolation réseau et CloudTrail pour l'auditabilité. Condé Nast a ainsi pu adopter un modèle spécialisé sans exploiter sa propre infrastructure d'inférence. OpenSearch fournit pour sa part une recherche des k plus proches voisins gérée, avec réplication multi-zones et filtrage par métadonnées pour les requêtes hybrides, sans avoir à administrer le cluster sous-jacent.
Pas d'impact direct sur la France/UE