Aller au contenu principal
Outils · Outil ·

Transcription avec identification des locuteurs via WhisperX sur SageMaker AI

Les équipes AWS ont détaillé le déploiement d'un nouveau conteneur d'apprentissage profond (Deep Learning Container, DLC) baptisé WhisperX, conçu pour la transcription audio avec identification des locuteurs sur Amazon SageMaker AI. WhisperX s'appuie sur Whisper, le modèle de reconnaissance vocale open source d'OpenAI, en y ajoutant trois capacités : l'inférence par lots pour accélérer le traitement, un alignement forcé via wav2vec2 pour produire des horodatages précis au mot près, et une diarisation qui attribue chaque segment de parole à un locuteur identifié. Le conteneur, prêt à l'emploi sur GPU, embarque directement Whisper, les modèles d'alignement et les poids de diarisation, sans nécessiter de jeton Hugging Face. Il respecte le contrat de service standard de SageMaker AI : port 8080, requêtes POST sur /invocations, vérifications de santé via GET /ping, format multipart/form-data avec des champs optionnels comme la langue, l'activation de la diarisation ou le format de sortie (json, verbose_json, SRT ou VTT). Deux modes de déploiement sont proposés : un point de terminaison en temps réel, limité à 60 secondes de réponse et réservé aux clips courts et interactifs, et un point de terminaison asynchrone recommandé pour l'audio long nécessitant plus de temps de calcul. Cette publication s'inscrit dans une série de quatre articles sur les DLC multimodaux d'AWS, aux côtés de vLLM-Omni pour la synthèse vocale, vLLM-Omni pour l'image et la vidéo, et llama.cpp.

2 min de lecturePertinence 47

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette avancée répond à un problème concret rencontré par toute équipe travaillant sur l'audio parlé, des centres d'appels aux réunions d'entreprise en passant par les podcasts et les dépositions judiciaires : la transcription vocale classique produit des horodatages décalés de plusieurs secondes et ne sait pas fiablement dire qui a parlé. Ces lacunes compliquent la recherche dans les transcripts, le sous-titrage, l'anonymisation ou l'analyse à grande échelle, un label de locuteur manquant pouvant par exemple invalider une revue de conformité. Grâce à WhisperX, les centres d'appels peuvent mesurer le temps de parole, vérifier le respect des scripts et mener des analyses de sentiment, tandis que les réunions deviennent des notes consultables. Les équipes médias et e-learning génèrent des sous-titres précis pour de vastes bibliothèques de contenu, et les secteurs réglementés comme la santé, le droit ou la finance disposent de transcriptions avec locuteurs identifiés utilisables pour des audits ou des procédures de découverte légale.

Cette initiative s'inscrit dans la stratégie plus large d'AWS de proposer des conteneurs spécialisés et préconfigurés pour des usages d'intelligence artificielle multimodale, évitant aux équipes de construire elles-mêmes des images personnalisées pour chaque cas d'usage. WhisperX, projet open source distinct du Whisper original d'OpenAI, a été conçu spécifiquement pour combler l'écart entre un modèle de recherche performant et les exigences de production, où l'horodatage précis, l'identification des locuteurs et la vitesse de traitement comptent autant que la qualité brute de la transcription. AWS détaille également, dans cette même série de publications, les aspects opérationnels critiques pour une mise en production réussie : le choix de l'image système GPU, le paramétrage du scaling automatique, la configuration du stockage Amazon S3 et les leviers de maîtrise des coûts, des éléments qui conditionnent l'adoption de cette technologie à grande échelle par les entreprises.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Vérification en temps réel des images dentaires avec Amazon SageMaker AI chez Henry Schein One35AWS ML BlogOutils 02Tutoriel pratique : ASR avec identification du locuteur, TTS en temps réel et pipelines speech-to-speech avec Microsoft VibeVoice39MarkTechPostOutils 03Déploiement de modèles quantifiés sur Amazon SageMaker AI avec Unsloth39AWS ML BlogOutils 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.