Transcription audio : Meta lance une IA qui comprend plusieurs voix et langues en temps réel
Meta a dévoilé le 1er septembre 2026 Muse Voice Transcribe, son premier modèle de transcription audio capable de fonctionner en temps réel. Développé par la division MSL de l'entreprise, ce système se distingue par sa capacité à suivre des conversations impliquant plusieurs locuteurs sans qu'ils aient besoin de parler chacun leur tour, et à gérer des changements de langue en cours de phrase, un phénomène appelé alternance codique, fréquent dans les échanges bilingues. Entraîné sur plus de 70 langues, dont 25 officiellement validées au lancement, le modèle peut selon Meta tenir des sessions d'une heure avec plus de 20 locuteurs différents. Il intègre nativement la diarisation (identification des intervenants) et un système de délai adaptatif qui accélère le traitement des mots simples et ralentit sur les termes ambigus. Mark Zuckerberg, revenu sur X après trois ans d'absence, a personnellement présenté une démonstration du modèle le 1er septembre, tandis qu'Alexandr Wang a précisé que l'outil alimente déjà la dictée dans l'application Meta desktop et dans Muse Code, avec un accès via l'API Model de Meta facturé 3 dollars pour 1 000 minutes d'audio.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de Le Big Data. Lire l'article original →
Cette annonce marque une avancée notable pour les usages professionnels et grand public de la transcription automatique, notamment pour les réunions multilingues, les équipes internationales ou les créateurs de contenu jonglant entre plusieurs langues. La capacité à suivre nativement des conversations à intervenants multiples sans étape de post-traitement séparée simplifie des flux de travail jusqu'ici fragmentés, où diarisation et transcription reposaient souvent sur des outils distincts. Pour les développeurs, l'intégration directe via API à un tarif relativement accessible ouvre la voie à de nouvelles applications de dictée vocale, de sous-titrage en direct ou d'assistance en temps réel, au-delà du seul écosystème Meta, puisque le modèle peut déjà alimenter des fonctions vocales dans des applications tierces via Meta AI sur Mac.
Ce lancement s'inscrit dans une compétition intense entre grands acteurs de l'IA sur le segment de la transcription audio avancée. Muse Voice Transcribe arrive en effet moins d'une semaine après Gemini 3.5 Transcribe, le modèle concurrent présenté par Google, qui prévoit de son côté une intégration à Android et à Chrome, un avantage de distribution que Meta n'a pas encore annoncé pour ses propres produits phares comme Instagram ou WhatsApp. Pour l'instant, Meta mise sur une diffusion progressive via son application Meta AI sur Mac, récemment lancée, et sur les outils destinés aux développeurs. Cette course entre Meta et Google illustre l'intensification de la bataille autour des modèles audio en temps réel, un terrain où la qualité de la reconnaissance multilingue et multi-locuteurs devient un critère de différenciation clé, avec des retombées attendues sur les assistants vocaux, les outils de productivité et les services de sous-titrage automatique dans les mois à venir.
Pas d'impact direct sur la France/UE