OutilsMarkTechPost · 8 juin 2026, 11:56· 2 min de lecture

Microsoft AI lance MAI-Transcribe-1.5 : 2,4 % de taux d'erreur et transcriptions longues jusqu'à 5x plus rapides

Microsoft a dévoilé la semaine dernière MAI-Transcribe-1.5, la deuxième génération de son modèle de reconnaissance vocale développé en interne. Ce système de transcription automatique prend en charge 43 langues, contre 25 pour la version précédente, avec dix-huit nouvelles langues ajoutées sans dégradation des performances, dont le bengali, le tamoul, le télougou côté Asie du Sud, et l'ukrainien, le grec ou le catalan côté Europe. Sur le benchmark multilingue FLEURS, Microsoft revendique la première place parmi les modèles du marché. Sur le classement Artificial Analysis, le modèle affiche un taux d'erreur par mot (WER) de 2,4 %, ce qui le place troisième dans un champ concurrentiel. En vitesse, il est capable de transcrire une heure d'audio en moins de 15 secondes et se révèle jusqu'à 5 fois plus rapide que des modèles comparables comme Gemini 3.1, Scribe v2 ou GPT-4o-Transcribe sur des fichiers longs. MAI-Transcribe-1.5 est intégré à Copilot, Teams, GitHub et Dynamics 365 Contact Centre, et disponible via Foundry, la plateforme de modèles de Microsoft.

La fonctionnalité qui mérite le plus d'attention est le « keyword biasing », ou biais par entités nommées. Les transcripteurs génériques trébuchent régulièrement sur les vocabulaires métiers, noms propres, termes médicaux, acronymes internes, précisément là où les erreurs coûtent le plus cher. MAI-Transcribe-1.5 permet de fournir jusqu'à 200 mots-clés personnalisés que le modèle prend en compte lors de la transcription, sans forcer mécaniquement les correspondances mais en s'appuyant sur le contexte. Résultat : une réduction de 30 % du WER sur FLEURS lorsque ce mécanisme est activé. Sur les réunions d'entreprise, dans les centres d'appels ou les environnements de santé, cette capacité change concrètement la qualité des transcriptions produites. La détection automatique de la langue parlée, sans paramétrage manuel, complète l'ensemble pour des flux d'entrée non structurés.

La course aux modèles de transcription s'est considérablement intensifiée depuis que OpenAI a popularisé Whisper et que des acteurs comme AssemblyAI ou ElevenLabs ont investi le segment entreprise. Microsoft, fort de son infrastructure Azure et de son intégration profonde dans les outils de productivité, cherche à imposer une solution maison plutôt que de dépendre de fournisseurs tiers. Le passage de 25 à 43 langues, avec une couverture renforcée des langues d'Asie du Sud, reflète aussi une ambition de croissance sur des marchés où l'anglais n'est pas dominant. Pour les équipes qui traitent des archives audio volumineuses en batch, médias, justice, santé, support client, un facteur de vitesse de 5x sur les fichiers longs n'est pas anecdotique : il réduit directement les coûts d'infrastructure et les délais de traitement à grande échelle.

Impact France/UE

Les entreprises européennes intégrées à l'écosystème Microsoft (Teams, Dynamics 365) bénéficieront directement de ces gains de précision et de vitesse, avec un support renforcé des langues européennes comme le grec, le catalan et l'ukrainien.

Dans nos dossiers

Microsoft Azure OpenAI Gemini

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1MarkTechPost

Gradium lance stt-translate et s2s-translate, des modèles de traduction vocale en temps réel plus précis et plus rapides que gpt-realtime-translate

Gradium a lancé ce jeudi deux modèles de traduction vocale en temps réel, baptisés stt-translate et s2s-translate, qui s'attaquent directement aux offres de Google et d'OpenAI sur ce marché en pleine expansion. Les deux modèles couvrent cinq langues, anglais, français, allemand, espagnol et portugais, soit vingt paires de traduction dans toutes les directions. stt-translate convertit la parole d'une langue en texte dans une autre en un seul passage, sans transcription intermédiaire, en s'appuyant sur le cadre Hibiki-Zero et un entraînement par apprentissage par renforcement optimisant simultanément la précision et la latence. s2s-translate va plus loin en produisant directement de l'audio traduit depuis de l'audio source, en enchaînant stt-translate avec un modèle TTS de Gradium au sein d'un service unique accessible via WebSocket duplex. La latence moyenne annoncée est de 3,0 secondes, et les flux audio sont gérés en PCM 24 kHz en entrée et 48 kHz en sortie, avec support WAV, Opus, mu-law et A-law. Sur le plan des performances, Gradium affirme surpasser gpt-realtime-translate d'OpenAI sur le score BLEU, la métrique historique de traduction automatique mesurant la fidélité lexicale, tout en étant comparable sur MetricX, le système d'évaluation neuronal de Google qui juge la qualité sémantique selon des critères proches du jugement humain. Face à gemini-3.5-live-translate de Google, Gradium l'emporte sur les deux métriques. La latence de 3,0 secondes se situe devant OpenAI (3,6 s) mais légèrement derrière Gemini (2,9 s), un écart marginal. La différenciation la plus concrète réside dans la flexibilité vocale : Gradium permet de choisir une voix dans un catalogue ou de cloner sa propre voix pour la sortie audio, une fonctionnalité absente chez gpt-realtime-translate et non précisée chez Gemini. Ces modèles s'inscrivent dans une course accélérée à la traduction vocale temps réel, portée par des cas d'usage comme les réunions internationales, le service client multilingue et l'accessibilité. L'approche de Gradium, fusionner transcription et traduction en un seul modèle plutôt qu'enchaîner trois systèmes distincts, réduit la complexité d'intégration et les points de latence. C'est précisément le type d'architecture que les développeurs cherchent pour éviter de gérer plusieurs API et connexions en parallèle. En proposant ces modèles via une interface WebSocket unique avec streaming des résultats, Gradium vise les équipes produit qui construisent des expériences vocales multilingues sans vouloir assembler elles-mêmes une pipeline STT-MT-TTS. Le lancement positionne la startup face à deux des acteurs les plus capitalisés du secteur, avec des résultats de benchmarks qui, s'ils se confirment en production, pourraient en faire un concurrent sérieux sur ce segment.

UELes développeurs européens construisant des applications vocales multilingues peuvent intégrer directement ces modèles via WebSocket, le français et l'allemand étant inclus parmi les cinq langues supportées dès le lancement.

OutilsOpinion

1 source

2MarkTechPost

NVIDIA publie Nemotron 3.5 ASR : un modèle de transcription temps réel en 40 langues, optimisé pour le streaming

NVIDIA a lancé Nemotron 3.5 ASR, un modèle de reconnaissance vocale automatique en streaming capable de transcrire 40 variantes linguistiques en temps réel depuis un seul checkpoint de 600 millions de paramètres. Publié en open weights sur Hugging Face sous licence OpenMDW-1.1, le modèle repose sur une architecture Cache-Aware FastConformer-RNNT qui intègre nativement la ponctuation et les majuscules, sans étape de post-traitement supplémentaire. Il couvre des langues aussi variées que l'anglais, le français, l'espagnol, l'arabe, le japonais, le coréen, le mandarin, le hindi ou le thaï, avec un mode de détection automatique de la langue (targetlang=auto) permettant de traiter des flux audio multilingues sans composant externe. La latence est configurable à l'inférence via un paramètre unique (attcontext_size), offrant des modes allant de 80 ms ultra-basse latence jusqu'à 1,12 seconde pour une précision maximale, sans nécessiter de réentraînement. Ce modèle s'attaque directement à l'un des principaux obstacles au déploiement industriel de la transcription vocale en temps réel : la complexité opérationnelle. Jusqu'ici, couvrir plusieurs langues imposait de maintenir autant de modèles distincts, de gérer des pipelines de détection de langue séparés, et de choisir entre latence et précision via des checkpoints différents. Nemotron 3.5 ASR supprime ces trois frictions en un seul déploiement. Pour les équipes produit qui développent des outils de sous-titrage en direct, des assistants vocaux multilingues ou des plateformes de transcription à grande échelle, cela représente une réduction significative de l'infrastructure et du coût d'exploitation. Le fait qu'il soit disponible gratuitement en self-hosting change également la donne face aux services cloud payants comme Nova-3 de Deepgram (~0,0077 $/min) ou Scribe v2 Realtime d'ElevenLabs (~0,28 $/heure). NVIDIA opère depuis plusieurs années une montée en puissance dans le domaine des modèles de traitement du langage parlé, notamment via sa division Nemotron Speech. Ce lancement s'inscrit dans une compétition intense entre acteurs open source et solutions propriétaires : Whisper large-v3 d'OpenAI reste la référence en transcription batch (99 langues, MIT), mais n'est pas natif au streaming ; AssemblyAI (Universal-3 Pro) et Speechmatics se positionnent sur le streaming temps réel, mais avec des couvertures linguistiques plus étroites ou des API fermées. NVIDIA entre dans ce segment avec un modèle à la fois performant, polyglotte et librement hébergeable, ce qui pourrait accélérer son adoption dans les environnements souverains ou à contraintes de confidentialité forte. La prochaine étape probable sera l'intégration dans les pipelines NIM (NVIDIA Inference Microservices) pour simplifier encore le déploiement en production.

UELe modèle couvre explicitement le français parmi ses 40 variantes linguistiques, et son mode self-hosting gratuit facilite le déploiement dans des environnements européens soumis aux exigences de souveraineté des données, réduisant la dépendance aux API cloud américaines payantes.

💬 Un seul checkpoint pour 40 langues en streaming, ponctuation et majuscules intégrées nativement : c'est le genre de truc qu'on attendait depuis 2 ans. Couvrir plusieurs langues en temps réel imposait jusqu'ici de gérer autant de modèles distincts plus un détecteur de langue en amont, bref une usine à gaz. Et là, en self-hosting gratuit face à Deepgram à 0,0077 $ la minute, les équipes qui hésitaient vont vite trancher.

OutilsOpinion

1 source

3Blog du Modérateur

Transcription, voix, image : Microsoft déploie ses modèles maison dans Foundry

Microsoft a intégré trois nouveaux modèles propriétaires à sa plateforme Azure AI Foundry : un modèle de transcription audio, un modèle de synthèse vocale et un modèle de traitement d'image. Ces outils, développés en interne par les équipes de recherche de la firme de Redmond, sont désormais disponibles pour les développeurs et entreprises via l'interface Foundry, la plateforme centralisée de Microsoft pour déployer et tester des modèles d'IA. Cette initiative marque une étape significative dans la stratégie de diversification de Microsoft, qui cherche à réduire sa dépendance technologique à l'égard d'OpenAI, son partenaire de référence depuis l'investissement massif de 13 milliards de dollars. En proposant ses propres modèles spécialisés sur des tâches précises comme la transcription ou la reconnaissance visuelle, Microsoft offre aux entreprises clientes des alternatives intégrées à l'écosystème Azure, potentiellement moins coûteuses et plus facilement personnalisables. Cette évolution s'inscrit dans une tendance de fond : les grandes plateformes cloud cherchent toutes à maîtriser leur chaîne de valeur IA de bout en bout. Google avec Gemini, Amazon avec Titan et Nova, et désormais Microsoft avec ses modèles maison renforcent chacun leurs capacités propriétaires, réduisant le pouvoir de négociation des fournisseurs tiers et consolidant leur emprise sur les entreprises qui bâtissent sur leur infrastructure.

UELes entreprises européennes sur Azure AI Foundry disposent désormais de modèles propriétaires Microsoft pour la transcription, la synthèse vocale et l'image, comme alternatives intégrées aux solutions OpenAI.

OutilsOutil

1 source

4MarkTechPost

IBM publie deux modèles Granite Speech 4.1 2B : ASR autorégressif avec traduction et édition non-autorégressive rapide

IBM a mis en ligne deux nouveaux modèles de reconnaissance vocale open source, Granite Speech 4.1 2B et Granite Speech 4.1 2B-NAR, disponibles sur Hugging Face sous licence Apache 2.0. Ces modèles compacts d'environ 2 milliards de paramètres visent à résoudre un problème classique des équipes IA en entreprise : les systèmes de transcription automatique performants exigent généralement des ressources de calcul importantes, tandis que les solutions légères sacrifient la précision. Les deux modèles partagent une architecture en trois composants, un encodeur audio, un adaptateur de modalité et un modèle de langage, mais divergent sur le mécanisme de décodage. Le modèle standard prend en charge la transcription multilingue et la traduction bidirectionnelle en anglais, français, allemand, espagnol, portugais et japonais. La variante NAR (non-autorégressif) se concentre uniquement sur la transcription, sans le japonais ni la traduction, mais avec des temps de réponse nettement plus rapides. IBM a également lancé discrètement une troisième variante, Granite Speech 4.1 2B-Plus, qui ajoute l'attribution par locuteur et des horodatages au niveau du mot. Sur le leaderboard Open ASR d'avril 2026, le modèle principal affiche un taux d'erreur sur les mots (WER) moyen de 5,33%, avec 1,33% sur le benchmark LibriSpeech clean, des résultats compétitifs pour un modèle de cette taille. L'intérêt concret de ces modèles réside dans leur efficacité à l'inférence. La version NAR utilise un modèle de langage bidirectionnel de 1 milliard de paramètres qui corrige la transcription en une seule passe, sans générer les tokens un à un comme le font les architectures autorégressives classiques. Cela réduit considérablement la latence, ce qui en fait une option sérieuse pour les applications temps réel, centres d'appels, sous-titrage en direct, assistants vocaux embarqués. Pour les équipes qui ont besoin de traduction ou de transcription en japonais, le modèle autorégressif standard reste nécessaire, mais la version NAR offre un avantage décisif dès que la vitesse prime sur la polyvalence. IBM s'inscrit ici dans une tendance de fond : la course aux modèles de reconnaissance vocale ouverts et compétitifs s'est intensifiée depuis qu'OpenAI a publié Whisper en 2022. Plusieurs acteurs, dont Meta et Nvidia, ont depuis proposé leurs propres alternatives, chacun cherchant à optimiser le rapport précision/coût computationnel. La famille Granite, déjà connue pour ses modèles de langage orientés entreprise, s'étend désormais à l'audio avec une approche modulaire et documentée, ce qui facilite l'intégration dans des pipelines existants. La publication sous licence Apache 2.0 permet un usage commercial sans restriction, ce qui devrait accélérer l'adoption dans des secteurs comme la santé, la finance ou les médias, où la transcription précise et souveraine est un enjeu stratégique.

UELes entreprises européennes des secteurs santé, finance et médias peuvent déployer ces modèles en souveraineté complète grâce à la licence Apache 2.0, avec un support natif du français pour la transcription et la traduction.

OutilsOpinion

1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic