Microsoft AI lance MAI-Transcribe-2-Streaming, modèle de transcription vocale en temps réel classé n°1 par Artificial Analysis
Microsoft AI a lancé le 1er octobre 2026 MAI-Transcribe-2-Streaming, son premier modèle de reconnaissance vocale en flux continu, en même temps que deux modèles de synthèse vocale, MAI-Voice-2.1 et MAI-Voice-2.1-Flash. Version temps réel de MAI-Transcribe-2, sorti en septembre en mode batch, il transcrit 60 langues avec détection automatique et continue de la langue. Il émet ses premières hypothèses, dites « partielles », un peu plus de 100 ms après réception de l'audio, les révise à mesure que le contexte arrive, puis valide une transcription finale stable. Selon l'indice AA-WER Streaming d'Artificial Analysis, qui repose sur environ 8 heures d'audio (AA-AgentTalk à 50 %, VoxPopuli et Earnings22 à 25 % chacun), le modèle se classe premier sur 38. Il affiche 2,5 % de taux d'erreur de mots (WER) pour la transcription finale, 0,13 s après la fin de la parole, et le même 2,5 % pour la première transcription partielle, à 0,12 s. Il devance Grok Voice Transcribe 2.0 de xAI (2,7 % et 0,49 s) et Muse Voice Transcribe de Meta (3,1 % et 0,16 s). Cartesia Ink-2 livre ses transcriptions finales en 0,07 s, mais avec 4,0 % d'erreurs. Microsoft affirme aussi, d'après ses tests internes, que les mots apparaissent deux fois plus vite qu'avec son concurrent le plus proche.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Également couvert par The Decoder.
L'intérêt tient à la précision des premières partielles, identique à celle du résultat final. Un agent vocal peut ainsi raisonner ou appeler des outils avant même que l'utilisateur ait fini sa phrase, ce qui réduit la latence perçue, décisive pour les agents conversationnels, les sous-titres en direct et la dictée. Le prix est en revanche plus élevé que chez certains rivaux : 0,54 dollar par heure d'audio, un tarif introductif valable jusqu'à fin 2026 (9 dollars pour 1 000 minutes selon la normalisation d'Artificial Analysis). C'est plus que xAI (0,20 dollar) et Meta (0,18 dollar), et à peu près l'équivalent de l'estimation pour Google (environ 0,54 dollar). Le modèle batch coûte 0,10 dollar l'heure. Les développeurs peuvent l'intégrer via une API Realtime compatible avec les WebSockets d'OpenAI, ou via le SDK Azure Speech, qui gère connexions, relances et flux audio. Il est aussi accessible dans le MAI Playground, via Vercel et Azure Voice Live, la prise en charge de LiveKit étant annoncée. Aucun modèle de la comparaison n'est en poids ouverts, et Microsoft ne précise pas si la séparation des locuteurs fonctionne en streaming.
Ce lancement s'inscrit dans une course rapide à la voix temps réel, où les grands acteurs ont multiplié les sorties en quelques semaines : Gemini 3.5 Transcribe Live de Google le 26 août (4,0 % de WER en streaming), Muse Voice Transcribe de Meta Superintelligence Labs le 1er septembre, puis Grok Voice Transcribe 2.0 de xAI le 18 septembre. Microsoft complète son offre pour boucler une chaîne vocale complète : MAI-Voice-2.1-Flash génère 45 secondes d'audio avec 150 ms de latence de bout en bout, pour 15 dollars par million de caractères, tandis que MAI-Voice-2.1 couvre 23 langues et 26 variantes régionales pour 22 dollars par million de caractères. Microsoft se positionne sur la frontière de Pareto entre précision et latence, mais la tarification et la concurrence des offres moins chères diront si cette avance se traduit en parts de marché une fois la période introductive terminée.
Pas d'impact direct sur la France/UE