Aller au contenu principal
LLMs · Opinion ·

Gemini 3.5 Transcribe de Google convertit la parole en texte en 85 langues et corrige automatiquement les hésitations

Google a dévoilé Gemini 3.5 Transcribe, un nouveau modèle de reconnaissance vocale capable de convertir la parole en texte dans plus de 85 langues. L'outil se distingue par sa capacité à supprimer automatiquement les mots de remplissage et à corriger les hésitations ou lapsus de l'utilisateur en temps réel. En mode streaming, le modèle atteint un taux d'erreur de mots de seulement 4,0 %, un score qui témoigne d'une précision élevée pour ce type de transcription en direct. Surtout, Google annonce une latence réduite de 70 % par rapport à son prédécesseur, Chirp 3, ce qui rend les transcriptions quasi instantanées. Le modèle intègre également une fonction d'appel d'outils (function calling) lui permettant de déléguer certaines tâches à d'autres modèles de la famille Gemini.

1 min de lecturePertinence 56
Source

Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →

Cette avancée est significative pour toutes les applications reposant sur la transcription vocale en direct, des assistants virtuels aux outils de sous-titrage automatique, en passant par les logiciels de dictée professionnelle. Une latence divisée par plus de deux change concrètement l'expérience utilisateur : les échanges vocaux avec des assistants IA deviennent plus fluides et naturels, se rapprochant d'une conversation humaine. La correction automatique des hésitations et le nettoyage du texte parlé simplifient aussi le travail des développeurs qui exploitent ces transcriptions comme entrée pour d'autres systèmes, notamment via l'appel de fonctions vers d'autres modèles Gemini.

Ce lancement s'inscrit dans la compétition intense que se livrent les grands acteurs de l'IA sur la reconnaissance vocale multilingue, un domaine longtemps dominé par des solutions comme Whisper d'OpenAI. En misant sur la couverture linguistique, la vitesse et la précision simultanément, Google cherche à consolider sa position dans l'écosystème Gemini, où la voix devient une interface de plus en plus centrale pour interagir avec les modèles d'intelligence artificielle au quotidien.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Google lance Gemini 3.5 Live Translate, un modèle audio voix-à-voix en temps réel couvrant plus de 70 langues46MarkTechPostLLMs 02Google lance Gemini 3.7 Flash pour le code et les agents, avec 50% de reduction au lancement48VentureBeat AILLMs 03Google annonce Gemini 3.5 Live Translate pour la traduction vocale en temps réel55Ars Technica AILLMs 
Dossier · GeminiSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.