Google lance des modèles Flash TTS pour créer des voix IA sur mesure à partir de descriptions textuelles
Google déploie deux nouveaux modèles de synthèse vocale, Gemini 3.8 Flash TTS et Flash-Lite TTS, capables de gérer plus de 100 langues. Le modèle Flash TTS introduit une fonctionnalité inédite : la création de voix entièrement nouvelles à partir de simples descriptions textuelles, permettant de définir un timbre ou un style vocal sans partir d'un enregistrement existant. Les deux modèles permettent également d'ajouter des indications de jeu, ou "stage directions", ligne par ligne, pour préciser le ton, l'émotion ou le rythme de chaque réplique, ainsi que de générer des dialogues à deux voix à partir d'un seul script. Une fonction de clonage vocal complète l'offre, capable de construire un profil de voix à partir d'un échantillon audio de seulement 30 secondes.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Cette avancée renforce la position de Google dans la course aux outils de génération audio par IA, un secteur de plus en plus disputé face à des acteurs comme ElevenLabs ou OpenAI. La possibilité de concevoir une voix sur la seule base d'une description textuelle simplifie considérablement le travail des développeurs, créateurs de contenu et studios qui doivent produire des voix sur mesure sans recourir à des acteurs vocaux professionnels. Le clonage rapide à partir de 30 secondes d'audio abaisse encore la barrière technique et financière, ouvrant la personnalisation vocale à un public plus large, des podcasteurs indépendants aux entreprises développant des assistants virtuels.
Ces modèles s'inscrivent dans une tendance de fond où les grands éditeurs de modèles de langage étendent leurs capacités au-delà du texte pur pour couvrir la voix, avec des implications directes sur les métiers du doublage, de la production audio et de l'accessibilité numérique. La possibilité de scripter des dialogues à plusieurs voix directement dans un modèle de langage ouvre la voie à des usages comme les livres audio automatisés, les assistants conversationnels multilingues ou la localisation rapide de contenus. Reste à voir comment Google encadrera les usages de ces outils, notamment sur les questions de consentement et de détection des voix synthétiques clonées.
Ces outils seront accessibles aux créateurs et entreprises européens et pourraient impacter les métiers du doublage et de la production audio en France, sans annonce de réglementation locale spécifique.