Aller au contenu principal
Création · Actu ·

Google lance des modèles Flash TTS pour créer des voix IA sur mesure à partir de descriptions textuelles

Google déploie deux nouveaux modèles de synthèse vocale, Gemini 3.8 Flash TTS et Flash-Lite TTS, capables de gérer plus de 100 langues. Le modèle Flash TTS introduit une fonctionnalité inédite : la création de voix entièrement nouvelles à partir de simples descriptions textuelles, permettant de définir un timbre ou un style vocal sans partir d'un enregistrement existant. Les deux modèles permettent également d'ajouter des indications de jeu, ou "stage directions", ligne par ligne, pour préciser le ton, l'émotion ou le rythme de chaque réplique, ainsi que de générer des dialogues à deux voix à partir d'un seul script. Une fonction de clonage vocal complète l'offre, capable de construire un profil de voix à partir d'un échantillon audio de seulement 30 secondes.

1 min de lecturePertinence 52

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →

Cette avancée renforce la position de Google dans la course aux outils de génération audio par IA, un secteur de plus en plus disputé face à des acteurs comme ElevenLabs ou OpenAI. La possibilité de concevoir une voix sur la seule base d'une description textuelle simplifie considérablement le travail des développeurs, créateurs de contenu et studios qui doivent produire des voix sur mesure sans recourir à des acteurs vocaux professionnels. Le clonage rapide à partir de 30 secondes d'audio abaisse encore la barrière technique et financière, ouvrant la personnalisation vocale à un public plus large, des podcasteurs indépendants aux entreprises développant des assistants virtuels.

Ces modèles s'inscrivent dans une tendance de fond où les grands éditeurs de modèles de langage étendent leurs capacités au-delà du texte pur pour couvrir la voix, avec des implications directes sur les métiers du doublage, de la production audio et de l'accessibilité numérique. La possibilité de scripter des dialogues à plusieurs voix directement dans un modèle de langage ouvre la voie à des usages comme les livres audio automatisés, les assistants conversationnels multilingues ou la localisation rapide de contenus. Reste à voir comment Google encadrera les usages de ces outils, notamment sur les questions de consentement et de détection des voix synthétiques clonées.

Impact France / UEChamp produit par Le Fil IA

Ces outils seront accessibles aux créateurs et entreprises européens et pourraient impacter les métiers du doublage et de la production audio en France, sans annonce de réglementation locale spécifique.

À lire ensuite

01Google AI lance Gemini 3.1 Flash TTS : un nouveau standard pour la voix IA expressive et contrôlable46MarkTechPostCréation 02Cette IA vous permet de créer des jeux vidéo à partir de Google Maps, mais il y a une condition47Presse-citronCréation 03Gemini Omni 1.1 Flash de Google rend la génération de vidéos par IA moins chère et plus flexible37The DecoderCréation 
Dossier · OpenAISuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.