Aller au contenu principal
Création · Actu ·

Google lance Gemini 3.8 Flash TTS et Flash-Lite TTS, avec conception vocale par prompt

Google a mis en ligne Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux nouveaux modèles de synthèse vocale de sa famille Gemini Audio, présentés comme ses modèles audio les plus expressifs à ce jour. Les deux versions sont accessibles dès maintenant via l'API Gemini et Google AI Studio, sous les identifiants gemini-3.8-flash-tts et gemini-3.8-flash-lite-tts, sans poids ouverts pour un hébergement local ; l'accès entreprise via Gemini Enterprise est annoncé comme prochain. Flash TTS cible la direction créative et la conception de personnages pour le jeu vidéo, les livres audio immersifs, les podcasts et les médias interactifs, avec un contrôle fin sur le jeu d'acteur, le rythme et les changements de dialecte. Flash-Lite TTS vise la production à grande échelle et à coût réduit pour le doublage et les agents vocaux. Alors que la génération précédente proposait 30 voix originales, Flash TTS peut désormais créer des voix inédites à partir d'un simple prompt décrivant rôle, accent et caractéristiques, dans plus de 100 langues et dialectes, et les développeurs disposent d'une bibliothèque de plus de 2 000 voix prêtes à l'emploi, couvrant des variantes régionales comme l'espagnol mexicain, le français québécois ou l'anglais écossais. Sur le benchmark Hume AI Voice Design, Flash TTS se classe numéro un avec un score de 71,4.

2 min de lecturePertinence 55

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette montée en gamme s'inscrit dans une bataille industrielle autour de la voix synthétique, où la qualité d'interprétation et la diversité linguistique deviennent des critères de différenciation aussi importants que la puissance brute des modèles de texte. Pour les studios de jeux vidéo, les plateformes de podcasts ou les créateurs de livres audio, la possibilité de générer des voix sur mesure à partir d'un texte, avec des indications scéniques directement intégrées au script, réduit fortement le recours à des comédiens de doublage pour les productions de masse ou multilingues. Les fonctions de mise en scène vocale, comme les deux voix distinctes dans un dialogue généré à partir d'un seul script, les bruitages non verbaux tels que les rires ou soupirs, et les interjections d'écoute active, rapprochent la synthèse vocale d'une véritable direction d'acteur automatisée, ce qui ouvre la voie à des contenus audio produits à très grande échelle et à moindre coût.

Cette évolution s'accompagne toutefois d'un encadrement renforcé de la réplication vocale, un sujet sensible depuis l'essor des deepfakes audio. Google exige un échantillon de 30 secondes de la voix concernée, accompagné d'un enregistrement de consentement verbal du propriétaire de la voix, comparé à l'échantillon de référence. Chaque extrait généré par les modèles Gemini Audio embarque un filigrane invisible SynthID, et les voix répliquées portent en plus des identifiants de provenance C2PA. Une fonction de remixage vocal, permettant d'ajuster timbre, hauteur et accent d'une voix existante via un prompt, est annoncée comme à venir. Cette sortie place Google en concurrence directe avec les autres acteurs de la synthèse vocale générative, dans un secteur où les questions d'authentification et de traçabilité du contenu deviennent aussi centrales que la qualité audio elle-même.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Google AI lance Gemini 3.1 Flash TTS : un nouveau standard pour la voix IA expressive et contrôlable46MarkTechPostCréation 02Google lance Nano Banana 2 Lite pour la génération rapide d'images IA et Gemini Omni Flash pour la vidéo via API40The DecoderCréation 03Google lance Gemini Flash Omni sur son API, rendant la production vidéo en entreprise conversationnelle52VentureBeat AICréation 
Dossier · GeminiSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.