Aller au contenu principal
Création · Actu ·

Gradium AI lance un nouveau modèle TTS par défaut : 81 % de réussite sur cas difficiles, 216 ms avant premier audio

Gradium AI a annoncé le 31 août 2026 le déploiement de son nouveau modèle de synthèse vocale (text-to-speech) comme option par défaut sur l'ensemble de son API et de sa plateforme Studio. La société affiche un taux de réussite de 81,0 % évalué par des locuteurs natifs sur un ensemble de 500 phrases jugées difficiles, couvrant cinq langues (anglais, allemand, français, espagnol, portugais). Ce score dépasse celui de Cartesia Sonic 3.6 (75,1 %), ElevenLabs v3 Conversational (65,4 %), Fish Audio S2.1 Pro (49,5 %) et Inworld TTS 1.5 Max (46,5 %). Côté latence, le modèle atteint un temps avant premier son de 216 millisecondes en médiane (P50) sur le benchmark de Coval, soit 170 ms de moins que la version précédente, avec un écart interquartile de seulement 30 ms sur 480 tests, la variabilité la plus faible des cinq modèles comparés. La bascule s'est faite sans migration requise : les voix existantes, y compris les clones personnalisés, continuent de fonctionner sans modification.

2 min de lecturePertinence 49

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette annonce cible un point de friction bien identifié des agents vocaux automatisés : la restitution fiable des éléments critiques d'un appel, comme un numéro de commande, des chiffres de rappel ou une adresse email dictée par un interlocuteur. Une seule syllabe ou un chiffre mal prononcé peut faire échouer toute une interaction avec un client, ce qui explique pourquoi Gradium a construit une méthodologie d'évaluation stricte : une phrase n'est validée que si un évaluateur natif entend chaque élément prononcé correctement et intégralement. Pour les entreprises qui déploient des centres d'appels automatisés, des assistants de support ou des agents de prise de commande, ce genre d'amélioration a un impact direct sur le taux de résolution des appels et la satisfaction client, sans nécessiter de refonte technique. La combinaison d'une précision élevée et d'une latence courte et stable est particulièrement recherchée dans les conversations vocales en temps réel, où les utilisateurs perçoivent immédiatement les temps de réponse irréguliers.

Ce lancement s'inscrit dans une compétition croissante entre fournisseurs de synthèse vocale pour les agents conversationnels, un segment où Cartesia, ElevenLabs, Fish Audio et Inworld sont déjà positionnés. Gradium a choisi de rendre son protocole d'évaluation transparent en publiant l'ensemble des 500 phrases de test sur Hugging Face sous licence CC BY 4.0, une démarche destinée à crédibiliser ses résultats face à des benchmarks habituellement propriétaires et donc invérifiables par des tiers. La entreprise reconnaît elle-même qu'il s'agit d'un benchmark mené en interne, ce qui appelle à la prudence dans son interprétation. Pour encourager la détection de défauts persistants, Gradium propose désormais une récompense d'un million de crédits à quiconque signale, via son serveur Discord, un cas d'échec complet sur ses critères de test. L'accès au nouveau modèle se fait via le SDK Python existant et le point de terminaison WebSocket TTS, sans changement pour les identifiants de voix déjà utilisés par les clients.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

Notre lecture

81% de réussite sur des phrases piégeuses (numéros, adresses email dictées), c'est le premier chiffre de TTS qui parle vraiment aux boîtes qui font tourner des call centers automatisés, parce que c'est exactement là que ça foire d'habitude, sur un chiffre mal prononcé qui plante tout l'appel. La latence à 216 ms avec un écart-type ridicule, c'est ce qui manquait pour du vocal temps réel crédible. Reste que c'est un benchmark maison, même transparent sur Hugging Face, donc j'attends de voir si les 81% tiennent hors du labo.

À lire ensuite

01Google AI lance Gemini 3.1 Flash TTS : un nouveau standard pour la voix IA expressive et contrôlable46MarkTechPostCréation 02Stability AI lance Stable Audio 3 : une famille de modèles de diffusion latente rapides pour la génération et l'édition audio46MarkTechPostCréation 03Alibaba lance Qwen-Audio-3.0-TTS, un modèle de synthèse vocale hébergé en versions Flash et Plus dans 16 langues37MarkTechPostCréation 
Dossier · Hugging FaceSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.