Le nouveau modèle vocal v4 d'ElevenLabs rend les voix IA plus expressives et plus constantes
ElevenLabs a dévoilé Eleven v4, la nouvelle version de son modèle de synthèse vocale. Il suit plus fidèlement les indications d'expression, comme un rire ou un chuchotement, et conserve une voix cohérente sur les productions longues, par exemple un livre audio. Le modèle existe aussi en variante Turbo, conçue pour les agents vocaux en temps réel, qui commence à parler au bout de 150 millisecondes. Dans le classement Voice Arena d'Artificial Analysis, v4 se place devant les modèles de Cartesia et le Gemini de Google.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Ces progrès visent deux défauts persistants des voix synthétiques : le manque de naturel dans l'émotion et la dérive d'une voix qui change subtilement de timbre ou de ton au fil des heures d'enregistrement. Pour les éditeurs de livres audio, les studios de doublage et les créateurs de contenu, une voix stable et pilotable réduit les retouches manuelles. Pour les entreprises qui déploient des assistants vocaux, un délai de 150 millisecondes rapproche l'échange de la fluidité d'une conversation humaine, où la moindre latence est perçue comme un défaut.
Cette sortie s'inscrit dans une concurrence intense sur la voix générative. ElevenLabs, l'un des acteurs de référence du secteur, affronte des spécialistes comme Cartesia et des géants comme Google, qui intègrent la parole à leurs modèles multimodaux. Les classements par vote d'utilisateurs, tels que celui d'Artificial Analysis, servent de plus en plus d'arbitre commercial. La suite dépendra de la capacité de ces modèles à tenir leurs promesses en usage réel, au-delà des évaluations.
Pas d'impact direct sur la France/UE