Aller au contenu principal
Fish Audio lance Fish Audio S2 : une nouvelle génération de synthèse vocale expressive (TTS) aux émotions incroyablement contrôlables
OutilsMarkTechPost · 1 min de lecture

Fish Audio lance Fish Audio S2 : une nouvelle génération de synthèse vocale expressive (TTS) aux émotions incroyablement contrôlables

Source originale ↗·

Fish Audio lance S2-Pro, un modèle de synthèse vocale de nouvelle génération reposant sur une architecture Dual-AR (4B paramètres pour la sémantique, 400M pour l'acoustique) et la quantification vectorielle résiduelle (RVQ), permettant une génération audio 44,1 kHz avec une latence inférieure à 150 ms. Le modèle offre un clonage vocal zero-shot à partir d'un extrait de référence de 10 à 30 secondes, sans fine-tuning. Une fonctionnalité notable est le contrôle émotionnel granulaire via des balises en langage naturel insérées directement dans le texte (ex. [whisper], [laugh]), permettant des transitions d'émotion dynamiques au sein d'une même génération.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

PolyAI lance Dialog-RSN-1, un modèle de dialogue audio-natif qui combine tour de parole, reconnaissance vocale, appel de fonctions et génération de réponse
1MarkTechPost 

PolyAI lance Dialog-RSN-1, un modèle de dialogue audio-natif qui combine tour de parole, reconnaissance vocale, appel de fonctions et génération de réponse

PolyAI a dévoilé Dialog-RSN-1, un modèle de dialogue conçu pour percevoir directement l'audio d'un appelant plutôt que de lire une simple transcription. Le système fusionne en un seul modèle audio-natif la gestion des tours de parole, la reconnaissance vocale, l'appel de fonctions et la génération de réponse, et traite déjà des appels en production réelle. Contrairement aux modèles de type GPT Realtime ou Gemini Live, la synthèse vocale reste séparée, ce qui permet de garder un contrôle total sur la voix produite. Le modèle fonctionne à la demande, sollicité ponctuellement plutôt qu'en flux permanent monopolisant un GPU en continu : un détecteur d'activité vocale à haut rappel et quelques minuteurs décident du moment où l'interroger, et le premier jeton généré (VIDE, EN COURS ou TERMINÉ) détermine si l'agent doit prendre la parole. PolyAI annonce des temps de réponse inférieurs à 300 millisecondes, une hausse de 11% du taux de résolution sans transfert humain chez un groupe de restauration, et une baisse de 37% de la latence chez un assureur. Le lancement se limite pour l'instant à l'anglais, et l'accès passe exclusivement par la plateforme de PolyAI, sans poids ouverts ni API publique. Cette annonce compte parce qu'elle cible directement les grandes entreprises à fort volume d'appels, dans des secteurs comme la restauration, l'assurance, les services financiers, la santé, l'hôtellerie, le commerce de détail, les télécommunications, le voyage ou les services publics, pour des usages tels que la réservation, la facturation, l'authentification, le routage d'appels ou la gestion de commandes. PolyAI revendique plus de 100 clients entreprises et plus de 2000 déploiements actifs, chiffres mis en avant lors de sa levée de série D de 86 millions de dollars en décembre 2025. Les développeurs indépendants et les petites entreprises ne sont pas visés : les clients existants peuvent activer la fonctionnalité dès maintenant, les nouveaux doivent demander un accès anticipé. L'enjeu technique dépassé est important, car les architectures existantes présentent chacune des limites : les systèmes en cascade perdent le ton et l'hésitation du locuteur en ne transmettant au modèle de langage que le texte transcrit, tandis que les modèles de parole à parole intègrent la voix directement dans le modèle, réduisant le contrôle sur la prononciation et nécessitant un GPU dédié pendant tout l'appel. Pour construire Dialog-RSN-1, PolyAI a affiné des modèles multimodaux à poids ouverts par apprentissage supervisé puis par renforcement sur ses propres données, en évaluant des bases comme Gemma, GPT-OSS, Qwen et Mistral, avec des tailles allant de 8 milliards de paramètres denses à 30 milliards en configuration éparse pour tenir l'objectif de latence sur GPU A100. Plusieurs optimisations ont permis d'atteindre ces performances : préremplissage du cache d'attention pendant que l'utilisateur parle, gabarit de prompt qui minimise l'invalidation du cache, routage systématique de chaque appelant vers le même GPU, et un module de génération spéculative affiné acceptant en moyenne 3,9 jetons. Les évaluations internes, menées sur un benchmark baptisé Dialog-Eval que l'entreprise prévoit de publier en open source, placent Dialog-RSN-1 en tête des modèles compatibles avec le temps réel, tandis que le taux d'erreur de transcription du système reste inférieur à celui de gpt-4o-transcribe. PolyAI prévoit de publier un rapport technique complet ainsi qu'un article scientifique détaillant Dialog-Eval, et recommande pour l'instant son modèle Raven 3.5 pour les usages non anglophones ou le chat web enrichi.

💬 Reste à voir si les 2000 déploiements tiennent la charge, mais l'idée de séparer la synthèse vocale du reste, ça c'est malin. Ça évite le piège des modèles parole à parole qui bouffent un GPU en continu pour un appel qui dure trois minutes. Ce que révèle surtout ce lancement, c'est que le marché du centre d'appels IA bascule d'une course à la démo vers une course à la marge, où gagner 300ms ou 11% de résolution sans transfert humain vaut plus cher qu'un modèle "impressionnant" en labo.

OutilsActu
1 source
AWS prépare une nouvelle génération d’agents IA d’entreprise
2Le Big Data 

AWS prépare une nouvelle génération d’agents IA d’entreprise

Amazon Web Services a dévoilé une série d'annonces autour de sa plateforme Bedrock et de plusieurs nouveaux services destinés à accélérer l'intégration des agents IA dans les environnements d'entreprise. Les évolutions touchent quatre domaines principaux : l'accès à la connaissance, l'automatisation des processus métier, la sécurité applicative et le développement logiciel. Bedrock AgentCore s'enrichit notamment de connecteurs vers SharePoint, Confluence, Google Drive et Amazon S3, mais aussi d'une capacité de navigation web directement intégrée au périmètre sécurisé du client. Un mécanisme d'accès aux contenus sous licence est également prévu, permettant aux fournisseurs de données de monétiser leur usage par les agents. Sur le terrain de la gouvernance, les équipes peuvent désormais analyser les erreurs récurrentes, tester différentes configurations et renforcer la protection contre les injections de prompt via Bedrock Guardrails. L'assistant métier Amazon Quick reçoit des capacités de gestion autonome de tâches, avec une vue unifiée regroupant échanges, rendez-vous et actions en attente, et s'ouvre à de nouveaux partenaires comme Adobe, Figma, Shopify, Snowflake et WhatsApp. Ces annonces marquent un changement de paradigme dans la façon dont AWS positionne l'IA en entreprise : il ne s'agit plus d'outils de question-réponse, mais d'agents capables d'agir de façon autonome sur des workflows réels. Pour les équipes de développement, AWS Continuum automatise l'identification et la correction des vulnérabilités logicielles, tandis qu'AWS Transform surveille en continu les dépôts de code pour détecter les composants vieillissants et proposer des pull requests correctives. AWS DevOps Agent élargit quant à lui son périmètre à la validation pré-production et à la génération automatique de scénarios de test. L'environnement de développement piloté par agents Kiro devient accessible sur iPhone. Ce virage vers l'automatisation concrète représente un enjeu majeur pour les directions techniques et les DSI, qui doivent désormais évaluer comment déléguer des pans entiers de leur chaîne de valeur à des systèmes autonomes. Ces évolutions s'inscrivent dans une compétition intense entre les grands fournisseurs de cloud pour capter les budgets IA des entreprises. AWS répond ainsi aux offres de Microsoft Copilot et de Google Vertex AI, qui avancent sur des territoires similaires. Le nouveau service AWS Context, qui construit automatiquement une représentation des liens entre données d'entreprise pour les rendre exploitables par les agents, illustre la volonté d'AWS de résoudre la fragmentation de l'information dans les grandes organisations, un problème structurel que ni les outils de recherche classiques ni les premiers chatbots d'entreprise n'ont su régler. La capacité à monétiser les données premium via les agents ouvre par ailleurs un nouveau marché pour les éditeurs de contenu, dont les modalités de valorisation restent encore à définir dans un cadre réglementaire et contractuel qui n'en est qu'à ses débuts.

UELes DSI français et européens opérant sur AWS peuvent dès maintenant évaluer le déploiement d'agents autonomes sur leurs workflows internes, dans un cadre de sécurité (Bedrock Guardrails, protection anti-injection) potentiellement aligné avec les exigences de l'AI Act.

💬 AWS Context est probablement l'annonce la plus sous-estimée du lot : construire automatiquement la carte des liens entre données d'entreprise, c'est ce que ni SharePoint ni Elastic n'ont réussi à faire depuis vingt ans. Le vrai enjeu ici, c'est pas les agents, c'est qui détient le graphe de connaissance de l'organisation. Azure l'avait compris avant tout le monde avec le Microsoft Graph, AWS vient de rattraper son retard, bon, presque.

OutilsOutil
1 source
Google lance Lyria 3 Pro, son nouveau modèle de génération musicale
3TechCrunch AI 

Google lance Lyria 3 Pro, son nouveau modèle de génération musicale

Google franchit une nouvelle étape dans la génération musicale par intelligence artificielle avec le lancement de Lyria 3 Pro, une version améliorée de son modèle dédié à la création sonore. Ce nouveau modèle est capable de produire des morceaux plus longs et offre davantage d'options de personnalisation, marquant une progression significative par rapport aux versions précédentes. L'enjeu est considérable dans un secteur où la concurrence s'intensifie autour des outils de création musicale assistée par IA. En intégrant Lyria 3 Pro à travers son écosystème, Gemini, ses produits enterprise et d'autres services, Google positionne clairement cette technologie comme un pilier transversal de son offre, aussi bien pour les créateurs individuels que pour les professionnels et les entreprises. Le modèle se distingue par sa capacité à générer des pistes musicales plus longues et plus adaptables aux besoins des utilisateurs, une limitation notable des générations précédentes. Le déploiement s'étend sur plusieurs plateformes Google, ce qui témoigne d'une stratégie d'intégration large plutôt qu'un produit isolé. Les détails techniques précis sur la durée maximale des pistes ou les paramètres de personnalisation disponibles n'ont pas encore été tous divulgués. Cette annonce s'inscrit dans une dynamique plus large où les grandes plateformes technologiques, Google, OpenAI, Meta ou encore Suno et Udio, investissent massivement dans la génération audio et musicale. La montée en puissance de Lyria 3 Pro suggère que Google entend s'imposer comme référence dans ce domaine, en capitalisant sur ses infrastructures existantes pour toucher un maximum d'utilisateurs et de cas d'usage professionnels.

OutilsActu
1 source
4MarkTechPost 

xAI lance des API autonomes de reconnaissance et synthèse vocale Grok pour les développeurs entreprise

xAI, la société d'intelligence artificielle d'Elon Musk, a lancé deux nouvelles API audio autonomes : une API de transcription vocale (Speech-to-Text) et une API de synthèse vocale (Text-to-Speech), toutes deux basées sur la même infrastructure qui alimente Grok Voice sur les applications mobiles, les véhicules Tesla et le support client Starlink. L'API STT est disponible dès maintenant, avec transcription en 25 langues, modes batch et temps réel, à des tarifs de 0,10 dollar par heure en batch et 0,20 dollar en streaming. L'API TTS, elle, est facturée 4,20 dollars par million de caractères, prend en charge 20 langues et propose cinq voix distinctes. Les deux API entrent directement en concurrence avec les acteurs établis du marché : ElevenLabs, Deepgram et AssemblyAI. Ces nouveaux outils s'adressent en priorité aux développeurs qui construisent des agents vocaux, des systèmes de transcription de réunions, des centres d'appels automatisés ou des fonctionnalités d'accessibilité. Sur le plan technique, l'API STT intègre des horodatages au niveau du mot, la diarisation des locuteurs (identification de qui parle à quel moment), le support de 12 formats audio et une normalisation intelligente du texte qui convertit automatiquement les formes orales en formats lisibles. L'API TTS se distingue par sa capacité à injecter des balises expressives dans le texte, comme [laugh], [sigh] ou des balises enveloppantes comme whisper et emphasis, permettant une synthèse vocale naturelle et nuancée, loin de la monotonie des systèmes classiques. Sur les benchmarks internes, xAI revendique un taux d'erreur de 5,0 % pour la reconnaissance d'entités sur appels téléphoniques, contre 12,0 % pour ElevenLabs, 13,5 % pour Deepgram et 21,3 % pour AssemblyAI. Ce lancement s'inscrit dans une stratégie d'expansion agressive de xAI, qui cherche à monétiser ses capacités audio au-delà de l'écosystème Grok et à conquérir un marché entreprise où la qualité de transcription et la latence sont des critères décisifs. Le marché des API vocales connaît une forte croissance portée par l'essor des agents IA conversationnels, des outils de réunion automatisés et des interfaces vocales embarquées. Si les performances annoncées se confirment en production, xAI dispose d'un avantage compétitif tangible face à des concurrents bien établis, mais les développeurs attendront des validations indépendantes avant de migrer leurs infrastructures critiques vers une plateforme encore jeune.

💬 Les chiffres du benchmark STT sont impressionnants, 5% d'erreur contre 21% pour AssemblyAI, bon, sur le papier. Le pricing est agressif et les features (diarisation, balises expressives) montrent qu'ils ont bossé le sujet sérieusement, pas juste un wrapper OpenAI Whisper habillé. Reste à voir si ça tient en prod sur des accents français ou du bruit ambiant réel, parce que les benchmarks internes de xAI, j'attends la validation communautaire avant de migrer quoi que ce soit.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic