Aller au contenu principal
OutilsMarkTechPost · 3 min de lecture

PolyAI lance Dialog-RSN-1, un modèle de dialogue audio-natif qui combine tour de parole, reconnaissance vocale, appel de fonctions et génération de réponse

Source originale ↗·

PolyAI a dévoilé Dialog-RSN-1, un modèle de dialogue conçu pour percevoir directement l'audio d'un appelant plutôt que de lire une simple transcription. Le système fusionne en un seul modèle audio-natif la gestion des tours de parole, la reconnaissance vocale, l'appel de fonctions et la génération de réponse, et traite déjà des appels en production réelle. Contrairement aux modèles de type GPT Realtime ou Gemini Live, la synthèse vocale reste séparée, ce qui permet de garder un contrôle total sur la voix produite. Le modèle fonctionne à la demande, sollicité ponctuellement plutôt qu'en flux permanent monopolisant un GPU en continu : un détecteur d'activité vocale à haut rappel et quelques minuteurs décident du moment où l'interroger, et le premier jeton généré (VIDE, EN COURS ou TERMINÉ) détermine si l'agent doit prendre la parole. PolyAI annonce des temps de réponse inférieurs à 300 millisecondes, une hausse de 11% du taux de résolution sans transfert humain chez un groupe de restauration, et une baisse de 37% de la latence chez un assureur. Le lancement se limite pour l'instant à l'anglais, et l'accès passe exclusivement par la plateforme de PolyAI, sans poids ouverts ni API publique.

Cette annonce compte parce qu'elle cible directement les grandes entreprises à fort volume d'appels, dans des secteurs comme la restauration, l'assurance, les services financiers, la santé, l'hôtellerie, le commerce de détail, les télécommunications, le voyage ou les services publics, pour des usages tels que la réservation, la facturation, l'authentification, le routage d'appels ou la gestion de commandes. PolyAI revendique plus de 100 clients entreprises et plus de 2000 déploiements actifs, chiffres mis en avant lors de sa levée de série D de 86 millions de dollars en décembre 2025. Les développeurs indépendants et les petites entreprises ne sont pas visés : les clients existants peuvent activer la fonctionnalité dès maintenant, les nouveaux doivent demander un accès anticipé. L'enjeu technique dépassé est important, car les architectures existantes présentent chacune des limites : les systèmes en cascade perdent le ton et l'hésitation du locuteur en ne transmettant au modèle de langage que le texte transcrit, tandis que les modèles de parole à parole intègrent la voix directement dans le modèle, réduisant le contrôle sur la prononciation et nécessitant un GPU dédié pendant tout l'appel.

Pour construire Dialog-RSN-1, PolyAI a affiné des modèles multimodaux à poids ouverts par apprentissage supervisé puis par renforcement sur ses propres données, en évaluant des bases comme Gemma, GPT-OSS, Qwen et Mistral, avec des tailles allant de 8 milliards de paramètres denses à 30 milliards en configuration éparse pour tenir l'objectif de latence sur GPU A100. Plusieurs optimisations ont permis d'atteindre ces performances : préremplissage du cache d'attention pendant que l'utilisateur parle, gabarit de prompt qui minimise l'invalidation du cache, routage systématique de chaque appelant vers le même GPU, et un module de génération spéculative affiné acceptant en moyenne 3,9 jetons. Les évaluations internes, menées sur un benchmark baptisé Dialog-Eval que l'entreprise prévoit de publier en open source, placent Dialog-RSN-1 en tête des modèles compatibles avec le temps réel, tandis que le taux d'erreur de transcription du système reste inférieur à celui de gpt-4o-transcribe. PolyAI prévoit de publier un rapport technique complet ainsi qu'un article scientifique détaillant Dialog-Eval, et recommande pour l'instant son modèle Raven 3.5 pour les usages non anglophones ou le chat web enrichi.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Cohere lance Cohere Transcribe, un modèle de reconnaissance vocale automatique de pointe pour les entreprises
1MarkTechPost 

Cohere lance Cohere Transcribe, un modèle de reconnaissance vocale automatique de pointe pour les entreprises

Cohere, l'entreprise canadienne spécialisée dans les grands modèles de langage pour les entreprises, a lancé le 26 mars 2026 son premier modèle de reconnaissance automatique de la parole, baptisé Cohere Transcribe. Dès sa sortie, le modèle s'est classé premier sur le classement Open ASR Leaderboard de Hugging Face, avec un taux d'erreur moyen de 5,42 % (WER) sur sept ensembles de benchmark, AMI, Earnings22, GigaSpeech, LibriSpeech, SPGISpeech, TED-LIUM et VoxPopuli. Il surpasse ainsi les références du marché : Whisper Large v3 d'OpenAI (7,44 % WER), ElevenLabs Scribe v2 (5,83 %) et Qwen3-ASR-1.7B (5,76 %). Dans des évaluations humaines en anglais, les annotateurs ont préféré Transcribe dans 78 % des cas face à IBM Granite 4.0, 67 % face à NVIDIA Canary, et 64 % face à Whisper Large v3. Le modèle prend en charge 14 langues, dont le français, l'anglais, l'arabe, le chinois et le japonais, en misant sur la qualité plutôt que sur l'exhaustivité. Ce lancement marque une entrée stratégique de Cohere sur un segment jusqu'ici dominé par OpenAI, Google et Meta. Pour les entreprises, la transcription automatique fiable est un prérequis pour exploiter des données audio massives : appels de centres de contact, réunions, audiences juridiques, transcriptions médicales. Un WER inférieur à 6 % représente un seuil de qualité utilisable en production sans correction humaine systématique, ce qui change concrètement l'économie du traitement audio à grande échelle. La capacité du modèle à traiter des fichiers longs, jusqu'à des enregistrements de plus d'une heure, via un système de découpage automatique en segments de 35 secondes avec réassemblage intelligent répond directement aux usages entreprise les plus exigeants, comme les earnings calls ou les procédures légales. Sur le plan technique, Cohere a opté pour une architecture hybride Conformer-Transformer : un encodeur Conformer de grande taille, qui combine réseaux convolutifs (efficaces pour les détails acoustiques locaux) et mécanismes d'attention (pour les dépendances linguistiques longue portée), couplé à un décodeur Transformer allégé. Ce choix architectural, entraîné par supervision classique (cross-entropy), contraste avec les approches purement Transformer comme Whisper. Cohere, qui avait jusqu'ici concentré son offre sur les modèles de texte et d'embedding, se positionne désormais sur une stack multimodale complète à destination des entreprises. Dans un contexte où les grandes plateformes, Microsoft, Zoom, Google, intègrent déjà de la transcription native dans leurs outils, Cohere parie sur une offre souveraine et personnalisable pour les équipes qui ne veulent pas dépendre des APIs propriétaires des géants américains.

UECohere Transcribe supporte le français parmi ses 14 langues et se positionne comme alternative souveraine aux APIs américaines pour les entreprises européennes souhaitant traiter des données audio sensibles en interne.

OutilsOpinion
1 source
Meilleurs modèles de reconnaissance vocale (ASR) open source en 2026 : comparatif WER, langues, latence et licences
2MarkTechPost 

Meilleurs modèles de reconnaissance vocale (ASR) open source en 2026 : comparatif WER, langues, latence et licences

Cohere a publié en mars 2026 son modèle de reconnaissance vocale Transcribe, doté de 2 milliards de paramètres et sous licence Apache 2.0, qui a pris la tête du Open ASR Leaderboard d'Hugging Face avec un taux d'erreur mot (WER) moyen de 5,42%. Cinq semaines plus tard, IBM a riposté avec Granite Speech 4.1 2B, à 5,33%. Depuis, ARK-ASR-3B et MOSS-Transcribe-preview-2B ont affiché des scores encore plus bas, si bien que le sommet du classement se joue désormais à moins d'un point de WER. Mais ce chiffre de 5,42% mérite d'être décortiqué: il correspond à une moyenne sur huit jeux de test anglophones incluant TED-LIUM (AMI 8,13, Earnings-22 10,86, GigaSpeech 9,34, LibriSpeech clean 1,25, LibriSpeech other 2,37, SPGISpeech 3,08, TED-LIUM 2,49, VoxPopuli 5,87). Or ARK-ASR-3B affiche son 5,04% sur seulement sept jeux, sans TED-LIUM, l'un des plus faciles du lot. En recalculant Cohere et Granite sur ces mêmes sept jeux, leurs scores remontent respectivement à 5,84 et 5,65: l'avance réelle d'ARK est donc plus grande que ne le laissent penser les chiffres bruts, pas plus petite. Cette affaire de méthodologie a des conséquences très concrètes pour quiconque doit choisir un modèle de transcription en production. Le rang au classement n'est plus le critère décisif: la licence, la couverture linguistique, le support du streaming et le coût par heure audio pèsent désormais davantage. Deux biais supplémentaires fragilisent le classement public: MOSS-Transcribe-preview-2B a été explicitement affiné par apprentissage par renforcement sur les données d'entraînement du leaderboard lui-même, ce qui mesure sa capacité à optimiser le benchmark plutôt que sa performance réelle. Par ailleurs, des jeux d'évaluation privés fournis par Appen, couvrant les accents australien, canadien, indien et américain en parole scriptée et spontanée, rebattent les cartes: activés, ils font passer zoom/scribe_v1 de la quatrième à la première place, reléguant le leader public. Les modèles calibrés sur de la parole lue propre s'effondrent proportionnellement plus sur de la conversation spontanée. Sur le terrain de la précision pure, Cohere Transcribe reste le modèle réellement adopté en production, avec plus de 620 000 téléchargements en un mois et un support d'exécution large (transformers, vLLM, mlx-audio pour Apple Silicon, port Rust, version WebGPU). Construit autour d'un encodeur Conformer et d'un décodeur Transformer léger entraîné depuis zéro, il couvre 14 langues et affiche un taux de préférence humaine de 61% en moyenne, 78% face à IBM Granite 4.0 1B Speech et 64% face à Whisper large-v3. Sa fiche technique reconnaît toutefois l'absence de détection automatique de langue, d'horodatage et de diarisation, ainsi qu'une tendance à halluciner du texte sur du silence. Granite Speech 4.1 2B, entraîné sur 174 000 heures audio, mise lui sur la polyvalence plutôt que sur le score brut: six langues, traduction vocale bidirectionnelle, biais par liste de mots-clés pour les noms propres, et gestion fine de la ponctuation.

OutilsOutil
1 source
Cohere publie un modèle open source qui domine les benchmarks de reconnaissance vocale
3The Decoder 

Cohere publie un modèle open source qui domine les benchmarks de reconnaissance vocale

Cohere a publié un nouveau modèle de reconnaissance vocale open source qui surpasse l'ensemble de ses concurrents sur les benchmarks de référence du secteur, y compris Whisper d'OpenAI, le standard de facto depuis plusieurs années. Le modèle est disponible librement, ce qui permet à n'importe quelle équipe de le déployer, le modifier et l'intégrer sans restrictions de licence. Cette sortie représente un défi direct à la domination d'OpenAI dans le domaine de la transcription automatique. Whisper, lancé en 2022, s'est imposé comme la solution de référence pour des milliers d'applications professionnelles et open source. Qu'un acteur comme Cohere propose désormais une alternative plus performante et librement accessible change concrètement la donne pour les développeurs, les entreprises et les chercheurs qui cherchent à traiter de l'audio à grande échelle sans dépendance à un fournisseur propriétaire. Cohere, spécialisé dans les modèles de langage à destination des entreprises, élargit ainsi son périmètre au-delà du texte vers la modalité vocale, un segment en forte croissance. Cette publication s'inscrit dans une tendance plus large où les acteurs de l'IA rivalisent d'open source stratégique pour gagner en adoption et en crédibilité face aux géants comme OpenAI et Google. La qualité des benchmarks annoncés reste à confirmer par la communauté, mais le signal envoyé à l'industrie est clair.

UELes développeurs et entreprises européens peuvent adopter une alternative open source performante à Whisper pour la transcription vocale, réduisant leur dépendance aux solutions propriétaires américaines.

OutilsActu
1 source
4MarkTechPost 

xAI lance des API autonomes de reconnaissance et synthèse vocale Grok pour les développeurs entreprise

xAI, la société d'intelligence artificielle d'Elon Musk, a lancé deux nouvelles API audio autonomes : une API de transcription vocale (Speech-to-Text) et une API de synthèse vocale (Text-to-Speech), toutes deux basées sur la même infrastructure qui alimente Grok Voice sur les applications mobiles, les véhicules Tesla et le support client Starlink. L'API STT est disponible dès maintenant, avec transcription en 25 langues, modes batch et temps réel, à des tarifs de 0,10 dollar par heure en batch et 0,20 dollar en streaming. L'API TTS, elle, est facturée 4,20 dollars par million de caractères, prend en charge 20 langues et propose cinq voix distinctes. Les deux API entrent directement en concurrence avec les acteurs établis du marché : ElevenLabs, Deepgram et AssemblyAI. Ces nouveaux outils s'adressent en priorité aux développeurs qui construisent des agents vocaux, des systèmes de transcription de réunions, des centres d'appels automatisés ou des fonctionnalités d'accessibilité. Sur le plan technique, l'API STT intègre des horodatages au niveau du mot, la diarisation des locuteurs (identification de qui parle à quel moment), le support de 12 formats audio et une normalisation intelligente du texte qui convertit automatiquement les formes orales en formats lisibles. L'API TTS se distingue par sa capacité à injecter des balises expressives dans le texte, comme [laugh], [sigh] ou des balises enveloppantes comme whisper et emphasis, permettant une synthèse vocale naturelle et nuancée, loin de la monotonie des systèmes classiques. Sur les benchmarks internes, xAI revendique un taux d'erreur de 5,0 % pour la reconnaissance d'entités sur appels téléphoniques, contre 12,0 % pour ElevenLabs, 13,5 % pour Deepgram et 21,3 % pour AssemblyAI. Ce lancement s'inscrit dans une stratégie d'expansion agressive de xAI, qui cherche à monétiser ses capacités audio au-delà de l'écosystème Grok et à conquérir un marché entreprise où la qualité de transcription et la latence sont des critères décisifs. Le marché des API vocales connaît une forte croissance portée par l'essor des agents IA conversationnels, des outils de réunion automatisés et des interfaces vocales embarquées. Si les performances annoncées se confirment en production, xAI dispose d'un avantage compétitif tangible face à des concurrents bien établis, mais les développeurs attendront des validations indépendantes avant de migrer leurs infrastructures critiques vers une plateforme encore jeune.

💬 Les chiffres du benchmark STT sont impressionnants, 5% d'erreur contre 21% pour AssemblyAI, bon, sur le papier. Le pricing est agressif et les features (diarisation, balises expressives) montrent qu'ils ont bossé le sujet sérieusement, pas juste un wrapper OpenAI Whisper habillé. Reste à voir si ça tient en prod sur des accents français ou du bruit ambiant réel, parce que les benchmarks internes de xAI, j'attends la validation communautaire avant de migrer quoi que ce soit.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic