Aller au contenu principal
Création · Actu ·

NVIDIA lance NemotronLabs VoiceChat 11B, un modèle vocal en duplex intégral avec 450 ms de latence et appel d'outils en direct

NVIDIA a publié NemotronLabs VoiceChat 11B, un modèle ouvert de 11 milliards de paramètres capable de conversation vocale en duplex intégral, c'est à dire que l'agent écoute pendant qu'il parle. Contrairement aux architectures classiques qui enchaînent reconnaissance vocale, modèle de langage et synthèse vocale dans trois systèmes séparés, ce modèle traite la compréhension et la génération de parole dans un seul réseau unifié, ce qui supprime les échanges entre API et réduit la latence. Sur le benchmark Full-Duplex-Bench 1.0, la latence de transition de tour de parole mesurée est de 448 millisecondes, et le taux de prise de parole lorsqu'un utilisateur interrompt l'agent atteint 1,00 en 480 millisecondes. Le modèle est le premier système ouvert en duplex intégral à permettre l'appel d'outils pendant que la conversation continue, via un canal de sortie séparé dédié aux scripts au format TOOLCALL, complété par des phrases d'attente prédéfinies par l'opérateur pour éviter les silences pendant qu'une requête API s'exécute. L'architecture combine un encodeur vocal Fast Conformer issu de Nemotron-Speech-Streaming-En-0.6b, le modèle de langage Nemotron Nano v2 comme colonne vertébrale, et un décodeur de synthèse vocale NVIDIA produisant de l'audio à 22,05 kHz. L'entraînement a mobilisé environ 550 000 heures d'audio réel et synthétique, en s'appuyant sur les travaux SALM-Duplex et Audio Flamingo 3.

2 min de lecturePertinence 36

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette sortie compte parce qu'elle abaisse concrètement la barrière technique pour construire des agents vocaux réactifs capables d'interruption naturelle et d'actions en temps réel, un défi resté largement non résolu dans l'écosystème open source. Les secteurs visés sont nombreux: centres d'appels, assistants embarqués dans les véhicules, commande vocale en restauration rapide, modernisation des serveurs vocaux télécoms, dialogues de personnages non joueurs dans le jeu vidéo, et outils d'accessibilité. Mais NVIDIA précise que le modèle reste destiné à la recherche uniquement, pas à la production: le contexte audio est plafonné à deux minutes, le système peut dégénérer en réponses incohérentes après plusieurs tours d'échange, et des erreurs de transcription ou des prises de parole intempestives de l'agent après la fin d'un tour ont été documentées.

L'accès reste réservé aux équipes disposant d'au moins un GPU de 80 Go de VRAM, comme les puces A100, H100, RTX 6000 Pro ou B200 sous Linux x86_64, puisqu'aucune API hébergée ni fournisseur d'inférence ne propose actuellement le modèle. Sur les benchmarks d'appel d'outils vocaux BFCL-v3, les scores restent modestes, avec 58,5% de réussite sur les appels simples et seulement 27,5% sur les appels multiples et parallèles combinés, tandis que NVIDIA recommande de limiter chaque session à cinq outils maximum. Le modèle se classe deuxième parmi les systèmes ouverts en duplex intégral sur les classements VoiceBench et Full-Duplex-Bench 1.0, ce qui en fait une base de travail prometteuse mais encore expérimentale pour les laboratoires de recherche, startups spécialisées en IA vocale et fournisseurs de cloud GPU qui voudront l'affiner avant tout déploiement réel.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

Notre lecture

Le duplex intégral qui marche à 448 ms, c'est le vrai déblocage ici, pas le nombre de paramètres. Ça fait des années que l'appel d'outils en conversation vocale butait sur le silence gênant pendant qu'une API répond, et là ils le masquent avec des phrases d'attente, c'est bricolé mais ça fonctionne. Reste que "recherche uniquement", contexte à deux minutes et 27,5% de réussite sur les appels d'outils multiples, faut pas se leurrer, on est encore loin d'un centre d'appels en prod avec ça.

À lire ensuite

01Cartesia lance Sonic-3.6, un modèle de synthèse vocale en flux en tête des deux classements d'Artificial Analysis40MarkTechPostCréation 02Alibaba lance Qwen-Audio-3.0-TTS, un modèle de synthèse vocale hébergé en versions Flash et Plus dans 16 langues37MarkTechPostCréation 03Miso Labs publie MisoTTS : un modèle de synthèse vocale expressif de 8 milliards de paramètres en open weights44MarkTechPostCréation 
Dossier · NVIDIASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.