
NVIDIA lance NemotronLabs VoiceChat 11B, un modèle vocal en duplex intégral avec 450 ms de latence et appel d'outils en direct
NVIDIA a publié NemotronLabs VoiceChat 11B, un modèle ouvert de 11 milliards de paramètres capable de conversation vocale en duplex intégral, c'est à dire que l'agent écoute pendant qu'il parle. Contrairement aux architectures classiques qui enchaînent reconnaissance vocale, modèle de langage et synthèse vocale dans trois systèmes séparés, ce modèle traite la compréhension et la génération de parole dans un seul réseau unifié, ce qui supprime les échanges entre API et réduit la latence. Sur le benchmark Full-Duplex-Bench 1.0, la latence de transition de tour de parole mesurée est de 448 millisecondes, et le taux de prise de parole lorsqu'un utilisateur interrompt l'agent atteint 1,00 en 480 millisecondes. Le modèle est le premier système ouvert en duplex intégral à permettre l'appel d'outils pendant que la conversation continue, via un canal de sortie séparé dédié aux scripts au format TOOLCALL, complété par des phrases d'attente prédéfinies par l'opérateur pour éviter les silences pendant qu'une requête API s'exécute. L'architecture combine un encodeur vocal Fast Conformer issu de Nemotron-Speech-Streaming-En-0.6b, le modèle de langage Nemotron Nano v2 comme colonne vertébrale, et un décodeur de synthèse vocale NVIDIA produisant de l'audio à 22,05 kHz. L'entraînement a mobilisé environ 550 000 heures d'audio réel et synthétique, en s'appuyant sur les travaux SALM-Duplex et Audio Flamingo 3.
Cette sortie compte parce qu'elle abaisse concrètement la barrière technique pour construire des agents vocaux réactifs capables d'interruption naturelle et d'actions en temps réel, un défi resté largement non résolu dans l'écosystème open source. Les secteurs visés sont nombreux: centres d'appels, assistants embarqués dans les véhicules, commande vocale en restauration rapide, modernisation des serveurs vocaux télécoms, dialogues de personnages non joueurs dans le jeu vidéo, et outils d'accessibilité. Mais NVIDIA précise que le modèle reste destiné à la recherche uniquement, pas à la production: le contexte audio est plafonné à deux minutes, le système peut dégénérer en réponses incohérentes après plusieurs tours d'échange, et des erreurs de transcription ou des prises de parole intempestives de l'agent après la fin d'un tour ont été documentées.
L'accès reste réservé aux équipes disposant d'au moins un GPU de 80 Go de VRAM, comme les puces A100, H100, RTX 6000 Pro ou B200 sous Linux x86_64, puisqu'aucune API hébergée ni fournisseur d'inférence ne propose actuellement le modèle. Sur les benchmarks d'appel d'outils vocaux BFCL-v3, les scores restent modestes, avec 58,5% de réussite sur les appels simples et seulement 27,5% sur les appels multiples et parallèles combinés, tandis que NVIDIA recommande de limiter chaque session à cinq outils maximum. Le modèle se classe deuxième parmi les systèmes ouverts en duplex intégral sur les classements VoiceBench et Full-Duplex-Bench 1.0, ce qui en fait une base de travail prometteuse mais encore expérimentale pour les laboratoires de recherche, startups spécialisées en IA vocale et fournisseurs de cloud GPU qui voudront l'affiner avant tout déploiement réel.
Le duplex intégral qui marche à 448 ms, c'est le vrai déblocage ici, pas le nombre de paramètres. Ça fait des années que l'appel d'outils en conversation vocale butait sur le silence gênant pendant qu'une API répond, et là ils le masquent avec des phrases d'attente, c'est bricolé mais ça fonctionne. Reste que "recherche uniquement", contexte à deux minutes et 27,5% de réussite sur les appels d'outils multiples, faut pas se leurrer, on est encore loin d'un centre d'appels en prod avec ça.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




