Aller au contenu principal
Outils · Tuto ·

Développement d'applications vocales en temps réel avec vLLM-Omni sur SageMaker AI (partie 1)

AWS a publié la première partie d'une nouvelle série technique consacrée à ses conteneurs de deep learning (DLC) spécialisés, cette fois centrée sur la génération vocale en temps réel. L'article détaille comment déployer le modèle de synthèse vocale Qwen3-TTS sur Amazon SageMaker AI à l'aide du DLC AWS vLLM-Omni, une extension du moteur d'inférence vLLM capable de traiter et générer du texte, de l'audio, des images et de la vidéo. Le système permet de commencer à diffuser la voix générée avant même que la réponse textuelle complète ne soit produite, via une connexion WebSocket bidirectionnelle et persistante transportée sur HTTP/2, exposée sur le port 8443 du endpoint SageMaker Runtime. Le client envoie du texte et des paramètres de session, tandis que Qwen3-TTS retourne en continu des événements audio et des fragments sonores sur cette même connexion. L'exemple de code complet, disponible dans le dossier 03-features/bidirectional-streaming-vLLM-Omni, inclut un script de déploiement et une application de démonstration construite avec Gradio.

2 min de lecturePertinence 47

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette avancée répond à un besoin concret pour les agents vocaux, les outils d'accessibilité, les applications d'apprentissage interactif et les assistants de service client, qui doivent éviter les silences prolongés pour rester naturels et utilisables. En réduisant la latence perçue grâce au streaming audio en parallèle de la génération, AWS facilite la construction de pipelines vocaux complets et réactifs directement sur son infrastructure managée. L'entreprise positionne ainsi vLLM-Omni comme une alternative standardisée aux déploiements maison, avec des API compatibles OpenAI et une architecture capable d'orchestrer des étapes de calcul hétérogènes, autant autoregressives que basées sur la diffusion. Pour les équipes qui développent des produits vocaux, cela signifie moins de travail d'intégration bas niveau et un chemin de déploiement plus direct vers du matériel AWS.

Ce travail s'inscrit dans la continuité d'un article précédent qui couvrait le volet entrée du pipeline vocal, avec le streaming audio du microphone vers le modèle de reconnaissance vocale Voxtral-Mini-4B Realtime pour produire des transcriptions. Le nouvel article complète ce dispositif côté sortie, en transformant le texte de réponse en parole diffusée en continu. Une deuxième partie de la série appliquera le même DLC vLLM-Omni à la génération d'images et de vidéo, tandis que d'autres volets aborderont des conteneurs spécialisés comme WhisperX et llama.cpp. AWS cherche ainsi à démontrer, exemples de déploiement et benchmarks reproductibles à l'appui, que ses conteneurs d'inférence peuvent couvrir des architectures de modèles et des pipelines multimodaux de plus en plus variés, au-delà de la génération de texte classique.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Créez des applications vocales en temps réel avec Amazon SageMaker AI et vLLM44AWS ML BlogOutils 02Déploiement de la synthèse vocale personnalisée en temps réel avec Qwen3-TTS sur Amazon SageMaker AI39AWS ML BlogOutils 03Applications de streaming vocal en temps réel avec Amazon Nova Sonic et WebRTC42AWS ML BlogOutils 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.