Aller au contenu principal
Outils · Tuto ·

Génération d'images et de vidéos avec vLLM-Omni sur SageMaker AI (partie 2)

Amazon Web Services a publié la deuxième partie d'une série technique consacrée au conteneur AWS vLLM-Omni Deep Learning Container (DLC) sur Amazon SageMaker AI, cette fois centrée sur la génération d'images et de vidéos. Le tutoriel montre comment transformer un simple prompt textuel en image fixe, puis animer cette image en une courte vidéo. Pour cela, deux points de terminaison (endpoints) distincts sont déployés à partir du même conteneur AWS vLLM-Omni : un endpoint en temps réel qui fait tourner le modèle FLUX.2-klein-4B pour la génération d'images, routé vers /v1/images/générations, et un endpoint d'inférence asynchrone qui fait tourner Wan2.1-VACE-1.3B pour la génération vidéo, routé vers /v1/vidéos/sync. Le workflow envoie d'abord un prompt textuel pour obtenir une image encodée en PNG base64, la redimensionne et la convertit en JPEG compact, puis transmet cette image ainsi qu'un prompt de mouvement au modèle vidéo. Le fichier MP4 final est récupéré depuis Amazon S3, qui sert aussi au stockage de la requête vidéo multipart. L'exemple de code fourni comprend un workflow en ligne de commande ainsi qu'une interface optionnelle sous Streamlit.

2 min de lecturePertinence 49

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette architecture illustre un choix technique clé pour les développeurs qui construisent des pipelines multimodaux sur AWS : utiliser l'inférence en temps réel pour les tâches courtes qui exigent une réponse immédiate, ici la génération d'image nécessaire pour construire la requête suivante, et réserver l'inférence asynchrone aux opérations plus longues, ici la génération vidéo conditionnée par image, dont la charge utile est plus lourde. En conservant une seule image de conteneur commune pour les deux endpoints, AWS réduit la variation de la pile de service tout en laissant chaque modèle choisir le type d'instance et l'option d'inférence adaptés à sa charge de travail. Pour les équipes qui déploient des applications génératives combinant plusieurs modalités, ce modèle offre un patron reproductible pour enchaîner des modèles hétérogènes sans multiplier les infrastructures.

Ce tutoriel s'inscrit dans une série plus large sur les conteneurs spécialisés d'AWS: la première partie portait sur la synthèse vocale en temps réel via le streaming bidirectionnel de SageMaker AI et vLLM-Omni. vLLM-Omni est une extension du moteur d'inférence vLLM qui dépasse la simple génération de texte pour couvrir l'audio, l'image et la vidéo, le tout via des API compatibles avec le format OpenAI. Les AWS Deep Learning Containers packagent les frameworks et dépendances nécessaires à l'entraînement et à l'inférence, simplifiant le déploiement de ces modèles multimodaux. Cette série doit se poursuivre avec d'autres cas d'usage combinant les capacités étendues de vLLM-Omni sur SageMaker AI.

Impact France / UEChamp produit par Le Fil IA

Les équipes européennes utilisant AWS peuvent reproduire ce patron d'architecture pour leurs pipelines multimodaux, mais aucun acteur ou réglementation française ou européenne n'est directement concerné.

À lire ensuite

01Développement d'applications vocales en temps réel avec vLLM-Omni sur SageMaker AI (partie 1)47AWS ML BlogOutils 02Gouvernance des modèles avec MLflow et la synchronisation du registre de modèles Amazon SageMaker AI (2e partie)37AWS ML BlogOutils 03Créez des applications vocales en temps réel avec Amazon SageMaker AI et vLLM44AWS ML BlogOutils 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.