Aller au contenu principal
Infrastructure · Actu ·

Simplifiez et soutenez vos charges TorchServe avec les conteneurs Deep Learning de Ray Serve

Le projet TorchServe, largement utilisé pour déployer des modèles de machine learning en production, n'est plus activement maintenu : son avis officiel indique qu'aucune mise à jour, correction de bug, nouvelle fonctionnalité ou patch de sécurité n'est prévu, et que les vulnérabilités futures pourraient rester sans réponse. Face à ce constat, Amazon Web Services (AWS) a lancé un nouveau conteneur, le Ray Serve Deep Learning Container (DLC), destiné à prendre le relais pour l'inférence. Ce conteneur GPU s'appuie sur l'image officielle NVIDIA Amazon Linux 2023, intègre PyTorch, la couche de service Ray Serve avec FastAPI et Uvicorn, ainsi que des utilitaires pour la vidéo, l'audio et le multimodal, dont FFmpeg compilé avec accélération matérielle NVIDIA. AWS illustre son fonctionnement en déployant le modèle vision-langage Qwen3-VL-2B sur Amazon Elastic Kubernetes Service (EKS), à l'aide d'instances g5.xlarge et des outils AWS CLI, eksctl et kubectl. L'application de service est injectée via une ConfigMap Kubernetes, ce qui permet de modifier le code sans reconstruire l'image du conteneur.

2 min de lecturePertinence 51

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

L'enjeu dépasse la simple compatibilité logicielle : sans maintenance, les équipes qui exploitent TorchServe doivent elles-mêmes garantir la cohérence de toute la chaîne de dépendances GPU, corriger les failles de sécurité couche par couche et déboguer des pannes dues à des versions désalignées entre CUDA, PyTorch et le serveur d'inférence. Ce travail technique, qualifié de non différenciant par AWS, ralentit la mise en production des modèles sans apporter de valeur ajoutée. En proposant un conteneur préconstruit, testé et patché à chaque publication, AWS transfère cette charge de maintenance vers son propre cycle de release, un service déjà éprouvé pour l'entraînement de modèles via ses Deep Learning Containers historiques, et désormais étendu à l'inférence. Pour les développeurs venant de TorchServe, Ray Serve simplifie aussi l'écriture du code : un point de terminaison devient une simple classe Python décorée avec @serve.deployment, sans archiveur de modèle ni hiérarchie de classes de handlers ni fichier de configuration séparé.

Cette bascule s'inscrit dans une tendance plus large de consolidation des outils de serving de modèles autour d'infrastructures cloud gérées, alors que plusieurs projets open source d'inférence peinent à trouver des financements pérennes pour leur maintenance. Le Ray Serve DLC est disponible en versions distinctes pour Amazon EKS, Amazon EC2 et Amazon SageMaker, chacune dotée d'un point d'entrée adapté à son environnement, mais partageant la même pile logicielle sous-jacente. AWS précise que de nombreux modèles peuvent tourner directement sur ce conteneur sans image personnalisée, les équipes ne devant ajouter des bibliothèques supplémentaires que pour des besoins spécifiques, ce qui laisse présager une adoption progressive de cette approche par d'autres fournisseurs cloud confrontés au même problème d'obsolescence des outils d'inférence.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Réservez de la capacité GPU à court terme pour vos workloads ML avec EC2 Capacity Blocks et SageMaker40AWS ML BlogInfrastructure 02Chargement des LLM accéléré et fenêtres de contexte élargies avec GPUDirect, Amazon FSx for Lustre et TurboQuant48AWS ML BlogInfrastructure 03« Simplifier l'accès multi-comptes aux modèles Amazon Bedrock avec les habilitations gérées »33AWS ML BlogInfrastructure 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.