Aller au contenu principal
Infrastructure · Actu ·

Réduire les temps de démarrage à froid sur Amazon SageMaker HyperPod grâce à la mise en cache des modèles

AWS a lancé une nouvelle fonctionnalité de mise en cache de modèles pour Amazon SageMaker Inference sur HyperPod, destinée à réduire drastiquement les temps de démarrage à froid lors du déploiement de grands modèles de langage. Jusqu'à présent, chaque nouveau pod d'inférence devait suivre deux téléchargements séquentiels avant de pouvoir traiter la moindre requête : l'image du conteneur du serveur d'inférence depuis Amazon ECR, puis les poids du modèle depuis une source de stockage comme Amazon S3, Amazon FSx for Lustre ou HuggingFace Hub. Pour les images de serveurs comme vLLM ou LMI, qui embarquent pilotes GPU, bibliothèques CUDA et framework de service, ce seul téléchargement prend entre 5 et 7 minutes. Pour les poids d'un modèle de 145 Go stocké sur S3, il faut compter plus de 20 minutes supplémentaires, et pour un modèle massif comme DeepSeek-R1, qui dépasse 600 Go, l'attente grimpe à plus de 30 minutes avant qu'une seule requête puisse être servie. Avec le nouveau système de cache, les poids et les images sont préchargés sur les nœuds du cluster avant même que les pods en aient besoin, ce qui permet une lecture depuis un stockage NVMe local à environ 7 Go/s au lieu d'un téléchargement réseau, ramenant le temps de démarrage à quelques secondes.

2 min de lecturePertinence 49

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette avancée change concrètement la donne pour l'autoscaling en production. Lorsqu'un pic de trafic déclenche le HorizontalPodAutoscaler et que celui-ci demande, par exemple, cinq nouveaux pods, chacun devait auparavant répéter indépendamment tout le cycle de téléchargement : même si la politique d'autoscaling réagissait en quelques secondes, le temps réel avant de pouvoir absorber le trafic supplémentaire atteignait 25 à 30 minutes, voire plus. Pour les équipes qui opèrent des modèles volumineux en production, ce délai représentait un goulot d'étranglement critique, capable de provoquer des dégradations de service lors de montées en charge soudaines. En réduisant ce temps à quelques secondes, AWS permet aux entreprises de dimensionner leurs déploiements d'inférence de façon beaucoup plus réactive, sans sacrifier la disponibilité du service ni sur-provisionner en permanence des ressources coûteuses en GPU pour anticiper les pics.

Techniquement, la fonctionnalité repose sur deux composants indépendants et activables séparément : un cache de poids et un cache d'images. Il suffit d'ajouter la configuration modelCacheConfig avec l'option weightsCache activée dans la ressource InferenceEndpointConfig ou JumpStartModel. L'opérateur d'inférence HyperPod crée alors automatiquement une ressource ModelDataCacheConfig, télécharge les poids sur le stockage NVMe local de tous les nœuds ciblés, puis étiquette chaque nœud comme prêt dès que le cache est disponible, avant de lancer le déploiement d'inférence. Le cache reste disponible lors des redémarrages de pods sur un même nœud, et les nouveaux pods qui atterrissent sur des nœuds déjà en cache démarrent immédiatement, ce qui s'inscrit dans la stratégie plus large d'AWS visant à rendre l'infrastructure GPU pour l'IA générative plus efficace et plus rentable à exploiter.

Impact France / UEChamp produit par Le Fil IA

Les entreprises européennes déployant des LLM sur AWS SageMaker pourraient bénéficier de cette réduction des temps de démarrage, mais aucune régulation ou acteur européen n'est concerne directement.

Notre lecture

Le vrai problème, c'était jamais le calcul, c'était l'attente : 30 minutes pour qu'un pod DeepSeek-R1 daigne répondre à la première requête, pendant qu'un pic de trafic passe. Le cache NVMe local, ça ramène ça à quelques secondes, et c'est exactement le genre de plomberie invisible qui rend l'autoscaling GPU crédible en prod plutôt que théorique. Ce qu'AWS montre surtout, c'est que le vrai goulot d'étranglement de l'inférence à grande échelle n'est plus le silicium, c'est le réseau de stockage qu'on a construit autour.

À lire ensuite

01La mise en cache des conteneurs dans Amazon SageMaker AI accélère le déploiement des modèles41AWS ML BlogInfrastructure 02Renforcement de l'inférence entreprise sur Amazon SageMaker HyperPod grâce à l'intégration de Hugging Face, NVMe et Route 5331AWS ML BlogInfrastructure 03Réduire la latence des LLM grâce au routage sensible aux préfixes sur Amazon SageMaker Inference49AWS ML BlogInfrastructure 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.