Aller au contenu principal
Infrastructure · Actu ·

Amazon SageMaker AI ajoute des listes de préférence d'instances pour les jobs d'entraînement

Amazon Web Services a annoncé une nouvelle fonctionnalité pour Amazon SageMaker AI baptisée "instance preference lists", disponible pour les tâches d'entraînement (Training Jobs) et de traitement (Processing Jobs). Concrètement, au lieu de réserver un seul type d'instance GPU pour un job, les équipes peuvent désormais soumettre une liste ordonnée d'au maximum cinq types d'instances acceptables. SageMaker AI évalue alors cette liste par ordre de priorité au moment de la création du job et lance automatiquement le travail sur le premier type d'instance disponible. La fonctionnalité s'intègre également avec les Flexible Training Plans (FTP), les plans de capacité réservée d'AWS : une organisation disposant d'une réservation peut demander qu'elle soit évaluée en premier, puis basculer automatiquement vers une capacité à la demande si le plan réservé est épuisé, sans avoir à resoumettre de requête.

2 min de lecturePertinence 47

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette annonce répond à un problème très concret pour les équipes qui entraînent des modèles d'IA à grande échelle : lors des pics de demande, les GPU préférés ne sont pas toujours disponibles immédiatement, et un job figé sur une seule configuration matérielle doit alors attendre ou être relancé manuellement. Pour contourner ce problème, de nombreuses équipes avaient développé des scripts de relance personnalisés qui interrogent le statut des jobs, annulent les requêtes bloquées et les resoumettent avec un autre type d'instance, une approche jugée fragile et coûteuse en maintenance. Le risque est particulièrement critique pour les charges de travail sensibles au temps, comme les pipelines de réentraînement nocturnes, les campagnes de fine-tuning en production ou les traitements de données planifiés, où une erreur de type "InsufficientCapacityError" survenant en pleine nuit peut retarder la mise à jour d'un modèle. En laissant la plateforme évaluer plusieurs types d'instances en un seul appel API, AWS promet des démarrages de jobs plus rapides, une meilleure utilisation de la capacité disponible, et surtout un allègement de la charge opérationnelle des équipes d'ingénierie.

Cette évolution s'inscrit dans un contexte plus large de pénurie et de forte tension sur l'accès aux GPU pour l'entraînement de modèles d'IA, un enjeu qui touche l'ensemble de l'industrie du cloud alors que la demande de calcul explose avec la multiplication des modèles de langage et des projets de fine-tuning. AWS cherche ainsi à simplifier l'accès à cette capacité limitée sans complexifier le travail des équipes techniques, en internalisant dans SageMaker AI une logique d'arbitrage que beaucoup de clients devaient auparavant coder eux-mêmes. Reste à voir si d'autres fournisseurs cloud, comme Google Cloud ou Microsoft Azure, proposeront des mécanismes similaires pour leurs propres services d'entraînement de modèles, dans une course où la disponibilité effective du matériel devient un argument commercial aussi important que sa puissance brute.

Impact France / UEChamp produit par Le Fil IA

Les entreprises et laboratoires européens utilisant Amazon SageMaker pour entrainer leurs modèles pourraient bénéficier de démarrages de jobs plus rapides et d'une meilleure disponibilité des GPU, sans qu'aucune législation européenne ne soit concernée.

À lire ensuite

01Inférence adaptée à la capacité : basculement automatique entre instances pour les endpoints SageMaker AI38AWS ML BlogInfrastructure 02Amazon SageMaker AI accélère l'inférence d'IA générative avec les instances G7e41AWS ML BlogInfrastructure 03Optimiser l'entraînement des modèles sur Amazon SageMaker AI avec NVIDIA Blackwell43AWS ML BlogInfrastructure 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.