Aller au contenu principal
Infrastructure · Actu ·

Entraînement multi-région avec Amazon SageMaker HyperPod et Qumulo

Amazon Web Services a dévoilé une solution combinant son service Amazon SageMaker HyperPod avec la technologie de stockage Cloud Native Qumulo (CNQ) et le Cloud Data Fabric (CDF) de Qumulo, permettant d'entraîner des modèles d'IA dans une région AWS tout en gardant les données d'entraînement stockées dans une autre région, ou même sur site. L'équipe a validé cette approche en exécutant le même job d'entraînement sur deux clusters distincts : un cluster "hub" situé dans la région US East (Ohio, us-east-2), co-localisé avec les données, et un cluster "spoke" dans la région US West (Oregon, us-west-2), qui accède aux mêmes données à distance via CDF avec une latence réseau de 60 millisecondes. Après une courte phase de préchauffage de 100 à 150 batches, le cluster distant a atteint un débit identique à celui du cluster co-localisé, entre 115 et 117 échantillons par seconde, avec une utilisation des GPU grimpant à 98-100%, contre 80-90% lors de la phase initiale. Le système repose sur un montage NFS local à chaque cluster, une liaison VPC peering entre les régions, et un cache prédictif appelé NeuralCache qui apprend les schémas d'accès du chargeur de données pour servir les fichiers depuis de la mémoire NVMe locale.

3 min de lecturePertinence 49

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette avancée répond à un dilemme classique de l'entraînement de grands modèles d'IA : la capacité GPU idéale et les données d'entraînement ne se trouvent pas toujours dans la même région cloud, obligeant jusqu'ici les équipes à choisir entre dupliquer des pétaoctets de données entre régions, avec les coûts de stockage et de transfert que cela implique, ou accepter une latence réseau pénalisante sur chaque lecture, au détriment du débit d'entraînement. En rendant cette latence transparente après une phase de préchauffage négligeable à l'échelle, moins de 1% du temps total au-delà de 10 000 batches et moins de 0,1% au-delà de 100 000, la solution permet aux entreprises de conserver leurs modèles à jour sans sacrifier la vitesse d'entraînement ni multiplier les copies de données. Pour les équipes qui gèrent des infrastructures d'IA distribuées entre plusieurs régions ou entre le cloud et leurs centres de données on-premises, cela représente une simplification opérationnelle notable et une réduction potentielle des coûts de stockage redondant, un enjeu de plus en plus critique à mesure que les jeux de données d'entraînement atteignent des tailles de plusieurs pétaoctets.

Cette annonce s'inscrit dans la tendance plus large de désolidarisation entre le calcul et le stockage dans les infrastructures d'IA à grande échelle, un sujet devenu central alors que les entreprises déploient des clusters de GPU comme les instances p5.48xlarge d'AWS dans des régions choisies pour leur disponibilité en capacité plutôt que pour leur proximité avec les données. SageMaker HyperPod, le service géré d'AWS pour l'entraînement résilient de modèles, apporte de son côté la gestion automatisée des pannes, le remplacement de nœuds et la récupération des points de contrôle, tandis que Qumulo apporte son expertise en architecture de stockage cloud-native capable de scaler ses performances indépendamment du volume de données stocké. Les deux entreprises évoquent des taux d'utilisation GPU proches de 99% et une saturation réseau des instances les plus puissantes avec des opérations de données sous les 3 millisecondes, des chiffres qui, si confirmés à plus grande échelle par d'autres utilisateurs, pourraient inciter davantage d'organisations à répartir géographiquement leurs charges de travail d'entraînement plutôt qu'à les concentrer dans une seule région.

Impact France / UEChamp produit par Le Fil IA

Les entreprises européennes utilisant les régions AWS pourraient bénéficier de cette architecture pour entrainer des modèles sans dupliquer leurs données entre régions, mais aucun acteur ou réglementation français/européen n'est implique ici.

À lire ensuite

01Accélération de l'entraînement RL multimodal avec SkyRL sur Amazon SageMaker HyperPod48AWS ML BlogInfrastructure 02Déploiement de Kimi K3 sur Amazon SageMaker HyperPod et Amazon EKS44AWS ML BlogInfrastructure 03AWS met à l'échelle des modèles de fondation sismiques : entraînement distribué avec Amazon SageMaker HyperPod et extension des fenêtres de contexte39AWS ML BlogInfrastructure 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.