Aller au contenu principal
Infrastructure · Actu ·

Nouvelles fonctionnalités Ray sur SageMaker HyperPod

Amazon lance de nouvelles capacités Ray sur SageMaker HyperPod, son infrastructure dédiée à l'entraînement et au déploiement de modèles de fondation, en les intégrant directement à Amazon SageMaker Studio. Ray est un framework open source utilisé par les data scientists pour distribuer des charges de travail Python sur des clusters de GPU, notamment via Ray Train pour l'entraînement distribué et Ray Serve pour le déploiement de modèles. Sur Kubernetes, ces clusters Ray sont pilotés par KubeRay, un opérateur open source qui gère leur cycle de vie via des ressources personnalisées comme RayCluster, RayJob et RayService. Jusqu'à présent, faire tourner Ray sur Kubernetes obligeait les équipes à écrire des manifestes YAML, reconstruire des images Docker à chaque changement de dépendance, configurer manuellement un tunnel kubectl pour accéder au tableau de bord Ray, et déployer Prometheus et Grafana pour la supervision. Avec cette mise à jour, tout se fait désormais depuis SageMaker Studio : création de clusters Ray, ouverture des tableaux de bord Ray et Amazon Managed Grafana, connexion à un espace de travail JupyterLab ou Code Editor, soumission de jobs distribués et détection des tâches bloquées.

2 min de lecturePertinence 48
Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette simplification vise à lever un frein technique majeur pour les équipes de machine learning à grande échelle : la complexité opérationnelle de Kubernetes. En automatisant la gestion de l'infrastructure, Amazon permet aux data scientists de se concentrer sur leurs modèles plutôt que sur l'écriture de manifestes ou la configuration d'outils d'observabilité. Les jobs d'entraînement Ray bénéficient désormais d'une tolérance aux pannes automatique grâce à la surveillance et à la récupération des nœuds intégrées à HyperPod, ainsi que d'un système de checkpointing hiérarchisé qui accélère la reprise après incident via le stockage distribué à plusieurs niveaux de HyperPod. Du côté du déploiement, l'intégration avec SageMaker JumpStart permet de charger directement des poids de modèles dans des endpoints Ray Serve, avec un déchargement du cache KV vers un stockage hiérarchisé pour traiter des requêtes à contexte long. Ces fonctionnalités restent compatibles avec KubeRay et les API Ray standards, ce qui signifie que les scripts et workflows existants continuent de fonctionner sans modification, un point clé pour éviter de bloquer les équipes déjà investies dans cet écosystème.

Cette annonce s'inscrit dans la compétition croissante entre fournisseurs cloud pour simplifier l'entraînement de modèles de fondation à grande échelle, un segment où AWS, Google Cloud et Microsoft Azure cherchent chacun à réduire la friction opérationnelle liée à Kubernetes. Pour profiter de ces nouveautés, les utilisateurs doivent disposer d'un cluster SageMaker HyperPod orchestré par Amazon EKS, avec plusieurs composants installés : l'add-on EKS SageMaker Spaces pour les espaces JupyterLab et Code Editor, l'add-on EKS HyperPod Observability pour la collecte de métriques et les tableaux de bord Grafana, l'opérateur KubeRay, ainsi qu'un chart Helm appelé HyperPod Ray Endpoint Operator pour générer des points d'accès authentifiés. Un éditeur YAML en ligne reste disponible pour les utilisateurs avancés préférant kubectl. Cette approche hybride, entre interface simplifiée et accès bas niveau conservé, illustre la stratégie d'AWS consistant à abaisser la barrière à l'entrée sans sacrifier la flexibilité attendue par les équipes d'infrastructure ML les plus expérimentées.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Bonnes pratiques pour l'inférence sur Amazon SageMaker HyperPod38AWS ML BlogInfrastructure 02Déploiement de Kimi K3 sur Amazon SageMaker HyperPod et Amazon EKS44AWS ML BlogInfrastructure 03Renforcement de l'inférence entreprise sur Amazon SageMaker HyperPod grâce à l'intégration de Hugging Face, NVMe et Route 5331AWS ML BlogInfrastructure 
Dossier · MicrosoftSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.