Accélération de l'entraînement RL multimodal avec SkyRL sur Amazon SageMaker HyperPod
Amazon a publié un guide technique détaillant l'utilisation de SageMaker HyperPod, son infrastructure de calcul pour l'apprentissage automatique à grande échelle, afin d'entraîner par renforcement un modèle vision-langage capable de résoudre des labyrinthes visuels. L'expérience s'appuie sur SkyRL, un framework open source de reinforcement learning, pour entraîner Qwen3-VL-8B à l'aide de la méthode GRPO (Group Relative Policy Optimization), une technique où le modèle joue plusieurs fois le même labyrinthe sous sa politique actuelle avant d'ajuster ses paramètres selon les résultats obtenus. En partant d'un point de départ affiné par apprentissage supervisé, le checkpoint SFT de VisGym, ce post-entraînement par GRPO a fait passer le taux de réussite du modèle de 43,75 % à plus de 95 % sur un ensemble fixe de 64 labyrinthes d'évaluation. Pour reproduire cette expérience, Amazon précise qu'il faut un cluster HyperPod orchestré via Amazon EKS comprenant au moins trois instances ml.g7e.12xlarge et une instance ml.r5d.16xlarge, ainsi que plusieurs opérateurs Kubernetes (KubeRay, le module d'observabilité HyperPod, l'opérateur Ray Endpoint) et un système de fichiers Amazon FSx for Lustre pour stocker les checkpoints et les adaptateurs LoRA.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Cette démonstration illustre une tendance de fond dans le développement d'agents fondés sur des modèles de langage : le post-entraînement par renforcement multi-tours devient une étape quasi obligatoire pour apprendre à un modèle à raisonner et agir sur des séquences d'étapes, plutôt que de simplement produire une réponse ponctuelle. Contrairement au RL classique qui récompense une seule sortie, l'apprentissage multi-tours évalue un agent sur l'ensemble d'un épisode, ce qui pose un défi d'infrastructure particulier lorsque les récompenses sont rares (ici, seulement 1,0 point si le labyrinthe est résolu dans la limite de coups impartie). Pour les entreprises qui développent des agents IA capables de percevoir des images et d'agir en conséquence, comme la navigation dans des interfaces visuelles ou des environnements physiques, ce type d'entraînement nécessite des clusters GPU capables de tourner en continu pendant des centaines d'heures sans perdre la progression accumulée.
L'enjeu principal que résout SageMaker HyperPod est la résilience de ces longs entraînements distribués. Grâce à une surveillance continue de l'état des nœuds et au remplacement automatique des nœuds défaillants, combinés à un système de checkpointing régulier, un job d'entraînement peut reprendre à sa dernière étape sauvegardée plutôt que de repartir de zéro après une panne matérielle, un risque bien réel sur des clusters multi-nœuds tournant plusieurs jours. Amazon met également en avant l'intégration avec Ray, qui permet de créer des clusters directement depuis SageMaker Studio, de soumettre des jobs à distance de façon sécurisée, et de suivre l'entraînement via des tableaux de bord Amazon Managed Grafana générés automatiquement. Ces briques s'inscrivent dans la compétition entre fournisseurs cloud pour capter les charges de travail d'entraînement d'agents IA multimodaux, un segment en forte croissance à mesure que les modèles de langage évoluent vers des capacités d'action et de perception combinées.
Pas d'impact direct sur la France/UE