Mise à l'échelle du RL pour MoE sur Amazon EKS avec EFA et DeepEP : 40 % de débit en plus
Amazon Web Services a détaillé une architecture technique permettant d'accélérer de 40 % l'entraînement par renforcement des modèles de langage à architecture Mixture-of-Experts (MoE), en combinant trois briques de son infrastructure cloud : Amazon Elastic Kubernetes Service (EKS), l'interconnexion réseau Elastic Fabric Adapter (EFA) et la bibliothèque de communication DeepEP. Cette solution cible spécifiquement la phase de post-entraînement par renforcement, qu'il s'agisse de RLHF (reinforcement learning from human feedback, méthode reposant sur l'algorithme PPO et un modèle critique pour estimer la valeur des actions) ou de GRPO (group relative policy optimization), une approche plus récente qui se passe de ce modèle critique en utilisant des récompenses relatives calculées par groupes. Les modèles MoE, devenus la norme pour faire passer les grands modèles de langage à l'échelle de centaines de milliards, voire de milliers de milliards de paramètres tout en gardant une inférence économe grâce à leur structure creuse (sparsity), doivent malgré tout traverser les étapes classiques de pré-entraînement, entraînement intermédiaire, fine-tuning supervisé puis renforcement, cette dernière étape étant la plus gourmande en ressources réseau.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Cette annonce répond à un problème d'infrastructure très concret pour les équipes qui entraînent des modèles à grande échelle : plus les architectures MoE deviennent creuses pour réduire les coûts d'inférence, plus leur entraînement devient limité par la communication entre accélérateurs plutôt que par leur puissance de calcul brute. Le parallélisme d'experts (Expert Parallelism), technique qui distribue les blocs d'experts sur différents accélérateurs, impose un routage dynamique des tokens en tout-à-tous (all-to-all) entre les machines, qui s'ajoute aux schémas de communication déjà denses du parallélisme tensoriel, du parallélisme de données et du parallélisme de pipeline. Dans les boucles d'entraînement par renforcement asynchrones, deux charges de travail doivent rester synchronisées en permanence : la génération de rollouts (inférence massive orientée débit) et l'entraînement de la politique, fortement couplé et exigeant en bande passante. Un déséquilibre entre les deux se traduit soit par des workers d'inférence à l'arrêt, soit par des accélérateurs d'entraînement inutilisés, un gaspillage de ressources coûteux à l'échelle de centaines de puces.
Ce chantier illustre les tensions croissantes entre les fournisseurs de cloud et les laboratoires d'IA autour de l'optimisation matérielle du renforcement à grande échelle, un maillon devenu critique depuis la généralisation des modèles raisonneurs entraînés par RL. AWS positionne ici EKS comme orchestrateur capable de gérer dynamiquement l'équilibre entre les sous-systèmes hétérogènes, EFA comme couche réseau à haut débit pour absorber le trafic inter-nœuds, et DeepEP, une bibliothèque de communication optimisée pour le parallélisme d'experts, comme moyen de faire transiter efficacement ce trafic sur EFA. Cette architecture s'inscrit dans une course plus large entre fournisseurs cloud pour réduire le coût et le temps d'entraînement des modèles de nouvelle génération, alors que les besoins en calcul pour le post-entraînement par renforcement continuent d'augmenter avec la taille et la sparsité croissantes des modèles MoE.
Pas d'impact direct sur la France/UE