Aller au contenu principal
Infrastructure · Actu ·

Mise à l'échelle du RL pour MoE sur Amazon EKS avec EFA et DeepEP : 40 % de débit en plus

Amazon Web Services a détaillé une architecture technique permettant d'accélérer de 40 % l'entraînement par renforcement des modèles de langage à architecture Mixture-of-Experts (MoE), en combinant trois briques de son infrastructure cloud : Amazon Elastic Kubernetes Service (EKS), l'interconnexion réseau Elastic Fabric Adapter (EFA) et la bibliothèque de communication DeepEP. Cette solution cible spécifiquement la phase de post-entraînement par renforcement, qu'il s'agisse de RLHF (reinforcement learning from human feedback, méthode reposant sur l'algorithme PPO et un modèle critique pour estimer la valeur des actions) ou de GRPO (group relative policy optimization), une approche plus récente qui se passe de ce modèle critique en utilisant des récompenses relatives calculées par groupes. Les modèles MoE, devenus la norme pour faire passer les grands modèles de langage à l'échelle de centaines de milliards, voire de milliers de milliards de paramètres tout en gardant une inférence économe grâce à leur structure creuse (sparsity), doivent malgré tout traverser les étapes classiques de pré-entraînement, entraînement intermédiaire, fine-tuning supervisé puis renforcement, cette dernière étape étant la plus gourmande en ressources réseau.

2 min de lecturePertinence 49

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette annonce répond à un problème d'infrastructure très concret pour les équipes qui entraînent des modèles à grande échelle : plus les architectures MoE deviennent creuses pour réduire les coûts d'inférence, plus leur entraînement devient limité par la communication entre accélérateurs plutôt que par leur puissance de calcul brute. Le parallélisme d'experts (Expert Parallelism), technique qui distribue les blocs d'experts sur différents accélérateurs, impose un routage dynamique des tokens en tout-à-tous (all-to-all) entre les machines, qui s'ajoute aux schémas de communication déjà denses du parallélisme tensoriel, du parallélisme de données et du parallélisme de pipeline. Dans les boucles d'entraînement par renforcement asynchrones, deux charges de travail doivent rester synchronisées en permanence : la génération de rollouts (inférence massive orientée débit) et l'entraînement de la politique, fortement couplé et exigeant en bande passante. Un déséquilibre entre les deux se traduit soit par des workers d'inférence à l'arrêt, soit par des accélérateurs d'entraînement inutilisés, un gaspillage de ressources coûteux à l'échelle de centaines de puces.

Ce chantier illustre les tensions croissantes entre les fournisseurs de cloud et les laboratoires d'IA autour de l'optimisation matérielle du renforcement à grande échelle, un maillon devenu critique depuis la généralisation des modèles raisonneurs entraînés par RL. AWS positionne ici EKS comme orchestrateur capable de gérer dynamiquement l'équilibre entre les sous-systèmes hétérogènes, EFA comme couche réseau à haut débit pour absorber le trafic inter-nœuds, et DeepEP, une bibliothèque de communication optimisée pour le parallélisme d'experts, comme moyen de faire transiter efficacement ce trafic sur EFA. Cette architecture s'inscrit dans une course plus large entre fournisseurs cloud pour réduire le coût et le temps d'entraînement des modèles de nouvelle génération, alors que les besoins en calcul pour le post-entraînement par renforcement continuent d'augmenter avec la taille et la sparsité croissantes des modèles MoE.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01« Mise en œuvre de patterns de résilience avec Amazon Bedrock et une passerelle LLM »33AWS ML BlogInfrastructure 02NVIDIA et AWS s'associent pour déployer l'IA en production à grande échelle47NVIDIA AI BlogInfrastructure 03Accélération de l'entraînement RL multimodal avec SkyRL sur Amazon SageMaker HyperPod48AWS ML BlogInfrastructure 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.