Moonshot AI publie en open source MoonEP, une bibliothèque de parallélisme d'experts équilibrée pour l'entraînement de modèles MoE
Moonshot AI a publié en open source MoonEP, une bibliothèque de communication pour le parallélisme d'experts (Expert Parallelism) destinée à l'entraînement distribué de modèles Mixture-of-Experts, sous licence MIT. Cette annonce s'inscrit dans le cadre du Kimi K3 Open Day, journée durant laquelle l'entreprise a dévoilé les poids du modèle K3 ainsi que son rapport technique, accompagnés de trois briques d'infrastructure logicielle : MoonEP, FlashKDA et AgentEnv. FlashKDA avait déjà été ouvert précédemment, tandis que MoonEP et AgentEnv sont publiés pour la première fois avec cette sortie. Moonshot présente MoonEP comme l'une des innovations ayant permis un gain de 2,5 fois en efficacité de mise à l'échelle pour Kimi K3, un modèle MoE de 2 800 milliards de paramètres doté d'une vision native et d'une fenêtre de contexte d'un million de tokens. Sur le plan technique, la bibliothèque s'attaque au déséquilibre de routage entre experts, mesuré par une métrique appelée maxvio, en garantissant que chaque rang de calcul reçoive exactement S multiplié par K tokens, quel que soit le déséquilibre du routeur, grâce à une planification dynamique d'experts redondants directement dérivée des sorties du routeur en temps réel. Le système repose sur un noyau de planification GPU quasi optimal, implémenté avec le langage CUTLASS CuTe, et sur une architecture à copie nulle avec des formes statiques qui éliminent la synchronisation hôte à chaque couche.
Ce déséquilibre de routage est un problème structurel majeur pour l'entraînement de grands modèles MoE : la latence d'une opération collective est dictée par son participant le plus lent, donc le rang le plus sollicité détermine la durée de chaque itération d'entraînement. Ce phénomène fragmente aussi la mémoire GPU puisque le nombre de tokens traités par rang varie à chaque étape. En imposant une charge parfaitement équilibrée et des formes de mémoire prévisibles, MoonEP permet de réduire ces coûts cachés et d'accélérer l'entraînement de modèles à très grande échelle, un enjeu crucial à mesure que les architectures MoE comptant plusieurs milliers de milliards de paramètres se généralisent chez les grands laboratoires d'IA.
La publication s'accompagne d'indications précises d'usage : pour l'entraînement, le nombre d'emplacements de préchargement B doit être fixé à E divisé par R, garantissant que tout expert distant sollicité reste local au groupe de calcul GEMM ; pour l'inférence, une valeur plus faible, entre 3 et 4, est recommandée. Cette ouverture de code s'inscrit dans une dynamique plus large où les laboratoires chinois d'IA, dont Moonshot AI, DeepSeek ou Alibaba, publient de plus en plus leurs briques d'infrastructure d'entraînement, contribuant à démocratiser les techniques nécessaires pour entraîner des modèles MoE à l'échelle du trillion de paramètres, jusque-là réservées à une poignée d'acteurs disposant de ressources massives.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




