Aller au contenu principal
OutilsMarkTechPost · 2 min de lecture

Moonshot AI publie en open source MoonEP, une bibliothèque de parallélisme d'experts équilibrée pour l'entraînement de modèles MoE

Source originale ↗·

Moonshot AI a publié en open source MoonEP, une bibliothèque de communication pour le parallélisme d'experts (Expert Parallelism) destinée à l'entraînement distribué de modèles Mixture-of-Experts, sous licence MIT. Cette annonce s'inscrit dans le cadre du Kimi K3 Open Day, journée durant laquelle l'entreprise a dévoilé les poids du modèle K3 ainsi que son rapport technique, accompagnés de trois briques d'infrastructure logicielle : MoonEP, FlashKDA et AgentEnv. FlashKDA avait déjà été ouvert précédemment, tandis que MoonEP et AgentEnv sont publiés pour la première fois avec cette sortie. Moonshot présente MoonEP comme l'une des innovations ayant permis un gain de 2,5 fois en efficacité de mise à l'échelle pour Kimi K3, un modèle MoE de 2 800 milliards de paramètres doté d'une vision native et d'une fenêtre de contexte d'un million de tokens. Sur le plan technique, la bibliothèque s'attaque au déséquilibre de routage entre experts, mesuré par une métrique appelée maxvio, en garantissant que chaque rang de calcul reçoive exactement S multiplié par K tokens, quel que soit le déséquilibre du routeur, grâce à une planification dynamique d'experts redondants directement dérivée des sorties du routeur en temps réel. Le système repose sur un noyau de planification GPU quasi optimal, implémenté avec le langage CUTLASS CuTe, et sur une architecture à copie nulle avec des formes statiques qui éliminent la synchronisation hôte à chaque couche.

Ce déséquilibre de routage est un problème structurel majeur pour l'entraînement de grands modèles MoE : la latence d'une opération collective est dictée par son participant le plus lent, donc le rang le plus sollicité détermine la durée de chaque itération d'entraînement. Ce phénomène fragmente aussi la mémoire GPU puisque le nombre de tokens traités par rang varie à chaque étape. En imposant une charge parfaitement équilibrée et des formes de mémoire prévisibles, MoonEP permet de réduire ces coûts cachés et d'accélérer l'entraînement de modèles à très grande échelle, un enjeu crucial à mesure que les architectures MoE comptant plusieurs milliers de milliards de paramètres se généralisent chez les grands laboratoires d'IA.

La publication s'accompagne d'indications précises d'usage : pour l'entraînement, le nombre d'emplacements de préchargement B doit être fixé à E divisé par R, garantissant que tout expert distant sollicité reste local au groupe de calcul GEMM ; pour l'inférence, une valeur plus faible, entre 3 et 4, est recommandée. Cette ouverture de code s'inscrit dans une dynamique plus large où les laboratoires chinois d'IA, dont Moonshot AI, DeepSeek ou Alibaba, publient de plus en plus leurs briques d'infrastructure d'entraînement, contribuant à démocratiser les techniques nécessaires pour entraîner des modèles MoE à l'échelle du trillion de paramètres, jusque-là réservées à une poignée d'acteurs disposant de ressources massives.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

NVIDIA AI publie 'OpenShell' en open source : un environnement d'exécution sécurisé pour les agents IA autonomes
1MarkTechPost 

NVIDIA AI publie 'OpenShell' en open source : un environnement d'exécution sécurisé pour les agents IA autonomes

NVIDIA franchit une étape importante dans la sécurisation des agents IA autonomes en publiant OpenShell en open source sous licence Apache 2.0. Cet environnement d'exécution dédié répond à un problème concret : les agents capables d'exécuter du code et d'interagir avec des systèmes fichiers ou des endpoints réseau représentent une surface d'attaque bien plus large que les applications LLM classiques, limitées aux échanges textuels. L'enjeu est de taille pour l'industrie. Jusqu'ici, la sécurité des agents autonomes reposait principalement sur l'alignement interne du modèle, une approche jugée insuffisante face à des risques d'exécution de commandes non souhaitées ou d'accès non autorisé à des données sensibles. OpenShell introduit une couche de sécurité externe et explicite, indépendante du comportement du modèle, ce qui représente un changement de paradigme pour les équipes de développement. Techniquement, la solution s'articule autour de trois piliers. D'abord, un sandbox à isolation kernel qui confine tout code généré, scripts Python, commandes Bash, dans un espace restreint. Ensuite, un moteur de politiques granulaire permettant un contrôle par binaire (git, curl, python), par endpoint réseau et par méthode d'API, avec un journal d'audit complet de chaque action. Enfin, un mécanisme de routage d'inférence privé qui intercepte le trafic modèle pour éviter les fuites de données vers des fournisseurs cloud externes. Point clé : OpenShell est agent-agnostique, il fonctionne sans modification avec Claude Code, Codex, LangChain ou tout autre framework existant, via une simple CLI et une interface TUI pour le monitoring en temps réel. La prise en charge d'exécution distante (openshell sandbox create --remote user@host) ouvre également la voie à des déploiements sur clusters GPU haute performance, ce qui positionne NVIDIA non seulement comme fournisseur de matériel, mais comme acteur central de l'infrastructure logicielle pour agents IA en production.

UEOpenShell peut être adopté par les développeurs et entreprises européens pour sécuriser leurs agents IA autonomes, en répondant aux exigences de traçabilité et de contrôle imposées par l'AI Act européen.

OutilsOutil
1 source
AutoAgent : la bibliothèque open source qui permet à une IA d'optimiser son propre système d'agents
2MarkTechPost 

AutoAgent : la bibliothèque open source qui permet à une IA d'optimiser son propre système d'agents

Kevin Gu, ingénieur chez thirdlayer.inc, a publié AutoAgent, une bibliothèque open source qui automatise l'optimisation des agents IA. En l'espace de 24 heures d'exécution autonome, le système a atteint la première place sur SpreadsheetBench avec un score de 96,5 %, et la meilleure performance GPT-5 sur TerminalBench avec 55,1 %. Le projet est disponible sur GitHub avec une architecture délibérément minimaliste : un fichier agent.py qui contient l'intégralité du harness sous test, un fichier program.md que l'humain édite pour donner la directive, et un journal d'expériences results.tsv maintenu automatiquement par le méta-agent pour tracer l'historique de chaque run. Le principe est simple mais radical : là où un ingénieur IA passe des journées à ajuster manuellement les prompts système, les définitions d'outils et la logique d'orchestration de son agent, AutoAgent confie cette boucle d'itération à un second agent, le méta-agent, qui lit la directive, inspecte agent.py, exécute le benchmark, analyse les échecs, réécrit les parties pertinentes et recommence. L'humain ne touche jamais agent.py directement. Ce ratchet loop, proposer une modification, mesurer le score, conserver si meilleur, rejeter sinon, est directement inspiré du projet autoresearch d'Andrej Karpathy, qui applique la même logique à l'entraînement de modèles ML. AutoAgent transpose ce mécanisme au niveau du harness : le prompt système, les outils disponibles, le routage entre sous-agents et la stratégie d'orchestration. Concrètement, toute équipe qui développe des agents complexes pourrait déléguer la phase d'optimisation la plus fastidieuse à un processus nocturne entièrement automatisé, réduisant drastiquement le temps humain consacré au réglage fin. Cette publication s'inscrit dans une tendance plus large d'automatisation de l'ingénierie IA elle-même, souvent désignée sous le terme "méta-apprentissage" ou "self-improvement". Depuis que les LLMs ont démontré leur capacité à écrire et modifier du code de manière fiable, plusieurs laboratoires et chercheurs indépendants explorent des architectures où un modèle supervise l'amélioration d'un autre, ou de lui-même. AutoAgent se distingue par sa portée pratique immédiate : il ne requiert pas d'infrastructure exotique, s'appuie sur le format Harbor pour exprimer les benchmarks, et peut être adapté à n'importe quel domaine via les dossiers tasks/ et .agent/. Les résultats sur TerminalBench et SpreadsheetBench, deux benchmarks reconnus dans la communauté, donnent une crédibilité concrète à l'approche. La question ouverte reste celle du contrôle : lorsqu'un méta-agent réécrit librement la logique d'orchestration d'un système en production, les garanties de sécurité et de prévisibilité du comportement final deviennent un enjeu non trivial que la bibliothèque n'adresse pas encore explicitement.

💬 C'est exactement la boucle que tout dev d'agents rêve d'automatiser, et là quelqu'un l'a fait en un seul fichier. Le score sur SpreadsheetBench est bluffant, bon, reste à voir ce que ça donne sur des tâches moins balisées qu'un benchmark. La vraie question, c'est quand le méta-agent commence à réécrire l'orchestration en prod sans que tu comprennes pourquoi ça marche.

OutilsOutil
1 source
RightNow AI publie AutoKernel : un framework open source qui applique une boucle d'agents autonomes à l'optimisation des kernels GPU pour les modèles PyTorch
3MarkTechPost 

RightNow AI publie AutoKernel : un framework open source qui applique une boucle d'agents autonomes à l'optimisation des kernels GPU pour les modèles PyTorch

RightNow AI a publié AutoKernel, un framework open-source qui automatise l'optimisation des kernels GPU pour n'importe quel modèle PyTorch. Le principe est simple : soumettre un modèle avant de dormir et retrouver au matin des kernels Triton plus rapides, sans avoir à maîtriser la programmation GPU de bas niveau. Le système repose sur une boucle agentique autonome : un agent LLM modifie un fichier kernel.py, un banc de test vérifie la correction puis mesure le débit, et le résultat détermine si la modification est conservée ou annulée via un git reset. Chaque itération dure environ 90 secondes, ce qui permet de réaliser 300 à 400 expériences lors d'une session de 10 heures. L'agent suit un manuel d'optimisation en six niveaux encodé dans un document de 909 lignes, couvrant le réglage des tailles de blocs, les patterns d'accès mémoire, les optimisations de calcul comme TF32, les techniques avancées comme split-K, et les stratégies spécifiques aux architectures Hopper et Ampere de NVIDIA. L'enjeu est considérable pour l'industrie du machine learning. Optimiser un kernel GPU de haute performance exige de raisonner simultanément sur l'intensité arithmétique, la coalescence mémoire, la pression sur les registres, la synchronisation au niveau warp et la sélection des instructions tensor core, un ensemble de compétences qui prend des années à acquérir. Un seul kernel de multiplication matricielle performant peut représenter plus de 200 lignes de code CUDA ou Triton avec des dizaines de paramètres interdépendants. La suite de benchmarks KernelBench, qui évalue les grands modèles de langage sur 250 problèmes de kernels GPU, a montré que même les meilleurs modèles n'égalaient la baseline PyTorch que dans moins de 20 % des cas en génération directe. AutoKernel répond précisément à ce déficit en rendant cette expertise accessible sans spécialiste humain, ce qui pourrait accélérer significativement le développement et le déploiement de modèles d'IA. L'approche s'inspire directement du projet autoresearch d'Andrej Karpathy, dans lequel une boucle keep/revert appliquée à du code d'entraînement LLM avait permis de découvrir 20 optimisations en 700 expériences sur deux jours avec un seul GPU. AutoKernel transpose cette logique à l'espace des kernels, en substituant la loss de validation par un benchmark de correction et de débit comme fonction d'évaluation. La traçabilité est assurée par git, les résultats étant stockés dans un fichier TSV lisible directement par l'agent. Ce type de framework illustre une tendance plus large où les tâches d'ingénierie hautement spécialisées deviennent des cibles pour l'automatisation agentique, réduisant la dépendance aux rares experts en optimisation GPU à mesure que les architectures de modèles continuent d'évoluer.

💬 L'idée de laisser tourner une boucle agentique toute la nuit pour sortir des kernels Triton optimisés au matin, c'est exactement ce qu'on attendait depuis qu'on a vu Karpathy faire la même chose sur du code d'entraînement. La partie vraiment bien foutue, c'est le mécanisme d'évaluation : un benchmark de correction avant tout, et le git reset si ça régresse, ce qui évite de passer des heures à débugger des "optimisations" qui cassent tout. Pour les équipes sans expert CUDA dans les jambes, c'est une vraie bouffée d'air.

OutilsOutil
1 source
OpenAI publie Symphony en open source : un SPEC.md pour l'orchestration d'agents de codage autonomes
4InfoQ AI 

OpenAI publie Symphony en open source : un SPEC.md pour l'orchestration d'agents de codage autonomes

OpenAI a publié en open source Symphony, un orchestrateur d'agents de codage autonomes accompagné d'une spécification formelle baptisée SPEC.md. Le système utilise des outils de gestion de projet, comme les gestionnaires de tickets, comme plan de contrôle pour coordonner plusieurs agents travaillant en parallèle. Concrètement, Symphony découpe le travail en "tâches" distinctes, chacune confiée à un agent dédié qui progresse jusqu'à l'achèvement sans intervention humaine continue. Une fois la tâche terminée, un développeur humain examine le résultat avant de valider ou corriger. Ce modèle rompt avec l'approche actuelle où les développeurs supervisent activement chaque session de codage assistée par IA. Avec Symphony, un ingénieur peut déléguer simultanément plusieurs blocs de travail à une flotte d'agents autonomes, ce qui multiplie potentiellement la capacité de production d'une équipe sans augmenter ses effectifs. Pour les entreprises tech, cela annonce des pipelines de développement logiciel beaucoup plus automatisés, où l'humain intervient surtout en phase de validation plutôt qu'en pilotage continu. Symphony émerge dans un contexte de compétition intense autour des agents de codage autonomes. OpenAI affronte Anthropic et son assistant Claude, Google avec Gemini Code Assist, ainsi que des startups comme Cognition AI dont l'agent Devin cible explicitement ce marché. En diffusant Symphony sous forme de spécification ouverte, OpenAI tente d'influencer les standards de l'industrie et d'encourager l'adoption de son approche d'orchestration par d'autres équipes et plateformes. La prochaine étape sera de voir si SPEC.md s'impose comme référence, ou si chaque acteur développe son propre modèle propriétaire.

💬 OpenAI publie une spec ouverte, pas juste du code, et c'est exactement la stratégie qu'on adopte quand on veut que l'industrie entière s'aligne sur ton modèle d'orchestration plutôt que sur celui du voisin. Le truc intéressant dans Symphony, c'est ce glissement : le dev ne pilote plus en continu, il valide à la fin, comme un lead qui fait des code reviews plutôt que du pair-programming permanent. Ça ressemble à du vrai changement de workflow, pas du gadget.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic