NVIDIA AI présente Molt, un framework d'apprentissage par renforcement à base d'agents, natif PyTorch
NVIDIA a dévoilé Molt, un nouveau framework d'apprentissage par renforcement agentique développé par l'équipe NeMo et conçu nativement pour PyTorch. Son objectif affiché est de réduire drastiquement la complexité du code : environ 8 600 lignes composent la partie RL du projet, contre 62 000 pour verl, 25 000 pour slime et 7 200 pour OpenRLHF, des chiffres obtenus en traçant le graphe d'imports depuis le point d'entrée RL de chaque framework. Publié sous licence Apache 2.0, Molt est livré avec des scripts de lancement, des configurations Slurm et un conteneur préconstruit. Les recettes fournies supposent une infrastructure de deux nœuds de huit GPU H100 chacun, répartis entre huit unités dédiées à l'entraînement et huit au rollout. Techniquement, le framework assemble trois briques existantes sans les modifier : Ray pour l'orchestration et les files asynchrones, vLLM pour la génération, et NVIDIA AutoModel avec FSDP2 pour l'entraînement, ce qui permet d'intégrer les mises à jour de ces projets sans réécrire le code.
Cette approche vise directement les chercheurs confrontés à un problème récurrent en RL agentique : chaque nouvelle idée, qu'il s'agisse d'un estimateur, d'une étape de pipeline ou d'un schéma de rollout, doit habituellement traverser plusieurs couches de code d'entraînement et de distribution avant d'être testée. Un code plus compact, que même un assistant de codage IA peut analyser dans son intégralité, réduit ce coût d'itération. Molt cible ainsi les laboratoires de pointe, les startups IA bien financées travaillant sur le post-entraînement, les équipes de recherche en entreprise dans la finance, la santé ou la robotique qui entraînent des agents sur des environnements propriétaires, ainsi que les laboratoires académiques disposant d'un accès multi-nœuds à des GPU H100 ou H200. Les cas d'usage couverts incluent les agents conversationnels multi-tours utilisant des outils, les agents d'exécution de code, les environnements vision-langage, les boucles de récompense fondées sur un LLM juge, et la distillation sur un modèle étudiant plus petit.
Sur le plan architectural, Molt fait tourner un pool d'agents, un ensemble de moteurs vLLM derrière un routeur de requêtes, et un unique acteur de politique entraînable, avec un mécanisme de rollout partiel qui diffuse les poids de l'acteur par NCCL sans interrompre les requêtes en cours. Un agent se définit comme un simple module Python exportant un AgentRunner, utilisable via deux interfaces : une boucle gérée par le framework, ou une boucle pilotée par l'utilisateur via un SDK OpenAI ou Anthropic standard. Trois garanties de cohérence structurent le système, notamment un mécanisme de rejeu du routage pour les modèles à mélange d'experts, où les choix de routage effectués pendant la génération sont reproduits fidèlement lors de l'entraînement.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




