Aller au contenu principal
LLMs · Tuto ·

Tulu 3 d'AllenAI : post-entraînement avec SFT, DPO, RLVR, GRPO et évaluation par vérificateurs

AllenAI a publié un tutoriel technique détaillant la reconstruction complète du pipeline de post-entraînement Tulu 3, initialement conçu pour des clusters multi-GPU, afin de le faire tenir sur une seule carte graphique disposant de 16 Go de mémoire, comme celles proposées gratuitement sur Google Colab. Le guide s'appuie sur le framework open source Open Instruct d'AllenAI et enchaîne trois étapes d'entraînement : le fine-tuning supervisé (SFT), l'optimisation directe des préférences (DPO), puis l'apprentissage par renforcement à récompenses vérifiables (RLVR) via l'algorithme GRPO. Le code clone le dépôt Open Instruct, réutilise ses fonctions natives de calcul de perte et d'utilitaires, configure des adaptateurs LoRA pour limiter le nombre de paramètres entraînés, et prépare le jeu de données mathématiques GSM8K pour chacune des trois phases. Des vérificateurs déterministes contrôlent ensuite si les réponses générées par le modèle aux problèmes de mathématiques sont correctes, servant de signal de récompense pour la phase RLVR. Les composants distribués d'origine, vLLM, les acteurs Ray, DeepSpeed et les files de rollout asynchrones, sont remplacés par des implémentations légères reposant sur Hugging Face et PyTorch.

2 min de lecturePertinence 51
Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette démonstration a une portée pratique importante pour la communauté du machine learning : elle rend accessible à des développeurs individuels ou de petites équipes une chaîne d'entraînement qui reproduit fidèlement la logique d'optimisation utilisée pour des modèles de référence, sans nécessiter l'infrastructure coûteuse habituellement associée à ce type de travaux. Le fait de conserver les fonctions de perte et les mécanismes d'origine, plutôt que de les réécrire de zéro, garantit que les résultats obtenus restent comparables à ceux du pipeline officiel, ce qui est précieux pour l'expérimentation, l'enseignement et la recherche reproductible. L'utilisation de récompenses vérifiables sur des problèmes mathématiques illustre aussi une tendance plus large dans l'entraînement des modèles de raisonnement, où des critères de correction objectifs remplacent des évaluations humaines coûteuses.

Tulu 3 est la famille de modèles ouverts développée par l'Allen Institute for AI, conçue pour rivaliser avec des modèles propriétaires tout en documentant intégralement ses recettes de post-entraînement. Open Instruct constitue l'infrastructure logicielle qui sous-tend cet entraînement, habituellement pensée pour tourner sur de larges clusters GPU avec des outils comme Ray ou DeepSpeed. La technique GRPO, popularisée notamment par les travaux sur les modèles de raisonnement de type DeepSeek R1, associe apprentissage par renforcement et vérification automatique des réponses pour améliorer les capacités de raisonnement sans supervision humaine directe. En proposant une version simplifiée exécutable sur une configuration modeste, ce tutoriel s'inscrit dans un mouvement plus vaste visant à démocratiser l'accès aux méthodes avancées d'alignement et de raisonnement des grands modèles de langage, ouvrant la voie à davantage d'expérimentation indépendante et de reproductibilité scientifique dans ce domaine.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Entraîner Gemma-3 au raisonnement mathématique structuré avec Tunix GRPO, adaptateurs LoRA et récompenses GSM8K34MarkTechPostLLMs 02Hugging Face publie TRL v1.0 : une suite unifiée pour l'entraînement post-initial (SFT, DPO, GRPO)48MarkTechPostLLMs 03Apprentissage par renforcement avec récompenses vérifiables via GRPO sur SageMaker AI38AWS ML BlogLLMs 
Dossier · Hugging FaceSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.