Aller au contenu principal
LLMs · Tuto ·

Préparer les données pour le fine-tuning supervisé (partie 2) : stratégies avancées

La préparation des données pour le fine-tuning supervisé (SFT) ne s'arrête pas à un jeu de données propre et bien formaté : c'est là que commencent les questions les plus difficiles. Un second article publié sur le blog machine learning d'AWS, faisant suite à un premier volet consacré au formatage et au contrôle qualité, détaille quatre stratégies avancées appliquées aux modèles Amazon Nova mais transposables à tout modèle. Il recommande de viser environ 2 000 échantillons d'entraînement de haute qualité comme point de départ pour une tâche SFT typique, ce chiffre pouvant descendre à 500 pour un simple changement de format, ou grimper à 10 000 et plus pour un raisonnement complexe en plusieurs étapes. La méthode proposée pour calibrer précisément ce volume repose sur une analyse de courbe d'apprentissage : un seul entraînement est lancé sur l'ensemble du jeu de données, avec sauvegarde de points de contrôle intermédiaires tous les 10 à 20 % de l'entraînement, chacun étant évalué sur un jeu de données de validation représentatif du trafic réel de production.

2 min de lecturePertinence 48
Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette approche répond à un problème concret pour les équipes qui affinent des modèles : contrairement au pré-entraînement, qui suit une loi d'échelle relativement prévisible où plus de données égale de meilleures performances, le SFT ne progresse pas de façon monotone. Ajouter des données du même type au-delà d'un certain seuil de saturation, défini comme un gain inférieur à 1-2 % sur la métrique principale à chaque doublement du volume, n'améliore plus le modèle et gaspille du temps de calcul. L'article insiste sur le fait que la construction d'un benchmark d'évaluation représentatif est souvent plus difficile que la préparation des données d'entraînement elle-même, et constitue un prérequis incontournable avant toute optimisation. Pour les équipes qui personnalisent des modèles de langage à grande échelle, cette distinction change concrètement la manière d'allouer les ressources : au lieu d'empiler des données similaires, il devient plus efficace de cibler spécifiquement les cas d'échec identifiés par le modèle.

Ce travail s'inscrit dans un effort plus large d'AWS pour outiller la personnalisation de ses modèles Nova via Amazon Bedrock, notamment à travers les fonctionnalités d'évaluation qui permettent de tester des modèles sur des jeux de données et métriques propres à chaque cas d'usage. Le premier article de la série couvrait le format conversationnel attendu par Nova, les contrôles qualité pour écarter les exemples mal formés ou peu informatifs, ainsi que la séparation correcte entre données d'entraînement et d'évaluation pour éviter les fuites de données. Ce second volet, consacré à l'évaluation de la disponibilité des données, à la sélection de sous-ensembles, à l'augmentation de données et au mélange de données, s'appuie sur des recherches récentes montrant que ce qui compte pour le SFT n'est pas tant le volume brut que la couverture et la profondeur du jeu d'instructions. Ces travaux s'adressent directement aux équipes qui doivent arbitrer entre collecter davantage de données humaines, coûteuses à annoter, ou générer des exemples synthétiques, tout en évitant l'écueil du surapprentissage qui effacerait les capacités générales du modèle de base.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Préparer les données pour le fine-tuning supervisé, partie 1 : format et qualité50AWS ML BlogLLMs 02Série Nova Forge SDK, partie 2 : guide pratique pour affiner les modèles Nova avec le mélange de données41AWS ML BlogLLMs 03Guide pratique : affiner un LLM avec TRL, du supervised fine-tuning au raisonnement DPO et GRPO45MarkTechPostLLMs 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.