Se retire de l'affinement supervisé auto-distillé pour Amazon Nova
Amazon a détaillé une nouvelle technique baptisée Self-Distilled Reasoning (SDR), conçue pour améliorer le fine-tuning supervisé (SFT) de sa famille de modèles Amazon Nova 2, en particulier Nova 2 Lite. Le problème de départ est concret: entraîner un modèle avec des traces de raisonnement en chaîne de pensée (chain-of-thought) de haute qualité coûte cher et reste souvent impraticable, ce qui pousse de nombreuses équipes à se contenter de jeux de données ne contenant que des entrées et des sorties, sans raisonnement. Or les chercheurs d'Amazon montrent que cette absence de raisonnement dans les données de fine-tuning provoque un phénomène d'oubli catastrophique: sur un benchmark de mathématiques, les performances du modèle chutent de 70% avant entraînement à seulement 6% après un SFT classique sans traces de raisonnement, en moyenne sur leurs tests. Face à ce constat, l'équipe propose SDR, une méthode qui réutilise directement les propres traces de raisonnement générées par le modèle de base Nova 2 Lite comme substitut, pour combler les jeux de données qui en sont dépourvus, sans recourir à un modèle enseignant externe ni à une validation humaine.
Cette approche change la donne pour les équipes qui personnalisent des modèles de raisonnement sur des domaines spécifiques via SFT ou apprentissage par renforcement fine-tuné (RFT), car elle évite un compromis jusqu'ici jugé quasi inévitable entre performance sur la tâche ciblée et rétention des capacités générales du modèle. La méthode alternative la plus courante, le fusionnement de modèles (model merging), consiste à réintégrer un point de contrôle post-SFT dans le modèle de base pour limiter l'oubli, mais elle sacrifie une partie des gains obtenus pendant l'entraînement spécialisé. Avec SDR, Amazon affirme retrouver quasiment intégralement les performances mathématiques de départ (70% contre 68% pour le fusionnement) tout en améliorant les performances sur la tâche cible de plus de 6,5% en moyenne par rapport au fusionnement classique. Concrètement, cela signifie qu'une entreprise peut spécialiser un modèle Nova sur son propre domaine, comme du code interne ou des données métier, sans dégrader ses compétences générales en raisonnement ni devoir arbitrer entre les deux.
Cette découverte s'inscrit dans un courant de recherche plus large qui explore l'auto-distillation, c'est-à-dire l'idée de réinjecter dans un modèle des informations issues de lui-même pendant l'entraînement, plutôt que de dépendre d'un modèle enseignant tiers. Amazon positionne SDR comme une régularisation intégrée directement au processus d'entraînement, applicable à n'importe quel jeu de données SFT existant, quel que soit son domaine, sans annotation humaine supplémentaire. Publiés dans le cadre de la documentation technique d'Amazon Nova 2, ces résultats visent à guider les développeurs qui personnalisent des modèles de raisonnement pour des cas d'usage professionnels, à l'heure où les capacités de raisonnement deviennent un facteur de différenciation majeur face à des concurrents comme OpenAI, Anthropic ou Google sur les tâches complexes en code et en mathématiques.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




