Aller au contenu principal
Outils · Tuto ·

Fonctions de récompense personnalisées pour l'apprentissage par renforcement multi-tours avec Amazon Nova Forge

Amazon Web Services a publié un nouveau volet technique consacré à Nova Forge, sa plateforme de personnalisation des modèles Nova, détaillant comment concevoir des fonctions de récompense sur mesure pour l'apprentissage par renforcement multi-tours. Le texte fait suite à une première partie couvrant l'infrastructure sous-jacente, à savoir un cluster Amazon SageMaker HyperPod, un environnement géré par le client sur Amazon Elastic Container Service et un bucket Amazon S3 pour les données de déploiement et les points de contrôle. La méthode repose sur le réglage fin par renforcement (RFT), qui entraîne le modèle à partir de signaux d'évaluation sur ses propres réponses plutôt que d'exemples annotés, avec l'algorithme Group Relative Policy Optimization (GRPO). Nova Forge propose une fonctionnalité "Bring Your Own Orchestration" (BYOO) permettant d'exécuter sa propre logique de récompense tout en laissant la plateforme gérer les déploiements et l'état des conversations, ainsi qu'une option multi-tours sans serveur désormais disponible en version générale. Le code d'exemple est publié sur le dépôt GitHub aws-samples/sample-nova-multi-turn-rl-infra, avec un environnement par défaut basé sur le jeu Wordle et un environnement personnalisé activable via le fichier cdk.json.

2 min de lecturePertinence 48
Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette publication répond à une fragilité connue de l'entraînement des agents IA : une fonction de récompense subtilement mal calibrée peut enseigner un comportement erroné tout en laissant les courbes d'entraînement paraître saines. Contrairement à une notation tour par tour, le RFT multi-tours évalue la récompense cumulée sur toute une trajectoire, incluant les appels d'outils, l'exécution de code ou la correction d'erreurs, plutôt que de juger une réponse isolée, ce qui compte particulièrement pour les entreprises développant des agents devant enchaîner plusieurs étapes de façon fiable. AWS partage un exemple tiré d'un entraînement réel où la composante de récompense la plus fortement pondérée n'a fourni aucun signal d'apprentissage sans que cela soit détecté immédiatement, ce qui souligne l'importance d'instrumenter et surveiller chaque composante individuellement pour éviter des cycles d'entraînement coûteux et inutiles.

Le texte s'inscrit dans un débat plus large sur les mérites respectifs de l'apprentissage par renforcement et du réglage supervisé, citant une étude de 2025 signée Chu et al. montrant qu'à budget de calcul équivalent, le RL améliore la généralisation hors distribution sur différentes variantes de tâches, là où le réglage supervisé tend à se dégrader. Les fonctions de récompense de Nova Forge peuvent être fondées sur des règles vérifiables ou déléguer le jugement à un autre grand modèle de langage selon l'approche "LLM-as-Judge". Le guide aborde aussi l'exécution sécurisée de code généré par le modèle au sein même du pipeline de récompense. Cette publication illustre la stratégie d'Amazon visant à rendre la personnalisation d'agents IA accessible via Nova Forge, dans un secteur cloud où les fournisseurs rivalisent pour proposer des outils de réglage fin par renforcement toujours plus sophistiqués, alors que les entreprises cherchent à adapter leurs modèles à des flux de travail autonomes complexes plutôt qu'à de simples tâches question-réponse.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Créer des fonctions de récompense efficaces avec AWS Lambda pour personnaliser Amazon Nova39AWS ML BlogOutils 02Lancez vos expériences de personnalisation Nova avec le SDK Nova Forge39AWS ML BlogOutils 03Combiner Google Search, Google Maps et fonctions personnalisées dans un appel Gemini avec chaînes d'agents multi-étapes40MarkTechPostOutils 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.