RISED : des grilles d'évaluation pour sélectionner des environnements multiples et distiller des agents autonomes
Des chercheurs proposent RISED (Rubrics for Agentic Multi-Environment Selection and Self-Distillation), une méthode pour entraîner un seul agent LLM, conjointement, sur plusieurs environnements interactifs très différents. Elle s'appuie, comme son nom l'indique, sur des rubriques pour sélectionner les données d'entraînement et sur l'auto-distillation pour exploiter celles qui ne fournissent aucun signal. Les chercheurs identifient deux limites des approches actuelles. Les stratégies de curriculum et de sélection de données répartissent l'entraînement au niveau de l'environnement, ou privilégient des signaux locaux fondés sur la récompense. Elles ne tiennent pas compte des relations entre les trajectoires en cours dans les différents environnements au moment de choisir les groupes de prompts.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de Apple Machine Learning. Lire l'article original →
Le second problème tient aux rythmes d'apprentissage. Chaque environnement progresse à sa propre vitesse, si bien qu'un même lot peut contenir à la fois des groupes de trajectoires entièrement échouées et des groupes entièrement réussies. Ces groupes n'offrent aucun signal de récompense relative, car tous leurs membres obtiennent le même résultat. Ces données sont donc inutilisables pour l'apprentissage par renforcement, alors qu'elles représentent un coût de calcul réel.
L'enjeu dépasse la technique. Les agents généralistes capables d'agir dans des environnements variés (navigation web, outils, code, jeux) sont devenus un axe majeur de la recherche. Gaspiller une part significative des échantillons d'un lot ralentit l'entraînement et en augmente le coût. Une sélection fondée sur la comparaison entre environnements, doublée d'une récupération du signal perdu, pourrait rendre cet apprentissage multi-environnement plus efficace. Cela s'inscrit dans l'effort actuel pour dépasser les curriculums rigides et les récompenses purement locales.
Pas d'impact direct sur la France/UE