Aller au contenu principal
Recherche · Paper ·

RISED : des grilles d'évaluation pour sélectionner des environnements multiples et distiller des agents autonomes

Des chercheurs proposent RISED (Rubrics for Agentic Multi-Environment Selection and Self-Distillation), une méthode pour entraîner un seul agent LLM, conjointement, sur plusieurs environnements interactifs très différents. Elle s'appuie, comme son nom l'indique, sur des rubriques pour sélectionner les données d'entraînement et sur l'auto-distillation pour exploiter celles qui ne fournissent aucun signal. Les chercheurs identifient deux limites des approches actuelles. Les stratégies de curriculum et de sélection de données répartissent l'entraînement au niveau de l'environnement, ou privilégient des signaux locaux fondés sur la récompense. Elles ne tiennent pas compte des relations entre les trajectoires en cours dans les différents environnements au moment de choisir les groupes de prompts.

1 min de lecturePertinence 42

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de Apple Machine Learning. Lire l'article original →

Le second problème tient aux rythmes d'apprentissage. Chaque environnement progresse à sa propre vitesse, si bien qu'un même lot peut contenir à la fois des groupes de trajectoires entièrement échouées et des groupes entièrement réussies. Ces groupes n'offrent aucun signal de récompense relative, car tous leurs membres obtiennent le même résultat. Ces données sont donc inutilisables pour l'apprentissage par renforcement, alors qu'elles représentent un coût de calcul réel.

L'enjeu dépasse la technique. Les agents généralistes capables d'agir dans des environnements variés (navigation web, outils, code, jeux) sont devenus un axe majeur de la recherche. Gaspiller une part significative des échantillons d'un lot ralentit l'entraînement et en augmente le coût. Une sélection fondée sur la comparaison entre environnements, doublée d'une récupération du signal perdu, pourrait rendre cet apprentissage multi-environnement plus efficace. Cela s'inscrit dans l'effort actuel pour dépasser les curriculums rigides et les récompenses purement locales.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Recherche sur les environnements proactifs d'agents : simuler des utilisateurs actifs pour évaluer les assistants proactifs37Apple Machine LearningRecherche 02Métrique d'évaluation des agents pour les conversations multi-tours36AWS ML BlogRecherche 03« IA sans environnement : génération de données synthétiques pour agents d'appel API »34Apple Machine LearningRecherche 

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.