Aller au contenu principal
Recherche · Paper ·

SCLATE : une infrastructure pour l'entraînement et l'évaluation d'agents à apprentissage continu

Des chercheurs présentent SCLATE, un substrat d'exécution conçu pour entraîner et évaluer les agents à apprentissage continu. Ces agents associent des modèles, des harnais logiciels et une mémoire, et opèrent sur de longs horizons répartis en plusieurs sessions. Leur évaluation exige d'entrelacer les tâches d'un benchmark avec des événements propres à l'agent : arrêt et redémarrage de session, tâches planifiées de type cron, consolidation de la mémoire. SCLATE fournit pour cela un ordonnanceur d'événements ouvert, auquel le benchmark et l'agent, sans modification de ce dernier, ajoutent chacun leurs événements au moyen d'un adaptateur. Le système repose aussi sur une horloge simulée hybride. Le résumé disponible s'interrompt à ce stade, sans détailler le fonctionnement de cette horloge ni les résultats chiffrés.

1 min de lecturePertinence 52

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de Apple Machine Learning. Lire l'article original →

L'enjeu est pratique. Aujourd'hui, les benchmarks et les cadres d'entraînement ne planifient que leurs propres événements. Chaque couple benchmark-agent oblige donc à écrire une boucle d'ordonnancement sur mesure, ce qui coûte du temps d'ingénierie et rend les comparaisons fragiles. Avec un substrat commun, un même agent pourrait être testé sur plusieurs benchmarks sans adaptation lourde, et les équipes disposeraient d'un cadre partagé pour mesurer des comportements qui n'apparaissent que sur la durée, comme l'oubli, la dérive de la mémoire ou la consolidation des acquis.

Ce travail s'inscrit dans l'essor des agents censés apprendre en continu plutôt que rester figés après leur entraînement. Ces agents combinent des modèles de langage, des mécanismes de mémoire persistante et des routines périodiques, mais les outils d'évaluation ont été pensés pour des tâches isolées et ponctuelles. Cet écart entre la façon dont ces agents fonctionnent et la façon dont on les teste explique l'apparition de substrats comme SCLATE. Reste à voir si la communauté adoptera cette interface commune, et si elle servira aussi à l'entraînement par renforcement d'agents sur de longues séquences de sessions.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01NVIDIA et Ineffable Intelligence s'associent pour bâtir l'infrastructure de l'apprentissage par renforcement40NVIDIA AI BlogRecherche 02Trajectory publie une pile d'entraînement Multi-LoRA concurrent pour l'apprentissage continu, avec un gain de débit de 2,81x44MarkTechPostRecherche 03Capture des ID de tokens pendant les interactions à base d'agents pour améliorer l'apprentissage par renforcement35Amazon ScienceRecherche 

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.