Aller au contenu principal
Google Cloud présente ReasoningBank : mémoire de stratégies de raisonnement tirées des succès et échecs d'agents
RechercheMarkTechPost · 2 min de lecture

Google Cloud présente ReasoningBank : mémoire de stratégies de raisonnement tirées des succès et échecs d'agents

Source originale ↗·

Une équipe de chercheurs de Google Cloud AI, de l'Université de l'Illinois à Urbana-Champaign et de l'Université Yale a présenté ReasoningBank, un cadre mémoire destiné aux agents IA qui distille les stratégies de raisonnement à partir de leurs réussites comme de leurs échecs. Le système fonctionne en trois étapes exécutées autour de chaque tâche accomplie : récupération mémoire, extraction mémoire, et consolidation mémoire. Avant de démarrer une nouvelle tâche, l'agent interroge ReasoningBank via une recherche par similarité vectorielle pour récupérer l'élément de mémoire le plus pertinent, injecté directement dans son prompt système. Les expériences d'ablation montrent qu'un seul élément récupéré (k=1) donne de meilleurs résultats qu'un lot plus large : le taux de succès atteint 49,7% avec k=1, contre 44,4% avec k=4. Une fois la tâche terminée, un extracteur de mémoire analyse la trajectoire et la condense en items structurés comportant un titre, une description en une phrase, et un contenu de 1 à 3 phrases. Pour évaluer si la tâche était réussie ou non, le système emploie un LLM-as-a-Judge, qui reste robuste même lorsque sa précision descend à 70%.

Le problème que ReasoningBank cherche à résoudre est fondamental : les agents IA actuels souffrent d'une amnésie structurelle. Chaque tâche est abordée comme si aucune expérience antérieure n'existait, et les leçons apprises disparaissent dès la fin de l'exécution. Les approches existantes n'y remédient qu'en partie. La mémoire de trajectoire brute, utilisée par le système Synapse, enregistre chaque action mais génère trop de bruit pour être directement réutilisable. La mémoire de flux, mise en oeuvre dans Agent Workflow Memory, extrait des procédures réutilisables, mais uniquement à partir des succès, ce qui élimine le signal d'apprentissage contenu dans les échecs. ReasoningBank traite les deux de manière asymétrique : les réussites fournissent des stratégies validées, les échecs alimentent des mises en garde et des leçons préventives.

Les chercheurs poussent le système plus loin avec MaTTS, une approche de mise à l'échelle au moment du test combinée à la mémoire. Plutôt que de générer plusieurs trajectoires pour une tâche et n'en conserver qu'une, MaTTS exploite l'ensemble de ces trajectoires comme signal contrastif pour enrichir ReasoningBank. Cette technique s'appuie sur une tendance déjà bien établie en raisonnement mathématique et en programmation, où le calcul supplémentaire au moment de l'inférence améliore nettement les performances. L'enjeu dépasse la simple optimisation technique : il s'agit de permettre aux agents déployés en entreprise, sur des tâches web, de résolution de bugs ou de navigation d'interface, de capitaliser sur leur expérience accumulée plutôt que de la jeter après chaque session.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Des chercheurs automatisent la conception de stratégies de raisonnement pour LLM et réduisent l'utilisation de tokens de 69,5 %
1VentureBeat AI 

Des chercheurs automatisent la conception de stratégies de raisonnement pour LLM et réduisent l'utilisation de tokens de 69,5 %

Des chercheurs affiliés à Meta, Google et plusieurs universités ont publié AutoTTS, un cadre algorithmique capable de concevoir automatiquement des stratégies d'optimisation pour les grands modèles de langage au moment de l'inférence. Jusqu'ici, les ingénieurs devaient manuellement définir les règles régissant le raisonnement des modèles, quand explorer de nouvelles pistes, quand approfondir une réflexion existante, quand élaguer une branche peu prometteuse. AutoTTS remplace ce travail artisanal par un agent explorateur, typiquement un LLM comme Claude, qui teste et affine des politiques d'allocation de calcul de façon itérative. Dans les expérimentations menées par les chercheurs, cette approche a permis de réduire la consommation de tokens de 69,5 % sans perte de précision. L'enjeu est considérable pour les entreprises qui déploient des modèles de raisonnement en production. Le "test-time scaling" (TTS) consiste à accorder aux modèles des cycles de calcul supplémentaires à l'inférence, générer plusieurs chemins de raisonnement, voter par majorité sur la réponse, ou s'arrêter dès qu'un seuil de confiance est atteint. Ces stratégies sont coûteuses, et les réduire de 69,5 % sans sacrifier la qualité représente une économie opérationnelle directe et substantielle. Pour les organisations déployant ces modèles à grande échelle, c'est la différence entre une technologie économiquement viable et un budget calcul incontrôlable. Le TTS s'est imposé ces dernières années comme l'une des voies principales pour améliorer les performances des LLM sans passer par un réentraînement coûteux. Les méthodes existantes, self-consistency, adaptive-consistency, parallel-probe, partagent toutes le même défaut : elles sont conçues à la main, limitées par l'intuition humaine dans un espace de configurations potentielles immense. AutoTTS redéfinit le rôle de l'ingénieur : plutôt que de coder les règles elles-mêmes, il définit l'environnement de découverte (l'espace d'états, les objectifs d'optimisation, les mécanismes de feedback), et laisse le LLM explorateur trouver la politique optimale. Pour rendre cette recherche économiquement supportable, le cadre s'appuie sur un environnement de simulation hors ligne, évitant d'appeler le modèle cible à chaque itération. La publication ouvre la voie à une nouvelle catégorie d'outils où l'IA conçoit ses propres stratégies d'inférence, potentiellement adaptées dynamiquement selon le type de tâche ou le budget disponible.

UEUne réduction de 69,5% des tokens à l'inférence bénéficierait aux entreprises et institutions européennes déployant des LLMs en production, réduisant significativement leurs coûts opérationnels cloud.

RecherchePaper
1 source
2MarkTechPost 

Stanford présente TRACE, un système d'entraînement d'agents ciblé sur les compétences qui transforme leurs échecs récurrents en environnement RL synthétique

Des chercheurs de Stanford ont développé TRACE (Turning Recurrent Agent failures into Capability-targeted training Environments), un système publié en open source sous licence MIT qui transforme les échecs récurrents des agents fondés sur des LLM en environnements d'entraînement ciblés. Le constat de départ est simple: un agent ne rate pas ses tâches au hasard, mais parce qu'il lui manque des capacités précises et réutilisables, comme retrouver la bonne information ou vérifier une condition préalable. Face à ce problème, les approches classiques, apprentissage par renforcement direct, réglage fin supervisé ou génération de données synthétiques non ciblée, gaspillent une grande partie du budget de calcul sur des compétences que le modèle maîtrise déjà, sans jamais signaler précisément quelle capacité fait défaut. TRACE fonctionne en quatre étapes automatisées, chacune pilotée par un agent LLM suivant un prompt structuré. D'abord, une analyse contrastive compare les trajectoires réussies et échouées pour identifier les capacités absentes, en ne retenant que celles dont l'écart entre succès et échec dépasse un seuil de 0,20 et dont la couverture dépasse 0,10. Ensuite, un agent générateur construit un environnement synthétique dédié à chaque capacité retenue, avec des instances de tâches produites automatiquement à partir de graines aléatoires, ce qui permet une vérification purement algorithmique sans recours à un juge humain ou à un LLM évaluateur. Chaque capacité reçoit alors son propre adaptateur LoRA, entraîné via l'algorithme GRPO (Group Relative Policy Optimization) pendant que le modèle de base reste figé. Enfin, ces adaptateurs sont combinés dans une architecture de mélange d'experts (Mixture-of-Experts), où seules de légères portes de routage sont entraînées, permettant au modèle d'orienter chaque token vers l'expert le plus pertinent en cours de raisonnement. Cette approche change la manière dont les équipes peuvent corriger les faiblesses d'un agent en production: plutôt que de réentraîner l'ensemble du modèle ou de multiplier les tentatives de prompt engineering, il devient possible de diagnostiquer précisément quelles compétences manquent et d'y répondre par un entraînement chirurgical, moins coûteux en calcul et plus facile à faire évoluer au fil du temps. Pour les entreprises qui déploient des agents autonomes dans des tâches complexes comme la gestion de réservations ou le support client, cela ouvre la voie à une amélioration continue ciblée, où chaque nouvel échec récurrent peut être transformé en module d'entraînement supplémentaire sans perturber les capacités déjà acquises. Sur le benchmark τ²-Bench, testé avec le modèle Qwen3-30B-A3B, TRACE a surpassé à la fois les méthodes d'optimisation de prompts et les approches à adaptateur unique en matière de taux de réussite global. Ce travail s'inscrit dans une tendance plus large de recherche sur les agents fondés sur des LLM, où la difficulté ne vient plus seulement de la puissance brute des modèles mais de leur capacité à combler des lacunes spécifiques de façon vérifiable. Les auteurs ont publié leur code et leur article, référencé sous l'identifiant arXiv:2604.05336, ce qui devrait permettre à d'autres équipes de reproduire et d'étendre cette méthode à d'autres environnements agentiques.

RecherchePaper
1 source
Comment créer des agents de raisonnement sur mesure avec un minimum de calcul
3VentureBeat AI 

Comment créer des agents de raisonnement sur mesure avec un minimum de calcul

Des chercheurs de JD.com et de plusieurs institutions académiques ont publié une nouvelle méthode d'entraînement pour les modèles d'IA raisonnants, baptisée RLSD, pour Reinforcement Learning with Verifiable Rewards with Self-Distillation. L'approche combine deux techniques existantes : l'apprentissage par renforcement avec récompenses vérifiables (RLVR), qui évalue simplement si une réponse finale est juste ou fausse, et l'auto-distillation, qui fournit un retour granulaire sur chaque étape du raisonnement. Selon les expériences publiées, les modèles entraînés avec RLSD surpassent ceux construits avec les algorithmes classiques de distillation et d'apprentissage par renforcement. Chenxu Yang, co-auteur de l'étude, a précisé à VentureBeat les défauts fondamentaux des méthodes précédentes : avec RLVR standard, une trace de raisonnement de plusieurs milliers de tokens ne reçoit qu'une seule récompense binaire, 0 ou 1, et chaque token dans cette trace obtient exactement le même crédit, qu'il s'agisse d'une étape logique décisive ou d'une phrase accessoire. Pour les équipes d'ingénierie en entreprise, RLSD réduit concrètement les barrières techniques et financières pour construire des modèles de raisonnement sur mesure adaptés à leur logique métier. La méthode concurrente dite OPD (On-Policy Distillation) exige de maintenir un grand modèle "enseignant" actif en permanence durant tout l'entraînement, ce qui, selon Yang, "double approximativement votre empreinte GPU". Elle impose également que le modèle enseignant et le modèle étudiant partagent exactement la même structure de vocabulaire, ce qui exclut de facto la majorité des configurations multi-architectures, multi-modalités ou multilingues que les entreprises utilisent réellement. RLSD contourne ces contraintes sans sacrifier la qualité du signal d'apprentissage. L'auto-distillation en mode OPSD (On-Policy Self-Distillation), qui faisait jouer au même modèle le rôle de l'enseignant et de l'étudiant, semblait être le compromis idéal, mais souffre d'un défaut structural identifié par les chercheurs : la "fuite d'information privilégiée". Lorsque la version enseignante du modèle dispose d'une clé de réponse vérifiée et que la version étudiante tente de reproduire son comportement sans cette information, il existe un écart irréductible entre les deux distributions que l'étudiant ne peut jamais combler. RLSD est conçu pour résoudre précisément ce problème, en combinant les avantages de chaque paradigme sans en hériter les défauts. Cette publication s'inscrit dans une course plus large à démocratiser l'entraînement de modèles raisonnants de qualité, jusqu'ici réservé aux acteurs disposant de grandes infrastructures de calcul.

RecherchePaper
1 source
4VentureBeat AI 

Google's TabFM se passe d'entraînement par jeu de données et prédit quand même sur des tables jamais vues

Google Research a dévoilé TabFM, un modèle de fondation capable de faire des prédictions sur des données tabulaires sans jamais être entraîné sur le jeu de données concerné. Grâce à l'apprentissage en contexte, TabFM produit ses résultats en un seul passage avant, à partir d'un prompt unique combinant les exemples historiques et les nouvelles lignes à prédire. Selon Weihao Kong, chercheur chez Google Research, ce modèle épargne aux équipes data les pipelines classiques de nettoyage, d'imputation des valeurs manquantes et d'encodage des variables catégorielles, ainsi que les boucles répétitives d'optimisation d'hyperparamètres portant sur le taux d'apprentissage, la profondeur des arbres ou les ratios de sous-échantillonnage. TabFM s'appuie sur deux architectures antérieures : TabPFN, développée par la société Prior Labs, qui avait le première démontré la faisabilité d'une classification zéro-shot sur de petits tableaux, et TabICL, conçue par l'Institut national de recherche en sciences et technologies du numérique en France, qui a résolu les limites de passage à l'échelle grâce à une technique de compression des lignes. Pour les développeurs et ingénieurs en entreprise, l'enjeu est concret : ce qui nécessitait auparavant des semaines de construction de pipelines peut désormais tenir en un simple appel API. Prenons l'exemple d'un analyste cherchant à prédire le désabonnement d'un client : au lieu d'entraîner un modèle XGBoost sur mesure, il lui suffit de transmettre à TabFM un échantillon de données de sessions passées accompagné de la session active à évaluer, pour obtenir instantanément une probabilité de churn. Cette approche supprime aussi la dette opérationnelle liée à la surveillance de la dérive des données et au réentraînement périodique des modèles, un fardeau récurrent pour les équipes qui maintiennent des systèmes de machine learning en production. Cette avancée s'inscrit dans un mouvement plus large : alors que les modèles génératifs de texte et de vision sont depuis longtemps passés à l'inférence zéro-shot par simple prompt, les données tabulaires, qui représentent pourtant la majorité des données d'entreprise stockées dans les entrepôts, les CRM et les registres financiers, étaient restées à l'écart de cette évolution. La raison tient aux limites des grands modèles de langage face aux tableaux : leur fenêtre de contexte sature vite face à des tableaux de quelques milliers de lignes, leur tokenisation fragmente maladroitement les valeurs numériques, et la mise à plat d'une structure à deux dimensions en texte linéaire leur fait perdre la correspondance entre lignes et colonnes. TabFM contourne ce problème en traitant directement les données comme une grille, préservant leur intégrité structurelle plutôt que de les forcer dans une chaîne de texte.

UEL'architecture TabICL, sur laquelle s'appuie TabFM, a été développée par l'Institut national de recherche en sciences et technologies du numérique (Inria), une contribution française majeure à cette avancée.

💬 Ça fait des années qu'on attend ça : le zero-shot qui débarque enfin sur les données tabulaires, alors que le texte et l'image l'ont depuis longtemps. Plus besoin de dresser un XGBoost sur mesure ni de courir après les hyperparamètres, tu balances ton échantillon et la ligne à prédire dans un prompt, et ça sort. Reste à voir comment ça encaisse un vrai CRM d'entreprise avec ses colonnes pourries et ses trous partout, mais si ça tient, ça change la donne pour toutes les équipes qui passent plus de temps sur le pipeline que sur le modèle.

RechercheActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic