Aller au contenu principal
RechercheMicrosoft Research · 2 min de lecture

EvoLib : transformer l'expérience en savoir évolutif

Source originale ↗·

EvoLib est un nouveau cadre de recherche qui permet aux grands modèles de langage d'apprendre de leur propre expérience pendant l'inférence, sans nécessiter d'étiquettes de référence ni de retour externe. Présenté dans l'article "Test-Time Learning with an Evolving Library", ce système transforme les tentatives passées d'un modèle en compétences réutilisables et en enseignements réflexifs, plutôt que de simplement archiver des conversations, des traces de raisonnement ou des historiques d'actions. Concrètement, EvoLib repose sur deux mécanismes principaux : la consolidation, qui rapproche une nouvelle connaissance extraite d'une expérience récente des connaissances similaires déjà présentes dans la bibliothèque pour en tirer une version plus générale et réutilisable, et un mécanisme de pondération, qui ajuste en continu l'importance de chaque unité de connaissance selon son utilité immédiate mais aussi sa contribution à la génération de connaissances utiles pour des tâches futures. L'équipe a testé EvoLib sur un ensemble varié de tâches exigeantes, notamment la résolution de problèmes de raisonnement mathématique et l'écriture de code, avec des gains de performance constatés au fil du temps.

L'intérêt de cette approche tient au fait qu'elle ne nécessite aucune mise à jour du modèle sous-jacent : elle peut donc s'appliquer à n'importe quel modèle de langage en boîte noire, y compris ceux déployés uniquement via des API, ce qui inclut la grande majorité des modèles commerciaux actuels comme ceux d'OpenAI, Google ou Anthropic. Pour les entreprises et développeurs qui construisent des agents IA, cela ouvre la possibilité d'un apprentissage continu sans les coûts et contraintes du fine-tuning classique. Plutôt que de laisser un agent accumuler une masse croissante et difficile à exploiter d'expériences passées, EvoLib permet d'en extraire progressivement l'essentiel : les stratégies qui fonctionnent et les erreurs à éviter, un peu comme le fait la mémoire humaine, qui ne retient pas chaque détail mais raffine avec le temps des leçons générales et transférables.

Cette recherche s'inscrit dans un mouvement plus large de l'IA autour de la mémoire et de l'apprentissage à l'inférence ("test-time learning"), un des axes jugés prometteurs pour dépasser les limites du seul pré-entraînement massif. Les systèmes de mémoire d'agents IA existants se contentent souvent d'empiler des historiques bruts, rendant difficile l'identification des informations pertinentes pour une nouvelle tâche, sans parler de leur raffinement progressif. En proposant un mécanisme d'évolution continue des connaissances plutôt qu'une simple accumulation, les chercheurs à l'origine d'EvoLib visent à combler cet écart entre mémoire et apprentissage réel. Les prochaines étapes probables incluront des tests à plus grande échelle, sur davantage de types de tâches, et l'exploration de la manière dont plusieurs agents pourraient partager et faire évoluer une même bibliothèque de connaissances collective.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Yong Wang transforme l'information en connaissances
1IEEE Spectrum AI 

Yong Wang transforme l'information en connaissances

Yong Wang, assistant professeur en informatique et science des données à l'Université Technologique de Nanyang à Singapour, vient de recevoir le prix Significant New Researcher Award 2025 du comité technique visualisation et graphiques de l'IEEE Computer Society. Cette distinction, l'une des plus prestigieuses pour les chercheurs en début de carrière dans le domaine de la visualisation de données, récompense ses travaux sur l'utilisation des techniques de visualisation pour rendre les outils d'intelligence artificielle plus compréhensibles et accessibles. Wang, membre IEEE et éditeur associé d'IEEE Transactions on Visualization and Computer Graphics, concentre ses recherches sur l'interaction humain-ordinateur et la collaboration humain-IA, deux champs en pleine expansion à mesure que le volume de données mondiales dépasse la capacité d'interprétation humaine. Ce prix met en lumière une contribution qui dépasse le cadre académique : si les interfaces de visualisation sont bien conçues, elles peuvent démocratiser l'accès aux technologies avancées pour des publics non spécialistes. Dans un contexte où l'IA pénètre rapidement l'entreprise, la médecine et la recherche, la capacité à rendre lisibles des modèles complexes devient un enjeu stratégique. Les travaux de Wang s'inscrivent directement dans cette problématique : comment permettre à un plus grand nombre de personnes de comprendre, d'interroger et de collaborer avec des systèmes d'IA sans nécessiter une expertise technique approfondie. Son influence grandissante sur ces questions lui vaut d'être désormais reconnu parmi les figures montantes de son domaine à l'échelle internationale. Le parcours de Wang illustre une trajectoire peu ordinaire. Né dans un village agricole de la province du Hunan, dans le sud-ouest de la Chine, il a grandi dans un foyer sans ordinateur, où la télévision elle-même était considérée comme un objet de valeur. Ses parents, sans formation universitaire, ont néanmoins soutenu ses études, son père finançant une partie de sa scolarité grâce à des emplois en usine et sur des chantiers en ville. Attiré par la robotique et l'informatique après avoir découvert ces domaines à la télévision, Wang a intégré l'Institut de Technologie de Harbin, réputé pour ses programmes d'ingénierie, où il a obtenu une licence en automatisme en 2011. Il a ensuite poursuivi ses études à l'Université des Sciences et Technologies de Huazhong à Wuhan, puis à l'Université des Sciences et Technologies de Hong Kong, avant de rejoindre Singapour. Sa trajectoire, des rizières du Hunan aux laboratoires de recherche en IA, incarne précisément la vision qu'il défend : donner à davantage de personnes les outils pour participer à la science et à l'innovation.

RecherchePaper
1 source
Entraînement par anticipation latente pour les Transformers
2Apple Machine Learning 

Entraînement par anticipation latente pour les Transformers

Les modèles de langage autorégressifs sont aujourd'hui entraînés via la prédiction du prochain token, une approche efficace mais fondamentalement limitée : à chaque étape, le modèle doit s'engager sur un choix unique, sans possibilité d'explorer plusieurs continuations plausibles. Une nouvelle recherche, acceptée à l'ICLR 2026 dans le cadre du workshop Latent & Implicit Thinking, propose une alternative : l'entraînement par anticipation latente (Latent Anticipation Training), conçu pour dépasser ces contraintes structurelles. L'enjeu est de taille pour le secteur. L'objectif de prédiction token par token impose une allocation de calcul uniforme : chaque token mobilise exactement un seul passage forward, quelle que soit sa difficulté. Cela bride l'expressivité du modèle sur les tokens complexes, ceux qui nécessiteraient davantage de "réflexion" avant d'être générés. En introduisant une dimension latente dans le processus d'entraînement, l'approche permet au modèle de raisonner implicitement avant de s'engager, ouvrant la voie à un calcul adaptatif selon la difficulté du contexte. Le papier s'inscrit dans un courant de recherche croissant qui cherche à aller au-delà du raisonnement par chaîne de pensée (Chain-of-Thought), en déportant une partie du raisonnement dans un espace latent non visible. Contrairement au CoT classique qui externalise le raisonnement sous forme de tokens intermédiaires explicites, l'anticipation latente opère de manière implicite, sans surcharge du contexte de génération. Cette distinction est centrale : le modèle "pense" sans écrire, ce qui réduit la latence et préserve la fluidité de génération. Si les résultats complets ne sont pas encore publics dans cet extrait, l'acceptation du travail à l'ICLR, l'une des conférences de référence en apprentissage automatique, signale une contribution jugée solide par la communauté. La convergence de plusieurs équipes vers des architectures à raisonnement latent, dont les récents travaux sur les Coconut tokens ou les espaces de pensée continues, suggère que cette direction pourrait redéfinir la prochaine génération de grands modèles de langage.

RecherchePaper
1 source
Meta et Stanford présentent Fast Byte Latent Transformer : 50% de bande passante mémoire en moins, sans tokenisation
3MarkTechPost 

Meta et Stanford présentent Fast Byte Latent Transformer : 50% de bande passante mémoire en moins, sans tokenisation

Des chercheurs de Meta, de Stanford University et de l'Université de Washington ont présenté trois nouvelles méthodes pour accélérer significativement le Byte Latent Transformer (BLT), une architecture de modèle de langage qui traite directement le texte en octets bruts plutôt qu'en tokens. La contribution principale s'appelle BLT Diffusion (BLT-D) et s'attaque à un problème central du BLT : son décodeur local génère les octets un à un, de manière autoregressive, ce qui implique plusieurs passes mémoire là où un modèle tokenisé n'en nécessite qu'une seule. Sur les serveurs modernes de LLM, le goulot d'étranglement n'est pas la puissance de calcul brute mais la bande passante mémoire, c'est-à-dire le coût répété de charger les poids du modèle et les caches KV depuis la mémoire. La solution proposée remplace ce décodage octet par octet par une diffusion discrète par blocs : au lieu de prédire un seul octet à la fois, le modèle génère simultanément des blocs de 4, 8 ou 16 octets en démasquant progressivement les positions les plus certaines à chaque étape, selon deux stratégies, l'une basée sur un seuil de confiance, l'autre sur une contrainte d'entropie cumulative. L'enjeu pratique est considérable. Selon les chercheurs, ces méthodes permettent de réduire la bande passante mémoire à l'inférence de plus de 50%, ce qui se traduit directement par une accélération de la génération de texte. Pour les entreprises qui déploient des LLM à grande échelle, où le coût d'inférence est un facteur économique déterminant, ce gain représente une réduction significative de la latence et des coûts opérationnels. Au-delà de la vitesse, les modèles octet-niveau comme BLT présentent des avantages intrinsèques que les architectures tokenisées peinent à égaler : meilleure gestion du texte multilingue, robustesse accrue face au bruit dans les entrées, et traitement naturel du code, des chiffres et des caractères spéciaux, sans les artefacts produits par les tokenizers comme le byte-pair encoding (BPE). Le BLT avait déjà constitué une avancée notable en démontrant qu'un modèle opérant sur des octets bruts pouvait atteindre les performances des modèles tokenisés à grande échelle, grâce à une segmentation dynamique en patches de longueur variable pilotée par l'entropie locale du texte. Les régions difficiles à prédire reçoivent des patches courts, les passages plus prévisibles des patches plus longs, avec une taille moyenne de 4 octets et un maximum de 8. La majeure partie du calcul s'effectue sur des représentations latentes compressées via trois composants : un encodeur local, un Transformer global, et un décodeur local. Le principal frein à l'adoption industrielle de cette approche restait sa lenteur à l'inférence, rendue pénalisante par le nombre élevé de passes décodeur nécessaires. Les trois techniques introduites dans ce nouveau travail visent directement ce verrou, ouvrant concrètement la voie au déploiement des modèles octet-niveau dans des environnements de production exigeants, où vitesse et coût ne sont pas négociables.

RecherchePaper
1 source
GEGLU-Transformer pour l'estimation IMU vers EMG avec adaptation few-shot
4arXiv cs.RO 

GEGLU-Transformer pour l'estimation IMU vers EMG avec adaptation few-shot

Des chercheurs ont publié sur arXiv (référence 2604.25670) un système d'apprentissage automatique capable de reconstituer l'activité musculaire d'un individu à partir de simples capteurs de mouvement portables, sans recourir aux électrodes d'électromyographie traditionnelles. L'architecture proposée, baptisée GEGLU-Transformer, combine un encodeur de type Transformer avec des unités linéaires à porte d'erreur gaussienne (GEGLU) pour estimer en continu les enveloppes d'activation neuromusculaire des membres inférieurs. Testée selon un protocole strict dit "leave-one-subject-out" sur un jeu de données biomécanique multi-conditions, elle atteint une corrélation r = 0,706 sans aucune adaptation individuelle, puis r = 0,761 avec seulement 0,5 % des données spécifiques au sujet utilisées pour la personnalisation, soit une amélioration significative à partir d'un volume d'entraînement négligeable. Ces résultats ouvrent une voie concrète pour déployer des exosquelettes et des prothèses robotiques en dehors des laboratoires. L'électromyographie de surface, qui mesure l'activité électrique des muscles via des électrodes cutanées, est aujourd'hui indispensable au contrôle adaptatif de ces dispositifs, mais elle reste fragile : les signaux varient selon la transpiration, le placement des électrodes ou les caractéristiques physiologiques propres à chaque utilisateur. Remplacer ces capteurs par des centrales inertielles, accéléromètres et gyroscopes déjà intégrés dans la plupart des appareils portables grand public, permettrait de rendre ces systèmes nettement plus robustes, moins contraignants à calibrer et potentiellement accessibles à une population bien plus large de patients ou d'utilisateurs industriels. Le problème de la variabilité inter-individuelle est l'un des grands obstacles non résolus de la robotique neuromusculaire depuis plusieurs années. Les approches classiques nécessitaient des sessions de calibration longues et répétées pour chaque nouvel utilisateur, ce qui rendait leur usage clinique difficile à grande échelle. L'introduction d'architectures à base d'attention, popularisées par les grands modèles de langage, dans le domaine biomécanique reflète une tendance plus large à recycler des paradigmes issus du traitement du langage naturel vers des signaux physiologiques temporels. La capacité du modèle à se personnaliser rapidement avec très peu de données ouvre la perspective de dispositifs qui s'adaptent à leur porteur en quelques secondes, sans intervention d'un clinicien.

UELes fabricants européens d'exosquelettes et de prothèses pourraient bénéficier de cette approche pour réduire les contraintes de calibration clinique et élargir l'accès aux dispositifs d'assistance motrice.

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic