Aller au contenu principal
Le nouveau projet de recherche LeWorldModel (LeWM) de Yann LeCun cible l'effondrement JEPA dans la modélisation prédictive du monde par pixels
RechercheMarkTechPost · 1 min de lecture

Le nouveau projet de recherche LeWorldModel (LeWM) de Yann LeCun cible l'effondrement JEPA dans la modélisation prédictive du monde par pixels

Source originale ↗·

Yann LeCun et une équipe de chercheurs issus du Mila, de l'Université de Montréal, de la New York University, de Samsung SAIL et de la Brown University viennent de présenter LeWorldModel (LeWM), une architecture de modélisation du monde capable de s'entraîner de bout en bout directement à partir de pixels bruts, sans les béquilles techniques qui handicapent les approches actuelles.

Le problème que résout LeWM est fondamental pour l'IA incarnée : les modèles du monde entraînés sur des images pixel par pixel souffrent d'un phénomène dit d'effondrement de représentation, où le modèle apprend à produire des embeddings redondants pour satisfaire trivialement ses objectifs de prédiction, sans rien comprendre du monde réel. Les solutions existantes contournent ce problème avec des heuristiques complexes, mises à jour stop-gradient, moyennes mobiles exponentielles (EMA), encodeurs pré-entraînés gelés, qui introduisent de la fragilité et limitent la flexibilité d'entraînement.

LeWM est la première architecture JEPA (Joint-Embedding Predictive Architecture) à résoudre ce problème avec seulement deux termes de perte : une perte de prédiction d'embedding suivant et un régulariseur SIGReg (Sketched-Isotropic-Gaussian Regularizer) qui force la diversité des représentations latentes. L'architecture repose sur un encodeur ViT-Tiny (~5M paramètres) et un prédicteur transformer (~10M paramètres). Le gain d'efficacité est spectaculaire : LeWM encode les observations avec 200× moins de tokens que DINO-WM, et atteint une vitesse de planification 48× supérieure (0,98 s contre 47 s par cycle). La recherche de l'hyperparamètre clé λ passe d'une complexité polynomiale O(n⁶) à une recherche par bissection O(log n).

Au-delà des performances brutes, LeWM développe une compréhension émergente de la physique : son espace latent permet de détecter des événements physiquement impossibles (téléportation) et présente un phénomène de redressement temporel des trajectoires latentes, sans qu'aucun régulariseur explicite ne l'impose, surpassant sur ce point PLDM qui, lui, ne l'obtient pas naturellement. Ces propriétés émergentes suggèrent que LeWM construit une représentation interne du monde plus structurée que ses prédécesseurs, une piste directement alignée avec la vision de LeCun sur les agents capables de raisonnement causal.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Le WorldModel : comment Yann LeCun et son équipe veulent révolutionner l’IA
1Next INpact 

Le WorldModel : comment Yann LeCun et son équipe veulent révolutionner l’IA

Yann LeCun, figure emblématique de l'intelligence artificielle et ancien responsable de la recherche IA chez Meta, a fondé début 2025 AMI Labs (Advanced Machine Intelligence) avec d'autres chercheurs de renom. En mars 2025, la start-up levait 890 millions d'euros, signalant d'emblée des ambitions considérables. Elle vient de présenter son premier modèle : LeWorldModel (LeWM), un système capable d'apprendre à partir d'images et de vidéos, puis d'anticiper ce qui va se passer à partir d'actions données. Techniquement, il repose sur l'architecture JEPA (Joint Embedding Predictive Architecture) et intègre un mécanisme appelé SIGReg, un régulariseur gaussien simple, pour éviter l'effondrement des représentations internes. Le modèle s'entraîne de bout en bout directement depuis les pixels, avec seulement deux termes de perte, et atteint des performances de contrôle comparables aux meilleurs systèmes existants, mais pour une fraction du coût de calcul habituel. Cette approche tranche radicalement avec celle des grands modèles de langage (LLM) comme GPT-4 ou Gemini, qui apprennent le monde à travers du texte. LeWM apprend à partir de la perception visuelle et de l'interaction avec l'environnement, plus proche de la façon dont un animal ou un enfant se construit une représentation du réel. L'enjeu est crucial : les LLM actuels nécessitent des ressources de calcul colossales (une seule requête à ChatGPT mobilise déjà des centaines de milliards d'opérations), et leur taille en paramètres explose à chaque nouvelle génération. Si LeWM tient ses promesses d'efficacité, il pourrait offrir une alternative moins gourmande en énergie et en infrastructure, rendant des systèmes d'IA avancés accessibles à bien plus d'acteurs. LeCun défend cette direction depuis plus de quatre ans : il plaide pour une IA capable de « raisonner comme les animaux et les humains », ancrée dans la perception et l'action plutôt que dans la prédiction de tokens. Son départ de Meta lui a permis de concrétiser cette vision sans les contraintes d'un grand groupe. AMI Labs s'inscrit dans un mouvement plus large de remise en question du paradigme LLM, porté également par des chercheurs comme Yoshua Bengio ou des startups comme World Labs de Fei-Fei Li, qui misent toutes sur des représentations du monde physique. La levée de fonds massive donne à LeCun les moyens de ses ambitions, mais LeWM reste pour l'instant un premier prototype, et la route vers une IA véritablement « embodied » et généraliste reste longue et incertaine.

RecherchePaper
1 source
15 millions de paramètres et 1 seul GPU : Yann LeCun fait un premier pas vers l’IA qui comprend le monde réel
2Numerama 

15 millions de paramètres et 1 seul GPU : Yann LeCun fait un premier pas vers l’IA qui comprend le monde réel

Yann LeCun franchit une étape concrète vers sa vision d'une IA capable de comprendre le monde physique. Avec un consortium de chercheurs, il présente LeWorldModel, un modèle de monde entraînable directement à partir de pixels bruts, sans les instabilités qui plombent habituellement ce type d'approche. Une première technique significative, rendue accessible avec seulement 15 millions de paramètres et un unique GPU. L'enjeu dépasse la performance brute : les modèles de monde (world models) sont au cœur de la vision de LeCun pour une IA "à la fois plus capable et plus sûre que les LLMs", capable de raisonner sur la causalité et d'anticiper les conséquences de ses actions dans un environnement réel. Là où les grands modèles de langage opèrent sur du texte, un modèle de monde ambitionne de représenter la réalité physique, prérequis fondamental pour la robotique autonome et les systèmes d'IA incarnés. La contribution technique centrale de LeWorldModel réside dans sa capacité à s'entraîner sur des flux vidéo bruts sans recourir aux architectures hybrides complexes qui causent d'ordinaire des instabilités d'apprentissage. Le choix d'une empreinte modeste, 15 millions de paramètres contre des centaines de milliards pour les modèles génératifs actuels, est délibéré : il s'agit d'un proof of concept reproductible, pas d'une course au gigantisme. LeCun opère dans ce contexte parallèlement à AMI Labs, sa startup fondée en France, dont les premières recherches n'ont pas encore été publiées. Cette publication s'inscrit dans la trajectoire intellectuelle que LeCun défend depuis plusieurs années contre le courant dominant des LLMs : construire des systèmes qui modélisent le monde plutôt que de simplement en prédire le texte. LeWorldModel ne résout pas ce défi, mais il pose une brique technique vérifiable sur un chemin que peu de laboratoires empruntent encore sérieusement.

UELa cofondation par LeCun d'AMI Labs, startup basée en France, ancre directement ces travaux dans l'écosystème français de l'IA et pourrait constituer un pôle de recherche européen sur l'IA incarnée.

RecherchePaper
1 source
La planification par gradient dans les modèles du monde sur des horizons prolongés
3Robohub 

La planification par gradient dans les modèles du monde sur des horizons prolongés

Des chercheurs de Meta AI, de l'Université de Californie Berkeley et du GRASP Lab ont publié un article présentant GRASP, un nouveau planificateur à base de gradients conçu pour les modèles de monde appris. L'équipe comprend Michael Psenka, Mike Rabbat, Aditi Krishnapriyan, Yann LeCun et Amir Bar. GRASP s'attaque à l'un des problèmes les plus persistants de l'IA incarnée : utiliser efficacement un modèle prédictif puissant pour planifier des séquences d'actions sur de longs horizons temporels. L'approche repose sur trois innovations clés : élever la trajectoire dans des états virtuels pour paralléliser l'optimisation dans le temps, introduire de la stochasticité directement dans les itérations d'état pour favoriser l'exploration, et reformuler les gradients afin que les actions reçoivent des signaux d'apprentissage clairs, tout en évitant les gradients instables qui traversent les modèles de vision haute dimension. Ce travail est important parce qu'il résout un goulot d'étranglement concret qui freine le déploiement des modèles de monde modernes dans des systèmes de contrôle réels. Un modèle de monde, dans ce contexte, est un simulateur différentiable appris : donné un état courant et une séquence d'actions futures, il prédit ce qui va se passer. En théorie, cela permettrait à un agent de planifier par optimisation, en faisant rouler le modèle en avant et en rétropropageant les erreurs. En pratique, sur de longs horizons, ce processus dégénère : les graphes de calcul deviennent mal conditionnés (problème d'explosion ou de disparition des gradients, analogue au backpropagation through time), des minima locaux apparaissent à cause de la structure non-greedy de la tâche, et les espaces latents de haute dimension introduisent des instabilités supplémentaires. GRASP contourne ces trois écueils simultanément, rendant la planification par gradient beaucoup plus robuste sans abandonner la différentiabilité du système. Les modèles de monde sont devenus un axe central de la recherche en IA depuis que Yann LeCun, directeur scientifique de Meta AI, a défendu leur rôle fondamental dans la quête d'une IA plus générale. Des systèmes comme DreamerV3 ou les modèles vidéo génératifs récents montrent que ces architectures peuvent désormais prédire de longues séquences d'observations dans des espaces visuels complexes et généraliser entre tâches. Mais posséder un simulateur puissant et s'en servir efficacement pour la prise de décision sont deux choses différentes. GRASP comble ce fossé en rendant la planification à long horizon viable là où elle échouait auparavant, ouvrant la voie à des agents robotiques ou autonomes capables de raisonner sur des séquences d'actions étendues dans des environnements réels.

RecherchePaper
1 source
DIAL : découpler intention et action par modélisation latente du monde pour les VLA de bout en bout
4arXiv cs.RO 

DIAL : découpler intention et action par modélisation latente du monde pour les VLA de bout en bout

Des chercheurs ont publié DIAL (Decoupling Intent and Action via Latent World Modeling), un nouveau cadre d'apprentissage pour les modèles Vision-Langage-Action (VLA) dédiés à la robotique. Le principe repose sur une séparation explicite entre l'intention de haut niveau et l'exécution motrice, via un goulot d'étranglement d'intention latente différentiable. Un module System-2, basé sur un grand modèle de langage visuel (VLM), génère une représentation interne de ce que le robot devrait percevoir dans le futur, une prévision visuelle latente qui encode l'intention. Un module léger System-1 traduit ensuite cette intention en actions motrices précises grâce à une dynamique inverse latente. L'entraînement se déroule en deux phases: un échauffement découplé pour stabiliser chaque module séparément, puis une optimisation conjointe de bout en bout. Sur le benchmark RoboCasa GR1 Tabletop, DIAL établit un nouvel état de l'art en nécessitant dix fois moins de démonstrations que les méthodes concurrentes. Ce gain d'efficacité est décisif dans un domaine où la collecte de données de démonstration reste coûteuse et chronophage. Réduire d'un ordre de grandeur le nombre d'exemples nécessaires change l'équation économique du déploiement de robots autonomes en environnements industriels ou domestiques. DIAL démontre également une généralisation zero-shot robuste: lors de déploiements réels sur un robot humanoïde, le système parvient à manipuler des objets et des configurations jamais rencontrés à l'entraînement, sans données supplémentaires. Cette capacité de transfert constitue l'un des verrous les plus difficiles de la robotique moderne. Le développement des VLA s'est accéléré ces deux dernières années avec l'essor des grands modèles multimodaux. La plupart des approches existantes utilisent toutefois le VLM comme simple encodeur, le connectant directement à une couche d'action, ce qui dégrade ses représentations sémantiques et introduit une instabilité à l'entraînement. DIAL corrige cette limite structurelle en exploitant pleinement les capacités de raisonnement du VLM pour la planification, tout en préservant ses connaissances pré-entraînées grâce au découplage. L'approche s'inscrit dans une tendance plus large visant à doter les robots d'une capacité à planifier avant d'agir, et pourrait accélérer l'adoption de systèmes capables de s'adapter à de nouveaux environnements sans réentraînement coûteux.

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic