Aller au contenu principal
Le WorldModel : comment Yann LeCun et son équipe veulent révolutionner l’IA
RechercheNext INpact · 2 min de lecture

Le WorldModel : comment Yann LeCun et son équipe veulent révolutionner l’IA

Source originale ↗·

Yann LeCun, figure emblématique de l'intelligence artificielle et ancien responsable de la recherche IA chez Meta, a fondé début 2025 AMI Labs (Advanced Machine Intelligence) avec d'autres chercheurs de renom. En mars 2025, la start-up levait 890 millions d'euros, signalant d'emblée des ambitions considérables. Elle vient de présenter son premier modèle : LeWorldModel (LeWM), un système capable d'apprendre à partir d'images et de vidéos, puis d'anticiper ce qui va se passer à partir d'actions données. Techniquement, il repose sur l'architecture JEPA (Joint Embedding Predictive Architecture) et intègre un mécanisme appelé SIGReg, un régulariseur gaussien simple, pour éviter l'effondrement des représentations internes. Le modèle s'entraîne de bout en bout directement depuis les pixels, avec seulement deux termes de perte, et atteint des performances de contrôle comparables aux meilleurs systèmes existants, mais pour une fraction du coût de calcul habituel.

Cette approche tranche radicalement avec celle des grands modèles de langage (LLM) comme GPT-4 ou Gemini, qui apprennent le monde à travers du texte. LeWM apprend à partir de la perception visuelle et de l'interaction avec l'environnement, plus proche de la façon dont un animal ou un enfant se construit une représentation du réel. L'enjeu est crucial : les LLM actuels nécessitent des ressources de calcul colossales (une seule requête à ChatGPT mobilise déjà des centaines de milliards d'opérations), et leur taille en paramètres explose à chaque nouvelle génération. Si LeWM tient ses promesses d'efficacité, il pourrait offrir une alternative moins gourmande en énergie et en infrastructure, rendant des systèmes d'IA avancés accessibles à bien plus d'acteurs.

LeCun défend cette direction depuis plus de quatre ans : il plaide pour une IA capable de « raisonner comme les animaux et les humains », ancrée dans la perception et l'action plutôt que dans la prédiction de tokens. Son départ de Meta lui a permis de concrétiser cette vision sans les contraintes d'un grand groupe. AMI Labs s'inscrit dans un mouvement plus large de remise en question du paradigme LLM, porté également par des chercheurs comme Yoshua Bengio ou des startups comme World Labs de Fei-Fei Li, qui misent toutes sur des représentations du monde physique. La levée de fonds massive donne à LeCun les moyens de ses ambitions, mais LeWM reste pour l'instant un premier prototype, et la route vers une IA véritablement « embodied » et généraliste reste longue et incertaine.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Une IA capable de comprendre le monde qui l’entoure grâce à un seul GPU : LeWordModel veut révolutionner le secteur
1Frandroid 

Une IA capable de comprendre le monde qui l’entoure grâce à un seul GPU : LeWordModel veut révolutionner le secteur

Yann LeCun, chercheur français et directeur scientifique de Meta AI, reconnu comme l'un des pères fondateurs de l'intelligence artificielle moderne, a dévoilé avec son équipe un nouveau système baptisé LeWorldModel. La particularité revendiquée de ce modèle est sa capacité à fonctionner sur un seul GPU, une contrainte matérielle bien plus accessible que les clusters de milliers de puces utilisés par les grands modèles actuels. Les premiers résultats expérimentaux sont décrits comme très encourageants par les chercheurs. Si la promesse tient, LeWorldModel représenterait une avancée significative dans la démocratisation de l'IA : rendre possible une compréhension contextuelle du monde physique sans infrastructure colossale ouvre la voie à des déploiements embarqués, sur des robots, des véhicules autonomes ou des appareils grand public. Cela réduirait aussi la dépendance aux géants du cloud pour qui souhaite développer des applications d'IA perceptuelle. LeWorldModel s'inscrit dans la vision de long terme de LeCun, qui critique depuis plusieurs années les grands modèles de langage (LLM) pour leur incapacité à raisonner sur le monde réel. Il défend l'approche des "world models", des systèmes capables de simuler et anticiper les états du monde physique, inspirés du fonctionnement cognitif humain. Cette annonce relance le débat sur la voie vers une IA plus robuste, face aux approches dominantes de type GPT portées par OpenAI et Google.

UEYann LeCun, chercheur français à la tête de Meta AI, porte une vision qui pourrait orienter la recherche européenne en IA vers des approches embarquées moins dépendantes des infrastructures cloud américaines.

RecherchePaper
1 source
15 millions de paramètres et 1 seul GPU : Yann LeCun fait un premier pas vers l’IA qui comprend le monde réel
2Numerama 

15 millions de paramètres et 1 seul GPU : Yann LeCun fait un premier pas vers l’IA qui comprend le monde réel

Yann LeCun franchit une étape concrète vers sa vision d'une IA capable de comprendre le monde physique. Avec un consortium de chercheurs, il présente LeWorldModel, un modèle de monde entraînable directement à partir de pixels bruts, sans les instabilités qui plombent habituellement ce type d'approche. Une première technique significative, rendue accessible avec seulement 15 millions de paramètres et un unique GPU. L'enjeu dépasse la performance brute : les modèles de monde (world models) sont au cœur de la vision de LeCun pour une IA "à la fois plus capable et plus sûre que les LLMs", capable de raisonner sur la causalité et d'anticiper les conséquences de ses actions dans un environnement réel. Là où les grands modèles de langage opèrent sur du texte, un modèle de monde ambitionne de représenter la réalité physique, prérequis fondamental pour la robotique autonome et les systèmes d'IA incarnés. La contribution technique centrale de LeWorldModel réside dans sa capacité à s'entraîner sur des flux vidéo bruts sans recourir aux architectures hybrides complexes qui causent d'ordinaire des instabilités d'apprentissage. Le choix d'une empreinte modeste, 15 millions de paramètres contre des centaines de milliards pour les modèles génératifs actuels, est délibéré : il s'agit d'un proof of concept reproductible, pas d'une course au gigantisme. LeCun opère dans ce contexte parallèlement à AMI Labs, sa startup fondée en France, dont les premières recherches n'ont pas encore été publiées. Cette publication s'inscrit dans la trajectoire intellectuelle que LeCun défend depuis plusieurs années contre le courant dominant des LLMs : construire des systèmes qui modélisent le monde plutôt que de simplement en prédire le texte. LeWorldModel ne résout pas ce défi, mais il pose une brique technique vérifiable sur un chemin que peu de laboratoires empruntent encore sérieusement.

UELa cofondation par LeCun d'AMI Labs, startup basée en France, ancre directement ces travaux dans l'écosystème français de l'IA et pourrait constituer un pôle de recherche européen sur l'IA incarnée.

RecherchePaper
1 source
Le nouveau projet de recherche LeWorldModel (LeWM) de Yann LeCun cible l'effondrement JEPA dans la modélisation prédictive du monde par pixels
3MarkTechPost 

Le nouveau projet de recherche LeWorldModel (LeWM) de Yann LeCun cible l'effondrement JEPA dans la modélisation prédictive du monde par pixels

Yann LeCun et une équipe de chercheurs issus du Mila, de l'Université de Montréal, de la New York University, de Samsung SAIL et de la Brown University viennent de présenter LeWorldModel (LeWM), une architecture de modélisation du monde capable de s'entraîner de bout en bout directement à partir de pixels bruts, sans les béquilles techniques qui handicapent les approches actuelles. Le problème que résout LeWM est fondamental pour l'IA incarnée : les modèles du monde entraînés sur des images pixel par pixel souffrent d'un phénomène dit d'effondrement de représentation, où le modèle apprend à produire des embeddings redondants pour satisfaire trivialement ses objectifs de prédiction, sans rien comprendre du monde réel. Les solutions existantes contournent ce problème avec des heuristiques complexes, mises à jour stop-gradient, moyennes mobiles exponentielles (EMA), encodeurs pré-entraînés gelés, qui introduisent de la fragilité et limitent la flexibilité d'entraînement. LeWM est la première architecture JEPA (Joint-Embedding Predictive Architecture) à résoudre ce problème avec seulement deux termes de perte : une perte de prédiction d'embedding suivant et un régulariseur SIGReg (Sketched-Isotropic-Gaussian Regularizer) qui force la diversité des représentations latentes. L'architecture repose sur un encodeur ViT-Tiny (~5M paramètres) et un prédicteur transformer (~10M paramètres). Le gain d'efficacité est spectaculaire : LeWM encode les observations avec 200× moins de tokens que DINO-WM, et atteint une vitesse de planification 48× supérieure (0,98 s contre 47 s par cycle). La recherche de l'hyperparamètre clé λ passe d'une complexité polynomiale O(n⁶) à une recherche par bissection O(log n). Au-delà des performances brutes, LeWM développe une compréhension émergente de la physique : son espace latent permet de détecter des événements physiquement impossibles (téléportation) et présente un phénomène de redressement temporel des trajectoires latentes, sans qu'aucun régulariseur explicite ne l'impose, surpassant sur ce point PLDM qui, lui, ne l'obtient pas naturellement. Ces propriétés émergentes suggèrent que LeWM construit une représentation interne du monde plus structurée que ses prédécesseurs, une piste directement alignée avec la vision de LeCun sur les agents capables de raisonnement causal.

RecherchePaper
1 source
SkillMAS : quand l’IA réorganise son équipe et réécrit ses outils en temps réel
4Le Big Data 

SkillMAS : quand l’IA réorganise son équipe et réécrit ses outils en temps réel

Une équipe de chercheurs des universités Jiao Tong de Shanghai et du Centre-Sud, en partenariat avec le fabricant de smartphones OPPO, a publié en mai 2026 les travaux fondateurs du framework SkillMAS, un nouveau système d'orchestration d'agents d'intelligence artificielle. L'architecture, entièrement non paramétrique, ne modifie pas les poids des modèles de langage sous-jacents : elle fonctionne comme une couche logicielle supérieure qui permet à des équipes d'agents autonomes de réorganiser leurs rôles et de réécrire leurs outils en temps réel, sans aucune reprogrammation manuelle. Le mécanisme central repose sur une coévolution synchronisée à deux échelles : une échelle micro, qui gère les compétences techniques de chaque agent individuel, et une échelle macro, qui supervise l'organigramme collectif et redistribue les responsabilités au sein de l'équipe. Les deux niveaux s'influencent mutuellement en continu, ce qui confère au système une plasticité jusqu'ici absente des architectures classiques. Ce niveau d'adaptabilité répond à une limite structurelle des systèmes multi-agents actuels : leurs rôles et leurs outils sont figés par les développeurs au moment de la conception. Face à l'imprévu, ces architectures rigides entrent en boucles d'erreurs, consomment des quantités massives de tokens et nécessitent une supervision humaine constante, ce qui cantonne la technologie à des tâches bien balisées. SkillMAS brise ce plafond en permettant au système de s'adapter dynamiquement aux tâches complexes, réduisant à la fois les coûts opérationnels et la dépendance au pilotage humain. Pour OPPO, l'enjeu est directement industriel : cette architecture ouvre la voie à des assistants virtuels capables de gérer des situations inédites sans intervention extérieure, un saut qualitatif significatif pour les appareils grand public. Entre 2023 et 2025, la recherche en systèmes multi-agents avançait sur deux fronts séparés : des projets comme Voyager (Microsoft Research, 2023) exploraient la capacité des agents à créer leurs propres outils, tandis que des frameworks comme MetaGPT se concentraient sur la coordination collective. Aucun système ne fusionnait réellement ces deux dimensions. SkillMAS représente cette convergence, en unifiant apprentissage automatique et systèmes distribués dans une architecture unique. La validation en laboratoire démontre sa supériorité face aux standards actuels, et l'implication directe d'un acteur industriel comme OPPO suggère un passage prochain vers des applications commerciales. La prochaine étape sera de confirmer ces performances dans des environnements réels, hors conditions de laboratoire, où la robustesse des systèmes adaptatifs sera véritablement mise à l'épreuve.

UERecherche publiée par des universités chinoises en partenariat avec OPPO, sans impact immédiat sur la France/UE, mais susceptible d'influencer les architectures multi-agents à moyen terme.

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic