Rich Sutton, prix Turing, lance Oak Lab pour créer des agents IA capables d'apprendre par eux-mêmes
Richard Sutton, lauréat du prix Turing 2024 et co-fondateur de l'apprentissage par renforcement moderne, a lancé une nouvelle startup baptisée Oak Lab à Toronto. Sutton, connu pour ses travaux fondateurs sur le reinforcement learning aux côtés d'Andrew Barto, qualifie les méthodes actuelles de deep learning de "faibles et inefficaces". Son objectif avec Oak Lab est de développer des agents d'intelligence artificielle capables d'apprendre en continu directement à partir de leur environnement, plutôt que de dépendre d'un entraînement préalable sur des jeux de données statiques. L'entreprise est basée au Canada, pays où Sutton a mené l'essentiel de sa carrière de recherche, notamment à l'Université de l'Alberta.
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Cette initiative marque une rupture potentielle avec le paradigme dominant de l'IA actuelle, largement fondé sur l'apprentissage supervisé et les grands modèles de langage entraînés une fois puis déployés. Si les agents d'Oak Lab parviennent réellement à apprendre en temps réel, cela pourrait ouvrir la voie à des systèmes plus adaptatifs, capables de s'ajuster à des environnements changeants sans réentraînement complet, un enjeu majeur pour la robotique, les véhicules autonomes ou les assistants personnels évoluant dans des contextes imprévisibles.
Cette annonce s'inscrit dans un débat plus large sur les limites des grands modèles de langage, que plusieurs chercheurs de premier plan jugent insuffisants pour atteindre une intelligence artificielle véritablement générale. Sutton défend depuis des années l'idée que l'apprentissage continu et l'expérience directe avec le monde réel sont essentiels, une philosophie qui a notamment inspiré des avancées comme AlphaGo. Reste à voir si Oak Lab parviendra à traduire ces principes théoriques en systèmes concrets et compétitifs face aux géants du secteur.
Pas d'impact direct sur la France/UE
Bon, un prix Turing qui traite le deep learning actuel de "faible et inefficace", ça fait forcément du bruit. L'idée d'apprendre en continu sur l'environnement plutôt que sur un dataset figé, c'est exactement ce qui manque à nos LLM aujourd'hui, incapables de s'adapter sans réentraînement complet. Reste que Sutton n'a jamais eu à livrer un produit compétitif face à des boîtes qui brûlent des milliards en compute, alors je dirais : la théorie est solide depuis vingt ans, la question c'est si Oak Lab tient en prod.