Ne vous laissez pas tromper : les LLM ne raisonnent pas
Le 10 mars 2016 à Séoul, au deuxième match d'une rencontre en cinq parties, AlphaGo a posé une pierre sur la cinquième ligne du plateau, un coup si absurde que certains commentateurs y ont vu un bug. C'était le fameux coup 37, et le programme a fini par s'imposer 4 à 1 face à Lee Sedol, l'un des plus grands joueurs professionnels de l'histoire. Lee a reconnu ensuite avoir cru à une simple machine fondée sur le calcul de probabilités, avant de conclure qu'AlphaGo était « créatif ». L'auteur, qui a participé à la conception du programme, rappelle que Deep Blue avait battu Garry Kasparov en 1997 en explorant six à huit coups par joueur et en évaluant 200 millions de positions par seconde, avec des règles écrites à la main. Le go est incomparablement plus complexe : explorer ne serait-ce qu'une fraction des issues possibles prendrait des milliards d'années à un superordinateur. AlphaGo repose sur deux systèmes. Son réseau de politique, entraîné à deviner le coup d'un bon joueur humain, jugeait le coup 37 banal, avec environ une chance sur 10 000 d'être joué par un expert. C'est la machinerie de recherche qui l'a retenu, en construisant et en parcourant explicitement un arbre de milliers de branches, chacune représentant un futur possible.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MIT Technology Review. Lire l'article original →
L'auteur y voit une erreur d'interprétation répandue : le coup 37 n'est pas un éclair d'intuition pure, mais le produit d'un raisonnement, capacité que l'IA actuelle ne possède pas. Il établit un parallèle avec la distinction popularisée par Daniel Kahneman entre le système 1, rapide et intuitif, et le système 2, lent et délibératif. Les réseaux d'AlphaGo fournissaient les intuitions, la recherche les mettait à l'épreuve, et aucune des deux moitiés ne suffisait seule. Les grands modèles de langage, eux, choisissent un jeton après l'autre, ce qui relève du système 1 : une complétion de motifs rapide et étonnamment efficace. Pour les faire délibérer, on les laisse produire des étapes intermédiaires, la « chaîne de pensée », avec des gains réels en mathématiques et en programmation. Mais, contrairement à la recherche d'AlphaGo, ce n'est pas un mécanisme distinct : ces étapes sont générées par la même prédiction du jeton suivant, simplement prolongée. Pour obtenir des résultats fiables et de véritables découvertes en science ou en médecine, il faudrait donc doter les systèmes d'un raisonnement authentique.
L'auteur identifie trois lacunes qui empêchent ce que font les chatbots de passer pour du raisonnement au sens où un scientifique l'entendrait. La première est que ces modèles ne maintiennent généralement pas de représentation explicite, persistante et inspectable (le texte fourni s'interrompt à cet endroit). Le débat s'inscrit dans le virage pris par le secteur après le lancement de ChatGPT, quand on a constaté que la seule aisance linguistique ne suffisait pas à rendre les modèles réellement utiles. Les modèles dits « de raisonnement » en sont la réponse industrielle, mais l'argument avancé ici est que l'amélioration des performances ne dit rien de la nature du mécanisme sous-jacent. La piste esquissée consiste à combiner l'intuition des réseaux neuronaux avec une recherche explicite, comme dans AlphaGo, plutôt que de prolonger indéfiniment la génération de texte.
Pas d'impact direct sur la France/UE