Aller au contenu principal
Sam Altman affirme que toute une génération de chercheurs a freiné l'IA en sous-estimant le potentiel du passage à l'échelle
RechercheThe Decoder · 1 min de lecture

Sam Altman affirme que toute une génération de chercheurs a freiné l'IA en sous-estimant le potentiel du passage à l'échelle

Source originale ↗·

Lors d'une conférence à Stanford, Sam Altman a pris la défense du scaling des grands modèles de langage et s'en est pris directement aux chercheurs sceptiques, affirmant qu'une génération entière de scientifiques a freiné l'avancement de l'IA en sous-estimant ce que l'augmentation de la puissance de calcul et des données pouvait produire. Pour étayer son propos, le PDG d'OpenAI a cité un résultat récent de son entreprise : la réfutation automatisée d'une conjecture mathématique, un type de raisonnement abstrait longtemps considéré hors de portée des systèmes actuels.

Cette prise de position tranche dans un débat qui agite le monde de la recherche depuis plusieurs années. De nombreux académiciens et chercheurs avaient soutenu que le scaling seul ne suffirait pas à produire une intelligence générale, et que des approches fondamentalement différentes seraient nécessaires. Si Altman a raison, ces voix critiques n'ont pas seulement eu tort sur le plan technique : elles ont activement ralenti les investissements et les orientations de recherche vers une voie qui s'avère productive. L'enjeu dépasse la fierté intellectuelle, il touche à l'allocation de milliards de dollars en R&D.

Le contexte est celui d'une période charnière pour OpenAI, qui multiplie les démonstrations de capacités avancées pour justifier sa valorisation dépassant les 300 milliards de dollars. Les lois de scaling, théorisées notamment par les chercheurs de DeepMind et OpenAI autour de 2020, avaient déjà divisé la communauté. La sortie de modèles comme o3 et GPT-4o relance la question : le scaling est-il un plafond ou une rampe, et qui avait vraiment raison ?

💬 L'analyse de Mathieu

Altman a raison, même si c'est très pratique de le dire quand on vaut 300 milliards. Les paris de recherche se paient cash : sous-estimer le scaling pendant dix ans, c'est des milliards réorientés vers des impasses et des années brûlées pour tout le secteur. La conjecture mathématique réfutée automatiquement, c'est le genre de résultat qui rend le débat difficile à esquiver.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Google Deepmind affirme que les générateurs vidéo possèdent déjà les modèles du monde qui manquaient à la vision par ordinateur
1The Decoder 

Google Deepmind affirme que les générateurs vidéo possèdent déjà les modèles du monde qui manquaient à la vision par ordinateur

Google DeepMind a présenté GenCeption, un système qui détourne un générateur vidéo de son usage habituel pour lui faire accomplir des tâches classiques de vision par ordinateur, comme l'estimation de profondeur ou la segmentation d'images. Le modèle atteint des performances comparables aux meilleurs systèmes spécialisés actuels, alors qu'il a été entraîné avec beaucoup moins de données. Fait notable, son entraînement s'est appuyé presque exclusivement sur des vidéos synthétiques plutôt que sur des images réelles, une approche qui réduit considérablement les besoins en données annotées manuellement. Cette prouesse technique alimente un débat déjà vif dans la communauté de l'intelligence artificielle : les générateurs vidéo, conçus à l'origine pour produire des images animées réalistes, contiendraient-ils déjà, en creux, une forme de modèle universel du monde physique ? Si cette hypothèse se confirme, les implications sont importantes pour l'industrie de la vision par ordinateur, qui pourrait voir converger deux familles de systèmes jusqu'ici séparées, les modèles génératifs et les modèles de perception. Cela ouvrirait la voie à des architectures plus polyvalentes, capables à la fois de générer et de comprendre le monde visuel, réduisant les coûts de développement pour des applications comme la robotique, la conduite autonome ou l'analyse d'images médicales. Le débat sur les modèles du monde occupe une place centrale dans la recherche en IA depuis plusieurs années, porté notamment par des chercheurs comme Yann LeCun chez Meta, qui plaide pour des architectures capables d'apprendre une représentation implicite de la physique et de la causalité plutôt que de simplement prédire des pixels. Les résultats de Google DeepMind suggèrent que les générateurs vidéo, entraînés uniquement à prédire des séquences d'images plausibles, développent malgré tout une compréhension exploitable de la structure du monde réel. Reste à savoir si cette capacité se généralise à d'autres tâches de vision plus complexes, et si les grands laboratoires d'IA, entre Google, Meta et OpenAI, orienteront davantage leurs futurs modèles vers cette convergence entre génération et perception.

💬 L'idée que les générateurs vidéo pourraient déjà contenir un modèle du monde, c'est le genre de truc qu'on attendait depuis 2 ans. Ce qui me frappe, c'est le coût : entraîné quasi exclusivement sur du synthétique, sans annoter des masses d'images à la main, ça change la donne économique de la vision par ordinateur. Reste à voir si ça généralise au-delà de l'estimation de profondeur, mais si LeCun avait raison sur les modèles du monde, ce serait ironique que ce soit un générateur d'images qui lui donne raison plutôt qu'une architecture pensée pour ça.

RecherchePaper
1 source
Le lauréat du prix Turing Richard Sutton estime que l'IA générative pure ne peut pas faire de vraie science
2The Decoder 

Le lauréat du prix Turing Richard Sutton estime que l'IA générative pure ne peut pas faire de vraie science

Richard Sutton, lauréat du prix Turing 2024 pour ses travaux fondateurs sur l'apprentissage par renforcement, a pris une position tranchée sur les limites des systèmes d'IA générative actuels : ils sont structurellement incapables de faire de la vraie science. Sa critique centrale porte sur l'absence de boucle d'évaluation interne. Sans mécanisme pour juger la validité ou la nouveauté de ses propres résultats, un système génératif ne peut que produire du contenu vraisemblable, pas découvrir quelque chose de réellement nouveau. Toute nouveauté émergente reste fugace, non reconnue, aussitôt perdue. L'enjeu est considérable pour le débat autour de l'IA scientifique. De nombreux acteurs présentent les grands modèles de langage comme des outils de découverte, capables d'accélérer la recherche en biologie, en chimie ou en mathématiques. Sutton conteste cette vision : sans capacité d'autoévaluation, ces systèmes restent des moteurs de reformulation, non d'exploration. Pour les chercheurs qui misent sur l'IA pour générer des hypothèses originales, la distinction est fondamentale. Sutton pointe en contraste des systèmes comme AlphaGo ou AlphaProof, développés par Google DeepMind, qui intègrent une boucle d'évaluation explicite, le score d'une partie, la validité d'une preuve, permettant à l'IA de tester et valider ses propres productions. C'est précisément ce mécanisme qui rend ces systèmes capables d'une forme de créativité authentique, selon lui. Sa prise de position s'inscrit dans un débat plus large sur la trajectoire de l'IA : faut-il poursuivre la voie des modèles génératifs à grande échelle, ou revenir vers des architectures hybrides combinant génération et vérification formelle ?

RecherchePaper
1 source
Générer des tâches synthétiques pour agents à grande échelle grâce à l'exploration
3Apple Machine Learning 

Générer des tâches synthétiques pour agents à grande échelle grâce à l'exploration

L'entraînement post-formation des grands modèles de langage multimodaux (MLLMs) pour créer des agents interactifs ouvre des perspectives majeures dans des domaines aussi variés que l'utilisation d'ordinateurs, la navigation web et la robotique. Mais cette promesse se heurte à un obstacle concret : le manque criant de jeux de données de haute qualité pour les tâches agentiques, capables d'être à la fois diversifiées, réalisables et vérifiables. Les approches existantes pour générer ces tâches reposent soit sur l'annotation humaine, coûteuse et difficile à passer à l'échelle, soit sur le prompting direct des MLLMs avec des informations limitées sur l'environnement cible. Résultat : une couverture insuffisante et des tâches peu représentatives de la diversité réelle des cas d'usage. Ce goulot d'étranglement freine directement la montée en puissance des agents autonomes. Pour répondre à ce défi, des chercheurs présentent AutoPlay, un système scalable de génération automatique de tâches synthétiques. L'approche repose sur l'exploration de l'environnement cible pour collecter des informations contextuelles riches, permettant ainsi de produire des tâches à grande échelle sans recours massif à l'annotation humaine. Cette méthode d'exploration automatisée vise à augmenter significativement la couverture et la diversité des données d'entraînement pour les agents. Si les résultats se confirment, AutoPlay pourrait représenter une avancée structurante pour le domaine : en démocratisant la création de données d'entraînement agentiques, il permettrait d'accélérer le développement d'agents capables d'interagir de façon robuste avec des interfaces numériques complexes, réduisant ainsi la dépendance aux pipelines d'annotation humaine traditionnels.

RecherchePaper
1 source
L'IA gagne à Slay the Spire 2 après que les chercheurs ont remplacé les logs de chat croissants par une mémoire structurée
4The Decoder 

L'IA gagne à Slay the Spire 2 après que les chercheurs ont remplacé les logs de chat croissants par une mémoire structurée

Voici l'article traduit et résumé. L'équipe du projet AgenticSTS a mis au point un nouveau système de mémoire pour les agents d'intelligence artificielle, capable de remplacer les journaux de conversation qui s'allongent indéfiniment. Concrètement, au lieu d'accumuler l'historique complet des échanges dans le contexte du modèle, le système répartit l'information dans cinq couches de mémoire structurées distinctes. Testée sur le jeu de cartes Slay the Spire 2, cette approche permet de maintenir la taille du prompt autour de 5 000 tokens, contre plus de 500 000 tokens pour les méthodes classiques qui empilent simplement l'ensemble des échanges passés. Résultat des tests : l'agent équipé de cette mémoire structurée remporte 6 parties sur 10, alors qu'aucun des agents concurrents utilisant l'approche traditionnelle ne parvient à gagner une seule partie. Cette avancée s'attaque à un problème central des agents IA actuels : plus une session s'allonge, plus le contexte devient lourd, coûteux à traiter et difficile à exploiter efficacement par le modèle, ce qui dégrade ses performances et augmente les coûts de calcul. En réduisant drastiquement la taille du contexte nécessaire tout en améliorant les résultats, cette méthode pourrait rendre les agents IA plus efficaces pour des tâches longues et complexes, que ce soit dans le jeu, l'assistance technique ou d'autres applications nécessitant un raisonnement soutenu sur la durée. Elle ouvre aussi la voie à des déploiements moins coûteux, un enjeu majeur pour les entreprises qui exploitent ces systèmes à grande échelle. Le défi de la gestion de la mémoire dans les agents conversationnels est un sujet de recherche actif, à mesure que ces systèmes sont appelés à effectuer des tâches de plus en plus longues et complexes, comme jouer à des jeux stratégiques ou gérer des projets multi-étapes. Slay the Spire, un jeu de cartes exigeant en planification et en prise de décision séquentielle, sert ici de banc d'essai révélateur pour comparer les architectures de mémoire. Les résultats suggèrent qu'une organisation structurée de l'information, plutôt qu'un simple empilement chronologique, pourrait devenir une norme pour les futurs agents autonomes, avec des implications potentielles pour d'autres domaines où le raisonnement à long terme est crucial.

💬 Le vrai enjeu, c'est pas que l'IA gagne à un jeu de cartes, c'est que 500 000 tokens qui deviennent 5 000 sans perte de perf, ça change le calcul économique de tout agent qui tourne longtemps. Cinq couches de mémoire au lieu d'un log qui s'empile, c'est le genre d'architecture bête et solide qu'on aurait dû avoir depuis le début. Reste à voir si ça tient sur des tâches réelles et pas juste sur un jeu de plateau bien borné, mais si oui, empiler tout l'historique dans le contexte va vite passer pour une méthode d'un autre temps.

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic