
Ces startups en quête de la prochaine avancée majeure des LLM
Une nouvelle génération de startups s'attaque aux limites des transformeurs, l'architecture qui sous-tend la quasi-totalité des grands modèles de langage actuels. Ce mécanisme a été décrit pour la première fois en 2017 par des chercheurs de Google dans l'article fondateur "Attention Is All You Need". Neuf ans plus tard, selon Justin Dangel, cofondateur et PDG de la startup Subquadratic, "l'ensemble de l'industrie de l'IA repose sur les transformeurs" qui ont "changé le monde". Mais leur mécanisme central, l'attention dense, qui compare chaque mot d'un texte à tous les autres pour en capturer le sens, devient très coûteux à mesure que les documents s'allongent : un texte de 10 000 mots peut nécessiter environ 50 millions de multiplications. Cette explosion des calculs explique en grande partie la consommation énergétique massive des modèles actuels. OpenAI prévoit ainsi de dépenser 50 milliards de dollars en puissance de calcul cette année, selon son président Greg Brockman, et l'Agence internationale de l'énergie anticipe un doublement de la consommation électrique des centres de données d'ici 2030.
Cette limite technique a des conséquences concrètes pour toute l'industrie. Les modèles les plus récents, notamment les modèles dits "de raisonnement" qui rédigent des notes intermédiaires (une "chaîne de pensée") avant de répondre, ou les agents qui doivent ingérer d'immenses quantités de données comme des bibliothèques de documents entières ou des bases de code, ont besoin de fenêtres de contexte toujours plus larges. Or les transformeurs, en traitant le texte mot par mot, peinent justement à conserver en mémoire de très grands volumes d'informations. Ce qui faisait la force du transformeur, sa capacité à analyser finement chaque relation entre les mots, devient donc un frein à la progression des modèles vers des tâches plus complexes, plus rapides et moins coûteuses à exécuter.
Face à ce constat, plusieurs jeunes entreprises, dont Subquadratic, cherchent à repenser les fondations de l'IA générative plutôt que de se contenter de correctifs temporaires. Une des pistes explorées consiste à remplacer l'attention dense par une attention dite "sparse" (éparse), qui ne calcule les relations que pour certaines paires de mots plutôt que pour l'ensemble d'un texte, réduisant ainsi drastiquement la charge de calcul. Cette approche n'est pas nouvelle en soi, plusieurs chercheurs ayant déjà proposé des variantes d'attention éparse par le passé sans obtenir de résultats aussi convaincants que l'attention dense classique. Ces startups, moins exposées que les géants déjà installés du secteur, misent sur le fait qu'elles ont peu à perdre et beaucoup à gagner si l'une de leurs innovations parvient à surpasser l'architecture dominante actuelle.
Aucune entreprise francaise ou europeenne n'est citee, mais la hausse de la consommation energetique des data centers evoquee concerne aussi les infrastructures europeennes.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




