Aller au contenu principal
TurboQuant veut réduire grandement les besoins en mémoire des IA génératives… et ça marche
RechercheNext INpact · 1 min de lecture

TurboQuant veut réduire grandement les besoins en mémoire des IA génératives… et ça marche

Source originale ↗·

Des chercheurs de Google ont publié un ensemble d'algorithmes de quantification baptisé TurboQuant, annoncé officiellement le 24 mars 2026, bien que le papier de recherche soit disponible sur arXiv depuis le 28 avril 2025. Ces algorithmes permettent une compression massive des modèles de langage (LLM) en réduisant significativement leur empreinte mémoire, en particulier lors de l'inférence générative. La recherche a été acceptée pour présentation à la conférence ICLR 2026, qui se tiendra du 23 au 27 avril à Rio de Janeiro, l'une des références mondiales en apprentissage automatique.

Le problème résolu est concret et coûteux : les LLM modernes s'appuient sur des fenêtres contextuelles de plus en plus larges et des milliards de paramètres, ce qui exige des quantités croissantes de RAM pour fonctionner efficacement. La quantification vectorielle existait déjà comme technique de compression, mais elle introduisait systématiquement un surcoût mémoire cumulatif qui en limitait les bénéfices. TurboQuant prétend répondre à ce problème de façon « optimale » au sens information-théorique du terme, une référence directe aux travaux de Shannon sur la compression sans perte. Si les résultats tiennent à l'échelle, cela pourrait réduire les coûts d'infrastructure pour les entreprises déployant des LLM en production, et rendre des modèles plus puissants accessibles sur du matériel moins onéreux.

La sortie de TurboQuant s'inscrit dans une course intense à l'optimisation mémoire, alors que le prix et la disponibilité des GPU et de la RAM VRAM haute performance constituent des goulets d'étranglement majeurs pour l'industrie. Des approches comme GPTQ, AWQ ou bitsandbytes ont déjà popularisé la quantification à 4 ou 8 bits, mais chacune implique des compromis en précision ou en vitesse. Google entre sur ce terrain avec une approche fondée sur la théorie de l'information, ce qui lui confère une légitimité académique solide. La prochaine étape sera l'adoption par la communauté open source et la validation sur des modèles de grande taille en dehors des laboratoires Google.

Impact France/UE

Impact indirect : si les résultats sont confirmés à grande échelle, les entreprises européennes déployant des LLM en production pourraient réduire significativement leurs coûts d'infrastructure GPU/VRAM.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Google : TurboQuant réduit la mémoire des modèles d'IA sans perte de qualité
1Ars Technica AI 

Google : TurboQuant réduit la mémoire des modèles d'IA sans perte de qualité

Google Research vient de dévoiler TurboQuant, un algorithme de compression capable de réduire drastiquement l'empreinte mémoire des grands modèles de langage tout en améliorant leurs performances. Les premiers résultats sont frappants : jusqu'à 8 fois plus rapide et 6 fois moins gourmand en mémoire, sans dégradation de la qualité des sorties. L'enjeu est considérable pour l'ensemble du secteur de l'IA. Les LLMs sont notoires pour leur consommation mémoire excessive, un goulot d'étranglement qui freine leur déploiement à grande échelle et sur des appareils aux ressources limitées. Une compression efficace sans perte de qualité représente l'un des défis techniques les plus critiques du moment, aussi bien pour les fournisseurs cloud que pour les acteurs souhaitant embarquer ces modèles en local. TurboQuant cible spécifiquement le cache clé-valeur (key-value cache), que Google décrit comme une "antisèche numérique" stockant les informations calculées pour éviter de les retraiter à chaque génération de token. Ce cache repose sur des vecteurs haute dimension, pouvant compter des centaines ou milliers d'embeddings, qui encodent le sens sémantique du texte traité. Ces structures sont précisément ce qui gonfle la mémoire. Là où les techniques classiques de quantification (réduction de la précision numérique) dégradent inévitablement la qualité des prédictions, TurboQuant parvient à contourner ce compromis. Si ces résultats se confirment à plus grande échelle, Google Research pourrait redéfinir les standards d'optimisation des LLMs, ouvrant la voie à des modèles puissants tournant sur du matériel bien moins onéreux, et réduisant significativement les coûts d'inférence pour les services en production.

RecherchePaper
1 source
Google accélère la mémoire IA de 8x avec TurboQuant, réduisant les coûts de 50 %
2VentureBeat AI 

Google accélère la mémoire IA de 8x avec TurboQuant, réduisant les coûts de 50 %

Google Research a publié hier TurboQuant, une suite d'algorithmes de compression qui résout l'un des principaux goulots d'étranglement des grands modèles de langage : le cache KV (Key-Value). Lorsqu'un modèle traite un long document ou une conversation complexe, il doit stocker chaque mot sous forme de vecteurs haute dimension en mémoire GPU, un espace coûteux qui se sature rapidement. TurboQuant réduit cette consommation mémoire d'un facteur 6 en moyenne, accélère le calcul des logits d'attention d'un facteur 8, et permettrait aux entreprises qui l'adoptent de réduire leurs coûts d'inférence de plus de 50 %. La solution est entièrement logicielle, ne nécessite aucun réentraînement des modèles, et ses algorithmes, dont PolarQuant et la transformée Quantized Johnson-Lindenstrauss (QJL), sont publiés gratuitement sous un cadre de recherche ouvert, y compris pour un usage commercial. Les résultats seront présentés aux conférences ICLR 2026 à Rio de Janeiro et AISTATS 2026 à Tanger. L'impact est immédiat et concret : les entreprises qui déploient des LLMs à grande échelle font face à des coûts d'infrastructure GPU considérables, largement dictés par la taille du cache KV lors de l'inférence. Réduire ce cache d'un facteur 6 sans perte de qualité signifie qu'un même serveur peut traiter beaucoup plus de requêtes en parallèle, ou que des modèles jusqu'ici réservés aux data centers peuvent tourner sur du matériel existant. L'annonce a d'ailleurs déjà fait bouger les marchés financiers : les cours de plusieurs fabricants de mémoire ont reculé, les investisseurs anticipant une baisse de la demande en VRAM. Une lecture que nuance le paradoxe de Jevons, historiquement, les gains d'efficacité ont tendance à stimuler la consommation totale plutôt qu'à la réduire. La recherche sous-jacente remonte à 2024, avec une formalisation progressive des frameworks mathématiques en début 2025. TurboQuant s'attaque à un problème connu de longue date : la quantification classique des vecteurs introduit des erreurs d'arrondi qui s'accumulent et dégradent la cohérence sémantique des modèles, jusqu'aux hallucinations. De plus, les méthodes traditionnelles stockent des constantes de normalisation qui annulent une partie des gains de compression. PolarQuant contourne ce problème en convertissant les vecteurs en coordonnées polaires après une rotation aléatoire : la distribution des angles devient prévisible, éliminant le besoin de ces constantes coûteuses. Une seconde couche basée sur QJL corrige les erreurs résiduelles avec seulement 1 bit supplémentaire par valeur. Cette publication intervient au moment où l'IA agentique, des systèmes capables de raisonner sur de très longues séquences, devient l'enjeu central de l'industrie, et où la course à l'efficacité mémoire est aussi stratégique que la course à la puissance brute.

UELes entreprises et startups européennes déployant des LLMs à grande échelle pourraient réduire leurs coûts d'inférence de moitié en adoptant ces algorithmes open source sans réentraînement ni achat de matériel supplémentaire.

RecherchePaper
1 source
L’IA générative bouscule la recherche en mathématiques
3Next INpact 

L’IA générative bouscule la recherche en mathématiques

42 est toujours la réponse, de toute façon. En mai dernier, OpenAI a annoncé qu'un de ses modèles internes avait résolu l'un des problèmes d'Erdős, celui des distances unitaires, numéroté 90. Ce n'était pas une première tentative : dès novembre, l'entreprise affirmait déjà que GPT-5 avait trouvé des solutions à dix problèmes posés par le mathématicien Paul Erdős, des résultats que le média Next qualifie de largement gonflés. Cette fois, le 20 mai, neuf mathématiciens et mathématiciennes ont mis en ligne sur la plateforme arXiv leurs remarques sur la démonstration produite par OpenAI, validant au passage sa réalité. David Madore, maître de conférences en mathématiques à Télécom ParisTech, confirme sans détour : « C'est indiscutable que des problèmes d'Erdős ont été résolus par des IA génératives. » Il précise toutefois que les premières annonces étaient exagérées, certaines IA ayant simplement retrouvé des résultats déjà présents dans la littérature scientifique. Cette percée soulève des questions concrètes sur la nature réelle des progrès accomplis et sur ce qu'elle change pour la recherche en mathématiques. Thomas Bloom, mathématicien à l'université de Manchester, souligne que la preuve initiale de l'IA, bien que valide, a été considérablement améliorée par les chercheurs humains d'OpenAI et par de nombreux autres mathématiciens ayant contribué à l'article. Melanie Matchett Wood, professeure à Harvard, va plus loin en avançant que si l'expertise humaine mobilisée pour vérifier et affiner la solution avait été employée en amont pour chercher un contre-exemple à la conjecture, les mathématiciens auraient probablement pu la résoudre eux-mêmes. Ces nuances comptent : elles rappellent que la résolution de ces problèmes reste un travail collaboratif entre machine et humains, et non une démonstration d'autonomie totale de l'IA. Le contexte de cette controverse tient à la stratégie de communication des entreprises d'IA générative, qui cherchent depuis plusieurs mois à convaincre que leurs modèles atteignent le niveau d'un chercheur professionnel. David Madore relativise la portée de l'exploit en rappelant que les problèmes d'Erdős, bien que non triviaux, reposent généralement sur des outils et des définitions peu sophistiqués comparés à d'autres pans des mathématiques. Il note aussi qu'OpenAI a utilisé un modèle interne aux caractéristiques non divulguées, sans préciser le temps de calcul nécessaire à la résolution, ce qui limite la possibilité d'évaluer objectivement la performance. Le mathématicien reconnaît malgré tout qu'un problème important a été résolu de façon essentiellement autonome par l'IA, tout en insistant sur le fait que ce succès reste isolé parmi de nombreux autres problèmes soumis aux modèles sans résultat probant, et qu'il ne s'agit en rien du « Saint Graal des mathématiques ».

UEUn mathématicien français de Télécom ParisTech (David Madore) apporte une expertise critique centrale à ce débat, illustrant la contribution académique française à l'évaluation des capacités réelles de l'IA générative.

💬 Un problème d'Erdős tombé, c'est réel, Madore le confirme sans détour. Mais regarde qui a fait le travail : la preuve de l'IA, les mathématiciens l'ont largement retapée après coup, et une chercheuse d'Harvard estime que si cette énergie humaine avait été mise en amont, ils l'auraient sans doute trouvée seuls. Ce qui se confirme surtout, une fois de plus, c'est que les annonces des boîtes d'IA sortent gonflées et que seule la vérification par les pairs, des mois plus tard, dit ce qui tient vraiment debout.

RecherchePaper
1 source
Meta et Stanford présentent Fast Byte Latent Transformer : 50% de bande passante mémoire en moins, sans tokenisation
4MarkTechPost 

Meta et Stanford présentent Fast Byte Latent Transformer : 50% de bande passante mémoire en moins, sans tokenisation

Des chercheurs de Meta, de Stanford University et de l'Université de Washington ont présenté trois nouvelles méthodes pour accélérer significativement le Byte Latent Transformer (BLT), une architecture de modèle de langage qui traite directement le texte en octets bruts plutôt qu'en tokens. La contribution principale s'appelle BLT Diffusion (BLT-D) et s'attaque à un problème central du BLT : son décodeur local génère les octets un à un, de manière autoregressive, ce qui implique plusieurs passes mémoire là où un modèle tokenisé n'en nécessite qu'une seule. Sur les serveurs modernes de LLM, le goulot d'étranglement n'est pas la puissance de calcul brute mais la bande passante mémoire, c'est-à-dire le coût répété de charger les poids du modèle et les caches KV depuis la mémoire. La solution proposée remplace ce décodage octet par octet par une diffusion discrète par blocs : au lieu de prédire un seul octet à la fois, le modèle génère simultanément des blocs de 4, 8 ou 16 octets en démasquant progressivement les positions les plus certaines à chaque étape, selon deux stratégies, l'une basée sur un seuil de confiance, l'autre sur une contrainte d'entropie cumulative. L'enjeu pratique est considérable. Selon les chercheurs, ces méthodes permettent de réduire la bande passante mémoire à l'inférence de plus de 50%, ce qui se traduit directement par une accélération de la génération de texte. Pour les entreprises qui déploient des LLM à grande échelle, où le coût d'inférence est un facteur économique déterminant, ce gain représente une réduction significative de la latence et des coûts opérationnels. Au-delà de la vitesse, les modèles octet-niveau comme BLT présentent des avantages intrinsèques que les architectures tokenisées peinent à égaler : meilleure gestion du texte multilingue, robustesse accrue face au bruit dans les entrées, et traitement naturel du code, des chiffres et des caractères spéciaux, sans les artefacts produits par les tokenizers comme le byte-pair encoding (BPE). Le BLT avait déjà constitué une avancée notable en démontrant qu'un modèle opérant sur des octets bruts pouvait atteindre les performances des modèles tokenisés à grande échelle, grâce à une segmentation dynamique en patches de longueur variable pilotée par l'entropie locale du texte. Les régions difficiles à prédire reçoivent des patches courts, les passages plus prévisibles des patches plus longs, avec une taille moyenne de 4 octets et un maximum de 8. La majeure partie du calcul s'effectue sur des représentations latentes compressées via trois composants : un encodeur local, un Transformer global, et un décodeur local. Le principal frein à l'adoption industrielle de cette approche restait sa lenteur à l'inférence, rendue pénalisante par le nombre élevé de passes décodeur nécessaires. Les trois techniques introduites dans ce nouveau travail visent directement ce verrou, ouvrant concrètement la voie au déploiement des modèles octet-niveau dans des environnements de production exigeants, où vitesse et coût ne sont pas négociables.

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic