Aller au contenu principal
Google : TurboQuant réduit la mémoire des modèles d'IA sans perte de qualité
RechercheArs Technica AI · 1 min de lecture

Google : TurboQuant réduit la mémoire des modèles d'IA sans perte de qualité

Source originale ↗·

Google Research vient de dévoiler TurboQuant, un algorithme de compression capable de réduire drastiquement l'empreinte mémoire des grands modèles de langage tout en améliorant leurs performances. Les premiers résultats sont frappants : jusqu'à 8 fois plus rapide et 6 fois moins gourmand en mémoire, sans dégradation de la qualité des sorties.

L'enjeu est considérable pour l'ensemble du secteur de l'IA. Les LLMs sont notoires pour leur consommation mémoire excessive, un goulot d'étranglement qui freine leur déploiement à grande échelle et sur des appareils aux ressources limitées. Une compression efficace sans perte de qualité représente l'un des défis techniques les plus critiques du moment, aussi bien pour les fournisseurs cloud que pour les acteurs souhaitant embarquer ces modèles en local.

TurboQuant cible spécifiquement le cache clé-valeur (key-value cache), que Google décrit comme une "antisèche numérique" stockant les informations calculées pour éviter de les retraiter à chaque génération de token. Ce cache repose sur des vecteurs haute dimension, pouvant compter des centaines ou milliers d'embeddings, qui encodent le sens sémantique du texte traité. Ces structures sont précisément ce qui gonfle la mémoire. Là où les techniques classiques de quantification (réduction de la précision numérique) dégradent inévitablement la qualité des prédictions, TurboQuant parvient à contourner ce compromis.

Si ces résultats se confirment à plus grande échelle, Google Research pourrait redéfinir les standards d'optimisation des LLMs, ouvrant la voie à des modèles puissants tournant sur du matériel bien moins onéreux, et réduisant significativement les coûts d'inférence pour les services en production.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Google accélère la mémoire IA de 8x avec TurboQuant, réduisant les coûts de 50 %
1VentureBeat AI 

Google accélère la mémoire IA de 8x avec TurboQuant, réduisant les coûts de 50 %

Google Research a publié hier TurboQuant, une suite d'algorithmes de compression qui résout l'un des principaux goulots d'étranglement des grands modèles de langage : le cache KV (Key-Value). Lorsqu'un modèle traite un long document ou une conversation complexe, il doit stocker chaque mot sous forme de vecteurs haute dimension en mémoire GPU, un espace coûteux qui se sature rapidement. TurboQuant réduit cette consommation mémoire d'un facteur 6 en moyenne, accélère le calcul des logits d'attention d'un facteur 8, et permettrait aux entreprises qui l'adoptent de réduire leurs coûts d'inférence de plus de 50 %. La solution est entièrement logicielle, ne nécessite aucun réentraînement des modèles, et ses algorithmes, dont PolarQuant et la transformée Quantized Johnson-Lindenstrauss (QJL), sont publiés gratuitement sous un cadre de recherche ouvert, y compris pour un usage commercial. Les résultats seront présentés aux conférences ICLR 2026 à Rio de Janeiro et AISTATS 2026 à Tanger. L'impact est immédiat et concret : les entreprises qui déploient des LLMs à grande échelle font face à des coûts d'infrastructure GPU considérables, largement dictés par la taille du cache KV lors de l'inférence. Réduire ce cache d'un facteur 6 sans perte de qualité signifie qu'un même serveur peut traiter beaucoup plus de requêtes en parallèle, ou que des modèles jusqu'ici réservés aux data centers peuvent tourner sur du matériel existant. L'annonce a d'ailleurs déjà fait bouger les marchés financiers : les cours de plusieurs fabricants de mémoire ont reculé, les investisseurs anticipant une baisse de la demande en VRAM. Une lecture que nuance le paradoxe de Jevons, historiquement, les gains d'efficacité ont tendance à stimuler la consommation totale plutôt qu'à la réduire. La recherche sous-jacente remonte à 2024, avec une formalisation progressive des frameworks mathématiques en début 2025. TurboQuant s'attaque à un problème connu de longue date : la quantification classique des vecteurs introduit des erreurs d'arrondi qui s'accumulent et dégradent la cohérence sémantique des modèles, jusqu'aux hallucinations. De plus, les méthodes traditionnelles stockent des constantes de normalisation qui annulent une partie des gains de compression. PolarQuant contourne ce problème en convertissant les vecteurs en coordonnées polaires après une rotation aléatoire : la distribution des angles devient prévisible, éliminant le besoin de ces constantes coûteuses. Une seconde couche basée sur QJL corrige les erreurs résiduelles avec seulement 1 bit supplémentaire par valeur. Cette publication intervient au moment où l'IA agentique, des systèmes capables de raisonner sur de très longues séquences, devient l'enjeu central de l'industrie, et où la course à l'efficacité mémoire est aussi stratégique que la course à la puissance brute.

UELes entreprises et startups européennes déployant des LLMs à grande échelle pourraient réduire leurs coûts d'inférence de moitié en adoptant ces algorithmes open source sans réentraînement ni achat de matériel supplémentaire.

RecherchePaper
1 source
2InfoQ AI 

La compression TurboQuant de Google pourrait accélérer l'inférence sans perte de précision sur du matériel moins puissant

Google Research a dévoilé TurboQuant, un nouvel algorithme de quantification conçu pour compresser les caches Key-Value (KV) des grands modèles de langage jusqu'à six fois leur taille originale. Cette technique permet d'atteindre une compression à 3,5 bits avec une perte de précision quasi nulle, et sans nécessiter de réentraînement du modèle. Les premiers benchmarks communautaires confirment des gains d'efficacité substantiels, permettant aux développeurs de faire tourner des fenêtres de contexte très larges sur du matériel bien moins puissant qu'auparavant. L'enjeu est considérable : le cache KV est l'un des principaux goulots d'étranglement en mémoire lors de l'inférence de LLM, surtout lorsque les contextes atteignent des centaines de milliers de tokens. En réduisant l'empreinte mémoire de ces caches par un facteur pouvant atteindre 6x, TurboQuant ouvre la voie à des déploiements sur des GPU grand public ou des serveurs moins coûteux, ce qui représente une réduction directe des coûts d'inférence pour les entreprises et les développeurs indépendants. La compression des caches KV est un domaine de recherche actif, avec des travaux concurrents comme KVQuant ou StreamingLLM déjà publiés ces dernières années. L'originalité de TurboQuant réside dans sa capacité à atteindre ce niveau de compression sans phase de fine-tuning, ce qui facilite son intégration dans des pipelines existants. Google Research n'a pas encore précisé de calendrier de disponibilité dans ses produits, mais cette publication s'inscrit dans la course plus large à réduire le coût computationnel des modèles toujours plus grands comme Gemini.

UELes développeurs et entreprises européens pourraient bénéficier indirectement d'une réduction des coûts d'inférence LLM en déployant des modèles à large contexte sur du matériel grand public ou des serveurs moins coûteux.

RecherchePaper
1 source
TurboQuant veut réduire grandement les besoins en mémoire des IA génératives… et ça marche
3Next INpact 

TurboQuant veut réduire grandement les besoins en mémoire des IA génératives… et ça marche

Des chercheurs de Google ont publié un ensemble d'algorithmes de quantification baptisé TurboQuant, annoncé officiellement le 24 mars 2026, bien que le papier de recherche soit disponible sur arXiv depuis le 28 avril 2025. Ces algorithmes permettent une compression massive des modèles de langage (LLM) en réduisant significativement leur empreinte mémoire, en particulier lors de l'inférence générative. La recherche a été acceptée pour présentation à la conférence ICLR 2026, qui se tiendra du 23 au 27 avril à Rio de Janeiro, l'une des références mondiales en apprentissage automatique. Le problème résolu est concret et coûteux : les LLM modernes s'appuient sur des fenêtres contextuelles de plus en plus larges et des milliards de paramètres, ce qui exige des quantités croissantes de RAM pour fonctionner efficacement. La quantification vectorielle existait déjà comme technique de compression, mais elle introduisait systématiquement un surcoût mémoire cumulatif qui en limitait les bénéfices. TurboQuant prétend répondre à ce problème de façon « optimale » au sens information-théorique du terme, une référence directe aux travaux de Shannon sur la compression sans perte. Si les résultats tiennent à l'échelle, cela pourrait réduire les coûts d'infrastructure pour les entreprises déployant des LLM en production, et rendre des modèles plus puissants accessibles sur du matériel moins onéreux. La sortie de TurboQuant s'inscrit dans une course intense à l'optimisation mémoire, alors que le prix et la disponibilité des GPU et de la RAM VRAM haute performance constituent des goulets d'étranglement majeurs pour l'industrie. Des approches comme GPTQ, AWQ ou bitsandbytes ont déjà popularisé la quantification à 4 ou 8 bits, mais chacune implique des compromis en précision ou en vitesse. Google entre sur ce terrain avec une approche fondée sur la théorie de l'information, ce qui lui confère une légitimité académique solide. La prochaine étape sera l'adoption par la communauté open source et la validation sur des modèles de grande taille en dehors des laboratoires Google.

UEImpact indirect : si les résultats sont confirmés à grande échelle, les entreprises européennes déployant des LLM en production pourraient réduire significativement leurs coûts d'infrastructure GPU/VRAM.

RecherchePaper
1 source
Google a peut-être réglé la crise de la mémoire vive (RAM) avec un algorithme
4Numerama 

Google a peut-être réglé la crise de la mémoire vive (RAM) avec un algorithme

Google vient de dévoiler TurboQuant, un algorithme de quantification qui promet de diviser par six les besoins en mémoire vive des modèles d'intelligence artificielle. Une avancée potentiellement décisive à l'heure où la consommation mémoire des grands modèles de langage constitue l'un des principaux goulots d'étranglement du secteur. La crise de la RAM dans l'IA n'est pas anecdotique : elle conditionne directement le coût d'inférence, la scalabilité des déploiements cloud, et l'accessibilité des modèles sur du matériel grand public. Réduire drastiquement l'empreinte mémoire sans dégrader les performances ouvre la voie à des déploiements plus larges, moins coûteux, et potentiellement embarqués sur des appareils edge. TurboQuant s'appuie sur une approche mathématique de compression des poids des réseaux de neurones, réduisant la précision numérique des paramètres tout en minimisant la perte de qualité. Le facteur annoncé de ×6 sur la consommation mémoire représenterait un bond significatif par rapport aux techniques de quantification existantes comme GPTQ ou AWQ, déjà largement utilisées dans l'industrie. Si les résultats se confirment à grande échelle, Google pourrait redistribuer les cartes dans la course à l'efficience des LLMs, un terrain où Meta, Microsoft et les acteurs open-source rivalisent d'ingéniosité pour faire tourner des modèles toujours plus grands sur des infrastructures toujours plus contraintes.

UEUne réduction par six des besoins en RAM des modèles IA pourrait permettre aux entreprises et laboratoires européens de déployer des modèles plus puissants sur leur infrastructure existante, abaissant la barrière d'entrée pour la recherche et l'industrie IA en Europe.

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic