Aller au contenu principal
Outils · Outil ·

Redis LangCache : un cache sémantique managé qui réduit jusqu'à 90% les coûts API des LLM

Redis a lancé LangCache, un service de cache sémantique entièrement géré qui s'interpose entre une application et un grand modèle de langage. Le principe : au lieu de renvoyer chaque requête vers le LLM, LangCache compare la question entrante au sens des questions déjà traitées, via une recherche vectorielle, et renvoie directement la réponse stockée si une correspondance suffisamment proche existe. Redis annonce des économies pouvant atteindre 90% sur les coûts d'API et des réponses jusqu'à 15 fois plus rapides lors d'un cache hit. Le service est disponible dès maintenant en préversion publique sur Redis Cloud, accessible via une API REST avec des SDK Python et JavaScript, Redis précisant que ses fonctionnalités peuvent encore évoluer. Dans une démonstration citée par l'entreprise, une inférence directe a nécessité 2,232 secondes et consommé 514 tokens en entrée plus 250 en sortie, contre 0,37 seconde et zéro token facturé avec LangCache, soit environ six fois plus rapide. Le client Mangoes.ai, qui exploite une application vocale de suivi de patients, rapporte un taux de cache de 70%, une réduction de 70% de sa facture LLM et des réponses quatre fois plus rapides.

2 min de lecturePertinence 49

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

L'enjeu tient à un constat simple : dans les assistants de support ou les pipelines RAG en production, la même intention revient des milliers de fois par jour sous des formulations différentes, et la plupart des systèmes traitent chaque reformulation comme une requête entièrement nouvelle et entièrement facturée. Les techniques de "prefix caching" existantes n'éliminent qu'une partie du problème: elles réutilisent les calculs liés à un contexte partagé, mais la requête atteint tout de même le modèle et la réponse est intégralement régénérée. LangCache, en stockant directement la réponse finale plutôt que des états intermédiaires, permet d'éviter purement et simplement l'appel au modèle lorsqu'une correspondance sémantique est trouvée, supprimant à la fois les tokens d'entrée, les tokens de sortie et la latence de génération. Redis propose une formule d'estimation des économies mensuelles égale aux coûts de tokens de sortie multipliés par le taux de cache: avec 200 dollars de dépense mensuelle en LLM, dont 60% en tokens de sortie, et un taux de cache de 50%, l'économie atteint 60 dollars par mois. Pour les entreprises qui opèrent des LLM à grande échelle, ce type de levier pèse directement sur la rentabilité des produits d'IA générative.

LangCache s'appuie sur la base de données vectorielle de Redis et fonctionne avec n'importe quel fournisseur de LLM et n'importe quel langage de programmation, la génération des embeddings étant assurée par le service ou personnalisable. Le comportement du cache se règle via des seuils de similarité, des durées de vie (TTL), des politiques d'éviction et des contrôles adaptatifs de précision, avec un suivi des taux de succès depuis la console Redis Cloud. Ce lancement s'inscrit dans une tendance plus large où les fournisseurs d'infrastructure cherchent à réduire le coût structurel de l'inférence à mesure que les usages en production se multiplient, après des innovations comme le prefix caching côté moteurs d'inférence. Le résultat réel dépendra toutefois du degré de répétition présent dans le trafic de chaque application, et le choix des questions à mettre en cache reste une décision qui demande une attention particulière selon Redis.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Reducto lance r-1, un modèle d'analyse de documents en une passe qui réduit les erreurs de 20% pour 1 cent par page41MarkTechPostOutils 02Fireworks AI lance Nexus, une couche de routage qui bascule le code de routine vers des modèles ouverts pour réduire les coûts41MarkTechPostOutils 03ACRouter choisit le modèle d'IA le plus adapté à chaque tâche, réduisant les coûts de 2,6 fois par rapport à un usage exclusif d'Opus43VentureBeat AIOutils 

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.