Redis LangCache : un cache sémantique managé qui réduit jusqu'à 90% les coûts API des LLM
Redis a lancé LangCache, un service de cache sémantique entièrement géré qui s'interpose entre une application et un grand modèle de langage. Le principe : au lieu de renvoyer chaque requête vers le LLM, LangCache compare la question entrante au sens des questions déjà traitées, via une recherche vectorielle, et renvoie directement la réponse stockée si une correspondance suffisamment proche existe. Redis annonce des économies pouvant atteindre 90% sur les coûts d'API et des réponses jusqu'à 15 fois plus rapides lors d'un cache hit. Le service est disponible dès maintenant en préversion publique sur Redis Cloud, accessible via une API REST avec des SDK Python et JavaScript, Redis précisant que ses fonctionnalités peuvent encore évoluer. Dans une démonstration citée par l'entreprise, une inférence directe a nécessité 2,232 secondes et consommé 514 tokens en entrée plus 250 en sortie, contre 0,37 seconde et zéro token facturé avec LangCache, soit environ six fois plus rapide. Le client Mangoes.ai, qui exploite une application vocale de suivi de patients, rapporte un taux de cache de 70%, une réduction de 70% de sa facture LLM et des réponses quatre fois plus rapides.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
L'enjeu tient à un constat simple : dans les assistants de support ou les pipelines RAG en production, la même intention revient des milliers de fois par jour sous des formulations différentes, et la plupart des systèmes traitent chaque reformulation comme une requête entièrement nouvelle et entièrement facturée. Les techniques de "prefix caching" existantes n'éliminent qu'une partie du problème: elles réutilisent les calculs liés à un contexte partagé, mais la requête atteint tout de même le modèle et la réponse est intégralement régénérée. LangCache, en stockant directement la réponse finale plutôt que des états intermédiaires, permet d'éviter purement et simplement l'appel au modèle lorsqu'une correspondance sémantique est trouvée, supprimant à la fois les tokens d'entrée, les tokens de sortie et la latence de génération. Redis propose une formule d'estimation des économies mensuelles égale aux coûts de tokens de sortie multipliés par le taux de cache: avec 200 dollars de dépense mensuelle en LLM, dont 60% en tokens de sortie, et un taux de cache de 50%, l'économie atteint 60 dollars par mois. Pour les entreprises qui opèrent des LLM à grande échelle, ce type de levier pèse directement sur la rentabilité des produits d'IA générative.
LangCache s'appuie sur la base de données vectorielle de Redis et fonctionne avec n'importe quel fournisseur de LLM et n'importe quel langage de programmation, la génération des embeddings étant assurée par le service ou personnalisable. Le comportement du cache se règle via des seuils de similarité, des durées de vie (TTL), des politiques d'éviction et des contrôles adaptatifs de précision, avec un suivi des taux de succès depuis la console Redis Cloud. Ce lancement s'inscrit dans une tendance plus large où les fournisseurs d'infrastructure cherchent à réduire le coût structurel de l'inférence à mesure que les usages en production se multiplient, après des innovations comme le prefix caching côté moteurs d'inférence. Le résultat réel dépendra toutefois du degré de répétition présent dans le trafic de chaque application, et le choix des questions à mettre en cache reste une décision qui demande une attention particulière selon Redis.
Pas d'impact direct sur la France/UE