Réduire les coûts de RAG sur Amazon Bedrock grâce à la compression adaptée aux requêtes
Amazon Web Services a publié un article technique détaillant une méthode baptisée "query-aware compression" pour réduire les coûts des applications de génération augmentée par récupération (RAG) construites sur Amazon Bedrock. Le principe repose sur une architecture à deux modèles: un petit modèle, Claude Haiku d'Anthropic, filtre les extraits de texte récupérés par le moteur de recherche vectoriel pour ne conserver que les passages réellement pertinents par rapport à la question posée, avant qu'un modèle plus puissant, Claude Sonnet, ne génère la réponse finale. Les deux appels s'exécutent au sein d'une seule fonction AWS Lambda, en aval d'un récupérateur comme Amazon Bedrock Knowledge Bases, le service RAG managé d'AWS adossé à Amazon OpenSearch Serverless. Dans un flux RAG classique, le système récupère généralement entre 5 et 20 segments de texte (chunks) pertinents, ce qui représente souvent plusieurs milliers de tokens d'entrée par requête pour des cas d'usage comme la documentation technique ou les contenus juridiques. La mise en œuvre nécessite un compte AWS actif, un rôle IAM dédié et l'activation de l'accès aux deux modèles concernés dans la console Bedrock.
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
L'enjeu est directement financier: dans une architecture RAG à grande échelle, le nombre de tokens envoyés au modèle principal à chaque appel constitue une part importante de la facture totale. En confiant le tri des extraits à un modèle nettement moins coûteux avant l'appel au modèle principal, les entreprises peuvent réduire significativement leur consommation de tokens tout en préservant la qualité des réponses. AWS souligne un bénéfice secondaire notable: en éliminant le contexte non pertinent transmis au modèle, cette compression réduit aussi la surface propice aux hallucinations, un problème récurrent des systèmes RAG. La méthode peut en outre se combiner avec d'autres fonctionnalités déjà présentes sur Bedrock, comme la mise en cache des prompts, le routage intelligent des requêtes (Intelligent Prompt Routing) ou l'API de reclassement (Rerank), pour cumuler les économies.
Cette approche illustre une tension classique des systèmes RAG en production: pour garantir des réponses fiables, les moteurs de récupération sont généralement calibrés pour maximiser le rappel, c'est-à-dire renvoyer un ensemble large de contenus potentiellement utiles, quitte à gonfler le volume de texte transmis au modèle. AWS met en avant l'architecture ouverte et composable de Bedrock, qui permet d'insérer des étapes de traitement personnalisées après la récupération et avant la génération. Cette publication s'inscrit dans une tendance plus large de l'industrie vers des stratégies d'optimisation des coûts pour les applications d'IA générative déployées à grande échelle, comme la mise en cascade de modèles de tailles différentes selon la complexité de la tâche.
Les entreprises europeennes utilisant Amazon Bedrock pour leurs applications RAG peuvent appliquer cette technique pour reduire leurs couts d'infrastructure IA.