Agents Bedrock de récupération de connaissances gérée : recherche augmentée par des agents autonomes
Amazon vient de lancer la récupération agentique (agentic retrieval) pour les Knowledge Bases managées d'Amazon Bedrock, accessible via une nouvelle API baptisée AgenticRetrieveStream. Contrairement à la recherche classique qui effectue une seule requête vectorielle et renvoie les k documents les plus proches par score de similarité, ce nouveau mode s'appuie sur un modèle de fondation qui décompose la question de l'utilisateur en sous-questions, interroge la base pour chacune d'elles, évalue si les preuves collectées sont suffisantes, puis itère si nécessaire avant de générer une réponse directement dans le même appel. L'équipe AWS illustre le problème avec un exemple concret : sur un corpus de 25 ans de lettres aux actionnaires d'Amazon, une question simple comme « quel est le message le plus important » ramène des résultats médiocres, le premier chunk portant sur la charte graphique du logo Amazon plutôt que sur le fond. Le défaut s'aggrave nettement avec une question comparative du type « comment le discours sur le recrutement, l'investissement long terme et l'obsession client a-t-il évolué entre 2020 et 2023 », car un seul vecteur d'embedding ne peut pas représenter fidèlement plusieurs intentions à la fois, ce qui produit soit un nuage de résultats disparates, soit un amas dominé par le signal le plus fort.
Cette limite touche directement les analystes et les équipes support qui posent des questions multi-parties, comparatives ou exploratoires portant sur des PDF, des slides, des tickets ou des transcriptions. Jusqu'ici, les entreprises devaient bricoler leurs propres frameworks d'agents autour de l'API Retrieve classique, en programmant elles-mêmes la boucle de planification, la déduplication des résultats et le critère d'arrêt, ce qui ajoutait de la latence, des coûts et des risques de fiabilité propres à chaque implémentation. En intégrant cette logique directement dans l'API des Knowledge Bases, AWS supprime ce travail d'infrastructure répété pour chaque application et fiabilise le comportement d'itération, un peu comme un analyste humain qui chercherait d'abord des informations sur le recrutement en 2020, puis en 2023, avant de comparer et de synthétiser.
L'enjeu plus large est celui de la fiabilité des systèmes de RAG (retrieval-augmented generation) face à des questions réelles d'entreprise, rarement des recherches ponctuelles mais souvent des demandes croisant plusieurs sources et plusieurs dimensions temporelles ou thématiques. AWS positionne cette fonctionnalité comme un complément à l'API Retrieve standard plutôt qu'un remplacement total, à choisir selon la complexité de la question posée. L'option generateResponse=False permet de ne récupérer que les résultats de recherche sans génération de texte, laissant aux développeurs le contrôle sur l'usage final des données extraites.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




