Aller au contenu principal
OutilsAWS ML Blog · 2 min de lecture

Agents Bedrock de récupération de connaissances gérée : recherche augmentée par des agents autonomes

Source originale ↗·

Amazon vient de lancer la récupération agentique (agentic retrieval) pour les Knowledge Bases managées d'Amazon Bedrock, accessible via une nouvelle API baptisée AgenticRetrieveStream. Contrairement à la recherche classique qui effectue une seule requête vectorielle et renvoie les k documents les plus proches par score de similarité, ce nouveau mode s'appuie sur un modèle de fondation qui décompose la question de l'utilisateur en sous-questions, interroge la base pour chacune d'elles, évalue si les preuves collectées sont suffisantes, puis itère si nécessaire avant de générer une réponse directement dans le même appel. L'équipe AWS illustre le problème avec un exemple concret : sur un corpus de 25 ans de lettres aux actionnaires d'Amazon, une question simple comme « quel est le message le plus important » ramène des résultats médiocres, le premier chunk portant sur la charte graphique du logo Amazon plutôt que sur le fond. Le défaut s'aggrave nettement avec une question comparative du type « comment le discours sur le recrutement, l'investissement long terme et l'obsession client a-t-il évolué entre 2020 et 2023 », car un seul vecteur d'embedding ne peut pas représenter fidèlement plusieurs intentions à la fois, ce qui produit soit un nuage de résultats disparates, soit un amas dominé par le signal le plus fort.

Cette limite touche directement les analystes et les équipes support qui posent des questions multi-parties, comparatives ou exploratoires portant sur des PDF, des slides, des tickets ou des transcriptions. Jusqu'ici, les entreprises devaient bricoler leurs propres frameworks d'agents autour de l'API Retrieve classique, en programmant elles-mêmes la boucle de planification, la déduplication des résultats et le critère d'arrêt, ce qui ajoutait de la latence, des coûts et des risques de fiabilité propres à chaque implémentation. En intégrant cette logique directement dans l'API des Knowledge Bases, AWS supprime ce travail d'infrastructure répété pour chaque application et fiabilise le comportement d'itération, un peu comme un analyste humain qui chercherait d'abord des informations sur le recrutement en 2020, puis en 2023, avant de comparer et de synthétiser.

L'enjeu plus large est celui de la fiabilité des systèmes de RAG (retrieval-augmented generation) face à des questions réelles d'entreprise, rarement des recherches ponctuelles mais souvent des demandes croisant plusieurs sources et plusieurs dimensions temporelles ou thématiques. AWS positionne cette fonctionnalité comme un complément à l'API Retrieve standard plutôt qu'un remplacement total, à choisir selon la complexité de la question posée. L'option generateResponse=False permet de ne récupérer que les résultats de recherche sans génération de texte, laissant aux développeurs le contrôle sur l'usage final des données extraites.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Créez des agents de recherche riches en contexte avec Deep Agents et Bedrock AgentCore
1AWS ML Blog 

Créez des agents de recherche riches en contexte avec Deep Agents et Bedrock AgentCore

Amazon Web Services et LangChain ont publié une approche conjointe pour construire des agents de recherche IA capables de travailler en profondeur sans saturer leur fenêtre de contexte. La solution combine LangChain Deep Agents, un orchestrateur qui délègue le travail intensif à des sous-agents éphémères et spécialisés, avec Amazon Bedrock AgentCore, l'infrastructure cloud qui fournit à chaque sous-agent son environnement isolé : un vrai navigateur web dans une MicroVM (machine virtuelle légère à usage unique) pour la recherche en ligne, et un interpréteur Python complet pour l'analyse de données. Le modèle de langage utilisé est Claude Sonnet d'Anthropic, accessible via Amazon Bedrock. L'architecture décrite suit un schéma précis : un agent coordinateur reçoit la requête, consulte une mémoire persistante (AgentCore Memory) pour récupérer des analyses antérieures, puis lance trois sous-agents navigateurs en parallèle, chacun explorant le site d'un concurrent dans sa propre MicroVM. Une fois leurs résultats consolidés, un quatrième sous-agent analyste génère un graphique comparatif et un rapport Markdown via l'interpréteur de code. L'ensemble du flux est tracé via Amazon CloudWatch ou LangSmith. L'intérêt concret de cette architecture réside dans la résolution d'un problème structurel des agents IA : la compétition pour la fenêtre de contexte. Lorsqu'un agent lit dix pages web et exécute du code en même temps, la mémoire disponible pour le raisonnement stratégique s'épuise rapidement. En isolant chaque tâche intensive dans un sous-agent dédié qui ne renvoie qu'un résultat synthétique, le coordinateur conserve toute sa capacité de réflexion. Pour les équipes qui construisent des workflows de recherche concurrentielle, d'analyse de marché ou de veille technologique, cela représente un gain de fiabilité et de scalabilité significatif, sans avoir à chaîner manuellement les prompts ou à découper séquentiellement les traitements. Cette publication s'inscrit dans une dynamique plus large de structuration de l'écosystème des agents IA en production. AWS positionne Bedrock AgentCore comme une couche d'infrastructure standardisée pour les agents multi-étapes, rivalisant avec des offres comme OpenAI's Assistants API ou les frameworks autonomes tels qu'AutoGPT et CrewAI. LangChain, de son côté, continue de s'imposer comme la couche d'orchestration de référence dans les architectures multi-agents complexes. La disponibilité d'AgentCore comme fournisseur natif dans la CLI Deep Agents, accessible via une simple commande deepagents --sandbox agentcore, suggère une volonté de réduire la friction à l'adoption. La prochaine étape décrite dans le tutoriel est le déploiement de l'agent en tant que service managé et isolé par session via AgentCore Runtime, ce qui ouvre la voie à des applications de recherche IA persistantes et scalables en entreprise.

OutilsTuto
1 source
Amazon Bedrock AgentCore : paiements par agents autonomes avec garde-fous intégrés
2AWS ML Blog 

Amazon Bedrock AgentCore : paiements par agents autonomes avec garde-fous intégrés

Amazon a annoncé en avant-première AgentCore Payments, une nouvelle fonctionnalité d'Amazon Bedrock développée en partenariat avec Coinbase Developer Platform et Stripe (via Privy), qui permet aux agents d'intelligence artificielle d'effectuer des transactions financières au nom de leurs utilisateurs. Disponible en préversion dans quatre régions, Virginie du Nord, Oregon, Francfort et Sydney, la solution repose sur un système de portefeuilles embarqués auto-custodiaux hébergés chez ces partenaires. Concrètement, chaque session de paiement est isolée, assortie d'un budget configurable et d'une durée de vie limitée (TTL), empêchant tout agent de dépenser librement au-delà du périmètre défini. Les informations sensibles, numéros de carte, codes CVV, clés d'API développeur, ne transitent jamais dans le contexte de l'agent, ce qui réduit considérablement la surface d'exposition en cas de compromission. Cette capacité répond à un verrou majeur dans le déploiement des agents autonomes : jusqu'ici, dès qu'une ressource web, un outil ou un endpoint MCP nécessitait un paiement, l'agent se retrouvait bloqué, incapable de finaliser la tâche sans intervention humaine. En intégrant la transaction directement dans l'infrastructure AWS, Amazon permet aux développeurs de construire des agents capables de mener à bien des missions complexes sans interruption. Les garde-fous sont conçus pour répondre aux trois risques principaux identifiés : les dépenses incontrôlées liées au comportement non-déterministe des grands modèles de langage, l'absence de délégation explicite de la part de l'utilisateur final, et la compromission des credentials développeur ou des tokens de portefeuille. Les limites de dépense sont appliquées au niveau de l'infrastructure, en dehors du modèle, ce qui les rend incontournables même si l'agent est manipulé ou mal configuré. Cette annonce s'inscrit dans une tendance de fond : les grandes plateformes cloud cherchent à industrialiser l'infrastructure nécessaire aux agents autonomes, au-delà des simples appels d'API. AWS positionne Bedrock AgentCore comme une couche de confiance entre les agents et les systèmes financiers réels, à un moment où la course à l'agentivité s'intensifie entre Amazon, Google et Microsoft. Le choix de Coinbase et Stripe comme partenaires n'est pas anodin : il permet de couvrir à la fois les paiements en crypto-monnaie et les paiements en monnaie fiduciaire, deux rails complémentaires selon les cas d'usage. La fonctionnalité reste en préversion, avec des API susceptibles d'évoluer avant la disponibilité générale, mais elle marque une étape concrète vers des agents capables d'agir pleinement en mandataires économiques de leurs utilisateurs, avec un cadre de responsabilité clairement défini.

UELa région Frankfurt est incluse dans les quatre régions de préversion, ouvrant l'accès aux développeurs européens, mais sans cadre réglementaire spécifique à l'UE mentionné pour encadrer les paiements délégués à des agents IA.

OutilsOutil
1 source
Chroma lance Context-1 : un modèle de recherche à base d'agents de 20 milliards de paramètres pour la récupération multi-saut et la gestion du contexte
3MarkTechPost 

Chroma lance Context-1 : un modèle de recherche à base d'agents de 20 milliards de paramètres pour la récupération multi-saut et la gestion du contexte

Chroma, l'entreprise derrière la base de données vectorielle open source du même nom, a lancé Context-1, un modèle de recherche agentique de 20 milliards de paramètres conçu pour résoudre l'un des problèmes les plus tenaces des systèmes RAG (Retrieval-Augmented Generation) modernes. Dérivé de l'architecture Mixture of Experts gpt-oss-20B et affiné par apprentissage supervisé combiné à du renforcement via CISPO, ce modèle ne joue pas le rôle d'un moteur de raisonnement généraliste : il agit comme un sous-agent de recherche ultra-spécialisé. Concrètement, face à une question complexe nécessitant plusieurs étapes de raisonnement, Context-1 décompose la requête en sous-questions ciblées, exécute des appels d'outils en parallèle — 2,56 appels en moyenne par tour — et parcourt itérativement un corpus documentaire via des outils comme searchcorpus (hybride BM25 + recherche dense), grepcorpus et readdocument, avant de transmettre les passages pertinents à un modèle frontier pour la réponse finale. L'innovation la plus significative de Context-1 est ce que Chroma appelle le "Self-Editing Context" : le modèle ne se contente pas de chercher, il gère activement sa propre fenêtre de contexte. Au fil de la recherche, les documents s'accumulent — beaucoup s'avèrent redondants ou hors sujet. Plutôt que de se noyer dans ce bruit, Context-1 a été entraîné avec une précision de pruning de 0,94 : il exécute proactivement une commande prunechunks pour éliminer les passages inutiles en cours de recherche. Ce mécanisme lui permet de maintenir une fenêtre de contexte de 32 000 tokens propre et efficace, là où les modèles généralistes "s'étranglent" sur des chaînes de raisonnement longues. Le découplage entre la logique de recherche — traditionnellement gérée par le développeur — et la génération de réponse représente un changement architectural majeur pour les équipes qui construisent des pipelines RAG en production. Pour entraîner et évaluer ce type de modèle, Chroma a également publié en open source son outil de génération de données synthétiques, context-1-data-gen. Ce pipeline produit des tâches multi-hop dans quatre domaines — recherche web, dépôts SEC (10-K, 20-F), brevets USPTO et corpus d'emails (Enron, fichiers Epstein) — selon un processus structuré en quatre étapes : Explorer, Vérifier, Distraire, Indexer. L'astuce centrale est l'injection de "distracteurs thématiques", des documents apparemment pertinents mais logiquement inutiles, qui forcent le modèle à raisonner plutôt qu'à faire du simple matching de mots-clés. Ce faisant, Chroma s'attaque à un angle mort bien connu des benchmarks statiques, et positionne Context-1 comme compétitif face à GPT-5 sur les tâches de recherche complexes — tout en étant nettement moins coûteux à faire tourner pour des volumes industriels.

OutilsOpinion
1 source
Paiements par agents autonomes : exploration technique d'AgentCore
4AWS ML Blog 

Paiements par agents autonomes : exploration technique d'AgentCore

Amazon a lancé en avant-première AgentCore Payments, un nouveau service managé intégré à Amazon Bedrock AgentCore, conçu pour permettre aux agents d'intelligence artificielle d'effectuer des paiements autonomes en temps réel. Le service prend en charge les stablecoins pour des microtransactions inférieures au centime, une API unifiée compatible avec les protocoles machine-à-machine comme x402, ainsi que des garde-fous de dépenses configurables permettant aux développeurs de fixer des budgets et des limites de transactions précises. Là où l'intégration de solutions de paiement tierces pour agents pouvait auparavant mobiliser plusieurs mois de développement, Amazon promet de réduire ce délai à quelques jours grâce à une abstraction complète de la complexité d'orchestration, de conformité réglementaire et d'observabilité. Ce lancement répond à un problème structurel qui freine l'essor des agents autonomes : lorsqu'un agent tente d'accéder à un service payant, une API ou du contenu sous abonnement, il se heurte à un mur. Les méthodes de paiement classiques comme les cartes bancaires imposent des frais fixes d'environ 0,30 dollar par transaction, ce qui les rend économiquement inviables pour des milliers d'appels valant chacun quelques fractions de centime. Sans solution native, chaque développeur devait câbler manuellement des portefeuilles tiers, gérer des comptes de facturation distincts chez chaque fournisseur et construire ses propres mécanismes de gouvernance financière. AgentCore Payments centralise tout cela en un seul appel API, rendant enfin viables les workflows d'agents qui consomment massivement des services externes à très faible coût unitaire. Ce service s'inscrit dans une tendance de fond qui redessine l'économie du web : le trafic automatisé généré par des agents dépasse désormais le trafic humain sur de nombreuses plateformes, poussant éditeurs, CDN et fournisseurs d'API à faire évoluer leurs modèles commerciaux vers du paiement à l'usage. Des protocoles comme x402 émergent pour standardiser les échanges financiers machine-à-machine, et les grands acteurs du cloud s'y positionnent en priorité. AWS, avec AgentCore, construit une infrastructure complète pour l'ère agentique, comprenant déjà la gestion de la mémoire, la sécurité et désormais les paiements. Si des milliards d'agents doivent opérer de façon autonome dans les prochaines années, la couche de paiement représente un maillon critique, et le premier à proposer un service managé mature dans ce domaine pourrait capturer une part substantielle de cette nouvelle infrastructure de l'économie numérique.

UELa réglementation MiCA sur les stablecoins en vigueur dans l'UE pourrait compliquer l'adoption d'AgentCore Payments pour les développeurs européens, qui devront vérifier la conformité des actifs numériques supportés avant tout déploiement.

💬 Le problème des microtransactions pour agents, c'est le genre de mur qui tuait les workflows avant même de démarrer. Payer 0,30 dollar par transaction quand l'appel vaut un centième de centime, c'est mathématiquement mort, et jusqu'ici chaque dev bricolait ça en solo avec trois portefeuilles tiers et aucune gouvernance. AWS centralise tout ça proprement, enfin du concret, même si les devs européens vont devoir passer par la case MiCA avant de déployer.

OutilsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic