Aller au contenu principal
AgentCore Optimization : AWS lance une boucle d'amélioration des performances des agents
OutilsAWS ML Blog · 2 min de lecture

AgentCore Optimization : AWS lance une boucle d'amélioration des performances des agents

Source originale ↗·

Amazon a annoncé le lancement en préversion d'AgentCore Optimization, une nouvelle fonctionnalité intégrée à sa plateforme Amazon Bedrock AgentCore. Cette brique complète ce qu'Amazon appelle la boucle "observer, évaluer, améliorer" pour les agents IA en production. Concrètement, le système analyse automatiquement les traces de production, génère des recommandations d'optimisation pour les prompts système ou les descriptions d'outils, puis propose deux mécanismes de validation : l'évaluation par lot sur des jeux de données prédéfinis, et les tests A/B en conditions réelles via AgentCore Gateway, avec découpage du trafic en production à un pourcentage configurable et résultats assortis d'intervalles de confiance et de signification statistique. NTT DATA, partenaire annoncé lors du lancement, indique que des processus qui nécessitaient auparavant plusieurs semaines d'ajustement manuel de prompts peuvent désormais s'exécuter en cycles rapides et reproductibles.

L'enjeu est de taille pour les équipes produit qui déploient des agents IA : la qualité d'un agent se dégrade silencieusement à mesure que les modèles évoluent, que le comportement des utilisateurs change, et que les prompts sont réutilisés dans des contextes imprévus. Jusqu'ici, la remédiation reposait entièrement sur l'intuition du développeur, lire des traces, formuler une hypothèse, réécrire le prompt, tester quelques cas, déployer, un cycle qui introduit souvent de nouveaux problèmes en corrigeant les anciens. AgentCore Optimization remplace cette boucle artisanale par un processus systématique fondé sur les données : les recommandations sont générées à partir des traces réelles et validées avant tout déploiement, éliminant la part de pari inhérente aux corrections en aveugle.

Amazon Bedrock AgentCore, déjà utilisé par des milliers de développeurs pour construire des agents capables de raisonner et d'agir dans des workflows complexes, s'enrichit ainsi d'une couche d'amélioration continue qui manquait jusqu'à présent à l'écosystème. Les grandes équipes disposent certes d'équipes scientifiques dédiées et de benchmarks centralisés, mais ces dispositifs fonctionnent sur des cycles hebdomadaires ou mensuels, pendant que les agents dérivent en production chaque jour. En intégrant la traçabilité OpenTelemetry, les évaluateurs built-in (taux de succès, précision de sélection d'outils, sécurité), et la possibilité de simuler des jeux de données via un acteur LLM jouant le rôle de l'utilisateur final, Amazon positionne AgentCore comme une plateforme complète pour industrialiser l'optimisation des agents, une capacité qui pourrait devenir un critère de choix déterminant face à des concurrents comme Google Vertex AI ou Microsoft Azure AI Foundry.

Impact France/UE

Les équipes européennes déployant des agents IA sur Amazon Bedrock peuvent désormais automatiser l'optimisation de leurs prompts et outils, réduisant des cycles d'ajustement manuel qui duraient plusieurs semaines à des itérations rapides et reproductibles.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

AgentCore Optimization en préversion : la boucle de qualité des agents
1AWS ML Blog 

AgentCore Optimization en préversion : la boucle de qualité des agents

Amazon a annoncé le 5 mai 2026 la disponibilité en preview d'AgentCore Optimization, une nouvelle fonctionnalité de sa plateforme Amazon Bedrock AgentCore dédiée à l'amélioration continue des agents d'intelligence artificielle en production. Le système introduit une boucle automatisée en trois étapes : génération de recommandations à partir des traces de production, validation par évaluation en batch ou par test A/B, puis déploiement. Concrètement, l'API Recommendations analyse les logs stockés dans CloudWatch pour identifier les failles dans le prompt système ou les descriptions d'outils, en ciblant un signal de récompense défini par l'équipe, taux de succès des objectifs, précision dans la sélection d'outils, ou critères personnalisés via un LLM-as-judge. L'évaluation en batch compare ensuite la nouvelle version sur un jeu de tests préétabli, tandis que le test A/B, routé via AgentCore Gateway, divise le trafic réel selon un pourcentage configurable et produit des résultats avec intervalles de confiance et significativité statistique. NTT DATA, via Yoshiharu Okuda, son responsable de la stratégie IA générative, confirme déjà que des cycles de tuning de prompts qui prenaient auparavant plusieurs semaines sont devenus des itérations rapides et reproductibles grâce à ce système. L'enjeu est de taille pour les équipes produit qui déploient des agents à grande échelle. Jusqu'ici, lorsqu'un agent dégradait en qualité, parce qu'un modèle sous-jacent avait évolué, que les comportements utilisateurs avaient changé, ou qu'un prompt était réutilisé hors de son contexte d'origine, la correction reposait entièrement sur l'intuition d'un développeur : lire les traces, formuler une hypothèse, réécrire le prompt, tester quelques cas, déployer, et recommencer. Ce cycle manuel était non seulement lent, mais souvent contre-productif, un correctif résolvant un problème pour un utilisateur tout en en créant un nouveau pour un autre. AgentCore Optimization remplace cette mécanique artisanale par une boucle systématique alimentée par des données réelles, ce qui permet aux équipes produit de détecter les dérives au fil du quotidien plutôt que d'attendre les benchmarks hebdomadaires ou mensuels des équipes scientifiques dédiées. Amazon Bedrock AgentCore est la plateforme sur laquelle des milliers de développeurs construisent déjà des agents capables de raisonner, planifier et agir dans des workflows complexes. La composante Observability du service capture chaque appel de modèle, invocation d'outil et étape de raisonnement sous forme de traces compatibles OpenTelemetry, fournissant ainsi la matière première nécessaire à la nouvelle boucle d'optimisation. Cette annonce s'inscrit dans une tendance de fond : les grands fournisseurs cloud cherchent à industrialiser non plus seulement la création d'agents, mais leur maintenance opérationnelle dans la durée. Avec cette fonctionnalité encore en preview, Amazon positionne Bedrock comme une plateforme de bout en bout pour le cycle de vie complet des agents, dans un marché où Google Vertex AI et Microsoft Azure AI Foundry jouent la même carte d'intégration verticale.

UELes équipes produit françaises et européennes déployant des agents sur Amazon Bedrock pourront bénéficier de cycles d'optimisation automatisés, réduisant une dépendance aux processus manuels chronophages, sans impact réglementaire ou institutionnel spécifique à l'UE.

OutilsOutil
1 source
AgentCore : optimisation de la qualité des agents, désormais en préversion
2AWS ML Blog 

AgentCore : optimisation de la qualité des agents, désormais en préversion

Amazon a annoncé ce 5 mai 2026 l'intégration de nouvelles capacités d'optimisation automatique dans AgentCore, sa plateforme de déploiement d'agents IA, désormais disponibles en préversion. Ces fonctionnalités couvrent trois mécanismes complémentaires : les Recommandations, l'évaluation par lots (batch evaluation) et les tests A/B. Le moteur de recommandations analyse les traces de production et les résultats d'évaluation pour proposer des améliorations concrètes des prompts système ou des descriptions d'outils, en ciblant un critère de performance défini par le développeur. L'évaluation par lots permet ensuite de valider ces suggestions sur un jeu de données de test prédéfini, en mesurant des scores agrégés pour détecter d'éventuelles régressions. Enfin, les tests A/B comparent deux versions d'un agent en production via AgentCore Gateway, en répartissant le trafic réel selon un pourcentage configurable et en restituant les résultats avec intervalles de confiance et significativité statistique. L'ensemble s'appuie sur un système de traçabilité OpenTelemetry géré par AgentCore Observability, qui capture chaque appel au modèle, chaque invocation d'outil et chaque étape de raisonnement. Ces nouvelles capacités répondent à un problème structurel bien connu des équipes IA en production : la dégradation silencieuse des agents au fil du temps. Lorsque les modèles évoluent, les comportements utilisateurs changent, ou les prompts sont réutilisés dans des contextes imprévus, la qualité baisse sans signal d'alerte clair. Jusqu'ici, le cycle de correction restait entièrement manuel : un utilisateur se plaint, un développeur lit des traces, formule une hypothèse, réécrit le prompt, teste quelques cas et pousse un correctif qui peut en créer un autre. AgentCore ferme cette boucle en remplaçant l'intuition du développeur par des données systématiques, avec un signal de récompense configurable : taux de succès des objectifs, précision de sélection des outils, pertinence, sécurité. Yoshiharu Okuda, directeur de la stratégie IA générative chez NTT DATA, a confirmé que des processus qui nécessitaient auparavant plusieurs semaines de réglage manuel se transforment désormais en cycles rapides et reproductibles. AgentCore est la plateforme d'Amazon Web Services pour construire, connecter et optimiser des agents IA à grande échelle, avec des milliers de développeurs déjà actifs. Cette annonce s'inscrit dans une course plus large entre les grands fournisseurs cloud pour proposer des outils d'opérationnalisation des agents, au-delà de la simple inférence. Google Vertex AI, Microsoft Azure AI et AWS se disputent les équipes qui passent de la phase expérimentale à la production à grande échelle, là où la maintenance de la qualité devient un défi d'ingénierie à part entière. En automatisant la boucle observer-évaluer-améliorer, AWS positionne AgentCore comme une infrastructure de fond pour les organisations qui ne peuvent pas se permettre des équipes dédiées à l'optimisation manuelle de prompts sur des cycles hebdomadaires, alors que leurs agents dérivent chaque jour en production.

OutilsActu
1 source
Détecter les défaillances silencieuses d'agents grâce à l'optimisation d'Amazon Bedrock AgentCore
3AWS ML Blog 

Détecter les défaillances silencieuses d'agents grâce à l'optimisation d'Amazon Bedrock AgentCore

Amazon a présenté une nouvelle fonctionnalité d'observabilité pour Amazon Bedrock AgentCore, baptisée insights, conçue pour détecter les défaillances silencieuses des agents d'intelligence artificielle déployés en production. Le problème que cible ce nouvel outil est bien connu des équipes qui opèrent des agents IA à grande échelle : les tableaux de bord affichent des indicateurs au vert, un taux de complétion de 99%, une latence normale et aucun pic d'erreur, alors même que des clients signalent des résultats incorrects. Amazon cite plusieurs exemples concrets : une modification de commande jamais réellement exécutée, un produit annoncé comme disponible alors que l'API d'inventaire avait expiré, ou encore une étape de validation silencieusement sautée. Ces défaillances comportementales n'apparaissent dans aucun signal d'erreur classique et ne remontent souvent que plusieurs semaines plus tard, via les réclamations clients. Le système analyse chaque trace de session à l'aide d'une taxonomie structurée couvrant onze catégories de défaillances, dont l'hallucination et les réponses incorrectes. Cette évolution répond à un enjeu très concret pour les entreprises qui déploient des agents IA à grande échelle : au delà de la simple détection d'erreurs, il devient essentiel de prioriser les correctifs. Quand un agent traitant des milliers de sessions quotidiennes accumule des centaines d'erreurs, l'examen individuel de chaque trace ne permet pas de savoir si l'on est face à un problème systémique touchant 30% du trafic ou à un cas isolé concernant trois sessions seulement. AgentCore insights regroupe les sessions par clusters, classés selon la proportion de sessions affectées, avec une explication agrégée pour chaque groupe de défaillances, exploitable sans avoir à rouvrir chaque trace individuellement. L'outil propose aussi une analyse de l'intention des utilisateurs, révélant les écarts entre les requêtes réellement adressées à l'agent et sa conception initiale, ainsi que des insights d'exécution montrant les stratégies effectivement employées par l'agent en conditions réelles. Cette annonce s'inscrit dans une tendance plus large du secteur : à mesure que les agents IA autonomes se multiplient en production, les outils d'observabilité traditionnels, pensés pour l'infrastructure logicielle classique, montrent leurs limites face à des défaillances de nature comportementale plutôt que technique. Amazon positionne ainsi AgentCore insights comme une couche complémentaire à la pile d'observabilité existante, exploitant les données de traces déjà collectées plutôt que d'exiger une nouvelle instrumentation. L'enjeu dépasse la seule correction de bugs : il s'agit de combler l'écart entre le comportement prévu d'un agent et son comportement réel une fois confronté à des utilisateurs et des cas d'usage imprévus, un défi appelé à prendre de l'ampleur à mesure que les entreprises industrialisent le déploiement d'agents IA autonomes dans leurs processus métier.

OutilsOutil
1 source
Analyse dans une boucle de feedback où les agents s'améliorent d'eux-mêmes
4Latent Space 

Analyse dans une boucle de feedback où les agents s'améliorent d'eux-mêmes

Roland Gavrilescu, cofondateur et PDG d'Introspection, s'est exprimé cette semaine lors de l'AI Engineer World's Fair à l'occasion de sa session intitulée « Autoresearch in the Wild ». Avant de lancer sa startup, Gavrilescu travaillait chez xAI sur l'infrastructure des agents et les agents cloud, où il a rencontré son cofondateur Julian Bright. Les deux hommes ont quitté xAI l'an dernier pour fonder Introspection, une entreprise qui construit l'infrastructure nécessaire au déploiement de systèmes dits « auto-améliorants ». Le concept central qu'ils défendent s'appelle l'autoresearch : il s'agit de construire une boucle externe dans laquelle des agents contribuent eux-mêmes à maintenir et améliorer le système principal, en s'appuyant sur des signaux de retour, des évaluations (evals) et des apports humains pour progresser dans le temps, sans dépendre en permanence d'une validation humaine à chaque étape. Cette approche marque, selon Gavrilescu, un déplacement progressif de l'attention : d'abord centrée sur les modèles, puis sur les harnais applicatifs (harnesses), elle se concentre désormais sur les boucles de rétroaction elles-mêmes, qui deviennent le produit. L'enjeu pour les entreprises est de concevoir les bons mécanismes de feedback afin que les agents absorbent davantage de tâches sans pour autant générer du contenu de mauvaise qualité, ce que l'industrie appelle familièrement le « slop ». Introspection propose un second concept, celui de recette d'agent (agent recipe), un conteneur regroupant les évaluations, les juges automatisés, le traitement des signaux et l'expertise humaine capturée au fil du temps, inspiré des recettes de données utilisées en post-entraînement des modèles. L'objectif est de créer un format portable et indépendant des fournisseurs, que les agents peuvent eux-mêmes faire évoluer, à la manière d'un laboratoire de recherche autonome. Pour Gavrilescu, la trajectoire empruntée par des entreprises comme Cursor et Cognition démontre déjà la viabilité de ces systèmes en production. La prochaine étape consiste à les rendre plus accessibles, plus rapides et moins coûteux, en distillant progressivement les capacités des modèles de pointe dans des systèmes détenus et personnalisés par chaque organisation. Cette évolution s'inscrit dans un mouvement plus large de l'ingénierie IA, où les équipes cherchent à automatiser non seulement la production de code ou de contenu, mais aussi l'amélioration continue de leurs propres outils, en s'appuyant sur des boucles qui apprennent d'abord des humains avant de gagner en autonomie. Reste à voir si ces « usines logicielles autonomes » sauront limiter les dérives de qualité tout en réduisant les coûts, un équilibre que plusieurs startups du secteur cherchent désormais à démontrer concrètement.

💬 Ce qui change avec Introspection, c'est que la boucle de feedback devient elle-même le produit, plus le modèle ni le harnais. Sur le papier, l'idée de recette d'agent portable et auto-améliorante a de l'allure, mais Cursor et Cognition restent deux exemples, pas une preuve généralisée. Reste à voir combien d'équipes tiendront ce genre de boucle en prod sans se noyer dans le slop.

OutilsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic