Évaluer n'importe quel framework d'agents avec Amazon Bedrock AgentCore Evaluations
Amazon a présenté Amazon Bedrock AgentCore Evaluations, un nouveau service d'évaluation conçu pour fonctionner avec n'importe quel framework d'agent IA, quel que soit le kit de développement logiciel utilisé. Le service s'appuie sur OpenTelemetry, un standard d'instrumentation neutre vis-à-vis des fournisseurs, pour lire les traces générées par les agents en production. Concrètement, il cible les frameworks les plus répandus du marché : LangGraph pour l'orchestration de workflows, LlamaIndex pour les pipelines de récupération d'information, le OpenAI Agents SDK pour les organisations standardisées sur les modèles GPT, Google ADK pour la coordination multi-agents, le Claude Agent SDK d'Anthropic, ainsi que Strands Agents, présenté comme permettant de déployer un agent fonctionnel sur Amazon Bedrock AgentCore runtime en quelques minutes. Sur cette infrastructure d'exécution, la collecte des données passe par AWS Distro for OpenTelemetry (ADOT), qui achemine les traces vers Amazon CloudWatch. Le service d'évaluation se concentre sur trois types de segments de trace: le segment d'invocation de l'agent, qui capture la requête de l'utilisateur et la réponse finale, les segments d'inférence, qui enregistrent chaque appel au modèle de langage, et les segments d'exécution d'outils, qui détaillent les paramètres et résultats de chaque outil sollicité par l'agent.
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Cette annonce répond à un problème concret rencontré par les équipes qui développent des agents en production: la plupart des outils d'évaluation existants sont conçus pour fonctionner avec un SDK précis, un client de modèle spécifique ou un schéma de traçage particulier, et cessent de fonctionner dès qu'une équipe change d'architecture. Or les organisations combinent de plus en plus plusieurs frameworks selon leurs besoins, ce qui les obligeait jusqu'ici à maintenir des pipelines d'évaluation distincts et coûteux à répliquer pour chaque projet. En découplant l'évaluation du choix technique du framework, Amazon Bedrock AgentCore Evaluations permet aux équipes de conserver un seul système de mesure de la qualité de leurs agents, même lorsque différents projets internes reposent sur des architectures totalement différentes. Cela réduit la charge d'ingénierie liée à la mise en conformité de chaque nouvel agent et facilite les comparaisons de performance entre équipes ou entre projets.
Cette évolution s'inscrit dans la stratégie plus large d'Amazon Web Services visant à positionner Bedrock AgentCore comme la couche d'infrastructure de référence pour l'hébergement, la mise à l'échelle, la gestion de la mémoire et l'observabilité des agents IA, quel que soit leur mode de construction. Le service s'appuie aussi sur les conventions GenAI d'OpenTelemetry et sur OpenInference, deux référentiels qui normalisent la façon dont les opérations d'un agent, comme les appels d'outils, la récupération documentaire ou les vérifications de garde-fous, sont nommées et décrites. Cette approche ouverte laisse entrevoir une extension progressive de la compatibilité à d'autres frameworks émergents, à mesure que ceux-ci adoptent eux aussi l'instrumentation OpenTelemetry.
Pas d'impact direct sur la France/UE