Évaluer des agents équipés de compétences avec Strands Evals et Amazon Bedrock AgentCore
Les équipes AWS ont publié début 2026 une méthode pour évaluer les agents d'intelligence artificielle équipés de "skills", des modules de compétences réutilisables au format SKILL.md. Ces skills encapsulent des instructions spécifiques à un domaine, comme la rédaction d'un contrat, le rapprochement d'une facture ou le respect des conventions internes de revue de code, plutôt que de tout intégrer dans un unique prompt système difficile à maintenir. Le dispositif s'appuie sur deux outils : le SDK Strands Evals et Amazon Bedrock AgentCore Evaluations, une fonctionnalité d'Amazon Bedrock AgentCore. Trois évaluateurs ont été introduits. Skill Selection Accuracy vérifie, avec un résultat binaire, si le skill invoqué par l'agent était le bon choix pour la tâche demandée. Skill Instruction Following mesure, sur une échelle à cinq niveaux justifiée par des preuves, dans quelle mesure l'agent a suivi les étapes prescrites par le skill choisi. Un troisième contrôle, Skill Invoked, disponible uniquement dans Strands Evals, vérifie de façon déterministe qu'un skill nommé a bien été chargé. Ces évaluations s'appliquent aussi bien à des trajectoires enregistrées dans Strands Evals qu'à des traces au format OpenTelemetry collectées via la couche d'observabilité, le tout pilotable depuis la ligne de commande AgentCore.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Cette avancée répond à un angle mort des méthodes d'évaluation classiques des agents, qui se concentrent sur la qualité de la réponse finale sans vérifier ce qui s'est passé en amont. Or les skills introduisent deux modes de défaillance invisibles à l'œil nu : un agent peut invoquer un skill inadapté à la tâche, ou invoquer le bon skill mais n'en suivre qu'une partie des instructions, voire les ignorer complètement. Dans les deux cas, l'agent peut produire une réponse fluide et convaincante en apparence, sans avoir réellement mobilisé les connaissances métier censées encadrer sa décision. Pour des usages sensibles comme la conformité réglementaire, le traitement de documents juridiques ou les politiques d'escalade, cette différence est critique : une réponse plausible mais non conforme aux procédures internes peut avoir des conséquences réelles pour une entreprise. En rendant ces défaillances mesurables et en isolant les résultats skill par skill, les équipes techniques peuvent identifier précisément si le problème vient d'un mauvais routage vers le skill ou d'une exécution incomplète de ses instructions, et donc choisir le bon correctif plutôt que de retoucher l'agent à l'aveugle.
Cette initiative s'inscrit dans la montée en puissance des architectures d'agents modulaires, où la composabilité des compétences remplace progressivement les longs prompts monolithiques ou la logique métier codée en dur dans l'application. Les skills suivent un standard ouvert, ce qui les rend portables d'un environnement d'exécution à un autre, un enjeu important alors que les entreprises cherchent à mutualiser des procédures validées entre plusieurs agents et flux de travail sans dépendre d'un unique fournisseur. Cette approche permet aussi de mettre à jour les connaissances spécialisées d'un agent sans réentraîner ou affiner le modèle sous-jacent, ce qui réduit les coûts de maintenance. À mesure que les agents d'IA se généralisent dans des fonctions à fort enjeu réglementaire ou opérationnel, la capacité à auditer non seulement le résultat produit mais aussi le raisonnement et le respect des procédures internes devrait devenir un critère de confiance central, tant pour les équipes techniques que pour les responsables de la conformité.
Pas d'impact direct sur la France/UE