Aller au contenu principal
Outils · Outil ·

Évaluation automatisée d'agents avec Amazon Bedrock AgentCore et GitHub Actions

Amazon a publié un guide technique détaillant comment construire un pipeline d'intégration et de livraison continues (CI/CD) capable d'évaluer automatiquement des agents d'intelligence artificielle déployés sur Amazon Bedrock AgentCore, en s'appuyant sur GitHub Actions. Le dispositif décrit repose sur un agent développé avec le framework Strands, connecté à un serveur MCP (Model Context Protocol) dont l'accès aux outils est restreint selon le rôle de l'utilisateur, via un pool Amazon Cognito partagé gérant à la fois l'authentification machine à machine et l'authentification utilisateur. L'infrastructure est définie avec CDK (Cloud Development Kit), et chaque déploiement déclenche une évaluation automatique grâce à l'API AgentCore Evaluate, qui utilise un grand modèle de langage comme juge pour noter les réponses de l'agent sur des critères comme la pertinence, l'exactitude et le bon choix des outils appelés, en s'appuyant sur des traces OpenTelemetry stockées dans Amazon CloudWatch. Le pipeline utilise la fédération OpenID Connect pour permettre à GitHub Actions d'obtenir des identifiants AWS temporaires sans stocker de secrets, et bloque toute fusion de code si le score d'évaluation descend sous un seuil fixé, par exemple 0,8 sur 1.

2 min de lecturePertinence 53

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

L'enjeu concret est de transformer la qualité d'un agent conversationnel en une métrique mesurable et automatisée, plutôt qu'en une appréciation subjective découverte après coup par les utilisateurs. Concrètement, dès qu'un développeur modifie un prompt système, change de modèle ou reconfigure un outil, le pipeline redéploie l'agent dans un environnement de test, l'interroge avec des scénarios représentatifs, note les réponses et empêche la mise en production si les performances régressent. Cette approche répond à un problème spécifique aux agents protégés par OAuth avec contrôle d'accès par rôle: un pipeline CI, exécuté sans contexte utilisateur, doit pouvoir s'authentifier auprès d'un agent qui, lui, transmet normalement des jetons liés à des rôles utilisateurs vers son serveur d'outils MCP. La solution proposée combine un flux d'authentification machine à machine (client_credentials) avec une architecture d'autorisation à trois couches.

Cette publication s'inscrit dans la montée en puissance d'AgentCore, la plateforme de Bedrock dédiée à l'hébergement, la mise à l'échelle et l'isolation des sessions d'agents IA, positionnée par Amazon comme l'équivalent d'AWS Lambda pour les agents. Elle reflète aussi l'adoption croissante du protocole MCP comme standard d'interconnexion entre agents et outils externes, et la nécessité, à mesure que ces agents accèdent à des données sensibles selon des rôles utilisateurs, de disposer de garde-fous qualité intégrés au cycle de développement logiciel classique. Amazon met à disposition une implémentation de référence complète dans un dépôt public, permettant aux équipes d'adapter directement ce modèle de portail qualité à leurs propres agents en production.

Impact France / UEChamp produit par Le Fil IA

Les équipes françaises et européennes utilisant AWS Bedrock peuvent reprendre directement ce pipeline CI/CD pour fiabiliser leurs agents IA en production.

À lire ensuite

01Évaluer n'importe quel framework d'agents avec Amazon Bedrock AgentCore Evaluations36AWS ML BlogOutils 02Se retire de l'extraction d'informations web automatisée par Amazon Bedrock AgentCore38AWS ML BlogOutils 03Amazon Bedrock AgentCore Evaluations : construire des agents IA fiables47AWS ML BlogOutils 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.