Configurez des limites de débit pour le trafic IA sur la passerelle AgentCore
Amazon a annoncé le support de la limitation de débit sur AgentCore gateway, la passerelle IA entièrement gérée et sans serveur d'Amazon Bedrock. Cette passerelle sert de point d'entrée unique et sécurisé pour le trafic IA, qu'il s'agisse de recherche web gérée, de bases de connaissances, de serveurs MCP, de modèles d'inférence ou d'agents. La nouvelle fonctionnalité permet de définir des règles basées sur OAuth ou IAM pour contrôler, par utilisateur, les requêtes par minute, les connexions simultanées et le débit de tokens. Trois types de cibles sont pris en charge : les cibles MCP, les cibles d'inférence et les cibles HTTP passthrough. Trois métriques sont disponibles. Les requêtes par seconde ou par minute s'appliquent à tous les types de cibles, chaque requête comptant pour une unité quelle que soit sa durée d'exécution. Les tokens par minute, réservés aux cibles d'inférence, comptabilisent à la fois les tokens d'entrée et de sortie : la passerelle estime d'abord la consommation via un tokenizer générique avant l'appel, puis ajuste le compte une fois la réponse réelle du modèle reçue. Les connexions par seconde, applicables à tous les types de cibles, mesurent la durée d'occupation d'une connexion plutôt que le nombre de requêtes, une session de streaming de 100 secondes bloquant un emplacement pendant toute sa durée.
Cette fonctionnalité permet aux entreprises qui déploient des agents IA à grande échelle de protéger leurs services en aval contre les pics de trafic, tout en différenciant l'accès selon les profils d'utilisateurs. Amazon illustre le cas d'usage avec trois groupes, Basic, Advanced et Beta, gérés via AgentCore Identity, qui authentifie les utilisateurs par jetons JWT avec Microsoft Entra ID comme fournisseur d'identité et sert aussi de service de distribution de jetons pour les cibles sortantes. Le contrôle d'accès basé sur les rôles, appliqué via les politiques d'Amazon Bedrock AgentCore, restreint l'accès de chaque groupe à des cibles et modèles spécifiques. Les utilisateurs Basic reçoivent des limites plus strictes que les utilisateurs Advanced, tandis que les utilisateurs Beta bénéficient de seuils élevés sur des modèles restreints, ce qui permet à une organisation de tester leurs performances avant un déploiement plus large. Concrètement, cela offre une meilleure maîtrise des coûts d'inférence, une disponibilité garantie des services critiques en cas de forte demande, et la possibilité de piloter des déploiements progressifs de nouveaux modèles sans saturer l'infrastructure.
Cette annonce s'inscrit dans la montée en puissance des architectures d'agents IA en entreprise, où la gestion fine du trafic devient critique à mesure que les organisations multiplient les intégrations vers des LLM, des bases de connaissances et des outils tiers via le protocole MCP. La configuration d'une limite de débit repose sur deux éléments : les clés de dimension, qui définissent comment le trafic entrant est réparti en compartiments, et les entrées, qui fixent le débit autorisé pour chaque compartiment. Amazon détaille la mise en place de ces règles via l'interface en ligne de commande AWS. En combinant identité, politique d'accès et limitation de débit dans une seule passerelle managée, AWS cherche à simplifier la gouvernance des déploiements d'agents IA à grande échelle, un terrain sur lequel Google Cloud et Microsoft Azure investissent également face à la demande croissante des entreprises pour des infrastructures d'IA générative mieux contrôlées et sécurisées.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




