OutilsAWS ML Blog6sem

Ring optimise son support client mondial avec Amazon Bedrock Knowledge Bases

Résumé IASource uniqueImpact UE

Ring, la filiale de sécurité domestique d'Amazon, a déployé en production un chatbot de support client multilingue fondé sur la technologie RAG (Retrieval-Augmented Generation), en s'appuyant sur Amazon Bedrock Knowledge Bases. Le système couvre aujourd'hui 10 régions internationales — dont le Royaume-Uni, l'Allemagne et huit autres marchés — depuis une infrastructure centralisée unique. Résultat concret : chaque nouvelle locale ajoutée au dispositif coûte désormais 21 % moins cher qu'avec l'architecture précédente, qui exigeait des déploiements d'infrastructure distincts par région. La solution mobilise Amazon Bedrock, AWS Lambda, AWS Step Functions et Amazon S3, dans une logique entièrement serverless. Le projet a été développé en collaboration avec David Kim et Premjit Singh, ingénieurs chez Ring.

Ce déploiement répond à des limites très concrètes de l'ancien système. Ring utilisait jusqu'ici un chatbot basé sur des règles prédéfinies, construit avec Amazon Lex : pendant les pics d'activité, 16 % des interactions client devaient être escaladées vers des agents humains, faute de réponses adaptées. Les ingénieurs consacraient par ailleurs 10 % de leur temps à la maintenance de ce système rigide. L'expansion internationale a rendu cette approche intenable : chaque territoire nécessite des informations produits spécifiques — spécifications électriques, conformité réglementaire locale, configurations matérielles distinctes — qui ne se réduisent pas à une simple traduction. Le nouveau système permet de servir ce contenu différencié depuis un référentiel unique, en appliquant un filtrage par métadonnées (balises de locale) pour délivrer les bonnes informations au bon marché, sans infrastructure dédiée par région.

L'architecture repose sur une séparation en deux flux : l'ingestion et l'évaluation d'un côté, la promotion en production de l'autre. Cette organisation en deux phases permet à l'équipe éditoriale de Ring de publier des mises à jour de guides produits, articles de dépannage et documentation de support, qui se propagent automatiquement à toutes les locales sans intervention manuelle. La latence de bout en bout visée est de 7 à 8 secondes ; l'analyse de performance a montré que la latence liée à la distance géographique représente moins de 10 % du temps de réponse total, ce qui a justifié le choix d'une architecture centralisée plutôt que distribuée. Pour Ring, c'est un pivot stratégique : au lieu d'industrialiser la maintenance d'infrastructure, les équipes peuvent concentrer leurs efforts sur l'amélioration de l'expérience client. Le modèle est transposable à tout opérateur cherchant à étendre ses opérations de support à l'international sans faire exploser ses coûts opérationnels.

Impact France/UE

Le déploiement couvre déjà le Royaume-Uni et l'Allemagne, améliorant le support client pour les utilisateurs européens des produits Ring.

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1AWS ML Blog

Amazon Bedrock Knowledge Bases : créer et déployer une solution de synchronisation automatique

Amazon Web Services a publié la description d'une solution serverless permettant de synchroniser automatiquement les bases de connaissances Amazon Bedrock avec les documents stockés dans Amazon S3, sans aucune intervention manuelle. Conçue selon une architecture événementielle, elle repose sur cinq services AWS articulés ensemble : EventBridge capte les modifications dans les buckets S3 en temps réel, des fonctions Lambda traitent ces événements, des files SQS absorbent les pics de requêtes, Step Functions orchestre le flux de synchronisation, et DynamoDB assure le suivi des changements et des métadonnées de jobs. Le tout se déploie via AWS SAM (Serverless Application Model), sans infrastructure à provisionner ni à maintenir. Deloitte figure parmi les entreprises ayant adopté ce type d'approche pour moderniser leur infrastructure de tests et de traitement documentaire. L'enjeu est considérable pour les organisations qui utilisent Bedrock Knowledge Bases dans des environnements multi-utilisateurs ou des applications critiques comme les systèmes de support client. Amazon Bedrock impose des quotas stricts : au maximum cinq jobs d'ingestion simultanés par compte AWS, un seul job par base de connaissances et un seul par source de données. L'API StartIngestionJob est en outre limitée à 0,1 requête par seconde, soit une requête toutes les dix secondes et par région. Sans orchestration, lorsqu'une équipe contenu met à jour plusieurs fichiers lors d'une release, les requêtes s'accumulent, percutent ces plafonds et finissent par nécessiter une supervision manuelle. La solution absorbe ces rafales en mettant les demandes en file d'attente via SQS et en les émettant au rythme autorisé par l'API, de façon totalement transparente. Amazon Bedrock Knowledge Bases est le service RAG (Retrieval-Augmented Generation) d'AWS qui permet aux modèles de fondation et aux agents IA d'accéder aux données privées d'une organisation afin de produire des réponses plus précises et contextualisées. Jusqu'ici, toute modification dans S3, ajout, suppression ou mise à jour de métadonnées, exigeait une synchronisation déclenchée manuellement, processus sujet aux oublis et aux retards. Ce manque de synchronisation en temps réel constitue l'un des principaux points de friction dans le déploiement d'agents IA en production. La solution proposée élimine ce point de friction pour les équipes travaillant en continu sur des bases documentaires volumineuses, et représente une avancée concrète vers des systèmes d'IA d'entreprise capables de rester à jour sans supervision humaine permanente.

OutilsOutil

1 source

2AWS ML Blog

Optimiser la recherche sémantique vidéo avec la distillation de modèles Amazon Nova sur Amazon Bedrock

Amazon Web Services a publié un tutoriel détaillé expliquant comment utiliser la technique de distillation de modèles sur Amazon Bedrock pour optimiser les systèmes de recherche sémantique vidéo. Le cœur du problème : les modèles de grande taille comme Claude Haiku d'Anthropic offrent une excellente précision pour interpréter l'intention de recherche des utilisateurs, mais ils allongent le temps de réponse à 2 à 4 secondes, représentant à eux seuls 75 % de la latence totale. La solution proposée consiste à transférer l'intelligence de routage d'un grand modèle dit "enseignant", Amazon Nova Premier, vers un modèle beaucoup plus léger dit "étudiant", Amazon Nova Micro. Le résultat : une réduction des coûts d'inférence de plus de 95 % et une baisse de la latence de 50 %, sans sacrifier la qualité de routage. L'enjeu est considérable pour les entreprises qui gèrent de larges catalogues vidéo. Lorsqu'un utilisateur tape "Olivia qui parle de son enfance dans la pauvreté", le système doit décider automatiquement quels aspects de la vidéo interroger en priorité : les métadonnées textuelles, la transcription audio, les données visuelles ou les informations structurées. Cette logique de routage devient rapidement complexe à l'échelle enterprise, où les attributs peuvent inclure les angles de caméra, le sentiment, les droits de diffusion ou des taxonomies métier propriétaires. Un modèle plus petit et distillé qui maîtrise cette tâche précise permet de traiter davantage de requêtes simultanément, à un coût marginal quasi nul, ce qui change fondamentalement l'équation économique des moteurs de recherche multimodaux. La distillation de modèles se distingue du fine-tuning supervisé classique par un avantage pratique majeur : elle ne nécessite pas de dataset entièrement étiqueté par des humains. Amazon Bedrock génère automatiquement jusqu'à 15 000 paires prompt-réponse en interrogeant le modèle enseignant, en appliquant des techniques de synthèse et d'augmentation de données. Dans ce pipeline, 10 000 exemples synthétiques ont été produits via Nova Premier, chargés sur Amazon S3, puis utilisés pour entraîner Nova Micro. Le modèle résultant est ensuite évalué via Amazon Bedrock Model Evaluation, comparé à la base Nova Micro et au Claude Haiku original. AWS a publié l'intégralité du notebook Jupyter, le script de génération des données et les utilitaires d'évaluation sur GitHub, rendant cette approche reproductible pour toute équipe souhaitant industrialiser la recherche vidéo à grande échelle.

OutilsTuto

1 source

3AWS ML Blog

Amazon Bedrock AgentCore Runtime introduit des capacités MCP client avec état

Amazon a introduit des capacités client MCP (Model Context Protocol) avec état dans son service AgentCore Runtime sur Amazon Bedrock, marquant une évolution majeure pour les développeurs d'agents IA. Jusqu'à présent, les serveurs MCP hébergés sur cette plateforme fonctionnaient en mode sans état : chaque requête HTTP était traitée de façon indépendante, sans mémoire entre les appels. Le nouveau mode avec état, activé via un simple paramètre stateless_http=False, provision une microVM dédiée par session utilisateur, persistant jusqu'à 8 heures ou 15 minutes d'inactivité. Cette architecture permet désormais trois capacités clés du protocole MCP : l'élicitation (demander une saisie utilisateur en cours d'exécution), le sampling (solliciter du contenu généré par un LLM côté client), et les notifications de progression (streamer des mises à jour en temps réel). La continuité de session est assurée via un en-tête Mcp-Session-Id, échangé lors de l'initialisation et inclus dans toutes les requêtes suivantes. Ces nouvelles capacités transforment fondamentalement la nature des workflows agents. Là où les implémentations sans état forçaient les agents à s'exécuter de bout en bout sans interruption, les agents peuvent désormais mener de véritables conversations bidirectionnelles avec leurs clients : s'arrêter pour demander une clarification à l'utilisateur au milieu d'un appel d'outil, déléguer dynamiquement la génération de contenu au LLM présent côté client, ou signaler l'avancement d'opérations longues en temps réel. Pour les équipes qui construisent des assistants IA complexes, des pipelines de traitement de documents ou des agents d'automatisation nécessitant validation humaine intermédiaire, c'est un changement de paradigme concret qui élimine des contournements architecturaux souvent coûteux à maintenir. Le Model Context Protocol, standard ouvert définissant comment les applications LLM se connectent à des outils et sources de données externes, gagne rapidement en adoption depuis son lancement par Anthropic fin 2024. Amazon avait déjà intégré l'hébergement de serveurs MCP sans état dans AgentCore Runtime dans une version précédente ; cette mise à jour complète l'implémentation bidirectionnelle du protocole. L'isolation entre sessions via des microVMs dédiées garantit la sécurité et l'indépendance des contextes, chaque session bénéficiant de CPU, mémoire et système de fichiers séparés. Si une session expire ou que le serveur redémarre, les clients reçoivent une erreur 404 et doivent réinitialiser la connexion. Cette approche positionne AWS comme un acteur central dans l'infrastructure d'agents IA d'entreprise, en rivalité directe avec les offres similaires de Microsoft Azure et Google Cloud dans la course à standardiser les architectures agentiques.

UELes équipes européennes développant des agents IA sur des plateformes cloud peuvent désormais implémenter des workflows agentiques bidirectionnels natifs sans contournements architecturaux coûteux.

OutilsActu

1 source

4AWS ML Blog

Commandes omnicanales avec Amazon Bedrock AgentCore et Amazon Nova 2 Sonic

Amazon a présenté une architecture complète pour construire des systèmes de commande vocale omnicanaux en s'appuyant sur deux de ses services cloud : Amazon Bedrock AgentCore, une plateforme dédiée au déploiement d'agents IA en production, et Amazon Nova 2 Sonic, un modèle de fondation speech-to-speech disponible via Amazon Bedrock. La solution permet à une application de traiter des commandes vocales en temps réel sur plusieurs points de contact simultanément, application mobile, site web et interface vocale, tout en maintenant le contexte conversationnel entre les échanges. L'infrastructure s'appuie sur AWS CDK pour le déploiement, le protocole MCP (Model Context Protocol) pour connecter l'agent IA aux services métier, et une série de services managés : Amazon Cognito pour l'authentification OAuth 2.0, API Gateway pour exposer les endpoints REST, AWS Lambda pour la logique métier, DynamoDB pour le stockage des profils et commandes, et AWS Location Services pour les recommandations géolocalisées de points de retrait. L'intérêt principal de cette architecture réside dans sa capacité à isoler chaque composant pour les faire évoluer indépendamment. AgentCore Runtime exécute chaque session utilisateur dans une microVM isolée, ce qui garantit qu'un pic de charge sur une session n'affecte pas les autres, un problème classique des systèmes vocaux en production. Le MCP standardise la communication entre l'agent et les services backend, ce qui permet de modifier ou d'étendre la logique métier sans réécrire le code d'intégration. Pour les équipes qui construisent des expériences de commande vocale à grande échelle, restauration rapide, retail, logistique, cette séparation claire entre la couche IA, le frontend et le backend réduit significativement la complexité opérationnelle et les risques de régression lors des mises à jour. La publication de cette solution s'inscrit dans une compétition intense autour des agents IA en production. Google, Microsoft et des acteurs comme Anthropic proposent leurs propres infrastructures agentiques, mais AWS mise sur l'intégration native avec son écosystème de services cloud existants comme différenciateur clé. Nova 2 Sonic, le modèle speech-to-speech au coeur du système, représente l'entrée d'Amazon dans les interfaces vocales conversationnelles en temps réel, un segment où OpenAI s'est imposé avec GPT-4o Voice. En publiant ce tutoriel complet avec une architecture de restaurant fictive comme backend d'exemple, Amazon cherche à accélérer l'adoption par les développeurs et à établir AgentCore comme standard de fait pour le déploiement d'agents IA sur AWS. Les prochaines étapes logiques incluront probablement l'extension à d'autres modalités et l'intégration avec des systèmes de caisse et d'inventaire existants.

OutilsOutil

1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour