Se retire de l'extraction d'informations web automatisée par Amazon Bedrock AgentCore
Amazon a présenté une solution technique permettant d'automatiser l'extraction d'informations à partir de sites web, construite autour d'Amazon Bedrock AgentCore, une plateforme dédiée à la création et à l'exploitation d'agents IA à grande échelle. Le système combine plusieurs services cloud : AgentCore Browser, un navigateur entièrement géré capable de restituer les pages riches en JavaScript, Amazon Bedrock pour l'analyse par IA, Amazon OpenSearch Serverless pour la recherche sémantique, et AWS Lambda pour l'orchestration. Concrètement, une règle Amazon EventBridge déclenche toutes les 15 minutes une fonction Lambda qui vérifie les flux RSS configurés et élimine les doublons via Amazon S3. Pour chaque nouvel article détecté, une session de navigateur s'ouvre via AgentCore et se connecte grâce à Playwright par le protocole Chrome DevTools (CDP) : contrairement à une simple requête HTTP, ce navigateur distant charge la page entière, attend le rendu des éléments dynamiques, capture une image d'écran et télécharge les visuels, avant que ces éléments ne soient stockés dans S3 dans un format structuré. Chaque dépôt sur S3 déclenche ensuite un message via Amazon SQS pour lancer le traitement par IA. Le code complet est disponible sur GitHub.
L'enjeu pour les entreprises est de taille : suivre manuellement des dizaines de sites concurrents, de blogs sectoriels ou de publications réglementaires est chronophage et repose sur des scrapers classiques, fragiles par nature, puisqu'ils dépendent étroitement de la structure des pages. Une simple refonte d'un site ou une migration vers un frontend en JavaScript peut casser silencieusement un pipeline pendant plusieurs jours sans que l'équipe s'en aperçoive. En rendant le rendu des pages plus fiable, AgentCore Browser réduit ce risque et permet à des équipes design, marketing ou produit de suivre en continu les nouveautés d'un concurrent, les changements de tarification ou les signaux faibles d'un marché, sans intervention manuelle quotidienne.
Cette architecture événementielle, qui sépare la collecte de contenu du traitement par IA, illustre une tendance plus large : l'automatisation de la veille par des agents capables de naviguer le web comme un humain plutôt que par des scripts rigides. Les cas d'usage identifiés par Amazon couvrent l'intelligence concurrentielle, la veille marché, la curation de contenu et la surveillance réglementaire. La recherche sémantique via des embeddings vectoriels dans OpenSearch Serverless permet ensuite d'interroger l'ensemble des informations collectées en langage naturel plutôt que par mots-clés exacts, ouvrant la voie à des tableaux de bord de veille alimentés en continu et consultables via une interface web.
Les entreprises françaises et européennes pourraient adopter cette architecture AWS pour automatiser leur veille concurrentielle et réglementaire, sans qu'aucune loi ou institution européenne ne soit directement concernée.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




