Aller au contenu principal
Amazon Bedrock Data Automation : améliorer la précision de l'extraction de plans
OutilsAWS ML Blog · 2 min de lecture

Amazon Bedrock Data Automation : améliorer la précision de l'extraction de plans

Source originale ↗·

Amazon Web Services a enrichi son service Amazon Bedrock Data Automation (BDA) d'une fonctionnalité appelée "blueprint instruction optimization", conçue pour améliorer automatiquement la précision d'extraction de données structurées à partir de documents non structurés, factures, contrats, formulaires fiscaux ou dossiers d'inscription. Le principe repose sur des blueprints, des schémas personnalisables qui définissent les champs à extraire (numéro de commande, montant total, date, demandes spéciales) accompagnés d'instructions en langage naturel guidant le modèle. Jusqu'ici, lorsqu'un champ était mal extrait, les équipes devaient affiner manuellement ces instructions en boucle. Désormais, il suffit de fournir entre trois et dix documents d'exemple avec les valeurs attendues : BDA analyse les écarts entre ses résultats et la vérité terrain, puis reformule automatiquement les instructions de chaque champ en quelques minutes. Aucun fine-tuning de modèle séparé n'est nécessaire.

L'impact est direct pour les équipes en charge de l'automatisation documentaire dans les entreprises. Traiter des documents provenant de centaines de fournisseurs différents posait un problème structurel : les libellés varient ("subtotal" vs "total"), les mises en page changent selon les périodes ou les partenaires, et la qualité des scans dégrade encore la reconnaissance. Ce cycle d'itération manuelle pouvait prendre plusieurs semaines par type de document. Avec cette optimisation automatisée, ce délai tombe à quelques minutes, ce qui réduit considérablement le coût de mise en production de pipelines de traitement intelligent de documents (IDP). Les organisations qui gèrent de grands volumes documentaires, assureurs, cabinets comptables, services achats, sont les premières bénéficiaires.

Cette annonce s'inscrit dans la stratégie d'AWS visant à rendre l'automatisation documentaire accessible sans expertise en machine learning. Amazon Bedrock Data Automation, lancé pour unifier classification, extraction, normalisation et validation via une seule API, fait face à une concurrence croissante d'acteurs spécialisés comme Google Document AI ou Microsoft Azure Form Recognizer, ainsi que de solutions fondées sur des modèles de vision généralistes. En supprimant la nécessité de fine-tuner un modèle tout en automatisant le travail d'ingénierie des prompts, AWS réduit la barrière d'entrée pour les équipes métier. La prochaine étape logique serait d'étendre cette optimisation à des flux documentaires plus complexes impliquant plusieurs types de documents interconnectés, un enjeu central pour des secteurs comme la finance ou la santé.

Impact France/UE

Les entreprises françaises et européennes gérant de grands volumes documentaires (assureurs, cabinets comptables, services achats) peuvent réduire leurs délais de mise en production de pipelines d'extraction documentaire de plusieurs semaines à quelques minutes, sans expertise en machine learning.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Se retire de l'extraction d'informations web automatisée par Amazon Bedrock AgentCore
1AWS ML Blog 

Se retire de l'extraction d'informations web automatisée par Amazon Bedrock AgentCore

Amazon a présenté une solution technique permettant d'automatiser l'extraction d'informations à partir de sites web, construite autour d'Amazon Bedrock AgentCore, une plateforme dédiée à la création et à l'exploitation d'agents IA à grande échelle. Le système combine plusieurs services cloud : AgentCore Browser, un navigateur entièrement géré capable de restituer les pages riches en JavaScript, Amazon Bedrock pour l'analyse par IA, Amazon OpenSearch Serverless pour la recherche sémantique, et AWS Lambda pour l'orchestration. Concrètement, une règle Amazon EventBridge déclenche toutes les 15 minutes une fonction Lambda qui vérifie les flux RSS configurés et élimine les doublons via Amazon S3. Pour chaque nouvel article détecté, une session de navigateur s'ouvre via AgentCore et se connecte grâce à Playwright par le protocole Chrome DevTools (CDP) : contrairement à une simple requête HTTP, ce navigateur distant charge la page entière, attend le rendu des éléments dynamiques, capture une image d'écran et télécharge les visuels, avant que ces éléments ne soient stockés dans S3 dans un format structuré. Chaque dépôt sur S3 déclenche ensuite un message via Amazon SQS pour lancer le traitement par IA. Le code complet est disponible sur GitHub. L'enjeu pour les entreprises est de taille : suivre manuellement des dizaines de sites concurrents, de blogs sectoriels ou de publications réglementaires est chronophage et repose sur des scrapers classiques, fragiles par nature, puisqu'ils dépendent étroitement de la structure des pages. Une simple refonte d'un site ou une migration vers un frontend en JavaScript peut casser silencieusement un pipeline pendant plusieurs jours sans que l'équipe s'en aperçoive. En rendant le rendu des pages plus fiable, AgentCore Browser réduit ce risque et permet à des équipes design, marketing ou produit de suivre en continu les nouveautés d'un concurrent, les changements de tarification ou les signaux faibles d'un marché, sans intervention manuelle quotidienne. Cette architecture événementielle, qui sépare la collecte de contenu du traitement par IA, illustre une tendance plus large : l'automatisation de la veille par des agents capables de naviguer le web comme un humain plutôt que par des scripts rigides. Les cas d'usage identifiés par Amazon couvrent l'intelligence concurrentielle, la veille marché, la curation de contenu et la surveillance réglementaire. La recherche sémantique via des embeddings vectoriels dans OpenSearch Serverless permet ensuite d'interroger l'ensemble des informations collectées en langage naturel plutôt que par mots-clés exacts, ouvrant la voie à des tableaux de bord de veille alimentés en continu et consultables via une interface web.

UELes entreprises françaises et européennes pourraient adopter cette architecture AWS pour automatiser leur veille concurrentielle et réglementaire, sans qu'aucune loi ou institution européenne ne soit directement concernée.

💬 Se retirer d'un service AWS "prêt à l'emploi" pour l'extraction web, c'est un signal fort : même Amazon préfère composer ses propres briques (Browser, Lambda, OpenSearch) plutôt que de maintenir un produit fini. Ça confirme un truc que je répète depuis des mois, la veille automatisée par navigateur headless plutôt que par scraper fragile devient l'architecture par défaut, pas une option de luxe. Reste que c'est un stack AWS complet à opérer soi-même, pas un bouton à cliquer, donc parfait pour une équipe data qui sait déjà manier Lambda et SQS, beaucoup moins pour une PME qui voulait juste suivre trois concurrents sans embaucher un ingénieur cloud.

OutilsOutil
1 source
Baz améliore la précision de la revue de code par agents IA grâce à Amazon Bedrock AgentCore
2AWS ML Blog 

Baz améliore la précision de la revue de code par agents IA grâce à Amazon Bedrock AgentCore

Baz, une startup spécialisée dans l'automatisation des revues de code, a développé un agent IA capable de vérifier non seulement la qualité technique du code, mais aussi sa conformité aux spécifications produit et aux maquettes de design. Baptisé Spec Review Agent, ce système repose sur Amazon Bedrock et Amazon Bedrock AgentCore, les services d'IA managés d'AWS. Concrètement, l'agent s'active automatiquement à l'ouverture d'une pull request GitHub, interroge simultanément Figma pour récupérer les spécifications visuelles et Jira pour les exigences fonctionnelles, puis décompose l'ensemble en critères vérifiables. Il spawne ensuite des sous-agents parallèles, un par exigence, qui analysent le code source et interagissent avec l'environnement de prévisualisation via l'outil AgentCore Browser Tool, capable d'inspecter le DOM, de simuler des interactions utilisateur et de comparer visuellement l'interface rendue avec les maquettes Figma. L'enjeu est considérable pour les équipes de développement modernes. Jusqu'ici, la vérification qu'une fonctionnalité correspondait réellement à ce que le product owner avait demandé ou que le designer avait conçu reposait entièrement sur des tests manuels effectués par des équipes QA. Ces vérifications prenaient des heures, introduisaient des incohérences d'une release à l'autre et s'appuyaient sur une connaissance interne non documentée et donc fragile. En automatisant cette couche de validation, Baz cherche à supprimer le délai systématique entre la livraison du code et la détection des écarts, réduisant ainsi les régressions et accélérant les cycles de mise en production. Pour les équipes engineering qui travaillent à haute vélocité, c'est potentiellement une transformation profonde du workflow de review, qui passe d'une vérification de syntaxe à une validation de comportement réel. Ce projet s'inscrit dans une tendance plus large d'industrialisation des agents IA dans le cycle de développement logiciel, après l'émergence des assistants de génération de code comme GitHub Copilot. Amazon Bedrock AgentCore, lancé récemment par AWS, propose des primitives spécifiquement conçues pour l'orchestration d'agents multi-étapes en production, incluant la navigation web autonome, la gestion de la mémoire et l'exécution de code dans des environnements isolés. Baz exploite ces capacités pour bâtir une infrastructure d'orchestration déployée sur Amazon EKS, avec un Application Load Balancer en entrée. La prochaine étape logique pour ce type de système sera d'étendre la couverture au-delà des critères d'acceptation Jira et des maquettes Figma, vers des dimensions comme la performance ou l'accessibilité, transformant progressivement la revue de code en audit produit complet piloté par l'IA.

OutilsOutil
1 source
Automatiser le tri et la priorisation de vos boîtes mail avec Amazon Bedrock
3AWS ML Blog 

Automatiser le tri et la priorisation de vos boîtes mail avec Amazon Bedrock

Amazon Web Services a publié un guide technique détaillant une solution d'intelligence artificielle destinée aux organismes du secteur public, en particulier aux collectivités locales britanniques, pour trier et prioriser automatiquement leurs courriels entrants grâce à Amazon Bedrock. Le système fonctionne ainsi : les messages électroniques sont déposés dans un espace de stockage Amazon S3, via Amazon Simple Email Service, une intégration tierce ou le SDK AWS. Chaque nouvel objet S3 déclenche une notification transmise à Amazon EventBridge, qui l'achemine vers une file d'attente Amazon SQS de type FIFO. Cette file est reliée, via EventBridge Pipes, à une machine à états AWS Step Functions, laquelle récupère le contenu du courriel puis interroge un modèle Amazon Bedrock, en l'occurrence Amazon Nova Pro, par le biais de l'API InvokeModel. Un prompt spécifique demande au modèle de classer chaque message selon le service municipal concerné (transports, aides sociales, taxe d'habitation, action sociale, gestion des déchets, environnement, informatique, protection de l'enfance, logement) et d'en évaluer le degré d'urgence, dans un format structuré. En cas d'échec de traitement, les messages sont redirigés vers une file d'attente de lettres mortes pour investigation. Cette automatisation répond à trois difficultés concrètes identifiées par AWS dans la gestion actuelle des courriels des collectivités. D'abord une crise des délais de réponse, avec des centaines de messages reçus chaque jour où les demandes urgentes se retrouvent noyées dans le flux général. Ensuite, un usage inefficace du temps des agents, qui consacrent des heures au tri manuel, un même message pouvant être examiné à plusieurs reprises par différents services avant d'aboutir au bon interlocuteur. Enfin, une évaluation de la gravité des demandes qui manque de cohérence d'un agent à l'autre. En automatisant ce triage, la solution vise à garantir que les dossiers urgents reçoivent une attention immédiate, tout en libérant le personnel administratif pour des tâches à plus forte valeur ajoutée dans le service aux citoyens. Cette initiative s'inscrit dans une tendance plus large d'adoption de l'IA générative par les administrations publiques, confrontées à des contraintes budgétaires et des effectifs limités alors que les attentes des usagers en matière de rapidité de traitement ne cessent de croître. AWS présente cette architecture comme une base de départ, conçue pour être adaptée et enrichie par les organismes qui l'adoptent plutôt que comme un produit fini. Le déploiement s'appuie exclusivement sur des services managés d'AWS, ce qui limite la charge d'exploitation pour des collectivités locales disposant rarement d'équipes informatiques dédiées à l'intelligence artificielle, tout en respectant les bonnes pratiques de sécurité recommandées pour le stockage de données sensibles sur Amazon S3, notamment le chiffrement et le principe du moindre privilège.

OutilsOutil
1 source
Amazon Lex améliore la précision des bots grâce au NLU assisté
4AWS ML Blog 

Amazon Lex améliore la précision des bots grâce au NLU assisté

Amazon a enrichi son service de création de chatbots Amazon Lex avec une fonctionnalité baptisée Assisted NLU (Natural Language Understanding), qui intègre des grands modèles de langage pour améliorer significativement la compréhension des requêtes utilisateurs. Concrètement, le système atteint en moyenne 92 % de précision dans la classification des intentions et 84 % dans la résolution des paramètres de conversation (les "slots"). Parmi les centaines de clients déjà déployés sur cette fonctionnalité, les retours terrain font état d'une amélioration de 11 à 15 % de la classification des intentions, d'une réduction de 23,5 % des réponses de type "je n'ai pas compris", et d'une meilleure gestion de 30 % des entrées ambiguës ou mal formulées. La fonctionnalité est disponible en deux modes : un mode primaire où le LLM traite chaque entrée utilisateur, et un mode de secours où il n'intervient que lorsque le système traditionnel est en faible confiance. Elle est incluse sans surcoût dans la tarification standard d'Amazon Lex. L'enjeu est de taille pour toutes les entreprises qui déploient des assistants conversationnels en production. Les systèmes classiques basés sur des règles imposaient aux développeurs de configurer manuellement des dizaines de variantes pour chaque formulation possible, sans jamais couvrir l'exhaustivité du langage naturel. Un bot de réservation hôtelière entraîné sur "réserver une chambre" échouait dès qu'un client disait "j'aimerais prendre une suite pour mon séjour à Seattle du 15 au 18 décembre", perdant au passage le type de chambre, la ville et les dates. Avec Assisted NLU, ces requêtes complexes ou ambiguës sont gérées sans configuration supplémentaire, ce qui réduit directement le taux d'abandon des conversations et allège la charge de maintenance pour les équipes techniques. Amazon Lex existe depuis 2017, initialement comme le moteur NLU d'Alexa adapté aux développeurs tiers. La montée en puissance des LLMs a créé une pression sur tous les fournisseurs de plateformes conversationnelles pour intégrer ces modèles dans leurs pipelines. L'approche hybride retenue ici, combiner le ML traditionnel avec un LLM en mode fallback ou primaire, reflète une tendance de fond dans l'industrie : ne pas remplacer les anciens systèmes d'un coup, mais les augmenter progressivement pour amortir la transition. Plusieurs clients pilotes auraient déjà annoncé un déploiement plus large après leurs tests initiaux. La prochaine étape pour les équipes produit sera probablement d'affiner la façon dont les descriptions d'intentions et de slots alimentent le LLM, car c'est là que se joue désormais l'essentiel de la qualité de compréhension.

UELes entreprises européennes déployant des chatbots en production peuvent bénéficier de cette amélioration de précision sans surcoût, réduisant directement les coûts de maintenance de leurs systèmes conversationnels.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic