Aller au contenu principal
Associer Nova 2 Lite à Claude pour un traitement de documents à moindre coût
OutilsAWS ML Blog1sem· 2 min de lecture

Associer Nova 2 Lite à Claude pour un traitement de documents à moindre coût

Source originale ↗·

Amazon a publié un retour d'expérience détaillé sur une architecture combinant deux modèles d'IA pour numériser des annuaires scolaires numérisés à grande échelle. Le pipeline, développé sur Amazon Bedrock, associe Amazon Nova 2 Lite et Claude Sonnet 4.6 d'Anthropic dans deux étapes séquentielles distinctes. Testé sur 336 pages d'annuaires scannées, le système a produit 3 122 associations nom-visage, avec 93 % des correspondances atteignant un score de confiance supérieur ou égal à 0,95. La première étape confie à Nova 2 Lite l'extraction multimodale native : via un seul appel API, le modèle détecte les photos avec leurs coordonnées, extrait les noms visibles sur la page avec leurs positions approximatives, et remonte les métadonnées de la page. Claude Sonnet 4.6 intervient ensuite uniquement pour le raisonnement spatial, c'est-à-dire déterminer quel nom correspond à quel visage selon la mise en page. Ce découpage permet de limiter la sortie de Nova 2 Lite à environ 1 000 tokens par page, contre 4 500 tokens pour une passe OCR complète. Le coût total est réduit de deux tiers par rapport à un modèle unique chargé de l'intégralité de la tâche.

L'intérêt concret de cette architecture va au-delà de la numérisation d'annuaires. Elle illustre une stratégie de décomposition de tâches visuelles complexes en sous-problèmes spécialisés, permettant d'affecter à chaque étape le modèle le mieux adapté et le moins coûteux. Nova 2 Lite est configuré en mode de raisonnement LOW, le niveau minimal, sans perte mesurable de précision sur cette tâche d'extraction structurée. Claude, lui, absorbe la variabilité des mises en page sans nécessiter de prompt engineering spécifique à chaque format, grâce à ce qu'Amazon appelle son "adaptive thinking". La tarification fixe par image de Nova 2 Lite rend également le coût prévisible à grande échelle, ce qui est déterminant pour des workflows traitant des centaines de milliers de pages.

Cette publication s'inscrit dans la montée en puissance d'Amazon Bedrock comme plateforme d'orchestration multi-modèles, où différents modèles d'éditeurs tiers coexistent et peuvent être combinés. Amazon positionne Nova 2 Lite comme un modèle économique pour les tâches d'extraction à haut volume, tandis que Claude occupe le rôle de raisonneur pour les étapes à plus forte valeur ajoutée. Ce type d'architecture hybride reflète une tendance plus large dans l'industrie : plutôt que de chercher le modèle universel le plus puissant, les équipes d'ingénierie construisent des pipelines spécialisés où le coût et la précision sont optimisés étape par étape. La question des droits sur les archives numérisées, notamment pour des annuaires privés, reste un angle peu abordé mais potentiellement sensible à mesure que ces techniques se généralisent.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Automatiser la génération de schémas pour le traitement intelligent de documents
1AWS ML Blog 

Automatiser la génération de schémas pour le traitement intelligent de documents

Amazon Web Services vient d'enrichir son IDP Accelerator, solution open-source et serverless dédiée au traitement automatisé de documents, d'une nouvelle fonctionnalité baptisée "multi-document discovery". Jusqu'ici, exploiter le traitement intelligent de documents (IDP) exigeait de constituer manuellement un schéma de configuration pour chaque type de document à analyser : définir les classes, identifier des exemples représentatifs, spécifier les champs à extraire. Une contrainte rédhibitoire dès lors qu'une organisation se retrouve avec des milliers de documents non étiquetés et aucune visibilité sur les catégories qui les composent. La nouvelle fonctionnalité répond directement à ce problème : elle analyse une collection de documents inconnus, les regroupe automatiquement par type, puis génère les schémas de configuration prêts à l'emploi. Le pipeline repose sur AWS Step Functions pour l'orchestration, AWS Lambda pour le calcul serverless, Amazon S3 pour le stockage, et les modèles disponibles via Amazon Bedrock pour la génération des schémas, dont le modèle d'embeddings Cohere Embed v4 utilisé par défaut. L'intérêt opérationnel est considérable pour les équipes qui traitent des volumes documentaires hétérogènes. Là où le module Discovery existant nécessitait de connaître ses classes de documents à l'avance et de fournir un exemple par classe, la nouvelle approche supprime ce prérequis. Le système génère d'abord un embedding visuel pour chaque document, en se basant sur la première page uniquement pour les documents multi-pages, puis utilise le score de silhouette pour déterminer automatiquement le nombre de clusters pertinents. Un agent construit avec Strands Agents et un LLM Bedrock analyse ensuite chaque cluster pour identifier le type de document et produire un schéma. Une étape de "réflexion" finale compare l'ensemble des schémas générés pour détecter les chevauchements et incohérences avant validation humaine. Cette approche réduit drastiquement le travail préparatoire qui, à grande échelle, pouvait représenter des semaines de labelling manuel. Le choix des embeddings visuels plutôt que textuels, via OCR, est une décision technique délibérée : la mise en page, le formatage et la structure visuelle d'un document permettent de distinguer des types documentaires même lorsque leur contenu textuel se ressemble. Ce positionnement s'inscrit dans la stratégie plus large d'AWS de faire de Bedrock un socle central pour les workflows d'IA en entreprise, en y adossant des briques comme Strands Agents pour la partie agentique. La solution reste open-source, disponible sur GitHub, ce qui permet aux équipes de l'adapter à leurs propres collections. L'enjeu sous-jacent est de rendre accessibles les initiatives IDP à des organisations qui ne disposent pas des ressources pour classifier manuellement leur patrimoine documentaire avant même de commencer à en extraire de la valeur.

OutilsOutil
1 source
Créer un système de traitement de documents financiers avec Pulse AI et Amazon Bedrock
2AWS ML Blog 

Créer un système de traitement de documents financiers avec Pulse AI et Amazon Bedrock

Pulse AI et Amazon Bedrock s'associent pour proposer un pipeline de traitement intelligent des documents financiers complexes, ciblant les établissements bancaires, les fonds d'investissement privés et les grandes entreprises. Contrairement aux outils OCR traditionnels qui traitent les documents comme de simples images, la solution combine les modèles de langage visuels de Pulse avec des composants de machine learning classiques spécifiquement conçus pour comprendre la structure des documents financiers : bilans comptables, comptes de résultats, dépôts SEC, rapports de recherche et documents d'audit. Le résultat le plus concret : un lot d'environ 1 000 documents financiers complexes, qui nécessitait auparavant plusieurs jours de traitement, est désormais traité en moins de trois heures, produisant des sorties structurées et auditables prêtes pour l'analyse. La solution est déjà déployée chez Samsung, Cloudera, Howard Hughes, ainsi que dans plusieurs institutions financières du classement Fortune 500. L'enjeu est critique pour le secteur financier : une erreur OCR dans un bilan ou un tableau à cellules fusionnées ne reste pas isolée, elle se propage en cascade à travers les calculs interconnectés, faussant l'ensemble de l'analyse. Le pipeline Pulse-Bedrock extrait les données de façon structurée et sémantiquement consciente, puis utilise Amazon Bedrock pour affiner les modèles Nova d'Amazon sur ces données de haute qualité. L'organisation obtient ainsi un modèle de langage personnalisé, entraîné sur ses propres conventions financières, capable de traiter les nouveaux documents avec une compréhension spécifique à l'entreprise. La révision manuelle, qui prenait des jours, se réduit à quelques heures. Ce développement s'inscrit dans une course à l'automatisation documentaire dans laquelle les institutions financières investissent massivement, sous la pression de volumes croissants de rapports réglementaires et de due diligence. Amazon Bedrock se positionne ici comme infrastructure de fine-tuning clé en main, sans gestion d'infrastructure ML ni planification de capacité, ce qui réduit la barrière d'entrée pour les équipes sans expertise MLOps. Pour Pulse AI, ce partenariat valide son approche hybride vision-langage face aux acteurs OCR historiques comme ABBYY ou aux offres cloud génériques de Google Document AI et Azure Form Recognizer. La prochaine étape logique est l'extension à d'autres verticales documentaires lourdes, comme le juridique ou le médical, où les mêmes problèmes de structure complexe et de dépendances contextuelles se posent.

OutilsOutil
1 source
Zhipu AI lance ZCode pour concurrencer Claude Code et OpenAI Codex à moindre coût
3The Decoder 

Zhipu AI lance ZCode pour concurrencer Claude Code et OpenAI Codex à moindre coût

Zhipu AI a lancé ZCode, un environnement de développement intégrant son modèle GLM-5.2, avec pour ambition de concurrencer Claude Code d'Anthropic et Codex d'OpenAI sur le terrain de l'assistance au code par intelligence artificielle. L'entreprise chinoise met en avant la capacité de GLM-5.2 à traiter de très longs contextes, un atout revendiqué pour gérer des tâches de programmation complexes sur des bases de code volumineuses. Pour attirer les nouveaux utilisateurs, Zhipu AI propose un essai gratuit de cinq jours donnant accès à un quota pouvant atteindre 5 millions de tokens par jour. Les abonnés existants bénéficient quant à eux d'environ 1,5 fois plus de quota de tokens, une offre valable jusqu'en juillet 2026. Cette stratégie tarifaire agressive vise directement les développeurs et les entreprises qui utilisent quotidiennement des assistants de code, un segment où les coûts liés à la consommation de tokens peuvent rapidement devenir importants. En proposant des volumes généreux à moindre coût, Zhipu AI cherche à convaincre les équipes techniques de basculer vers son offre plutôt que de payer les tarifs pratiqués par les acteurs américains dominants du secteur. Ce lancement s'inscrit dans une tendance plus large de montée en puissance des laboratoires d'intelligence artificielle chinois, qui misent sur des prix cassés et des capacités techniques compétitives pour gagner des parts de marché face à Anthropic et OpenAI. Les outils d'aide à la programmation sont devenus un champ de bataille stratégique majeur, où la course aux contextes toujours plus longs et aux tarifs toujours plus bas devrait continuer de s'intensifier dans les mois à venir.

OutilsOutil
1 source
Anthropic lance Claude Science, un espace de travail IA conçu spécifiquement pour les chercheurs
4The Decoder 

Anthropic lance Claude Science, un espace de travail IA conçu spécifiquement pour les chercheurs

Anthropic a lancé Claude Science, un espace de travail conçu spécifiquement pour les chercheurs scientifiques. L'outil embarque plus de 60 compétences préconfigurées couvrant des domaines comme la génomique et la chimie computationnelle, permettant aux scientifiques d'automatiser des tâches complexes propres à leur discipline. Un agent de vérification intégré contrôle automatiquement les citations et les calculs produits, une fonction pensée pour limiter les erreurs dans un contexte où la rigueur est essentielle. L'application peut fonctionner en local ou sur des clusters de calcul haute performance (HPC), ce qui signifie que les données sensibles n'ont jamais besoin de quitter l'infrastructure propre d'un laboratoire. Cette approche répond directement aux préoccupations des institutions de recherche concernant la confidentialité des données, un frein majeur à l'adoption de l'IA dans les laboratoires manipulant des informations sensibles, qu'il s'agisse de séquences génomiques ou de données précliniques. En automatisant la vérification des citations et des calculs, Claude Science s'attaque aussi à un problème récurrent des outils d'IA généralistes en contexte scientifique: le risque d'erreurs factuelles ou de résultats non fiables qui peuvent compromettre des travaux de recherche entiers. Pour les laboratoires publics et privés, cela pourrait accélérer des processus de recherche jusqu'ici ralentis par des contraintes de conformité et de sécurité des données. Ce lancement s'inscrit dans une compétition plus large entre les géants de l'IA pour s'implanter dans le secteur scientifique, un marché où les besoins spécifiques en matière de précision, de traçabilité et de confidentialité diffèrent nettement des usages grand public. Anthropic mise sur la spécialisation par domaine, plutôt que sur un assistant généraliste, pour convaincre des institutions de recherche exigeantes. Reste à voir comment les laboratoires universitaires et industriels, souvent contraints par des budgets et des infrastructures HPC limités, adopteront concrètement cet outil, et si d'autres acteurs du secteur suivront cette voie de la spécialisation verticale.

UELes laboratoires de recherche français et européens pourraient tirer parti de l'exécution locale ou sur clusters HPC, un argument qui répond aux exigences de confidentialité des données scientifiques en vigueur en Europe.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic