Aller au contenu principal
Mistral lance OCR 4, un outil d'extraction documentaire taillé pour l'IA en entreprise
OutilsVentureBeat AI · 2 min de lecture

Mistral lance OCR 4, un outil d'extraction documentaire taillé pour l'IA en entreprise

Source originale ↗·

Mistral AI a lancé mardi OCR 4, sa quatrième génération de technologie de reconnaissance optique de caractères en à peine quinze mois. Ce modèle de traitement documentaire dépasse la simple extraction de texte brut : il retourne une représentation structurée complète de chaque document, avec des boîtes de délimitation précises pour chaque bloc, une classification par type de contenu (titre, tableau, équation, signature) et des scores de confiance mot par mot. Le modèle supporte 170 langues, accepte les formats PDF, DOC, PPT et OpenDocument, et peut être déployé en conteneur autonome sur l'infrastructure interne d'une organisation. Il est disponible immédiatement via l'API Mistral, Document AI dans Mistral Studio, Amazon SageMaker et Microsoft Foundry, avec une intégration Snowflake annoncée prochainement. La tarification débute à 4 dollars pour 1 000 pages, ramenée à 2 dollars via l'API batch. Lors d'évaluations humaines indépendantes, les annotateurs ont préféré les sorties d'OCR 4 dans 72 % des cas face aux solutions concurrentes.

Le changement central d'OCR 4 est architectural. Plutôt que de produire un flux plat de texte extrait, le modèle génère une carte sémantique du document : chaque bloc est localisé, typé et scoré. Cette traçabilité répond à une friction majeure des équipes qui construisent des pipelines RAG (retrieval-augmented generation) ou des workflows de conformité, où la question "d'où vient ce chiffre, sur quelle page ?" exige une réponse auditable. La classification des blocs permet en outre d'orienter automatiquement un tableau vers un pipeline de données structurées, un titre vers un découpage sémantique, ou une signature vers un workflow de caviardage. Packager ces sorties directement dans le modèle OCR supprime une couche d'analyse de mise en page que les équipes devaient jusqu'ici construire et maintenir séparément. Les scores de confiance permettent quant à eux de router programmatiquement les extractions incertaines vers des relecteurs humains, sans qu'une personne n'ait à vérifier chaque page de chaque document.

Ce lancement intervient dans un contexte particulièrement porteur pour Mistral. La startup française, dont la proposition de souveraineté numérique européenne n'a jamais été aussi commercialement pertinente, cible explicitement les entreprises des secteurs réglementés, finance, santé, juridique, qui ne peuvent pas faire transiter leurs documents sensibles par des API cloud sous juridiction américaine. La capacité de déploiement on-premise en conteneur unique est le principal levier de différenciation face à des acteurs comme Google Document AI ou AWS Textract. Pour les développeurs, l'enjeu est aussi économique : dans les systèmes de production, l'OCR n'est que la première étape d'un pipeline plus large, et la reconstruction manuelle de la structure documentaire consomme souvent plus de temps d'ingénierie que la logique IA en aval. OCR 4 vise à éliminer cette étape, et si le modèle tient ses promesses, les gains se mesurent autant en heures d'ingénierie économisées qu'en coût d'extraction.

Impact France/UE

Mistral AI, startup française, propose un déploiement on-premise en conteneur qui offre aux entreprises européennes des secteurs réglementés (finance, santé, juridique) une alternative souveraine aux solutions cloud sous juridiction américaine.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1InfoQ AI 

AWS lance un registre d'agents en aperçu pour gérer la prolifération des agents IA en entreprise

Amazon Web Services a lancé Agent Registry en version préliminaire, une nouvelle fonctionnalité intégrée à Amazon Bedrock AgentCore, destinée à répondre à un problème croissant dans les grandes entreprises : la prolifération incontrôlée d'agents IA déployés en silo. Concrètement, cette solution propose un catalogue centralisé permettant de découvrir, gouverner et réutiliser des agents IA, des outils et des serveurs MCP au sein d'une même organisation, quel que soit l'endroit où ces agents s'exécutent. Le registre prend en charge nativement les protocoles MCP (Model Context Protocol) et A2A (Agent-to-Agent). Pour les équipes techniques des grandes entreprises, l'enjeu est considérable : sans inventaire central, les organisations se retrouvent avec des dizaines d'agents redondants, difficiles à auditer, à maintenir ou à faire évoluer. Agent Registry entend résoudre ce problème de gouvernance en offrant une visibilité unifiée sur l'ensemble du parc d'agents, facilitant ainsi la réutilisation des composants existants et réduisant les coûts de développement. Cette initiative s'inscrit dans une course entre les grands fournisseurs cloud pour imposer leur standard de gestion d'agents IA. Microsoft et Google Cloud proposent leurs propres solutions concurrentes, tandis que l'ACP Registry constitue une alternative indépendante. Le choix d'intégrer nativement les protocoles MCP et A2A signale la volonté d'AWS de s'aligner sur les standards émergents de l'industrie, dans un contexte où l'interopérabilité entre agents de différentes plateformes devient un critère décisif pour les entreprises qui multiplient les déploiements.

UELes grandes entreprises européennes utilisant AWS peuvent désormais centraliser la gouvernance de leurs agents IA via ce registre, facilitant l'audit et la conformité dans un contexte de multiplication des déploiements.

OutilsActu
1 source
Mistral veut bousculer la gestion des documents avec son modèle OCR 4
2Next INpact 

Mistral veut bousculer la gestion des documents avec son modèle OCR 4

Mistral a lancé le 23 juin la quatrième version de son modèle OCR, baptisé Mistral OCR 4, marquant un virage significatif dans la façon dont l'entreprise française positionne cet outil. Là où les versions précédentes se contentaient de convertir du texte imprimé en texte numérique, OCR 4 se présente comme un parseur documentaire sémantique complet. Le modèle prend en charge tous les formats courants, PDF, DOC, PPT, ODF, et restitue une représentation structurée en couches de chaque document : chaque bloc de contenu est localisé dans une bounding box, classé par type (titre, tableau, équation, signature, etc.) et accompagné d'un score de confiance par page et par mot. Selon Mistral, des annotateurs indépendants ont préféré OCR 4 dans 72 % des cas face aux principaux systèmes OCR et IA documentaires testés, et le modèle atteint 85,20 % sur le benchmark OlmOCRBench, ce qui lui vaut la première place. Il prend en charge 170 langues réparties en 10 groupes linguistiques. Ce changement de nature change concrètement la donne pour les équipes qui construisent des pipelines RAG, des systèmes de recherche sémantique ou des flux de travail agentiques sur des documents. Jusqu'ici, sans localisation spatiale ni typage sémantique, il était impossible de retracer un extrait vers sa source exacte dans un document, répondre à « d'où vient ce chiffre ? » nécessitait un travail d'ingénierie supplémentaire. OCR 4 résout ce problème en proposant nativement cette traçabilité : un texte étiqueté comme titre peut segmenter un document pour la recherche hiérarchique, une signature reconnue peut alimenter directement un flux de conformité, et les zones à faible confiance peuvent être automatiquement routées vers des vérificateurs humains. Mistral affirme ainsi supprimer toute une étape de reconstruction qui pesait jusqu'ici à la fois sur les coûts d'infrastructure OCR et sur les heures d'ingénierie nécessaires pour assembler le reste. La sortie d'OCR 4 s'inscrit dans une stratégie plus large de Mistral pour s'imposer sur le marché de l'intelligence documentaire d'entreprise, un segment en forte croissance porté par l'essor des agents IA et de l'automatisation des processus métiers. La startup parisienne, qui concurrence à la fois des acteurs spécialisés comme Adobe ou ABBYY et des plateformes cloud généralistes comme AWS Textract ou Google Document AI, cherche à proposer une solution unifiée là où les entreprises devaient auparavant assembler plusieurs briques techniques. En intégrant localisation spatiale, typage sémantique et score de confiance dans un seul modèle accessible via API, Mistral parie que la friction d'intégration restait le principal frein à l'adoption, et que la lever suffira à convaincre les équipes data et les éditeurs de logiciels de migrer vers son offre.

UEMistral, startup parisienne, renforce sa position sur le marché européen de l'intelligence documentaire d'entreprise en proposant une alternative souveraine aux plateformes américaines (AWS Textract, Google Document AI).

OutilsOutil
1 source
Mistral Forge : l’offensive de Mistral AI pour rendre l’IA d’entreprise réellement souveraine
3ZDNET FR 

Mistral Forge : l’offensive de Mistral AI pour rendre l’IA d’entreprise réellement souveraine

Mistral AI franchit une nouvelle étape dans sa conquête du marché entreprise avec le lancement de Forge, une plateforme dédiée à la personnalisation et à l'entraînement de modèles sur mesure. L'objectif est clair : permettre aux organisations de s'affranchir des modèles généralistes pour disposer d'une IA façonnée selon leurs propres référentiels, qu'il s'agisse de normes internes, de bases de code propriétaires ou de politiques métier spécifiques. L'enjeu dépasse la simple question technique. Pour de nombreuses entreprises européennes, notamment dans les secteurs réglementés, banque, santé, défense, la souveraineté des données et la maîtrise des modèles constituent des prérequis non négociables à toute adoption de l'IA générative. En proposant une solution d'entraînement hébergeable en infrastructure privée, Mistral AI répond directement à ce blocage, positionnant Forge comme une alternative crédible aux offres de OpenAI, Google ou Microsoft Azure AI. La plateforme s'appuie sur l'écosystème de modèles ouverts de Mistral, notamment Mistral Small et Mistral Large, que les entreprises peuvent désormais affiner finement sur leurs propres corpus. Cette approche de fine-tuning souverain permet d'obtenir des modèles spécialisés plus performants sur des tâches métier précises, tout en conservant un contrôle total sur les données d'entraînement, un argument de poids face aux préoccupations croissantes autour du RGPD et de la réglementation européenne sur l'IA. Dans un contexte où l'AI Act européen entre progressivement en vigueur et où la question de la dépendance technologique aux acteurs américains s'intensifie, Forge s'inscrit comme un signal fort de la stratégie de Mistral AI : consolider sa position de champion européen de l'IA en offrant aux entreprises du continent les outils pour construire une IA véritablement à leur image.

UEMistral AI, startup française, offre aux entreprises européennes une solution d'entraînement de modèles sur leurs propres données, réduisant concrètement la dépendance aux fournisseurs étrangers et facilitant la conformité au cadre réglementaire européen.

OutilsOutil
1 source
Zhipu AI présente GLM-OCR : un modèle multimodal OCR de 0,9 milliard pour le traitement de documents et l'extraction d'informations clés (KIE)
4MarkTechPost 

Zhipu AI présente GLM-OCR : un modèle multimodal OCR de 0,9 milliard pour le traitement de documents et l'extraction d'informations clés (KIE)

Zhipu AI et l'université Tsinghua présentent GLM-OCR, un modèle multimodal compact de 0,9 milliard de paramètres conçu pour la reconnaissance de documents complexes et l'extraction d'informations structurées. Face aux limites des systèmes OCR traditionnels, efficaces sur du texte simple mais en difficulté dès qu'apparaissent tableaux, formules mathématiques, blocs de code ou sceaux, ce modèle propose une alternative légère aux grands modèles de vision-langage, trop coûteux pour un déploiement en production ou en environnement edge. L'enjeu dépasse la simple reconnaissance de caractères : dans l'industrie, les documents réels mêlent mises en page complexes, données structurées et champs à extraire automatiquement. Les grands modèles multimodaux actuels améliorent la compréhension documentaire, mais leur taille et leur mode de décodage autorégressif classique les rendent prohibitifs à grande échelle. GLM-OCR s'impose donc comme une réponse d'ingénierie pragmatique, pensée dès le départ pour des contraintes de déploiement réelles plutôt qu'adaptée à l'OCR en second plan. Architecturalement, le modèle combine un encodeur visuel CogViT de 0,4 milliard de paramètres, un connecteur cross-modal léger et un décodeur de langage GLM de 0,5 milliard de paramètres. Sa principale innovation technique est l'adoption de la prédiction multi-tokens (MTP) : au lieu de prédire un token à la fois, le modèle est entraîné à en prédire 10 par étape, et génère en pratique 5,2 tokens par étape à l'inférence, soit un gain de débit d'environ 50%. Le pipeline repose sur deux étages distincts : une analyse de mise en page via PP-DocLayout-V3, puis une reconnaissance parallèle des régions détectées. Pour le parsing, les sorties sont en Markdown ou JSON ; pour l'extraction d'informations clés (KIE), l'image complète est soumise au modèle avec un prompt de tâche, produisant directement un JSON structuré. L'entraînement suit quatre étapes successives, allant du préentraînement vision-langage jusqu'à un affinage par apprentissage par renforcement via GRPO. Les récompenses sont adaptées à chaque sous-tâche : distance d'édition normalisée pour la reconnaissance de texte, score CDM pour les formules, score TEDS pour les tableaux, et F1 au niveau des champs pour la KIE. Cette approche modulaire et spécialisée distingue GLM-OCR des modèles généralistes et le positionne comme un outil de production sérieux pour les entreprises traitant de grands volumes de documents.

OutilsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic