Aller au contenu principal
Le Marker 2 de Datalab face à MinerU, Docling et LiteParse : 76,0 sur olmOCR-bench avec un débit 5 fois supérieur à MinerU
OutilsMarkTechPost · 2 min de lecture

Le Marker 2 de Datalab face à MinerU, Docling et LiteParse : 76,0 sur olmOCR-bench avec un débit 5 fois supérieur à MinerU

Source originale ↗·

Datalab a publié Marker 2, une réécriture complète de son pipeline open source de conversion de documents, le 21 juillet 2026. Marker convertit les fichiers PDF, images, PPTX, DOCX, XLSX, HTML et EPUB en markdown, JSON, HTML ou en chunks. Cette nouvelle version s'appuie sur trois composants développés ces derniers mois par l'équipe de Datalab : Surya OCR 2, un modèle de détection de mise en page rapide de 20 millions de paramètres, et une version reconstruite de pdftext trois fois plus rapide que la précédente. Sur le benchmark olmOCR-bench d'Allen AI, référence tierce composée de 1403 PDF et d'environ 8400 tests, le mode équilibré de Marker 2 obtient un score global de 76,0% et 83,5% sur les documents PDF nativement numériques, tout en traitant 2,9 pages par seconde sur un seul GPU B200. À titre de comparaison, MinerU plafonne à 72,7% avec seulement 0,54 page par seconde, et Docling atteint 50,3% à 2,1 pages par seconde sur le même test.

Cette avancée change concrètement la donne pour les équipes qui doivent extraire et structurer de grands volumes de documents, un besoin central dans l'entraînement de modèles de langage, l'indexation documentaire ou l'automatisation de flux d'entreprise. Un gain de vitesse supérieur à 5 fois par rapport à MinerU, à qualité égale voire supérieure sur les documents natifs, réduit directement les coûts d'infrastructure et les délais de traitement à grande échelle. Marker 2 propose désormais trois modes selon les besoins : le mode équilibré qui mobilise le modèle Surya pour les documents complexes, un mode rapide combinant un détecteur léger et un usage minimal du modèle de vision pour un coût réduit, et un mode sans OCR fonctionnant uniquement sur CPU, à 43,6% de score mais 23,7 pages par seconde. La sélection automatique du mode selon le matériel disponible facilite l'adoption par des équipes aux ressources GPU limitées.

Cette évolution s'inscrit dans une course plus large entre plusieurs outils open source de conversion documentaire, tous confrontés au même défi : concilier fidélité d'extraction et rapidité de traitement à l'échelle industrielle. L'architecture de Marker 2 repose sur un changement structurel clé, plusieurs processus légers tournant sur CPU partagent un seul serveur d'inférence Surya, ce qui permet au débit de suivre la capacité du serveur plutôt que d'être limité par la mémoire GPU de chaque processus. Datalab revendique une amélioration notable par rapport au traitement en flux unique. La mise à jour s'accompagne toutefois de changements majeurs à anticiper avant toute migration : Python 3.10 minimum désormais requis, passage de Poetry à uv pour le packaging, et suppression du convertisseur d'extraction structurée, les utilisateurs étant désormais orientés vers l'API hébergée ou un usage combiné avec un LLM.

💬 L'analyse de Mathieu

Sur le papier, c'est le genre de bond qu'on n'a pas vu souvent : 5 fois plus rapide que MinerU sans sacrifier la qualité sur les PDF natifs, c'est rare. Ce qui change vraiment la donne, c'est le mode CPU sans GPU, ça ouvre l'extraction documentaire à masse aux équipes qui n'ont pas de cluster à disposition. Reste que la casse côté migration (Python 3.10, uv, convertisseur structuré supprimé) va faire râler pas mal de monde qui tournait déjà en prod avec l'ancienne version.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Le benchmark de Datalab Marker v2 face à MinerU, Docling et Liteparse
1MarkTechPost 

Le benchmark de Datalab Marker v2 face à MinerU, Docling et Liteparse

Datalab a publié Marker 2, une réécriture complète de son pipeline open source de conversion de documents. L'outil transforme des fichiers PDF, image, PPTX, DOCX, XLSX, HTML et EPUB en Markdown, JSON, HTML ou en chunks structurés. Cette nouvelle version s'appuie sur trois composants développés ces derniers mois par l'équipe Datalab: Surya OCR 2, un modèle léger de détection de mise en page de 20 millions de paramètres, et une version reconstruite de pdftext, trois fois plus rapide que la précédente. Le résultat principal provient du benchmark olmOCR-bench, développé par Allen AI (Ai2): le mode "balanced" de Marker 2 obtient un score global de 76,0% et de 83,5% sur les PDF nativement numériques, avec un débit soutenu de 2,9 pages par seconde sur un seul GPU B200. À titre de comparaison, MinerU, avec son moteur "pipeline", plafonne à 72,7% pour 0,54 page par seconde, tandis que Docling atteint 50,3% à 2,1 pages par seconde sur le même test. Marker 2 propose désormais trois modes de conversion distincts. Le mode balanced confie la mise en page au VLM Surya et relance l'OCR sur la page entière dès que le texte intégré est de mauvaise qualité: c'est le mode le plus précis, calibré pour tourner sur GPU. Le mode fast utilise un détecteur de mise en page léger (rf-detr/onnx) combiné à pdftext, avec un recours minimal et ciblé au VLM, pour 66,6% de score mais un coût bien plus faible. Le mode --disableocr se contente d'extraire le texte natif sans aucun appel au VLM et tourne entièrement sur CPU, avec 43,6% de score mais un débit de 23,7 pages par seconde. Le choix du mode est désormais automatique selon le matériel disponible. Sur le plan architectural, de nombreux processus CPU légers partagent désormais un seul serveur d'inférence Surya, ce qui permet au débit de suivre la capacité du serveur plutôt que la mémoire vidéo de chaque processus: Datalab indique que le mode balanced atteint ainsi environ 2,9 pages par seconde en charge concurrente, contre 0,3 page par seconde en traitement isolé sur le même matériel. Cette architecture rend Marker 2 pertinent aussi bien pour les équipes disposant de GPU que pour celles limitées au CPU. Le benchmark olmOCR-bench repose sur 1403 PDF et environ 8400 tests de réussite ou d'échec, répartis sur huit catégories couvrant le rendu des formules mathématiques, la structure des tableaux, l'ordre de lecture, les en-têtes et pieds de page, ou encore les anciens documents scannés. Toutes les mesures proviennent des propres tests de Datalab, reproductibles via le dépôt Marker qui inclut aussi des scripts pour MinerU, Docling et LiteParse. Face à MinerU, son concurrent le plus proche architecturalement, Marker 2 balanced devance de peu sur les PDF nativement numériques (83,5% contre 83,3%) mais creuse un écart net en débit, 5,4 fois supérieur pour un score plus élevé. Cette mise à jour s'accompagne de changements techniques à anticiper avant migration: Python 3.10 minimum, passage de Poetry à uv avec hatchling comme backend de build, et suppression du convertisseur d'extraction structurée, remplacé par l'API hébergée ou l'option --usellm.

💬 Marker 2 pulvérise MinerU sur le débit (5,4x plus rapide pour un score équivalent), et ça c'est le vrai signal : la course à l'OCR se joue plus sur les points de benchmark que sur le coût réel de traitement à grande échelle. Sur le papier, l'archi partagée (un seul serveur Surya pour plein de process CPU) c'est malin, ça évite de gâcher de la VRAM. Reste à voir si ça tient aussi bien en prod sur des PDF scannés pourris, parce que les benchmarks aiment bien les cas propres.

OutilsOutil
1 source
« Datalab Lift face à la concurrence : comment un extracteur à 9 milliards de paramètres, guidé par schéma, se compare à NuExtract3, LlamaExtract, Marker et Docling »
2MarkTechPost 

« Datalab Lift face à la concurrence : comment un extracteur à 9 milliards de paramètres, guidé par schéma, se compare à NuExtract3, LlamaExtract, Marker et Docling »

Datalab a lancé Lift, un outil d'extraction de documents qui promet une approche différente des solutions existantes. Le principe : on lui fournit un PDF ou une image accompagné d'un schéma JSON, et le modèle retourne directement les données structurées correspondantes, sans passer par une conversion intermédiaire en Markdown. Lift s'appuie sur un modèle de vision de 9 milliards de paramètres, capable de lire les images des pages rendues et de produire l'objet JSON final en une seule passe grâce à un décodage contraint par le schéma. Selon les benchmarks internes de Datalab, Lift atteint une précision de champs de 90,2%, contre 81,5% pour son principal concurrent open-weight, NuExtract3, développé par NuMind. Ce dernier, un modèle de 4 milliards de paramètres sous licence Apache-2.0, combine extraction structurée et conversion image-vers-Markdown, et cible des documents comme les factures, reçus, formulaires et contrats. Cette approche change la manière dont les entreprises peuvent construire leurs pipelines de traitement documentaire. Jusqu'à présent, la pratique dominante consistait à convertir un PDF en Markdown ou en texte structuré via des outils comme Docling, MinerU, Marker ou Unstructured, puis à envoyer cette représentation à un grand modèle de langage avec un schéma pour en extraire les champs utiles. Lift propose de fusionner ces deux étapes en une seule, ce qui réduit la complexité du pipeline lorsque l'objectif final est réellement l'extraction de champs précis, comme un numéro de facture, un nom de fournisseur ou une liste de lignes de commande, plutôt que la reconstruction fidèle du document dans son ensemble. Pour les équipes d'ingénierie qui traitent de gros volumes de documents visuellement complexes, cela peut se traduire par moins de composants à maintenir et une latence réduite, au prix d'une dépendance plus forte à un seul modèle propriétaire. Le marché de l'extraction documentaire par IA s'est considérablement densifié ces derniers mois, avec plusieurs catégories d'outils qui se chevauchent sans être toujours en concurrence directe. D'un côté, les parseurs comme Docling, MinerU, Marker, Unstructured, PyMuPDF ou Surya, qui produisent des représentations fidèles du document plutôt que des données applicatives. De l'autre, les extracteurs schéma-first comme Lift, NuExtract3, LlamaExtract, Reducto Extract ou Extend, ainsi que les géants du cloud comme Azure, Google et AWS avec leurs propres systèmes de compréhension documentaire. Des bibliothèques de génération structurée comme XGrammar, Outlines, Instructor ou BAML complètent cet écosystème en garantissant la conformité des sorties JSON. Face à ce paysage fragmenté, le choix entre Lift et ses alternatives dépendra moins de la performance brute que des priorités de chaque équipe : licence permissive, taille du déploiement local, ou besoin d'un modèle unique capable à la fois d'extraire et de convertir en Markdown.

OutilsOutil
1 source
3VentureBeat AI 

OpenAI lance ChatGPT Pro à 100 dollars avec des limites d'utilisation de Codex 5 fois supérieures à celles de Plus

OpenAI a lancé un nouveau palier d'abonnement à 100 dollars par mois pour ChatGPT, baptisé ChatGPT Pro, ciblant explicitement les développeurs et les "vibe coders", ces utilisateurs qui construisent des logiciels en langage naturel avec l'aide de l'IA. Cette offre se positionne entre le plan Plus à 20 dollars et le plan Pro existant à 200 dollars, et son argument principal est simple : elle offre cinq fois plus d'utilisation de Codex, l'environnement de développement assisté par IA d'OpenAI, par rapport au plan Plus. Sam Altman, PDG et co-fondateur d'OpenAI, a annoncé le lancement sur X en évoquant une "très forte demande". Concrètement, le plan à 100 dollars permet par exemple d'envoyer entre 300 et 1 500 messages locaux avec le modèle GPT-5.3-Codex toutes les cinq heures, contre 45 à 225 pour le plan Plus, et d'effectuer entre 50 et 400 tâches cloud sur la même fenêtre, contre 10 à 60. Les revues de code passent également de 10 à 25 pull requests par semaine à 100 à 250. Le plan à 200 dollars offre quant à lui le double du plan à 100 dollars, soit dix fois les limites du Plus. Ce lancement signale une montée en puissance d'OpenAI sur le segment du développement logiciel assisté, un marché devenu stratégique. En introduisant un palier intermédiaire, l'entreprise cherche à capter les développeurs qui trouvaient le plan Plus trop limité sans vouloir payer 200 dollars. La décision est toutefois ambiguë : OpenAI a simultanément annoncé un "rééquilibrage" de l'utilisation de Codex pour les abonnés Plus, réduisant les sessions longues au profit de sessions plus courtes et distribuées dans la semaine, ce qui revient de facto à restreindre les usages intensifs des utilisateurs à 20 dollars, les incitant à passer à la formule supérieure. Le contexte concurrentiel explique en grande partie cette accélération. Anthropic, principal rival d'OpenAI, a récemment révélé un chiffre d'affaires annualisé dépassant 30 milliards de dollars, devançant les 24 à 25 milliards estimés d'OpenAI. Cette croissance est portée en grande partie par l'adoption massive de Claude Code et Claude Cowork, des outils de développement assisté par IA qui gagnent rapidement du terrain auprès des équipes techniques. OpenAI, qui a largement contribué à populariser l'IA générative, se retrouve ainsi à devoir défendre son leadership sur un segment qu'il a pourtant contribué à inventer. La guerre des abonnements pour coder avec l'IA ne fait que commencer, avec des acteurs comme Google, GitHub Copilot et Cursor également dans la course.

UELes développeurs européens disposent d'un nouveau palier intermédiaire à 100$/mois pour accéder à Codex avec des limites 5x supérieures au plan Plus, une option concrètement utilisable par les équipes techniques en France et en Europe.

OutilsOutil
1 source
Implémentation Python pour le benchmarking de parsing de documents avec LlamaIndex ParseBench
4MarkTechPost 

Implémentation Python pour le benchmarking de parsing de documents avec LlamaIndex ParseBench

LlamaIndex a publié ParseBench, un jeu de données de référence conçu pour évaluer de manière rigoureuse les systèmes d'analyse de documents. Hébergé sur Hugging Face sous l'identifiant llamaindex/ParseBench, ce benchmark est structuré autour de plusieurs dimensions d'évaluation distinctes : extraction de texte brut, reconnaissance de tableaux, interprétation de graphiques et respect de la mise en page. La procédure d'utilisation s'appuie sur un pipeline Python standardisé mobilisant des bibliothèques open source comme datasets, pandas, PyMuPDF (alias fitz), rapidfuzz et rich. Les données sont distribuées au format JSONL, avec des fichiers PDF associés accessibles directement depuis le dépôt Hugging Face via hfhubdownload. Le pipeline de référence décrit dans le tutoriel officiel construit un extracteur de texte léger basé sur PyMuPDF, compare les sorties aux annotations de référence grâce à des métriques de similarité floue (fuzz), et produit des visualisations de la distribution des exemples par dimension. L'importance de ParseBench réside dans le manque criant de standards objectifs pour comparer les moteurs d'analyse documentaire, qu'il s'agisse de solutions OCR classiques, de modèles de vision-langage ou de parseurs hybrides. Jusqu'ici, les équipes évaluaient leurs systèmes sur des jeux de données internes non reproductibles, rendant toute comparaison inter-organisations impossible. Avec ce benchmark unifié, les développeurs peuvent mesurer la qualité de l'extraction sur chaque dimension séparément, texte, tableaux, graphiques, layout, et identifier précisément où leurs pipelines échouent. Pour les entreprises qui traitent des volumes importants de documents (contrats, rapports financiers, publications scientifiques), disposer d'un tel outil de mesure change concrètement la façon dont on sélectionne et valide un moteur de parsing avant de le passer en production. ParseBench s'inscrit dans une tendance plus large portée par LlamaIndex, qui cherche à standardiser l'outillage autour des pipelines RAG (retrieval-augmented generation). La qualité de l'extraction documentaire est en effet le maillon critique souvent négligé de ces architectures : un PDF mal parsé produit des embeddings bruités, ce qui dégrade directement les réponses des assistants IA en aval. Plusieurs acteurs du secteur, comme Unstructured, LlamaParse ou encore Docling d'IBM, se livrent une concurrence directe sur ce segment. L'arrivée d'un benchmark public et reproductible oblige désormais ces acteurs à rendre des comptes sur des métriques communes. Les prochaines étapes probables incluent l'intégration de modèles de vision-langage comme GPT-4o ou Qwen-VL comme baselines supplémentaires, et l'extension du benchmark à des formats au-delà du PDF.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic