Aller au contenu principal
OutilsMarkTechPost · 2 min de lecture

Le Marker 2 de Datalab face à MinerU, Docling et LiteParse : 76,0 sur olmOCR-bench avec un débit 5 fois supérieur à MinerU

Source originale ↗·

Voici l'article traduit et résumé :

Datalab a publié Marker 2, une réécriture complète de son pipeline open source de conversion de documents, le 21 juillet 2026. Marker convertit les fichiers PDF, images, PPTX, DOCX, XLSX, HTML et EPUB en markdown, JSON, HTML ou en chunks. Cette nouvelle version s'appuie sur trois composants développés ces derniers mois par l'équipe de Datalab : Surya OCR 2, un modèle de détection de mise en page rapide de 20 millions de paramètres, et une version reconstruite de pdftext trois fois plus rapide que la précédente. Sur le benchmark olmOCR-bench d'Allen AI, référence tierce composée de 1403 PDF et d'environ 8400 tests, le mode équilibré de Marker 2 obtient un score global de 76,0% et 83,5% sur les documents PDF nativement numériques, tout en traitant 2,9 pages par seconde sur un seul GPU B200. À titre de comparaison, MinerU plafonne à 72,7% avec seulement 0,54 page par seconde, et Docling atteint 50,3% à 2,1 pages par seconde sur le même test.

Cette avancée change concrètement la donne pour les équipes qui doivent extraire et structurer de grands volumes de documents, un besoin central dans l'entraînement de modèles de langage, l'indexation documentaire ou l'automatisation de flux d'entreprise. Un gain de vitesse supérieur à 5 fois par rapport à MinerU, à qualité égale voire supérieure sur les documents natifs, réduit directement les coûts d'infrastructure et les délais de traitement à grande échelle. Marker 2 propose désormais trois modes selon les besoins : le mode équilibré qui mobilise le modèle Surya pour les documents complexes, un mode rapide combinant un détecteur léger et un usage minimal du modèle de vision pour un coût réduit, et un mode sans OCR fonctionnant uniquement sur CPU, à 43,6% de score mais 23,7 pages par seconde. La sélection automatique du mode selon le matériel disponible facilite l'adoption par des équipes aux ressources GPU limitées.

Cette évolution s'inscrit dans une course plus large entre plusieurs outils open source de conversion documentaire, tous confrontés au même défi : concilier fidélité d'extraction et rapidité de traitement à l'échelle industrielle. L'architecture de Marker 2 repose sur un changement structurel clé, plusieurs processus légers tournant sur CPU partagent un seul serveur d'inférence Surya, ce qui permet au débit de suivre la capacité du serveur plutôt que d'être limité par la mémoire GPU de chaque processus. Datalab revendique une amélioration notable par rapport au traitement en flux unique. La mise à jour s'accompagne toutefois de changements majeurs à anticiper avant toute migration : Python 3.10 minimum désormais requis, passage de Poetry à uv pour le packaging, et suppression du convertisseur d'extraction structurée, les utilisateurs étant désormais orientés vers l'API hébergée ou un usage combiné avec un LLM.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

« Datalab Lift face à la concurrence : comment un extracteur à 9 milliards de paramètres, guidé par schéma, se compare à NuExtract3, LlamaExtract, Marker et Docling »
1MarkTechPost 

« Datalab Lift face à la concurrence : comment un extracteur à 9 milliards de paramètres, guidé par schéma, se compare à NuExtract3, LlamaExtract, Marker et Docling »

Datalab a lancé Lift, un outil d'extraction de documents qui promet une approche différente des solutions existantes. Le principe : on lui fournit un PDF ou une image accompagné d'un schéma JSON, et le modèle retourne directement les données structurées correspondantes, sans passer par une conversion intermédiaire en Markdown. Lift s'appuie sur un modèle de vision de 9 milliards de paramètres, capable de lire les images des pages rendues et de produire l'objet JSON final en une seule passe grâce à un décodage contraint par le schéma. Selon les benchmarks internes de Datalab, Lift atteint une précision de champs de 90,2%, contre 81,5% pour son principal concurrent open-weight, NuExtract3, développé par NuMind. Ce dernier, un modèle de 4 milliards de paramètres sous licence Apache-2.0, combine extraction structurée et conversion image-vers-Markdown, et cible des documents comme les factures, reçus, formulaires et contrats. Cette approche change la manière dont les entreprises peuvent construire leurs pipelines de traitement documentaire. Jusqu'à présent, la pratique dominante consistait à convertir un PDF en Markdown ou en texte structuré via des outils comme Docling, MinerU, Marker ou Unstructured, puis à envoyer cette représentation à un grand modèle de langage avec un schéma pour en extraire les champs utiles. Lift propose de fusionner ces deux étapes en une seule, ce qui réduit la complexité du pipeline lorsque l'objectif final est réellement l'extraction de champs précis, comme un numéro de facture, un nom de fournisseur ou une liste de lignes de commande, plutôt que la reconstruction fidèle du document dans son ensemble. Pour les équipes d'ingénierie qui traitent de gros volumes de documents visuellement complexes, cela peut se traduire par moins de composants à maintenir et une latence réduite, au prix d'une dépendance plus forte à un seul modèle propriétaire. Le marché de l'extraction documentaire par IA s'est considérablement densifié ces derniers mois, avec plusieurs catégories d'outils qui se chevauchent sans être toujours en concurrence directe. D'un côté, les parseurs comme Docling, MinerU, Marker, Unstructured, PyMuPDF ou Surya, qui produisent des représentations fidèles du document plutôt que des données applicatives. De l'autre, les extracteurs schéma-first comme Lift, NuExtract3, LlamaExtract, Reducto Extract ou Extend, ainsi que les géants du cloud comme Azure, Google et AWS avec leurs propres systèmes de compréhension documentaire. Des bibliothèques de génération structurée comme XGrammar, Outlines, Instructor ou BAML complètent cet écosystème en garantissant la conformité des sorties JSON. Face à ce paysage fragmenté, le choix entre Lift et ses alternatives dépendra moins de la performance brute que des priorités de chaque équipe : licence permissive, taille du déploiement local, ou besoin d'un modèle unique capable à la fois d'extraire et de convertir en Markdown.

OutilsOutil
1 source
2VentureBeat AI 

OpenAI lance ChatGPT Pro à 100 dollars avec des limites d'utilisation de Codex 5 fois supérieures à celles de Plus

OpenAI a lancé un nouveau palier d'abonnement à 100 dollars par mois pour ChatGPT, baptisé ChatGPT Pro, ciblant explicitement les développeurs et les "vibe coders", ces utilisateurs qui construisent des logiciels en langage naturel avec l'aide de l'IA. Cette offre se positionne entre le plan Plus à 20 dollars et le plan Pro existant à 200 dollars, et son argument principal est simple : elle offre cinq fois plus d'utilisation de Codex, l'environnement de développement assisté par IA d'OpenAI, par rapport au plan Plus. Sam Altman, PDG et co-fondateur d'OpenAI, a annoncé le lancement sur X en évoquant une "très forte demande". Concrètement, le plan à 100 dollars permet par exemple d'envoyer entre 300 et 1 500 messages locaux avec le modèle GPT-5.3-Codex toutes les cinq heures, contre 45 à 225 pour le plan Plus, et d'effectuer entre 50 et 400 tâches cloud sur la même fenêtre, contre 10 à 60. Les revues de code passent également de 10 à 25 pull requests par semaine à 100 à 250. Le plan à 200 dollars offre quant à lui le double du plan à 100 dollars, soit dix fois les limites du Plus. Ce lancement signale une montée en puissance d'OpenAI sur le segment du développement logiciel assisté, un marché devenu stratégique. En introduisant un palier intermédiaire, l'entreprise cherche à capter les développeurs qui trouvaient le plan Plus trop limité sans vouloir payer 200 dollars. La décision est toutefois ambiguë : OpenAI a simultanément annoncé un "rééquilibrage" de l'utilisation de Codex pour les abonnés Plus, réduisant les sessions longues au profit de sessions plus courtes et distribuées dans la semaine, ce qui revient de facto à restreindre les usages intensifs des utilisateurs à 20 dollars, les incitant à passer à la formule supérieure. Le contexte concurrentiel explique en grande partie cette accélération. Anthropic, principal rival d'OpenAI, a récemment révélé un chiffre d'affaires annualisé dépassant 30 milliards de dollars, devançant les 24 à 25 milliards estimés d'OpenAI. Cette croissance est portée en grande partie par l'adoption massive de Claude Code et Claude Cowork, des outils de développement assisté par IA qui gagnent rapidement du terrain auprès des équipes techniques. OpenAI, qui a largement contribué à populariser l'IA générative, se retrouve ainsi à devoir défendre son leadership sur un segment qu'il a pourtant contribué à inventer. La guerre des abonnements pour coder avec l'IA ne fait que commencer, avec des acteurs comme Google, GitHub Copilot et Cursor également dans la course.

UELes développeurs européens disposent d'un nouveau palier intermédiaire à 100$/mois pour accéder à Codex avec des limites 5x supérieures au plan Plus, une option concrètement utilisable par les équipes techniques en France et en Europe.

OutilsOutil
1 source
Implémentation Python pour le benchmarking de parsing de documents avec LlamaIndex ParseBench
3MarkTechPost 

Implémentation Python pour le benchmarking de parsing de documents avec LlamaIndex ParseBench

LlamaIndex a publié ParseBench, un jeu de données de référence conçu pour évaluer de manière rigoureuse les systèmes d'analyse de documents. Hébergé sur Hugging Face sous l'identifiant llamaindex/ParseBench, ce benchmark est structuré autour de plusieurs dimensions d'évaluation distinctes : extraction de texte brut, reconnaissance de tableaux, interprétation de graphiques et respect de la mise en page. La procédure d'utilisation s'appuie sur un pipeline Python standardisé mobilisant des bibliothèques open source comme datasets, pandas, PyMuPDF (alias fitz), rapidfuzz et rich. Les données sont distribuées au format JSONL, avec des fichiers PDF associés accessibles directement depuis le dépôt Hugging Face via hfhubdownload. Le pipeline de référence décrit dans le tutoriel officiel construit un extracteur de texte léger basé sur PyMuPDF, compare les sorties aux annotations de référence grâce à des métriques de similarité floue (fuzz), et produit des visualisations de la distribution des exemples par dimension. L'importance de ParseBench réside dans le manque criant de standards objectifs pour comparer les moteurs d'analyse documentaire, qu'il s'agisse de solutions OCR classiques, de modèles de vision-langage ou de parseurs hybrides. Jusqu'ici, les équipes évaluaient leurs systèmes sur des jeux de données internes non reproductibles, rendant toute comparaison inter-organisations impossible. Avec ce benchmark unifié, les développeurs peuvent mesurer la qualité de l'extraction sur chaque dimension séparément, texte, tableaux, graphiques, layout, et identifier précisément où leurs pipelines échouent. Pour les entreprises qui traitent des volumes importants de documents (contrats, rapports financiers, publications scientifiques), disposer d'un tel outil de mesure change concrètement la façon dont on sélectionne et valide un moteur de parsing avant de le passer en production. ParseBench s'inscrit dans une tendance plus large portée par LlamaIndex, qui cherche à standardiser l'outillage autour des pipelines RAG (retrieval-augmented generation). La qualité de l'extraction documentaire est en effet le maillon critique souvent négligé de ces architectures : un PDF mal parsé produit des embeddings bruités, ce qui dégrade directement les réponses des assistants IA en aval. Plusieurs acteurs du secteur, comme Unstructured, LlamaParse ou encore Docling d'IBM, se livrent une concurrence directe sur ce segment. L'arrivée d'un benchmark public et reproductible oblige désormais ces acteurs à rendre des comptes sur des métriques communes. Les prochaines étapes probables incluent l'intégration de modèles de vision-langage comme GPT-4o ou Qwen-VL comme baselines supplémentaires, et l'extension du benchmark à des formats au-delà du PDF.

OutilsOutil
1 source
Perplexity AI publie en open source un tokeniseur Unigram avec une latence p50 5 fois inférieure au tokeniseur de Hugging Face
4MarkTechPost 

Perplexity AI publie en open source un tokeniseur Unigram avec une latence p50 5 fois inférieure au tokeniseur de Hugging Face

L'équipe de recherche de Perplexity AI a réécrit de zéro son tokeniseur Unigram en Rust et publié le code en open source dans son dépôt pplx-garden, dédié à ses technologies d'inférence. Le résultat est saisissant : à des longueurs d'entrée typiques de production, la nouvelle implémentation divise par 5 la latence médiane (p50) par rapport à la bibliothèque tokenizers de Hugging Face, par 2 par rapport à SentencePiece en C++, et par 1,5 par rapport au tokeniseur IREE en C. En conditions réelles, Perplexity a mesuré une réduction de 5 à 6 fois de l'utilisation CPU dans sa pile d'inférence, et un gain de plusieurs dizaines de millisecondes sur la latence de ses modèles de reranking. La solution atteint zéro allocation sur le tas en régime permanent, ce qui change fondamentalement la courbe de performance à grande échelle. Ce gain n'est pas anecdotique : il révèle un angle mort souvent ignoré de l'inférence LLM. La conversation autour des coûts se concentre presque exclusivement sur les GPU, les caches KV et les noyaux d'attention. Mais des modèles plus compacts, comme les encodeurs d'embeddings, les classifieurs et les modèles de reranking, présentent un profil radicalement différent. Un reranker tel que XLM-RoBERTa, doté d'un vocabulaire Unigram de 250 000 tokens, peut terminer son calcul GPU en quelques millisecondes seulement. La tokenisation côté CPU devient alors le vrai goulot d'étranglement, surtout lorsqu'il faut traiter des centaines de documents par requête. Pour des systèmes à fort trafic comme celui de Perplexity, optimiser cette étape revient à réduire directement les coûts d'infrastructure et la latence perçue par l'utilisateur final. La lenteur de l'implémentation de Hugging Face tenait à trois problèmes structurels : chaque correspondance dans le trie déclenchait une allocation mémoire via String::from_utf8, générant jusqu'à 299 000 allocations pour une entrée de 16 000 tokens ; chaque nœud du trie reposait sur une HashMap entraînant quatre chargements mémoire dépendants par octet ; enfin, les buffers de la table de programmation dynamique étaient réalloués à chaque appel, saturant le cache L2 à mesure que les entrées s'allongent. Perplexity a d'abord validé un portage sans allocation avec la même structure de trie, réduisant déjà la latence de 326 µs à 155 µs, avant d'introduire un Double-Array Trie pour éliminer le coût résiduel du parcours de pointeurs. L'algorithme de Viterbi, introduit en 1967 pour la segmentation probabiliste, reste au cœur du tokeniseur Unigram formalisé par Kudo en 2018 et intégré à SentencePiece. En publiant leur implémentation, Perplexity offre à l'ensemble de l'écosystème open source un composant critique dont les bénéfices dépassent largement leur propre infrastructure.

UELes équipes techniques européennes travaillant avec des tokeniseurs Unigram à grande échelle peuvent intégrer directement cette bibliothèque open source pour réduire la latence et les coûts CPU de leurs pipelines d'inférence.

OutilsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic