Pipeline complet d'OCR de bout en bout avec Unlimited-OCR de Baidu pour images haute résolution et PDF multipages
Un tutoriel détaille la construction d'un pipeline complet d'OCR de bout en bout à partir du modèle Unlimited-OCR de Baidu, conçu pour traiter des images de documents haute résolution ainsi que des PDF multi-pages. La démarche configure d'abord un environnement GPU sous Google Colab, installe les dépendances nécessaires (transformers 4.57.1, Pillow, PyMuPDF, accelerate, entre autres) puis charge un modèle vision-langage de 3 milliards de paramètres depuis Hugging Face, avec sélection automatique du format bfloat16 ou float16 selon le matériel disponible, pour un poids d'environ 6 Go en BF16. Le tutoriel génère ensuite des documents d'exemple structurés, imitant des rapports trimestriels avec titres, paragraphes et tableaux de données financières régionales, afin de tester le modèle dans des conditions proches du réel. Deux modes d'inférence sont comparés pour l'OCR sur page unique : le mode Gundam, qui découpe l'image en tuiles pour une analyse plus fine, et le mode Base, plus rapide mais moins détaillé. Le pipeline est ensuite étendu au traitement de PDF multi-pages grâce à la bibliothèque PyMuPDF et à la fonction infer_multi(), qui gère le contenu réparti sur plusieurs pages en conservant des paramètres de génération à long contexte et des contrôles de répétition.
L'intérêt de cette approche réside dans sa capacité à traiter des mises en page denses, des tableaux et du texte continu en une seule passe de décodage, sans recourir à une étape séparée d'analyse de mise en page comme le font les pipelines OCR classiques. Pour les entreprises et développeurs qui doivent extraire des données structurées de documents administratifs, financiers ou de rapports scannés, cela simplifie considérablement l'architecture technique tout en réduisant la latence de traitement. La possibilité de traiter des PDF entiers, page par page, avec une sortie textuelle cohérente ouvre la voie à des applications d'automatisation documentaire plus robustes, notamment pour les secteurs juridique, comptable ou administratif où la fidélité aux tableaux et aux chiffres est critique.
Ce tutoriel s'inscrit dans une tendance plus large de remplacement des pipelines OCR traditionnels, souvent composés de plusieurs modules spécialisés, par des modèles vision-langage uniques capables de comprendre directement la structure visuelle d'un document. Baidu rejoint ainsi d'autres acteurs qui misent sur des modèles de quelques milliards de paramètres, suffisamment légers pour tourner sur un GPU grand public tout en conservant des performances élevées sur des tâches complexes. La reproductibilité du pipeline via Colab et son intégration à l'écosystème Hugging Face facilitent l'adoption par les développeurs, qui peuvent adapter rapidement l'outil à leurs propres corpus de documents professionnels.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




