Aller au contenu principal
LLMs · Opinion ·

Jina AI lance jina-ocr-v1, un analyseur de documents MoE de 3,4 milliards de paramètres pour GPU d'entrée de gamme

La société Jina AI, filiale du groupe Elastic, a publié jina-ocr-v1, un modèle de reconnaissance de documents capable de transformer en une seule passe des PDF, scans, tableaux, graphiques ou factures en texte Markdown propre. Le modèle compte 3,4 milliards de paramètres au total, dont environ 570 millions activés par token dans son décodeur de type mélange d'experts. Il intègre nativement une tête de décodage spéculatif et a été conçu pour tourner sur des GPU d'entrée de gamme comme le NVIDIA L4. Selon le rapport technique publié par Jina AI, le modèle obtient un score de 91,14 sur le benchmark OmniDocBench v1.6 et de 83,4 sur olmOCR-Bench. Les poids ouverts, d'environ 6,8 Go en BF16, sont compatibles avec Transformers et vLLM, mais la licence CC BY-NC 4.0 réserve l'usage commercial à un accord préalable avec Jina AI.

2 min de lecturePertinence 53

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

L'intérêt principal du modèle réside dans sa vitesse plutôt que dans sa précision brute, puisque plusieurs concurrents comme PaddleOCR-VL-1.6 (96,34) ou HunyuanOCR-1.5 (94,74) le devancent sur OmniDocBench. Sur un GPU A100 40 Go avec une concurrence de 32 requêtes, jina-ocr-v1 traite 2,57 pages par seconde, la meilleure performance parmi les 14 systèmes testés par Jina AI, contre 1,22 pour olmOCR-2 et 0,38 pour chandra-ocr-2, tout en générant le texte de sortie le plus court parmi les modèles dépassant 83 points sur olmOCR-Bench. Sur un GPU L4 en traitement unitaire, le débit passe de 42,7 à 83,1 tokens par seconde grâce au décodage spéculatif, soit un gain de 1,95 fois pour un taux d'acceptation de 57,6 %, sans perte de qualité puisque le texte produit reste strictement identique à celui d'un décodage classique. Pour les entreprises qui traitent de gros volumes de documents, cela représente une réduction directe des coûts d'inférence sans sacrifier la fiabilité du résultat.

Techniquement, jina-ocr-v1 repose sur un post-entraînement du modèle DeepSeek-OCR, dont il conserve l'encodeur DeepEncoder (environ 380 millions de paramètres, combinant SAM, un compresseur convolutif et CLIP-L) et le décodeur DeepSeek-3B-MoE à 64 experts routés. Jina AI a affiné ce socle avec un entraînement par renforcement de type GRPO, des récompenses vérifiables codées de façon déterministe, et un jeu de données synthétiques baptisé JinaOCRSynth, ce qui a permis un gain de 7,4 points sur olmOCR-Bench par rapport au modèle DeepSeek-OCR d'origine. Le marché de l'OCR documentaire par modèles de langage reste très disputé, avec des acteurs comme PaddleOCR, Tencent (HunyuanOCR), dots.mocr ou Qwen3-VL d'Alibaba, chacun optimisant un compromis différent entre taille, précision et vitesse.

Impact France / UEChamp produit par Le Fil IA

Jina AI, société basée a Berlin, publie ce modèle OCR en poids ouverts que les entreprises européennes peuvent tester, sous réserve d'un accord commercial pour tout usage professionnel du fait de la licence CC BY-NC.

À lire ensuite

01Meta AI lance Muse Glimmer, un modèle open source de 30 milliards de paramètres exécutable sur un seul GPU grand public50MarkTechPostLLMs 02Cohere lance Command A+, un modèle MoE sparse de 218 milliards de paramètres pour agents autonomes, utilisable sur seulement deux GPU H10046MarkTechPostLLMs 03Mistral AI lance Voxtral TTS : un modèle vocal open-weight de 4 milliards de paramètres pour la génération vocale multilingue en temps réel56MarkTechPostLLMs 
Dossier · DeepSeekSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.