Cohere lance Parse 5 : un modèle vision-langage de 2,3 milliards de paramètres qui convertit les documents d'entreprise en Markdown
Cohere a lancé Parse (parse-v5.0), un modèle de vision-langage conçu pour l'extraction de documents d'entreprise à grande échelle. Doté de 2,3 milliards de paramètres, d'une fenêtre de contexte de 8 192 tokens et d'un poids d'environ 4,6 Go, il repose sur l'architecture North-Micro-Vision-Instruct de Cohere Labs. Le modèle prend en entrée une page PDF, PowerPoint ou JPEG encodée en base64 et restitue directement du Markdown avec le texte dans l'ordre de lecture, les tableaux au format HTML, les listes, les paires clé-valeur de formulaires, les descriptions d'images et les coordonnées de zones délimitées, sans étape d'OCR séparée en amont. Neuf langues sont prises en charge de façon stable, dont le français, l'anglais, l'allemand, l'espagnol et le japonais. L'API est facturée 1,50 dollar pour 1 000 pages et le modèle est disponible immédiatement, sans liste d'attente, via l'API Cohere Parse, Microsoft Foundry, AWS SageMaker et Model Vault pour les déploiements à locataire unique.
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Ce lancement cible directement les secteurs qui traitent de gros volumes de documents complexes : services financiers, assurance, santé, secteur public, télécoms, énergie et industrie manufacturière, où formulaires scannés et tableaux denses sont la norme. Les usages visés vont de l'alimentation de pipelines RAG au traitement intelligent de documents, en passant par les sinistres, les factures, la recherche contractuelle et l'enrichissement contextuel d'agents. Pour les équipes de taille moyenne déjà équipées d'une stack RAG, l'entrée se fait par simple appel API facturé à l'usage avec une clé d'essai gratuite, tandis que les grandes entreprises soumises à des contraintes de résidence des données ou d'isolation réseau peuvent opter directement pour Model Vault ou un déploiement privé. Cohere avance que l'intérêt économique du produit ne devient réellement significatif qu'au-delà d'environ 100 000 pages traitées par mois, ce qui positionne Parse comme un outil pensé pour le volume plutôt que pour l'usage ponctuel.
Cohere met en avant un score ParseBench de 79,2, supérieur à celui de Mistral OCR 4 (74,5), Azure Document Intelligence (74,3) et Databricks AI Parse (72,4), et présente Parse comme un choix orienté rapport qualité-prix plutôt que précision maximale. Ce chiffre mérite toutefois d'être nuancé : ParseBench, un benchmark de LlamaIndex portant sur environ 2 078 pages d'entreprise vérifiées manuellement, évalue cinq dimensions (tableaux, graphiques, fidélité du contenu, mise en forme sémantique et ancrage visuel), mais le score de Cohere n'en moyenne que trois, en écartant les graphiques et l'ancrage visuel, précisément les deux critères sur lesquels la plupart des outils de parsing échouent. Sur le classement public à cinq dimensions, les mêmes concurrents obtiennent des scores nettement plus bas, et Cohere Parse n'y figure pas encore, alors que LlamaParse Agentic domine ce classement avec 84,88. Le 79,2 annoncé reste donc une mesure partielle fournie par le vendeur lui-même, à vérifier sur des documents réels avant tout choix définitif.
Les entreprises françaises et européennes à fort volume documentaire disposent d'un nouvel outil disponible en français, sans impact réglementaire ou légal spécifique à la France ou à l'UE.