Cohere Parse 5 perd le benchmark sur les points, mais gagne sur le coût par page
Cohere a annoncé jeudi le lancement de Parse 5, un modèle de vision destiné à convertir PDF, diapositives et documents scannés en Markdown structuré pour les pipelines d'intelligence artificielle en entreprise. Il s'agit d'un modèle de langage visuel de 2,3 milliards de paramètres, construit sur l'architecture North-Micro-Vision-Instruct de Cohere Labs, avec une fenêtre de contexte de 8 192 tokens et une empreinte d'environ 4,6 gigaoctets. Sur le benchmark ParseBench, qui évalue les outils d'extraction documentaire sur des pages d'entreprise vérifiées par des humains, Parse 5 obtient 79,2 points sur trois critères (tableaux, fidélité du contenu, mise en forme sémantique), derrière GPT-5.5 (84,4), Opus 4.8 (84,3) et Gemini 3.5 Flash (81,8), mais devant LlamaParse en version économique (78,3), Mistral OCR 4 (74,5), Databricks AI Parse (72,4) et Azure Document Intelligence (69,3). Cohere facture le modèle 1,50 dollar pour 1 000 pages via son API, avec un accès élargi via Model Vault, sa plateforme d'inférence sécurisée à locataire unique, ainsi que via Microsoft Foundry et AWS SageMaker. Neuf langues, dont le français, l'anglais, l'allemand et le japonais, bénéficient d'une précision stable.
Résumé et traduction réalisés par Le Fil IA à partir de VentureBeat AI. Lire l'article original →
Plutôt que viser le meilleur score, Cohere revendique le meilleur rapport prix-performance du marché. Nils Reimers, vice-président IA Search chez Cohere, explique que la difficulté du traitement documentaire ne tient pas à la lecture du texte mais à la préservation de la structure et du sens, les documents d'entreprise mélangeant tableaux, diagrammes et mises en page qui changent l'interprétation des données, un obstacle sur lequel trébuchent encore la plupart des outils, y compris les modèles les plus avancés. Parse 5 traite chaque page comme une image en un seul passage, supprimant l'étape d'OCR habituellement séparée. Son mode "blocks" renvoie des éléments typés, chaque tableau étant accompagné de son code HTML, de ses coordonnées et d'une description, un format que Cohere présente comme la clé d'une traçabilité au niveau de la citation pour les agents autonomes. Pour les entreprises traitant des volumes massifs de documents, cette baisse de coût peut peser lourd face à des modèles généralistes plus chers.
Ce lancement s'inscrit dans une compétition croissante entre grands modèles généralistes comme GPT-5.5 ou Gemini 3.5 Flash et outils spécialisés bon marché comme Mistral OCR 4 ou LlamaParse pour équiper les pipelines documentaires des entreprises. Cohere assume des limites de portée: Parse 5 restitue le texte dans l'ordre de lecture plutôt que par éléments avec coordonnées précises, et décrit les graphiques sans en extraire les données sous-jacentes, une fonctionnalité promise pour une version future. Reimers justifie ce choix en expliquant que l'extraction brute des données d'un graphique fait perdre des informations comme la couleur ou le motif d'une courbe, sources d'hallucinations dans les applications conversationnelles et agentiques. Le pari de Cohere est que la majorité des entreprises préféreront un outil moins cher et presque aussi précis à un modèle frontière plus onéreux pour des tâches d'extraction à très grande échelle.
Les entreprises françaises et européennes traitant des documents peuvent utiliser Parse 5 via API, le français figurant parmi les neuf langues à précision stable.
Cohere a raison sur un point : le vrai casse-tête, c'est jamais de lire le texte, c'est de garder la structure d'un tableau ou d'un graphique quand tu le transformes en Markdown, et là-dessus les gros modèles trébuchent encore. Parse 5 n'est pas le meilleur du benchmark, il est juste largement le moins cher, et pour une boîte qui traite des millions de pages ça compte plus qu'un demi-point sur ParseBench. Reste que Cohere a coupé des angles (pas d'extraction de données dans les graphiques, texte à plat plutôt que positionné) pour tenir ce prix, donc ça reste un outil de volume, pas de précision chirurgicale.