H Company dévoile NeoMME, une famille d'encodeurs multimodaux à tour unique de 260M et 800M sans tour de vision ni décodeur causal
H Company, société française d'intelligence artificielle, a publié NeoMME, une famille de deux encodeurs multimodaux à tour unique et bidirectionnels, comptant 262 937 906 et 793 715 032 paramètres, soit environ 260 et 800 millions. À la différence des modèles de récupération documentaire visuelle actuels comme ColPali, qui recyclent un modèle vision-langage génératif en conservant une tour visuelle et un décodeur causal inutiles pour cette tâche, NeoMME fait passer texte multilingue et patches d'image bruts de 32x32 pixels dans les mêmes couches d'un seul Transformer entraîné depuis une initialisation aléatoire. Doté d'un tokenizer BPE de 131 072 entrées et d'une fenêtre de contexte de 16 384 tokens, suffisante pour deux images 4K, le modèle a été pré-entraîné par diffusion masquée discrète sur environ 524 milliards de tokens, en utilisant 16 puis 32 accélérateurs Nvidia H100. Sa version de récupération, NeoMME-Retriever, atteint 0,523 nDCG@10 sur le benchmark ViDoRe v3 à 260 millions de paramètres et 0,556 à 800 millions, et tous les checkpoints sont publiés sous licence Apache 2.0 avec support immédiat dans Hugging Face Transformers.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Ce résultat est notable: le modèle de 260 millions de paramètres se situe à seulement 0,002 point du score de ColQwen2.5-v0.2, qui en compte pourtant 3,75 milliards, près de quinze fois plus, et devance de 26,1 points le meilleur autre modèle de moins de 300 millions de paramètres. Concrètement, cela permet une recherche documentaire visuelle multilingue presque aussi précise que les modèles de référence, pour un coût de calcul bien moindre: le modèle 260M indexe 51,3 pages par seconde sur un seul GPU Nvidia L40S et encode une requête en 78,3 millisecondes sur simple processeur, sans GPU. Pour les entreprises qui indexent de grands volumes de documents scannés ou de rapports multilingues, cela ouvre la voie à des déploiements moins coûteux en infrastructure. Deux techniques de compression des index par interaction tardive réduisent aussi fortement le stockage, jusqu'à 255,5 fois, faisant passer un index de page de 1,5 mégaoctet à 6 kilooctets tout en conservant 95,19% de la performance de référence.
Le développement de NeoMME répond à un défaut structurel des modèles de récupération visuelle actuels, majoritairement bâtis sur des architectures détournées de leur usage d'origine, ColPali et ses successeurs empruntant des modèles génératifs pour en faire de simples encodeurs, avec du poids mort inutile. H Company mise ici sur une architecture repensée dès la base pour la tâche de recherche, combinant attention par fenêtre glissante sur la plupart des couches, attention globale toutes les six couches, et deux têtes entraînées conjointement pour la recherche dense et par interaction tardive. Des limites subsistent côté texte pur: sur le benchmark BEIR-15, NeoMME reste derrière le modèle spécialisé LateOn, avec des scores de 0,4881 et 0,5126 contre 0,5722, écart attribué par les auteurs au volume d'entraînement, environ 430 000 exemples de requêtes textuelles contre 660 millions pour son concurrent. Cette publication en open source s'inscrit dans une compétition croissante entre laboratoires pour des encodeurs multimodaux légers et efficaces, alors que la demande en recherche documentaire visuelle multilingue s'accroît avec la numérisation des archives d'entreprise.
H Company, entreprise française d'IA, publie en open source une famille de modèles efficaces, renforçant la souveraineté technologique européenne en recherche documentaire visuelle.