Knowledgator lance GLiFormer, un encodeur de 575M de paramètres qui atteint 91,10 F1 sur l'extraction JSON imbriquée sans générer de tokens
Knowledgator Engineering a publié GLiFormer, un framework d'encodeur conditionné par schéma pour l'extraction d'information, disponible sur Hugging Face sous licence Apache 2.0 et installable via pip install gliformer. Deux versions existent : Base v1, avec 264,2 millions de paramètres et 12 couches, et Large v1, avec 575,6 millions de paramètres et 24 couches ; les deux tournent sur CPU comme sur GPU. Sur un test d'extraction JSON imbriquée portant sur 500 exemples, Large obtient un score F1 de 91,10 et Base 87,20, contre 91,96 pour GPT-5.6-luna et 82,56 pour GPT-5-mini. Sur treize jeux de données de classification, Large atteint 75,03 de F1 macro moyen contre 72,36 pour Base, 64,89 pour GLiNER2.5 et 79,79 pour GPT-5-mini. Sur l'évaluation CrossNER couvrant cinq domaines, Base obtient 65,10 et Large 64,35, contre 70,74 pour Gemma-4-31B-IT. Côté vitesse, GLiFormer-base traite un document en 69 millisecondes sur une carte graphique RTX Pro 6000 Blackwell et en 547 millisecondes sur un processeur AMD Epyc 9B45.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
L'intérêt de GLiFormer est de remplacer par un seul modèle toute une chaîne d'outils habituellement séparés pour la reconnaissance d'entités nommées, la classification de texte, l'extraction de relations, la structuration en JSON imbriqué et le calcul d'embeddings. Contrairement aux grands modèles de langage qui génèrent chaque token de la sortie, GLiFormer encode le texte source une seule fois puis évalue la compatibilité entre ce texte et les schémas fournis à l'inférence, sans jamais générer de sortie textuelle. Cette approche réduit fortement la latence et le coût de calcul pour les pipelines industriels traitant de gros volumes de documents, et limite le risque d'hallucination puisque les valeurs extraites sont toujours des segments pris directement dans le texte source. Pour des usages comme le traitement de factures, de contrats ou de rapports structurés, cela ouvre la voie à des déploiements moins coûteux, capables de tourner sur un simple processeur plutôt que sur une infrastructure GPU dédiée aux grands modèles génératifs.
GLiFormer s'appuie sur l'architecture GLiNER, dont il généralise le mécanisme d'appariement des labels via la notion d'ancre, un objet de référence auquel chaque label est comparé, qu'il s'agisse d'un vecteur de catégorie, d'une paire d'entités ou d'un emplacement dans un enregistrement structuré. La version Base part d'un socle DeBERTa pré-entraîné sur cent milliards de tokens supplémentaires, puis affinée sur plus de 1,35 million d'exemples pour un entraînement multitâche et 372 090 exemples pour un entraînement ciblé par tâche. Ce lancement illustre un mouvement plus large vers des encodeurs spécialisés, plus légers que les modèles génératifs géants, pour les tâches d'extraction où la vitesse et le coût priment sur la flexibilité conversationnelle. Knowledgator précise que son estimation d'un gain de vitesse jusqu'à 95,8 fois reste un calcul analytique fondé sur des hypothèses de débit de tokens, et non une mesure directe face à un modèle de langage. Le code source et les fiches des modèles sont disponibles sur GitHub et Hugging Face pour un déploiement immédiat.
Pas d'impact direct sur la France/UE