Fastino lance GLiNER2.5-Decide, un modèle de décision open-weight de 340M de paramètres, exécutable sur CPU
Fastino Labs a publié GLiNER2.5-Decide, un modèle de décision open-weight de 340 millions de paramètres, sous licence Apache 2.0, installable via pip install gliner2. Contrairement à un modèle génératif, il ne produit aucun texte : il prend en entrée un texte accompagné d'un schéma de questions typées et renvoie des réponses structurées, chacune assortie d'une distribution de probabilité, d'un score de confiance et de métadonnées sur la faisabilité des contraintes. Basé sur un encodeur DeBERTa-v3-large affiné à partir de gliner2-large-v1, il fonctionne sur CPU, GPU ou en environnement isolé sans connexion réseau. Sur le benchmark interne Fast Decisions, composé de 5 100 exemples répartis sur 17 jeux de données couvrant la banque, le médical, le voyage et les avantages sociaux, il obtient une précision moyenne de 60,1 %, devançant des modèles bien plus volumineux comme JevK5 (4 milliards de paramètres, 57,5 %) ou SemIf Qwen3.5-4B (56,4 %), et arrive en tête sur 9 des 17 jeux de données, notamment en routage d'intentions avec 75,3 % de précision sur le support client. Côté latence, le modèle répond en 167,3 millisecondes sur un CPU Intel Xeon Platinum 8581C à 48 cœurs virtuels, et entre 38 et 47 millisecondes sur des GPU comme les NVIDIA T4, L4, V100 ou A100.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Cette sortie répond à un besoin précis et souvent négligé dans les architectures d'agents IA : les décisions opérationnelles rapides et répétitives, comme le routage de tickets, le tri de requêtes, la sélection d'outils ou l'application de garde-fous de sécurité, qui ne nécessitent pas la puissance ni le coût d'un grand modèle génératif. Fastino illustre l'intérêt de son décodage conjoint avec un exemple de détection d'injection de prompt : évalué séparément, le modèle attribuait un score de 0,82 à une tentative d'attaque tout en jugeant à 0,52 que le même prompt était sûr, un résultat contradictoire. En appliquant une règle liant les réponses entre elles, le modèle renvoie désormais une verdict cohérent, sûr ou non sûr, couplé au type de menace détecté. Pour les équipes qui construisent des pipelines d'agents, cela signifie une couche de décision moins chère, plus rapide et déployable localement, y compris pour des cas sensibles nécessitant un traitement sur site sans passer par une API cloud tierce.
Ce lancement s'inscrit dans une tendance plus large de spécialisation des modèles : plutôt que de confier chaque micro-décision à un grand modèle de langage génératif coûteux en calcul, certains laboratoires développent des classificateurs compacts et rapides pour les tâches à choix contraints. Fastino propose également une offre d'inférence hébergée et de fine-tuning via son API GLiNER, ce qui laisse entrevoir un modèle économique mixte entre poids ouverts et service payant. Le même encodeur peut aussi extraire des entités, des relations et des enregistrements structurés avec des offsets au niveau des caractères en un seul passage, ce qui élargit son usage au-delà de la simple classification. Reste à voir comment ce type de modèle de décision s'intégrera face à la montée en puissance des agents génériques capables de raisonnement, et si d'autres acteurs suivront cette voie de la spécialisation pour réduire les coûts d'inférence dans les pipelines de production.
Le fonctionnement local sans connexion réseau peut intéresser les entreprises européennes soumises a des contraintes de souveraineté des données, mais aucun acteur ou marche européen n'est directement implique.