Modèles d'IA de décision : TypeSafe Jev face à Fastino GLiDE, GLiNER2.5-Decide et aux alternatives open source
Les modèles d'IA de décision forment une nouvelle catégorie qui renvoie un choix plutôt qu'un paragraphe. Le développeur envoie un texte accompagné de questions typées, et le modèle retourne une option, un score ou une probabilité oui/non que le code peut exploiter directement. La catégorie s'est imposée quand TypeSafe AI a lancé Jev après deux ans passés dans l'ombre, en le présentant comme un « modèle System One », en référence à la pensée rapide et intuitive décrite par Daniel Kahneman. Jev reçoit un « état » (chaîne, tableau ou paires nom-valeur) et une ou plusieurs questions, de trois types : Choice (une option parmi 255 au maximum, avec probabilités et confiance), Score (une note sur une échelle ordonnée) et Noul, une probabilité de 0 à 1 qu'une affirmation soit vraie, nom abrégé de Bernoulli. Les questions sont évaluées en parallèle et indépendamment, et comme le modèle ne génère jamais de texte, il ne peut pas produire d'erreur de type. Il est facturé 0,042 dollar par million de jetons en entrée, la sortie étant gratuite, avec une fenêtre de contexte de 32K sur OpenRouter et des réponses en 70 à 500 millisecondes. Il repose sur une méthode d'entraînement baptisée RLCD (Reinforcement Learning for Calibrated Decisions), qui vise des probabilités calibrées plutôt que la préférence humaine.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
L'enjeu est d'abord économique. Sur les évaluations de workflow conçues par TypeSafe (incidents de sécurité, observabilité d'agents, traitement de factures, service client), dont les étiquettes de référence sont la moyenne de GPT-6 Astra et de Claude Fable 5.1, Jev atteint 67,8 % de précision moyenne pour 0,0004 dollar par cas et 0,4 seconde. Claude Sonnet 5 obtient le même score, mais à 0,1174 dollar et 78,1 secondes. La meilleure configuration comparée, OpenAI « sol », atteint 74,1 % pour 0,0836 dollar et 23,3 secondes : Jev reste donc 6,3 points derrière. Les résultats varient selon les tâches, de 76,0 % sur le service client à 61,8 % sur les factures. La règle pratique est simple : si le code doit se brancher sur une réponse bornée, un modèle de décision est candidat, et si un humain doit lire la sortie, un LLM reste préférable. Les usages cités couvrent le choix de l'outil suivant dans un agent, le routage de requêtes vers des modèles plus ou moins coûteux, le tri de tickets et d'alertes de sécurité, les garde-fous anti-jailbreak, les cascades vérifiées et le remplacement du « LLM juge », déjà adopté par Arize et Langfuse, tandis que Buddy l'emploie comme barrière de CI/CD.
Le marché s'est structuré très vite. Trois semaines après Jev, Fastino Labs a publié deux modèles concurrents, GLiDE et GLiNER2.5-Decide, évalués sur 17 jeux de données de tri et de classification. Le second peut décoder ensemble des attributs liés, comme « sûreté » et « type de nuisance », pour éviter des réponses contradictoires. Des développeurs open source ont aussi publié plusieurs reproductions du principe de Jev. Vercel cite le choix d'outils parmi les usages principaux, et Simon Willison range le tri de spams et la suggestion d'étiquettes parmi les cas naturels de classification. Cette ruée reflète une lassitude face aux étapes fragiles de génération de texte suivie d'analyse JSON dans les systèmes d'agents. Reste à voir si la calibration annoncée tient en production et si ces petits modèles spécialisés s'imposeront comme couche de contrôle, laissant les grands modèles aux tâches de rédaction et de raisonnement.
Pas d'impact direct sur la France/UE
Selon Le Fil IA, le vrai gain des modèles de décision n'est pas la vitesse, c'est qu'ils sortent le LLM de la boucle quand le code n'a besoin que d'un choix borné. Jev fait 67,8 % pour 0,0004 dollar, là où Sonnet 5 fait pareil pour 0,1174. Bon, sur le papier. Les étiquettes de référence viennent de GPT-6 Astra et Claude Fable 5.1, et le meilleur modèle reste 6,3 points devant. Le « LLM juge » et le routage d'agents, c'est le genre de truc qu'on attendait pour arrêter de parser du JSON à la main. Reste à voir si la calibration tient en prod.