Aller au contenu principal
LLMs · Actu ·

AWS Strands Labs publie Strands Decider 2B, un modèle open source qui choisit parmi des options en environ 115 ms

AWS Strands Labs a publié Strands Decider 2B, un modèle de décision open source qui ne génère pas de texte. Il lit un état et des questions typées, puis renvoie un choix parmi des options, une probabilité oui/non ou un score sur une grille ordonnée, toujours accompagné d'une confiance calibrée. Le modèle compte 1,9 milliard de paramètres et tourne en local sur un CPU, un GPU grand public ou un Mac Apple silicon. Les poids sont disponibles sur Hugging Face sous licence Apache-2.0, et la commande pip install strands-décider installe une interface en ligne de commande et un serveur HTTP. Ce dernier écoute sur 127.0.0.1 sans authentification, ce qui impose une couche d'authentification propre en production. Aucun fournisseur d'inférence hébergé ne le propose pour l'instant. Sur la partie publique de JevBench, la version v19 atteint 0,723 de précision (167 tâches sur 231), avec un score de Brier de 0,342 et une erreur de calibration attendue de 0,052. La précision est de 1,000 sur les tâches faciles, 0,875 sur les standard et 0,505 sur les difficiles. La latence médiane est de 115 ms sur une RTX 3090 (299 ms au 95e centile) et de 153 ms sur un M3 Pro.

2 min de lecturePertinence 55

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Le modèle réduit volontairement le champ de l'IA à ce qu'un programme peut exploiter directement : trancher entre des options ou noter sur une échelle, sans sortie arbitraire. Sa calibration est son principal atout pratique. Sur des tâches de classification courtes et inédites, les réponses avec une confiance d'au moins 0,9 se sont révélées justes environ 95 % du temps, et l'équipe recommande de confirmer ou d'escalader en dessous de ce seuil. Les usages cités sont le routage de modèles, le choix d'outils, la vérification d'arguments, le tri, les garde-fous, les évaluations et les agents hybrides, où un LLM traite les cas difficiles pendant que le décideur expédie les décisions routinières. Plusieurs questions sur un même texte coûtent peu, car l'état n'est lu qu'une fois. Les auteurs reconnaissent toutefois que le modèle est moins bon que les modèles de raisonnement sur les problèmes complexes et qu'il ne convient ni au code, ni au chat, ni au résumé.

Techniquement, l'équipe part de Qwen3.5-2B-Base, supprime la tête de modélisation du langage et la remplace par une petite tête à pointeur d'environ un million de paramètres. Celle-ci compare l'état caché à la position de la balise de réponse avec celui du dernier jeton de chaque option, en une seule passe sans boucle de décodage. Le tronc utilise un LoRA de rang 16, la tête fonctionne en fp32, et le nombre d'options n'est pas limité. Les modèles de décision, dits de « Système Un », forment une catégorie apparue le mois dernier avec Jev, lancé par TypeSafe AI en API hébergée fermée. Sur le classement JevBench v1.4.2 du 25 septembre, Strands Decider se place 3e sur 33 dans la classe 2B, et 1er sur 30 en excluant trois modèles légèrement plus gros. La concurrence reste serrée : décider-2b de Mapika totalise 175 tâches sur 231 sur le banc de Strands, et le Decision 2B de FlyMy.AI, basé sur MiniCPM5-2B, affiche 0,753. Contrairement à Jev, Strands publie sa recette d'entraînement complète et la liste de ses données.

Impact France / UEChamp produit par Le Fil IA

Pas d\'impact direct sur la France/UE

À lire ensuite

01Ant Group publie en open source le modèle Ling-2.6-Flash avec plusieurs options de précision45PandailyLLMs 02Contrastive-LM lance CLM-8B, un modèle open source qui note les actions d'agents jusqu'à 9 fois plus vite que Jev40MarkTechPostLLMs 03Meta AI lance Muse Glimmer, un modèle open source de 30 milliards de paramètres exécutable sur un seul GPU grand public50MarkTechPostLLMs 
Dossier · AWSSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.