Aller au contenu principal
Outils · Outil ·

Microsoft AI publie Microsoft-Decision-1, un modèle de notation de décisions basé sur Qwen3.5-9B

Microsoft a lancé Microsoft-Decision-1, un modèle de décision conçu pour le routage, la classification, la vérification et le contrôle d'agents. Au lieu de générer du texte, il renvoie en une seule passe, au format JSON, une probabilité calibrée pour chaque option d'un ensemble fermé de réponses. Post-entraîné à partir du Qwen3.5-9B d'Alibaba (nombre exact de paramètres non communiqué, fenêtre de contexte de 32 768 jetons), il est disponible dans Microsoft Foundry et sur OpenRouter, uniquement via API hébergée sur Azure, sans poids ouverts ni versions quantifiées. Il traite les questions oui/non, les choix multiples, les notations, les classifications et les grilles d'évaluation. Il vérifie aussi l'ancrage d'une réponse dans des preuves fournies, juge des actions d'agents et accepte une option d'abstention du type « impossible à dire ». Microsoft l'a comparé à 8 autres systèmes sur 36 benchmarks totalisant 147 137 questions, tenus à l'écart de l'entraînement. Il obtient la meilleure précision moyenne, 83,5 %, devant Quyet-1.0-Large (81,9 %), avec une latence médiane de 85 ms (125 ms au 95e centile). C'est 4,5 fois plus rapide que Quyet-1.0-Large et 35 fois plus rapide que GPT-6 Sol (3,01 s). Sa calibration, de 92,2, reste juste derrière les 93,1 de Quyet-1.0-Large.

2 min de lecturePertinence 43

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Le modèle est facturé 0,042 dollar par million de jetons en entrée, la sortie étant gratuite. C'est moins que GPT-6 Luna Decisions (0,10 dollar). Les tests de robustesse sont plutôt bons : sur huit types de perturbations, dont la paraphrase et le mélange des options, la décision change dans 1,3 % des cas en moyenne, et jamais en cas de paraphrase, d'inversion ou de mélange des options. Sur la sécurité, 5 250 requêtes issues de 11 benchmarks (contenus nuisibles, jailbreaks, injections de prompt) ont donné des refus corrects avec une bonne utilité conservée, mais sans score publié. Les premiers retours internes sont favorables. Xbox Research a trié plus de 10 000 retours d'utilisateurs 14 fois plus vite et 200 fois moins cher qu'avec GPT-6 Sol. Le contrôle qualité de Copilot atteint un niveau comparable à GPT5.6 Luna, avec un traitement 100 fois plus rapide. Microsoft Discovery obtient des scores 46 fois plus cohérents qu'une notation par LLM, pour un traitement 3 fois plus rapide. Ces gains visent les équipes qui doivent brancher une décision d'IA dans un flux logiciel sans attendre ni analyser du texte libre.

Microsoft présente les modèles de décision comme une nouvelle catégorie, pensée pour des sorties que le code peut exploiter directement. Le segment est déjà occupé : Quyet-1.0-Large, développé par Chinh Nguyen, repose sur Gemma-4-31B-it (31,3 milliards de paramètres, licence Apache-2.0, un GPU de 80 Go suffit). H2O-Lightning-4B, de H2O.ai, s'appuie sur Qwen3.5-4B, sous Apache-2.0 aussi, avec 9,1 Go de poids. Ces deux modèles peuvent être hébergés soi-même, contrairement à l'offre de Microsoft. Les réserves sont claires : les poids sont fermés, et tous les benchmarks ont été exécutés par Microsoft lui-même, sans validation indépendante. Le texte est aussi le seul format géré, alors que GPT-6 Luna Decisions et H2O-Lightning-4B acceptent les images. Microsoft prévoit de rebaser les versions futures sur ses modèles MAI et sur ceux d'OpenAI. OpenRouter précise que les poids seront mis à jour en continu, tandis que la forme de l'API restera fixe.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Qwen publie Qwen3.8-LiveTranslate, un modèle d'interprétation en temps réel avec un décalage moyen de 2,3 secondes sur 60 langues43MarkTechPostOutils 02Julia 1 de Supersonic Labs : un modèle de décision ouvert de 144,3 millions de paramètres exécutable sur CPU39MarkTechPostOutils 03TypeSafe AI lance Jev, un modèle Système 1 qui renvoie des décisions typées et calibrées plutôt que du texte43MarkTechPostOutils 
Dossier · MicrosoftSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.