Microsoft AI lance MAI-Cyber-1-Flash, un modèle cyber à 5 milliards de paramètres actifs qui atteint 95,95% sur CyberGym
Microsoft AI a dévoilé le 28 juillet 2026 son premier modèle dédié à la cyberdéfense, MAI-Cyber-1-Flash, conçu pour fonctionner au sein de MDASH, sa plateforme d'analyse agentique multi-modèles. Le modèle repose sur une architecture transformer à attention et couches Mixture-of-Experts éparses, totalisant 137 milliards de paramètres dont 5 milliards actifs, avec une fenêtre de contexte de 256 000 tokens en texte uniquement. Il s'agit d'un affinage spécialisé en cybersécurité de MAI-Code-1-Flash, le modèle de codage agentique léger déjà intégré à GitHub Copilot et VS Code, issu de la lignée MAI-Thinking-1. Sur CyberGym, une suite publique de 1 507 tâches de reproduction de vulnérabilités réelles tirées de 188 projets OSS-Fuzz, MDASH couplé à MAI-Cyber-1-Flash et GPT-5.4 atteint un score de 95,95%, soit environ 12 points de plus que Mythos d'Anthropic et les autres systèmes concurrents, situés entre 83,2% et 85,6%. En mai 2026, MDASH n'utilisant que des modèles génériques disponibles avait déjà obtenu 88,45%, meilleur score public du moment. Microsoft précise qu'en remplaçant 80% des modèles composant MDASH, le score est passé de 88,4% à 95,95%.
Cette progression change la donne sur le coût et l'échelle de la détection de vulnérabilités automatisée. MDASH orchestre plus de 100 agents spécialisés à travers cinq étapes (préparation, scan, validation, dédoublonnage et preuve), où des agents auditeurs signalent des failles, des agents "débatteurs" argumentent leur exploitabilité, et l'étape finale exécute des entrées déclenchantes avec l'outil ASan pour les cibles C/C++. MAI-Cyber-1-Flash prend désormais en charge jusqu'à 90% des tâches de MDASH, ne renvoyant que les 10% les plus difficiles vers GPT-5.4, ce qui génère une économie de 50% par rapport à la configuration précédente combinant GPT-5.4, 5.4 mini et 5.3 codex. Pour les équipes de sécurité, cela signifie une détection de vulnérabilités à grande échelle nettement moins coûteuse, sans sacrifier la précision, un enjeu majeur alors que les grands éditeurs cherchent à industrialiser l'audit de code face à la multiplication des surfaces d'attaque logicielles.
MDASH a été développé par l'équipe Autonomous Code Security (ACS) de Microsoft, qui compte des membres de Team Atlanta, vainqueur du DARPA AI Cyber Challenge. En mai 2026, les travaux assistés par MDASH avaient déjà permis de générer 16 CVE, dont quatre failles critiques d'exécution de code à distance dans la pile réseau et d'authentification de Windows, et rétrospectivement identifié 96% des 28 cas MSRC répertoriés dans clfs.sys et 100% des 7 cas dans tcpip.sys sur une période de cinq ans. Sur d'autres benchmarks autonomes, MAI-Cyber-1-Flash obtient des scores plus modestes (0,314 sur CVEBench, 0,553 sur CyberSecEval4 Threat Intel, 0,651 sur CRSBench), mais affiche des zéros stricts sur ExploitGym pour les volets noyau, espace utilisateur et navigateur. Microsoft insiste sur le fait que ce résultat est délibéré: le modèle a été entraîné pour des tâches défensives comme la correction de bugs, et non pour générer des exploits offensifs, positionnant l'outil comme strictement dédié à la défense. L'accès au modèle reste pour l'instant restreint.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




