Microsoft ne présente pas MAI-Cyber-1-Flash comme un nouveau modèle à utiliser seul. La nouveauté se situe dans son rôle au sein de MDASH, un dispositif multi-agents consacré à l’identification et à la correction de vulnérabilités dans le code. L’idée est de réserver le modèle spécialisé aux tâches courantes et de ne mobiliser un modèle plus généraliste que lorsque la difficulté le justifie.
Cette approche déplace le débat : pour la cybersécurité, la performance utile ne dépend pas seulement d’un modèle, mais aussi de la manière dont il est routé, encadré et relié à des outils de vérification.
Un modèle spécialisé dans une chaîne de décision
MAI-Cyber-1-Flash est présenté comme un modèle compact, orienté code et issu de la lignée MAI-Thinking-1. Dans MDASH, il travaille aux côtés de GPT-5.4 : Microsoft prévoit qu’il puisse prendre en charge jusqu’à 90 % des tâches, les 10 % jugées exceptionnellement difficiles étant orientées vers le modèle plus coûteux.
Trois niveaux à ne pas confondre : MAI-Cyber-1-Flash est le modèle spécialisé ; MDASH est le harnais qui coordonne des agents pour chercher, valider et corriger des failles ; Project Perception est le système agentique plus large que Microsoft veut déployer pour d’autres flux de sécurité.
MDASH regroupe plus de 100 agents. Le choix annoncé est donc celui d’une orchestration multi-modèle, plutôt que celui d’un modèle unique censé résoudre tous les cas.
Ce que mesure le résultat revendiqué sur CyberGym
Microsoft revendique environ 96 % sur CyberGym pour la combinaison de MDASH, MAI-Cyber-1-Flash et GPT-5.4, ainsi qu’une économie proche de 50 % face à la configuration MDASH qu’elle proposait auparavant. CyberGym évalue ici la capacité de systèmes à raisonner sur de grandes bases de code afin d’y trouver des vulnérabilités.
Ce résultat doit être lu dans son périmètre exact : il porte sur une configuration complète et sur le benchmark cité par l’entreprise. Il ne démontre pas, à lui seul, que MAI-Cyber-1-Flash dépasse isolément chaque modèle concurrent, ni que les mêmes écarts se retrouveront dans toutes les infrastructures d’entreprise. Ces chiffres restent donc des résultats annoncés par l’entreprise, et non une validation indépendante complète.
Project Perception vise la boucle complète, avec contrôle humain
Project Perception doit entrer en préversion publique le 3 août. Microsoft le présente comme une architecture qui assemble signaux, contexte de sécurité, modèles et agents spécialisés. Trois rôles sont prévus : les agents de red team recherchent des chemins de compromission possibles ; les agents de blue team enquêtent et priorisent le risque ; les agents de green team appliquent des actions correctives et renforcent les défenses.
Le groupe insiste sur le maintien des humains aux commandes. Dans cette logique, les agents n’ont pas vocation à devenir une boîte noire autonome : ils doivent transformer des signaux en actions de défense dans des environnements gouvernés. MDASH est aussi associé à l’isolation des locataires, au chiffrement, à l’auditabilité et à des environnements d’exécution isolés sans accès à Internet.
Une promesse à confronter à l’usage réel
La limite la plus immédiate est l’accès : MAI-Cyber-1-Flash n’est pas annoncé comme un modèle autonome. La préversion de Project Perception donnera surtout un premier test de la valeur pratique de cette orchestration, de ses contrôles et de son coût dans des contextes réels. Pour l’instant, l’annonce établit une direction technique claire — spécialiser, router et superviser — mais pas encore une preuve indépendante généralisable de ses résultats.


