微软发布了其第一个专用网络安全模型,名为 MAI-Cyber​​-1-Flash,并将其插入 MDASH,这是一种漏洞搜寻系统,据称该系统击败了 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6 Sol,同时成本比微软当前最佳 MDASH 配置低 50%。

据微软称,组合设置在 Cyber​​Gym 上的得分为 95.95%。 Cyber​​Gym 是一个基准测试,要求人工智能代理重现 188 个开源项目中的 1,507 个已知漏洞,然后根据在受控环境中成功重现的百分比对其进行评分。

这使得 MDASH 领先于 GPT-5.5 Cyber​​(85.6%)、Mythos 5(83.8%)、GPT-5.6 Sol(83.6%)和 Gemini 3.5 Flash Cyber​​(83.2%)。结果是由微软自行报告的,尽管该基准测试使用了公共测试集和定义的成功指标,但在发布时尚未出现在 Cyber​​Gym 的公共排行榜上。

MAI-Cyber​​-1-Flash 不能单独工作。微软表示它可以处理高达 90% 的任务,而 MDASH 将最难的 10% 路由到 GPT-5.4。这很重要,因为每次模型读取代码或生成答案时,令牌(人工智能处理的文本块)都会花费金钱。

这是第一次,为提高效率而构建的 Microsoft 模型能够击败考虑到通用功能而构建的密集最先进模型。微软首席执行官 Satya Nadella 写道:“与 MDASH 结合使用时,(MAI-Cyber​​-1-Flash) 可以以领先型号 50% 的成本提供世界一流的性能。”

今天,我们宣布了一系列更新,以一半的成本为客户提供前沿级的安全性。

MAI-Cyber​​-1-Flash 是我们的第一个网络安全模型,旨在发现复杂代码库中最具挑战性的漏洞。与 MDASH 结合使用时,它...... pic.twitter.com/npcIihN1H7

— 萨蒂亚·纳德拉 (@satyanadella) 2026 年 7 月 27 日

模型(在本例中为 MAI-Cyber​​-1-Flash)是对代码进行推理的 AI。线束(在本例中为 MDASH)是围绕它的机器:代理、工具、检查和工作流程,用于决定在哪里查找、质疑可疑的发现、删除重复项以及证明可以触发错误。

MDASH 使用 100 多名指定的专业代理来审计代码,辩论发现的结果是否真实,并建立概念证明 - 缺陷存在的有效证明。

微软表示,随着人工智能使错误发现变得更便宜,偶尔的扫描和延迟的补丁正在变得过时。该公司辩称,数十年的安全数据为其带来了优势,并补充说,“没有人可以创造这段历史。”

自从 Claude Mythos 发布以来,网络安全专家一直在试图击败或匹配其功能。研究人员使用公共模型重现了神话式的漏洞搜寻,每次扫描费用不到 30 美元。参与研究的研究人员之一 Dawid Moczadło 表示,“护城河正在从模型访问转向验证。”

稀缺的部分是成为一个能够证明研究结果而不让开发人员陷入误报的系统。

Decrypt 还报道称,GPT-5.5 Cyber​​ 最近以 85.6% 的分数领先于公开的 Cyber​​Gym,以微弱优势击败了 Mythos。微软的得分比 GPT-5.5 Cyber​​ 高出约 10 分,比 MDASH 之前的成绩高出 7.5 分,但它评估的是整个系统,而不是 MAI-Cyber​​-1-Flash 本身。

Microsoft 正在通过 Defender 门户中的 Microsoft Security Exposure Management 将 MDASH 置于私人预览版。客户可以扫描 Git 存储库,查看从不太可能到已证实的结果排序,并使用 Defender CLI 生成建议的代码修复供开发人员审查。

目前,预览版将存储库限制为大约 256MB,并允许每个租户进行一次并发扫描。 Project Perception 预计将相同的多代理方法从代码扫描扩展到更广泛的威胁监控和修复工作流程。