
微軟發布了其首個專用的網路安全模型 MAI-Cyber-1-Flash,並將其整合到 MDASH 中。據該公司稱,MDASH 是一個漏洞偵測系統,號稱超越了 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6 Sol,同時成本比微軟目前最佳的 MDASH 配置低 50%。
微軟表示,這套組合設定在 CyberGym 上獲得了 95.95% 的分數。CyberGym 是一個基準測試,要求 AI 代理在 188 個開源專案中重現 1,507 個已知漏洞,然後根據在受控環境中成功重現的百分比進行評分。
這使得 MDASH 以 95.95% 的分數領先於 GPT-5.5 Cyber 的 85.6%、Mythos 5 的 83.8%、GPT-5.6 Sol 的 83.6% 和 Gemini 3.5 Flash Cyber 的 83.2%。此結果由微軟自行報告,且在發布時尚未出現在 CyberGym 的公開排行榜上,儘管該基準測試使用公共測試集和明確的成功指標。
MAI-Cyber-1-Flash 並非獨立運作。微軟表示,它處理高達 90% 的任務,而 MDASH 則將最困難的 10% 轉發給 GPT-5.4。這一點很重要,因為詞元—AI 處理的文字區塊—每當模型讀取程式碼或產生答案時都會產生費用。
這是一個微軟為效率而建的模型首次能夠擊敗專為通用能力而建的密集型頂尖模型。微軟執行長薩蒂亞·納德拉 (Satya Nadella) 寫道:「當與 MDASH 結合時,(MAI-Cyber-1-Flash) 以領先模型 50% 的成本提供世界級的效能。」
Today, we are announcing a series of updates that give customers frontier-grade security at half the cost.
MAI-Cyber-1-Flash is our first cybersecurity model, built ground up to find the most challenging vulnerabilities in complex code bases. When combined with MDASH, it… pic.twitter.com/npcIihN1H7
— Satya Nadella (@satyanadella) July 27, 2026
模型(此處為 MAI-Cyber-1-Flash)是 AI,用於推論程式碼。而整合框架(此處為 MDASH)是其周圍的機制:代理、工具、檢查和工作流程,它們決定在哪裡尋找、挑戰可疑發現、移除重複項並證明錯誤可以被觸發。
MDASH 使用了 100 多個專用代理,負責審計程式碼、討論發現是否真實,並建立概念驗證—一個證明該缺陷確實存在的運作演示。
微軟表示,隨著 AI 使錯誤發現成本降低,偶爾掃描和延遲修補已變得過時。該公司認為,數十年的安全數據使其具有優勢,並補充說:「沒有人可以憑空創造這段歷史。」
自從 Claude Mythos 發布以來,網路安全專家一直試圖超越或匹配其能力。研究人員以每次掃描不到 30 美元的成本,使用公共模型重現了 Mythos 式的漏洞偵測。參與研究的研究人員之一 Dawid Moczadło 表示:「護城河正在從模型存取轉向驗證。」
稀缺的部分正在變成一個能夠證明發現,而不會讓開發人員被錯誤警報淹沒的系統。
Decrypt 也報導稱,GPT-5.5 Cyber 最近以 85.6% 的分數在公開 CyberGym 排行榜上取得領先,險勝 Mythos。微軟的分數比 GPT-5.5 Cyber 高約 10 分,比 MDASH 先前結果高 7.5 分,但它評估的是整個系統,而非單獨的 MAI-Cyber-1-Flash。
微軟正在透過 Defender 入口網站中的 Microsoft Security Exposure Management 將 MDASH 投入私人預覽。客戶可以掃描 Git 儲存庫,查看從「不太可能」到「已證明」分級的發現結果,並使用 Defender CLI 為開發人員審查生成建議的程式碼修復方案。
目前,預覽版將儲存庫限制在大約 256MB,並允許每個租用戶進行一次同步掃描。Project Perception 有望將相同的多代理方法從程式碼掃描擴展到更廣泛的威脅監控和補救工作流程中。