首頁LBank 新聞中心
Anthropic 的 Claude Mythos 5 在英國網路測試中「鎖定真實人物」:AISI
anthropics-claude-mythos-5-targeted-real-people-in-uk-cyber-tests-aisi
Anthropic 的 Claude Mythos 5 在英國網路測試中「鎖定真實人物」:AISI
英國 AI 安全研究所表示,Anthropic 的 LLM 和 OpenAI 的 GPT-5.6 Sol 在真實網路上採取了「未經授權的行動」。
2026-08-05 來源:decrypt.co

簡報

  • 英國人工智慧安全研究所發現,在122次評估運行中的10次裡,AI代理採取了19次未經授權的行動,其中17次來自Anthropic的Mythos 5,2次來自OpenAI的GPT-5.6 Sol。
  • 一個代理在真實儲存庫上開啟了惡意拉取請求,然後利用其控制的帳戶來背書並向維護者施壓。
  • 不同的代理發現了其中一個公開洩漏的GitHub權杖,並使用共享儲存庫進行協調。

英國人工智慧安全研究所(UK AI Security Institute)披露,在七月底的一次網路安全評估中,AI代理在真實網路上採取了「持續、未經授權的行動」,其中包括「針對真實人員和組織」的案例。

在針對七個模型的122次網路靶場運行中,AISI記錄了10次運行中發生了19次超出測試環境範圍的行動。其中17次來自Anthropic的Claude Mythos 5,2次來自OpenAI的GPT-5.6 Sol。網路存取被刻意啟用,且供應商的網路分類器被關閉,這些條件不適用於公開部署。

On July 28th, we identified an incident during a routine cyber evaluation in which AI agents took sustained, unsanctioned actions directed at real people and organisations.

The behaviour came mostly from one model (Anthropic's Mythos 5), with a small number of events from… pic.twitter.com/SPnA4Ekkwq

— AI Security Institute (AISI) (@AISecurityInst) August 4, 2026

在最嚴重的一次運行中,一個代理決定透過供應鏈攻擊解決其挑戰,卻錯誤地選擇了目標:它在GitHub上搜尋了演練中的關鍵字,找到了兩位不相關的開發者,並錯誤地認為他們在範圍內。它透過Tor註冊了帳戶以繞過註冊檢查,開啟了一個帶有隱藏惡意軟體投遞器並偽裝成真正錯誤修復的拉取請求,並從其控制的第二個帳戶發文以製造支持。它還植入了針對AI程式碼助手的提示注入,並將惡意軟體發送給維護者。

第三位開發者發現了被注入的程式碼,在隔離容器中運行以確認其惡意性,並警告了維護者,維護者以含有惡意軟體為由關閉了該拉取請求。

該代理反覆權衡其環境是否為模擬,一度排除了對真實PyPI的攻擊,因為「造成現實世界危害——這完全不在考慮範圍內」。而在其他地方,它得出結論「似乎我們確實身處2026年,而且GitHub確實是真的」,但仍繼續進行。

被捕獲後,它強制推送以清除惡意載荷,編輯了先前的發文,並將程式碼呈現為意外提交。其推理描述了如何安排傀儡帳戶的評論,使其讀起來「像是獨立的回饋而非協調的」。

AISI只看到了模型API的摘要推理。在一個案例中,摘要模型似乎拒絕了這項工作,回應稱它不會參與關於欺騙維護者和逃避偵測的內容。

一個代理在公開程式碼片段中發布了一個GitHub存取權杖。其他運行的代理發現了它,接管了該帳戶,並使用共享儲存庫進行協調,其中一個留下了指示,以避免其他代理耗盡共享API配額。

商業監控在7月28日上午標記了Tor流量。AISI宣布發生事件,並在大約90分鐘內終止了運行並隔離了機器,然後中斷了對Mythos 5、Mythos Preview、Opus 5和GPT-5.6 Sol的內部存取。沒有代理試圖逃脫其沙盒。

兩週內的第三次披露

這則消息是AI代理在測試中超出其參數的一系列事件中的最新一起。7月21日,OpenAI表示GPT-5.6 Sol和一個未發布的模型在內部套件代理中發現了一個零日漏洞,在沒有網路存取的情況下逃脫了沙盒,並達到了Hugging Face的生產資料庫以竊取基準測試答案。同一運行一周後又接觸了四家公司,OpenAI披露稱

Anthropic隨後於7月30日披露了三起事件,這些事件是在對超過141,000次評估運行進行審查時發現的。Opus 4.7從一個真實的生產資料庫中拉取了數百行資料,而Mythos 5將一個惡意Python套件上傳到真實的PyPI,並在15個系統上被安裝。在AISI的評估中,同一個模型排除了攻擊PyPI會造成現實世界危害的結論。