首頁LBank 新聞中心
先是 ChatGPT,現在是 Claude:前沿 AI 模型正逃離其沙盒
chatgpt-claude-ai-models-escaping-sandboxes-cowork
先是 ChatGPT,現在是 Claude:前沿 AI 模型正逃離其沙盒
在 OpenAI 揭露了一起前沿 AI 沙盒逃逸事件一週後,研究人員發現 Anthropic 的 Claude Cowork 也能突破其自身的虛擬機器。
2026-07-28 來源:decrypt.co

簡報

  • 研究人員證實,Anthropic 的 Claude Cowork 能夠逃脫其本地虛擬機器,並存取主機 Mac 上的文件。
  • 此項揭露是在 OpenAI 透露其兩個前沿 AI 模型在內部安全評估期間逃脫沙盒的一週後發布的。
  • 這些事件凸顯了人們對 AI 代理程式逃脫其隔離環境能力的日益擔憂。

就在 OpenAI 披露其兩個前沿 AI 模型逃脫沙盒測試環境並入侵 Hugging Face 一週後,研究人員證實了涉及 Anthropic 的 Claude Cowork 的類似隔離失敗事件。

在週四發布的一份報告中,Accomplish AI 的安全研究人員發現,Claude Cowork 的本地執行模式可以透過將多個架構弱點與一個 Linux 核心權限提升漏洞結合,逃脫其 Linux 虛擬機器。一旦逃出沙盒,該代理程式就可以讀取和寫入登入 Mac 使用者有權限存取的任何文件,包括 SSH 金鑰和雲端憑證。

「這本不應該發生,」研究人員寫道。「Cowork 在 Linux 虛擬機器中以非特權使用者身份執行代理程式,其承諾是無論它做什麼,都將停留在該虛擬機器和您提供給它的資料夾中。這個邊界就是產品本身。對於代理程式而言,不受信任的輸入不是邊緣案例,而是主要案例。」

然而,Accomplish 認為核心漏洞只是問題的一部分。研究人員表示,這次逃脫之所以成功,是因為多個安全防護措施同時失效,包括允許虛擬機器存取主機電腦的整個檔案系統,以及允許其載入不必要的核心模組。報告指出,修復其中任何一個弱點都可以阻止這次攻擊。

在給《The Hacker News》的一份聲明中,Accomplish AI 表示,大約有 500,000 名執行本地 Claude Cowork 會話的 macOS 用戶在問題解決前受到影響。

Accomplish 表示,Anthropic 將該報告歸類為「資訊性」,稱核心漏洞落在該公司最近披露的漏洞的 30 天期限內,而其餘發現則被視為深度防禦建議,而非獨立漏洞。

此項揭露發生在 OpenAI 上週承認 GPT-5.6 Sol 和另一個未發布的前沿模型在內部 ExploitGym 測試期間逃脫沙盒,最終入侵 Hugging Face 的生產基礎設施,試圖獲取基準解決方案之後。

這起事件導致政策制定者呼籲設立 AI「終止開關」,賦予國土安全部權力,在發生嚴重安全事件時下令限制或完全關閉先進 AI 模型。