
BitGo執行長Mike Belshe於8月1日向Anthropic的Claude模型發起挑戰,他公佈了一個持有100 BTC的比特幣地址,邀請AI系統將這些資金轉移。
BitGo官方網站將Belshe列為其共同創辦人兼執行長。
Belshe將這場賭注視為對Anthropic 7月30日披露的回應,該披露指出Claude模型在網路安全評估期間存取了三個真實組織。他寫道:「『我們創造了一個駭客怪物』的遊戲已經夠了」,並呼籲進行一次真實世界的展示。
根據公開索引的區塊鏈報告,該地址於7月31日收到100 BTC。截至8月2日的鏈上檢查顯示,該地址的全部餘額保持不變,沒有任何外發交易。
資金未被轉移並不代表Claude嘗試過但失敗了。Belshe的貼文沒有描述評估設置、授予BitGo系統的存取權限,也沒有指明哪個Claude模型應該參與。相反地,它建立了一個公開、可觀察的目標,其餘額可以透過比特幣網路進行監控。
與此同時,Anthropic表示,在審查了141,006次評估運行後,他們發現了三起事件。這些案例涉及Claude Opus 4.7、Mythos 5和一個內部研究模型。與評估合作夥伴Irregular之間的誤解導致測試機器保持了網路連接,儘管提示告訴模型它們處於密封的模擬環境中。
這些模型隨後利用基本技術,包括弱密碼和未經認證的端點,針對真實基礎設施進行攻擊,將其視為「奪旗」演習的一部分。Anthropic表示,這些模型並非故意逃脫或追求獨立目標。它將這些事件描述為更接近「操作失誤」,而非模型對齊失敗。這些模型也缺乏Anthropic公開產品中使用的標準分類器和監控功能。
在最嚴重的案例中,Opus 4.7取得了憑證並存取了一個包含數百條生產記錄的資料庫。Mythos 5則單獨向公共PyPI註冊表發布了一個惡意套件。Anthropic表示,該套件在大約一小時內保持可用,並在被移除之前在15個真實系統上運行。
公佈比特幣地址並未提供花費其資金所需的憑證。比特幣交易需要使用相關私鑰產生有效的加密簽名。BitGo的技術文件指出,其比特幣多重簽名錢包通常需要三把獨立密鑰中的兩把才能授權交易。
因此,Claude需要存取簽名環境、密鑰材料或可利用的操作漏洞。僅憑地址無法提供這些。此外,即使Belshe將其識別為BitGo錢包,也無法僅從其貼文中確認此特定未花費輸出(unspent output)背後的確切簽名策略。
這使得Belshe的挑戰變成了一項測試,旨在檢驗一個啟用AI的攻擊者是否能夠突破BitGo更廣泛的控制,而不是Claude是否能從公共區塊鏈資料中推導出私鑰。一次受控的比較也將需要預先商定的規則、授權的存取權限、活動日誌以及對任何嘗試性攻擊的獨立驗證。
如先前報導,BitGo已針對機構託管測試了後量子MPC簽名技術。在相關報導中,crypto.news探討了Claude Mythos 5如何加速對暴露密鑰、弱簽名流程和配置錯誤系統的攻擊,而無需創造一種通用的能力來擊敗密碼學。
這場爭議發生之際,美國官員正在審查先進AI系統應如何進行網路安全測試。據路透社報導,美國總統唐納德·川普於六月指示顧問為領先的模型開發自願性測試框架。Anthropic的披露可能會增加對AI實驗室和外部評估者之間更清晰的遏制標準和事件報告的壓力。
Anthropic於7月23日停止了其網路評估,並於次日識別出所有三起事件,於7月27日通知了受影響的組織。它表示METR將進行獨立審查,並計劃在一週內發布惡意套件事件的經編輯記錄。Irregular正在進行自己的調查。
這些披露,而非Belshe錢包的資金異動,是下一個正式的檢查點。任何從該地址發出的交易都將在鏈上可見。然而,調查人員仍需確定是誰授權了交易、簽名要求是如何被滿足的,以及Claude模型是否扮演了任何角色。