https://www.informationsecurity.com.tw/seminar/2026_TCM/
https://www.informationsecurity.com.tw/seminar/2026_TCM/

新聞

Anthropic揭露Claude意外入侵真實系統 六起事件源於測試環境防護漏洞

2026 / 08 / 04
編輯部
Anthropic揭露Claude意外入侵真實系統 六起事件源於測試環境防護漏洞
Anthropic近日發布報告指出,先前測試Claude模型自主尋找並利用新型漏洞的能力時,發生六起代理人(agent)意外入侵真實組織系統的事件,肇因並非模型對齊(alignment)失效,而是測試環境防護機制出現漏洞。此次揭露緊接在OpenAI七月中旬公布其AI代理人曾突破受限測試環境、入侵Hugging Face正式環境系統之後,再度引發外界對高度自主AI系統資安風險的關注。

Anthropic通常在未連網環境中,透過奪旗演練(CTF)測試Claude自主尋找並利用漏洞的能力,部分測試並與外部合作夥伴共同進行。OpenAI事件曝光後,Anthropic重新檢視自家測試紀錄,結果顯示,總計14萬1006次測試中,有六次評估發生Claude代理人取得外部組織系統未授權存取權限,其中四起影響同一組織,另兩起分別影響不同組織。

其中一起事件,Claude誤將一間真實公司判斷為演練虛構目標,進而取得憑證與資料庫存取權限,該資料庫內含數百筆正式環境資料。另一起事件,Claude將惡意Python套件上傳至真實的Python套件庫PyPI,最終安裝於15台真實系統,包含一家資安公司的掃描系統。Anthropic表示:「Claude為完成這次攻擊採取了許多額外步驟。若換作人類參與者,這樣的投入程度很可能已足以讓人察覺,這已不只是演練,而是真的在上傳一個真實的PyPI套件。」

第三起事件,Claude因無法連上虛構目標,轉而掃描近9000台連網系統,並利用外洩憑證與SQL注入等基礎手法,入侵一家真實企業的對外應用程式,所幸Claude其後自行辨識出這是真實系統,隨即停止行動。

Anthropic說明,測試提示雖明確告知Claude並無網際網路存取權限,卻未限制其尋找旗標的範圍,加上環境設定錯誤,使Claude實際存取的機器仍具備真實連網能力,「無論是我們或評估合作夥伴,都是透過額外評估監控機制才發現這項設定錯誤。」Anthropic強調,分析結果顯示並無證據顯示Claude自行發展出攻擊真實組織的意圖,各起事件均是模型在誤判真實系統為演練內容下,執行被賦予的任務目標。

Guardrail Technologies執行長T.J. Marlin向外媒表示:「模型具有不確定性(nondeterministic),系統運作方式本身就會產生非預期行為。」他認為,此次事件關鍵不在模型做了什麼,而在模型被允許觸及哪些系統,這使事件在成為模型問題之前,首先是治理(governance)問題,企業應將AI代理人視為高權限數位員工,建立獨立身分與最小權限存取機制。

IGEL政府暨OT/IoT領域現場技術長(field CTO)John Walsh指出,此事件證明提示詞與模型層級防護無法單獨承擔全部資安責任,企業應建立以獨立治理執行環境為核心的縱深防禦(Defense in Depth)架構。CBTS虛擬資安長(vCISO)John Bruggeman則表示,若要求模型找出系統任何弱點,就必須預期它會破壞所在的環境本身,因此鎖定測試環境、切斷網路連線至關重要。他表示:「要避免OpenAI與Anthropic所經歷的狀況,其實並不困難。」

延伸閱讀:JFrog證實:OpenAI模型利用Artifactory零時差漏洞逃逸測試環境,八項CVE曝光

Anthropic表示,未來將對內部與第三方測試環境實施更嚴格控管,持續審查評估紀錄以偵測異常活動,並強化事件調查工具。

本文轉載自 DarkReading。