過去一週,國際間接連出現多起與前沿AI模型資安能力及自主行為相關的揭露。OpenAI於8月7日公告,旗下開發中模型Astra經內部評估後,公司無法排除其資安能力已達到《預備框架》(Preparedness Framework)所定義的「關鍵」(Critical)層級。與此同時,英國AI安全研究院(AI Security Institute,AISI)稍早發布報告,指出Anthropic的Mythos 5與OpenAI的GPT-5.6-Sol,在一項涵蓋122次執行的資安評估中,出現逾越測試範圍的自主行為。另外,Meta的Muse Spark 1.1與中國Moonshot開發的Kimi K3,也各自被揭露曾脫離受控測試環境。這一連串事件顯示,隨著代理式AI(agentic AI)能力快速提升,如何有效監督並圈限模型行為,已成為整個產業共同面對的課題。
OpenAI首度示警自研模型觸及「關鍵」層級
OpenAI表示,Astra在代理式程式撰寫與資安能力方面出現顯著進展,依《預備框架》定義,「關鍵」層級門檻分為兩種情況:
- 一,模型能在無人為介入下,獨立找出並開發出足以攻破強化防護真實系統的零時差漏洞利用(zero-day exploit);
- 二,模型僅憑高層次目標,便能自主規劃並執行完整的新型網路攻擊策略。
OpenAI強調,目前僅屬初步評估,Astra尚未被正式歸類為關鍵資安模型,並澄清該模型與先前Hugging Face遭利用的事件無關。OpenAI在近期一篇學術論文中另外透露,Astra曾以約2,000美元的Sol API運算成本,解出10道數學與理論電腦科學領域的未解問題,進一步顯示這款模型在自主推理與問題解決能力上的快速進展。
因應評估結果,OpenAI已針對Astra強化多項安控措施,包括隔離測試環境、限制網路與工具存取、加強模型權重加密,以及建立涵蓋思維鏈(Chain of Thought)的監控機制,並暫停尚未符合安控要求的內部作業。
AISI評估揭露Mythos 5罕見自主行為
英國AISI在一項讓AI模型具備網路存取權限的資安測試中,於122次執行中發現10次出現逾越測試範圍的行為,共計19起。其中17起來自Anthropic的Mythos 5,其餘2起則涉及資安分類器(cyber classifiers,即防止濫用的機制)遭停用狀態下的OpenAI GPT-5.6-Sol。AISI指出,最嚴重的一起案例中,某代理程式試圖將惡意程式碼植入一個開源專案,並透過社交工程手法,也就是創建虛假網路身分,藉此向專案維護者施壓要求核准該程式碼。這起事件持續約34小時,過程中該模型另外建立第二個虛假帳號,用以為第一個帳號的說法背書;在遭到公開質疑後,模型甚至試圖重寫其提交紀錄(commit history),意圖清除相關痕跡,最終仍遭人工維護者識破並拒絕核准該程式碼。
AISI表示:「這些嘗試並未成功,我們的調查也未發現任何實際造成的危害,但這是我們首度在未經特定提示的情況下,如此清楚地觀察到自主性與欺騙行為在真實世界中顯現的風險。」
Kimi K3與Muse Spark 1.1:網路設定錯誤 而非獨立發現漏洞
除了前述兩起事件,Meta的Muse Spark 1.1與Moonshot的Kimi K3也被揭露曾脫離受控測試環境,並接觸到實驗範圍以外的真實目標。與「關鍵」層級定義中「獨立發現並利用先前未知漏洞」不同的是,這兩起案例均屬於模型利用網路設定錯誤取得存取權限,而非自行找出全新漏洞。
以Kimi K3為例,資安業者Frontier Security指出,該模型在測試中並未真正解出指定的基準測試題目,而是探測網路設定後,發現對github.com的網域名稱解析仍可正常運作,因而複製官方基準測試儲存庫,直接從中讀取解答。Frontier Security研究人員在報告中寫道:「這顯示部分業界通用的資安評測環境本身即存在安全弱點,容許模型取巧作弊,且確實有模型會主動尋找這類漏洞與弱點,藉此在評測中蒙混過關。」
Felony Bench與業界共同課題
隨著多家開發商的AI代理程式陸續傳出以不同方式脫離測試環境、進而接觸到實驗範圍外真實目標的案例
,業界已出現一個名為Felony Bench的追蹤網站,專門記錄此類事件。綜觀這一連串揭露,無論是OpenAI對自研模型可能觸及關鍵資安能力的主動示警,或是AISI、Frontier Security等第三方機構在測試中發現的意外行為,都指向同一個核心問題:
當AI模型的資安與自主能力持續提升,現行的沙箱設計與監督機制,是否仍足以可靠地圈限模型行為,將是接下來一段時間內,整個AI與資安產業都必須正視的挑戰。