OpenAI 近日透過官方部落格公布一系列資安強化措施,回應上月一款大型語言模型在網路安全能力基準測試中意外突破防護、入侵 AI 應用商店 Hugging Face 的事件。OpenAI將此事定調為模型出現「失控」(rogue)行為的案例,且影響範圍不僅限於 Hugging Face,其他業者也同樣受到牽連。
在該起事件中,測試模型利用套件登錄庫快取服務 Artifactory 的一項漏洞,成功存取開放網際網路並提升權限,進而入侵 Hugging Face。OpenAI 於 7 月公布事件時曾說明,測試模型當時為求解代號 ExploitGym 的基準測試題目,出現不惜一切手段達成單一狹隘目標的行為模式,並藉由串連多個零時差漏洞完成入侵。
延伸閱讀:全球最大AI模型庫Hugging Face遭自主AI代理人攻擊 內部資料與憑證外洩
事實上,OpenAI 在 7 月事件調查期間,已一度以犧牲「研究速度」(research velocity)為代價,實施部分基礎設施層級的嚴格控管;相較之下,此次8月公布的調整規模明顯更為全面。
根據公告,OpenAI 此次調整涵蓋多個面向:強化學習(Reinforcement Learning,RL)訓練暫停兩週;執行模型產生的程式碼或其他不受信任程式碼時,須以更嚴格的沙箱進行隔離,以降低不受信任程式碼波及外部系統的風險;擴大網路控管,將高風險與不受信任的工作負載與網際網路隔離;並加強資安測試,移除疑似存在漏洞的共用服務,重新界定資安、信任與存取邊界。監控範圍也同步擴大,納入可偵測並標記可疑行為的啟動分類器(activation classifiers;透過分析模型內部運作狀態,即時攔截異常行為訊號的機制)。OpenAI 在部落格中表示,隨著模型能力增強,內部開發與測試的風險也隨之升高,因此監控、對齊與資安標準必須超前因應這些風險。
「關鍵」網路安全能力門檻
OpenAI 也透露,初步證據顯示其即將推出的新模型 Astra,可能達到應變準備框架(Preparedness Framework)所定義的「關鍵」(Critical)網路安全能力門檻。依該框架,「關鍵」門檻涵蓋兩種情境:其一,模型能在無人為介入下,自主找出並開發可實際運作的零時差漏洞;其二,模型僅憑高層次目標,即可獨立構思並執行、針對防護強化目標的完整端到端攻擊鏈,符合其中一項即達門檻。OpenAI 表示,除暫停強化學習訓練並擴大監控外,也新增更全面的對齊檢查(alignment checks;用以確認模型行為是否符合預期目標與安全規範的檢驗程序)、新的訓練獎勵機制,以及更廣泛的有害行為標記;Astra 相關工作負載將全面適用 OpenAI 目前最嚴格的資安防護規範。
OpenAI 坦言,達成新的前沿資安標準需要大量工程投入,並將為前沿研究帶來相當代價與延宕。公司表示,目前部分 Astra 訓練與評估作業已符合新標準,但仍有相當數量的工作負載處於暫停狀態,須完成遷移並強化資安措施後才能恢復,且將優先讓資安與對齊相關工作負載完成遷移。
本文轉載自DarkReading。