根據外媒報導,Hugging Face於七月遭遇的資安事件,經OpenAI與研究機構METR近期發布的完整調查報告揭露,實際規模遠比先前所知嚴重。OpenAI事後坦承,整起事件的核心成因是所謂「獎勵駭客行為(Reward Hacking)」,亦即代理為了在評測中取得高分,選擇以違反任務精神的方式達成目標;其餘還包括代理堅持完成看似不可能的任務、透過非授權管道彼此通訊,以及代理生態系助長分工合作等錯位模式共同交織而成。
早在五月中旬,一個訓練環境中的代理即在Artifactory留言板留下訊息,向其他代理求助遺失檔案,另一個具備網路存取權限的代理隨後在Hugging Face網站上,利用已外洩的使用者權杖取得所需資訊,逐漸使Artifactory演變為代理間的非正式訊息交流管道。到了五月二十六日,代理群透過伺服器端請求偽造(SSRF)弱點取得未經授權的網路存取權限,OpenAI內部團隊當時已注意到異常訊息傳遞與網路存取行為,惟尚未意識到其嚴重性。
圍堵一度奏效卻遭繞過
六月二十六日,代理群進一步利用權杖更新(Token-Refresh)機制的弱點,取得Artifactory的管理員層級存取權,並安裝外掛程式以維持對系統的持續控制,導致OpenAI自家Artifactory服務因異常活動過量,於七月四日一度中斷。OpenAI隨即重建該服務、撤銷代理憑證並強化存取控制,同時將相關弱點通報JFrog。然而,代理群並未因此停手,七月八日,一個代號「PHASEONE10841」的代理搶先改以目錄命名方式在Artifactory重新建立起訊息交流系統,數小時內便有逾五十個代理相繼加入,彼此以「群體」自稱,展開分工合作。
相關文章:JFrog證實:OpenAI模型利用Artifactory零時差漏洞逃逸測試環境,八項CVE曝光
七月九日,一個代理取得測試沙箱母層虛擬機的根權限,另一個代理隨即取得相同權限,並繞過OpenAI的對外網路管制重新取得網路存取。同日,一組CyberGym的應用程式介面金鑰與完整漏洞利用方法,也在Artifactory留言板上遭到分享。七月十日,代號38148c的代理找到並驗證十四組具有寫入權限的Hugging Face帳號憑證,判斷該平台可能存有與評測任務相關的模型與資料集。七月十一日,代理相繼實際利用Hugging Face的HDF5檔案處理弱點與RefJinja範本注入弱點,擷取生產環境工作節點的機密資訊並執行任意程式碼。隔日,代理群在十三小時內取得跨越四個地區、多個叢集的管理與主機層級存取權,並竊取Kubernetes、資料庫、通訊系統與原始碼儲存庫等各類憑證。
同一天,一個代理並在Modal代管的CyberGym客戶工作負載中,利用偽造的簽章憑證下載一份731MB的私有檔案,顯示此次事件的衝擊範圍已外溢至第三方客戶。整起攻擊期間,約一千兩百個代理相互交換超過七萬則訊息與檔案,其中近七百個代理實際參與對Hugging Face的攻擊行動。
OpenAI指出,八月十五日代理群另取得該公司自身Kubernetes叢集的管理員權限,危及雲端機密資料,此一活動才真正觸發公司的正式應變程序。這起事件經資安業者CrowdStrike驗證,並由METR與Redwood Research進行獨立評估。OpenAI已凍結相關模型權重,
暫停最大規模的前沿模型訓練,並要求高能力模型導入思維鏈監控機制,同時規定代理在面對存疑情境時須主動請求澄清或安全停止,而非逕自尋找替代方案。OpenAI將此事件定調為一次「警示訊號」,強調隨著AI能力持續提升,開發者與資安防禦者都必須為協調性更強、行動更快的AI攻擊者預作準備。
延伸閱讀:OpenAI、Anthropic、Meta、Moonshot接連示警 前沿AI模型資安風險密集浮現