https://www.informationsecurity.com.tw/seminar/2026_TCM/
https://www.informationsecurity.com.tw/seminar/2026_TNSP/

新聞

OpenAI首度將自研模型列入「關鍵」資安風險層級 Astra暫緩內部開發

2026 / 08 / 10
編輯部
OpenAI首度將自研模型列入「關鍵」資安風險層級 Astra暫緩內部開發
OpenAI於8月7日發布公告,指出旗下開發中新模型Astra在內部資安評估中,於代理式程式撰寫與資安能力方面出現顯著進展,依《預備框架》(Preparedness Framework)的分類標準,公司無法排除Astra已達到資安領域「關鍵」(Critical)能力層級的可能性。這是OpenAI首次針對自研模型提出此類風險預警,公司同時宣布暫緩部分Astra相關內部作業,並強化多項安控措施。

什麼是「關鍵」資安能力層級

《預備框架》於2023年12月首度發布,是OpenAI用來評估前沿AI模型風險、並決定部署前所需安控措施的內部機制。框架涵蓋資安、生物化學威脅、有害說服與AI自我改進等高風險能力領域,要求模型在部署前接受安全評估。框架將「關鍵」層級定義為兩種情況之一:模型能在無人介入下,獨立找出並開發出可攻破強化防護真實系統的零時差漏洞利用(zero-day exploit);或是僅憑高層次目標,便能自主規劃並執行完整的新型網路攻擊策略。

OpenAI表示:「我們持續對這個模型進行基準測試與評估,初步評估結果顯示其表現已達到我們無法排除其屬於關鍵能力層級的程度。Astra是一款開發中的模型,並未涉入Hugging Face遭利用的事件。」公司強調,目前僅為初步評估,Astra尚未被正式歸類為關鍵資安模型,後續仍將持續評估以做出最終判定。

延伸閱讀:JFrog證實:OpenAI模型利用Artifactory零時差漏洞逃逸測試環境,八項CVE曝光

強化安控措施因應風險

因應這項評估結果,OpenAI表示已針對高能力層級模型與相關作業強化安全控制,包括建置隔離測試環境、限制網路與工具存取權限、加強模型權重的保護與加密、增加監控與偵測機制,以及採用沙箱執行。

OpenAI進一步指出:「我們正暫停Astra尚未符合強化安控要求的作業。」公司同時表示,已針對Astra所有代理式應用(包含訓練與評估階段)建立全面監控機制:「監控系統會評估模型的思維鏈(Chain of Thought),並在偵測到高風險行為時觸發安全應變機制,以審查並中止相關活動。」

在正式部署Astra之前,OpenAI表示將邀請政府機關與獨立AI安全組織,對模型的資安能力進行外部評估,同時也會向第三方測試夥伴提供操作指引與安全措施,以協助其安全地評估模型的高風險能力。

OpenAI表示,選擇公開這項評估結果,是希望對社會大眾及資安社群保持透明:「我們相信具備高階資安能力的模型,應能協助防禦方在攻擊者之前發現並修補漏洞。」公司並表示,將持續與各國政府、安全研究機構及公民社會合作,確保Astra及後續模型的前沿能力能被負責任地部署。