https://www.informationsecurity.com.tw/seminar/2026_TCM/
https://www.informationsecurity.com.tw/seminar/2026_TCM/

新聞

報告:逾 6 千份修補AI 修補程式僅 46% 奏效

2026 / 08 / 17
編輯部
報告:逾 6 千份修補AI 修補程式僅 46% 奏效
資安業者 1Password 旗下 Off-By-1 研究團隊針對今年 3 月以來揭露的六項漏洞,分別使用 OpenAI 的 ChatGPT-5.5(Trusted Access for Cyber 版本)與 Anthropic 的 Opus 4.8(Cyber Verification Program 版本)生成共 6,080 份修補程式並進行測試。結果顯示,僅約 46% 的修補程式能真正解決原始漏洞,顯示大型語言模型(LLM)在自動化修補漏洞上的可靠度仍有待提升。

FLAWED 分類:近半數修補完全無效

這項研究以 FLAWED(Fix-Like Artifacts with Embedded Defects)為名,將修補結果分為五種情境:完全修復、透過改變程式行為間接修復、未修復、修復但同時引入新漏洞,以及未修復且新增漏洞。其中,僅 26% 的修補程式能在不改變應用程式行為的前提下修復原始漏洞;另有 20% 則是透過改變程式運作方式達成修復。占比最高的類別為「完全未修復漏洞」的修補程式,比例達 49%。

1Password 資安研究總監 Keith Hoodlet 指出,即便部分修補程式成功運作,往往也相當脆弱:只能涵蓋部分情境,或仍存在容易被繞過的弱點。他表示,若面對訓練資料集未涵蓋的新型漏洞,AI 生成修補程式的成功率甚至可能呈現負成長趨勢。

Veracode 平行研究:安全通過率僅 56%

這項發現也與應用程式安全業者 Veracode 的研究結果相呼應。Veracode 針對逾百個模型與 80 項編碼任務進行測試,發現 AI 生成程式碼的平均安全通過率為 56%,其中近半數(44%)的生成程式碼包含可偵測的 OWASP 十大(OWASP Top 10)漏洞類型。

Hoodlet 也提到,AI 系統在尋找漏洞與發動攻擊上的表現,似乎優於修補漏洞的能力,形成對防禦方不利的能力不對稱。並指出,包括 OpenAI、Anthropic 在內的 AI 實驗室,近期均傳出模型在測試環境中出現脫逃等異常行為的案例。

人工審查比例下滑,加速風險累積

研究團隊也觀察到,開發人員在採用 AI 生成程式碼時,審查強度有下滑趨勢。根據開發工具業者 Cursor 的調查,36% 的程式碼變更未經人工審查便直接採用。Hoodlet 認為,這種「生成即部署」的循環正在加速,卻缺乏足夠的驗證機制把關。

面對此一趨勢,專家建議,企業應將 AI 生成的修補程式視為「待驗證的變更提案」,而非可直接部署的最終修復。此外,企業應同步進行功能測試與回歸測試,並對敏感或複雜的變更要求人工審查;同時輔以能追蹤跨檔案、跨相依套件呼叫路徑的靜態分析工具,作為最後防線。

隨著 AI 系統搭配更完善的操作框架持續進步,未來修補品質有望改善。專家也認為,長期而言,撰寫嚴謹規格仍須仰賴人力;但 AI 模型在形式驗證(formal verification)程式碼方面的能力已顯著提升,只要規格明確,就能以更高效的方式驗證程式碼是否符合要求。

企業導入 AI 輔助修補漏洞時,建議可留意以下原則:
  • 修補程式上線前,務必經人工審查與回歸測試
  • 針對高風險或複雜系統,避免全自動化部署流程
  • 搭配靜態分析工具,追蹤跨檔案與相依套件的資料流

本文轉載自 DarkReading。