資安業者 Forcepoint 近日發布報告指出,若 AI 應用缺乏對單一請求可使用的運算資源與成本上限控管,可能因「
無界消耗」(Unbounded Consumption)導致費用失控。這項弱點在 OWASP 最新的 2026 年大型語言模型(LLM)應用十大風險中排名第六。報告並列出五種可能對企業造成衝擊的情境。
服務不斷線,帳單卻先失控
Forcepoint 研究員 Jyotika Singh 指出,這類問題的共通點在於,系統缺乏針對單一請求可動用的運算、成本或資源的限制。服務通常不會中斷,但營運成本可能遠遠超出原先編列的預算,這種模式被稱為
錢包阻斷(denial of wallet)。
這類風險之所以容易被忽略,是因為單一請求看似正常,未必會超出組織既有的用量上限;然而,資源消耗長期累積後,仍可能帶來高額成本,甚至影響服務。部分情境甚至不需要高深技術或惡意攻擊者:只要大量請求、設定不當的自動化流程,或長時間對話,都可能推升費用;而且個別請求也可能繞過傳統的輸入過濾機制。
報告列出的五種情境
第一種是
錢包阻斷。攻擊者取得遭竊或外洩的 API 憑證後,會對按用量計費的 AI 服務大量發送請求,讓帳戶擁有者被迫承擔費用。報告舉例,若客服聊天機器人的測試環境 API 金鑰外洩到公開程式碼庫,攻擊者就能用腳本發出數萬次請求,導致帳單遠超應用程式原先編列的每月雲端預算。
第二種是
代理工具扇出(agent tool fan out)。攻擊者不必讓 AI 代理違反指令,而是利用其正常行為。例如,攻擊者入侵代理可能檢索的部落格文章並植入數百篇偽造的相關內容。代理在執行合法研究任務時會逐一追蹤連結,而每個連結又指向更多連結,形成失控的連鎖活動,推高受害者的運算成本。
第三種是
推理迴圈耗盡(reasoning loop exhaustion),主要影響需要逐步推理後才回答的模型。攻擊者可在一般問題前加上一段簡短指示,要求模型在回答前從多個角度反覆質疑自己的推理,且不做任何假設,進而消耗遠多於問題本身所需的思考詞元(token)。Singh 指出,由於請求本身看似正常,通常不會出現足以觸發警示的流量暴增。
第四種是
脈絡累積(context accumulation),即使沒有攻擊者介入也可能發生。在長時間的 AI 對話中,模型每次回覆都必須重新處理整段對話歷史;對話越長,每則回覆的成本就越高。Singh 舉例,若客服代理的對話視窗缺乏重置機制,對話可能維持超過 150 輪;到了第 100 輪時,每則回覆都在重新處理比一篇短篇小說更長的逐字稿,使單則訊息成本相較起點增加約 100 倍。
第五種是
模型萃取(model extraction)。若系統缺少查詢上限,也可能從成本風險演變成智慧財產竊取。報告舉例,競爭對手可對公開的推論端點發出數萬次不同查詢;若端點又剛好揭露詞元機率,對方可能在數週內逐步重建出近似的模型行為。
建議的防護措施
Singh 建議組織採取多項措施降低風險,包括:
- 針對個別使用者、API 金鑰與團隊設定硬性的花費與詞元用量上限,而非僅在用量偏高時發出警示
- 限制代理可執行的步數,以及回頭處理自身輸出的次數,並建立機制在重複迴圈擴大前加以偵測
- 導入沙箱與最小權限控管,限制代理可存取的範圍,以及失控程序可擴散的程度
本文轉載自 DarkReading。