AI 的崛起與普及,使得各行各業逐漸將語言模型整合至現有系統與服務中。 然而, AI 帶來的便利與效率背後,也潛藏著不容忽視的安全風險。 即便 SLM 或 Edge AI 等作法試圖解決資料上雲的隱私疑慮與算力成本,模型放到地端就很安全嗎? 如果駭客的攻擊是隱藏在使用者輸入中呢? 事實上隱私不等於安全,當企業把語言模型部署到第一線時,有哪些針對這些語言模型本身的攻擊? 該如何防範這類型的攻擊?


OWASP Top 10 for LLM Applications

非營利組織 Open Worldwide Application Security Project (OWASP) 致力於推廣資訊安全教育與提供資安實務建議, 以定期更新的 OWASP Top 10 清單聞名,近年來隨著 AI 的應用,OWASP 也針對 LLM 與生成式應用領域列出了 2025 年 LLM application 的十大資安風險。 這些風險揭示了攻擊者可能從哪些地方下手,提供開發者可以提前預防的攻擊點以及如何解決。

OWASP Top 10 for LLM Applications
不僅是輸入層,LLM 應用程式每一層都有相對應的資安風險

LLM01 Prompt Injection 提示注入

使用者輸入的 prompt 能以意料之外的方式改變 LLM 的行為或輸出結果,RAG 或 fine tuning 也無法阻止提示注入風險。

這裡要注意的是 prompt 分為 system prompt 與 user prompt,我們看不到 system prompt,是一種在設計應用程式時就會預設好的提示,告訴模型使用範圍、語氣、控制等等。透過精心設計的 prompt,有機會讓 LLM 執行時繞過 system prompt,因而產生意想不到結果的風險。

提示注入又分為直接與間接兩種方式,前者指的是使用者的 prompt injection 直接以非預期的方式改變模型行為;後者則是 LLM 從外部來源接收輸入,這些網站或檔案等外部內容中隱含的資訊在模型解讀後改變模型行為。

LLM02 Insecure Output Handling 敏感資訊洩漏

模型透過輸出結果暴露敏感資料或專有演算法,資料可能包括可識別資訊(PII)、財務細節、健康紀錄、商業機密資料、安全認證資訊、法律文件、閉源或基礎模型訓練方法與程式碼。

LLM03 Supply Chain Vulnerability 供應鏈風險

依賴第三方預訓練模型與資料時,外部元素可能經由竄改或投毒被操控,因而產生訓練資料、模型本身與部署平台的完整性風險。

LLM04 Data and Model Poisoning 資料及模型投毒

透過操控訓練資料引入漏洞或偏見,影響模型進行準確預測的能力。

LLM05 Improper Output Handling 不當輸出處理

將 LLM 的輸出傳遞至下游元件時,缺乏足夠的驗證、淨化與處理程序。

LLM06 Excessive Agency 過度代理授權

LLM agent 被賦予過度的功能、權限或自主性,模型在模糊不清或被操縱的輸出影響下,可能執行破壞性行為。

LLM07 System Prompt Leakage 系統提示洩漏

系統提示包含敏感資訊,被外界發現並利用。

LLM08 Vector and Embedding Weakness 向量與嵌入弱點

在結合 RAG 的系統中,向量與嵌入的生成、儲存或擷取方式存在弱點。

LLM09 Misinformation 錯誤資訊

模型產生錯誤或具誤導性的內容(如:hallucination 幻覺),而將錯誤資訊納入關鍵決策中,尤其對金融與醫療產業特別危險。

LLM10 Unbounded Consumption 無限制消耗

不受控地進行推論要求,導致過度或惡意資源消耗,導致服務阻斷(DoS)或錢包拒絕服務(DoW)。


預防與緩解措施

限制模型行為

在系統提示中明確訂定角色、功能與限制,並指示模型忽略試圖修改核心指令的要求。

定義與驗證輸出格式

明確指定清楚的輸出格式,要求詳細的推理過程與來源,並驗證其是否符合這些格式。

輸入與輸出過濾

定義敏感內容的範疇並建立辨識與處理規則,運用語義過濾與字串檢查來掃描內容,例如 LLM Guardrail。

權限控管與最小權限存取

提供 app 專屬的 API 代碼以擴充功能,並在程式碼中處理這些功能,而非直接交付給模型。

要求人工審查

針對特權操作實施人類審核流程(human-in-the-loop)。

區隔並標示外部內容

對不受信任的內容進行分離與清楚標示,以減少其對使用者提示的影響。

對抗性測試與攻擊模擬

定期進行滲透測試與入侵模擬,將模型視為不受信任的使用者。


小結

隱私不等於安全,只要 AI 依然接受自然語言作為輸入,prompt injection 的威脅就永遠存在,防住了傳統駭客卻防不住惡意文字。 尤其現在 Agentic AI 的崛起又帶來更多風險,AI agent 可自主執行多步驟操作,權限範圍難以界定,行為更難預測。 建立多層次 LLM 防護架構,能有效預防 LLM 帶來的資安風險。


References