斬斷致命三角的一條腿:Lockdown Mode 的防禦邏輯
Prompt injection 不是新威脅,但防禦方法長期停留在「讓 AI 自己判斷哪些指令可信」這個根本上不可靠的路徑。

Prompt injection 不是新威脅,但防禦方法長期停留在「讓 AI 自己判斷哪些指令可信」這個根本上不可靠的路徑。OpenAI 近期正式上線 Lockdown Mode,目前向 Free、Go、Plus、Pro 及自助式 Business 帳號陸續推出,它的設計意圖值得建構 agent 的團隊認真拆解。
核心機制不複雜:Lockdown Mode 限制 ChatGPT 發出的對外網路請求,目標是截斷資料外洩(data exfiltration)的最後一哩路。它明確不承諾防止 prompt injection 本身進入系統,惡意指令仍可能藏在快取的網頁內容或上傳的檔案裡,並影響模型行為。這個邊界劃得清楚,也很誠實。
理解它為何有效,需要先理解「致命三角」框架:當一個 LLM 系統同時具備(1)接觸私密資料、(2)暴露在不可信內容、(3)能將資料傳回攻擊者的管道,三條腿同時存在,攻擊才能成立。防禦方不需要三條全斬,只需切斷其中一條。
問題在於哪條最好切。私密資料的存取往往是功能核心,拿掉等於廢掉產品。不可信內容的過濾理論上可行,但 AI 對「可信」的判斷本身就是可被攻破的,這是循環論證的陷阱。剩下的就是外洩管道:限制出站請求不會影響模型的推理過程,損失的只是少數需要主動傳送資料到外部的使用情境。
Lockdown Mode 選的正是這條腿,而且關鍵在執行方式:它用確定性機制(deterministic mechanisms)而非 AI 判斷來做限制。換句話說,攻擊者無法透過精心設計的 prompt 說服系統「這次外送資料是合法的」,因為做判斷的根本不是 AI。
對建構者來說,這裡有兩個值得正視的推論。
第一,Lockdown Mode 的存在本身是個訊號。這意味著在預設設定下,ChatGPT 對堅定的資料外洩攻擊並不提供 robust 防護。這不是批評,而是對現實的誠實描述,但若你的 agent 處理的是敏感資料,預設設定顯然不夠。
第二,這是一個把學界框架直接落地成產品功能的值得關注的案例。致命三角不是新概念,但把「斬斷外洩腿」做成可開關的系統層機制,而非依賴 prompt 層指令,這個設計思路可以直接抄作業:在你的 agent 架構裡,exfiltration 那條腿是由誰、用什麼機制守著?如果答案是「由 AI 自己判斷」,那就是你現在的風險敞口。


