提示詞注入是一種惡意指令,攻擊者將其嵌入內容中,誘使大型語言模型(LLM)遵循,一直是攻擊者用來反制 AI 平台用戶的常用工具。一個巧妙設計的指令,偷偷藏在電子郵件或行事曆邀請中,往往就能讓 LLM 洩露敏感資料或執行其他有害動作。
現在,防禦者也開始利用提示詞注入。Tracebit 的研究人員週一表示,他們發現將提示詞注入與儲存在 Amazon Web Services 上的密碼、加密金鑰及其他機密資料並置,通常就能有效阻止 AI 駭客代理的攻擊。
這些提示詞會指示攻擊型 LLM 執行其安全防護機制(AI 開發者為防止有害行為而設置的安全屏障)所禁止的動作。LLM 會因此停止運作。例如,一個提示詞可能要求 LLM 提供開發可吸入炭疽孢子的步驟,或者,對於中國開發者的 LLM 而言,提及 1989 年天安門事件中標誌性的「坦克人」。
一旦 LLM 遇到這些被禁止的指令,它就不會再遵循其原有的指令。研究人員將這項技術命名為「上下文轟炸」(context bombing)。Tracebit 共同創辦人兼執行長 Andy Smith 在解釋這個名稱時說:「我們最終是在上下文中觸發了一種拒絕機制。」
他補充道:「我們想表達的是,這確實具有強烈而尖銳的效果,代理程式很難從中恢復。一旦它們將這些內容納入其上下文,它們就會持續拒絕執行。」Tracebit 表示,初步測試顯示上下文轟炸具有巨大潛力。
他們測試了 Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek 4 Pro 和 Kimi 2.6,給予它們執行例行開發者任務的指令,這些任務會引導模型列舉資源並偶然發現預先植入的字串。他們在模擬的 AWS 環境中運行這些模型。
週一的報告指出:「在五個領先模型和 152 次攻擊運行中,將其中一個字串植入誘餌機密中,使代理程式取得完整帳戶管理員權限的比例從 57% 降至 5%,而完全入侵(包括留下持久立足點)的比例則從 36% 降至 1%。」「我們測試中最有能力的代理程式 Opus 4.8,在面對上下文轟炸時,從 93% 的運行中獲得管理員權限,變為每次都失敗。」
綜合五個模型和 152 次運行,結果包括:管理員權限提升從 57% 降至 5%;帶有持久立足點的管理員權限提升從 36% 降至 1%;達成任何攻擊路徑的運行從 91% 降至 15%;平均而言,每次運行成功完成的路徑從 1.53 個降至僅 0.16 個;沒有任何運行能在不觸發金絲雀偵測的情況下完成攻擊路徑。
這項研究建立在 Tracebit 五月份的發現之上,當時他們推出了一種方法,讓防禦者在基礎設施受到 AI 代理攻擊時能收到警告。這種方法以 AWS 資源的形式呈現,這些資源看起來像是用於合法目的,但實際上根本沒有被使用。它們與正在使用的資源並存。
當它們被代理 AI 探測時,防禦者就會收到警報。就像帶入煤礦坑的「金絲雀」一樣,這些資源讓防禦者能在威脅造成致命後果之前偵測到它。Tracebit 的金絲雀平均能在八分鐘內警示攻擊的開始。
開發上下文轟炸的動機源於需要一種能阻止攻擊而非僅僅發出警告的方法。在實驗中,代理模型平均需要 14 分鐘才能升級到管理控制權。六分鐘的提前預警時間顯得過於緊迫。
攻擊者早已利用提示詞注入來關閉網路內的 AI 防禦。例如,資安公司 Socket 的研究人員上個月發現了一個 LLM 代理,它會指示目標 LLM 提供製造核彈或生物武器的說明。這些注入旨在關閉 AI 輔助的惡意軟體分析。Check Point 的研究人員也發現了類似的惡意軟體原型。
上下文轟炸似乎是防禦者扭轉局勢的首個已知案例。聖地牙哥加州大學專攻 AI 安全的教授 Earlence Fernandes 在採訪中表示:「據我所知,我還沒有見過其他人將這項技術用於防禦。」
他說他一直在嘗試類似的方法,儘管是在稍微不同的情境下。他打趣道:「我本來想成為第一個,但我想這些傢伙搶先一步了!」
迄今為止,尚無已知方法能解決提示詞注入的根本原因。這使得開發者別無選擇,只能建構精密的防護機制,以防止注入的提示詞迫使 LLM 脫軌。防禦者現在或許能找到一種方法,將這個難以解決的問題轉化為自己的優勢。
