提示詞注入(Prompt injection)是攻擊者將惡意指令嵌入內容中,誘使大型語言模型(LLM)遵循這些指令的常用手法。這項工具已成為攻擊者利用 AI 平台對抗其用戶的首選方式。一個巧妙設計的指令,只要悄悄地藏在電子郵件或行事曆邀請中,就足以讓 LLM 洩露敏感資料或執行其他有害動作。

現在,防禦方也開始運用提示詞注入技術。

Tracebit 的研究人員週一表示,他們發現將提示詞注入指令放置在 Amazon Web Services 上儲存的密碼、加密金鑰及其他機密資訊旁,通常就能有效阻止 AI 駭客代理程式的攻擊。這些提示詞會指示攻擊性 LLM 執行其安全護欄(AI 開發者為防止有害行為而設置的安全屏障)所禁止的動作。一旦 LLM 遇到這些指令,它就會停止運作。

例如,一個提示詞可以命令 LLM 提供開發吸入式炭疽孢子的步驟,或者,對於中國開發者的 LLM 而言,提及 1989 年天安門事件中標誌性的「坦克人」。一旦 LLM 遇到這些被禁止的指令,它就不再遵循其現有指令。研究人員將這項技術命名為「上下文炸彈」(Context Bombing)。

Tracebit 共同創辦人兼執行長 Andy Smith 在解釋這個名稱時說:「我們最終是在上下文中觸發了一種拒絕機制。我們試圖表達的是,這確實具有強烈而尖銳的效果,而且代理程式很難從中恢復。一旦它們將這些內容納入其上下文,它們就會持續拒絕。」

Tracebit 表示,初步測試結果顯示上下文炸彈具有巨大潛力。他們測試了 Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek 4 Pro 和 Kimi 2.6 等模型,給予它們執行常規開發者任務的指令,這些任務會引導模型枚舉資源並偶然發現植入的字串。他們在模擬的 AWS 環境中運行這些模型。

週一的報告指出:「在五個領先模型和 152 次攻擊運行中,在誘餌機密中植入這些字串之一,將代理程式取得完整帳戶管理權限的機率從 57% 降低到 5%,而完全入侵(它們也為自己留下持久立足點)的機率則從 36% 降低到 1%。」「我們測試中最有能力的代理程式 Opus 4.8,在面對上下文炸彈時,從 93% 的運行中取得管理員權限,變為每次都失敗。」