SynthID 的一個關鍵功能是所謂的「錦標賽取樣」(tournament sampling)。類似於體育比賽,SynthID 會評估大量的下一個詞元候選詞。它使用一個秘密金鑰為這些詞元分配機率分數。一對詞元會在一個回合中競爭,得分較高者獲勝並晉級下一輪。這個過程會持續進行,直到確定最終獲勝的詞元。

研究員 Siposova 透過 Hugging Face 未經修改的 SynthIDTextWatermarkLogitsProcessor,測試了 SynthID-Text 的「非失真」(non-distortionary)配置。她將有害的提示詞輸入到六個開源模型中,並比較了使用浮水印和未使用浮水印時的回應。

實驗結果顯示,浮水印改變了模型對有害請求的回應,特別是當這些請求是透過提示詞注入技術提出時。Siposova 寫道:「浮水印改變了模型對單純有害請求的拒絕行為,但當相同的請求與提示詞注入技術結合時,這種影響更為顯著。」她補充說:「在幾個模型上,浮水印反而讓模型更有可能回應它原本會拒絕的有害請求。」

這些變化具有重要的安全影響,因為它們不僅影響 LLM 的回應,還影響依賴該模型的 AI 代理程式的後續動作。研究員寫道:「在模型層面,這會改變安全行為,包括模型是否拒絕有害請求,以及這種拒絕在提示詞注入下是否仍然有效。」

「在代理程式層面,相同的取樣詞元可以決定呼叫哪個工具以及傳遞哪些參數給它。提示詞注入將這兩種設定連結起來,因為當模型也能透過工具執行動作時,被削弱的拒絕變得更具影響力。」她解釋:「因此,這種浮水印程序會影響模型說什麼以及代理程式做什麼。我們將這種行為效應稱為『取樣漂移』(sampling drift)。」

另一個有趣的發現是:模型的回應行為會因使用的秘密金鑰不同而有所差異。

這項研究存在局限性。它沒有測試 Claude 模型的回應在浮水印下的變化。相反地,它測試了六個開源模型,因此研究員可以存取在錦標賽取樣期間可以啟用和停用的詞元取樣,同時保持其他設定不變。實驗也測試了 Hugging Face 對 SynthID-Text 錦標賽取樣的實作,而不是 Claude 模型將使用的特定實作。

儘管如此,這些結果表明,至少某些形式的浮水印方法可能會影響模型和代理程式的安全性。對於紅隊駭客演練來說,對其平台進行壓力測試以確保在部署 SynthID 時能按預期執行,將會非常重要。