8 月 11 日,Anthropic 宣布未來所有 Claude 模型生成的文字都將包含浮水印,以識別其為 AI 生成的結果。這家公司並非單獨行動,Google 也擁有自己的文字浮水印(Anthropic 的浮水印即以此為基礎),並將其應用於 Gemini 模型的輸出。OpenAI 尚未推出文字浮水印,但已計畫實施。
浮水印的迅速普及,部分是為了回應歐盟的《AI 法案》,該法案要求在 2026 年 8 月 2 日之後發布的 AI 模型必須加入浮水印,同時還有其他旨在遏制欺騙性或操縱性 AI 生成內容傳播的規劃與提案法規。然而,這些新規定可能會讓那些只想要最佳結果的 AI 使用者付出代價。
AI 浮水印可以應用於多種內容形式:歐盟《AI 法案》也要求圖像、音訊和影片加入浮水印。這類媒體浮水印已使用多年,儘管其作為 AI 標記整體解決方案的有效性仍有待商榷,但它們可以達到超過 99% 的偵測率。OpenAI、Google 和 Meta 等公司已部署圖像和影片浮水印(Anthropic 不提供圖像生成模型)。
然而,文字浮水印的部署頻率較低,並非所有人都相信文字浮水印能在不損害 AI 模型回應品質的情況下運作。科技作家兼 Markdown 語言共同創作者 John Gruber 稱浮水印是「寫作的扭曲」,並質疑 Anthropic 關於浮水印不改變文字意義或品質的說法。
他指出,圖像由數百萬像素組成,而文字回應通常只有數十或數百個詞彙。文字似乎提供了更少的空間來修改 AI 輸出,使其既可偵測又不會造成干擾。
Vector Institute 的博士後研究員 John Kirchenbauer 則持不同意見,他與同事在 2023 年共同發表了一篇論文,該論文是首批描述文字浮水印方法的論文之一。「如果沒有改變,它就不會被偵測到。這是一個非常根本的觀點。」他說。「問題是,如果它在所有實際用途上都不會改變你的實用性,你是否會在意它不是確切的原始分佈?」
實際上,這個問題歸結於「實用性」這個詞。為 AI 生成文字加入浮水印是否會顯著降低使用者的體驗?答案仍在爭議中。浮水印這個詞太過熟悉,以至於當它應用於 AI 時,可能會導致人們對其技術運作方式產生混淆。文字浮水印並非中繼資料或隱形字元;它是一種更為微妙的東西。
確切的細節因方法而異,但文字浮水印通常在沒有特定金鑰的情況下,人類(在許多情況下,甚至電腦)都無法偵測到。要理解這一點,需要了解大型語言模型(LLM)的運作方式。LLM 在回應提示詞的每個步驟中,都會為每個可能出現的下一個詞彙生成一個機率。(從這裡開始,我將「詞彙」與「token」互換使用,儘管 token 也代表數字、標點符號等)。
一個可能的詞彙可能獲得 40% 的機率,一個合理的替代詞彙 10%,而一個不太可能的詞彙則只有百分之幾的機率。然後,模型會根據這些數字加權隨機選擇一個詞彙。機率最高的詞彙通常會勝出,但並非總是如此。這個過程為隱藏文字浮水印提供了機會,透過引入詞彙選擇的細微變化。
Kirchenbauer 及其同事在 2023 年的論文中,提供了文字浮水印實施方式的首批範例之一,至今仍是引用最廣泛的技術。研究人員描述了一種浮水印,它將詞彙分為「紅名單」和「綠名單」。紅名單上的詞彙保持不變,但綠名單上的詞彙則被輕微地提高其出現機率。
Kirchenbauer 表示:「如果我們從這個修改過的分佈中取樣,那麼雖然任何一個 token 的選擇不一定會來自那個偏好的集合,但經過多次取樣,我們將優先從那個加權子集中選擇詞彙。」文字浮水印就嵌入在所使用的詞彙選擇中,這就是它對人類來說是隱形的原因。Kirchenbauer 及其同事報告稱,在包含約 200 個 token 的回應中,偵測率達到 98.4%,且零誤報。
詞彙機率的嵌入模式也意味著簡單的改寫不會掩蓋浮水印。該論文報告,要從長篇回應中移除浮水印,大約需要改變四分之一或更多的詞彙。
儘管 AI 文字浮水印旨在對人類讀者隱形,但它本質上會影響 AI 生成文字的詞彙模式。這種演算法上的干預正是 Gruber 等批評者擔憂浮水印會降低整體輸出品質的原因。
Google 團隊在 2024 年的一篇論文中,介紹了該公司的浮水印方案 SynthID-Text,提供了文字浮水印不影響品質的最有力證據。Anthropic 的浮水印也基於 SynthID-Text,儘管 Anthropic 並未詳述其修改方式。
為了證明 SynthID-Text 浮水印不影響品質,Google 的作者將 Gemini 使用者查詢隨機導向帶有浮水印和不帶浮水印的模型變體。然後,他們比較了超過 2000 萬次回應的整體使用者回饋,發現使用者回饋沒有顯著差異。
然而,一些研究人員仍對浮水印方法不影響 AI 生成回應品質的說法持懷疑態度。他們的疑慮源於在某些邊緣情況下,浮水印更難實施。Meta 的 AI 研究科學家 Vinu Sankar Sadasivan 共同撰寫了一篇關於 AI 文字浮水印可偵測性的廣泛引用論文,他表示當潛在詞彙選擇數量較少時,浮水印尤其難以運作。
Sadasivan 說:「對於 20 個詞的推文,我需要 50% 或 60% 的詞彙來自『綠名單』才能良好偵測。」由 AI 生成的基本 Python 函數也會在浮水印強度和模型回應品質之間產生類似的張力。「這就是我與 Anthropic 一些公關文章產生分歧的地方,他們聲稱浮水印沒有品質變化。」
Sadasivan 解釋說,雖然可以動態增加或減少浮水印的強度,以在困難情況下保持回應品質,但這樣做也會降低浮水印的強度。
Google 的 SynthID-Text 論文中包含一個圖表示例,該圖表繪製了偵測率與回應中 token 數量的關係。在最佳情況下,偵測率高達 95%,但對於短回應則降至 50% 以下。由於 Anthropic 拒絕為本文提供額外資訊,因此很難判斷該公司如何在 AI 回應品質和浮水印強度之間取得平衡。
關於 AI 文字浮水印的爭議不僅在於其運作效果,還在於為了明確標示 AI 生成文字,哪些權衡是合理的。Gruber 的立場是,改變文字是不可接受的,因為它會使 AI 模型的輸出與原本不同。另一方面,歐盟的《AI 法案》則暗示,如果能告知人們正在閱讀 AI 生成文字,某些改變是可接受的。
更複雜的是,AI 研究人員越來越關注文字浮水印的其他用途,而不僅僅是標示單個 AI 生成文字範例。特別是,浮水印可用於大規模追蹤資料。Kirchenbauer 共同撰寫的一篇 2026 年論文顯示,用帶有浮水印的文字訓練的 AI 模型,其自身輸出也會帶有該浮水印。
內容所有者可以在發布文件前加入浮水印,然後利用這些痕跡作為統計證據,證明其文字被納入模型的訓練資料中。或者,AI 公司在訓練新模型時,可以使用文字浮水印來排除舊模型生成的內容,以避免模型崩潰,即 AI 模型不斷重複和放大自身錯誤。
Kirchenbauer 認為,這些更廣泛的考量轉變了關於文字浮水印的整個辯論。「目標不一定是『你使用了 AI』的指控,而是朝向追溯資料來源、模型回收等方向發展。」他說。「我認為你可以將文字浮水印作為一種通用的中繼資料,在某些方面更堅固,在某些方面則較不堅固,可以附加到內容上並追蹤其去向。」
