你與 AI 聊天機器人之間的對話,不一定會永遠保密。Google 最近就證明了這一點。上週末,人們驚訝地發現 Anthropic 旗下 AI 聊天機器人 Claude 的部分對話內容,竟能輕易透過網路搜尋找到。這個問題最初由 Reddit 用戶發現,曝光的對話內容包含用戶詢問應加入哪個政黨的建議、堪薩斯州律師是否需自我舉報道德違規,甚至還有情色角色扮演等敏感話題。

Claude 允許用戶透過建立特定對話串的公開 URL,將「對話快照」分享給其他人。這些 URL 之所以會被主流搜尋引擎索引,原因在於網站與搜尋引擎的基本運作方式,以及當生成式 AI 產品加入後兩者之間的衝突。

基本上,Anthropic 會透過 robots.txt 檔案指示網路爬蟲(例如 Google 和 Bing 等搜尋引擎使用的爬蟲),不要索引用戶選擇分享的對話內容。robots.txt 長久以來被視為告知網路爬蟲哪些網站部分可存取的標準方式。

根據 Wayback Machine 的快照顯示,Anthropic 的 robots.txt 至少從 2025 年 9 月起就已將「分享對話」設定為網路爬蟲的禁區。

然而,要阻止頁面被搜尋引擎收錄,比你想像的還要困難。

截至本文撰寫時,若在 Bing 搜尋「site:claude.ai/share」,仍會顯示約 612 個結果。Bing 在其技術文件中指出,開發者可以使用 robots.txt 阻擋搜尋引擎的網路爬蟲,但同時也應在個別頁面中加入「noindex」標籤。

WIRED 檢視時,Reddit 貼文中指出的一些搜尋結果中的對話已被刪除,且在 Google 搜尋 Bing 仍可用的「share」查詢時,結果已不再顯示。Google 在其開發者指南中表示,如果某頁面被網路上的其他地方連結,且頁面擁有者未在該頁面中加入特殊的「noindex」HTML 標籤或在頁面回應標頭中加入「x-robots-tag」,Google 將會忽略 robots.txt 的指示。

WIRED 審查了部分外洩的 Claude 對話頁面樣本,發現它們並未包含 Bing 和 Google 都表示會納入考量是否索引頁面的「noindex」標籤。

擁有 Bing 的微軟在發稿前未提供評論。Anthropic 也未回應多次的置評請求。

Google 發言人 Ned Adriance 告訴 WIRED,Claude 分享對話被索引是 Anthropic 的責任。Adriance 表示:「Google 或任何其他搜尋引擎都無法控制哪些頁面在網路上公開,這些頁面在許多搜尋引擎上都被索引了。我們提供網站擁有者明確的控制權,讓他們決定頁面是否可以被爬取或索引,我們也始終尊重這些指令。」

Anthropic 並未回應關於為何未在分享對話頁面中加入「noindex」標籤的問題。

去年九月,Anthropic 也曾因同樣問題受到批評,當時他們向 Forbes 表示,公司使用 robots.txt 來告知爬蟲不應存取分享的對話。然而,正如 Forbes 報導所指出的,這並不能保證搜尋引擎不會索引特定的網頁。

即使 robots.txt 並非總能有效阻止頁面被搜尋引擎索引,AI 實驗室仍將其用於其他目的。許多實驗室向創作者承諾,只要開發者在 robots.txt 檔案中「禁止」某些爬蟲,他們的網站就不會被用作 AI 訓練資料,而這些實驗室本身也採納了這項建議。