廣受歡迎的AI文字偵測器在辨識一般AI生成文本時,準確率幾乎完美。然而,當大型語言模型刻意模仿特定作者的寫作風格時,高達五分之一的AI文本可能未被偵測出來。其中,科學寫作是偵測器最難以辨識的領域。
Epoch AI 的一個研究團隊測試了三款最廣泛使用的AI文字偵測器:Pangram (版本 3.3.2)、GPTZero (模型 2026-05-11-base) 和 Originality.ai (Turbo 3.0.2)。測試涵蓋了三種類別:真實人類寫作、由簡單提示詞生成的AI文本,以及刻意模仿特定作者風格的AI文本。
該團隊建立了一個包含 495 篇人類文章的語料庫,這些文章來自 99 位作者,平均分佈在部落格、小說和科學寫作領域。所有文本均在 ChatGPT 於 2022 年 11 月發布之前撰寫,這有效排除了語言模型污染的可能性。
在處理一般AI生成文本時,所有三款偵測器幾乎都表現完美,誤判率最高僅為 0.7%。人類文本也大多被正確分類。Pangram 和 GPTZero 沒有產生任何誤報,然而 Originality.ai 卻將 495 篇人類文章中的 19 篇標記為AI生成,這是一個令人不安的 3.8% 高誤報率。
當語言模型收到作者的寫作範例作為參考資料時,偵測率的結果便有所不同。在這項測試中,三個前沿模型(Claude Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro)分別收到一位作者的五篇真實文本,並被要求以相同的風格撰寫新文本。
根據 Epoch AI 的數據,以這種方式生成的 297 篇文本中,平均有 38 篇未被偵測出來,這相當於約 13% 的誤判率。Pangram 錯過了 10% 的風格模仿文本,GPTZero 錯過了 11%,而 Originality.ai 則錯過了 18%。
一旦AI模仿人類作者,偵測器的錯誤率就會飆升。在小說類別中,所有偵測器的誤判率僅為 1% 到 5%。然而,科學寫作卻呈現出截然不同的情況。Pangram 未能辨識出 25% 的風格模仿學術AI文本,GPTZero 錯過了 24%,Originality.ai 則錯過了 29%。
最差的個別結果出現在科學寫作中特定的模型與文體組合。根據已發布的數據,Pangram 錯過了 48% 由 Gemini 生成的學術文章。而在 Originality.ai,39% 的學術 GPT-5.5 文本未被偵測出來。
Pangram 使用一個經人類和機器生成文本訓練的神經網路,儘管其創始人稱該系統為「黑盒子」,因為其判斷無法追溯。GPTZero 則衡量詞彙選擇的可預測性以及文本內部的變化程度,其理念是語言模型寫作比人類更為統一。Originality.ai 則搜尋其在訓練人類和AI生成文本時學到的統計模式。
儘管這些偵測器方法不同,但它們都顯示出相同的模式。它們幾乎每次都能捕捉到由簡單提示詞生成的文本,但卻更常錯過模仿風格的文本。科學寫作這個AI偵測可能在現實世界中最常被使用的領域,仍然是最難以正確標記的。
早期 Authors Guild 的一項測試發現,Pangram 和 Originality.ai 能夠可靠地將人類文本分類為人類。Epoch AI 的這項研究則補足了另一半的圖像:人類寫作的低誤報率,並不能說明有多少AI文本實際上會被漏掉。
