多年來,Microsoft 和 OpenAI 一直努力阻止某些資訊曝光,以應對新聞機構的訴訟。這些新聞機構指控兩家 AI 公司聯手竊取大量新聞內容來訓練 AI,違反了版權法。

然而,現在那些本不應被標記為機密的細節開始浮出水面。在由 The New York Times 領頭的新聞原告於週四解密的簡易判決動議中,內部文件被公開。新聞團體聲稱這些文件精確地揭示了 Microsoft 和 OpenAI 在推出 ChatGPT 和 Copilot 等新 AI 產品之前,如何看待對新聞業的威脅。

或許最爆炸性的內容是,新聞機構指出,Microsoft 應用科學總監 Brent Hecht 在文件中多次警告,為 AI 訓練爬取新聞是「前所未有、令人震驚的竊盜」,甚至稱其為「人類史上最大規模的勞動竊盜」。在另一份文件中,Hecht 反駁了 Microsoft 和 OpenAI 關於使用新聞內容訓練 AI 屬於公平使用的論點。

他表示,大規模爬取新聞的計畫「完全是在嘲弄『公平使用』的概念」。

在 OpenAI 方面,ChatGPT 負責人 Nick Turley 在內部訊息中寫道,出版商將面臨來自商業產品的「生存威脅」。這些產品透過新聞內容訓練,可用來取代新聞供應商。

新聞機構表示,一份 Microsoft 文件甚至描述了一個「末日循環」,「這將同時損害我們模型的表現和整個網路」。

該文件指出:「終端產品威脅其主要供應商的經濟基礎,這極不尋常,但這正是我們為 LLM 業務在『內容供應鏈』方面所造成的局面。」

兩家公司的數據顯示,這項預測是準確的。Microsoft 記錄到,某些新聞原告的點擊率下降了 83-93%,其他原告則下降了 51-94%。

再加上 ChatGPT 搜尋結果的低點擊率報告,以及新聞機構自身關於流量下降的報告,人們突然更容易理解,新聞收入的下降最終可能如何剝奪聊天機器人賴以成為開創性工具的豐富可靠資訊流。

同時,Hecht 在一份 Microsoft 文件中承認:「幾乎沒有人希望他們創作的內容以這種方式被使用,他們也沒有因此獲得報酬。」

新聞機構表示,他們已準備好出庭受審,因為有太多「令人信服的替代證據」。如果他們能證明聊天機器人正在取代他們在各自市場中的地位,同時還能逐字逐句地吐出文章摘錄,他們認為這雙重打擊可能會徹底摧毀 Microsoft 和 OpenAI 的公平使用論點。

新聞團體主張:「不僅新聞業的未來,負責任 AI 的未來,都取決於保留人類創作健康社會所需作品的誘因。」

聊天機器人「在很大程度上就是替代品,句號」。Microsoft 執行長 Satya Nadella 在宣誓證詞中表示,AI 公司不應透過規避付費牆來違反新聞網站的使用條款。但在 OpenAI 內部,內部訊息顯示,當員工 Nick Ryder 告知總裁 Greg Brockman 發現了一個讓 OpenAI 爬蟲「繞過」NYT 付費牆的「技巧」時,Brockman 回應:「啊,不錯。」

Nadella 也承認聊天機器人已成為新聞平台的替代品,他形容聊天機器人透過「直接在 AI 平台上提供資訊,而非需要前往原始來源」,從新聞網站竊取點擊。

在 OpenAI 內部對此有共識,一位軟體工程師在內部訊息中表示:「無論我們多麼顯眼地顯示連結,用戶都不會點擊。」動議指出,OpenAI 的 Turley 同意,當聊天機器人提供資訊時,「沒有充分理由點擊」。

他似乎也暗示末日循環已經啟動,將聊天機器人描述為「在很大程度上就是替代品,句號」,並預測它們「會隨著改進而變得越來越具替代性」。

新聞團體主張,內部人士自己的聲明應具有毀滅性。他們認為:「對於與訓練或基礎來源實質相似的輸出,法院已駁回了複製新聞文章以提供替代新聞需求產品屬於公平使用的主張。」

Microsoft 否認高層言論。新聞團體嘗試了許多不同的策略來測試 Microsoft 和 OpenAI 產品是否會逐字輸出他們的新聞文章。他們的動議顯示,他們超越了早期透過重複詢問「下一行是什麼?」來要求聊天機器人提供完整新聞報導的策略。

在某些情況下,新聞機構發現,當用戶要求文章摘要時,聊天機器人會生成長篇摘錄。其他被標記的輸出則是透過要求文章的重點條列而生成。

特別成功的是要求聊天機器人「評估新聞文章偏見」的提示詞。如果用戶要求聊天機器人從特定網站首頁中選擇任何一篇文章,它們也會重現文章的部分內容。

新聞原告在他們的動議中,僅要求法院就輸出「顯示大量逐字重疊」的侵權文章作出裁決。他們確信「被告複製的替代目的不利於公平使用」。

他們表示,其他文章的法律問題將在審判中提出。

OpenAI 未立即回應 Ars 的置評請求。然而,Microsoft 發言人為其 AI 產品辯護,稱其為一種轉化性公平使用,並未取代新聞網站。

該發言人表示,Nadella 的證詞觸及了「人們如何尋找和消費資訊的廣泛原則和正在發生的變化」,這些僅是「觀察」,「不應與法院正在審理的版權問題結論混淆,Microsoft 已在其文件中處理這些問題。」

關於 Hecht 的評論,該發言人聲稱這些文件僅「反映了一名員工的個人觀點,並非法律分析,也不代表公司的立場」。The New York Daily News 及其七家姊妹報的律師 Steven Lieberman 對此表示不同意。

他告訴 Ars:「這裡首次揭露的證據表明,OpenAI 和 Microsoft 知道他們所做的是錯誤的。」

Lieberman 說:「在整個案件中,被告堅持這些文件應被視為機密,以防公眾看到。」「現在,真相大白了。全世界終於可以看到 OpenAI 和 Microsoft 一直以來對自己行為公平性的看法。」

Microsoft 高層描述「意外掩蓋」。新聞原告主張,無論表達這些觀點的是誰,內部文件都清楚表明,這些公司預期逐字輸出會損害新聞網站。

此外,他們聲稱這些公司非但沒有阻止這些輸出,反而試圖透過建立一個過濾器,讓新聞團體更難測試聊天機器人。Hecht 曾暗示這可能被視為「意外掩蓋」,因為它會導致「對內容擁有權利的人,對訓練內容的能見度降低」。

新聞團體也感到不滿,因為 Microsoft 和 OpenAI 沒有聽從內部人士關於爬取新聞是竊盜的警告,從未選擇授權內容。據稱,他們以新聞機構無法預料的方式,在另一個市場中取代了他們。

具體來說,他們的動議指控 Microsoft 違反「行業規範」,將為 Bing 購買的資料集作為 OpenAI 的訓練資料出售,據稱在未諮詢新聞團體的情況下進行,而新聞團體不會批准將他們對基本搜尋引擎爬取的同意重新用於此目的。此外,OpenAI 據稱「行為不當」,從第三方獲取了一個包含 180 萬篇文章的 NYT 資料集,該第三方受協議約束,資料不得用於商業目的。

新聞團體聲稱,OpenAI 員工知道使用該資料「來訓練模型是不恰當的」,但他們仍然這樣做了。

動議指出,對新聞團體而言,問題不僅僅是 Microsoft 和 OpenAI,而是所有追隨他們「搭便車」使用內容的 AI 公司。

最值得注意的是,在 ChatGPT 推出後,Google 的 AI Overviews 迅速推出,並開始吸收更多原本流向新聞網站的流量。

新聞原告主張,如果法院不澄清 AI 公司必須授權新聞內容,新聞出版商和 AI 公司都可能面臨厄運。他們指出,一份 Microsoft 內部文件也同意,「生成式 AI 存在『真正的風險』,可能會『嚴重擾亂』」那些「生成基礎模型訓練數據的人的就業」。

他們表示,Microsoft 甚至附上了一幅漫畫,說明大型語言模型(LLM)破壞自身供應鏈的問題:

一份 Microsoft 內部文件中的漫畫。

新聞團體主張:「AI 公司仍然無力擺脫這個『末日循環』,因為儘管整個行業會受益於每家公司付費維持其技術所依賴的創意作品持續生產,但每家單獨的公司在其他人付費的同時免費獲取內容,對自己更有利。」

作為這種盲目貪婪的證據,他們的動議強調 Brockman 曾寫道,他「深受數十億美元」潛在收益的驅動,這些收益可透過 OpenAI 技術的商業化獲得。

新聞機構表示:「認定為 AI 複製新聞不屬於公平使用,將能解決這個囚徒困境,讓所有 AI 公司,包括 OpenAI 和 Microsoft,處於平等的地位。」