OpenAI 在數學領域的驚人發現,再次引發研究人員對其訓練數據的質疑。繼先前一場關於其模型是否受益於未發表研究的激烈爭議後,第二位數學家也出面指控這家 AI 巨頭行為不道德且「不誠實」,並缺乏對訓練數據來源的透明度。

數學家 Andreas Thom 在 Mastodon 上發文表示擔憂,他認為在 OpenAI 發表其數學成就之前,他與同事和 ChatGPT 聊天機器人的互動,可能已促成了這些成功。上個月 OpenAI 大張旗鼓宣布的十項成果中,有一項涉及 Thom 的專業領域,即所謂的「非索菲克群」(non-sofic groups),而 OpenAI 也承認其成果大量借鑒了 Thom 和另一位數學家 Gábor Kun 的早期研究。

Thom 表示,在紐約大學數學教授 Tristan Buckmaster 公開質疑 OpenAI 的 AI 模型是否受益於他使用 OpenAI Codex 的經驗後,他開始反思自己與 OpenAI 的互動。OpenAI 宣布其非索菲克群成果後,因未能承認 Thom 和 Kun 的近期貢獻而在數學界受到廣泛批評,該公司隨後悄悄修改了其說明。非索菲克群大致上是指無法用有限結構近似的無限數學結構。

Thom 說,他對「OpenAI 對我們技術的詳細掌握」感到震驚,他認為這些技術在當時既不是最顯而易見,也不是最有希望的解決方案途徑。他表示已寫信給 OpenAI 研究員 Sébastien Bubeck 和哈佛大學統計學家 Mark Sellke,詢問他與 ChatGPT 的互動是否「屬於訓練數據的一部分,或可供推理過程存取」,進而可能促成了該成果。

然而,Thom 對此答案並不滿意,他指出這僅回答了他的對話是否能被直接存取,而非這些對話是否已進入該公司用於改進模型的龐大訓練數據庫中。他寫道:「沒有提供任何這樣的限定、解釋或證據。我認為這至少是不誠實的行為。」

Thom 表示,研究人員沒有能力逆向工程 OpenAI 的訓練流程,以查明他們的工作是否被使用。「只有 OpenAI 擁有相關數據。」他指出,如果該公司否認使用,則有責任透過公開所有必要的數據集,並澄清其如何使用數據的各種設定和條款來證明。

OpenAI 不願明確排除任何用戶數據使用的情況,與其近期在千禧年大獎難題突破上的辯護方式如出一轍,無論是在公開聲明還是與 Buckmaster 的溝通中皆是如此。Buckmaster 當時正與 Anthropic 研究員 Levent Alpöge 以個人身份合作解決這些問題。

在宣布流體運動相關的納維-斯托克斯方程解的部落格文章中,OpenAI 斷然否認使用了任何特定的用戶數據:「我們(研究人員和代理人)在他們公開之前,沒有透過任何方式看到他們的任何工作——特別是,沒有存取任何特定的用戶數據來解決這個問題。」

然而,它並未明確排除間接影響的可能性:「雖然不太可能,但我們無法排除從他們使用我們產品中獲得的去識別化數據,有助於改進我們的模型。」Thom 表示,這與該公司在與他溝通時所做的混淆性區別如出一轍。他說:「去識別化或許可以移除姓名;但它無法移除數學思想的智慧內容。」

鑑於近期事件,Thom 表示:「Sellke 的斷然回答,至少是沒有根據的廣泛且實質上誤導性的;回頭來看,這根本就是不誠實。」

Thom 認為,如果用戶提供的非公開研究有助於改進模型,而該公司隨後在未經同意、適當披露或署名的情況下,利用這些模型與這些用戶競相發表成果,那將是「道德上站不住腳的」。

OpenAI 未立即回應 The Verge 的置評請求。

在 OpenAI 本應慶祝勝利的時刻,Thom 的評論加劇了數學界對該公司日益增長的不安。OpenAI 宣布解決了數學界傳奇的千禧年大獎難題之一,這是一項非凡的成就,如果得到證實,幾乎無人會否認。然而,OpenAI 聲稱促使其最初著手解決這個問題的特殊情況,使事情變得複雜:它在網路上聽到其他研究人員取得了重大進展的傳言,於是也想嘗試。

這起持續的事件讓數學家們感到不快。許多研究人員告訴 The Verge,他們擔心這種行為會讓該領域變得更加隱密,因為數學家們知道,即使是接近重大突破的傳言,也可能引發與資源豐富、渴望榮耀的科技巨頭之間的競賽。