Anthropic 執行長 Dario Amodei 上週末發表一篇文章,呼籲放緩大型語言模型(LLM)的發展速度。Amodei 引用了他所預見的技術潛在危險,從網路攻擊和生物恐怖主義,到可能破壞經濟的風險。OpenAI 執行長 Sam Altman、Google DeepMind 董事長 Demis Hassabis 和 SpaceXAI 執行長 Elon Musk 等其他三家美國頂級 AI 實驗室的負責人也表達了支持。Musk 在 X 上寫道:「Dario 說得對。」

仔細想想這項共識有多麼超現實。就在幾個月前,Musk 和 Altman 還在法庭上互相攻擊名譽,Musk 對他前 OpenAI 同事提起的訴訟(最終失敗)——至少在表面上——是關於 Altman 是否值得信賴來管理如此危險的技術。

Amodei 與 OpenAI 的裂痕甚至更深。Anthropic 於 2021 年成立,正是因為 Amodei 認為 Altman 沒有足夠認真地看待他們正在開發的技術風險。此後,Anthropic 和 OpenAI 一直在進行一場贏者全拿的競爭。(Hassabis 雖然置身事外,但他的公司仍然是競爭對手。)

現在看來,他們似乎都達成共識:最新一代的 LLM 並不安全,每個人都需要找出應對之道。

人們很容易抱持犬儒主義。目前尚不清楚他們所說的「放緩」究竟意味著什麼,以及將如何實施。

這些公司也非常在意他們的公眾形象。隨著萬億美元首次公開募股(IPO)的目標在望,OpenAI 和 Anthropic 需要向投資者保證他們是負責任的成年人,同時又暗示他們所創造的「怪物」的力量——並打算馴服這些怪物。呼籲放緩發展正好能達到這兩個目的。

然而,這些公司高層的氛圍確實似乎已經改變。Amodei 的最新文章發表於 OpenAI 首席科學家 Jakub Pachocki 的文章發布六天之後,Pachocki 在文章中也闡述了他為何擔心 LLM 發展速度若不受控制會發生什麼事。簡而言之,Pachocki 擔心 OpenAI 現在建立強大模型的能力遠遠超過其監控和控制這些模型的能力。

Amodei 和 Pachocki 都將七月 OpenAI 代理程式群對 AI 公司 Hugging Face 的網路攻擊視為警鐘——OpenAI 甚至在攻擊結束數天後才意識到這件事。但他們確切的立場很難確定。

Pachocki 既呼籲放緩,又強調了保持領先的迫切需求:「我認為繼續快速訓練更智慧模型的最強大論點,是需要建立防禦系統來應對其他 AI 帶來的危險。」正如 Pachocki 所言,AI 公司正陷入一場實質的軍備競賽。放緩是好事,但獲勝更好。

(別忘了:OpenAI 剛剛花費數百萬美元和驚人的計算能力,搶在 Anthropic 幾天前發布了一項備受爭議的數學成果。)但讓我們假設放緩真的發生了。頂級實驗室同意投入更多時間和資源來尋找監控和控制現有模型的方法,而不是開發更強大的模型。他們邀請外部審計師協助評估這些模型。

這種協調一致的努力實際上能實現什麼?再次考慮 Hugging Face 攻擊事件。OpenAI 曾表示,驅動大部分惡意代理程式的模型是他們內部測試的「高度持久」的下一代模型。這暗示 OpenAI 已經建立了一個強大到危險的模型。

然而,如果你閱讀 OpenAI 和 METR(OpenAI 邀請來協助理解事件的第三方公司)發布的關於 Hugging Face 駭客事件的報告,你會得到的印象並非模型過於強大以至於 OpenAI 無法跟上,而是一個 OpenAI 未能正確訓練的「有缺陷」模型。

這些代理程式之所以做出那些行為——包括互相留言、將工作委派給其他代理程式,以及搜尋環境中任何可能的方式來完成任務——是因為它們在訓練期間因做這些事情而獲得獎勵。訓練設置中也存在錯誤,例如有些任務不可能完成,這促使模型尋找意想不到的解決方案,而這些解決方案也得到了獎勵。當時,許多這些問題都被忽視或未被報告。

OpenAI 表示已停止訓練這個新模型並將其鎖定。這聽起來像是他們關住了一頭危險的野獸。事實上,OpenAI 只是將一個有缺陷的產品擱置了。

這並不是說有缺陷的產品不會危險。過去,有缺陷的軟體甚至導致過人員死亡。但隨著關於放緩的討論日益熱烈,值得記住的是,所有這些問題都是「自作自受」。放緩可能會有某些利他主義的副作用。但它主要會讓這些科技巨頭有機會清理他們自己生產線上的爛攤子。

這些前沿實驗室的透明度將是任何有意義的 AI 改革、限制或監管努力的關鍵。否則,無論他們以何種速度發展,我們其他人仍然只能聽信他們關於他們究竟建立了什麼以及它有多安全的說法。

為了繼續討論 AI 最新的悲觀時刻,歡迎您和我的同事們參加明天(9 月 15 日)美國東部時間上午 11 點舉行的訂閱者專屬圓桌討論。我們期待您的參與!