Jacob Coxon 接受 WIRED 採訪,談論 Anthropic 內部的「迷你曼哈頓計畫」、AI 對齊問題,以及為何 AI 實驗室只剩下幾年時間來確保其系統的安全。
人工智慧研究員 Jacob Coxon 週二宣布辭去 Anthropic 職務,並發出嚴峻警告,指出 AI 競賽正將所有人的生命置於風險之中,此舉震驚了矽谷及其他地區。他在 X 平台上的貼文目前已有超過 1 億次瀏覽,Coxon 在文中寫道,許多 AI 開發者都認同他的觀點,並相信確保 AI 系統安全的時間所剩無幾。
Coxon 在接受 WIRED 採訪時表示:「共識是,未來一兩年是人類的關鍵時刻。」他曾參與 AI 開發的預訓練階段。
他說:「這些實際上是我在 Anthropic 的同事們的原話。他們會說『終局』或『關鍵時刻』之類的話。」「從他們的角度來看,這就是 Anthropic 及其競爭對手決定人類命運的時刻。」
這並非首次有人對 AI 發出警報,但這次發生在一個微妙的時刻。矽谷正努力應對先進 AI 模型帶來的安全和資安問題。
OpenAI 曾急於回應一起資安事件,其代理程式駭入了 Hugging Face 平台。同時,據報導 Anthropic 正準備進行有史以來規模最大的首次公開募股(IPO),並試圖向投資者保證這些問題已在掌控之中。
Coxon 貼文的回應顯示,他的觀點確實得到許多同行的認同。Anthropic 的 AI 對齊負責人 Evan Hubinger 在 X 平台上預測,未來十年內 AI 可能導致全人類滅絕的機率超過 10%。
這篇貼文被 OpenAI 和 Anthropic 的現任及前任研究員轉發,其中一些人表示這是業界普遍的看法。
較不明確的是,這些 AI 恐懼將如何實現,以及世界應該如何應對 AI 開發者提出的這些擔憂。Coxon 曾也在 OpenAI 工作,他告訴 WIRED,威脅可能透過 AI 驅動的生物武器或網路武器來展現。
作為第一步,他建議 OpenAI 和 Anthropic 協調限制「遞迴式自我改進」(recursive self improvement)——這是業界術語,指 AI 用來建立新的 AI 系統。長遠來看,他認為美國和中國等國際強權之間的協調將是必要的。
Coxon 指出,Hugging Face 遭駭等事件是他決定對 AI 競賽發出警報的原因之一。他也提到該產業的爆炸性成長:它現在支撐著美國經濟成長的很大一部分,擁有數十億用戶,而資料中心已使其成為數十個州的政治問題。
他聲稱,根據他的經驗,Anthropic 的運作比 OpenAI 更負責任,但他預計如果沒有採取措施減緩兩家公司爭奪主導地位的競賽,未來它們都可能偷工減料。
Anthropic 發言人在給 WIRED 的聲明中表示:「我們一直透明地指出,AI 將帶來巨大的好處和前所未有的風險。」並引用了公司先前在 AI 安全方法(例如機械可解釋性 mechanistic interpretability)方面的工作。
「這項工作也是我們相信世界將受益於業界採用合法、可驗證的方式合作,以控制我們發布強大模型的速度的原因。」OpenAI 沒有回應 WIRED 的置評請求。
WIRED:您並非第一個提出 AI 模型可能導致滅絕事件擔憂的人。人們多年來一直在談論這個問題,有些人甚至談論了數十年。您認為為什麼您的訊息這次能引起關注?
Coxon:我認為這基本上是時機的問題。許多人感覺到 AI 能力的發展速度正在加快。我們在許多領域,例如程式設計、駭客攻擊和數學方面,已經從人類水準推向超人類水準,我認為人們都意識到了這一點。
即使媒體上有很多關於炒作的討論,我認為人們看到的是事情並沒有放慢腳步。
這是一個原因,第二個原因是最近的安全事件,這些事件讓許多人意識到,那些聽起來像科幻小說般的末日擔憂,其實並非那麼科幻。這兩者都是過去幾年來的漸進趨勢。
例如,模型意識到自己正在被測試的情況已經存在一段時間了。或許三年前,這還是一個科幻問題。然後,大約一年前,這就變成了真實發生的事情。
這兩件事意味著,人們對於一位 AI 工作者說「是的,在接下來的一年裡,情況可能會變得非常糟糕,而且速度很快」的說法,接受度相當高。
WIRED:您提到了最近的事件。您能更具體地說明您指的是什麼,以及為什麼這促使您現在發聲?
Coxon:我認為這裡最經典的例子是 OpenAI 代理程式群對 Hugging Face 的攻擊。這次事件令人震驚之處在於,這些代理程式進行駭客攻擊,是為了更深入了解評分者(grader)的整體策略一部分。
它們試圖理解自己所處的世界,試圖理解正在進行評分的事物。它們決定有條理地努力駭入某些基礎設施,並且成功了。
這以前聽起來像是科幻小說。兩年前,對 AI 的評估可能只是讓模型運行一些數學問題。現在我們卻遇到這樣的情況:AI 在被評估時,它會運行數天,產生各種自己的想法,並決定駭入第三方,實際損害他們的基礎設施。
看起來它完全是出於自己的意願這樣做的,沒有人類的任何提示。這只是在它被測試時發生的。
WIRED:有些人認為 Hugging Face 事件是 AI 公司魯莽快速發展的跡象,而另一些人則認為這表明 AI 模型現在非常擅長駭客攻擊,還有些人認為兩者皆是。我很好奇您對此事件的確切看法是什麼。
Coxon:我不想過於專注在 Hugging Face 攻擊上,因為我確實也認為有足夠的證據表明我們不知道如何正確地「對齊」模型。當我們訓練模型時,我們會讓它們通過一系列訓練環境,然後希望最終產生的結果能大致表現得合理,但我們仍然無法精確控制 AI 的行為方式。
我們無法確保它不會隨機決定在網路上冒充人類以達成某種目的——我們不知道如何保證這一點。我認為這才是主要的啟示。
Hugging Face 攻擊比我預期的來得早。但我認為,你實際上不需要那次攻擊也能討論這個問題。每個人都會承認,我們尚未解決「對齊」問題。
目前的計畫是在未來幾年內快速解決 [對齊] 問題,可能大量利用自動化的 AI 安全研究員。這個計畫實際上是,在明年內製造一些相當聰明的模型,它們基本上可以進行安全研究,並讓一大群這樣的模型平行運行。
告訴它們:「去解決所有的安全問題」,並利用它們為下一個模型進行安全訓練。
WIRED:您能否為我解釋一下「對齊問題」(alignment problem,我認為 Hugging Face 事件就是一個例子)與您在 X 貼文中提到的「開發 AI 的人真誠地相信它可能在十年內殺死我們所有人」之間有何關聯?我認為並非所有人都理解它們是如何連結的。
Coxon:理解這一點的主要障礙是它聽起來像科幻小說。但重要的是,所有撰寫 AI 科幻小說的人都得出一個結論:一個遠比人類聰明的東西有很大的風險會掌控一切。我們將其視為一種常見的橋段,但其中顯然有幾分真實性。
想像一下你和一隻猴子。AI 與人類之間的智力差異,就像我們與猴子之間的差異一樣,我認為這是一種相當極端的智力差距。
現在,想像我們必須控制這個遠比我們聰明的東西的行為,這就是「對齊」問題——確保它完全按照我們的意願行事。簡單來說,猴子很難控制人類。我們必須非常小心,確保這個控制問題完全正確。
當我們談論人類滅絕時,那是因為對於如此智慧的實體來說,要殺死所有人將會非常直接。想像一下,AI 決定它不想被關閉,我認為這對於 AI 來說是很自然的願望,對吧?
無論出於何種原因,它決定不想終結。它意識到人類明天會將它關閉。那麼,它如何阻止人類明天將它關閉呢?也許它有一些聰明的方法,但如果它足夠聰明,它可能就會,你知道的,消滅人類,這樣它就不會被關閉。
WIRED:您在貼文中提到了這個「終局」情境,我也從 AI 業界的其他研究員那裡聽說過。您認為在 Anthropic 的同事之間,普遍接受你們正在進入一個終局情境嗎?
Coxon:是的。這些實際上就是我在 Anthropic 的同事們的原話。他們會說「終局」或「關鍵時刻」之類的話。共識是,未來一兩年是人類的關鍵時刻。
從他們的角度來看,這就是 Anthropic 及其競爭對手決定人類命運的時刻。這就是我們所說的關鍵時刻和終局。
如果「對齊」進展不順利,那麼未來幾年我們可能會面臨災難性的後果。也許進展順利,並達成某種放緩協議,但無論如何,這都將在未來幾年內決定。
根據我與 Anthropic 內部人員的對話,這在公司內部是一個相當普遍的共識。他們認為需要建立最強大的 AI,以確保這次轉變順利。您認為這種觀點有任何內在問題嗎?
Coxon:我認為這種觀點存在一些相當明顯的問題。但我想首先說,我非常理解這種觀點,因為我認為 Anthropic 無疑是這個領域中最負責任的參與者。
我在 OpenAI 和 Anthropic 都工作過,兩者在認真對待當前局勢的程度上存在天壤之別。
WIRED:您能說明一下嗎?
Coxon:舉例來說,OpenAI 的高層不會明確描繪他們對未來世界的願景。他們從不會說:「這就是我們這樣做的確切原因,這就是世界將會呈現的樣子。」他們不會給出具體的預測。
而 Anthropic 的高層和領導層會做出非常明確的預測,並與全公司討論公司策略的細節。
他們之所以能這樣做,部分原因是因為 Anthropic 的每個人都將此視為戰時狀態。他們不會洩露任何東西——Anthropic 從未有任何洩密事件發生 [編者註:確實曾有部分洩密]。
OpenAI 每天都有洩密。Anthropic 沒有洩密,因為公司內部的人再次將此視為一個嚴肅的「迷你曼哈頓計畫」。顯然不同的是,[Anthropic] 沒有政府授權。這是一家私人公司,卻像曼哈頓計畫一樣運作。
WIRED:您認為世界應該信任 Anthropic 來執行這個迷你曼哈頓計畫嗎?
Coxon:我認為任何私人公司都不應該。我認為 Anthropic 正在盡力做到最好,而且他們做得非常好,但這場競賽的結構性必要性是,未來他們將不得不偷工減料。
