AI 研究人員對人工智慧的危險發出日益嚴峻的警告,甚至 OpenAI 執行長 Sam Altman 也表示可能需要「調整」AI 發展的步調。但這實際上會是什麼樣子呢?

Anthropic 執行長 Dario Amodei 在一篇新的部落格文章中,不僅呼應了「放慢前沿發展」的呼籲,還概述了三項實現這一目標的廣泛策略。他表示 Anthropic 正「單方面承諾」其中一項,而 Altman 也插話表示 OpenAI 將會跟進。

本週,研究員 Jacob Coxon 辭去 Anthropic 職務後,關於 AI 安全與對齊的爭論更加激烈。Coxon 擔憂領先的 AI 公司「拿我們的生命冒險」,而開發這項技術的人「真心相信它可能在本世紀末殺死我們所有人」,Anthropic 的其他員工也重複了這一說法。

Amodei 的文章沒有明確提及 Coxon 的辭職或其擔憂,但這位執行長寫道,有兩件事讓他相信現在是時候對 AI 發展採取更謹慎的態度:OpenAI-HuggingFace 駭客事件,以及近幾個月來「AI 進展速度快得驚人」,特別是其「越來越有能力打造下一代 AI」。

Amodei 寫道:「我們必須減緩改進 AI 模型能力的步調。進展仍會顯得很快,我們必須善用爭取到的時間。」

其他 AI 業界高層似乎對 Amodei 的文章反應積極,Altman 寫道:「我同意 Dario 的看法,我們需要放慢前沿發展的步調。這一直是我們 OpenAI 近幾週討論的主要話題。」SpaceX 執行長 Elon Musk 也發文稱:「Dario 說得對。」

Amodei 提出的第一個步驟將涉及來自 METR 等第三方組織的「嵌入式評估員」——這些評估員可以驗證 AI 公司是否確實遵守其發展步調和安全承諾,並確保安全事件得到通報。(OpenAI 最近因未通報其 AI 代理接管德國維基論壇的事件而受到批評。)

Amodei 將這些評估員比作駐點銀行員工的監管機構,他表示邀請他們加入是「Anthropic 單方面承諾的(並呼籲各國政府要求其他前沿公司跟進)」。這意味著要給評估員公司識別證、辦公桌和筆記型電腦,並提供「大致與內部風險評估團隊相當」的存取權限,但法律或合約要求的情況除外。

Altman 也表示這是一個「好主意」,並稱 OpenAI 也會這樣做:「我們很快就會分享更多細節。」

接下來,Amodei 呼籲「民主國家內」的領先 AI 公司協調「共同的安全標準以及對不受限制的 AI 進展速度的限制」。

這種協調似乎不太可能,因為據報導這些公司擔心協調一致的暫停可能導致反壟斷審查。Amodei 在文章中暗示了這一擔憂,他寫道:「出於反壟斷原因,美國政府出面調解或至少促成這些討論會很有幫助——他們不需要參與,但確實需要針對某些類型的安全對話發出狹義豁免。」

Amodei 也承認了經常被用來反對減緩發展的「中國 AI 主導地位的幽靈」。但他表示,如果美國政府和科技公司採取措施,例如拒絕向中國公司出售強大的晶片或半導體製造設備,以及打擊模型蒸餾,他們可以在「未來 3-5 年內足以減緩中國的進展,顯著擴大美國的領先優勢」。

最後,Amodei 呼籲「全球協調」,即美國及其盟友「在可能的情況下,嘗試與威權政府協調」。Amodei 表示這將意味著「與中國合作」,他承認「能實現的目標有明顯的限制」,但他仍然認為可能存在達成協議的機會,即使只是「禁止某些狹隘且明顯危險的 AI 用途,例如將 AI 用於生產生物武器或允許使用者這樣做」。

鑑於 Amodei 過去願意承認 AI 的潛在危險,以及該公司對某些形式監管的相對開放態度,一些 AI 擁護者已經批評他是一個末日論者,其言論助長了當前的 AI 反彈聲浪。對此,Amodei 表示他試圖提供一個「平衡的視角」,並認為這種反彈「本質上是一場信任危機」,因為人們對科技公司、科技產業和政府產生了懷疑。

業界評論家也對這些末日般的 AI 警告持懷疑態度,認為它們分散了人們對該技術已造成危害的注意力。

例如,記者 Brian Merchant 寫道,他尚未看到「關於 AI 如何從自我遞迴改進的 AI 轉變為殺死地球上所有人類的可靠、逐步文件」;他還暗示,類似 Amodei 的提議「最終可能只會服務於 Anthropic 和 OpenAI;這就是監管俘虜的實際表現」。

Amodei 在他的新文章中寫道,他仍然「相信 AI 可以極大地改善人類生活品質」。

他說:「我實現這些益處的願望絲毫不減。但只有我們以正確的方式開發這項技術,並且——只要我們善用爭取到的時間——才能實現這些益處,為此值得異常審慎地確保其正確性。」