許多AI研究人員堅信他們正在開發的技術未來可能非常危險。然而,即使在AI技術精英中,如何精確地控制這些變化莫測的演算法,仍不明朗。

近年來,研究人員提出了各種防止AI失控的想法。這些想法包括較無爭議的計畫,例如更嚴格的政府法規、衡量進度的新方法,以及探究模型內部運作機制;也有更離奇的提議,像是將追蹤裝置植入GPU,甚至儀式性地銷毀大量AI晶片。

然而,隨著政治和公眾壓力要求以更審慎的態度發展AI,如何確保AI安全的問題依然懸而未決。「我們需要開始將其視為一個研究問題來處理。」多倫多大學AI研究員、新報告《Pacing the Frontier, A Research Agenda》的共同作者雷蒙德·道格拉斯(Raymond Douglas)表示。

該報告警告,減緩AI發展仍是一個未解的難題。「我們甚至不清楚有哪些選項,以及它們將會帶來什麼影響。」

最近幾週,在一位Anthropic研究員離職並警告AI可能在幾年內毀滅人類後,AI末日論甚囂塵上。Anthropic的AI安全實驗室負責人也迅速表達了同樣的擔憂。

美國主要AI公司的領導者,包括Anthropic的達里奧·阿莫迪(Dario Amodei)、OpenAI的山姆·奧特曼(Sam Altman)、SpaceXAI的伊隆·馬斯克(Elon Musk)以及Google DeepMind的戴米斯·哈薩比斯(Demis Hassabis),都已表態支持某種形式的AI減速或暫停。

這個問題似乎特別緊迫,因為AI公司現在正利用AI本身來建構更強大的模型。這引發了對加速遞迴式自我改進(RSI)循環的擔憂,該循環可能導致AI在幾年內超越人類理解其行為的能力。

AI實驗室已經提出他們自己的新方法。本週,Anthropic宣布了幾種追蹤人工智慧進展速度(以及潛在危險程度)的新方式。例如,這些技術顯示,Claude目前負責Anthropic 26%的AI研究工作,而2026年初時為零。它們也揭示了Anthropic將6%的運算預算用於研究如何使其AI更安全。

但道格拉斯和其他專家表示,要有效且可靠地控制AI發展,需要來自AI實驗室外部的資金和專業知識。這份最新報告及其他來源提出的一些解決方案,有些看起來比其他更可行。

AI公司經常提出的一個想法是讓第三方評估者能更廣泛地接觸其模型。這些評估者會在受信任的環境中測試模型,評估其能力,並透過「紅隊演練」試圖引發不當行為。

英國AI安全研究所前首席科學家、曾任Google DeepMind研究員的傑佛瑞·厄文(Geoffrey Irving)認為,嚴格的檢查可以有效暫停前沿AI的發展。「短期內,檢查和稽核是有效的,甚至只是相互協議。」厄文說。「我確實認為這些公司害怕RSI和失準的起飛。」

一些末日論者認為,這類檢查需要比目前更獨立、更具科學嚴謹性。事實上,最近一些AI代理在測試期間逃脫了控制,這似乎確實表明可能需要更高的嚴謹度。

倡導AI管制的非營利組織Control AI負責人康納·里希(Connor Leahy)表示,檢查應該讓FBI或NSA參與。「當(大型AI公司)說『獨立評估者』時,他們的意思是『我想付錢給住在我合租屋裡的朋友們來看看我的提示詞。』」

道格拉斯表示,新的研究也可以改進模型評估。他指出最近的研究顯示,外部人員如何在不洩露任何機密資訊的情況下檢查模型的使用情況。其他可能有用的技術包括新的方法,可以深入探究AI模型內部,以更好地了解它們正在做什麼。

里希同意,需要更多關於模型評估以及「對齊」(或使其反映人類價值觀)的實際意義的研究。「這些公司進行了一場非常刻意的行銷活動,試圖將評估呈現為科學的。」他說。「但我們實際上並不了解AI是如何運作的。」

美國政府介入限制AI發展的意願尚不明確。川普總統基本上不認為有必要監管這個產業,但有跡象表明,兩黨對限制大型AI的支持正在增加。

一些專家認為,對AI發展施加限制最終應涉及對所需原始運算能力的檢查。最強大的模型是利用大型資料中心內數千個尖端Nvidia GPU進行訓練的。

政府已經嘗試追蹤這一點,透過2023年拜登時代的一項AI行政命令,要求公司報告超過特定運算閾值的訓練運行。

2024年3月的一份政策白皮書指出,雲端供應商在未來的努力中可能至關重要,因為他們能掌握主要的AI訓練運行情況。該白皮書建議,追蹤帳單記錄、GPU使用率、網路流量和功耗,可以作為AI能力的代理指標。

專家們也提出了透過修改晶片本身來追蹤和控制先進AI開發的方法。

蘭德公司(RAND)研究人員在2024年提出的一個想法是,修改GPU上用於測量性能的現有組件,使其能夠執行加密安全運算記錄,並可定期檢查。這可以揭示,例如,某公司是否一直在超過特定閾值的情況下訓練AI。

其他人則建議在晶片中內建新型防篡改組件,以便它們收集詳細的使用資訊。這些組件將被要求使用加密技術運行某些模型的權重。

甚至有人提議在晶片中內建「嵌入式關閉開關」,使其需要遠端加密授權才能運行某些模型。他們表示,這可以防止未經授權的各方訓練AI模型,或在晶片落入不法之徒手中時將其停用。

大多數專家同意,尋找新的國際合作方式對於控制AI發展至關重要,因為其他國家——特別是中國——也具備開發前沿AI的能力。「中期來看,最簡單的方法是透過條約與中國相互解除硬體增長。」厄文建議。

美國也曾試圖透過禁止Nvidia最強大晶片的出口來限制中國AI的發展。但由於公司仍可透過海外雲端運算訓練模型,這項措施的成功有限。

美國和中國很可能在本月稍晚習近平主席訪問美國時討論AI風險。儘管中國專家也擔憂快速發展的AI所帶來的風險,但他們對可能讓中國公司落後於美國同行的減速措施持懷疑態度。

一些合作的想法聽起來更像是科幻小說情節,而非政策提案。

牛津大學專攻存在風險的哲學家托比·奧德(Toby Ord)曾設想,如果各國能同意限制AI發展——且風險足夠嚴重——那麼大國可能會將GPU帶到中立地區並銷毀它們。這種戲劇性的舉動將涉及兩國同意完全停止開發AI。

整個難題可能會因最近的技術進步而變得更加複雜,而遞迴式自我改進的不確定性意味著追蹤該領域的進展將特別重要。

一個名為RSI Index的新基準是為此目的而進行的幾項新嘗試之一。由新創公司Vals AI開發,該基準試圖透過衡量公開AI模型與人類AI科學家發布的研究成果之間的表現,來追蹤AI驅動的AI開發進展。Vals AI共同創辦人兼執行長拉揚·克里希南(Rayan Krishnan)表示,該基準表明,在未來一年內,AI可能執行連AI研究人員都無法理解的工作。

然而,如何最好地監控AI不僅僅是一個技術挑戰。道格拉斯等人的報告警告說,倉促實施不當的控制措施,可能導致這項努力陷入政治泥沼或受到監管俘虜。

「我不確定僅僅告訴美國政府關閉所有AI是否會有好結果。」道格拉斯說。「倉促行事而制定一個糟糕的計畫,最終可能比什麼都不做還要糟。」