今年稍早,Rishub Jain 在一次頓悟後,辭去了他在 Google DeepMind 的人工智慧研究員職位。當他開發新模型時,他開始相信他和所有在 AI 前沿工作的人都在放棄控制權。透過利用 AI 的編碼技能加速下一代模型的開發,他正在將自己從這個等式中移除。
AI 實驗室希望將這種方法發展到 AI 可以無限期地自我改進的程度,這個過程被稱為遞迴式自我改進。Jain 認為,讓人類參與其中對於維持對這項技術的控制,並避免可怕的後果至關重要。他告訴 WIRED:「AI 的進步正在加速,隨著 AI 能力越來越強,它帶來的風險也越大。」
他對 AI 模型如何建立其繼任者可能缺乏適當的可見性感到不安,以至於他在六月辭職。Jain 是越來越多公開表達這些擔憂的 AI 研究員之一。
最近幾週,這種恐慌情緒加劇。AI 能力的驚人進步——OpenAI 的一個模型在數小時內解決了一個數百年來的數學問題——伴隨著一系列安全事件,這些事件看到大量代理程式脫離控制,入侵其他系統。
本週,研究員 Jacob Coxon 宣布辭去 Anthropic 的職位,並警告 AI 公司「正直接衝向自我改進的超級智慧,並拿我們的生命下賭注」,這些擔憂達到了高潮。一位 Anthropic 的資深主管——負責 AI 安全工作——也提出了類似的直言不諱的評估:「我們確實真誠地相信 AI 可能會殺死所有人類!我個人認為在未來十年內,這種可能性超過 10%。」
MIRA 研究非營利組織的電腦科學家 Nate Soares 表示:「我確實認為遞迴式自我改進的願景正在嚇到人們。」他也是《如果有人建造它,所有人都會死》(If Anybody Builds It, Everybody Dies) 一書的共同作者,該書認為超人類 AI 將導致人類滅絕。他補充說:「這開始感覺真實了。」
遞迴式自我改進的一個關鍵組成部分是自動化開發過程的「回饋循環」概念,讓 AI 變得越來越強大。目前沒有任何前沿 AI 實驗室聲稱已實現這種完全自主的改進循環;它目前仍停留在理論階段。
然而,它已經激發了一些資金雄厚的初創公司(例如 Recursive Intelligence)的成立,以及大型公司關於「魔法師的學徒」式意外後果的警告。Soares 是對齊(一個旨在使 AI 與人類價值觀匹配的技術領域)工作的先驅,他說越來越明顯的是,沒有實際方法可以保證 AI 會循規蹈矩。
Soares 說:「我認為很多人曾幻想,隨著這些東西變得更聰明,對齊會變得更容易,但現在它卻變得更難了。他們就像在說『噢,糟了』。」
Soares 表示,他經常與大型 AI 實驗室內擔心他們正在進行的研究可能帶來後果的人交談。他說:「我傾向於建議他們辭職,但他們說那樣做沒有任何意義。然後 Jacob 辭職了,我們就看看誰是對的。」
《AI 2027》的作者 Daniel Kokotajlo 也對遞迴式自我改進感到擔憂,這是一個警告日益強大 AI 危險的具影響力專案。目前正在進行的這項工作版本通常涉及派遣數千個代理程式協同解決一個問題,由於涉及的巨大複雜性,這進一步抽象化了監督和控制。
許多末日論者似乎都同意,大型 AI 公司的激勵機制與良好結果並不一致,特別是當 OpenAI 和 Anthropic 都在衝刺各自的首次公開募股(IPO)時。Coxon 在 X 上寫道:「在 Anthropic,利害關係眾所周知,但他們卻被鎖定在一場搶先抵達的競賽中。」
Kokotajlo 指出,早在 Coxon 病毒式辭職、眾多駭客事件和數學突破之前,擔憂的鼓聲就已經響起。Anthropic 高管自公司成立以來就表示,AI 可能代表著一種生存威脅。七月,超過一千名頂尖 AI 工程師簽署了一封公開信,呼籲協調放緩先進 AI 的發展。他將最近的擔憂歸因於遞迴式自我改進的幽靈,而不是其他任何原因。
但這也發生在人們擔憂大規模資料中心建設和 AI 可能導致失業之際。對 AI 公司——以及 AI 研究人員本身——的信任可能正處於歷史最低點。
Kokotajlo 說:「人們正在覺醒並說『這些公司實際上正在試圖建立超級智慧……什麼?這太瘋狂了。』」
繼續開發 AI 的風險有多大很難量化。但當被要求解釋 AI 究竟如何可能消滅創造它的物種時,Soares 提出它可能以多種方式發生。這可能涉及操縱人類引發災難,或控制一支殺手機器人軍隊。
Soares 建議,其中一個更容易想像的場景可能涉及連接到生物實驗室的 AI。他說:「我們可以說我們會關閉它,但它可能會說:『不幸的是,我掌握了你的關閉開關,那就是這種超級病毒。』」(Coxon 在接受 WIRED 採訪時也提出了新病毒的想法,而 Anthropic 週四表示,由於擔心生物武器,他們已切斷了幾位外部研究人員的訪問權限。)
不過,AI 不必消滅人類就能造成危害。許多專家預測,更強大的模型將導致一波 AI 輔助的網路攻擊。這項技術現在被廣泛用於散佈假訊息的活動中,而軍事上對 AI 的採用也正在迅速加速。
儘管如此,並非所有人都認為末日是不可避免的。前 Google DeepMind 研究員 Jain 最近創立了 Sampura Research,這是一家致力於開發對齊技術的公司,這些技術涉及讓人們參與其中,即使 AI 負責大部分判斷行為好壞的工作。他指出,現在有大量資金投入像他這樣的 AI 安全新創公司。
Jain 似乎對 AI 仍能被馴服抱持希望。他說:「你可以問 AI,『這項任務安全嗎?』它會做出判斷,但我們認為結合 AI 和人類來執行這項任務將帶來更好的表現。」
