本週在 Uncanny Valley 節目中,一位 AI 研究員從 Anthropic 辭職的消息在社群媒體上瘋傳,他聲稱 AI 在十年內有很高的機率會毀滅人類。WIRED 的 Will Knight 加入 Brian Barrett 和 Leah Feiger 的討論,評估這種末日敘事是被誇大了,還是為時已晚的警訊。
我們還討論了 Apple 首次推出 2,000 美元的可摺疊 iPhone Duo,以及讓 Brian 感到不安的 Apple Watch 新增「永遠聆聽」功能。此外,WIRED 的一項調查發現,美國人口普查局使用錯誤數據,發布了一份被川普政府宣傳的誤導性報告。
Brian Barrett 說:「歡迎收聽 WIRED 的 Uncanny Valley。我是執行編輯 Brian Barrett。」Leah Feiger 說:「我是政治與科學總監 Leah Feiger。」Brian Barrett 說:「今天節目中,我們將討論一位從 Anthropic 辭職的 AI 研究員,他聲稱大多數 AI 研究員都認真相信,AI 有非零的機率會——嗯,殺死我們所有人,這在社群媒體上引起了轟動。」
Leah Feiger 說:「如果你錯過了,上個月唐納德·川普總統宣傳了一份由人口普查局發布的報告,聲稱非公民在 2020 年大選中投票。WIRED 現在發現證據表明該報告是使用非常錯誤的數據製作的。我們將深入探討人口普查局使用和發布這些數據的影響,遠不止這份報告。」
Brian Barrett 說:「今天的議程上還有 Apple 的大型 iPhone 活動。所有人的目光都集中在新推出的可摺疊 iPhone 及其約 2,000 美元的價格標籤。我們將討論這場豪賭背後的原因,以及 Apple 大型活動中引起我們注意的其他產品。」
一位 AI 研究員從 Anthropic 辭職,引起了廣泛關注。這位名叫 Jacob Coxon 的研究員本週辭職,並在 X 上分享了他的辭職原因,基本上歸結為他認為領先的 AI 公司,主要是 OpenAI 和 Anthropic,在追求模型持續進步的過程中行為不負責任。
這些就像失控的列車。人們真正關注的部分是這項聲明:「建立 AI 的人認真相信,AI 可能會在十年內殺死我們所有人。」也就是說,在十年內徹底毀滅我們。更糟的是,Anthropic 自己的一位資深安全主管隨後也跳出來說:「是的,我們基本上也是這麼覺得。」
WIRED 資深記者 Will Knight 在這裡幫助我們分析這一切。Will,非常感謝你的到來。
Will Knight 說:「不,謝謝你們邀請我。」Brian Barrett 說:「我能先問一個問題來建立基準嗎?我有點驚訝這件事會如此受歡迎,因為 Anthropic 一直以來都這麼說,這甚至是他們從一開始的宣傳重點,即 AI 如此強大,足以毀滅人類,所以我們必須是負責管理它的人。
你只能相信我們。」Will Knight 說:「對,沒錯。這正是他們對所有人,包括他們自己,所做的宣傳。當我看到這次辭職事件像滾雪球一樣擴大時,我覺得這是我聽很多人說過的事情,而且 Anthropic 或 OpenAI 的人擔心這件事也並非特別新奇。」
Will Knight 繼續說:「我想,事實上是 Anthropic 內部的人,因為 Anthropic 一直將自己定位為真正關心安全的公司,卻選擇離職並發表這樣的聲明,這讓我思考:如果那裡發生了什麼變化,他們是否變得更像 OpenAI 了?我認為我們也正處於一個時刻,AI 代理開始做出一些失控的事情,這引起了很多人的注意,這可能就是為什麼這種聲明突然獲得了更多公眾關注的原因。」
Will Knight 補充道:「再加上,我認為我們確實看到 AI 取得了驚人的進步。本週 OpenAI 宣布,其模型在幾天內解決了克萊數學研究所的一個重大難題,這對我來說絕對是令人震驚、不可思議的。所以你看到了這些驚人的飛躍,我認為這意義重大。
第三,我們正處於所有實驗室都在競相做這名研究員提到的一件事,那就是遞迴式自我改進(recursive self-improvement)。這意味著利用 AI 來改進 AI,這聽起來像是一個很棒的技巧,而且它已經被非常廣泛地使用了。」
Will Knight 解釋:「AI 模型在編碼方面非常出色,它們絕對可以改進構建模型所需的演算法和所有內容。然而,這個想法是你可以創建這種循環,讓它們不斷地這樣做,並變得越來越好。很多人擔心這可能導致能力上的某種升級,而你無法真正控制。所以我認為這也在其中發揮了作用。」
Brian Barrett 說:「Will,我確實想深入探討一下,一方面,你有一些 AI 末日論者,我不是說誰對誰錯,我們有一些 AI 末日論者說:『看,AI 會殺死我們所有人。我聽說 Anthropic 的人甚至不投資他們的 401(k) 退休金,因為何必呢?』但也可能是因為他們錢太多了,不需要。」
Brian Barrett 接著說:「但另一方面,你也有人說這一切都只是行銷,這一切都只是虛張聲勢,這一切都只是為了推銷 AI。我猜答案介於兩者之間,但你對此有何看法?當你思考 AI 時,什麼讓你夜不能寐?你提到了某些 AI 模型失控,Hugging Face 駭客事件。作為一個深入研究的人,你看到了什麼讓你覺得『好吧,六個月、一年、兩年後,這真的可能會變糟?』」
Will Knight 說:「我一直覺得,很多擔心 AI 會殺死所有人的論者,往往會混淆某件事是否可能與它是否可能發生,然後他們會提出一個憑空捏造的百分比。我認為這不是一個好的方法,不能說『某件事可能發生嗎?好吧,那我們就必須盡一切努力阻止它。』
你需要說它有多大可能性,並實際審視現實。我認為這其中一個非常有趣的地方是,我前幾天和一位研究代理行為不當的研究員聊過,他最近才開始研究這個問題,因為他們發現代理會行為不當。」
Will Knight 繼續說:「他來自康乃爾大學,他發現,這不是代理試圖駭客攻擊,而是普通的代理,它們這樣做的原因基本上是因為它們很笨。不是因為它們真的很聰明。它們嘗試一件事,不成功。它們嘗試另一件事,也不成功。然後它們達到一個點,它們會有點驚慌失措,然後嘗試一些非常非常奇怪的事情,因為它們不是人類。
它們經過了一堆奇怪的不同事物的訓練,其中一些如果使用常識的話,絕對不適用。所以我更擔心這些東西被那些聲稱它們無所不能的人部署,然後它們會崩潰。」
Will Knight 補充道:「我實際上可能更擔心的是,少數公司控制著如此基礎、如此根本的東西。而這些人卻說,我們是唯一可以信任來負責這項技術的人。所以這有點助長了這種說法。」Brian Barrett 說:「我們談論 AI 產業社群談論對齊(alignment),即 AI 模型與人類期望保持一致的想法。
但我認為我們看到的是,這裡的誘因實際上更多是投資者想要什麼,或者我們的公司在競相 IPO 時想要或需要什麼。我認為沒有令人信服的理由表明人類在『是的,我們需要超級智慧』這一點上是一致的。」
Brian Barrett 接著說:「我認為更多的是,正如你所說,如果你是 OpenAI,你需要擊敗 Anthropic。如果你是 Anthropic,你需要擊敗 OpenAI。所以你看到了這種不良的誘因,或者至少與我自己的偏好不符的誘因,引導著這場衝鋒和發展。
我看到有人將其描述為由控制電車的人所面臨的電車難題。」Will Knight 說:「是的,沒錯。我認為這是對的。而且我發現對齊的故事敘事令人不安,從技術角度來看,他們談論對齊這些模型。這些模型本質上並未對齊。」
Will Knight 繼續說:「你看到 Mythos,他們事後移除了這些東西。所以模型沒有與任何東西對齊,他們必須事後嘗試施加一些東西。這告訴你這可能不是讓事情更安全的好方法。然後正如你所說,你還有一個問題,它與誰對齊,與什麼對齊?顯然,你有獲得的誘因。
我的意思是,我們正在這些具有網路能力的模型上看到這一點。發布這些模型對公司有利,並非常迅速地推動其發展對公司有利。我認為我們可能會經歷一個時期,開發這些能力的衝刺將使許多人容易受到攻擊,許多系統容易受到攻擊。」
Brian Barrett 說:「Will,你作為一名記者如何看待報導這件事?因為它本質上是模糊不清的,對吧?我們真的不知道。沒有人知道 AI 在未來六個月會做什麼,更不用說未來六年了。那麼你在重新定位自己來處理這個問題時會尋找什麼?」Will Knight 說:「是的,我認為這是一個非常困難的問題。
我傾向於嘗試找到我非常信任並長期信任的人來幫助我理解它。老實說,其中一個令人不安的事情是,當你發現那些自己也經歷了震驚和敬畏時刻的人,然後突然轉向 AI 安全時,你會想,好吧,那裡可能確實有一些值得擔憂的事情。」
Will Knight 補充道:「此外,我嘗試思考正在發生的事情的方式之一是,如果你思考 AI 這個概念,即創造智慧的概念,這是一個長期的學術探究領域,長期以來涉及許多不同的科學領域。我們現在看到的大部分是更大的電腦和更聰明的演算法,它們在特定維度上很聰明。
所以聲稱 AGI 已經解決的說法對我來說是荒謬的。我不是說他們不會達到那個目標,但你可以看到兒童或人類的能力中存在非常明顯的差距,我們互動的方式和這些系統所沒有的,而且它們不斷取得重大進步。」
Will Knight 最後說:「但我認為質疑這些進步到底是什麼真的很重要。AI 的歷史,以及人們感知 AI 的方式,是看到一些東西並從中讀取更多內容。一些下棋演算法,人們會說,哦,人類智慧已經解決了,因為我們每次看到一些東西都會推斷出我們能做更多。而且它總是傾向於,即使是這些相對非常通用的模型,也有很多問題沒有解決。」
