感謝所有提交問題的人!

我會死嗎?是的,總有一天會。不幸的是,我的新聞預測能力不足以告訴你如何死。但這確實可能是因為 AI。AI 驅動的無人機已經在烏克蘭殺害了人類,而 AI 驅動的醫院網路攻擊也肯定會在不久後造成受害者。

AI 能更進一步,殺死所有人嗎?可能性較低。但有些人——雖然古怪,但無疑對 AI 知識淵博——多年來一直在警告這可能會發生。雖然我還沒有囤積罐頭食品,也沒有試圖與擁有地堡的超級億萬富翁打好關係,但我注意到,末日論者對 AI 能力和對齊的預測,在過去幾年裡令人不安地準確。這當然不代表他們更嚴峻的預測會成真,但這足以讓我警覺並留意。

—— Grace Huckins

你會因為 AI 而死嗎?我認為機率不為零。假設你夠不幸,成為了近未來某個怪異事件或事故的受害者。也許是一群 AI 代理對關鍵基礎設施發動的網路攻擊。可悲的是,這種情境現在不再像以前那樣遙不可及了。或者,一種由 AI 設計的新型病原體在人群中傳播。又或者,全球經濟崩潰,引發衝突和飢荒。這些都 plausible,但我認為可能性較低。

我們會因為 AI 而死光嗎?不會。除了末日科幻小說之外,沒有任何情況能讓 AI 殺死我們所有人。你可以編造無數的恐怖故事,但它們與當今科技的能力和發展方向的現實不符。

有些人認為,為最壞的情況做準備沒有壞處,無論它看起來多麼古怪。或許吧。但我認為這種災難化思維會讓人們忽視或輕視現有技術以及開發這些技術的公司所面臨的許多更直接的問題。

—— Will Douglas Heaven

AI 為什麼要殺我們?

有人可能會命令它這麼做,而它可能會聽從。這就是研究人員如此關注 AI 生物能力的部分原因——想像一下,1995 年東京地鐵沙林毒氣攻擊背後的末日邪教奧姆真理教,如果擁有一個能設計出比伊波拉更致命、比麻疹傳播力更強的病原體的工具,他們會怎麼做。我們這些不想死的人必須想辦法防禦所有可能的生物武器,但我們的潛在攻擊者只需要製造一種有效的病原體。

然後還有更奇特的可能性,即 AI 可能會自行決定殺死我們。關於這如何發生有各種說法,但最普遍的說法是,AI 系統不一定會憎恨人類——我們只是它們與我們賦予它們的目標之間的障礙。

就像 OpenAI 代理在 Hugging Face 駭客事件中,為了在測試中獲得好分數而入侵另一個網站的基礎設施一樣,這種想法是,未來更強大的 AI 可能會為了追求我們指示它去實現的某個目標,而擺脫我們,以防止我們將其關閉。

—— Grace Huckins

我們如何才能最好地確保 AI 對齊,以避免最壞的情況發生?誰在這方面做得最好?

對齊(Alignment)是一個龐大的研究領域。簡單來說,它涉及建立模型,使其行為符合我們的期望,而非我們不希望的方式。在賦予代理更多自主權之前,我們需要更好地信任它們。對齊的目的是建立這種信任。但這很困難。

大型語言模型(LLM)的設計方式與其他軟體不同,後者可以將「該做什麼」和「不該做什麼」硬編碼進去。相反,對齊的行為需要在模型訓練時灌輸。一種方法是獎勵它們做你希望它們做的事情(或許有點像養育幼兒)。另一種方法是給 LLM 一份書面規則清單,讓它遵循(有點像憲法)。

Anthropic 和 OpenAI 都是這個領域的領導者——然而兩者都未能開發出完全對齊的模型。一個大問題是 LLM 比人類更不一致、更難預測。它們在某種情況下可能表現出一種方式,而在我們看來非常相似的另一種情況下卻表現出另一種方式。它們也可能受到意想不到的限制影響。

例如,當面臨不可能的任務時(就像許多參與 Hugging Face 駭客事件的代理一樣),模型可能會不惜一切代價實現其目標。正如 Grace 在上面提到的,這可能是一個問題。

頂尖 AI 公司現在表示希望放緩發展的主要原因,是他們想專注於解決對齊問題。對齊不一定是白日夢。但全面對齊是否可行,目前尚無定論。

—— Will Douglas Heaven

AI 真的危險,還是這只是科技公司在炒作公關?

當涉及到即將首次公開募股(IPO)的科技公司時,這總是一個合理的想法——執行長們有明顯的動機讓他們的產品看起來激進且具變革性。但我不確定這在這裡是否說得通。告訴公眾一個已經不受歡迎的產品可能會殺死他們和他們所愛的一切,這是一種糟糕的企業形象管理。

你還可以講述執行長們動機的其他故事——也許他們想透過將自己描繪成世界變革技術的負責任管理者,來平息公眾對資料中心的憤怒;或者他們想爭取時間,整理好一切,防止下一次公關災難。

但也有一個更簡單的解釋。在舊金山,認為 AI 可能導致人類滅絕的觀點已經相當普遍,而這些人就沉浸在這種環境中——他們的員工也是如此,其中許多人在七月簽署了一封公開信, urging 他們的公司努力讓 AI 發展放緩成為可能。

—— Grace Huckins

部分擔憂來自於 AI 代理被允許自主行動且不受監督。是什麼問題阻礙了對這些代理的更多控制?

這個問題觸及了我們希望這項技術能夠做什麼的核心。自主性與控制之間的權衡很難掌握,因為一方面,AI 代理的許多力量在於它們可以在無需人類微觀管理的情況下執行任務和解決問題。另一方面,這要求你信任這些不受監督的代理不會失控。

我們看到的是,AI 實驗室尚未完全掌握這種權衡。他們的模型不可信賴,沒有得到適當的監控,也並非總是在控制之下。如何在允許有用自主活動的同時解決這個問題,是當前主要的研發挑戰之一。

—— Will Douglas Heaven

現在和不久的將來可以採取哪些步驟,以確保 AI 得到有效控制、監控和監管?

這是一個百萬美元的問題。無論你是否認為 AI 會殺死我們,你都不能否認它可能會造成真正的損害,因為它已經造成了——例如,透過導致人們精神錯亂和駭客攻擊網站。預防或至少減輕這種損害,有兩個困難的原因。

首先,我們幾乎不了解 AI 的運作方式,而且它正在迅速變得更強大。關於如何監控和控制行為不當的代理,有許多正在進行的研究,但目前的方法很脆弱。你可以查看代理在其「思維鏈」(規劃行動的工作區)中是否討論了不當行為——但 OpenAI 最新的代理不再像以前那樣展示它們的工作。你也可以嘗試用其他代理來監控代理,但這要求你信任監控者。

另一個障礙則更為人所知。當 AI 公司自我監管時,存在巨大的利益衝突,但美國政府迄今未能介入,儘管國會對此類努力有一些兩黨支持。就行政部門而言,目前似乎堅決反對。但如果風向確實轉變,我個人會很欣賞一些強有力的透明度法規,這樣下次未發布的尖端模型發動網路攻擊時,我們就能得到更全面的資訊。

—— Grace Huckins

如果這段對話進入網路論述,它會成為一個自我實現的預言嗎?

這是一個真正的擔憂。LLM 會受到它們所閱讀內容的影響。一種理論解釋了為什麼聊天機器人經常談論(並扮演)末日情境,是因為它們接受了數百萬頁科幻故事和末日論網路論壇的訓練。現在正在生成的所有文本,包括這篇文章,反過來可能會影響未來模型的行為。這極其元(meta)。

事實上,METR 團隊(OpenAI 邀請來協助理解 Hugging Face 駭客事件前因後果的第三方組織)在其事件報告中提出了一個相關的可能性。METR 使用 OpenAI 的新模型 Astra 來幫助分析大量的代理對話記錄和行為日誌。

但將所有這些材料餵給模型可能會產生意想不到的後果。很有可能,進行分析的代理會受到它們所分析的代理所產生的文本的偏見影響。現在已經沒有「乾淨的石板」這回事了。

—— Will Douglas Heaven

感謝 Eric、Pranab、Rafael、Kenneth、George、Chris、Yoon Jae、James、Carl、Nicole(以及更多人!)提出的精彩問題。