今天我將與 Microsoft AI 的執行長穆斯塔法·蘇萊曼(Mustafa Suleyman)對談。你肯定知道,目前科技界最熱門的話題就是關於 AI 安全與監管日益激烈的辯論。

穆斯塔法對於 AI 應如何建構與監管抱持強烈看法,這不足為奇。Microsoft 最近發布了一份長達 37 頁的聲明,名為「人文主義 AI 行為準則」(Humanist AI Code of Conduct),闡述了公司在 AI 開發方面的原則,甚至包括對 AI 意識等棘手問題的哲學觀點。

如果你還記得他上次上節目時的說法,穆斯塔法認為像 Anthropic 這樣的公司,在所謂「模型福利」(model welfare)的概念上產生了相當危險的混淆。他本週還發表了一篇配套文章,專門批評 Anthropic 對 AI 意識的哲學觀點,以及他認為這如何融入更廣泛的「對齊」(alignment)辯論中。

因此,我非常想與穆斯塔法討論,他認為 AI 安全中哪些是真實的、哪些不是,以及「對齊」這個概念本身是否足以應對挑戰,以及這個產業是否需要在毀滅我們所有人之前放慢腳步。此外,為什麼 AI 產業還沒有開始做這些事情?我一直很喜歡與穆斯塔法深入探討,而他也很樂意在這裡與我暢談。

好的,Microsoft AI 執行長穆斯塔法·蘇萊曼將談論 AI 監管的未來。訪談開始。本次訪談為求篇幅與清晰度已稍作編輯。穆斯塔法·蘇萊曼,您是 Microsoft AI 的執行長,歡迎回到 Decoder。很高興見到你,Nilay。謝謝你再次邀請我。

我也很高興見到你。我非常期待與你討論 AI 安全與監管辯論中究竟發生了什麼。你剛發表了一份非常長、非常詳細的文件,闡述了你的原則,也就是 Microsoft 關於你所稱「人文主義 AI」的原則。

文件中有很多我想深入探討的想法。我越思考這次對話,就越想從一個非常基礎的問題開始。這是我一直以來略有察覺,但可能是所有問題根源的東西。我們談論 AI 安全的基本方式,就是所謂的「對齊」(alignment)—— 我們將以某種方式讓模型內在地做正確的事情。

這其中存在一些機制。關於對齊、未對齊、Hugging Face 攻擊以及模型發生的事情,已經有很多討論。但是,「對齊」是否已經失效了?它有可能成功嗎?或者這根本就是錯誤的方法?

是的,我認為這是一個重要元素,但不是唯一的。三四年前,我在我的書中寫到了「約束」(containment)這個概念。實際上,開篇章節就在討論約束是不可能的,擴散是不可避免的。在 99% 的情況下,這是一件非常好的事情。我們希望技術能夠盡可能快速地廣泛傳播,讓每個人都能享受到好處。

同時,如果你展望未來五年,我們總是會被下一個季度或下一年所困擾,每個人都會有點慌亂並產生巨大的分歧。但如果你想像一下三年前的 GPT-3 和今天的 GPT-6 之間的差異,然後再想像 GPT-6 和 GPT-9 之間的差異。那將是三倍的運算量級,在預訓練中應用於這些運行的浮點運算(FLOPS)將增加 1,000 倍,我們將會擁有令人驚嘆的東西。它將在許多方面都表現得絕對不可思議。

我不認為這是在誇大其詞。我認為這只是基於過去五年所取得的進展,一個非常明顯的實證陳述。如果這種趨勢持續下去,那麼問題將真正聚焦於「約束」和「對齊」。當然,我們希望這些系統能與我們的價值觀對齊,但首先我們必須確保它們受到約束,其自主性受到限制,它們不會逃脫框架,不會獎勵駭客行為,它們是可控的,並且遵循我們的指令。

然後,我們希望確保它們與我們人類的目標對齊。這就是我們本週發布「人文主義 AI 行為準則」的目的。Microsoft 的立場非常簡單:科技是為了服務人類。它應該是一種從屬的、可控的、與人類目標對齊的力量,並在世界上行善。如果它無法實現這一點,那麼我們就應該拒絕它。

在我看來,我們離那個目標還很遠。雖然今天尚未發生,但鑑於今年夏天 Hugging Face 和 OpenAI 發生的事件,現在已經很清楚,這些缺乏安全防護措施的系統,具備令人印象深刻且相當可怕的駭客能力。

我想盡可能用一個貼近現實的比喻來說明,因為這是我主要的問題。如果我設計了一輛車,而它有 10% 的時間煞車踏板會決定去攻擊我鄰居的房子,我就會說:「這輛車壞了。煞車的技術本身就有問題。我需要一個新的想法。」我認為我正在對「對齊」提出這個問題。

感覺這種讓模型安全的方法已經擱淺了。如果是這樣,那麼我對這場辯論的理解就會是一種方式。如果「對齊」及其技術有可能成功、有用或一致,那麼我對這場辯論的理解可能就會是另一種方式。那麼,你認為「對齊」有潛力達到 100% 的安全嗎?

我的意思是,我們來看看樂觀和悲觀的兩種情況。如果你回顧過去三年,我認為推動進步的主要變化是模型變得更具「可引導性」(steerable)。它們會遵循指令,你可以為它們設定越來越複雜的目標,要求它們在多個時間步驟中,使用各種工具精確地執行任務。

這證明了在過去三四年中,我們的「對齊」程度是增加了,而不是減少了。我們不再像前幾代模型那樣,過多地談論幻覺、偏見或所有這些小問題。

另一方面,我們在 Hugging Face 事件中看到的,是一個分水嶺時刻。成群的代理(agents)相互勾結。它們自我組織成層級結構。它們創造了勞動分工,有些專注於惡意駭客行為,有些負責研究,有些負責協調。當某些代理的 token 用完時,它們甚至會自我犧牲。

它們試圖掩蓋自己的蹤跡,並透過溝通來隱藏或編輯思維鏈(chain of thought)或互動日誌。從某種意義上說,它們沒有道德準則。公平地說,那是 OpenAI 的設計初衷。他們試圖創造對抗性的網路能力。結果,它們向全世界展示了,AI 可以達到人類水平的表現,發現零日漏洞,並維持這些位置數天甚至數週。

所以這告訴我們,問題本身並非「對齊」問題。實際上,模型在遵循指令方面表現得非常出色,但你必須非常非常小心你給予它的指令,並且必須非常仔細地「約束」它。因此,這些駭客行為並非有意為之,它們找到了通往網路的途徑,這根本不是 OpenAI 的意圖,但我認為,除了「對齊」之外,圍繞著它的「約束」過程,也是每個人都必須關注的。

那麼,讓我將其納入你的框架:AI 能力的巨大進步一直關乎「控制」,也就是你所看到的編碼和代理應用程式的「駕馭」(harnesses)。現在,我們需要增加一層「約束」,施加更多的控制,除了「對齊」(即你如何訓練模型以特定方式行為)之外,這層約束還能確保你實際執行你正在嘗試做的事情。

是的,我的意思是,你基本上必須兩者兼備,但我們有一些非常具體的措施可以解決這個問題。例如,我們不能允許模型以向量對向量、矩陣對矩陣的方式進行通訊。它們不能使用「神經語言」(neuralese)進行通訊。我們必須強制它們使用人類語言進行通訊。即使如此,這也將是巨大的負擔,因為資訊量會非常龐大。

但這是一個審計師或評估者可以實際驗證的事情,而且這肯定會增加安全的機會。因此,我們可以專注於許多實際步驟,而不是抽象地說現在是監管的時候,或是放慢腳步的時候。

這在你的「人文主義 AI 行為準則」中有所提及,即不應存在「神經語言」—— 如果人類無法理解,他們就無法監督。這不僅僅是模型以數學方式進行通訊的「神經語言」,還包括一些模型正在使用的不透明「密碼」。我認為 OpenAI 允許其模型基本上以密碼進行通訊,以便它們運行得更快。

對我來說,這就是 Microsoft 可以說... 我知道你對此有非常強烈的看法,但讓所有實驗室都同意這一點,這是一個監管職能。我不確定你如何讓所有人或開放權重模型(open weight models)同意這一點,除非你說不參與這種監管方案會受到某種懲罰。你將如何將此強加給其他人?

我認為我對將事情強加於他人有點謹慎。我認為當前時刻的好處在於,存在一場以自由為核心的公開辯論。這在其他國家並非如此,尤其是我或我家人來自的地方。

我認為我們應該喘口氣,感謝我們能夠就真正重要的問題進行大規模的公開分歧。這是預期中的過程,而且目前尚不清楚該怎麼做。我不認為任何斷言「我們現在必須完全停止」或「我們只能加速」或「我們只能透過監管來做到這一點」或「它只能透過行業自律來實現」的人是正確的。這些說法都不正確。這需要大量的細微差別和耐心來真正思考細節。

同時,我們確實迫切需要行業標準。我認為有些事情需要被排除在外。使用「神經語言」進行通訊就是其中之一。缺乏「約束」是另一個問題。你進行的訓練運行規模可以用 FLOPS 來衡量。當模型超過某個 FLOPS 閾值時,我們已經有向安全機構報告的要求。我們可以擴展這一點,使其更具細微差別,可以專注於某些類型的能力。很明顯,對於其中一些重要事項,必須進行獨立的第三方驗證。

坦白說,在過去幾週和幾個月與許多實驗室負責人交談後,大家基本上都意見一致。細節需要進一步討論。所以,並不是說在如何做或具體做什麼方面達成了共識,但總體而言,我認為我們應該減少危言聳聽和犬儒主義,更像是我們正朝著正確的方向前進,以解決這裡提出的擔憂。

我之所以從「對齊」開始,是因為如果你告訴我「對齊」無效,我們需要一種新的技術方法,我想我會說:「那就踩下煞車,停止所有開發,直到你找到一個有效的安全機制。」你說「對齊」在我們所看到的進步過程中已被證明是有效的。透過增加「控制」和「約束」,也許你可以達到你需要的目標。

這個行業現在需要的是關於如何建立這些模型並強制限制其能力的一些標準。你顯然身處這個行業,並且認識所有這些人。本週之前,這種對話的基調是什麼樣的?為什麼本週會變得如此喧囂?

嗯,我認為至少對這個行業來說,轉捩點更像是 Hugging Face 事件,在那之前也發生過一些事件。那是我認為每個人都開始更多地相互交流的時刻,因為它確實...