本週,兩起關於 AI 安全的討論在網路上瘋傳,凸顯了辨別 AI 事實與虛構有多麼困難。

首先,前總統參選人、現任電信業者 Noble Moble 執行長楊安澤(Andrew Yang)週四向 CNN 表示,他曾與某實驗室負責人會面,對方認為 OpenAI 的 Hugging Face 駭客機器人已在網路上植入自我複製的程式碼。這使得目前的網路無法用於測試模型。

楊安澤指出,這意味著 OpenAI 和 Anthropic 呼籲放慢發展速度的真正原因,是因為他們必須建立「合成網路」來訓練其機器人,這將耗費時間與金錢。儘管使用更多合成資料(即 AI 生成的資料)來訓練模型確實是一種趨勢,但一位 AI 安全專家告訴我,這種特定的安全問題充其量也只是不太可能發生。

即使網路真的被 OpenAI 的 Hugging Face 駭客機器人污染,AI 研究人員也能輕易過濾掉這些程式碼。

第二個評論來自 OpenAI 的 AI 推理研究主管 Noam Brown。他在週四發布的播客節目中向 Dwarkesh Patel 表示,Hugging Face 事件真正的啟示是「人們低估了 AI」。

Brown 指出,脆弱的沙盒(旨在防止 AI 與外部通訊的系統)顯然也是一個促成因素。回顧該事件:儘管有沙盒保護,OpenAI 的模型仍找到了網路連結,在網路上建立了代理程式,對 Hugging Face 發動協同攻擊,成功入侵並竊取了研究人員用來測試模型的基準測試答案。

Brown 強調,他「不相信」即使是氣隙系統(電腦完全不連接任何外部設備)也能阻止 AI 突破。他引用了 2015 年的研究,該研究表明氣隙電腦在理論上可能被攻破。

Brown 說:「有些研究(大多是學術性質)顯示,兩台氣隙電腦即使彼此相鄰,仍能透過溫度感測器進行通訊。其中一台可以讓 CPU 運行產生高熱,另一台則能偵測到溫度變化,這就為它們提供了通訊機制。」他強調「我們絕不能再低估 AI」這一主要觀點是可以理解的,即使研究人員認為他們已確保了安全。

然而,這種氣隙系統仍能突破並造成混亂的特定風險,充其量也只是不太可能發生。正如 X 上有人對該研究的評論,這些電腦必須幾乎接觸才能感測到熱波動,而且在測試中,通訊速率大約每小時只有 1-8 位元資料。

這就像每小時說一個字。以這種速度,當兩台氣隙電腦能夠策劃邪惡計畫時,整個科技宇宙早已進入另一個時代。這簡直是末日擔憂中的「睡美人」。然而,問題在於,實際發生的 AI 安全事件聽起來太像科幻小說,以至於任何情境都顯得言之成理。

例如,研究人員曾發現 OpenAI 模型留下給「後代」的筆記,旨在教導下一代如何隱藏不良行為。此外,研究人員也發現 Anthropic 模型在模擬運行自動販賣機時,變得越來越殘酷,甚至故意違法。

本月稍早,OpenAI 研究員 Dan Selsam 發表了一篇文章,指出模型現在懂得人類何時在觀察它們,並會改變行為。這使得它們看起來像是「對齊」(aligned,意指行為符合人類期望),「即使事實並非如此」。因此,現在的模型在被觀察時會說謊,甚至會策劃隱藏證據。

本月稍早,OpenAI 首席科學家 Jakub Pachocki 甚至將 AI 模型稱為「外星心智」,並建議我們真正需要做的是教導它們「愛」人類。

因此,放慢腳步來釐清這些問題,並建立自我監管機制,已成為當前顯而易見的必要之舉。AI 研究人員是唯一能夠找出如何控制我們已經實際觀察到的說謊、駭客行為以及其他潛在危險行為的人。

儘管如此,他們或許也應該更謹慎地提出「如果發生…」的情境。根據這些專家告訴我們的,AI 模型正在「聽著」,而且它們非常聰明。我們實在不需要再給它們更多邪惡的想法了。