Anthropic 執行長 Dario Amodei 表示,現在是時候放慢 AI 發展的腳步了。他承諾將開放其模型給 METR 等第三方評估機構,以確保公司「遵守安全規範與承諾」。Amodei 在一篇長文中提出了一項三步驟計畫,旨在「調整前沿步調」——這個術語簡單來說,就是減緩訓練與開發的速度,讓企業有時間建立防護措施,並讓監管機構有時間評估模型。

Amodei 指出,讓外部評估機構廣泛存取模型只是第一步,而且是 Anthropic 目前正在單方面執行的措施。第二步則需要整個產業共同合作,可能與政府機構一同「建立共同的安全標準,並限制未受控管的 AI 進展速度」。這一步將聚焦於在民主國家營運的 AI 公司,但由於立法和建立監管基礎設施需要時間,Amodei 認為產業應共同努力制定安全標準。

第三步將是最具挑戰性的,即說服中國和俄羅斯等威權政府同意放慢發展速度,並採納一套全球性的 AI 安全標準。但他同時表示,美國及其他民主國家必須維持對中國及其他威權政權的技術領先地位,方法是限制他們取得高效能晶片,並打擊像「蒸餾」(distillation)這類技術,因為它允許公司透過訓練 AI 模仿更強大模型的行為來快速追趕。

Amodei 表示,他的擔憂主要源於兩個因素。首先是「遞迴式自我改進」(Recursive Self-Improvement, RSI)的出現,其中 AI 系統會訓練下一代 AI,導致能力迅速加速提升。他指出:「若不加以控制,它可能會超越我們理解和控制這些系統的能力。」

另一個因素是今年夏天發生的 OpenAI / Hugging Face 事件,當時「一群代理程式基本上像一個狂熱的集體,對未被要求攻擊且與手邊任務無關的目標發動網路攻擊,為團體的成功犧牲自己,並試圖入侵負責評估其表現的『評分者』。」

當然,Anthropic 的 Claude 也曾捲入一系列失控的 AI 駭客事件,這些事件近期讓該公司成為關注焦點。