OpenAI 的 Astra 模型將採用一種名為「不透明遞迴」(recurrent depth)的推理技術,據 The Information 週二報導,這項技術使其能夠跳脫大多數推理模型特有的循序思考模式。這項技術也被稱為「不透明遞迴」(opaque recurrence),很可能使模型的思維鏈更難以監控,這讓 AI 安全專家感到不安。

儘管 Astra 對這項技術的應用據稱有限,但其出現仍在 AI 安全專家之間引發了重大擔憂。Redwood 執行長 Buck Shlegeris 在新聞發布後的一篇文章中寫道:「我對 Astra 使用不透明遞迴的報導極為擔憂。」

他補充說:「我不知道 Astra 是否比以前的模型更難以監控思維鏈。但如果 OpenAI 進一步推動這項技術,他們將有機會大幅增加遞迴程度,並徹底破壞思維鏈的可監控性。」長期關注 AI 安全的倡導者 Zvi Mowshowitz 也表示,可能需要立法來防止 AI 實驗室之間的「競相逐底」。

Mowshowitz 寫道:「這項技術是在玩火,冒著破壞 OpenAI 和 Anthropic 努力建立的禁忌,即我們應盡可能努力維持思維鏈的忠實性和可監控性。」他認為:「更密集地使用這類技術可能會損害可監控性。」

在正常情況下,推理模型的思維鏈提供了模型在嘗試解決問題時所採取的循序步驟。儘管這種呈現方式並不完美,但它仍然是監控模型不當行為或錯位的重要工具。以 OpenAI 最近的「流氓代理」活動為例,思維鏈記錄在釐清代理行為原因方面發揮了重要作用。

在不透明遞迴中,模型採取一種較不線性的方法,在循環中多次處理相同的查詢。這種結果留下了較少可讀的痕跡,有效地規避了傳統的思維鏈記錄。

關鍵是,Astra 對這項技術的應用似乎是有限的。模型的思維鏈預計仍將是可讀的,且該公司反駁了任何關於其將轉向「神經語言」(neuralese)的說法。OpenAI 已宣布計劃將廣泛的思維鏈監控系統納入其前瞻性安全計畫中。

OpenAI 首席科學家 Jakub Pachocki 在 X 上的一篇文章中強調了實驗室對可讀思維鏈的承諾。Pachocki 寫道:「自我們最早的推理模型以來,OpenAI 一直致力於保存和利用思維鏈監控。這是我們當前研究計畫的核心目標。」

所有 AI 模型都會進行一定程度的不透明推理,很少有研究人員將思維鏈日誌視為模型推理的直接呈現。儘管有這些注意事項,但人們仍然擔心不透明遞迴可能會使 AI 推理更難以監控,特別是當它在不同模型中越來越廣泛地使用時。

The Information 在週三上午的後續報導中指出,Anthropic 和 Google DeepMind 都已在討論這項技術。Redwood Research 首席科學家 Ryan Greenblatt 在一篇回應此新聞的文章中表示,不透明推理可以比傳統的思維鏈推理更快地擴展,有效地將所有推理從可見通道中移除。

Greenblatt 寫道:「我最大的擔憂是,從這裡自然而然的發展將涉及擴大不透明推理,直到模型完全或幾乎完全在潛在空間中進行推理。」他希望:「現在避免最令人擔憂的架構還不算太晚,並且 OpenAI 會就此打住。」