Google 和 Google DeepMind 的研究人員於週三共同成立了 DeepMind Institute,旨在推動通用人工智慧(AGI)相關的對話。該機構的董事會成員包括 DeepMind 共同創辦人 Shane Legg、Google 高階主管 James Manyika 以及 Google DeepMind 董事長 Demis Hassabis,其中 Legg 擔任執行編輯。

這個新機構的目標是匯集 Google、Google DeepMind 以及更廣泛的全球研究社群對於 AGI 的不同觀點。根據公告指出:「他們不一定會總是意見一致,而且隨著快速發展的前沿領域有更多數據和資訊浮現,他們很可能會改變想法。」

首批發布的四篇論文涵蓋了多個主題:管理潛在 AGI 顛覆的經濟政策、保留人類可讀的模型推理、人類繁榮的原則,以及評估前沿 AI 模型的一個框架。

其中一篇論文由 DeepMind 安全研究員 Rohin Shah 和 Anca Dragan 撰寫,他們認為 AI 透明度(即查看和檢查模型逐步推理的能力)的縮減並非不可避免。隨著新架構使最強大的模型更難以監控,作者表示開發者和監管機構應直接面對安全權衡。

這可能意味著限制「不透明的序列深度」(模型在不產生可讀推理軌跡的情況下可以執行的連續計算量),或者要求開發者證明透明度較低的系統仍能同樣被監控。

在另一篇論文中,Hassabis 提議成立一個由美國主導的前沿 AI 標準機構,負責評估最先進的 AI 模型。根據他的框架,開發者最初可在模型發布前最多 30 天自願提交模型進行審查。一旦評估系統證明有效,通過其測試可能會成為在美國部署前沿模型的強制性要求。

該機構最初將與 AI 公司協商設計評估標準,但最終將開發獨立且不公開的評估方式,即論文中所謂的「保留測試」(held-out tests),以防止實驗室根據已知的評估標準來調整其模型。Hassabis 表示,如果情況的嚴重性需要,該框架可以「逐步升級」,甚至可能包括前沿 AI 開發者之間的協調減速。

這些論文發布之際,業界關於安全的辯論正從廣泛的擔憂聲明轉向具體的披露、外部審查以及在安全措施不足時協調減速的建議。本週,隨著業界領袖支持 Anthropic 執行長 Dario Amodei 呼籲「放慢」前沿 AI 發展的要素,這一轉變進一步加速。