我們的使命是確保通用人工智慧(AGI)能造福全人類。正如 Sam Altman 和 Jakub Pachocki 最近所闡述的,我們將工作重點放在三個主要目標上,以實現這一使命。

這些目標包括:透過建立自動化 AI 研究員來引導 AI 進步的下一階段,並與其在對齊問題上進行迭代,同時尋找讓人們能持續參與自我改進循環的方法。此外,還要實現高度智慧機器所帶來的科學進步和經濟成長效益,並賦予每個人一個專屬的個人 AGI。

AI 正在全球許多公司和國家快速發展,其進步改變了所有人面臨的機會與挑戰。除了其他好處之外,具備能力且對齊的 AI 將是我們應對這項轉變的重要一環。

它能強化防禦能力、推進對齊研究,並協助人們理解和引導 AI 發展的下個階段。

安全地應對這項轉變,需要對齊研究與 AI 能力的發展保持同步,以確保我們及其他機構所建構的系統能持續與人類價值觀對齊,並處於人類控制之下。隨著 AI 系統變得越來越強大和自主,甚至承擔更多 AI 研究與開發工作,這一點變得日益重要。

要讓 AI 持續進步並確保其安全與益處,不僅需要對齊研究的突破,也需要跨實驗室與國家間共同的開發指導標準。

自動化 AI 研究可能涉及不同程度的人類監督。隨著 AI 系統承擔越來越多開發下一代 AI 的工作,它們可以日益推動遞迴式自我改進(RSI)的過程,即使人類仍參與其中。

當這個過程變得更加自動化時,AI 進步的速度可能會迅速加快。

我們相信自動化 AI 研究將產生直接改善人們生活的模型。它能降低先進智慧的成本,讓全球人民都能受益。

自動化研究也能幫助我們大幅改進對齊,並建立防禦機制以應對日益強大的 AI——一個自動化 AI 研究員也能成為自動化 AI 安全研究員。更強大且對齊的系統可以協助保護關鍵基礎設施、防禦危險的 AI 代理,並開發新的保護措施。

完全自主的 RSI 目前尚未發生,除非能確保其安全性,否則我們不應追求。是否以及如何推進,必須取決於我們維持人類控制的能力,以及對其益處與風險做出知情的民主選擇。

如果沒有適當的謹慎與預防,RSI 可能導致人類失去對 AI 開發的實際控制權,無法監督他們不再理解的研究過程。從此,AI 可能變得更加危險、更不對齊,總體而言對人類構成威脅。我們揭露的 Hugging Face Incident,雖然不是 RSI 的直接結果,卻預示了在缺乏強大保障和對齊措施下,風險可能變得更加嚴重的類型。

在尖端 AI 開發中,安全與資安實踐的國際標準,對於引導 AI 發展速度的重要性,可能與對齊研究本身不相上下。這些標準可以建立高品質證據的共同定義,以及技術保障嚴謹性的共識基準。

簡而言之,它們幫助我們回答「在減輕災難性 AI 風險方面,什麼才是好的做法?」這個問題。

現有的民主機構,如人工智慧標準與創新中心(CAISI)、州法律以及聯邦 AI 框架,都能為此提供幫助,新型態的公私夥伴關係亦然。然而,AI 的開發與部署正在多個國家進行,全球都在採用,其影響很可能在某個時間點以某種方式波及每個人。

因此,國際間制定標準的努力是必要的,以解決幾個關鍵挑戰。首先是「碎片化」:不同國家之間的評估、報告要求和事件定義可能相互衝突,使得比較證據、理解新興能力以及應對跨國風險變得更加困難。

其次是「集體行動困境」:每個國家獨立行動可能產生任何國家都不樂見的結果。RSI 有能力加速 AI 研究本身,可能超出我們集體理解進度、評估風險和維持有意義人類監督的能力。最後是「能力不均」:尖端開發活動和相關專業知識在全球分佈不均,這加劇了上述兩個問題。

這些挑戰適用於開源和閉源模型。明確來說,任何追求自動化 AI 研究或其他先進能力的 AI 實驗室,都必須根據基本的自律原則和現有法律,為其安全實踐負責。

我們制定標準的理由,根植於避免權力集中,並產生更好的實際成果。標準提供了一種方式,讓實驗室以外的更多利害關係人能參與決定這項技術應如何發展,並提供一套可依賴的明確原則,而不受任何特定實驗室具體實踐的影響。如果各方合作解決上述挑戰,我們很可能會獲得更好的結果。

這就是為什麼我們相信美國應該領導一項努力,與世界各國合作,為尖端 AI(包括 RSI)制定全球技術標準。

儘管我們預期這個概念會隨著時間大幅演進,但有兩個方面將是至關重要的。首先是「促進國家與國際尖端標準互補的機制」。

實現這一目標的一種方式是利用新興的 AI 安全機構網絡,例如已在澳洲、加拿大、德國、法國、肯亞、日本、韓國、新加坡、印度和英國建立的機構,透過 CAISI 和國家產業機構來促進標準制定。其重點將特別放在:(1) 以能力基準衡量的尖端 AI 模型和開發者;以及 (2) 自動化 AI 研究(包括 RSI)的效益與風險管理。

美國可以基於 CAISI 在 2024 年建立的「國際先進 AI 測量、評估與科學網絡」(International Network for Advanced AI Measurement, Evaluation, and Science),匯集公共機構在 AI 測量、評估和科學方面進行合作。

這項努力所制定的標準將為能力測量與評估、風險評估和保障措施的充分性提供共同的技術基礎。這些技術標準不會是 AI 模型的許可證、強制發布前審查或批准要求。

各國政府將自行決定是否以及如何將這些標準納入其法律體系。

這項工作也應透過諮詢開源模型和閉源模型的開發者、獨立技術專家以及學術界,來支持一個具競爭力的 AI 生態系統。共同標準應以透明的方式制定,並設計成不偏袒特定公司、國家或商業模式。

這包括避免讓新進業者或開源權重開發者更難以競爭。

正如我們所建議的,這種方法可以借鑒航空和金融穩定等領域的經驗,這些領域的國家在不放棄國家主權的前提下,發展出共同的技術標準和值得信賴的合作管道。它也應與 ISO、Frontier Model Forum、Agentic AI Foundation 和 Open Secure AI Alliance 等既有及新興標準機構密切合作。

此外,還應與 Appia Foundation 等專注於實施的組織合作,該基金會正在開發實用規範,將國際標準與實際的 AI 評估連結起來。

第二個方面是「用於更好集體行動的共同測量和事件報告協議」。國際 AI 標準在管理 AI 研究日益增長的自主性以及遞迴式自我改進方面將特別關鍵。

具體而言,這些標準可能包括:評估與 RSI 相關的 AI 進展,以及 AI 公司內部自主研究的程度。我們最近關於研究加速的報告是這項努力的初步貢獻。對自動化 AI 研究的人類監督,包括哪些自動化 AI 研究過程應觸發立即的人工審查。

對對齊和自動化 AI 研究問題的事件分類、追蹤、報告和回應,例如共同的事件嚴重程度等級和報告閾值。我們的失準報告框架是早期的一項貢獻。

除了這些標準之外,我們認為全球關鍵基礎設施營運商和政府建立安全的溝通管道也將非常重要。這將用於分享國家安全疑慮、新興漏洞與威脅,以及在快速發展的尖端 AI 安全領域中的最佳實踐。

美國和中國在這些領域的對話將是積極的一步,即將舉行的會談正逢其時。

引導 AI 發展的速度並非維持預設的速度。從技術層面來看,它是關於確保對齊研究及其部署能領先於 AI 能力的發展。

從社會層面來看,它是關於利用標準、機構和協作來擴大產業網絡、社會關係和市場力量,以產生正和結果。最近關於網路防禦集體行動的呼籲就是後者的範例。

美國在引導這項工作上處於有利地位,因為其 AI 產業位居技術前沿,並且在金融、貿易、國防、科技和資訊系統等關鍵領域仍擁有優越的全球網絡地位。現在的領導將決定美國是塑造全球 AI 框架,還是眼睜睜看著一個碎片化、不均勻且充滿衝突的系統在其周圍形成。

這也將決定先進 AI 是否能強化美國及其盟友已有的網絡;未能領導可能會削弱這些網絡。

地緣政治競爭不僅僅是關於誰在技術上領先,也關乎 AI 的採用和普及。越來越多地,後者可能取決於誰能推動務實的合作和合理的「道路規則」。

如果全球企業和社會要將未來押注在這項技術上,他們將會需要這些規則。

透過務實的國際合作連結起來的強大國家治理,為更強大的保障措施、持續創新以及廣泛獲取 AI 效益提供了途徑。