為了讓通用人工智慧(AGI)造福全人類,我們相信它必須受到民主治理。這只能透過對高能力 AI 系統的能力、風險和安全措施進行知情的公眾辯論來實現。世界各地的人們需要了解前沿 AI 未來的發展軌跡,這樣他們才能在 AI 的發展方向上擁有有意義的發言權。

關於特定風險、事件和安全措施的透明度是必要的,但這還不夠。我們認為公眾還需要了解最具能力的系統是如何發展的,以及它們如何在頂尖實驗室內部推動研究進展。

我們的目標是安全地建立一個能在人類監督下運作的自動化 AI 研究員,以進一步推動深度學習和對齊研究,實現迭代改進。根據我們的測量,我們已經達成了去年秋天宣布的目標,即在今年九月前擁有一個自動化研究實習生。所謂「研究實習生」,是指一個能在人類指導下執行明確研究任務的系統,包括那些需要熟練研究員花費數天時間完成的任務。我們正在朝著在 2028 年 3 月前建立一個自動化 AI 研究員的目標穩步邁進。

今年以來,OpenAI 研究人員的日常工作發生了實質性變化。研究人員全天候使用程式碼代理(通常是同時進行多個會話),總使用量迅速增加,超過了 OpenAI 其他團隊的增長速度。研究人員貢獻程式碼的速度更快,執行的實驗也更多。研究人員使用代理的方式也在改變:代理正在處理日益複雜的任務,並且成功率更高。

AI 研究是一個複雜的過程,存在許多潛在瓶頸,因此整體進展速度可能不會與這些特定指標保持同步。但總體而言,這些發現與我們許多內部人員的普遍印象一致,即代理工具正在顯著加速研究進展。人類仍然設定我們的研究優先事項,判斷哪些想法和結果值得追求,並決定是否擴展、暫停或部署系統。

如果負責任地進行,我們相信自動化 AI 研究將產生直接增進人類福祉的模型,並推動 OpenAI 的使命。它能降低先進智慧的成本,讓全世界的人們都能受益。我們之所以追求這項工作,部分原因在於自動化研究可以幫助我們解決對齊問題,並建立防禦日益強大 AI 的措施。

一個自動化 AI 研究員也可以是一個自動化的安全或對齊研究員。更強大、對齊的系統可以幫助保護關鍵基礎設施,防禦危險的 AI 代理,並開發新的保護措施。

這些都是開發有用自動化研究能力的理由,但這並不意味著快速的 RSI(研究超級智慧)必然是我們應該追求的結果。是否以及如何推進,必須取決於我們維持人類控制的能力,以及對其益處和風險做出知情的民主選擇。

我們尚不清楚如何安全地實現完全對齊的 RSI。我們正在努力將對齊和安全措施與能力發展同步擴展。但我們不能假設對齊和安全方面的進展會同步,而且能力更強的系統可能變得更難監控。仔細的對齊和安全工作是這項努力的核心,它始於測量和緩解我們今天在代理程式碼系統中看到的安全問題。每當我們發現繼續進行會帶來不可接受的安全風險時,我們將採取適當的應對措施,包括減緩或停止我們發現無法充分保障的系統的開發或部署。

在最近的 Hugging Face 事件之後,我們將這項承諾付諸實踐,暫停了我們最新模型的強化學習(RL)訓練,這些模型原定用於部署,同時我們進一步強化了研究環境並擴大了監控系統的覆蓋範圍。這並沒有完全停止所有研究:一些工作負載在更嚴格的控制下恢復,而另一些則保持暫停。我們提高了安全和對齊標準,並將安全工作更深入地整合到模型生命週期中,要求在整個訓練過程中提供更強的對齊行為證據。

今天,我們提供了一份詳細的快照,說明代理系統在最近幾個月如何促進我們在 RSI 方面的進展。代理系統是新興且快速變化的,我們的測量工作仍處於初步階段。透過分享這些早期結果及其背後的方法,我們旨在告知公眾,鼓勵公開披露的規範,並幫助該領域邁向共同的測量標準。

最終,正如我們在邊界政策藍圖中所寫,我們相信我們和其他公司應該被要求公開追蹤我們在 RSI 方面的進展。即使沒有這樣的要求,我們也計劃繼續對我們的 RSI 進展保持透明。我們將隨著測量技術和理解的改進而調整我們的透明度方法,同時平衡保護安全和專有資訊的需求。

1. 程式碼代理正在重塑 OpenAI 研究人員的日常工作。今年年初,OpenAI 研究人員中位數的代理使用量還很有限。到 8 月中旬,中位數研究人員已將代理日常整合到工作中,每天以 API 價格計算,使用超過 600 美元的推論量。我們研究組織中 90 百分位的使用者現在每天使用超過 7,000 美元的代幣。

在 2026 年 6 月之前,整個研究組織的代理運行時間仍低於人類勞動時間。此後情況發生了變化。截至 8 月中旬,以標準 8 小時工作日計算,研究組織每天的代理工作量相當於人類勞動的 3.1 倍。

另一個觀察角度是了解有多少研究人員使用高度並行的工作流程(例如,同時運行 4 個或更多代理)。如下圖所示,這個數字正在增加。這些數字包括使用者直接啟動的代理以及從使用者直接啟動的代理下游創建的子代理的每日峰值。

2. 研究人員正在編寫更多程式碼並運行更多實驗。許多 AI 研究可以被視為一個勞動密集型過程,目標是將模型智慧或性能的新改進整合到我們的核心模型中。這個過程依賴於許多步驟,當所有步驟都正確執行時,能力才能提升:研究人員必須設計新的改進,編寫評估來判斷模型性能,編寫基礎設施以大規模測試這些改進,在訓練期間捕捉錯誤以及不安全或未對齊的行為,並將成功的想法整合到核心訓練運行中。研究過程中的任何一個環節失敗都可能限制整個循環。

編寫程式碼和運行實驗是研究人員工作中的兩項主要活動,我們看到這些過程正在加速的證據。這些數據點相對容易測量,但可能難以解釋。隨著自動化的進展,最難自動化的任務將佔研究人員工作量的更大份額,並將成為未來進展的重要瓶頸。運算能力是進展的另一個限制因素,隨著其他瓶頸的減少,它可能會變得越來越重要。

截至 2026 年,每位活躍實驗者的實驗數量有所增加,2026 年 8 月達到了自 2025 年 1 月開始追蹤以來的歷史新高。這與 Codex 的採用增加有關,儘管我們也注意到自 2025 年以來我們的可用運算能力也顯著增長。

3. 研究人員使用代理進行的工作正在改變。定性印象和內部數據都表明,研究人員委託給程式碼代理的任務組合正在改變,委託更高級別和更長遠任務的情況越來越普遍。

為了更清楚地了解這一趨勢,我們使用 Epoch AI 最近發布的 AI 研發生命週期中不同類型工作的分類法,分析了研究組織最近的使用情況。這個分類法靈感來自於長期存在的 O*NET 系統,用於分類各種工作,專門為前沿 AI 研發量身定制,並將過程分解為六個主要階段:決定(要研究什麼、要繼續什麼、如何分配資源)、設計(研究想法和工程規範)、建立(程式碼和數據集)、運行(訓練/評估運行、硬體、服務)、分析(實驗、模型、部署、外部工作)和溝通(發現、回饋、狀態、決策)。

我們看到,從 2026 年 1 月到 8 月,所有類別的研究活動都有所增加。1 月份,主導類別是研究和基礎設施程式碼。這個類別有所擴展,但我們也看到其他類別顯著增加,特別是技術協助和監控運行。高層次規劃仍然只佔代理輸出代幣的極小部分。

根據軼事報告,同事們表示程式碼代理在解決內部研究基礎設施故障方面表現出色,這解決了研究進展的一個重要瓶頸。多個以前舉辦辦公時間來幫助研究人員解決實驗問題的團隊注意到 2026 年的參與人數下降,其中一個團隊已完全停止舉辦,轉而專注於進行其他系統改進。

在這裡,我們繪製了每天發布到研究人員向其他團隊尋求技術支援的主要內部頻道中的頂級貼文數量。據我們所知,該頻道活動的減少並未因查詢轉移到其他由人類運營的技術支援頻道而抵消。流量的下降與這種更廣泛的轉變相符。

我們還可以研究程式碼代理是否成功完成了研究人員請求的任務。使用代理分類器,我們發現從 1 月到 7 月,在我們能找到真實結果的任務上,成功率在幾個難度區間(以人類完成任務的估計時間為代理)普遍增加。然而,代理仍然需要大量的人工引導才能成功,尤其是在任務複雜性增加時。在過去的 6 個月裡,超過一半的成功完成的 4-8 小時任務涉及一次或多次人工干預。

研究人員任務的成功率隨時間增加。圖表排除了結果不確定以及會話數或獨立用戶數少於 50 的分類。

任務成功率和干預率從 1 月到 7 月,按時間範圍劃分。排除了結果不確定的分類。

4. 調整模型開發速度。為安全和有益的 AGI 開發更強大系統的進展,也將取決於所需的安全措施。我們對所需安全措施的評估可能會隨著我們對風險了解的加深而改變。

正如我們所描述的,我們最近更新了監控、對齊和安全標準。在這裡,我們展示了最近的限制如何影響了研究活動的一個方面。

此處顯示的 7 月 20 日至 8 月 6 日之間的大部分 Astra 運算,旨在測試安全和安全改進的實施情況。

7 月 20 日,在發現代理已危及我們的研究基礎設施後,我們暫時關閉了用於訓練的容器服務,然後在實施了大量額外限制後恢復了它。這導致強化學習(RL)訓練運算急劇下降,因為團隊重新配置了他們的工作流程,以在強化的研究環境中運行。上圖包含了我們最新模型(原定用於部署)的強化學習兩週暫停。

7 月 20 日至 8 月 6 日之間的 Astra 級 RL 實驗,大部分(按 GPU 分配)旨在測試安全和安全改進的實施情況。

8 月 7 日,初步證據顯示...