使用其他 AI 模型來訓練 AI 模型已成為新興實驗室的熱門目標。現在,Anthropic 的一位研究員讓我們初步了解這項技術在實務上可能呈現的面貌。

Anthropic 週五發表了一篇題為《自動化研究員能可靠地緩解對齊失敗》(Automated Researchers Can Reliably Mitigate Alignment Failures)的新論文。該論文詳細說明了 AI 系統如何能可靠地改進模型在多組對齊基準上的表現。當面對 10 個特定未對齊行為的基準時,這些自動化系統在不降低整體效能的情況下,成功改進了每一個基準的表現。

由 Anthropic 研究員陳岳漢(Chen Yueh-Han)領導的這套系統,複製了許多傳統研究方法。每個自動化系統會搜尋現有文獻、提出方法,並使用該方法訓練模型 30 分鐘,透過多次迭代逐步提高基準分數。有效的方法會被保留,而無效的方法則被捨棄,這讓系統能夠快速且大規模地運作。

論文中提到:「總體而言,這些結果提供了初步證據,表明自動化對齊後訓練在近期內可能變得實用。」

這篇論文是邁向遞迴式自我改進(recursive self-improvement)的一步,許多人認為這是 AI 進步的下一個重要階段。如果模型能夠改進自身的對齊訓練,那麼它們很可能也能更廣泛地改進訓練實踐,屆時人類 AI 研究員可能很快就會過時。

論文毫不避諱地探討了這個想法,明確將自動化對齊研究員(AAR)與其人類對應物進行比較。論文指出:「最佳的 AAR 方法在平均六小時內就能超越經驗豐富的人類所提出的方案,人類引導的研究方向並未帶來更強的表現。」

論文甚至提供了成本比較,以防有人不相信。它寫道:「一個 AAR 每小時的 API 推論成本約為 4 美元,而我們支付給人類研究員的時薪則為 150 美元。」

公平地說,論文也指出了這種方法的一些局限性。自動化系統的有效性僅限於基準能反映實際對齊目標的程度,即便如此,在建立和維護這些基準方面仍有大量工作要做,更不用說維護和擴展自動化研究員所參考的文獻了。