我們設計 GPT-5.6 模型家族,旨在平衡人們使用模型時所需的能力與成本。我們的旗艦模型 GPT-5.6 Sol,其最大推理能力在人工分析程式碼代理指標(Artificial Analysis Coding Agent Index)上超越 Claude Fable 5,而成本卻不到一半。

Terra 在智慧基準測試上表現與 GPT-5.5 相當,價格卻減半;Luna 則是我們最快、最經濟實惠的模型,價格比 Sol 便宜 80%。為了實現這些效率,我們的研究和技術團隊在技術堆疊的每個主要層面都進行了顯著優化。

這些改進涵蓋了模型本身、推論(我們運行模型以生成輸出的方式),以及我們的代理協調層,後者同時被 Codex 和 ChatGPT Work 使用。在過去四年中,隨著我們的模型擴展到 10 億活躍用戶和超過 200 萬家企業,效率一直是將智慧效益普及給每個人的核心。

我們的使命是確保通用人工智慧(AGI)造福全人類。這些年來,我們一直努力在技術堆疊中不斷解鎖更大的優化,以便在成本-智慧曲線的每個點上提供性能最佳的模型。透過 GPT-5.6,我們實現了前所未有的每代幣智慧效率,該模型經過訓練,旨在以更少的代幣完成更多工作。在訓練中,我們同時優化任務成功率和效率,引導模型以更直接的路徑完成任務。

這篇文章將超越模型本身,分享我們如何透過技術堆疊中另外兩個主要部分的進步來實現效率設計,包括:1) 推論,透過優化負載平衡、推測解碼、快取和核心優化等流程,從相同的硬體中獲得更多輸出;2) 我們的代理協調層,包括更好地管理上下文膨脹、工具使用和重複工作。

我們還將分享 GPT-5.6 Sol 在自主實現這些改進中的作用。雖然任何單一的改進可能看起來有限,但這些成果的累積使我們能夠在智慧和效率的前沿取得突破。

在一個運算資源受限且模型需求增長速度快於容量的世界中,效率是每個系統設計的核心。這在我們的推論堆疊中尤其如此,推論堆疊負責運行訓練好的模型以生成回應。我們的主要目標是在保持用戶期望的智慧、延遲、可用性和可靠性的同時,以相同的硬體提供更多代幣服務。

實現這一目標需要優化整個系統。一個模型即使在獨立運作時效率很高,如果請求分佈不佳、硬體閒置或資料移動減慢運算速度,其服務成本仍然可能很高。每個層面的改進都會產生複合效應,收益來自於路由(請求發送地點)、排程(請求發送時間)、核心(在 GPU 上運行的軟體)、快取(保存和重複使用的工作)以及模型實作(GPU 程式碼的排序)的優化。Codex 中的 GPT-5.6 Sol 在所有這些優化中發揮了關鍵作用。

第一個重要例子是負載平衡。在全球範圍內,我們根據地理位置、可用容量和加速器類型(運行模型的 GPU 或專用晶片類型)等因素來路由請求。在叢集內部,我們根據負載、上下文長度、快取可用性和其他請求屬性,將工作分配到不同的模型實例中。在每個實例內部,工作必須有效地分配到加速器、模型的子網路和運算核心。

Codex 中的 GPT-5.6 Sol 幫助我們分析生產流量,識別以前被忽視的不平衡來源,測試新的路由策略,並不斷調整這些啟發式演算法。僅這些負載平衡的改進就顯著降低了我們模型的服務成本。

我們還使用 GPT-5.6 Sol 來優化模型的前向傳播:將輸入轉換為下一個代幣預測的運算。即使單個操作很快,過多的記憶體移動、同步和低效的資料佈局也可能導致 GPU 閒置。為避免這種情況,GPT-5.6 Sol 找到了可以預先計算、避免或平行化的工作。

透過 Codex,GPT-5.6 Sol 自主重寫並優化了我們的生產核心,這是執行構成模型數學運算的核心程式碼。這之所以有效,部分原因在於我們已經訓練 GPT-5.6 能夠有效地在 Triton 和 Gluon(OpenAI 維護的兩個開源 GPU 編程語言)中編寫和改進核心。

這些努力,結合 GPT-5.6 Sol 更廣泛的核心改進,將端到端服務成本降低了 20%。我們還大力投資驗證工具,例如開源工具 FpSan(浮點數清理器),以幫助驗證 GPT-5.6 Sol 編寫的核心的正確性。

推測解碼是提高速度和效率的另一個槓桿。該技術涉及在主模型旁邊運行一個較小的草稿(或「推測器」)模型,提出多個代幣供主模型平行驗證。當這些提案被接受時,系統可以從單次主模型傳遞中產生多個輸出代幣,從而減少昂貴的序列運算量。GPT-5.6 Sol 透過設計和運行數百個關於其架構的實驗,測試大小、結構和功能的變化,改進了自己的草稿模型。

此外,GPT-5.6 Sol 啟動並監控推測器訓練過程,在出現問題時自主介入,包括硬體故障和訓練不穩定。由此產生的改進使代幣生成效率提高了 15% 以上。

處理未快取的輸入代幣時,模型會在一次運算密集型傳遞中建立鍵值(KV)快取;生成輸出時,它會重複讀取並擴展該快取。服務的最佳配置,例如批次處理、分片和 KV 管理,在很大程度上取決於工作負載——提示詞和輸出長度、批次大小、快取命中率、查詢特性等等。

然而,配置空間以前太大,無法系統地調整,工程師不得不依賴廣泛的啟發式演算法。透過 Codex 中的 GPT-5.6 Sol,我們能夠分析生產工作負載,生成和評估候選配置,並針對每個場景對引擎和模型進行超級優化。這使得新層次的工作負載特定優化變得實用,從相同的硬體中提取更多有用的推論。

推論優化是一個持續的迴圈。我們測量生產行為,找出最大的差距,實施變革,並驗證它們是否改進了整個系統,而不僅僅是單一的基準測試。GPT-5.6 Sol 和 Codex 加速了這個迴圈的每個部分。這意味著我們的團隊可以探索更多想法,更快地回應不斷變化的工作負載,並為用戶創建一個具有更低延遲、更大容量和更低成本的推論堆疊。

ChatGPT Work 和 Codex 透過一系列模型請求和工具呼叫來完成複雜任務。在單次迴合中——從用戶請求到最終回應——Codex 可能會檢查原始碼、搜尋部署歷史、閱讀事件報告、編輯檔案和運行測試。每個步驟都可能需要一個請求。準備上下文、傳輸資料、運行推論、呼叫工具和啟動流程都需要時間和運算資源。

如果一個任務需要 30 個模型請求,每個請求額外的一秒鐘就會累積起來。提高整體性能意味著減少整個系統中的重複工作,而不僅僅是讓模型更快。

一個用戶迴合可能包含許多模型和工具的迭代。重複區域內的任何成本都可能被支付多次。這些乘數影響了我們代理協調層的設計,它是一個連接我們的模型、工具和用戶環境的 Rust 編排層。接下來,我們將討論如何透過避免上下文膨脹、載入工具和重複使用工作來提高每個請求的效率。

隨著代理被授予更多工具、技能、外掛程式和對話歷史的訪問權限,上下文視窗很容易擴大。這會增加成本,分散模型的注意力,並促使不必要的推理。協調層可以透過延遲發現來減少這種開銷,這使得整合、自訂 MCP 工具、技能和外掛程式只在需要時才浮現。協調層還防止單個工具和 MCP 整合意外地消耗上下文視窗。工具輸出預設限制為 10,000 個代幣,除非模型請求不同的限制。

如前所述,代理迴圈可以在單次迴合中多次將相同的指令、對話歷史、工具定義和早期結果發送到 GPU。處理這些重複的輸入是昂貴的,因此提示詞快取會重複使用與先前處理的提示詞前綴相關的運算。為了保留該前綴,協調層將所有模型可見的歷史視為僅限附加:新訊息、工具結果和環境更新會添加到末尾,而不是插入到較早的上下文中。

工具也以確定性順序呈現,而運行時設定(例如批准策略)則在執行期間應用,而不是嵌入到工具定義中。這種設計選擇有助於 Codex 和 ChatGPT Work 實現高整體提示詞快取命中率。

我們透過 GPT-5.6 實現的效率提升,是多年來在技術堆疊各層面(涵蓋研究、推論和我們的代理協調層)不斷累積改進的結果。GPT-5.6 在實現許多這些改進中的作用,讓我們對優化速度將如何加快感到樂觀。我們將繼續在核心優化等領域進行更大的優化,同時對我們的技術堆疊進行基礎性改進。我們期待將這些持續的、幕後的改進以更廣泛可用、更具成本效益的智慧形式回饋給我們的用戶和客戶。