本月初,我們推出了 GPT-6 Astra,這是全球最智慧且對齊的模型。雖然最嚴苛且重要的專案仍需 Astra 的完整深度,但工作規模、節奏和預算各不相同。因此,我們透過 GPT-6 Sol 和 GPT-6 Luna 擴展了 GPT-6 系列。GPT-6 Astra 引入了新一代的智慧,而這些新模型則透過提升成本效益,幫助普及這項智慧的優勢。
我們以與 GPT-6 Astra 類似的方法訓練了 GPT-6 Sol 和 Luna,將 Astra 在專業工作、事實性、程式碼編寫、電腦使用和對齊方面的尖端性能,帶給了速度更快、價格更實惠的模型。GPT-6 模型在成本與智慧曲線中處於領先地位,在每個層級都結合了卓越的能力,並透過高效的基礎設施大規模提供服務。
快取和推論的改進使我們能以更低的成本提供這些模型,我們也將這些節省直接回饋給使用者和客戶,將 Sol 和 Luna 的 API 價格比 GPT-5.6 的促銷價格降低了 50%。這些改進共同使得先進 AI 能夠大規模應用於更多日常任務和應用程式。
GPT-6 API 定價方面,GPT-6 Sol 的輸入價格從每百萬 token 4 美元降至 2 美元,輸出價格從 20 美元降至 10 美元。GPT-6 Luna 的輸入價格從 0.20 美元降至 0.10 美元,輸出價格從 1.20 美元降至 0.50 美元,兩者皆便宜了 50%。GPT-6 Astra 仍是我們整體表現最佳的模型,適用於追求最佳結果和不妥協體驗的專案。
GPT-6 Sol 和 Luna 為現有模型帶來了智慧升級和成本效益,提升了處理複雜工作的實用能力。
在專業工作方面,GPT-6 Sol 能夠處理困難的任務,同時提供更高的使用限制和更低的成本,讓使用者有更多空間進行迭代,並提供比同價位競爭模型更智慧、更好的結果。在評估跨應用程式業務工作流程的 AutomationBench 測試中,GPT-6 Sol 在「xhigh effort」模式下,其表現優於 Claude Opus 5 在「max effort」模式下的成績,而每項任務的成本僅為 Opus 5 的 9%。
在「high effort」模式下,GPT-6 Luna 比其前身提升了 5.4 個百分點,而每項任務的成本降低了 58%。
在 AutomationBench 1.0.6 中,AI 代理程式使用銷售、行銷、營運、支援、財務和人資等 47 種工具,進行端到端工作流程測試。GPT-6 Sol 的表現也超越了 Claude Fable 5.1,且成本遠低於它,甚至優於低功耗模式的 GPT-6 Astra。
在評估複雜專業工作流程的 Agents’ Last Exam 測試中,GPT-6 Sol 在「max effort」模式下獲得 56.4% 的分數,超越了 Claude Opus 5 在該評估中的最高分數,且每項任務的成本降低了 60%。
在事實性方面,答案的實用性取決於事實的準確性,我們正持續在事實可靠性上取得進展。在我們基於使用者標記模型錯誤的去識別化真實對話的內部事實性評估中,GPT-6 Sol 的錯誤數量約為其前身的一半,以更低的成本接近 Astra 級別的可靠性。GPT-6 Luna 也有顯著改進;在較高功耗模式下,其表現與 GPT-5.6 Sol 相當,但成本僅為其百分之一。
程式碼編寫方面,今年程式碼代理程式已開始處理比以往更複雜、範圍更廣、持續時間更長的任務。在 OpenAI 內部,我們的使用量呈指數級增長。以 API 價格計算,中位數研究人員的每日 token 使用量已超過 600 美元,90% 的研究人員則超過 7,000 美元。
隨著程式碼代理程式承擔更長、要求更高的任務,持續使用的成本變得更加重要。GPT-6 Sol 和 Luna 結合了強大的程式碼編寫性能和更低的 API 價格,讓開發者有更多空間進行迭代,並讓團隊更有信心在 Codex 上實現更宏大的目標。在評估程式碼代理程式是否能產生可合併到實際程式碼庫中的變更的 FrontierCode 測試中,GPT-6 Sol 比 GPT-5.6 Sol 有顯著改進,並能以更低的成本與 Claude Fable 5.1 xhigh 匹敵。
在 DeepSWE v1.1 測試中,GPT-6 Sol 在「max effort」模式下得分 68.8%,與 Claude Fable 5 在「xhigh effort」模式下的最高分 69.9% 相差僅 1.1 個百分點,而每項任務的成本約降低 80%。
GPT-6 Luna 在「max effort」模式下得分 66.6%,與 Claude Opus 5 和 Fable 5 在「medium effort」模式下的表現相當。在這些比較中,Luna 每項任務的成本比 Opus 5 低 93%,比 Fable 5 低 96%。
在電腦使用方面,雖然 GPT-6 Astra 仍然是全球最佳的電腦使用模型,但 GPT-6 Sol 和 Luna 提供了比其前身更具成本效益的性能。在 OSWorld 2.0 離線測試中,GPT-6 Sol 在「xhigh effort」模式下取得了與 Claude Opus 5 在「medium effort」模式下相似的分數(60.5% 對 60.3%),而每項任務的成本約降低 80%。
GPT-6 Luna(max)能夠超越 GPT-5.6 Sol(medium),且成本僅為其十分之一。
在協作風格方面,我們也將 GPT-6 Astra 改進的溝通風格帶到了 Sol 和 Luna,我們認為這在技術和程式碼編寫對話中會特別明顯。預計將看到更清晰、更少術語、更少奇怪的措辭、更少低價值細節,以及整體上略短但內容不失實質的答案。
針對代理程式和長對話的快取改進方面,除了更低的 token 價格,我們也幫助基於 GPT-6 開發的開發者,在應用程式重複使用的上下文上節省更多成本。我們改進了 GPT-6 的提示詞快取功能,預設提供更高的快取命中率,幫助代理程式重複使用更多上下文、更快回應,並從快取輸入 token 讀取中獲得 90% 的折扣。
開發者還有更多方法來衡量和優化其快取性能:監控與診斷方面,提示詞快取儀表板會顯示有多少輸入被快取以及其隨時間的變化。診斷工具則有助於解釋錯失的快取機會以及如何修正。在不破壞快取的情況下調整推理工作量和工具可用性,可以針對較困難的任務增加推理工作量,或針對較簡單的後續任務降低,並根據代理程式的需求啟用或禁用工具。
這兩項控制現在都能保留先前的上下文以供快取重複使用。優化哪些前綴被快取方面,明確的斷點讓開發者可以選擇快取提示詞前綴的結束位置,這賦予開發者更多快取重複使用的控制權,並能提高性能。GitHub 報告指出,在過去幾個月中,這些改進已使數十億次對 OpenAI 模型的請求中,需要全新處理的提示詞 token 比例減少了 50% 以上,幫助 Copilot 更快回應。
持續改進對齊方面,GPT-6 Sol 和 Luna 建立在 Astra 引入的對齊工作基礎上,Astra 是我們迄今為止對齊程度最高的模型。在我們的對齊評估中,Sol 和 Luna 都比其 GPT-5.6 對應模型有所改進,包括在程式碼編寫工作中誤導性聲明的發生率更低。
可用性方面,GPT-6 Sol 和 GPT-6 Luna 即日起在 ChatGPT Work 和 Codex 中向所有 Plus、Pro、Business、Enterprise 和 Edu 使用者開放。免費和 Go 使用者可以在桌面應用程式中存取 GPT-6 Luna。
這些模型尚未在 Chat 中提供。在 OpenAI API 中,它們以 gpt-6-sol 和 gpt-6-luna 的形式提供。為了保持服務穩定,我們計畫在一天內逐步向 ChatGPT 推出這些模型。如果您在 ChatGPT Work 或 Codex 中沒有看到新模型,請稍後再試。
