我從各地的財務長那裡聽到一個簡單的問題:我們如何從 AI 支出中獲得更多價值?

多年來,市場透過採用率來衡量軟體的成功,例如購買的席次、活躍用戶數和續訂的授權。然而,要理解 AI 的價值,需要一個更強大的衡量標準:完成的工作量。

財務長和其他商業領袖面臨的基本經濟問題是,AI 完成工作的價值是否比其生產成本增長得更快。

回答這個問題需要比「每代幣成本」等指標更深入的考量。成本較低的模型可能有較便宜的代幣,但要獲得良好結果可能需要更多嘗試、更多時間或更多人工審查。功能更強大的模型可能代幣成本較高,但能一次性完成相同的任務。重要的是產生成功結果的總成本,並與該結果創造的價值進行衡量。

AI 時代的最終記分卡可以視為「每美元有用智慧」。這個指標回答了四個關鍵問題:AI 是否正在完成重要的工作?每項成功任務的成本是多少?人們能否依賴其結果?隨著使用量的增長,每投入一美元的 AI 是否能產生更多價值?

1. 完成了多少有用工作?首先從工作本身著手。AI 協助解決了多少客戶問題?協助發布了多少程式碼變更?審查了多少合約?為人們節省了多少時間?由於在正確的時機提供了正確的背景資訊,改善了多少決策?

當代幣轉化為人們可以使用的實際工作時,它們就產生了價值。隨著模型能力越來越強,它們可以承擔更長、更複雜的任務,例如維持上下文、透過多個步驟進行推理、跨工具協作以及隨時調整。

最好的起點是從一個工作流程開始。定義「完成」的意義,並在實際執行工作的系統中衡量該成果。

對於支援團隊而言,「完成」可能意味著客戶問題已解決。對於工程團隊而言,可能意味著通過測試的程式碼變更。對於法務團隊而言,可能意味著合約已準確且及時地審查完畢。

想像一個財務團隊正在準備預測審查。在做出最終決策之前,大部分工作都已完成:尋找最新預測、將資料匯入 Excel 或 Sheets、識別變更、核對分頁、重建投影片,並檢查所有數據是否完全吻合。ChatGPT Work 可以承擔大部分這些流程,讓團隊有更多時間專注於重要的問題:哪些地方發生了變化?為什麼?我們下一步該怎麼做?

這就是「每美元有用智慧」的實際應用。更多工作能更快地完成,同時人們能將更多時間用於運用判斷力、創造力和專業知識。

2. 一項成功任務的實際成本是多少?下一個問題是,要出色地完成這項工作需要多少成本。AI 任務的複雜度差異很大。一個快速的答案可能只需要很少的運算資源。而編碼、研究或財務工作流程可能涉及更深入的推理、工具使用和許多操作。這些更複雜的任務可能需要更多的運算資源,但它們也能創造更大的價值。

在模型層面,每項成功任務的成本取決於價格、使用的運算量以及達到正確結果的可能性。對於企業而言,總成本還包括員工時間、人工審查、重試和返工。

計算方法很簡單:將完成工作的總成本加總。計算符合所需品質標準的任務數量。將總成本除以成功任務的數量。這就是為什麼最低的每代幣價格不一定會產生最低的每成果成本。即使是例行請求,一個前沿模型如果能一次性產生正確答案,減少重試、延遲、審查和總運算量,也可能提供最佳價值。

分層的模型系列為客戶提供了更多優化此方程式的方法。我們上週發布的 GPT‑5.6 具有三個層級:Sol 是我們的旗艦模型;Terra 在性能和成本之間取得平衡;Luna 則是我們最快且最經濟實惠的模型。

這些層級提供了有用的起點。最終應由整個任務的經濟效益來決定選擇哪個模型。客戶可能會將 Luna 用於快速、高吞吐量的工作流程,Terra 用於需要更高深度的任務,或在需要更強推理能力以減少嘗試次數時選擇 Sol。

我們訓練 GPT‑5.6 以從每個代幣中獲得更多有用工作。在 Artificial Analysis 編碼代理指數上,具有最大推理能力的 GPT‑5.6 Sol 創下了新的技術水準,同時比另一個領先模型減少了 54% 的輸出代幣使用量。下圖說明了這個比較。

DeepSWE v1.1:長週期工程任務;GPT‑5.6 Sol 達到 72.7% 的新高,超越 Claude Fable 5 的 69.9%,且估計 API 成本降低了 36.2%。

在整個 GPT‑5.6 系列中,目標都是相同的:每美元完成更多成功的工作。更高的效率使現有任務更經濟實惠。更強大的能力則使全新的工作類型成為可能。

每一代新模型都應該改進這個方程式的兩端。客戶應該能夠完成更多有價值的工作,同時每項任務的完成成本持續下降。

3. AI 完成工作的正確率如何?第三個衡量標準是可靠性。AI 的採用往往分階段深化。首先,AI 協助起草。然後,它在工具和數據之間尋找上下文並進行推理。隨著時間的推移,它開始採取行動、處理例外情況並完成工作流程,人們在需要時提供判斷和控制。

每一步都創造更多價值,並對系統提出更高的要求。

可靠性具有直接的經濟價值。當結果準確、來源可靠、一致且適當升級時,人們花費在審查、糾正和重複工作上的時間就會減少。成功的任務成本更低,組織也因此獲得信心,將 AI 用於更重要的工作流程。

團隊可以透過追蹤三種結果來具體化這一點:可直接使用:交付的結果符合品質標準。需要修正:結果需要再次嘗試或人工編輯。需要升級:需要人工介入並完成工作。

這些衡量標準比單純的模型準確性更能說明問題。它們顯示 AI 是否真正減少了完成專案所需的工作量。

可靠性也需要明確的界限。在 AI 從起草轉向採取行動之前,組織應定義:系統可以存取哪些資料。它可以使用或更改哪些系統。何時需要人工審查或批准某項行動。

安全、資安、隱私和控制為更深入的使用奠定了基礎。人們需要了解系統的行為方式、其資料如何處理以及其行動如何受到規範。

ChatGPT Work 建立在 ChatGPT Enterprise 的安全、隱私、合規性和工作區管理基礎之上。這使得組織能夠為 AI 提供更多上下文,並存取更有價值的工作流程,同時保持適當的監督。

能力贏得首次使用。可靠性使 AI 成為完成工作方式的一部分。

4. 隨著使用量的增長,每投入一美元的 AI 是否能完成更多工作?最後一個問題是,規模化後經濟效益是否會提高。公司可以透過長期追蹤相同的工作流程來衡量這一點。記錄有多少任務符合品質標準、完成這些任務的總成本以及每項成功任務的成本。如果完成的工作量增長速度快於總成本,同時品質保持不變或有所提高,那麼每投入一美元的 AI 都在產生更多價值。

運算能力是這個方程式的核心。運算能力驅動著研究以及 AI 完成的每一項任務。它塑造了產品的品質、速度、可靠性、可用性和成本。訓練運算能力建立未來的能力。推論運算能力則提供今日的有用工作。兩者都應轉化為客戶更好的成果。

更好的模型、更高效的推論、專用硬體、更高的利用率、更智慧的路由和更強大的產品設計,都能提高運算的回報。每一代基礎設施都有助於訓練出更強大的模型。更好的演算法、硬體和軟體則有助於更有效地服務這些模型。

客戶以更人性化的方式體驗這些改進:更好的答案、更快的結果、更少的修正、更可靠的產品,以及更低的所需工作成本。

這些收益是複合式的。更好的基礎設施加速研究。研究產生更強大、更高效的模型。更好的模型改進產品。更好的產品推動採用、學習和收入。這種增長支持了對下一代研究、運算、部署和安全的持續投資。

OpenAI 透過一個共享的智慧平台將這些部分整合在一起。人們透過 ChatGPT 和 ChatGPT Work 使用它。開發人員透過 Codex 和 API 進行建構。企業則將其部署到實際工作的系統中。

當其中一層改進時,每個產品和客戶都能受益。

AI 時代的效益評估指標。總體而言,這四個衡量標準告訴我們「每美元有用智慧」是否正在改善。有用工作量告訴我們 AI 產生了什麼。每項成功任務的成本告訴我們達成成果所需付出的代價。可靠性告訴我們人們可以多大程度上自信地使用這些工作。規模化價值則告訴我們,隨著時間的推移,每投入一美元和每個運算單元是否能完成更多工作。

目標是讓 AI 幫助人們完成更有意義的工作、做出更好的決策,並將更多時間投入到需要獨特人類判斷力和創造力的工作中。

我們的任務是讓這個方程式在每一代中都變得更好:更強大的模型、更快更可靠的結果,以及客戶所需工作更低的成本。

這就是 AI 如何隨著時間的推移,對更多人和組織變得更有用。