GPT-6 讓持久型代理程式能長時間執行複雜任務,從重構程式碼庫到生成研究文件和簡報。這些代理程式背後的應用會發出一系列相互關聯的 API 請求,經常重複使用先前的指令、工具定義和上下文。
OpenAI 會快取這些共享上下文,以便在不同請求之間重複利用運算資源,從而縮短回應時間,並為開發者提供高達 90% 的快取輸入代幣折扣。
隨著 GPT-6 系列的推出,我們發布了一個改良的提示詞快取系統,預設能提供更高的快取命中率。現在,在 30 分鐘內重複使用的符合條件的共享前綴,都能獲得快取折扣。
我們也引入了新工具,幫助開發者監控快取效能、診斷快取未命中問題,並選擇要快取提示詞的多少部分。
新的「提示詞快取儀表板」會顯示應用程式有多少輸入是從快取中提供的。您可以追蹤快取命中率隨時間的變化,並使用輸入組成圖表來比較快取和未快取的代幣。
這些視圖有助於您發現快取命中率的下降,並評估應用程式的變更如何影響快取效能。當您發現意外的快取未命中時,可以使用「提示詞快取診斷工具」來了解原因。
將當前請求與最近的回應進行比較,以找出阻止重複利用的模型、工具、設定或輸入的變更。受影響代幣的估計數量可幫助您評估影響規模,並決定如何優化整合以最大化快取命中率。
**選擇要快取的內容。** 明確的快取斷點讓您可以選擇要重複使用哪些提示詞前綴。更新後的提示詞快取指南解釋了如何使用它們,快取前綴的有效期限,以及工具和輸入的變更如何影響重複利用。
**調整推理強度而不破壞快取。** 在 GPT-6 模型上,您現在可以在回應之間調整推理強度,而不會破壞快取。透過附加 `configuration_update` 並保持請求級別的推理強度不變,您可以為更困難的任務提高強度,或為例行性後續任務降低強度。這讓您可以在保留可重複使用上下文的同時,調整任務所需的推理量。
**在工具和指令變更時保留快取。** 隨著代理程式工具使用需求的變化,請保持工具定義、架構和順序的穩定性,以便先前的上下文仍可重複使用。使用 `allowed_tools` 僅讓相關工具可呼叫,或在不需要工具時將 `tool_choice` 設定為 `none`,而不是直接移除定義。
使用新的開發者訊息將新指令附加到上下文的末尾,以覆蓋舊指令。請參閱我們關於管理工具變更的指南。
**預熱快取以減少延遲。** 預熱功能可以提前準備好已知上下文,以便模型在收到請求時能更快開始回應。例如,應用程式可以在啟動時,在使用者提出第一個問題之前,預熱共享指令、工具定義或參考資料。這將處理時間移出使用者的等待時間。
這些可選控制項建立在引擎的預設效能之上,幫助您根據工作負載調整快取。開始使用:在「提示詞快取儀表板」中監控快取命中率。使用診斷工具調查意外的快取未命中。遵循提示詞快取指南來改進您的設定,或使用 Codex 來審查您的程式碼、應用改進並衡量結果。
