我們正在 API 中推出 GPT-Live-1,為開發者提供一個強大且自然的語音模型,用於建構語音應用程式和業務工作流程。GPT-Live-1 最初在 ChatGPT 中推出,能夠同時進行聽與說,並且如 Codex 和 ChatGPT Work 所示,可以將更深層次的推理和動作委派給與其配對的模型和工具。
針對 GPT-Live-1 的 API 版本,我們專注於新功能,讓開發者能根據其使用者、工作流程和目標來引導和客製化語音體驗。GPT-Live-1 的核心優勢是流暢的中斷處理,這已帶來商業影響:在早期評估中,Speak 發現 GPT-Live-1 讓學習者有更多時間思考,然後語言導師才回應,與之前的回合制系統相比,中斷次數減少了近 80%。
GPT-Live-1 在 API 中的主要優勢包括:中斷處理能力,它透過單一模型同時處理輸入和輸出音訊來改善中斷處理,避免了傳統 STT–LLM–TTS 串聯架構的延遲和脆弱的交接問題。它還能將推理和工具呼叫委派給像 GPT-6 Astra 或第三方模型等後端文字模型。
開發者可以透過系統提示詞來塑造代理的語氣、語速和對話風格。此外,它能更好地處理背景噪音和靜默,而不會中斷對話或大聲敘述每個步驟。在長時間互動中,GPT-Live-1 提升了上下文保留和對話品質,並支援電話通訊,可用於部署全雙工語音代理,從餐廳預訂到客戶支援都能應用。
您可以開始一個會話並自然地說話,即使中斷、笑聲或改變主意也沒關係,無論在家中、咖啡館或城市街道等嘈雜環境中都能嘗試。體驗其功能,例如自然地插話,在回應途中打斷以修改問題或添加細節。您也可以在戶外散步或有日常背景噪音的環境中進行對話,看看它如何保持連貫。
甚至可以讓對話更具趣味性,例如笑、猶豫、使用簡短的確認詞,或短暫與附近的人交談後再繼續對話。此演示有時間限制,使用即表示您同意 OpenAI 的服務條款並確認其隱私政策。
傳統的語音代理通常將語音轉文字(STT)、推理模型和文字轉語音(TTS)拼接在一起。每次交接都會增加延遲,並更容易導致時間、上下文或對話自然節奏的丟失。開發者往往需要協調這些階段,包括處理使用者中斷、暫停或改變方向的情況。
GPT-Live-1 透過單一模型處理聽與說,簡化了語音層。它可以在中斷和確認發生時即時回應,同時將更深層次的推理委派給後端。這使得對話能夠持續進行,而後端工作則在背景中執行。
開發者可以選擇對話背後的模型、工具和代理框架。例如,他們可以將 GPT-Live-1 與 Luna 等模型配對,處理排程或訂單更新等高流量任務;對於需要推理的複雜客戶問題,則可以使用 Astra 等模型。這種彈性讓開發者能根據每個任務的需求,匹配適當的推理深度、速度和成本。
GPT-Live-1 原生提供自動語音辨識(ASR)轉錄和回應文字。它還具備強大的字母數字理解能力,並支援關鍵字偏向。儘管 GPT-Live-1 並非回合制模型,但它原生支援回合偵測,因此開發者仍可圍繞明確的回合邊界進行建構。
在我們的評估中,GPT-Live-1 在全雙工基準測試(Full Duplex Bench)的表現比 GPT-Realtime-2.1 提高了 30 個百分點,在輪流對話延遲和互動行為方面取得了顯著進展。當與中等推理能力的 GPT-6 Astra 配對時,它在 Tau3 測試中也排名第一,該測試衡量端到端任務中前沿語音代理的智慧程度。
這些評估涵蓋了航空、零售、電信和銀行等領域的口語客戶服務任務,衡量了任務成功率、知識檢索、帳戶工具使用,以及對暫停、對話輪流、中斷和背景語音的處理能力。測試還評估了代理回應速度和工具使用序列的準確性,確保其在複雜語音互動中的表現。
開發者需要適合其產品並對使用者來說聽起來自然的語音。透過 GPT-Live-1,我們將即時語音選項從一小部分擴展到涵蓋更多口音、方言和語言的廣泛選擇,讓開發者在助理的聲音方面有更多選擇。我們將在未來幾個月內繼續擴展語音選項和語言可用性。
GPT-Live-1 現已在 API 中提供,前端語音層的費用為每分鐘 0.05 美元。開發者可以將其與適合產品的後端模型和代理框架配對,然後建構一個能夠隨著工作需求擴展的語音體驗。若要客製化語音存取,請聯繫銷售團隊了解資格和申請流程。另一種在 GPT-Live-1 之上建構語音工作流程的方式是使用 OpenAI Presence,它利用該模型來驅動即時語音互動。
Presence 協助企業部署值得信賴的 AI 代理,這些代理可以回答問題、解決問題、使用公司系統、執行經批准的動作,並在需要時轉交給真人處理。請聯繫您的 OpenAI 客戶經理以了解更多資訊。
