語音正迅速成為 AI 的主要介面。從客戶服務、醫療保健到教育、娛樂和個人助理,語音正日益取代文字,成為人們與 AI 互動的方式。

過去幾年,語音模型取得了顯著進步。詞錯誤率持續下降,延遲已達到對話速度,許多既有基準測試也接近飽和。然而,任何經常使用語音 AI 的人,都感覺有些地方仍不對勁。

語音模型在對話過程中可能會聽起來像不同的人,錯過猶豫或不確定性,並且難以處理口音、噪音或帶有情感的語音。這些缺點在專注於延遲和詞錯誤率的基準測試中很容易被忽略。人們關心的是語音系統能否真正傾聽、適當回應,並在真實對話中保持自然和可靠。

為了衡量這些品質,我們建立了 Real World VoiceEQ——一個旨在評估語音互動「人味」品質的基準測試。它評估語音系統能否辨識、生成並回應文字記錄中遺漏的聲學資訊,包括語氣、情感、說話者身份和背景情境。

Real World VoiceEQ 評估了 40 多個領先的專有和開源語音模型,涵蓋超過 15 個關鍵評估維度及 60 多個指標,範圍包括自動語音辨識 (ASR)、文字轉語音 (TTS)、語音轉語音 (S2S) 和語音理解。

Real World VoiceEQ 是根據超過 100 萬次獨立人類評分開發而成,這些評分來自不同的人口統計資料、說話風格和聲學環境。目前的基準測試包含 785,000 次 TTS 評分和 48,000 次 STS 評分,使其成為迄今為止規模最大的人類語音 AI 評估之一。

每項評估都使用 Kairos 進行,這是我們靈活的語音原生評估平台。同樣的基礎設施也讓頂尖 AI 實驗室和企業能夠執行針對特定用例的客製化評估,識別生產語音系統中的細微故障模式,生成人類偏好數據,並透過強化學習和人類回饋持續改進模型。

追求單一「最佳」語音模型的競賽,正轉變為一系列專業化能力的集合。現今領先的系統針對不同的優勢進行優化,包括技術準確性、情感理解、對話智慧、表達能力和穩健性。

一個擅長重複預訂參考號碼、銀行帳戶詳細資料或複雜藥品名稱的模型,可能難以產生富有情感的語音。另一個模型可能聽起來非常自然,但在精確導向的任務上可靠性較低。

隨著語音 AI 的成熟,衡量進步越來越需要獨立評估這些能力,而不是將它們合併成一個單一的總分。在我們的 TTS 評估中,沒有任何系統配置能在所有八個能力組中都排名前五,這突顯了為何不存在單一的「最佳」語音模型。

語音轉語音(S2S)模型在我們評估的所有類別中顯示出最大的差異。有些系統在情感辨識方面表現出色,但難以自然回應。我們發現,即使能存取音訊,也無法保證代理程式會利用其中包含的副語言資訊。有些系統仍主要依賴文字記錄,只關注說出的詞語,卻忽略了語氣、語速、猶豫、強調和音量等線索。

人類自然會利用這些線索來推斷自信、不確定性、沮喪、諷刺和同理心。然而,現今的模型卻經常錯過這些。

想像一個銀行客服詢問你是否辨識出潛在的詐騙交易。一個自信的「是」和一個猶豫的「…是…」可能傳達完全不同的意義,儘管文字記錄相同。人類能立即辨識出這種差異,但許多現今的語音模型卻不能。

許多既有基準測試已接近極限,無法反映真實世界的狀況。模型在處理帶口音的語音、說話者重疊、情感、背景噪音和較長對話時仍然力有未逮。在我們的評估中,領先的開源和專有模型之間的性能差異,遠比傳統基準測試所顯示的要大得多。

舉例來說,在有噪音背景的語音上,轉錄的詞錯誤率大約是音樂背景語音的四倍,這顯示單一的背景音訊分數可能會掩蓋真正的故障模式。

在初步研究中,我們發現一些跡象顯示某些模型可能已針對既有的公開基準測試進行了優化。有些模型重現了參考文字記錄中的已知錯誤,遵循任意的拼寫慣例,甚至重建了音訊中不存在的遮蔽詞。

大型語言模型(LLM)現已廣泛用於評估基於文字的模型,但我們的研究結果表明,語音語言模型(SLM)在語音評估中應更謹慎使用。當我們將領先的 SLM 與受過訓練的人類評分員在文字轉語音評估上進行比較時,在發音準確性等具有明確、可驗證答案的任務上,兩者的一致性最高。

然而,在更主觀的評估上,一致性則有所下降。SLM 有時似乎會從基於文字的上下文線索推斷情感,而在開放式判斷(例如語音是否適合某個表演角色或保持一致的身份)方面,一致性最弱。

自動評估器對於定義明確的任務可能很有價值,但當判斷取決於聲學情境、感知和社會詮釋時,它們尚不能取代人類聽眾。

隨著語音成為 AI 的關鍵介面之一,單靠速度和技術準確性將不再決定哪些系統能成功。人們最終選擇的模型,將是那些不僅在理想基準條件下,而是在真實對話的複雜性中,也能像人類一樣理解、表達和回應的模型。

數十年來,語音 AI 透過針對標準化基準測試中的量化指標進行優化而進步,從轉錄準確度的詞錯誤率(WER),到語音品質的客觀感知指標如 PESQ 和 DNSMOS。我們希望 Real World VoiceEQ 能透過提供一個以人類為基礎的指標,來評估合成語音互動的各個組成部分,從而擴展這一範式。

閱讀完整的技術報告並探索公開排行榜,或與 Hume 聯繫,了解如何使用 Real World VoiceEQ 評估您的語音模型或代理,或設計針對您特定用例的客製化評估。