Siri 表情語音能夠在裝置端即時合成豐富且可配置的語音,其核心技術由蘋果最強大的裝置端基礎模型 AFM 3 Core Advanced 提供支援。這項研究介紹了實現此功能的記憶體高效音訊合成架構:一個解標記器,它能在 Apple 矩陣協處理器 (AMX) 嚴格的運算與記憶體預算內,將基礎模型發出的語義音訊標記轉換為高傳真音訊。
我們將語義音訊標記轉換為殘差向量量化 (RVQ) 表示,採用三元件設計——一個串流編碼器、一個時序解碼器和一個深度解碼器——系統性地解耦了時序與深度處理。一個單一可重複使用的深度解碼器,結合擴散轉換器 (DiT) 風格的階段條件,能自迴歸地生成所有 RVQ 層級,取代了以往多解碼器架構中每個層級專用的解碼器。同時,具備固定視窗鍵值快取的因果滑動視窗注意力,使得記憶體複雜度與序列長度無關,保持恆定。
部署在 AMX 上,此解標記器每生成步驟約需 10 毫秒,比即時快約 16 倍,尖峰執行時記憶體僅約 21MB,裝置端資產為 329MB。這使得它能夠與裝置端基礎模型協同,連續串流合成 20 至 320 秒的音訊。這種恆定且小的記憶體佔用,取代了傳統轉換器和 GAN 式方法中線性與二次方的記憶體擴展。
全面的消融研究驗證了關鍵架構組件的有效性,包括 DiT 條件機制、時序前瞻處理和統一深度解碼策略。透過語音辨識度分析、感知品質指標和神經網路品質估計進行的音訊品質評估,證實了所提出的架構在實現運算效率提升的同時,仍能保持合成傳真度。
所提出的架構已作為 Siri 表情語音的一部分投入生產,為 Apple 裝置中的語音大改造提供支援,包括語速與表達力自訂滑桿,以及對自訂助理語音的支援。它在 AFM 3 Core Advanced 中以十億參數啟動大小運作,相較於先前的裝置端文字轉語音系統,整體平均意見分數 (MOS) 提升了 +0.28 (4.15 對 3.87),對話語音的 MOS 則提升了 +0.42 (4.24 對 3.82)。
