騰訊的研究模型 Gander 結合了即時對話與 AI 代理能力。它利用「小腦」處理對話,而可替換的「大腦」則負責複雜任務。使用者可以隨時打斷對話,但測試顯示對話時機與任務準確性之間存在權衡。

騰訊混元語音團隊與多所大學的研究人員共同推出了 Gander,這是一個旨在在處理複雜任務的同時,仍能持續進行對話的 AI 模型。根據技術報告,它能同時接收語音、圖像和文字輸入。

研究人員指出,現今的語音助理大多採取輪流對話的方式。然而,在真實對話中,人們會互相打斷、快速給予回饋,並在說話的同時聆聽。Gander 的設計旨在處理這種來回互動,即使在說話時也能持續處理影像、語音和文字。使用者可以隨時介入,模型也能在未經提示的情況下提出追問或提供進度更新。

對話需要快速回應,但搜尋檔案或編寫程式碼則需要時間規劃。研究人員認為,單一模型必須在速度與推理能力之間取得平衡,因此 Gander 將工作分為兩個角色。

借鑒人體解剖學,他們將這兩個角色稱為「小腦」和「大腦」。小腦負責處理即時對話,而大腦則在背景處理推理和複雜任務。

大腦可以替換成 Codex 或 Claude Code 等代理系統,而無需重新訓練對話模型。在測試中,OpenAI 未指明的 GPT-5.6 系列模型扮演了這個角色。隨著底層模型的改進,整個系統都會受益。

Gander 將對話分解成一秒鐘的片段,以便小腦決定何時聆聽、說話,或在使用者打斷時停止。它無需單獨的模組來偵測語音的開始和結束,而是利用大約過去兩分鐘的對話作為記憶來做出這些決定。

由於目前還沒有專門針對 Gander 這類模型的測試,研究人員轉向了既有的基準測試。報告指出,Gander 在 Full-Duplex-Bench v3 上展現了最佳的時機掌握能力,該基準測試評估了語音助理在不同任務情境下的表現。

Gander 在所有 100 種情境中都能在正確的時機開始說話,並且在 8% 的情況下打斷使用者。相較之下,GPT-Realtime 的打斷率為 13.5%,而表現最弱的競爭對手則接近 48%。報告指出,Gander 使用相對較小的模型,卻能與包括 GPT-Realtime、Gemini Live 和 Grok 在內的商業系統競爭。

然而,Gander 在任務準確性方面略顯落後。研究人員表示,部分原因是測試會對整個系統進行評分,因此語音辨識和輸出錯誤都會影響其表現。如果直接給予文字輸入,大腦的得分會好得多。

影像和音訊理解能力也受到影響:Gander 在一項測試中表現不如其基礎模型,研究人員將此歸因於訓練時偏重流暢對話而非精確感知。這包括計算物體數量和在圖像中定位物體等任務。

根據報告,Gander 經過約 270 萬個範例的訓練。其中一些訓練旨在讓它在有背景噪音或群組中沒有人與其對話時保持安靜。

研究人員表示這項工作仍處於早期階段。如何擴展 Gander 仍是一個懸而未決的問題,而且目前還沒有標準的方法來評估這類系統。該團隊計劃在完成「開源發布流程」後,公開模型的權重和訓練資料。目前 GitHub 上已有程式碼儲存庫,專案頁面也提供了演示。

越來越多公司將代理任務拆分給不同的模型。Gander 繼騰訊七月發布的 Hy3 之後推出,據報導 Hy3 是一個開源語言模型,縮小了與競爭對手之間的差距,尤其是在代理任務方面。Hy3 已在 WorkBuddy、元寶和微信中運行。

騰訊也在北京阻止 Meta 收購後,正協商取得代理新創公司 Manus 的最大股權。騰訊認為這項交易符合其自身計畫,包括在微信中嵌入代理。

其他公司也正使用協調器來將任務委派給不同的模型。OpenAI 的 GPT-Live 將對話與推理分離,將網路搜尋和代理任務交給背景模型處理,同時聊天持續進行。Sakana AI 的 Fugu 是一個獨立的語言模型,可以從可擴展的模型池中呼叫其他模型。OpenAI 也正在測試主動式代理,這些代理會自動建立後續任務並聯繫使用者。

處理打斷和避免延遲仍然是實際考量。Anthropic 的分析發現,有經驗的使用者在大約 9% 的工作步驟中會打斷 Claude Code,而新手則約為 5%。根據一項調查,開發對話式語音和聊天代理的團隊尤其常報告延遲問題。