絕大多數的臨床診斷僅透過語言訪談即可得出。這些診斷訪談通常由臨床醫師在面對面或遠距看診時,透過醫病互動進行。儘管這些互動是症狀評估的黃金標準,但它們常受限於財務、地理和體制障礙,進而限制了其可近性。

目前的語言模型 (LM) 在針對精選醫療案例研究進行評估時,已展現出強大的鑑別診斷能力,突顯了其支援診斷過程的潛力。然而,現有的評估主要依賴於經過整理、高度詳細甚至有時是合成的病患案例,這可能無法反映真實世界的經驗和臨床表現的多樣性。這些評估並未捕捉到一般病患如何報告其健康症狀,例如醫學素養程度不一、資訊不完整以及自然對話中出現的其他複雜情況。這代表了一個關鍵的缺口,導致人們對語言模型在真實世界情境中的表現存在不確定性。

為了解決這個問題,我們進行了一項實地比較研究,針對一系列實驗性的對話式 AI 原型代理,旨在探索對話式 AI 如何進行端到端的症狀訪談和鑑別診斷評估,以用於研究基準測試。在我們最近的論文《SymptomAI:邁向日常症狀評估的對話式 AI 代理》中,我們分享了一項全國性隨機研究 (n=13,917) 的結果,其中同意參與研究的受試者與五個可能的 Gemini Flash 2.0 SymptomAI 代理之一進行互動。

研究期間生成的所有診斷、標籤和疾病關聯僅用於研究分析,不構成確定的臨床診斷或官方醫療評估。

在與 AI 代理互動兩週後,我們要求研究參與者報告他們從醫療服務提供者那裡獲得的任何診斷。利用這些數據,我們進行了一項臨床專家註釋研究,比較 SymptomAI 相對於真實臨床醫師醫療評估的診斷表現。

在評估 SymptomAI 鑑別診斷 (DDx) 的準確性後,我們進一步將 SymptomAI 的診斷與參與者在與 SymptomAI 對話前,其 Fitbit 穿戴式裝置的生理訊號進行比較。我們發現,SymptomAI 對話中導致感染性疾病病因診斷的案例,與可能指示免疫反應的生理趨勢相符,這進一步證明了 SymptomAI 的表現。

**運作方式**

我們招募了 13,917 名同意參與研究的受試者,他們各自向五個隨機分配的 SymptomAI 代理之一描述其症狀,每個代理在症狀訪談方式上具有不同程度的彈性。在這些對話中,參與者描述他們的症狀,而 SymptomAI 則提出追蹤問題,對話最終會產生一個鑑別診斷 (DDx,即一系列可能的診斷) 和後續步驟的建議。

參與者隨後可以去看醫療服務提供者,並被要求在兩週後透過問卷分享該次看診的結果。為了評估 SymptomAI 的表現並建立基準,我們進行了一項臨床專家註釋研究,由三位通過專科認證的臨床醫師組成的專家小組審查對話紀錄,並提供他們自己的評估 (即鑑別診斷)。

然後,每位臨床醫師在盲測情況下,對 SymptomAI 和其他臨床醫師提供的 DDx 進行排名。

**主要結果**

**臨床專家對 SymptomAI 鑑別診斷的偏好**

我們發現,在超過 50% 的案例中,臨床醫師更偏好 SymptomAI 生成的鑑別診斷,而非其他臨床醫師提供的診斷。這表明 SymptomAI 的鑑別診斷與我們的臨床醫師的醫療評估一致的頻率,與其他臨床醫師相同或更高。

**臨床專家認為 SymptomAI 鑑別診斷更準確**

同樣地,我們透過「前五名準確度」來比較 SymptomAI 生成的鑑別診斷與真實臨床醫師提供的診斷準確性 (即參與者個人醫療服務提供者提供的真實診斷是否出現在鑑別診斷的五個可能診斷之一)。我們讓臨床醫師分別識別提供的診斷是否在每個鑑別診斷中,包括 SymptomAI 生成的和臨床醫師提供的。我們發現,臨床醫師認為 SymptomAI 生成的鑑別診斷比其他臨床醫師提供的鑑別診斷更常是準確的。

**引導更多資訊可提升表現**

作為這項研究的一部分,我們評估了進行病史詢問訪談的不同方法。參與者被隨機分配到五個研究組,每個組採用不同的提示策略。其中兩個組 (Dynamic Live 和 Dynamic Final) 被賦予完全的自主權來提出不受限制的追蹤問題;另外兩個組 (Fixed Canonical 和 Flexible Canonical) 則從醫學院教授的一套標準病史詢問問題中提問;最後一個組是基本無提示詞的語言模型 (Base unprompted LM),代表了目前查詢語言模型聊天機器人時完全由使用者主導的現狀。

我們發現,所有由代理驅動的提示策略 (即 SymptomAI 主動提出追蹤問題) 都顯著優於基本條件,證明了從參與者那裡引導資訊對於提高鑑別診斷準確性的價值。

**SymptomAI 在低信心案例中的表現**

我們發現,SymptomAI 超越臨床基準的表現,在臨床醫師對自己的鑑別診斷信心最低的案例中表現最為突出。

**SymptomAI 診斷與生理訊號的關聯**

鑑於 SymptomAI 相對於臨床基準的準確性,我們還可以探索其大規模應用的潛力。目前,臨床標籤的成本限制了對大規模數據集的真實世界分析。像 SymptomAI 這樣準確的症狀檢查系統,有潛力實現臨床品質診斷的自動化參考標籤,這可以開啟對生理數據的大規模分析——這項任務目前在大規模上是不可能實現的。

一個例子是將穿戴式裝置的生理訊號與不同類型的疾病進行關聯。在急性呼吸道感染中,觀察到穿戴式生理訊號最顯著的變化。為了在大規模上研究這一點,我們收集了同意參與者的日常生物識別數據,最長可追溯到他們與 SymptomAI 互動前的 30 天。我們發現,在使用者報告症狀前的幾天,生理訊號出現明顯的變化,表明症狀的發作。

重要的是,隊列之間的區分是透過將 SymptomAI 的首選候選診斷進行分類,並將歸類為呼吸道感染的診斷進行分組而得出的。這個隊列排除了非感染性呼吸道疾病,例如過敏性鼻炎或慢性阻塞性肺病。這些參與者的穿戴式生理訊號變化高峰與症狀報告日期一致,這提供了與其報告症狀相符的觀察性生理證據。

**結合生理訊號的應用價值**

基於 AI 的症狀表現評估為新的研究開啟了大門。透過使用 SymptomAI 分析大量的症狀報告,並將其與即時 Fitbit 數據配對,我們可以探索各種疾病的數位生理訊號表型。我們的分析揭示了在使用者與 SymptomAI 對話前的幾天內,生理指標 (包括心血管功能、呼吸、皮膚溫度和睡眠品質) 出現了明顯的變化。

這些客觀變化與症狀對話的時間點緊密對齊,提供了一種潛在的方式來驗證病患報告的症狀,或提供被動數據以協助在症狀對話的同時提供鑑別診斷。此外,這種即時可近性突顯了 AI 症狀檢查工具的核心優勢。與可能因排程延誤而受影響的傳統臨床預約不同,參與者可以在症狀剛出現時即時參與 SymptomAI 研究。這可能可以提高病患報告的發病時間線的準確性,這對於人口規模的健康分析來說是一個關鍵細節。

**限制**

SymptomAI 是一項探索性的研究工作,可能代表著 AI 輔助症狀評估的重大研究進展,並展示了其為尋求了解自身症狀的普羅大眾所能提供的潛力。儘管大規模部署評估揭示了透過遠距病患訪談進行症狀評估的準確性,但在與臨床醫師評估進行比較時,仍存在細微的限制。

首先,鑑別診斷本身就是一項模糊的任務,即使是已報告的診斷也可能隨時間推移而改變和發展。症狀評估是時間上的一個快照,捕捉的是當下呈現的症狀。由於我們部署的規模,我們無法控制症狀報告的頻率和時間。因此,有些參與者可能在更具代表性的指標出現之前就報告了他們的症狀,而另一些人則可能在多年慢性病經驗的知情背景下報告了明顯的指標。

未來的研究可能會專注於症狀發展特定階段的特定疾病,例如早期發作的代謝症候群或呼吸道感染初期的症狀。研究期間生成的所有診斷、標籤和疾病關聯均為 AI 衍生,僅用於研究分析,不構成確定的臨床診斷或官方醫療評估。

其次,在我們的評估中,臨床醫師審查的是靜態的聊天紀錄,並未被賦予自主權來提出自己的追蹤問題。如果臨床醫師主導症狀訪談,他們可能會直觀地獲取不同的資訊。此外,儘管最近的研究表明對話式 AI 系統可以獲取達到臨床醫師水準的詳細和準確的臨床數據,但此類系統可能會錯過其他訊號,例如肢體語言、視覺評估、病歷,或在初級照護的背景下,與病患之間已建立的關係。

總之,我們介紹了 SymptomAI,這是一個用於進行真實世界病患訪談和症狀評估的實驗性對話式 AI 代理。我們透過在人口樣本上的鑑別診斷準確性,展示了 SymptomAI 的端到端真實世界表現,並說明了 SymptomAI 診斷如何能夠實現對穿戴式生理訊號等大規模訊號的分析,以識別生理訊號與所報告疾病之間的關聯。

**致謝**

本研究由 Joe Breda、Jake Sunshine 和 Daniel McDuff 等人共同貢獻。我們衷心感謝來自 Google Research 和 Google DeepMind 的共同作者和合作夥伴的貢獻。