OpenAI 自一月公開並測試「ChatGPT 健康」功能後,現正向美國 18 歲以上用戶推出。文章暗示,付費訂閱這項服務可能真的能挽救你的生命。
用戶可以連結 Apple Health、醫療紀錄和健康應用程式,以檢視實驗室報告、準備看診,並分析睡眠或活動數據。OpenAI 表示,不會將這些連結的健康數據用於模型訓練或廣告目的。
免費版用戶將獲得品質較差的健康建議。OpenAI 的這項功能由 GPT-5.5 Instant 提供支援,該模型在健康基準測試中的得分低於專為付費用戶保留的旗艦模型 GPT-5.6 Sol。OpenAI 可能會以道德理由為這種雙層系統辯護,指出這兩個模型在 HealthBench Professional 測試中都擊敗了醫生的答案。
在 OpenAI 的 HealthBench Professional 測試中,GPT-5.6 Sol 在各方面都超越了醫生撰寫的答案,以及舊版模型 GPT-4o 和 GPT-5.5 Instant。最大的差距體現在完整性(88.0% 對 53.2%)和健康決策的實用性(83.0% 對 50.8%)上。
即使基準測試結果看似決定性,它們仍來自於旨在衡量知識的人工測試環境。醫生得分較低可能有多種原因,例如時間壓力、疲勞,或在沒有病患紀錄或同事協助的情況下進行測試。
基準測試也無法捕捉實際醫療檢查中的許多環節,例如醫生可以親自檢查病患、察覺非語言線索,並憑藉多年經驗評估整體狀況。OpenAI 在公告中也一再強調,ChatGPT 仍可能出錯,且無法取代醫療建議。該公司表示,有超過 260 位醫生協助開發了這些健康功能。
OpenAI 的早期測試還發現,超過 70% 的參與者在專屬的「健康」區塊之外提問,因為切換到該區塊過於繁瑣。為此,該公司已將健康功能整合到任何對話中,同時保留獨立的「健康」區塊用於數據管理和存取過去的健康對話。
或許它能成為更好的「Google 醫生」,但絕不能取代真正的醫生。OpenAI 表示,目前每週有超過 3 億人向 ChatGPT 詢問健康問題,高於一月份的 2.3 億人。該公司尚未說明這項健康功能何時會在歐洲推出。OpenAI 在一月宣布時,明確排除了歐洲經濟區、瑞士和英國,這很可能是因為歐盟更嚴格的數據隱私法規,以及該功能可能被歐盟 AI 法案歸類為高風險。
這些風險並非假設。在最新的放射學基準測試 RadLE 2.0 中,16 個受測的 AI 模型都沒有達到人類放射科醫師的表現水準。主要問題在於聊天機器人會以高度自信提供錯誤的診斷結果,而非承認其極限,而人類放射科醫師則更擅長承認不確定性。這種過度自信、說服力以及迎合用戶而非挑戰錯誤假設的混合特質,也導致了嚴重的心理健康危害。
同時,也有一些報告顯示 AI 能在醫療數據中發現專業醫護人員遺漏的模式,有時甚至產生驚人的結果。例如,電子健康紀錄系統 MIRA 和 AMIE 在模擬諮詢中的表現,都與基層醫療醫生不相上下。一位研究人員將這些 AI 代理比作飛機的自動駕駛系統:「這些系統可以透過接管日常任務來支援和減輕醫護人員的負擔,但最終責任仍將由醫生承擔。」
