蘇黎世聯邦理工學院、新經濟學院和倫敦帝國學院的研究人員,在巴基斯坦司法系統進行了一項大規模的田野實驗。這項隨機試驗涵蓋了 118 個法院的 1,559 名法官,約佔巴基斯坦所有地方法院法官的一半。

這項工具名為 JudgeGPT,是一款基於 OpenAI 的 GPT-4 開發,專為巴基斯坦地方法院設計的 AI 助理。它利用檢索增強生成(RAG)技術,搜尋包含 128,292 份法院判決和 943 條巴基斯坦法律的 129,235 份文件資料庫。當法官輸入查詢時,JudgeGPT 會選出十個最相關的段落,並生成附有引用的答案。

研究人員將法官分為三組。其中一組獲得 JudgeGPT 的使用權限,並接受了為期三週的專門培訓,由蘇黎世聯邦理工學院教授 Elliott Ash 在下班後進行六次 90 分鐘的講座。法官們學習了哪些任務適合使用該工具、其不足之處以及如何驗證其輸出。

第二組法官也獲得了相同的 AI 使用權限,但只參加了一場關於科技與法律的綜合研討會。對照組則參加了該研討會,但沒有 JudgeGPT 的使用權限。

單獨提供 AI 使用權限的效果不大。接受專門培訓的法官使用 JudgeGPT 的頻率,是只參加綜合研討會的法官的四倍。經過 40 週後,受訓法官平均登入近 60 次,發出超過 200 個提示詞;而對照組平均登入約 20 次,提示詞少於 50 個。

擁有更多受訓法官的地區,處理了更多的案件。在中等使用程度下,這意味著每個地區每年平均多處理約 1,848 件案件,案件量增加了 6.3%。即使是使用量最低的四分之一地區,也額外處理了約 616 件案件。

判決品質保持穩定或有所提升。每 1,000 件已結案件的上訴率略有下降,且法官的工作時數不變,工作與生活平衡沒有受到影響。研究人員估計,每投資一美元可節省約 38.50 美元,這是根據聘請足夠法官以達到相同產出所需的成本計算。即使是保守估計,投資報酬率也「至少」達到每美元 10 美元。

對約 4,000 份法院判決的審查發現,如預期般有更多 AI 標記的文本。然而,判決的可讀性、長度以及法律論證的數量均保持不變。一項由兩位巴基斯坦律師驗證的 LLM 基礎品質檢查顯示,判決品質略有提升。在成對比較中,受訓法官的判決有 59% 被評為較好,高於對照組的 42%。該研究未發現 AI 使用會增加司法語言中性別或宗教偏見的證據。

研究人員審查了約 1,500 名法官的匿名聊天記錄。法律研究、文本編輯和文本生成是最常見的任務。約 60% 的查詢是關於法律、程序或法律概念的資訊。

受訓法官更多地將 JudgeGPT 用於編輯和總結文本,這些是語言模型較為可靠的任務。他們較少提出廣泛的法律問題,因為這類問題的幻覺風險較高。研究人員表示,培訓引導法官將 AI 用於有限的輔助任務,而最終決策仍由法官自行判斷。

只有約五分之一的請求涉及研究人員所稱的「實質性 AI 授權」,即法官要求 JudgeGPT 自行評估判決或起草理由。培訓讓法官更傾向於自行判斷案件,僅使用 AI 來撰寫其判決理由。

研究人員強調,他們的發現並不支持用 AI 取代法官。他們表示,這項實驗表明 AI 可以提升公共部門的生產力,但前提是必須搭配引導使用者執行正確任務的培訓。如果沒有適當的培訓,大部分的效益將會消失。

這項研究中的生產力提升可能只是最低限度,而非上限。JudgeGPT 當時是運行在 GPT-4 上,這是一個預推理模型,是當時最適合該專案的模型。現今的推理模型寫作能力更佳、幻覺現象更少,並且能更可靠地處理複雜任務。