一項新研究發現,流行的程式碼助理無法預測任務所需時間,也無法可靠地判斷已工作多久,這對長時間執行的任務構成挑戰。當 AI 助理執行任務時,它通常對時間流逝毫無概念。這是兩位獨立 AI 研究人員在 MATS 研究計畫中進行的一項研究結論,他們測試了 Anthropic 的 Claude Code 和 OpenAI 的 Codex 這兩款廣泛使用的程式碼助理的時間感。
在每個程式碼任務開始前,這些 AI 代理必須估計所需時間。隨後,它們解決任務並回顧報告已花費的時間。測試材料來自 ProgramBench 集合中的 200 個任務,以及研究人員自行設計的 18 個基準測試。
測試結果顯示,這些 AI 代理始終高估自己所需的時間。在 ProgramBench 上,無論任務難度如何,兩個模型大多估計約 90 分鐘。在第二輪測試中,Claude 的平均誤差是實際時間的三倍,而 Codex 則高達六到十倍。對於短任務的估計最差,只有在數小時的任務範圍內,部分預測才接近現實。
程式碼代理嚴重誤判任務所需的時間。圖中深色對角線以上的點表示高估:Fable 5 平均比實際執行時間高出約三倍,GPT-5.6 Sol 則高出約七倍。在短任務上,這種差距尤其明顯。
相同的 AI 根據其設定表現出截然不同的行為。測試結果會因模型運行的軟體設定而異。Claude Code 會持續工作直到它認為任務完成,中位數約為 90 分鐘。而 Codex 則在大約半小時後停止,幾乎不論任務為何。根據這項研究,相同的語言模型在 Claude Code 中執行的步驟平均比在 Codex 中多 2.5 倍。
因此,執行時間不僅取決於模型本身,也很大程度上取決於其周圍的軟體環境,即所謂的「harness」。
這些 AI 代理在判斷自身工作品質方面同樣不可靠。較舊的模型,如 Opus 4.8 和 GPT-5.5,平均將其結果高估了 20 個百分點,即使在失敗的任務中也給自己打高分。在一個案例中,兩者都認為自己的工作成功率約為 70%,但實際分數分別只有 7% 和 14.5%。
Claude 和 Codex 對自身工作的評分過於寬鬆。平均而言,這兩個系統給自己的分數比實際測試結果高出約 20 個百分點。圖中的虛線代表準確的自我評估。
研究人員表示,這種自我評估能力至關重要。對於一個需要長時間運作的 AI 代理來說,它必須能夠遵循「在此任務上迭代兩小時」之類的指令。一個持續誤判時間的代理將難以控制。接下來,作者們希望測試 AI 代理是否能堅持設定的工作時長。當這些代理獲得一個能報告已逝時間的工具時,它們幾乎每次都能正確判斷。
