科學運算是學術界與產業現代研究的核心支柱。然而,分析科學資訊所需的軟體卻難以跟上資料快速生成的腳步。許多廣泛使用的研究工具最初只是研究論文附帶的程式碼,由小型學術團隊開發,工程經驗有限,且幾乎沒有時間進行封裝、測試、優化或長期支援。結果是科學基礎設施往往依賴緩慢、脆弱的工作流程,需要持續維護。這些限制阻礙了科學發現的速度。
AI 代理正開始改變這種局面。透過降低工程工作的成本並承擔繁瑣的實作任務,它們可以幫助研究人員更快地開發原型,推動以前不切實際的專案,並更容易地長期維護軟體。因此,科學軟體變得更有效率且維護更佳,讓研究人員能將更多時間投入於發現。
我們正在分享一份探索性的實地報告,內容涵蓋八個主要在生命科學領域中,由代理輔助的科學運算專案;其中五個僅使用 Codex,三個則結合使用 Codex 和 Claude Code。這份報告匯集了每個專案團隊撰寫的案例研究,並歸納出重複出現的主題。
這些專案從日常維護和目標優化,到大規模語言遷移和 GPU 原生重新設計,範圍廣泛。貢獻者報告指出,代理顯著加速了軟體開發和維護,在某些情況下,幫助小型團隊承擔了原本需要更多時間或專業工程支援的工作。但他們也強調,建立明確的長期責任和工具管理仍然是一項持續的挑戰。
貢獻者一致描述,研究人員的角色正從實作轉變為驗證和協調:他們負責指定要建構什麼、定義如何衡量正確性,並決定專案何時可以發布。在這個新興模式中,研究人員仍掌握科學方向和品質標準,但透過代理的協助獲得了速度上的提升。
cyvcf2 是一個用於讀寫基因組變異檔案的 Python 函式庫。GPT-5.5 將該函式庫的舊版建構與封裝系統,替換為現代化且統一的流程,旨在讓函式庫更容易安裝、測試和發布。
「有了程式編寫代理,要快速推進相當容易;但目前,要在科學領域走得更遠,仍然需要專家的指導、理解、品味和細心。」—Brent Pedersen
儘管這些專案的範圍差異很大,但它們證明了程式編寫代理正在使工程勞動和專業知識在科學運算中不再是主要限制。現在,瓶頸在於驗證 AI 代理的輸出,這仍然依賴於人類的判斷。
在所有案例研究中,代理都能有效處理特定且範圍明確的請求,但無法可靠地判斷其工作是否具有科學有效性或符合預期。事實上,即使代理的工作包含明顯錯誤,它們也經常表現出自信。因此,人類審閱者需要找到可靠的方法來驗證結果。最有效的方法是使用外部參考或可衡量的驗收目標,例如精確的輸出一致性、與現有工具的對等性、適當的統計行為,或使用模擬資料預先建立的答案。
另一個重複出現的主題是,專案通常以階段性、回饋驅動的迭代方式進行,而非一次性完成。貢獻者將廣泛的目標分解為較小的變更,然後使用中間基準和測試系統來評估和改進代理的工作。代理通常能快速產生初步實作,但解決邊緣案例和細微的數值差異則需要更長時間。完成實作的「最後一哩路」往往耗費最多精力。
總體而言,這些案例研究表明,代理讓研究人員能將更少時間花在實作上,而將更多時間用於指導科學工作。人們定義目標、將複雜專案分解為可管理的區塊,並判斷結果是否具有科學有效性。透過緩解長期存在的工程限制,代理擴展了研究人員可以建構的內容,同時讓他們能專注於最重要的科學問題和決策。
研究軟體的維護落差長期以來減緩了迭代速度,並限制了可重現性和可靠性。已發表的「研究程式碼」和「體學工具」研究發現,發布的軟體通常無法在全新的運算環境中正確安裝或按文件運行,迫使研究人員花費大量時間進行配置和除錯。即使是例行性的改進也能為研究人員節省時間並減少運算需求,而基於效能的重構和重寫則能帶來更大的效益。
然而,較低的實作成本也使得產生許多類似的重寫版本變得更容易,這會分散使用者並稀釋維持任何單一工具可靠性所需的專家關注。這使得長期管理和歸屬變得至關重要。成熟的科學軟體帶有未記錄的慣例、相容性要求和使用者信任,這些是單純翻譯原始碼無法重現的。
這些案例研究闡明了幾種可能的發展路徑。MHCflurry 和 cyvcf2 的變更被整合到其原始上游專案中,而 rustar-aligner 則轉由新的社群管理,因為原始專案已被放棄。如果能與現有維護者協調,應盡早開始。當需要獨立實作時,它需要明確的擁有者和可信的維護計畫。否則,今天的現代重寫版本可能成為明天的廢棄程式碼,而非可靠的科學基礎設施。
這份實地報告是回顧性和探索性的,但這些案例研究指出科學軟體開發方式的實際轉變。Codex 等程式編寫代理可以顯著降低維護、遷移、優化和新實作的成本。它們的長期科學價值仍取決於人類關於要建構什麼、如何驗證以及由誰來維策的決策。更深層次的改變不僅僅是研究人員可以生產更多軟體,而是他們能將更多精力集中在定義、驗證和管理這些工具上。
這些案例研究表明,代理已經能夠加速科學運算中的迭代速度。隨著程式編寫代理的改進,研究人員將能花費更少時間維護分析流程,並將更多時間用於推進其領域。
