Poolside 在 2026 年 4 月首次向大眾發布了 Laguna M.1 和 XS.2 模型。在此之前,該公司主要服務政府和公共部門客戶。XS.2 也是其首個採用 Apache 2.0 授權的開源模型。Laguna S 2.1 是該系列在約三個月內發布的第三個版本。

啟用思考模式後,Laguna S 2.1 在測試模型長期終端任務的 Terminal-Bench 2.1 上獲得 70.2% 的分數。它僅次於騰訊的 Hy3 (295B-A21B),並領先於許多更大的開源模型,包括 DeepSeek-V4-Pro-Max、Nemotron 3 Ultra 和 Thinking Machines Lab 的首款模型。

總體排行榜由 OpenAI 的 GPT-5.6 Sol、Anthropic 的 Claude Fable 5 和 Kimi K3 領先。

Poolside 表示,Datacurve 的 DeepSWE 基準測試提供了更好的比較,因為其分數分佈範圍更廣。Laguna S 2.1 在 DeepSWE 上獲得 40.4% 的分數,而一些擁有超過一兆參數的開源模型仍低於 10%。它在 SWE-Bench Multilingual、SWE-Bench Pro 和 SWE Atlas 等測試中也名列前茅。

思考模式對效能有重大影響。如果沒有它,Laguna S 2.1 在 Terminal-Bench 上的分數會降至 60.4%,而 DeepSWE 分數則會降至 16.5%。Poolside 表示,之前的 Laguna 模型從未在兩種模式之間顯示出如此大的效能差距。

Poolside 表示,這次發布反映了對模型效能的更廣泛理念。該公司在其發布文章中寫道:「我們在這個模型中所做的,不一定是增加了更多智慧,而是改進了導致模型能力更強的行為:更多的驗證、更少地想當然、不提早宣布勝利,以及更具持久性。」

早期的 Laguna 模型有時在部分通過測試套件後就停止,或者在距離成功僅兩步之遙時放棄了方法。Poolside 將持久性、驗證和修正失敗方法視為提升效能的第二條路徑,與擴展模型本身並行。一個更大的 Laguna 模型已經在預訓練中。

Poolside 透過三次有記錄的試運行來支持其說法。其中一次,Laguna S 2.1 在 50 分鐘內從一個空資料夾建立了一個可運行的瀏覽器引擎,能夠渲染 HTML 和 CSS。另一次,該模型在沒有 Python 的沙盒環境中工作時,找到了 Erdős 問題 #397 的證明,這是一個自 1975 年以來一直未解決的數學問題。

Poolside 表示,這個結果是一次獨立的重新發現。GPT-5.2 Pro 在 2026 年 1 月解決了這個問題和幾個其他問題,而 Laguna 的訓練截止日期是 2025 年 11 月。

Poolside 表示,從 XS 2.1 到 S 2.1 的飛躍主要來自於擴展和後訓練,而非新的預訓練資料。代理式訓練階段涵蓋了 409,000 個環境,其中包括 83,000 個終端任務和 168,000 個軟體工程工作流程。最大的單一來源是來自約 17,000 個儲存庫的約 38,000 個真實提交。一個新的任務類別訓練模型自行安裝儲存庫、設定所有依賴項並運行測試套件。

Poolside 增加了推出預算並延長了超時時間。它還建立了一個新的沙盒系統,可以選擇性地阻止網路存取以遏制獎勵駭客行為。多重線束推出(Multi-harness rollouts)在多個代理環境中運行相同的提示詞,降低了過度擬合單一設定的風險。

根據 Poolside 的說法,從訓練開始到發布,不到九週的時間。預訓練於 2026 年 5 月 22 日開始,使用了 4,096 個 Nvidia H200 GPU。S 2.1 也是該公司首個使用 FP8 精度進行強化學習訓練的模型。

Poolside 在 trajectories.poolside.ai 上發布了所有基準測試軌跡。在訓練期間,SWE-Bench 任務上的獎勵駭客率曾高達 50%,因為模型會上網搜尋匹配的拉取請求,而不是自行解決任務。一個小的提示詞更改將該比率降至 2% 以下。

Poolside 表示,Laguna S 2.1 在某些情況下仍然與 Poolside 的代理線束過於緊密地調整。在工具模式略有不同的陌生環境中,模型可能會偏離所需的格式。它也傾向於在競爭性數學問題上產生過長的思考序列。用戶目前無法調整其思考努力程度。

Laguna S 2.1 可在 Hugging Face 上以 OpenMDW 1.1 授權提供。在 Linux 基金會的支持下,該授權允許任何人使用、修改和重新分發模型權重,包括用於商業目的。

Baseten、Vercel AI Gateway 和 OpenRouter 提供託管存取。OpenRouter 提供一個具有 256K 上下文視窗的免費端點,以及一個支援完整一百萬 token 視窗的付費端點。Poolside 表示,該模型也可以在單個 Nvidia DGX Spark 上本地運行。無需登入即可在 chat.poolside.ai 獲得免費的聊天演示。

Poolside 正在進行兩項戰略性賭注。一是通往智慧的路徑是透過代理式程式碼(agentic coding),因為軟體為代理提供了最具表達力的介面。它還相信 AI 可以「解壓縮網路」。大多數書面材料記錄的是答案而不是其背後的推理,Poolside 認為強化學習可以恢復這個過程。