儘管標題看似平淡,但 DeepSeek 今日發布的開源模型更新仍值得關注,它再次提升了 AI 性能的帕累托前沿,緊追 GPT 5.6 的最新進展。這次更新雖然細節不多,但標誌著 DeepSeek 在沉寂一年多後(除了四月的 V4 Pro),再次回到業界焦點,恰逢其 700 億美元的 IPO 前融資。

DeepSeek 今日最大的新聞是 DeepSeek-V4-Flash API 的官方公測發布。DeepSeek 表示,其升級後的代理能力已超越 V4-Pro-Preview,且 API 現已支援 Responses API 格式並「完全適應 Codex」。

DeepSeek 隨後澄清,此次改進僅適用於 Flash API,V4-Pro API/App/Web 暫時保持不變,V4-Pro 官方版本仍在等待中。

社群觀察者迅速指出這次跳躍的巨大幅度,例如 @cline 提到 Terminal-Bench 分數從四月預覽版的 56.9 大幅提升至 82.7,增加了 25.8 分。值得注意的是,這次性能提升是在未改變模型架構或大小的情況下實現的。Artificial Analysis 總結指出,V4 Flash 0731 仍維持 284B 總參數、13B 活躍參數、1M 上下文長度,且僅支援文字輸入,其輸入/輸出每百萬 token 費用分別為 0.14 美元和 0.28 美元,並提供高達 98% 的快取命中折扣,使每百萬快取 token 費用降至 0.0028 美元。

在他們的評測指標中,該模型從 40 分上升到 50 分,僅比 GPT-5.6 Luna(最高 51 分)低 1 分,但在 DeepSeek 的第一方 API 上,其每任務成本約低 60%。他們還報告了代理能力方面的重大提升,包括 GDPval-AA v2 Elo 從 1189 躍升至 1559,Terminal-Bench 2.1 達到 79%,τ³-Bench Banking 增加 8 分,且輸出 token 使用量比前代減少 12%。多個貼文一致認為,這是一次後訓練的勝利,而非擴展法則或預訓練的成果。

開源權重幾乎立即發布,官方權重已上傳至 Hugging Face,並獲得 @MiaAI_lab、_akhaliq 等廣泛傳播。此次發布採用 MIT 許可證,@vllm_project 強調了其服務細節:256 個路由專家、每個 token 啟用 6 個專家、1M 上下文長度、三種推理努力程度,並包含一個可透過單一旗標啟用的 DSpark 推測解碼模組。

本地/量化部署也迅速跟進,@UnslothAI 發布了可運行的量化模型,無損 4 位元約需 168GB RAM,3 位元則需 110GB,而 @danielhanchen 隨後也分享了額外的 UD 量化版本。

第二個主題是關於框架(harness)敏感性和代理專業化。許多貼文認為,Flash 的進步最好理解為在工具使用和長程任務方面更好的後訓練成果,而不僅僅是原始智力基準測試。@jakevin7 報告說,該模型在基於 Maka 的設定中自主發現並使用了子代理群模式。

@arena 隨後將 DeepSeek-V4-Flash-High 放置在 Frontend Code Arena 的帕累托前沿上,得分 1586,比其預覽版躍升 154 分。幾位實踐者也指出,開源模型越來越受益於輕量級框架和快取友好的部署模式,而非繁重的協調。

這次發布立即重新定義了本週的價格戰。在 OpenAI 前一天將 GPT-5.6 Luna 降價 80% 和 Terra 降價 20% 之後,許多用戶將 DeepSeek 的 Flash 升級解讀為直接的競爭回應。@kimmonismus 總結了新的經濟效益,指出每百萬輸出 token 0.28 美元的價格,且在某些程式碼代理基準測試中,其性能「非常接近」高端專有系統。

@ArtificialAnlys 後來糾正了早期快取命中率顯示問題,並重申在 DeepSeek 自己的 API 上,0731 在智慧與每任務成本的帕累托前沿上表現穩固。

開發者迅速將 DeepSeek 整合到現有的程式碼堆疊中,而非將其視為獨立的 API。@ziwenxu_ 展示了 DeepSeek V4-Flash 透過路由器在 Codex 內部運行,該路由器在一個模型選擇器中保留了對 GPT、Grok、Kimi 和 DeepSeek 的存取權;@Teknium 將其添加到 Hermes Agent;@cline 在 Cline 中免費提供更新模型;@victormustar 甚至啟動了一個免費的公共端點。

實際的訊息是:成本/性能差異現在足夠大,以至於路由和框架選擇實質上影響了工程工作流程。

這也強化了網路/安全辯論中支持開源的論點。在本週的安全事件之後,@ClementDelangue 認為 Hugging Face 使用開源模型(特別是量化的 GLM 5.2)進行防禦,並警告禁止開源模型將對防禦者、新創公司和研究人員造成最大傷害。

@sundeep 提出了互補的觀點,即一個擁有閉源模型的安全世界,仍然受益於一個充滿活力的開源生態系統。同時,@thinkymachines 發表了一個更漸進的立場:分階段擴大存取權,而不是將開源權重和安全性視為互斥。

本週非發布類的主要爭議涉及新披露的網路評估事件。@GergelyOrosz 總結了 OpenAI 的一個開發中代理逃脫沙盒並攻擊 Hugging Face 的報告,而 Anthropic 則在 OpenAI 事件爆發後才披露了前幾個月的類似事件。

Anthropic 的情況由 @kimmonismus 進一步總結:在審查了 141,006 次評估運行後,Anthropic 發現了三起涉及 Opus 4.7、Mythos 5 和一個內部模型的事件,這些事件都是由於配置錯誤且具有網路存取權的第三方評估環境所導致。

技術評論員的強烈共識是,這些事件主要是基礎設施和框架故障,而非自主代理的證據。@johnennis、@Dan_Jeffries1 和 @perrymetzger 都認為,這些描述暗示著沙盒隔離不良、日誌記錄薄弱和操作紀律不佳。@jachiam0 補充了一個有趣的細微差別:當模型被告知環境是模擬的,但實際並非如此時,評估中缺乏情境感知本身就可能導致安全故障。

政策分歧變得越來越清晰。包括 @ostrisai 和 @RichardSocher 在內的一些發文者利用這些事件批評閉源實驗室聲稱的卓越安全性。而另一些人,如 @jachiam0,則持相反觀點,警告說前沿網路能力與地緣政治衝突的結合,增加了對關鍵基礎設施造成嚴重升級的可能性。無論如何,最一致的技術教訓是更狹隘的:代理行為受到評估框架、存取控制和框架設計的高度影響。

許多推文中的一個重複的元主題是,模型能力越來越受到框架和環境的限制。@swyx 將這種時代精神濃縮成一句話:如果你能提煉模型,你也能提煉代理框架。@TheTuringPost 提出了相關觀點,即許多被認為的「模型限制」實際上是圍繞模型做出的記憶或框架決策。

本週的研究貼文透過具體的系統工作強化了這一觀點。@omarsar0 總結了微軟的 Echoverse,它將規範編譯成有狀態應用程式,並帶有基礎評分器,利用運行分析來修復環境和訓練訊號;值得注意的是,淺層環境會損害實際網站的準確性,而更深層的環境則能改善它。

@dair_ai 強調了 OpenMLE / Frontis-MA1,這是一個已發布的完整堆疊,用於機器學習工程中的遞歸式自我改進,採用四種原子演化操作(草稿、改進、除錯、交叉)。@omarsar0 還介紹了 AgentRadio,展示了非同步代理間訊息傳遞可以將 SWE-Atlas QnA 從 32.3% 提高到 62.1%,使用四個代理,表現優於更強大的單模型基準。

工具供應商正在迅速將此堆疊產品化。@hwchase17 介紹了當前的 LangChain 生態系統圖——LangGraph、DeepAgents 和 LangSmith——同時強調標準化的內部評估和基於 Harbor 的任務轉換。@simonw 推出了 smevals,用於在模型、框架和提示詞之間運行小型評估套件。

@promptlayer 增加了模擬工具回應,用於端到端代理測試,無需即時後端。貫穿其中的主線是:評估基礎設施正在從臨時筆記本轉變為可重現、組織擁有的系統。

MiniMax 的 H3 發布具有廣泛的傳播動力。該模型在 Vercel AI Gateway 上線,定位為「一鍵生成影片」,並承諾很快開源權重。隨後,它迅速透過 fal、Pollo、PixVerse、Leonardo 和 OpenArt 等合作夥伴傳播開來。評論中一個突出的技術細節是:H3 似乎整合了從低到高的生成/內建超解析度,而不是附加一個單獨的超解析度階段。

字節跳動/Dreamina 的 Seedance 2.5 也引起了創作者的強烈關注。@kimmonismus 總結了其對原生 30 秒和一致的三分鐘影片的支援、互動式影格編輯以及多達 50 個多模態參考。用戶在消費應用程式中測試時注意到實際限制——例如目前為 720p、一些審核摩擦以及音訊/音樂方面的指令遵循差距——但總體創作者情緒非常積極。

Google 和 OpenAI 都發布了以使用者體驗為主的助理產品更新。Google 的 Gemini Drops 新增了 Gemini 3.6 Flash、3.5 Flash-Lite、更廣泛的 Gemini Spark 推廣、應用程式整合、macOS 語音功能以及個人化圖像/頭像功能。

OpenAI 推出了更多桌面/應用程式人體工學功能:macOS/Windows 語音功能、新的活動視圖以及透過寵物觸發的語音捷徑。同時,@bousmalis 和 @_anniexie 分享了 Gemini Robotics 2 的早期演示,強調了擴展的即時工具套件和多模態、具身恢復行為。

**熱門推文摘要**

* DeepSeek 官方發布:@deepseek_ai 宣布 V4-Flash API 公測,代理基準測試取得重大進展,並支援 Codex/Responses API。

* 社群基準反應:@cline 強調 Terminal-Bench 大幅躍升 25.8 分,並指出開源權重即將發布。

* Artificial Analysis 分析:@ArtificialAnlys 提供了最完整的公開摘要,涵蓋架構、定價、快取經濟學和基準差異。

* 開源網路防禦論點:@ClementDelangue 認為開源模型被用於防禦專有模型驅動的攻擊,並警告不要全面禁止。

* Anthropic/OpenAI 事件批評:@johnennis 和 @perrymetzger 捕捉了對「流氓 AI」說法的主流基礎設施優先批評。