一年前,我們的一張「英雄圖表」(後來被 Demis 採用)做出了驚人的觀察:在 LMSys Elo 分數保持不變的情況下,GPT-4 等級的智慧在 18 個月內成本下降了 1000 倍。當時,尚不清楚這是否只是「新手紅利」,即從未優化到優化、從補全到推理、從密集模型到 MoE 模型,所有唾手可得的成果都已摘取。
又過了 18 個月,答案似乎是否定的;相同水準的智慧成本仍在持續急劇下降。昨天,OpenAI 發布了關於 GPT-5.6 如何優化自身服務的發現。
為了在不犧牲品質的前提下,於相同硬體上提供更多 token,OpenAI 專注於幾項系統性升級。其中,GPT-5.6 Sol 被積極用於分析生產流量、調整負載平衡,並自主地以 OpenAI 自己的 Triton 和 Gluon 語言重寫生產核心。這種自主核心優化將端到端服務成本降低了 20%。
推測解碼(Speculative Decoding)方面,OpenAI 透過設計和運行數百個架構實驗,測試大小、結構和功能的變化,同時監控推測器訓練過程,並在出現問題(包括硬體故障和訓練不穩定)時自主介入,從而改進了其草稿模型。這將 token 生成效率提高了 15% 以上。
KV 快取(KV Caching)則針對不同工作負載(主要是在 Codex 中的 Sol)優化了批次處理、分片和快取管理,以從現有硬體中提取更多推理能力。
為了簡化 Codex 和 ChatGPT Work 等工具中複雜的多步驟任務,OpenAI 優化了其 Rust 編排層,以減少重複的計算成本。透過避免上下文膨脹(Context Bloat),工具、技能和外掛程式只在需要時才顯示(延遲發現),並且工具輸出預設限制為 10,000 個 token,以防止上下文視窗不必要地擴大。
提示詞快取(Prompt Caching)方面,為了避免重複處理相同的指令和歷史記錄,系統將所有模型可見的歷史記錄視為僅追加(append-only)。這保留了提示詞前綴,允許系統重複使用先前計算的數據並保持高快取命中率。
今天,他們證明這不僅僅是理論,宣布大幅調降較小型模型的價格,並在 Sol 中推出新的 2.5 倍加速模式(儘管不是七月暗示的 10 倍加速 Cerebras 驅動模式)。
Sam Altman 在推特上表示:「今天大幅降價:GPT-5.6 Luna 降價 80%,現在每百萬輸入 token 0.20 美元,每百萬輸出 token 1.20 美元。GPT-5.6 Terra 降價 20%,降至 2 美元/12 美元。GPT-5.6 Sol 在 API 中獲得了快速模式,速度提高 2.5 倍,價格是兩倍,但智慧水準不變。」
這是一條漂亮的帕累托曲線——如果 AA 的「每任務成本」反映了真實世界的任務,那麼 OpenAI 甚至擊敗了 DeepSeek、GLM 和 MiniMax 等開源模型,以及 Gemini Flash-Lite 等專注於低成本但高效能的模型。
然而,真正令人震驚的是 Nicdunz 的觀察:GPT-5.4 在 xhigh 上的完整分數為 51,這與今天 Luna 的最高分數完全相同。GPT-5.4 的成本為 2.50 美元/15 美元;而 Luna 現在的成本為 0.20 美元/1.20 美元。換句話說,大約四個月後,OpenAI 以約十三分之一的 token 價格出售三月份的旗艦級智慧。
這相當於每年約 2000 倍的年化速度,比我們上次觀察到的速度大幅加速——儘管你應該對此打折扣,因為所有公開基準測試(如 AA)在某種程度上都會被訓練,而 Elo 分數則較不直接可訓練。儘管 Poolside 的 Laguna 和 Thinky 的 Inkling 等領先的中國和美國開源模型提供完全控制和主權,但如果你的唯一目標是具成本效益的非微調智慧,那麼你現在會發現很難擊敗 OpenAI。
這篇文章也包含了 2026 年 7 月 29 日至 30 日的 AI 新聞摘要,涵蓋了 OpenAI 定價調整、代理系統語義學以及 ARC-AGI-3 記憶體辯論等主題。
**OpenAI 定價調整、代理系統語義學與 ARC-AGI-3 記憶體辯論**
OpenAI 大幅調降了 GPT-5.6 的價格,並增加了更快的 Sol 層級。OpenAI 將 GPT-5.6 Luna 降價 80%,Terra 降價 20%,同時推出了 Sol Fast 模式,延遲降低高達 2.5 倍,價格是標準模式的兩倍,但「智慧水準不變」。
這對代理工作流程產生了顯著影響:ChatGPT 應用程式和 Codex CLI 中的自動審查功能正從 GPT-5.4 轉向 Luna,OpenAI 預計成本將降低約 10 倍。
多位觀察家,包括 Sam Altman 和 Nicdunz,都將此視為價格/效能前沿的重大轉變。OpenAI 也將這些降價歸因於跨「模型、推理堆疊和代理系統」的系統級效率提升。
ARC-AGI-3 再次強調「模型」並非整個系統。最技術性的評估討論集中在代理系統設計、記憶保留和上下文壓縮。François Chollet 澄清了 ARC 的規則:不允許使用針對基準測試的專用代理系統,但所有用戶可用的通用 API 功能是可接受的,前提是報告其設定和成本。
一份來自 @kimmonismus 的詳細摘要對比了 Opus 5 在官方半私人 ARC 設定下 30.2% 的分數,與 GPT-5.6 Sol 在標準代理系統下 7.8% 的分數,同時指出 OpenAI 內部使用 Responses API 結合推理和壓縮後,Sol 在公共集上的分數提高到 38.3%。
這一結論得到了 @gneubig 等人的呼應:長期評估越來越多地衡量完整的代理系統——推理保留、截斷策略、壓縮、工具編排——而不僅僅是基礎權重。
**Thinking Machines 的 Inkling-Small 與持續的開源權重推動**
Inkling-Small 將 Inkling 級別的功能壓縮到更小的活躍佔用空間中。Thinking Machines 發布了 Inkling-Small,這是一個開源權重、原生多模態的 MoE 模型,總參數為 276B,活躍參數為 12B,其性能據稱與原始 Inkling 相當,但規模約為四分之一。
該公司表示,它能與文本共同處理音訊和圖像,並在多模態設定中支援基於 Python 的圖像檢查。該版本立即在開源推理堆疊中落地:vLLM 宣布了當日支援,Modal 強調了單一 B300 部署,LMSYS/SGLang 報告了解碼吞吐量數據,Unsloth 發布了本地運行/GGUF 指南。
基準測試表明這是一個異常高效的開源編碼和多模態模型。Artificial Analysis 將 Inkling-Small 在其智慧指數上評為 40 分——與旗艦 Inkling 相差不到一分——在 Humanity’s Last Exam、GPQA Diamond、CritPt 和 SciCode 上表現出色,儘管在某些代理任務和事實知識方面較弱。
社群摘要強調,這個較小的模型在多項編碼任務上可以擊敗或匹配較大的 Inkling。開放權重、多模態輸入、部署堆疊中支援 1M 上下文以及 12B 活躍計算的結合,使其成為這批開源發布中更具實際重要性的模型之一。
**Google 的 Gemini Robotics 2 與具身 AI 的加速發展**
Gemini Robotics 2 從桌面操作擴展到全身控制和多機器人協調。Google DeepMind 推出了 Gemini Robotics 2,將其描述為「任何機器人的單一大腦」,其演示涵蓋了全身人形機器人控制、高級靈巧性以及多機器人協作。
Google AI 補充說,該堆疊包括 Gemini Robotics ER 2,這是一個高階具身推理模型,能夠觀察、規劃、與 VLA 模型協調、追蹤進度,並在數分鐘的任務中從失敗步驟中恢復。演示強調了非簡單的運動任務,例如打結、擰燈泡、彎腰撿物和協作清理車庫。
實際的故事是異質性和適應性,而不僅僅是更漂亮的演示。技術評論強調,相同的檢查點控制了多種硬體類型,並且 On-Device 2 據報導能夠以少於 200 個範例適應新的雙臂機器人。@OfficialLoganK 和 @osanseviero 關注了 ER 2 的 API 可用性和具身推理指標,而 NVIDIA Robotics 則藉此機會推動了 Jetson AGX Thor 用於人形/自主系統的本地硬體。
相對於之前的機器人發布,這次的突出之處在於它結合了平台廣度、規劃、靈巧性和直播 API,而非單一狹窄的操作基準。
**代理、雲端開發環境和持久記憶體基礎設施**
雲端代理正從演示階段畢業,進入核心工程工作流程。一個強有力的營運數據來自 Cursor:去年 12 月,十分之一的合併 PR 來自雲端代理;現在這個比例已達 56%,這歸因於為代理提供自己的雲端電腦,並允許它們隨時間改進其環境。
同樣地,@jaredpalmer 表示他在加入 Cognition 後仍未設置用於本地開發的筆記型電腦,更喜歡在 Slack/網頁應用程式中使用 Devin,而 @dabit3 展示了 Devin 雲端代理運行 macOS,並可存取 Xcode 和模擬器來建構/測試原生 iOS 應用程式。Cognition 還增加了原生 GitHub 堆疊 PR 支援,這是對代理生成變更集的一個有用適應。
持久記憶體正在產品化,但其價值的證據好壞參半。Perplexity 推出了 Projects,將 Spaces 演變為透過「Brain」共享文件和持久記憶體的持續工作中心,而 @AravSrinivas 將其定位為一個多用戶、代理式的工作作業系統。
對於堆疊中較低層的記憶體基礎設施,TurboPuffer 描述了 Mem0 將 4 億多個代理記憶體從 pgvector 遷移到 turbopuffer,引用了 70 毫秒的 p90 混合檢索和 97% 的 recall@10。但研究信號更為謹慎:@dair_ai 強調一篇論文指出,檔案系統風格的記憶體儲存可以在規模上將檢索成本減半,但在研究中並未改善最終答案品質,並且除了最強的代理管理器外,大多數管理代理下的儲存品質都會下降。總之:記憶體基礎設施作為產品表面正在成熟,但其對能力的因果貢獻仍未確定。
**基礎設施、檢索和工具:核心、搜尋透明度與新的評估基礎設施**
系統優化仍然是取得收益的主要來源。SemiAnalysis 強調了 GPU Mode 的 AMD 核心駭客松,稱 Readonflow 團隊將 MI355X 的端到端性能提高了兩倍以上。在單一核心層面,@maharshii 報告稱,透過將 div.rn.f32 替換為 rcp.approx,一個客製化注意力核心的性能從 torch SDPA 的 1.5 倍躍升至 2.17 倍,這提醒我們 PTX 層級的檢查仍然很重要。
Astral 還開源了 FlashAttention 和 DeepSpeed 等 GPU 密集型套件的預建輪子(wheels)的建構管道,旨在提高可重現性和簡化 Python 套件管理。
檢索和搜尋基礎設施成為一個透明度問題,而不僅僅是性能問題。Simon Willison 批評 OpenAI 和 Anthropic 都嚴重依賴搜尋,卻模糊了底層搜尋索引和合作夥伴關係;他指出 Anthropic 的子處理器清單揭示了與 Brave 以及後來的 TurboPuffer 的關係,而這些關係並未在產品文件中明確顯示。
在檢索模型方面,@antoine_chaffin 推出了 mDenseOn 和 mLateOn,這是完全開源的多語言檢索模型,用於長上下文和程式碼檢索,後續指標表明晚期互動模型具有特別強的泛化能力。
**熱門推文(按互動量)**
OpenAI 定價重置:@OpenAI 宣布 Luna 降價 80%,Terra 降價 20%,並推出 Sol Fast 模式,這是當天最明確的產品/推理信號。
Gemini Robotics 2 發布:@GoogleDeepMind 和 @GoogleAI 發布了更通用的具身 AI。
