根據 Mozilla 的一份報告,美國科技公司的頂尖 AI 模型與中國公司最佳開源模型之間的效能差距已縮小至僅 4.4 個月。這解釋了為何許多公司正轉向成本顯著較低的開源模型來處理日常工作,同時也揭示了頂尖模型值得投資的特定工作負載範圍。

Mozilla 於 9 月 15 日發布並提前與 Ars 分享的最新《開源 AI 狀況報告》指出,大多數組織理想上應將開源模型作為其大部分工作的預設選項。報告強調,領先的開源模型 Moonshot AI 的 Kimi K3 在 Artificial Analysis Intelligence Index 上的綜合 AI 效能分數,僅比 Anthropic 的閉源頂尖模型 Fable 5 落後三分,而其成本卻只有後者的 30%。

Mozilla 技術長 Raffi Krikorian 在一封寄給 Ars 的電子郵件中表示:「閉源模型在幾個方面證明了其高價:專業專家工作、高強度檢索和長上下文處理。」他補充說:「我們認為是否為閉源模型付費的決定,應取決於具體工作負載,而非組織本身。」

開源權重(open-weights)AI 模型允許任何人下載主要模型組件並在自己的電腦上運行,但開發者通常仍會保留關鍵資訊,例如訓練資料、資料管線和訓練程式碼。相較之下,Anthropic 和 OpenAI 等美國科技公司大多提供閉源頂尖模型,將所有內容專有化,要求客戶支付更高費用才能使用。

Krikorian 解釋說,組織仍會為閉源頂尖模型付費,因為它們開箱即用,並附帶「合規性套件、支援和問責機制」。而許多組織則缺乏足夠的人力來良好運行開源權重模型。

然而,開源與閉源頂尖模型之間效能差距的持續縮小,加上開源模型的成本效益,如今已廣為許多公司所認可。例如,外送公司 DoorDash 已將 Kimi 用於日常工作,同時保留 Fable 處理通常需要人類專家花費更長時間才能完成的較困難任務。

不出所料,自 Mozilla 的首份《開源 AI 狀況報告》於 7 月 14 日發布以來,這加速了開源模型的使用。

效能差距的縮小正透過多種方式衡量。例如,研究非營利組織 METR 將 AI 模型的時間範圍定義為,AI 模型能以「可靠」的 50% 成功率處理的任務長度,該長度以人類專家完成任務所需的時間來衡量。這個時間範圍一直以固定的節奏翻倍,且隨著時間推移而加速。

目前,最佳閉源模型能夠完成的任務長度,是最優開源模型能可靠完成任務長度的 1.7 倍。

Krikorian 告訴 Ars:「如果開源頂尖模型能處理七小時的任務,閉源頂尖模型則能處理十二小時的任務。」他進一步指出:「四個月後,開源模型就能處理十二小時的任務,而閉源模型則能處理約二十小時的任務。」

Krikorian 表示,需要八到十二小時的任務通常是閉源頂尖模型能處理而開源模型尚未能勝任的。目前沒有任何模型能可靠地完成超過十二小時的任務,而少於八小時的任務則可由任一類型的模型完成,並可交由更便宜的開源模型處理。

這類比較存在許多細微差別和注意事項。例如,閉源頂尖模型通常會附帶自己的「線束」(harness),這是一種軟體層,可幫助模型存取各種工具和記憶體以執行代理(agent-like)行為。AI 實驗室為其模型客製化的線束有時能提升各種任務的效能,而模型在使用第三方線束時表現可能較差。

為了公平比較,基準測試公司 Vals AI 一直使用其自有的中立線束來評估不同的開源和閉源模型。在 Terminal-Bench 2.1 評估中,當所有模型都在相同的線束上運行時,中國公司 Z.ai(智譜 AI)的開源權重模型 GLM 5.2 的得分與 Anthropic 的 Claude Opus 4.7 和 4.8 相差不到一分,但每完成一個任務的成本卻約低了五倍。

換句話說,為閉源頂尖模型付費,大約能換取四個月的領先優勢,但每項任務的成本卻高出約五倍,而且這僅限於目前需要八到十二小時才能完成的任務。

Krikorian 告訴 Ars:「當這種領先優勢值得時才付費,例如在開源模型趕上之前必須完成的截止日期。」他補充說:「對於下個季度仍會進行的日常工作則不值得,因為很快就能以五分之一的成本完成,而且模型屆時也不會是瓶頸。」

開源權重模型的日益普及,可從 OpenRouter 上看出,這是一個 AI 閘道和市場,讓開發者能存取來自多個供應商的數百種不同模型。Mozilla 報告指出,在 2026 年 8 月按 token 流量排名的前十大模型中,有八個提供開源權重。

然而,開源模型在營收方面仍落後於閉源頂尖模型。Frank Nagle 和 Daniel Yue 為 Linux Foundation 撰寫的一篇論文發現,開源模型僅佔總營收的 4%,而閉源模型則佔 96%——儘管他們研究的是 2025 年 5 月至 9 月的數據。

Krikorian 表示:「在過去一年中,開源模型呈爆炸性增長,因此我們確實預計營收結構會有所轉變。」

Krikorian 指出,目前的現實是「世界上大多數運行的開源模型都來自中國」。他解釋說:「中國實驗室正在複製美國當年對 Android 的策略——免費提供,但掌控其周邊生態系統。」

然而,Krikorian 對「中國模型」的擔憂不如對集中化風險的擔憂。目前,最佳開源模型集中在中國,而最佳閉源頂尖模型則來自美國公司。他主張美國和歐洲的實驗室應開始在「相同的開源賽道」上競爭,以避免單一國家設定全球的預設標準。

Krikorian 說:「令人不安的事實是,目前開源權重 AI 周圍的多元生態系統,主要由中國資本資助。」他補充道:「這既是多元化,同時也是一種集中化。」

Krikorian 表示,Linux 等開源軟體的發展歷史,或許能為「替代聯盟」如何形成提供一些啟示。這類開源軟體基礎設施是由一個組織聯盟資助的,這些組織「各自都需要商品層的存在」,其中包括中立基金會。

Krikorian 說,任何旨在建立更多開源 AI 模型的聯盟,可能由「以使命而非市場為導向的機構」組成,而非頂尖 AI 實驗室。他對此描述如下:

我們需要公共計算計畫來資助完全開源的參考模型,瑞士國家計算中心生產的 Apertus 就是一個例子。基金會需要像他們為網際網路開放協定所做的那樣,保持中立立場,並將其延伸到模型、線束和代理標準。從商品化模型中受益的公司必須參與。而慈善事業則必須彌補其他任何人都無法承擔的部分——特別是評估和審計基礎設施。

Krikorian 還呼籲替代聯盟應超越開源權重模型,更全面地採納開源方法。他表示:「如果你無法得知模型是如何訓練的,或者它是根據什麼進行評估的,就很難完全信任它來做出決策。」