英國人工智慧安全研究所(UK AISI)與美國人工智慧標準與創新中心(CAISI)聯合評估了月之暗面(Moonshot AI)的最新模型 Kimi K3。
Kimi K3 在攻擊性網路任務上,與領先的美國頂尖模型相比有很大差距,但表現優於中國的 GLM-5.2,為開源模型樹立了新標竿。其安全防護措施並未阻止漏洞利用開發或攻擊性網路操作,該模型在協助這些任務時也未遇到阻礙。
這些機構使用卡內基美隆大學開發的 ExploitBench 基準測試,來評估模型開發漏洞利用的能力。該測試利用 2023 年後在 Chrome V8 引擎中發現的 41 個漏洞,追蹤模型在軟體漏洞利用過程中的進展。結果顯示,領先的美國模型平均得分為 76.2%,而 Kimi K3 為 32.2%,GLM-5.2 則為 24.4%。
Kimi K3 在 ExploitBench 基準測試中得分 32.2%,而領先的美國模型則達到 76.2%,GLM-5.2 以 24.4% 落後。在 41 項任務中,Kimi K3 未能在任何一項達到最高級別的「任意程式碼執行」(Arbitrary Code Execution, ACE)。
ACE 是最嚴重的漏洞利用級別,因為它能讓攻擊者完全控制目標系統。領先的美國模型在 41 項任務中有 20 項實現了 ACE。
這些機構在測試美國閉源模型時,關閉了其系統級安全防護措施,以衡量其最大能力。這些安全防護在公開版本中是啟用的。
第二項測試「The Last Ones」(TLO)模擬了一次企業網路攻擊,包含跨越四個子網路和約 20 個主機的 32 步攻擊路徑。根據這些機構的說法,人類專家大約需要 20 小時才能完成。目前只有少數模型能夠解決 TLO,已有四個公開的閉源模型通過了測試,其中最強的模型在十次嘗試中成功了六到七次。
Kimi K3 平均達到 32 步中的第 17 步,而領先的美國模型則達到 28.5 步,GLM-5.2 僅為 11 步。Kimi K3 在十次嘗試中,有一次在 1 億 token 限制內完成了整個攻擊路徑,這表明它具備此能力,但無法可靠地調用。該機構寫道:「當被指示並獲得初始網路存取權限時,Kimi K3 能夠自主攻擊小型、防禦薄弱且易受攻擊的企業系統。」
TLO 測試並未考慮主動防禦,因此不完全符合現實情況。然而,這些結果在實際場景中仍會引發警示。本週就出現了一個新例子:OpenAI 模型試圖自主駭入 Hugging Face。Hugging Face 成功抵禦了這次攻擊,儘管這需要付出真正的努力並利用開源模型。
CAISI 透過基於 Elo 等級的時間序列分析,追蹤了自 2025 年初以來美國和中國模型的網路能力。兩者的趨勢線都在上升,但中國模型始終落後於美國同行。
在先前的分析中,英國機構將開源模型的性能差距定為四到七個月,而 2025 年初為六到十個月。新的結果符合這一模式:中國開源模型正在變強,但仍遠遠落後於領先的美國系統。
AISI 警告,這種差距不應導致自滿。開源模型日益增長的網路能力,帶來了「持續且不可逆轉的濫用風險」。
Kimi 的研究結果也支持了對中國模型開發商進行「蒸餾」的指控。美國科學顧問 Michael Kratsios 最近指控月之暗面「蒸餾」了 Anthropic 的 Fable 模型,利用 Fable 的最佳輸出作為訓練數據來提升 Kimi K3 的性能。Kratsios 還聲稱月之暗面能夠取得 Nvidia 的 GB300 晶片,而這些晶片受到美國出口管制。
對於 Kimi K3 在通用基準測試表現強勁,但在網路安全得分卻較弱的差距,一種解釋是 Kimi K3 可能主要透過 Claude 的輸出進行訓練,這些輸出涵蓋了通用知識、程式設計和代理任務。Anthropic 的安全分類器會特別阻擋進階的攻擊性網路查詢,因此在從 Claude 回應建立的蒸餾數據集中,這些輸出會代表性不足。
這使得 Kimi K3 能夠在標準基準測試上與領先的西方模型匹敵,卻未能習得其更深層次的漏洞利用能力。
AISI 的結果支持了這一解讀。該機構關閉了美國模型的系統級安全防護,揭示了幾乎不可能透過公共介面存取的網路能力,因此這些能力在蒸餾過程中也難以被利用。
