AI 推論的經濟效益取決於系統效能、高效基礎設施擴展和持續的軟體優化。更高的系統效能意味著能生成更多 tokens,進而帶來更高的營收。高效擴展則表示隨著硬體增加,吞吐量能按比例成長,用更少資源服務大量使用者。持續優化則能從基礎設施投資中創造更多價值。
這三者都建立在平台的可互換性之上:相同的基礎設施能運行任何模型、任何工作負載,從訓練到推論,從推薦系統到推理,從語言到視訊,保持高利用率。
NVIDIA 平台專為優化這些方面而設計,今日發布的 MLPerf Inference v6.1 測試結果便突顯了這一點:
NVIDIA Vera Rubin NVL72 系統首次亮相即展現領先效能:在首次提交的 MLPerf Inference 預覽測試中,NVIDIA Vera Rubin NVL72 的吞吐量比 GB300 NVL72 高出達 3.7 倍。
NVIDIA GB300 NVL72 實現領先的擴展效率:一個由四個 GB300 NVL72 機架組成的 288 顆 GPU 系統,達到了 99% 的擴展效率,吞吐量相較單機架基準幾乎呈線性成長。
持續的軟體優化推動效能提升:NVIDIA 在 MLPerf Inference v6.1 提交的軟體優化,相較 v6.0 提升了高達 1.6 倍的效能。v6.1 提交後,優化仍在持續進行,帶來了進一步的效能提升。
對於制定 AI 基礎設施決策的組織而言,效能、擴展效率和軟體迭代速度是決定長期推論經濟效益的重要考量因素。
NVIDIA 提交了 Vera Rubin NVL72 在 MLPerf Inference v6.1 套件中兩個要求最高的基準測試預覽結果:DeepSeek-R1 和 Qwen3-VL。
Vera Rubin NVL72 在 Qwen3-VL 的離線、伺服器和互動式情境中,使用 vLLM 搭配 NVIDIA Dynamo 開源推論框架,吞吐量比 GB300 NVL72 高出達 3.7 倍。在 DeepSeek-R1 上,使用 NVIDIA TensorRT-LLM 函式庫,吞吐量比 GB300 NVL72 高出達 2.5 倍。
這些初步結果展示了 NVIDIA 加速創新的步伐,以及透過持續軟體優化將如何進一步提升效能。
MLPerf Inference v6.1,封閉組。結果於 2026 年 9 月 16 日從 www.mlcommons.org 取得。NVIDIA 平台結果來自以下項目:6.1-0106 和 6.1-0074。MLPerf 名稱和標誌是 MLCommons Association 在美國及其他國家的註冊和未註冊商標。
保留所有權利。嚴禁未經授權使用。更多資訊請參閱 www.mlcommons.org。
這項效能意味著每個 Vera Rubin NVL72 機架能比 GB300 NVL72 機架生成顯著更多的 tokens、服務更多使用者並創造更多營收,同時降低每個 token 的成本。
這些結果反映了硬體和軟體之間的全堆疊協同設計。Vera Rubin 增強的 Tensor Cores 和 Transformer Engine 加速了推論的預填充 (prefill) 和解碼 (decode) 階段,而 NVFP4 精度則減少了模型權重、注意力機制和 KV 快取所需的記憶體佔用,在輸出品質損失最小的情況下提高了吞吐量。
Vera Rubin 的提交大量使用了分離式服務 (disaggregated serving),將預填充和解碼分開,並針對 DeepSeek-R1 和 Qwen3-VL 等模型所使用的專家混合 (mixture-of-experts) 層,採用大規模專家並行 (expert parallelism) 以實現最大效率。
NVL72 擴展領域由第六代 NVIDIA NVLink 和 NVLink Switch 提供支援,其封包速率比現成乙太網路高 10 倍,延遲低 3 倍,為這些技術在機架規模上發揮作用提供了互連基礎。
這種協同設計也延伸到 NVIDIA 的合作夥伴生態系統:Nebius 也提交了 Vera Rubin NVL72 的預覽結果,並展示了卓越的效能。
AI 代理 (AI agents) 能跨多步驟進行推理、規劃和行動,正在重塑推論效能的衡量方式。在旨在捕捉這一轉變的基準測試中,例如 SemiAnalysis AgentX,Vera Rubin NVL72 在預覽測試中展現了比 GB300 NVL72 高 30 倍的效能。
此外,即將推出的 MLPerf Endpoints 基準測試將為代理式推論工作負載帶來標準化的衡量方式,超越傳統吞吐量基準測試所能捕捉的範圍。
NVIDIA GB300 NVL72 實現領先的擴展效率
擴展效率——即額外增加的 GPU 如何有效轉化為吞吐量增益——是衡量 AI 基礎設施生產力的關鍵指標。NVIDIA 透過每個機架內的高頻寬、低延遲擴展互連、機架間的高頻寬網路以及跨節點的高效請求協調來實現這一點。
NVIDIA 的 DeepSeek-R1 (DSR1) 提交從單一 GB300 NVL72 機架(72 顆 GPU)擴展到四個機架(288 顆 GPU),在離線情境中實現了 99% 的擴展效率。吞吐量幾乎與增加的硬體數量成比例成長。
MLPerf Inference v6.1,封閉組。結果於 2026 年 9 月 16 日從 www.mlcommons.org 取得。NVIDIA 平台結果來自以下項目:6.1-0073 和 6.1-0074。MLPerf 名稱和標誌是 MLCommons Association 在美國及其他國家的註冊和未註冊商標。
保留所有權利。嚴禁未經授權使用。更多資訊請參閱 www.mlcommons.org。
擴展效率至關重要,因為增加更多 GPU 不會自動意味著吞吐量按比例增加。如果將 GPU 數量幾乎翻倍,卻只帶來個位數百分比的吞吐量提升,那麼基礎設施成本將遠遠超過效能回報。架構、互連和軟體都必須協同擴展。
GB300 NVL72 還在 WAN 2.2 文字轉視訊基準測試中展示了機架規模的效率,達到每秒 0.65 個 720p 視訊,每個視訊耗時 5.7 秒——吞吐量比單一節點高 9 倍,延遲低 7.5 倍。
軟體優化推動持續增益
NVIDIA 平台持續進行軟體開發,提供效能和功能改進。
在 v6.1 中,GB300 NVL72 在 Qwen3-VL 上的效能比 v6.0 結果提升了高達 1.6 倍。這些增益來自於更低的 KV 快取精度、額外的核心融合、更好的核心以及使用 vLLM 和 NVIDIA Dynamo 的分離式服務。
軟體優化在 v6.1 提交截止日期之後也持續進行。提交後的結果(尚未經 MLCommons 驗證)在 GPT-OSS-120B 和 DLRMv3 上顯示出進一步的效能提升。
各種規模的 AI 推論
除了 NVIDIA Grace Blackwell 和 Vera Rubin NVL72 平台的結果之外,NVIDIA 還提交了使用 NVIDIA TensorRT Edge-LLM 在新推出的 Edge-Agentic 基準測試中,搭配 Qwen3.6-27B 的 Jetson AGX Thor 結果。
NVIDIA 合作夥伴生態系統廣泛參與,共有 19 家合作夥伴——其中 8 家使用多節點 Blackwell NVL72 系統——展示了卓越的效能。這包括 ASUS、Azure、Cisco、CoreWeave、Crusoe、Dell Technologies、Fujitsu、Giga Computing、HPE、Inventec、Lambda、MiTAC Computing、Nebius、Oracle Cloud Infrastructure、Quanta Cloud Technology、Red Hat、ScitiX、Supermicro 和 Wiwynn。
從緊湊的邊緣裝置到最大的 AI 工廠,NVIDIA 持續透過每年更新的平台架構、不斷改進的軟體以及為大規模部署而建立的生態系統,在整個技術堆疊中推進效能。
了解更多關於 NVIDIA Vera Rubin 平台。
