NVIDIA 超大規模與高效能運算副總裁 Ian Buck 週二在 AI Infra Summit 上談論了 AI 工廠效率。這場在聖塔克拉拉會議中心舉辦的活動,已演變為基礎設施技術的「科切拉音樂節」。

在座無虛席的聽眾面前,Buck 討論了 NVIDIA 平台之間的新合作等議題。今年有超過 8,000 名與會者,較去年 3,500 人大幅增加。

Amazon 的 Annapurna Labs 正與 NVIDIA 合作開發 NVHBM 客製化高頻寬記憶體技術。

d-Matrix 則將 NVLink Fusion 平台整合到 d-Matrix Raptor XPU 中。

NVIDIA 及其合作夥伴也公布了新的成果:

Emerald AI 與 NVIDIA 合作,展示了與 Silicon Valley Power 合作的商業 AI 工廠彈性負載計畫。

Lambda 透過 NVIDIA DSX MaxLPS 將每瓦效能提升了 23%。

Pinterest 正在使用 NVIDIA Blackwell 平台和 NVIDIA Dynamo 推論軟體,將對話式 AI 引入視覺探索。

這些消息發布之際,代理式 AI 正在推動一類新型工作負載,對 AI 基礎設施的效能、效率和規模提出了更高要求。

NVIDIA 透過涵蓋 Vera Rubin 系統、Dynamo 推論軟體、NeMo 函式庫和 NVIDIA 網路(包括用於擴展運算的 NVIDIA NVLink、用於連接數千個節點的 Spectrum-X Ethernet 和 ConnectX SuperNICs、由 BlueField 驅動的上下文記憶體儲存以及用於基礎設施安全的 BlueField DPU)的全堆疊 AI 工廠平台來應對這項挑戰。

AI 基礎設施的衡量標準正從峰值效能迅速轉變為每百萬瓦驗證的代理式代幣數。AI 工廠現在必須從晶片到電網進行協同設計。NVIDIA DSX MaxLPS 透過工廠級的電源優化,可提供高達 1.4 倍的每百萬瓦代幣數,而 NVLink 則有助於將大規模加速運算整合為單一高效能系統。

其結果是,AI 基礎設施旨在生成更多代幣、提高效率,並幫助客戶從每百萬瓦電力中獲得更多價值。

Silicon Valley Power 營運著一個彈性負載互連計畫,使 AI 工廠能夠支援電網的彈性。

透過此計畫,Emerald AI 與 NVIDIA 合作展示了在 Silicon Valley Power 的自動負載降低功能。該系統成功響應了 Silicon Valley Power 發出的數百個需求訊號,同時保護了 AI 工作負載的效能。

NVIDIA 合作夥伴 Emerald AI 正計畫將 NVIDIA DSX Flex 用於其 Conductor 電網響應式電源管理軟體,該軟體可根據即時電網訊號和混合能源動態調整 AI 工廠的能耗。

透過使用 DSX Flex 進行自主負載平衡,Emerald AI 可以展示其自動限制低優先級 AI 作業電力,然後恢復正常運行的能力。

DSX Flex 可以接收電網訊號——例如卸載請求、需求響應事件和定價訊號——並在預定義的工作負載層級內自動執行。最關鍵的作業會持續運行,而其他所有作業則暫停,然後恢復。透過這種方式,設施可以參與電網的能源效率計畫。

這項功能使 AI 工廠能夠作為彈性電網資源運行,因此當電網需要緩解時,它們可以降低需求,保護優先級 AI 工作負載,並證明可控的 AI 負載有助於釋放更多電網容量以供增長。

AI 雲端供應商 Lambda 在 AI Infra Summit 上發布了成果,首次驗證了 NVIDIA DSX MaxLPS 在 NVIDIA Blackwell 伺服器上的表現。

DSX MaxLPS 持續監控 GPU 和機架的功耗,動態地將可用電力轉移到最需要的地方,並回收靜態配置未使用的容量。由於訓練和推論工作負載具有不同的功耗特性,MaxLPS 可優化混合工作負載 AI 工廠的電力分配。

結果顯著:Lambda 在通常分配給 16 個全功率節點的相同電力預算內運行了 19 個節點,將叢集範圍的代幣吞吐量提高了 24%——從每秒約 400 萬個代幣增加到 500 萬個——同時將每瓦效能提高了 23%。對於下一代 NVIDIA Vera Rubin NVL72 AI 工廠,DSX MaxLPS 在適當的部署環境中,可以在相同的百萬瓦預算內實現高達 40% 的 GPU 容量增長。

這意味著 AI 工廠營運商可以在相同的電力預算內增加 AI 容量和代幣吞吐量,有助於最大限度地提高每百萬瓦的生產力和經濟價值。

在 AI 工廠中,電力是限制因素。每一瓦都至關重要,因此從每百萬瓦中榨取更多代幣對於 AI 基礎設施來說最為重要。

NVIDIA 透過基於 Vera Rubin NVL72 的全堆疊 AI 工廠實現這一目標——系統、網路、軟體和電源管理協同運作。在工廠層面,NVIDIA DSX MaxLPS 會根據需求升降,動態地在機架之間轉移電力。

回報是顯著的:

在相同的站點電力預算內,GPU 數量可增加高達 40%。

代幣吞吐量可提高高達 35%——無需新的電力線。

在每個機架內部,智慧電源平滑軟體和擴展的能源緩衝吸收短暫的尖峰,讓系統更接近持續需求運行。閒置的餘裕變成了生產性運算。

對於代理式 AI——代理會鏈接推理步驟和工具呼叫——延遲和上下文長度會迅速增加。這就是 NVIDIA Groq 3 LPX 的用武之地,它為 Vera Rubin 增加了確定性超低延遲推論,並補充了 DSX MaxLPS。結合平台後,對於長上下文的 2 兆以上參數模型,每百萬瓦的代幣吞吐量比 GB200 NVL72 高出 35 倍。

這些數字說明了一切。在 10 萬上下文的 Qwen 3.8 27B 工作負載上,Groq 3 LPX 達到每用戶每秒 2,529 個輸出代幣。這種餘裕讓代理可以在相同的響應預算內運行更多的推理步驟和工具呼叫,即使工作負載擴展也是如此。

SemiAnalysis AgentX 衡量的是錄製的真實世界代理式編碼會話的推論效能,其中保留了實際的上下文增長、工具呼叫延遲和子代理生成,而不是基於單一請求的基準測試。NVIDIA Vera Rubin NVL72 的代理式效能結果現已在 SemiAnalysis AgentX 儀表板上線。

在 DeepSeek V4 Pro 模型上,Vera Rubin NVL72 的每百萬瓦吞吐量比 NVIDIA GB300 NVL72 高出 30 倍。

代理式工作負載的形態與歷史上推論基準測試所衡量的請求-響應任務不同。單一會話可以累積數十萬個輸入代幣,因為代理會進行推理、呼叫工具和生成子代理——大約是簡單聊天請求的 15 倍代幣量——並且請求的輸入和輸出長度差異很大。要端到端地捕捉這些,需要一個圍繞完整代理軌跡構建的基準測試。

AgentX 實現了這一點,補充了像 MLPerf Inference 這樣衡量廣泛模型和場景下每個請求效能的標準化套件。

效率提升直接轉化為 AI 工廠的經濟效益。每百萬瓦吞吐量提高 30 倍意味著在相同的能源足跡下,可以完成多達 30 倍的代理式工作,而 AgentX 的結果顯示每百萬代幣成本降低了 45 倍。在電力受限的部署中,每百萬瓦吞吐量決定了 AI 工廠能產生多少收入,而每百萬代幣成本則決定了其利潤。

這種效能是極致協同設計的產物,包括 NVL72 擴展領域和第六代 NVLink 互連、第五代 Tensor 核心上的 NVFP4 精度,以及涵蓋 NVIDIA TensorRT LLM 和 NVIDIA Dynamo 的推論堆疊。Vera Rubin 已全面投入生產並在生態系統中擴展,效能將隨著持續的軟體優化而繼續提升。

新創公司正在測試 NVIDIA Vera CPU 以運行代理工作負載和其他要求嚴苛的應用程式,並對結果感到滿意。

Perplexity 對 Vera CPU 進行了基準測試,用於其新的 SPACE 安全沙盒平台,結果顯示沙盒啟動速度快了 1.9 倍。

Daytona 將 Vera CPU 用於代理式工作負載,稱其「為代理式執行帶來了顯著提升」。

ClickHouse 分享了 Vera CPU 在 ClickBench(其分析資料庫的開放基準測試)上的結果。ClickHouse 表示,Vera 是他們迄今為止測量過最快的機器,這是「資料密集型工作負載 CPU 效能未來發展的強烈訊號」。

DeepInfra 對 Vera CPU 進行了多項基準測試,顯示它在所有指標上都取得了勝利,包括協調步驟延遲快了 2.2 倍。

Prime Intellect 發現,當更多工作負載並行運行時,Vera CPU 保持了高頻寬和低且一致的記憶體延遲——這是代理式 AI 所需的可預測效能。

Redpanda 表示,其對 Vera CPU 的基準測試顯示,延遲比其他 CPU 低 5.5 倍,吞吐量高 73%。

Starburst 發布的基準測試結果顯示,Vera CPU 的查詢吞吐量比其他 CPU 快 3 倍。

Kinetica 發現,與傳統 CPU 相比,Vera CPU 的分析查詢效能快了 2.7 倍。

隨著 AI 工廠擴展到數十萬個 GPU,可靠性成為一項效能特徵。

訓練和推論工作負載依賴於連續運行,這使得瞬時錯誤、訊號降級和硬體故障成為不可避免的挑戰。NVIDIA NVLink 6 透過多層彈性架構應對這些挑戰,該架構旨在在故障影響應用程式之前偵測、遏制並從中恢復。

在實體層,客製化的前向錯誤更正、實體層重試和通用實體層恢復有助於維持無損網路,且延遲影響最小。在網路層,基於信用點的流量控制、動態路由和連結重新平衡可局部遏制故障,並防止可能降低 AI 工廠吞吐量的級聯停滯。