AI 需求的激增,正推動著對巨量資料集和上下文視窗的需求,這些需求已遠超系統記憶體的限制。
然而,不斷增長的需求並非僅靠增加儲存容量就能滿足。我們需要的是來自 AI 工廠的實用、有根據的洞察,以及能夠實現這些洞察的高效、安全的儲存架構。
在本週的記憶體與儲存未來 (FMS) 大會上,NVIDIA 正發表多項儲存技術進展,並展示 AI 的下一個飛躍,不僅取決於運算能力本身,也同樣仰賴為加速運算提供資料的儲存基礎設施。
隨著 AI 代理程式消耗大量資料,該基礎設施面臨的壓力正不斷加劇。現在,GPU 可以直接發起儲存請求,產生數千個並行操作。
為了滿足這些請求,儲存系統必須持續進行資料的加密、壓縮、驗證和重建。當數千個代理程式同時存取儲存時,這些關鍵的資料服務可能會成為瓶頸。
NVIDIA 技術部落格中強調的基準測試顯示,NVIDIA Vera CPU(NVIDIA Vera BlueField-4 STX 的一部分)在兩階段壓縮和加密管線中,其吞吐量比 x86 CPU 高出 3.21 倍。這意味著,透過 Vera,儲存平台可以更有效地吸收大量的 AI 資料,以顯著減少的運算基礎設施提供更高的吞吐量。
隨著加速運算的發展,儲存不再是被動的資料存放處,而是成為資料路徑中的活躍部分。
這顛覆了過去決定資料應存放在記憶體(應用程式可更快獲取)還是儲存硬碟(可廉價且大量儲存)的經濟學。這種權衡最早在 40 年前提出,當時衡量資料存取時間是以分鐘計。如今,在搭配 NVIDIA 及其合作夥伴的 AI 儲存解決方案的 GPU 上,同樣的權衡現在是以微秒計。
彌合 AI 需求與記憶體短缺之間的差距,取決於整個生態系統的極致協同設計,從記憶體和儲存製造商到基於它們構建的軟體。
開源 NVIDIA cuFile API 實現儲存解決方案的互通性
在 FMS 大會上,NVIDIA 宣布將其 cuFile 應用程式介面 (API) 及其底層的垂直儲存軟體堆疊開源。這使得 GPU 不僅是 CPU,也能直接讀寫儲存。cuFile 是 NVIDIA GPUDirect Storage 的一個開源元件。
cuFile 透過利用數十萬個 GPU 執行緒、高速高頻寬記憶體及其他方法,實現了在短短數微秒內安全地從儲存中存取資料。
這代表著業界正基於 Linux 最佳實踐,統一一個安全優先的儲存堆疊,提供 GPU 與資料之間的互通性。
此外,快速、安全的資料和儲存存取是推動預防性和偵測性網路安全措施的基礎要素。將 cuFile 開源將有助於以 AI 驅動防禦所需的速度,使安全上下文、資料和儲存變得可存取。這些開放技術支援了諸如新的 Open Secure AI Alliance 等倡議。
該網站是這些開放貢獻 API 的新家,由 Google、Intel、NVIDIA 和 Meta 作為首批維護者。這些 API 可以針對各種軟體和硬體平台進行優化,為開發者和企業推動創新和效率。
NVIDIA 與業界領導者共同推進 AI 儲存新領域
此外,NVIDIA 和儲存業界領導者正透過一項名為 Storage-Next 的倡議,優化記憶體和儲存解決方案。這項由 NVIDIA 推動的倡議匯集了儲存製造商、控制器供應商、散熱設計、冷卻和協調營運商以及標準機構,旨在協調 GPU 驅動儲存的運作方式,然後將這些進展轉化為可互通的開放產業標準。
Storage-Next 包含了超過 40 家領先的儲存和快閃記憶體供應商,包括 DDN、KIOXIA 和 Micron,它們都與 NVIDIA 共同為下一代 AI 儲存技術做出貢獻。
這項倡議的核心是為大型 AI 資料集提供加速資料存取。為此,NVIDIA 提供了 SCADA(Scaled, Accelerated Data Access 的縮寫),這是一個框架,讓大規模並行 GPU 能夠直接從儲存中,將應用程式所需的資料拉取到自己的高速記憶體中。
例如,DDN 正將 SCADA 與其 Infinia 整合,Infinia 是一個軟體定義的 AI 原生資料智慧平台,旨在大規模消除儲存瓶頸。
DDN 技術長 Sven Oehme 表示:「AI 的成功將取決於組織如何高效利用其基礎設施,而非擁有多少基礎設施。我們與 NVIDIA 的合作正協助建立 GPU 與資料之間更直接、高效的連接,保持加速運算資源的生產力,加速獲得洞察的時間,並使客戶能從其 AI 投資中獲得更強大的商業和財務回報。」
Storage-Next 和 SCADA 擴展了 NVIDIA 在 AI 儲存基礎設施方面的長期工作,包括 NVIDIA Vera BlueField-4 STX,這是一個模組化的機架級基礎,由 NVIDIA Vera Rubin 平台、NVIDIA Vera BlueField-4 儲存處理器和 NVIDIA Spectrum-X 乙太網路提供支援。
NVIDIA Vera BlueField-4 STX 儲存處理器。
NVIDIA STX 定義了一種新型的 AI 原生資料平台,它利用統一的 NVIDIA DOCA 安全堆疊,讓企業能夠在 AI 資料路徑中實現持續的政策執行。
此外,NVIDIA CMX Context Memory Storage 在 NVIDIA STX 的基礎上,為長上下文、多輪、代理式 AI 推論提供了一個 AI 原生上下文層。
SCADA 實現快速且安全的 AI 儲存
儲存層的速度伴隨著一個問題。讓應用程式直接與硬碟通訊雖然快速,但若處理不慎,可能會覆寫其他程序的記憶體,這是一個安全漏洞而非功能。
NVIDIA SCADA 採用一種安全、穩健的方法來實現大規模直接存取,將任務分為兩部分:
應用程式中需要原始速度的使用者部分,保持在可信運算基礎之外。
一個獨立的、具特權的元件在設定時,會配置使用者應用程式與其核准儲存之間的受保護存取,遵循標準的 Linux 協議進行安全強制執行,同時有效保護資料。
這一切都是為了說明,快速、大規模並行、高效、安全的 AI 儲存基礎設施的進步,如何能為應用程式和 AI 工廠提供更好的資料,從而讓它們能夠大規模地產生更有用、更準確、更紮實的智慧。
歡迎參加 8 月 4 日至 6 日在加州聖塔克拉拉舉行的 FMS NVIDIA 場次,了解更多關於 NVIDIA AI 儲存的資訊。
請參閱有關軟體產品資訊的通知。
