「開放安全 AI 聯盟」(Open Secure AI Alliance)的成員們,目前已超過 120 個組織,正積極制定新的指南,以強化代理式 AI 的網路安全,適逢年度 Black Hat 大會今日在拉斯維加斯開幕。

Linux 基金會今日發布了關於「共享 AI 發現交換」(Shared AI Findings Exchange, SAFE)的意見徵求(Request for Comments),這是一套旨在將代理式 AI 網路安全事件轉化為整個生態系共同防護的擬議指南。

SAFE 指南正由開放安全 AI 聯盟的一個工作小組起草。NVIDIA、Cisco、CrowdStrike、Hugging Face 和 Red Hat 等公司,皆為開放安全 AI 聯盟的成員,正與 Linux 基金會合作,共同為這項初步提案貢獻心力。

SAFE 指南的內容包括機密收集與分析 AI 事件和潛在風險、通知受影響方、識別重複的控制失效,並發布基於證據的操作建議,以降低系統性風險。

網路安全是一場沒有終點的競賽。每一次重大的技術變革都會創造新的潛在攻擊面。防禦者必須以代理的速度迅速行動,以保護基礎設施和智慧財產權,而最好的方式就是共同合作。當受信任的生態系開放共享威脅情報時,集體防禦將產生倍增效應。

開放安全 AI 聯盟為 AI 網路安全提供了更多工具。SAFE 框架進一步豐富了聯盟成員們為建構和共享開放、可檢視工具,以涵蓋整個 AI 安全堆疊所做的技術貢獻。

AI 代理不僅僅是一個模型,它是一個完整的系統,包含身分控制、協調框架、防護措施、日誌和評估等。因此,保護它所需的遠不止是漏洞掃描。

安全性始終在於其層次結構,以及社群開放共享知識的意願。當防禦者能夠開放且迅速地相互學習時,最困難的問題才能迎刃而解。

NVIDIA 的貢獻貫穿整個技術堆疊,首先是 GitHub 上的 NVIDIA Labs 物件導向代理(NVIDIA Labs Object-Oriented Agent, NOOA)研究框架,它讓代理行為更容易測試、追蹤、稽核和治理。

NVIDIA OpenShell 執行時環境限制了代理可見、可觸及和可執行的操作,在代理層級強制執行安全和隱私控制,確保代理無法存取不應觸及的內容。

NVIDIA 的開放模型家族,包括用於代理式 AI 的 NVIDIA Nemotron、用於實體 AI 的 NVIDIA Cosmos、用於機器人技術的 NVIDIA Isaac GR00T、用於醫療保健和生命科學的 NVIDIA BioNeMo,以及全球最大的商用授權自駕車模型 NVIDIA Alpamayo,皆隨附開放權重、資料集和訓練技術。

NVIDIA 的開源驗證代理技能將這種信任延伸到能力層。

每項技能都提供可攜式指令集,這些指令集經過編目、掃描是否存在提示詞注入和工具中毒等風險、經過加密簽署,並附有技能卡文件。防禦者能清楚了解代理技能的功能、來源以及發布後是否被修改。

NeMo Guardrails、NeMo Anonymizer 和 NeMo Safe Synthesizer 有助於強制執行安全政策、保護敏感資料,並生成隱私安全的合成資料。

而 NVIDIA 的開源大型語言模型(LLM)漏洞掃描器 Garak,則讓安全團隊能在模型發布前檢查其是否存在資料洩漏、提示詞注入和越獄等情境。

開放安全 AI 聯盟的其他成員也一直在建構完整的防禦堆疊,涵蓋身分與權限、協調框架、執行時防護措施、安全 AI 模型、可觀察性與評估、資料安全與隱私、可用性與韌性等。

以下將重點介紹堆疊中不同層次的一些最新貢獻,未來還會有更多。

**身分與權限 — 誰能執行操作**

無法識別的事物就無法確保其安全。

Okta 正在開發代理身分與存取的參考實作,展示 Cross App Access (XAA) 這個開放協定如何讓在 OpenShell 沙盒環境中運作的 AI 代理安全地連接到企業應用程式。

Palo Alto Networks 貢獻了其下一代身分安全平台 Idira 的開源工具,包括 Agent Guard 和 Agent Watch。這些工具協助開發人員和代理建構者應用身分安全最佳實踐和安全防護措施,例如安全地檢索代理工作流程的機密。

由 Red Hat 創立的一個新開源專案 asago,能將組織的客製化治理要求(例如 NIST、OWASP 和歐盟 AI 法案中提及的要求)直接映射到代理在執行時被允許執行的操作,並提供從政策條款到即時控制的單一稽核軌跡。

**協調框架與工具 — 如何協調安全工作**

AI 代理不僅僅是一個模型,它們利用開放和封閉模型、協調框架、工具和執行時環境的系統來完成工作。

如果模型是代理的大腦,那麼協調框架就是透過使用工具來採取行動的身體。圍繞模型的協調框架就像一個協調器,決定代理如何部署、協調和約束。

聯盟成員正在為這個新興的 AI 安全堆疊層貢獻工具、協調框架和支援技術。

Amazon 今日成為開放安全 AI 聯盟的最新成員之一,貢獻了 Strands Agents,這是一個用於建構 AI 代理的開源工具包,在每個層次都是開放的,讓開發人員能完全掌握代理行為,並能在生產環境中評估代理系統。Amazon 還貢獻了 Cedar,這是一種開源授權語言,能對 AI 代理被允許執行的操作強制執行確定性、可驗證的邊界,為客戶提供細粒度、可分析的存取控制,以確保只有經授權的操作才能存取企業資源。

Capital One 開源了用於代理式 AI 程式碼安全的 VulnHunter。

Cloudflare 正在提供其漏洞發現協調框架(Vulnerability Discovery Harness)作為開源技能,以增加代理系統的安全性。

Microsoft AI 紅隊已開源了多個工具和協調框架。PyRIT(Python 風險識別工具包)使 AI 紅隊成員能夠執行自動化的紅隊測試,內建記憶體,支援常見目標以及客製化端點。

RAMPART 將紅隊發現和真實世界事件轉化為可重複的測試,隨軟體變更而運行。Clarity 則協助團隊在程式碼撰寫前質疑設計假設並識別潛在的失效。

Microsoft 也開源了 Assert,它能將自然語言要求和預期的 AI 安全與保障行為轉換為可執行的評估。

Atlas 是 Wiz 的自主漏洞研究引擎,它協調專門的 AI 代理來發現和驗證程式碼和開源套件中的安全缺陷。

Visa 也加入了開放安全 AI 聯盟,貢獻了其開源的 Visa Vulnerability Agentic Harness,以協助團隊快速安全地識別問題、支援修復和驗證。

**模型 — 為 AI 安全與防禦而建構的智慧**

並非每個安全或保障任務都需要通用模型。專門的安全與保障模型是為防禦而量身打造的:它們經過訓練,能夠理解程式碼、定位漏洞並大規模地推斷威脅。它們可以作為模型系統來支援代理工作流程,開放和封閉模型協同工作以高效完成任務。

Cisco DefenseClaw 是一個開源的代理式治理層,它位於 NVIDIA OpenShell 之上,在擴展代理工作人員時,提供強大、自動化的執行時安全。Cisco 還發布了其兩個 Antares 安全小型語言模型,以協助精確定位程式碼庫中存在的已知漏洞;以及 Project CodeGuard,將預設安全實踐直接嵌入到 AI 編碼工作流程中。

CrowdStrike 正在微調 NVIDIA Nemotron Nano 模型以用於網路防禦。內部測試顯示,在 Falcon LogScale 中生成調查查詢的準確度達到 96%,提供了一個自然語言介面,提升了代理的調查效率。CrowdStrike 還發表了研究,證明專門的 NVIDIA Nemotron Nano 推理模型在安全營運中心(SOC)檢測分類方面優於更大的模型,同時引入了經過校準的基於 logit 的置信度,以實現可測量、可調和可稽核的自主安全決策。

Mistral 今日發布了其新的 Shieldstral 多模態安全分類器模型,以 Apache 2.0 許可證下的開放權重形式提供。

**可觀察性與評估 — 了解發生了什麼以及為什麼**

看到代理做了什麼只是部分情況。防禦者還需要了解它為何採取行動、系統是否安全運行,以及攻擊在現實世界中如何演變。

Akamai 透過其《網路現況報告》(State of the Internet reports)和安全情報小組的研究帶來洞察,利用真實世界的資料闡明 AI 時代的威脅,並解釋新興的攻擊方式,以便防禦者學習、適應和應對。

Cognition 發布了一項可信度評估,衡量開源衍生模型的對齊和安全風險。該評估表明這些風險可以透過後訓練來緩解。

Numbat 是 Perplexity 的開源代理安全套件,適用於客戶端端點。它能偵測、調查和預防 macOS、Linux 和 Windows 上的代理活動,為防禦者提供代理實際操作的結構化記錄。

Uber 開源了 ADR(代理式 AI 偵測與回應)的關鍵組件,這是一個生產系統,能重建 AI 代理活動的完整因果鏈 — 從提示詞到推理、工具呼叫和結果 — 以協助安全團隊偵測威脅。

如今,ADR 每天支援超過 20 萬次代理會話,橫跨 3 萬個端點,採用兩層分析方法,將高效偵測與針對高置信度威脅的深度調查結合。

**可用性與韌性 — 關鍵時刻的快速恢復**

代理系統必須在受到干擾時保持可靠,控制故障並安全恢復,而不會丟失關鍵狀態或暴露更廣泛的環境。

LangChain 正在為其開源框架 — Deep Agents、LangGraph 和 LangChain — 添加韌性功能,使代理能夠重試中斷的工作、遵循安全的恢復路徑、從儲存的狀態恢復而不是重新開始,並在主要模型失效時自動回退到替代模型。

Veeam 透過 Kanister 等技術協助組織保持 AI 背後的資料和基礎設施的韌性和可恢復性,Kanister 是其用於 Kubernetes 上資料保護的開源框架。它協助團隊保護和恢復 AI 工作負載、向量資料庫和資料到經過驗證的良好狀態。

更多的貢獻正在陸續到來。當成員發布可重複使用的緩解措施時,整個生態系的防禦者可以檢查、調整和改進它們,協助安全實踐隨著 AI 的進步而演進。

歡迎在今日(8 月 4 日星期二)太平洋時間下午 5 點 15 分,於 Mandalay Bay 會議中心主舞台商務廳外,與開放安全 AI 聯盟的成員們一同合影。

了解更多或表達加入開放安全 AI 聯盟的意願。