Anthropic 研究員 Jacob Coxon 因擔憂 AI 可能在十年內毀滅人類而辭職後,我與創辦人兼連襟 Rune Kvist 和 Rajiv Dattani 會面。他們認為自己找到了一個可能拯救我們所有人的解決方案,至少能幫助防止 AI 代理在企業內部失控。

Kvist 表示:「AI 正以越來越快的速度變得更聰明。令人驚訝的是,AI 越聰明,就越難以採用和控制,而不是變得更容易。」Kvist 是 Anthropic 的早期員工,也是 Dattani 的姊夫。Dattani 則是 AI 安全研究組織 METR 的前營運長。

這兩人共同創立了一家名為 Artificial Intelligence Underwriting Company (AIUC) 的新創公司,希望將 AI 安全帶入企業以及開發 AI 模型和代理的公司。該新創公司已將 Cursor、Lovable、Harvey 和 ElevenLabs 列為客戶。

週二,AIUC 宣布完成由 Ribbit Capital 領投、First Harmonic 參與的 4000 萬美元 A 輪融資。此前,他們已透過 Nat Friedman 的 NFDG 基金,以及 Emergence、Terrain 和 Anthropic 共同創辦人 Ben Mann 等投資者,完成了 1500 萬美元的種子輪融資,使其總募資額達到 5500 萬美元。

吸引這群頂尖投資者的,是 AIUC 試圖將熟悉的網路安全模型應用於一系列新的 AI 風險。該公司為 AI 代理建立了一個第三方審計和認證層。

Kvist 說:「銀行、醫院、政府和軍隊不再因為模型不夠聰明而拒絕部署 AI。」他補充道:「他們拒絕是因為他們對自己的客戶做出了關於系統能做什麼、不能做什麼的承諾,而目前沒有人能保證這一點。」

AIUC 以廣泛採用的網路安全標準 SOC 2 為靈感,開發了一套名為 AIUC-1 的標準和測試服務,用於驗證代理是否符合該標準。

為了建立這套標準,AIUC 召集了一個由約 250 位安全和風險主管(即代理的買家)組成的聯盟。Dattani 告訴 TechCrunch:「我們每月都會與這些人會面,我們問他們的問題是:當你從某人那裡購買代理時,你會尋找什麼?你會想問哪些問題,以及你希望看到哪些問題得到解決?」

這些回饋意見塑造了測試內容。該新創公司隨後會讓代理執行一套約 5000 個測試,以觀察其在涉及越獄(jailbreaks)、幻覺(hallucinations)和資料洩漏(data leaks)等情境下的行為。測試結果會產生一份約 100 頁的報告,詳細說明代理在哪些方面表現安全可靠,以及哪些方面存在不足。

有趣的是,Kvist 表示,AIUC 使用 AI 代理來執行測試,並利用 AI 來分析數據,但最終的審計則由人類驗證。

如果這聽起來有點熟悉,那是因為 Dattani 的前雇主 METR(他於 2024 年至 2025 年擔任營運長,目前仍是董事會成員)也為前沿實驗室進行類似的測試,儘管其工作直到最近主要集中在性能方面(代理是否能可靠地完成任務)。METR 是 OpenAI 用來調查其 Hugging Face 事件的獨立研究組織之一。

Anthropic 執行長 Dario Amodei 最近也呼籲 AI 產業放慢前沿發展速度,理由是惡意行為事件迅速增加。在他的文章中,Amodei 提出了要求前沿實驗室使用嵌入式第三方評估人員來觀察和驗證安全性的想法,並點名 METR 為其中一種可能性。

儘管 AIUC 並未提議將自己嵌入客戶現場,但其整體理念是相似的:為企業提供其 AI 代理安全性的獨立評估。Dattani 說:「這就是它通過測試並值得信任的地方。而這裡則存在疑慮。在您做出購買決定之前,應該了解這些參考資訊。」