隨著生成式人工智慧的爆炸性普及,許多開源模型現在已可在線上取得,供任何人根據其任務進行調整,例如以特定藝術風格生成產品渲染圖。然而,這些模型也落入不法分子手中,他們可能會將其最佳化以產生非法內容,例如仇恨言論或兒童性虐待影像(CSAM)。這是一個日益嚴重的問題——國家失蹤與受剝削兒童中心在 2025 年收到了超過 150 萬份 AI 生成 CSAM 的報告,較 2024 年的 67,000 份大幅增加。

工程師通常透過提示模型並檢查其輸出來測試 AI 的有害能力,但這對於 CSAM 來說是不可能的,因為在美國,無論意圖如何,生成此類內容都是非法的。為避免這種困境並提高 AI 安全性,由研究生 Vinith Suriyakumar 和副教授 Ashia Wilson、Marzyeh Ghassemi 領導的麻省理工學院科學家團隊,與 Thorn 的研究人員合作,開發了一種新的審計方法,可以在不提示模型的情況下,判斷模型是否能產生 CSAM。

Thorn 是一個兒童安全非營利組織,其使命是改變數位時代保護兒童免受性虐待和剝削的方式。他們開發的技術檢查模型內部運作方式如何被調整,但從不生成任何輸出。透過檢查隱藏表示,它可以可靠地推斷模型是否已被專門用於產生有害圖像。

經過測試,該審計程序以 100% 的準確度識別出已被專門用於生成 CSAM 的模型變體。託管平台可以使用這項技術來標記不安全的模型,並迅速將其移除或從一開始就阻止其上傳。

麻省理工學院電機工程與電腦科學(EECS)研究生兼該技術論文主要作者 Vinith Suriyakumar 表示:「這為託管開源模型的平台和執法部門,開啟了一條實際測試模型是否能夠生成 CSAM 的新途徑。以前,我們無法衡量這一點,這是一個被一些人利用的巨大盲點。現在,我們可以解決一個正在造成嚴重負面影響的 AI 安全問題。」

Suriyakamur 和 Wilson(EECS 的 Lister Borthers 職業發展教授,以及資訊與決策系統實驗室 (LIDS) 的首席研究員)與麻省理工學院博士後 Lena Stempfle、EECS 副教授兼醫學工程科學研究所 (IMES) 和 LIDS 成員 Ghassemi,以及波士頓大學和 Thorn 的其他研究人員共同撰寫了這篇論文。

該論文將在國際機器學習會議的「值得信賴的 AI 造福人類」研討會上作為焦點論文發表。

最近的技術讓使用者更容易透過稱為微調的過程,將生成式 AI 模型專門用於其任務。個人可以利用一種稱為低秩適應(LoRA)的演算法,以更有效率的方式專門化模型,而不是在特定任務資料集上重新訓練整個模型。

這導致了大量用於各種目的的新生成式 AI 模型變體,例如產生模仿藝術運動的水彩圖像。但它也使惡意行為者能夠創建可以生成高品質 CSAM 和其他有害圖像的模型。為了審計模型,工程師通常會提示它產生有害內容並檢查其輸出,但這種手動審計程序不可擴展。此外,重複生成令人髮指的圖像可能會對人類評估者產生負面心理影響。

當測試 CSAM 時,這種評估方法很快就會失效,因為在美國和許多其他國際司法管轄區,出於任何目的生成 CSAM 都是非法的。Suriyakumar 表示:「我們處於一個非常困難的境地,根據法律本身,我們不能使用事實上的評估方法。我們必須拋棄整個工具包,採取不同的方法。」在了解這個難題後,研究人員與 Thorn 合作解決這個問題。

研究人員沒有專注於輸出,而是針對 LoRA 演算法在微調過程中進行的修改。他們的技術探測這些稱為 LoRA 適配器的修改,以判斷模型是否已被專門用於有害能力,而無需生成輸出。研究人員使用一種稱為高斯探測的技術,向模型輸入一組隨機資料點,並分析它如何在多層內部結構中操作這些資料。

Suriyakumar 解釋說:「我們從未將模型運行到最後,也從未提示模型,所以我們從不生成圖像。」研究人員在模型內部結構中的多個時間點捕獲這些修改,並將它們平均,以總結 LoRA 適配器如何改變模型的計算。他們發現這些反應是模型如何被專門化的強烈信號。

他們在三種類型模型的變體上測試了他們的方法,將結果與已知用於生成 CSAM、其他有害圖像和安全內容的 LoRA 適配器的真實資料進行比較。他們的方法在識別已被調整以生成 CSAM 的模型方面達到了 100% 的準確度。Wilson 表示:「AI 存在大量兒童安全問題,這些都是需要解決的實際問題。

許多兒童正受到 AI 深度偽造的傷害。我們已經證明高斯探測可以是一個非常有用的工具,我們希望研究界能將更多注意力投入到這個問題上。」

重要的是,他們的技術具有可擴展性,並且實施成本相對較低。由於每月有數千種模型變體在線上發布,可擴展性是幫助審計員在有害適應廣泛傳播之前將其移除的關鍵。高斯探測也比其他一些審計技術更具魯棒性,因為惡意行為者需要仔細修改基礎模型的內部運作才能避免檢測。

未來,研究人員希望在更大範圍的模型變體上評估他們的技術,並探索高斯探測是否能在基礎模型被調整之前檢測出有害能力。Ghassemi 表示:「現在我們有了一種技術方法來部分解決這個問題。這次合作投入了大量的努力,使我們能夠解決一個真正困難的問題,這個問題正在傷害全國乃至全世界的許多兒童。

希望我們能在這個領域產生變革性的影響。」這項工作部分得到了 Bridgewater AIA Labs 研究獎學金的資助。