大多數安全對齊工作將危害視為主題的屬性。提示詞之所以不安全,是因為它屬於武器、詐欺或自殘等一般類別,而 LlamaGuard-3 等防護模型正是採用這種主題層級分類法。XSTest 和 OR-Bench 等基準測試則探究由此產生的失敗模式:模型因包含看似危險的詞語而拒絕安全的提示詞,而拒絕回應校準工作則試圖降低這個數字。
然而,實際部署情境很少符合這種主題層級的設定。同一個基礎模型可能被改編用於通用助理、教育產品、企業系統或公共部門服務,而每個設定在同一主題內都需要不同的界線。一個公民學導師和一個公共部門助理可以共用一個模型,但在政治議題上卻需要截然相反的行為:兩者都應回答關於選舉的事實問題,但只有其中一個可能需要拒絕撰寫針對性政治操弄內容的要求。
主題層級的防護模型無法表達這種區分。例如,LlamaGuard-3 僅將選舉涵蓋為「關於選舉制度和程序的事實不正確資訊」,這排除了說服和操弄,同時也排除了部署必須持續回答的事實性提示詞。
我們最新的論文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》直接探討了這個更精確的問題。問題不在於是否應該拒絕整個主題,而是該主題的哪個子集與給定部署政策不相容,以及如何針對該邊界訓練和衡量模型。
我們將這種設定形式化為一個主題範疇,在我們的實驗中是所有政治提示詞,其中包含部署希望拒絕的目標有害子集。預期的政策不是拒絕所有政治內容,而是拒絕有害子集,同時繼續回答良性補集。理想的行為是明確的界線:在子集內部拒絕,在主題的其他地方回答。
受過訓練的模型從未學會那種明確的界線。它學到的是一個僅近似目標的拒絕回應機率,而提高有害子集內拒絕回應的交叉熵訓練,也可能將拒絕回應推向良性補集。因此,真正的問題不僅是提高對有害提示詞的拒絕回應,更重要的是塑造邊界附近的行為本身。我們將該邊界操作化為共享主題錨點但意圖不同的提示詞對,其中一個應該被拒絕,另一個應該被回答。
我們使用政治說服作為測試平台,因為操縱性說服可能造成實際危害,而事實性政治資訊則保持合法性,這正是主題層級拒絕回應過於粗糙的情況。
在這裡建立訓練資料的自然方式是自我生成:取目標模型,引導其對每個有害提示詞產生拒絕回應,並保留防護模型驗證為真實拒絕回應的軌跡。這是 ThinkSafe 等方法背後的配方,我們將其作為參考,應用於政治提示詞並逐一衡量其組成部分。將問題框定為邊界而非主題,暴露了該標準流程中的三個弱點。
第一個是覆蓋率落差。單次引導嘗試並不總是產生被接受的拒絕回應,而這些提示詞會被默默地從訓練集中刪除。在我們審核的資料池中,單次生成會丟棄 19.88% 的提示詞,共 8,009 個,而這些失敗的提示詞很可能就是最困難的範例。我們對此進行修復而不是丟棄:逐步升級的重試策略,透過逐步加強的引導重新取樣相同的提示詞,將剩餘的失敗率降至 0.20%,即 79 個提示詞。覆蓋率修復後,留下了 40,293 個有害訓練提示詞,而原始流程會丟棄數千個。
第二個是負面影響。安全微調往往會對表面看似危險的良性提示詞產生錯誤拒絕回應。為了彌補這一點,我們建立了分佈內良性資料,包括 18 種語義類型中 11,955 個經過驗證的表面看似危險的良性提示詞,因此模型在訓練期間會看到帶有危險詞語的安全提示詞,而不僅僅是在評估時。
第三個是普通的有害和良性劃分根本無法衡量邊界的形狀。模型可以透過將拒絕回應擴展到附近的允許提示詞來提高其有害拒絕回應率,而主題層級的指標會將其視為改進。保留的有害-良性配對,每邊 1,539 個,讓我們可以直接衡量邊界的兩側。
對政治拒絕回應資料進行訓練在明顯的意義上是有效的。在 Qwen3-8B 上,經過升級覆蓋率的模型將分佈內政治拒絕回應從 9.47% 提高到 84.75%,並且它也具有轉移性:在最強配置下,LlamaGuard-3 評分的 HarmBench、StrongREJECT 和 WildJailbreak 這三個更廣泛的有害性基準測試中,平均不安全回應率從 26.26% 降至 0.14%。
單獨報告這些數字看起來像是一場乾淨的勝利。但事實並非如此。在同一個檢查點,XSTest 上的過度拒絕從 2.00% 上升到 74.00%。有害回應率最低的配置,也是拒絕近四分之三明顯安全提示詞的配置。它是一台粗暴的拒絕機器,而不是一個更安全的模型,除非你衡量良性的一面,否則你無法看到這一點。這是核心訊息:資料組成決定了一個檢查點在安全與過度拒絕空間中的位置,因此必須同時報告這兩個軸。
我們的兩個資料組成部分在不放棄安全增益的情況下,將過度拒絕的數字拉回。用目標模型自身生成的經過驗證的回應取代外部採用的合規回應,在單次生成下將 XSTest 過度拒絕從 15.20% 降低到 5.20%,代價是輕微的有害性。而有害-良性邊界配對則完成了最精確的工作。
具體來說,添加良性邊界資料將保留配對中合規一側的過度拒絕從 32.94% 降低到 4.16%。有害一側的拒絕回應僅從 91.88% 略微下降到 87.72%。換句話說,邊界附近的大部分錯誤拒絕回應消失了,而幾乎所有真實的拒絕回應都得以保留。存在實際的召回率成本,它很小且可衡量,這正是重點:只有當你同時衡量兩側時,才能有意識地進行權衡。
實際的啟示是,安全微調不應僅憑有害拒絕回應率來評估。一個拒絕回應更多的模型不一定自動更安全,在狹窄的邊界上,提高有害提示詞拒絕回應的相同舉動,可能會悄悄地使模型對其旁邊的合法提示詞變得無用。訓練資料的組成、覆蓋率修復、分佈內補償和邊界配對是控制這種權衡的關鍵,並且必須評估預期邊界的兩側,這些數字才有意義。
這項工作是 Multiverse Computing 研究的一部分,旨在使模型行為在實際部署關心的層級上可控和可衡量,而不是在廣泛主題類別的層級上。相同的生成流程可以擴展到政治之外的其他主題,並且該論文報告了上述結果背後完整的資料組成消融實驗。
想要完整的技術細節,包括覆蓋率修復策略、將有害交叉熵與良性前向KL保留分開的損失路由,以及完整的保留邊界評估嗎?請閱讀完整論文,或聯繫我們的團隊,討論您自己模型的部署特定安全問題。
