擴散模型目前是生成任務中最強大的工具之一,這些任務需要複雜的局部結構,例如圖像生成和分子發現。它們展現出超越訓練資料的驚人泛化能力,並因此展現出「創造力」。例如,在用實際圖像資料集訓練後,它們可以將隨機雜訊樣本轉換為新穎、高品質的圖像。

儘管這種創造能力令人印象深刻,但它引出了一個有趣的問題:它從何而來?理解這個問題的答案是揭開基於擴散的生成式 AI「黑盒子」本質的重要一步。為此,我們在 ICLR 2026 上發表的論文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中,深入探討了擴散模型的數學原理來回答這個問題。

我們證明了模型的創造力並非偶然,而是神經網路訓練如何自然地「平滑」生成過程中從雜訊回到資料的轉換所導致的結果。

**理解去雜訊**

訓練擴散模型首先要取一組真實的訓練資料樣本——例如貓的照片——並故意用雜訊破壞它們,直到它們完全無法辨認。然後,模型會被訓練來逐步逆轉這種破壞,以便從純雜訊中重建出逼真的圖像,這個過程稱為去雜訊。

如果模型僅根據其訓練樣本完美地執行去雜訊過程,那麼在部署時它應該會產生這些樣本的複製品(這種行為稱為記憶化)。在這種情況下,模型充當的是檢索工具,而不是能夠生成新穎輸出的創造性引擎。然而,在實踐中,擴散模型通常不僅僅是記憶;它們會泛化以生成新的資料樣本。

為了理解擴散模型如何實際地對資料去雜訊,想像隨機雜訊就像一團散佈在房間裡的氣體粒子,其中一個「力場」將每個粒子拉向特定方向,直到它們形成有意義的形狀。在擴散模型中,移動的粒子是正在進行去雜訊的單個資料點。「力場」是分數函數(SF),它從訓練資料中學習而來,並決定粒子在任何給定時刻應該流向何處。

如果模型依賴於從訓練資料中完美學習到的分數函數,那麼力場將驅使粒子進入精確複製訓練資料點的位置(即記憶化)。

**擴散模型的創造力:一維範例**

我們發現擴散模型的創造力實際上源於神經網路通常學習的近似性質:由於正規化導致的不完美訓練,自然會導致學習到的分數函數產生輕微的模糊,這個過程稱為「分數平滑」。這反過來又導致去雜訊過程生成在訓練點之間進行插值(換句話說,落在訓練點之間的空間)的資料,從而創建出新的、合理的資料樣本。

想像一個只有兩個訓練資料點的一維世界:+1 和 -1。在去雜訊過程的後期,「完美」分數函數看起來像下圖中彎曲的灰色線,它在兩個點之間的中點處符號發生急劇變化,這意味著在接近 0 的地方方向會快速切換。換句話說,整個空間幾乎被清晰地分為兩部分,左側的粒子被拉向 -1,右側的粒子被拉向 +1。最終,每個粒子都收斂到兩個訓練資料點之一,因此發生了記憶化。

然而,在實踐中,擴散模型無法存取「完美」的分數函數,而是使用神經網路學習到的近似版本。由於訓練期間權重衰減(weight decay)的正規化效應,神經網路很難學習具有這些陡峭懸崖的函數。相反,它們傾向於學習「完美」分數函數的更平滑版本,將陡峭的下降軟化為更平緩的斜坡。

為了說明這一點,我們進行了一項實驗,訓練兩層 ReLU 神經網路來擬合一維範例中的分數函數,其中神經網路的參數由流行的 AdamW 演算法在不同程度的權重衰減(WD)下進行優化。

權重衰減越強,中間區域學習到的分數函數就越平滑,這意味著該區域的粒子流動速度比以前慢,並最終會停留在兩個訓練資料點之間的「插值區」。

在論文中,我們透過將神經網路正規化的函數空間理論與去雜訊的數學原理相結合,量化了這種關聯。此外,我們的實驗還表明,即使沒有明確的正規化策略(例如權重衰減),分數平滑也可能來自於基於梯度演算法訓練的神經網路中發現的隱式正規化效應。

**分數平滑促進流形恢復**

在現實世界中,高解析度圖像等複雜資料存在於高維像素空間中,而不是簡單的一維世界。然而,該空間的絕大部分只是對人眼無意義的隨機雜訊。該空間中只有一小部分資料點對應於可識別的圖像,它們存在於所謂的資料流形(data manifold)中(就像藏在更大空間中的一張紙)。

模型事先不知道資料流形的形狀和位置。因此,圖像生成可以被視為流形恢復的任務,模型需要根據從中採樣的有限訓練資料來推斷隱藏的資料流形是什麼樣子,然後在流形上找出新的點,這些點將對應於新穎且有意義的圖像。事實證明,分數平滑對於擴散模型實現這一點至關重要。

值得注意的是,在多維設定中,分數平滑的影響以方向相關的方式表現出來。沿著與隱藏資料流形平行(或「切線」)的方向,它會產生與一維情境中類似的減速效果。然而,沿著指向流形的方向,「完美」分數函數已經相對平滑(事實上,如果流形是平坦的,它只是一條直線),進一步的平滑並沒有太大區別。

因此,分數平滑不是在每個方向上對粒子流動施加制動(這會使它們停滯在嘈雜的空空間中,導致最終圖像模糊),而是不會減慢它們向流形移動的速度,而只是減少它們沿切線方向向訓練資料崩潰的趨勢。透過這種方式,模型在品質和新穎性之間取得了平衡:圖像既逼真(因為它們成功到達了有意義的資料流形),又新穎(因為它們停留在原始訓練資料點之間的空白空間中)。

**結論**

我們的發現表明,我們所稱的擴散模型的「創造力」實際上可能是一個可預測的數學結果。由於神經網路從來都不是「完美」尖銳的,它們創建了在已知資料之間進行插值的橋樑。在圖像生成或藥物發現中,這可能意味著擴散模型不僅僅記住它被展示的兩張不同的貓圖像或藥物分子;它會探索它們周圍的空間,以建議第三個全新的圖像或分子配置,結合兩者的痕跡。

我們的工作僅是闡明這種機制的一個初步努力,當資料分佈或神經網路架構變得更複雜時會發生什麼,還有待觀察。儘管如此,透過證明這種行為從根本上植根於神經網路的學習方式,我們可以開始有意識地構建更好的「插值器」模型,以確保它們保持創造性引擎,同時避免盲目記憶的陷阱。我們也發布了用於生成論文中圖表的數值實驗程式碼。