讓大型語言模型更快的廉價方法之一,也是最直接的方法之一,就是刪除整個Transformer區塊。由於模型實際縮短了,區塊移除(也稱為深度修剪)除了節省記憶體外,還能帶來可預測的推論速度提升,並且能與量化、低秩壓縮及其他技術完美結合。

困難之處在於決定要移除哪些區塊。移除錯誤的區塊會導致模型崩潰;而且移除任何一個區塊的效果,取決於同時移除的其他區塊,因此選擇之間存在相互作用。這使其成為一個組合問題,而非排序問題,而具有相互作用二元變數的組合問題,正是自旋系統物理學所旨在描述的。

我們最新的論文《LLM Compression by Block Removal with Constrained Binary Optimization》正是採納了這種對應關係。我們將區塊選擇重新定義為一個約束二元最佳化(CBO)問題,它直接映射到伊辛玻璃(一種具有全對全相互作用和固定「向上」自旋數量的無序自旋系統)。

這個自旋系統的能量,被證明是衡量修剪後模型在基準測試中表現的強大且廉價的替代指標。這意味著我們可以在不進行任何基準測試的情況下,對大量候選配置進行排序,並將困難的實例交給我們在Multiverse其他地方使用的經典和量子啟發式求解器。在深度壓縮情境下,其回報是巨大的:對Llama-3.3-70B-Instruct進行50%壓縮時,我們在MMLU上的表現比最佳的競爭區塊移除方法高出近23個百分點。

大多數現有的區塊移除方法會單獨評估每個區塊,然後根據其大小、敏感度或「區塊影響力」啟發式方法,移除看起來最不重要的區塊。在物理學術語中,這些是平均場方法:它們將每個區塊視為其貢獻獨立於其他區塊,就像平均場理論用單一平均場取代自旋的鄰居一樣。

一個相關的捷徑是只移除單一連續的區塊序列,這雖然使問題規模變小,但卻捨棄了大部分的搜尋空間。問題在於區塊並非獨立的,就像真實磁鐵中的自旋一樣。移除區塊20是否會損害模型,取決於你是否也移除了區塊19或區塊24,這是一種兩個決策之間的相互作用或耦合。

隨著模型變得更深、更異質,忽略這些耦合會犧牲品質,尤其當你想要一次移除大量區塊時。你真正想要的是在考慮區塊如何相互作用的同時,搜尋區塊的組合,但組合數量呈指數級增長,因此暴力破解看起來毫無希望。這正是統計物理學工具發揮作用的領域,即具有成對耦合的指數級巨大配置空間。

我們為每個Transformer區塊附加一個二元變數:0表示保留,1表示移除,就像一個可以指向下或上的自旋。然後,我們對模型損失函數針對這些變數進行二階泰勒展開,產生一個(近似的)Hessian矩陣。

Hessian矩陣的對角線表示每個區塊自身的影響程度;非對角線元素則精確地表示區塊之間的成對耦合,這是平均場方法所忽略的多體物理學。這種重新定義將「我應該移除哪些區塊?」轉化為一個清晰的最佳化問題:找到一組M個區塊,其移除能使能量xᵀH⁰x最小化,條件是從N個區塊中精確移除M個。

數學上,這是一個約束二元最佳化問題;物理上,它是一個伊辛玻璃,一個具有守恆磁化(固定數量的移除區塊扮演固定總自旋的角色)的全對全耦合自旋系統。我們確立的關鍵特性是,這種能量是下游品質的強大替代指標:自旋系統的低能量狀態對應於高性能的修剪模型。最小化能量和最大化基準分數變成了相同的搜尋。

區塊選擇變成一個約束二元最佳化問題,等同於尋找伊辛玻璃的低能量狀態;每個解都指示要刪除N個區塊中的哪M個。右圖:我們插入每個區塊殘差路徑中的耦合變數α,用於構建Hessian矩陣。來源:論文圖1。

這種方法之所以實用,是因為成本效益。Hessian矩陣,即完整的耦合集合,只需透過在小型校準資料集上進行一次前向和後向傳播即可計算。之後,評估任何候選配置都只是一個廉價的能量計算,無需運行實際模型,更不用說進行基準測試了。而且由於耦合不依賴於壓縮目標,相同的Hessian矩陣可以重複用於解決許多不同的M值。

對於大多數模型來說,配置空間雖然龐大但仍可檢查。由於計算單一能量非常便宜,我們可以在單一GPU上進行暴力破解,檢查多達數百億個自旋配置。數百萬個配置只需幾秒鐘;這裡最難處理的案例,即從Llama-3.3-70B的80個區塊中移除8個(約290億個配置),大約需要兩天。

超出這個範圍,精確方法就會失效,這正是將問題視為伊辛玻璃第二次發揮作用的地方。在其等效的QUBO形式(約束條件被吸收到懲罰項中)下,完全相同的任務可以交給為這類哈密頓量構建的高度最佳化經典、量子和量子啟發式求解器,例如量子退火、QAOA、禁忌搜尋和專用分支定界法。

我們發現,一個開源的禁忌求解器即使在我們能與暴力破解驗證的最困難案例上,也能在幾秒鐘內可靠地達到最低能量狀態。因此,該方法可以擴展到無法列舉配置的模型,使用完全屬於Multiverse領域的求解器。這裡有一個微妙但重要的點,它與通常的最佳化思路背道而馳。

通常,CBO或退火求解器會根據其是否找到真正的基態來判斷。我們實際上不需要基態。我們需要的是一種快速生成少量良好低能量狀態的方法,這是一個更容易達到的標準,這就是為什麼輕量級求解器對我們如此有效,以及為什麼我們能夠運行多個求解器。

能量是品質的強大替代指標,但並非完美無缺,因此單一最低能量狀態不總是最佳模型。這被證明是一個特性而非缺陷:一旦哈密頓量建立,讀取基態和低激發態基本上是免費的,這提供了一系列高品質的候選修剪方案供嘗試,而非一個脆弱的答案。

探索激發態,而不僅僅是基態,本身就是一個活躍的物理研究領域,它與實踐者在此處實際需求完美契合。一個具體例子:對於Llama-3.1-8B-Instruct在移除16/32個區塊時,大多數頂級狀態會移除模型末端的區塊,這與先前的研究預期一致。

然而,第17個激發態首次提出移除模型開頭附近的區塊,並且經過輕度再訓練後,該配置在多個基準測試中超越了基態。這直接駁斥了最佳修剪是連續的中後段區塊的常見假設,並展示了尊重問題的完整多體結構為何能帶來回報。

左圖:20個最低能量狀態中,每個狀態移除的區塊(紅色=移除)。右圖:第17個激發態,它移除了模型開頭的一個區塊,在再訓練後於多個基準測試中超越了基態。最佳模型是一個激發態,而非基態。來源:論文圖2。

在Llama-3.1-8B-Instruct、Qwen3-14B和Llama-3.3-70B-Instruct上,我們的方法(CBO)與最先進的區塊移除基準方法相比,表現持平或更優,且隨著壓縮程度越積極,差距越大。

最明顯的勝利是Llama-3.3-70B-Instruct的深度壓縮,且未經再訓練評估。在移除多達80個區塊中的24個時,CBO與區塊影響力大致持平。但在移除32/80和40/80個區塊時,CBO顯著領先,在最深層設定下,MMLU分數幾乎高出23點,擊敗了我們測試的所有基準線。

對於Qwen3-14B在移除12/40個區塊時,CBO在MMLU上領先約10點。在較輕的壓縮下,這些方法表現相當,這是預期的:當進行深度剪裁時,耦合的影響最為顯著。

Llama-3.3-70B-Instruct,未經再訓練

移除區塊數

MMLU

原始

0

82.2

CBO(我們的方法)

32 / 80

76.6

區塊影響力

32 / 80

59.3

CBO(我們的方法)

40 / 80

76.9

區塊影響力

40 / 80

54.0

在40/80(50%深度)的壓縮下,CBO將MMLU維持在接近77分,而最強的基準線則降至50多。來源:論文表2。

在現代異質架構上,區塊移除變得更加困難,因為不同類型的區塊交錯排列,但伊辛公式並不在意:無論每個位置是什麼類型的區塊,耦合就是耦合。為了進行壓力測試,我們將該方法應用於NVIDIA-Nemotron-3-Nano-30B-A3B-FP8,這是一個以非均勻模式交錯Mamba2、注意力層和專家混合(MoE)層的混合模型,且未進行任何再訓練。

我們的公式沒有假設同質堆疊,因此可以直接轉移應用。在移除2-3個MoE層或2個注意力層時,CBO找到的配置在AIME25和GPQA上優於區塊影響力方法。結果也證實,這些混合模型中的冗餘是真實存在的,但分佈不均:有些專家層比其他層更容易被捨棄,而該方法搜尋耦合配置空間的能力正是找到良好剪裁的關鍵。即使在這裡,密集模型的模式仍然成立,最佳配置通常是激發態而非基態。

將一個複雜的機器學習問題重新定義為伊辛哈密頓量,然後利用為物理學構建的經典和量子啟發式最佳化機制來解決它,這完全符合Multiverse的核心專長,這與我們壓縮堆疊中的直覺是一致的。而且區塊移除可以與該堆疊的其餘部分(量化、低秩/SVD壓縮、寬度修剪和基於知識蒸餾的修復)結合使用,因此它能融入更大的管線中,而非與之競爭。

想了解完整的技術細節,包括泰勒展開推導、QUBO映射、求解器基準測試、校準資料集消融研究以及完整的結果表格嗎?請在Hugging Face上閱讀完整論文,或聯繫我們的團隊討論如何將此應用於您自己的模型。程式碼已在github.com/CompactifAI/Block_removal_through_constrained_binary_optimization開源。