核心觀點:剪哪一層不是排名題,而是組合題

大型語言模型要加速,直接移除完整 Transformer block(depth pruning)是最乾脆的結構化壓縮手段:層數變少,推論延遲與記憶體占用會相應下降,也能與量化、低秩壓縮、寬度剪枝或蒸餾串接。但「逐層評分後刪掉最低分者」有一個根本盲點:移除某一層的損失取決於同時移除了哪些層。換言之,區塊之間有交互作用,選擇問題是組合最佳化,不是獨立排序。

Multiverse Computing 的研究將每個 block 表示為二元變數:保留為 0、移除為 1;再以損失函數對這些變數的二階泰勒展開建立近似 Hessian。對角項量測單一層的重要性,非對角項則保留兩層同時移除時的耦合效果。於是「恰好刪除 M 個、使能量最小的 N 層子集」成為受約束二元最佳化(CBO),物理上等價於固定磁化量的 Ising glass。作者的核心主張是:低能量組態可作為高品質剪枝模型的低成本代理指標。^[raw/articles/2026-09-21-huggingface-multiverse-block-removal-ising.md]

技術亮點:一次校準,搜尋大量候選組合

Hessian 只需用小型 calibration dataset 做一次前向與反向傳播取得;之後每一個剪枝候選只需計算能量,不必重新跑模型或基準測試,而且同一份耦合矩陣可重用於不同壓縮率。小規模時可直接枚舉;文章稱,Llama-3.3-70B 的 80 層中選 8 層移除(約 290 億組)在單張 GPU 約需兩天。更大的空間則可改寫為 QUBO,交給 tabu search、模擬/量子退火、QAOA 或 branch-and-bound 等求解器。

值得注意的是,目標不必死守全域最低能量的 ground state。作者在 Llama-3.1-8B、移除 16/32 層的案例中發現:第 17 個低能量激發態在輕度恢復訓練後,反而跨多項基準優於 ground state,且包含傳統直覺少選的早期層。實務上應把低能量譜當成一批可驗證候選,而不是把最佳化器輸出的第一名直接當作部署答案。

報告結果怎麼讀

作者在未重新訓練的 Llama-3.3-70B-Instruct 上報告:移除 32/80 層時,CBO 的 MMLU 為 76.6、block influence 基線為 59.3;移除 40/80 層(50% 深度)時,分別為 76.9 與 54.0,差距近 23 個百分點。Qwen3-14B 移除 12/40 層的 MMLU 領先約 10 分;在混合 Mamba2、attention 與 MoE 層的 Nemotron 模型上,也報告了較佳的 AIME25 與 GPQA 組態。這些數字支持「壓得越深,耦合越不能忽略」的假說,但仍是作者選定模型、校準資料、求解器與基準下的比較,不可直接外推為所有模型都能取得同等增益。^[raw/articles/2026-09-21-huggingface-multiverse-block-removal-ising.md]

與既有壓縮知識的連結

這個方法補上 Quantization-Aware Healing:4-bit 壓縮模型的恢復訓練與因果限制 所討論的「壓縮後怎麼恢復能力」之前的一步:先以結構化剪枝找出有希望的骨架,再決定是否量化與蒸餾修復。兩者皆須做公平控制:固定模型、資料、訓練步數、壓縮率與總推論成本,避免把額外訓練或不同實驗預算誤認為方法優勢。

它也把 Parameter Golf:OpenAI AI 輔助研究競賽的三大洞察 的效率觀點推得更具體:模型壓縮不只是「少放幾個 bit」,而是把架構選擇、求解成本與實際任務品質一起納入可測量的設計空間。若要落地,建議先在目標工作負載比較原模型、獨立重要度剪枝與 CBO 剪枝,並同時量測任務品質、首 token/每 token 延遲、VRAM、吞吐、量化後表現及失敗案例;低能量僅用於縮小候選集,最終仍以端到端驗收決定。

來源與限制

反向連結

以下頁面引用了本頁: