
像物理学家一样剪枝:把删 Block 变成 Ising 优化问题

深度剪枝最直接的一招是整块删除 transformer block,模型变短,推理加速和显存节省都可预测,还能与量化、低秩压缩叠加。难点在于选哪些 block 删:删错模型就崩,而且删某一块的影响取决于同时删了哪些其它块,选择之间相互耦合。这是一个组合问题,不是排序问题。作者把这种带交互的二元变量组合问题,直接对应到物理学中的自旋系统。
Multiverse Computing 在最新论文中把 block 选择重构为约束二元优化(CBO),映射到 Ising 玻璃模型——一种全连接、具有固定数量「向上自旋」的无序自旋系统。这个自旋系统的能量被证明是剪枝后模型 benchmark 得分的强代理指标,因此可以在不实际跑模型的情况下评估海量候选配置,再把困难实例交给经典或量子启发的求解器。在深度压缩场景收益显著:Llama-3.3-70B-Instruct 压缩 50% 时,MMLU 比最强的同类 block 删除方法高出近 23 个百分点。
现有 block 删除方法大多单独评估每个 block 的重要性,再用 magnitude、sensitivity 或 block influence 启发式删掉最不重要的块。物理上这叫平均场方法:假设每个 block 的贡献相互独立。另一种常见捷径是只删除连续的一段 block,虽然缩小了搜索空间,但也丢弃了大部分可能性。问题是 block 之间并不独立,删除第 20 块是否有害,取决于你是否同时删了第 19 或第 24 块。模型越深越异构,忽略耦合就越吃亏,尤其想一次删掉大量 block 时。真正需要的是在考虑交互的前提下搜索 block 组合,但组合数量指数增长,暴力搜索不现实。这正是统计物理工具擅长处理的场景:带成对耦合的指数级配置空间。
方法的核心是为每个 block 附加一个二元变量:0 保留,1 删除,类似自旋向下或向上。然后对模型损失关于这些变量做二阶泰勒展开,得到近似 Hessian 矩阵。对角元表示每个 block 自身的重要性,非对角元正是 block 之间的成对耦合——平均场方法丢掉的多体物理。于是「该删哪些 block」变成干净的优化问题:在恰好删除 M 个 block 的约束下,最小化能量 xᵀH⁰x。数学上是约束二元优化,物理上是 Ising 玻璃——全连接、磁化守恒(固定删除数量相当于固定总自旋)的自旋系统。关键性质是:低能态对应高表现的剪枝模型,最小化能量与最大化 benchmark 分数成为同一件事。
这个方法的实用之处在于成本。Hessian(全部耦合)只需要在小型校准数据集上做一次前向和反向传播即可算出。之后评估任意候选配置只是一次廉价能量计算,无需运行真实模型,更不需要 benchmark。耦合不依赖压缩目标,同一个 Hessian 可以复用于不同的 M 值。对于大多数模型,配置空间虽然大但仍可穷举:单张 GPU 上暴力检查上百亿个自旋配置,几百万个只需几秒。本文最难的可追踪案例是 Llama-3.3-70B 的 80 个 block 中删 8 个,约 290 亿配置,耗时约两天。超出这个规模后精确方法失效,此时等价 QUBO 形式(约束吸收为惩罚项)可以把任务交给为这类哈密顿量优化的经典、量子与量子启发式求解器,如量子退火、QAOA、禁忌搜索、专用分支定界。作者发现开源禁忌搜索求解器在数秒内可靠地达到最低能态,即使是在能对照暴力搜索验证的最难案例上。
一个重要且反常规的观点:通常 CBO 或退火求解器以找到真正基态为成功标准,但这里并不需要基态,只需要快速生成若干好的低能态。这个标准低得多,所以轻量求解器就够用,还能同时跑多个。而且能量是强代理但不是完美代理,单一最低能态不总是最佳模型。一旦哈密顿量建立,读取基态和低激发态几乎零成本,于是能得到一篮子高质量候选剪枝方案,而不是一个脆弱答案。具体例子:Llama-3.1-8B-Instruct 删 16/32 个 block 时,大部分顶部状态删的是模型尾部的 block,符合以往认知。但第 17 激发态首次提出删除靠近模型开头的 block,经过轻量重训练后,该配置在多个 benchmark 上超过基态。这直接推翻了「最佳剪枝是删掉中间或尾部一段连续 block」的常见假设。
结果方面,在 Llama-3.1-8B-Instruct、Qwen3-14B、Llama-3.3-70B-Instruct 上,CBO 与最先进 block 删除基线相当或更好,压缩越激进差距越大。最明显的是无重训练条件下 Llama-3.3-70B-Instruct 的深度压缩:删 24/80 以内与 block influence 大致持平,删 32/80 和 40/80 时显著领先,最深设置下 MMLU 优势接近 23 个点(40/80 时 CBO 保持 MMLU 约 77,最强基线跌到 54 左右)。Qwen3-14B 删 12/40 时 MMLU 领先约 10 个点。轻压缩时各方法差不多,因为耦合在深剪时最关键。
该方法还适用于异构架构。现代混合模型交错排布不同类型的层,Ising 公式不关心每个位置是哪种 block,耦合就是耦合。作者在 NVIDIA-Nemotron-3-Nano-30B-A3B-FP8(非均匀交错 Mamba2、attention 和 MoE 层的混合模型)上做了无重训练测试:删 2-3 个 MoE 层或 2 个 attention 层时,CBO 在 AIME25 和 GPQA 上超过 block influence。结果也印证混合模型中的冗余不均匀分布:某些 expert 层远比其它层可删。即便是这里,最佳配置也常常是激发态而非基态。
这项工作属于 Multiverse Computing 的既有路线:把凌乱的机器学习问题重构为 Ising 哈密顿量,再用为物理构建的经典与量子启发优化机器求解。block 删除可与该公司的量化、低秩/SVD 压缩、宽度剪枝、知识蒸馏修复等组合成更大流水线。论文全文、泰勒展开推导、QUBO 映射、求解器基准、校准数据集消融和完整结果表见 Hugging Face,代码开源在 github.com/CompactifAI/Block_removal_through_constrained_binary_optimization。

