
深度低秩残差蒸馏锁定预训练权重

开放权重语言模型的质量在近年来显著提升。分享权重使得模型能在不同软硬件平台被广泛采用,也促进了开放式研究。但另一方面,模型权重可能被修改用于未经授权的用途。防御这种修改并不简单:因为适应性攻击者能够看到所有权重和架构,可以轻易绕过简单的结构防御,并通过优化破解基本的锁定机制。
这篇文章提出利用自动微分(automatic differentiation)在推理与训练中的不对称性作为新的防御维度。作者提出 DLR-Lock 方法:模型发布者将预训练模型中的每个 MLP 替换为一个参数量相当的深度低秩残差网络(DLR-Net)。DLR-Net 的核心特点是,在反向传播时激活内存会随网络深度线性增长,而前向传播无此开销。这种不对称性让微调变得更加昂贵。DLR-Net 通过模块级蒸馏(module-wise distillation)高效训练,从而保留原始模型的能力。
除了内存开销,DLR-Lock 还引入了架构不匹配,使得标准微调的优化曲面更复杂。具体来说,后向传播的计算开销远大于前向传播,进一步增加了微调的难度。实验在语言模型上验证了该方法:DLR-Lock 成功抵御了充分了解防御策略的适应性攻击者,同时保持了原始模型的原有能力。该工作已被 ICML 2024 的 Efficient Systems for Foundation Models 研讨会接收。


