当遗忘是免费的:利用低影响点降低计算成本

机器学习的「数据遗忘」(Unlearning)需求在隐私法规推动下日益增长。当前主流遗忘方法有一个共同假设:需要遗忘的每个数据点都要被同等对待,并产生对应的计算开销。

这篇来自 Apple(部分作者现属哈佛)的研究对此提出了质疑:如果某些数据点对模型的影响本身就微乎其微,是否还有必要为它们执行全量遗忘步骤?

方法很直接。作者在语言和视觉任务中,利用影响函数(influence functions)对训练数据进行对比分析,识别出那些对模型输出影响可忽略不计的数据子集。关键发现是:这些「低影响点」实际上天然就从模型中「隐式遗忘了」——移除它们与否,模型的行为几乎没有变化。

基于这个观察,他们设计了一个高效的遗忘框架:在执行正式遗忘之前,先精简需要处理的数据集大小。具体做法是利用影响函数筛选、过滤掉低影响点,只对确实有实质影响的数据执行遗忘操作。

实验结果给出了最直接的价值:在实际的基准案例中,这种方法可以在不牺牲遗忘有效性的前提下,将计算开销降低 大约50%。这意味着遗忘不再是一个「全或无」的沉重负担,而可以按影响程度分级处理。

局限方面,论文主要评估了影响函数在分类任务中的效果,对生成式模型或更复杂的遗忘场景(如序列数据)边界尚未展开讨论。此外,影响函数的计算本身也需要额外开销,在极大规模数据集上是否仍然净收益为正,需要进一步权衡。

整体来看,这个思路的价值在于打破了遗忘问题中「所有遗忘点平权」的隐含假设,提出了一种可量化的裁剪策略——与其对所有数据一视同仁地执行昂贵的遗忘流程,不如先问一句:有些点是否根本就不值得去遗忘。

When Unlearning Is Free: Leveraging Low Influence Points to Reduce Computational Costs

查看原文