
超越 LoRA:最流行的微调方法不一定最好

Hugging Face 的 PEFT 团队发布了一篇长文,核心结论是:LoRA 虽然好用且占据绝对主流,但在很多场景下并非最优选择,有据可查。
先看数据。在 Hugging Face Hub 上,标注了单一 PEFT 技术的 20,834 个模型卡片中,98.4%(20,509 个)提到 LoRA。在外部图片生成平台的 10,000 个检查点样本里,95.0%(7,111 个)是 LoRA。GitHub 上 from peft import <PEFT CONFIG> 的代码搜索中,LoRA 占了 71.3%。这个统治力已经不仅仅是技术优劣能解释的了,更可能是自我强化的结果:LoRA 最早走红、教程最多、下游支持最完善。
那论文里那些“我们的方法击败了 LoRA”的结论呢?作者认为很难直接采信。研究者有发表压力,容易在自己提出的方法上多花调参功夫,而对 LoRA 等基线调得不够。有论文指出,仅靠调整学习率,LoRA 就能匹配那些号称更好的 PEFT 方法。另一个问题是各论文用的基准、对比方法、代码可复现性都参差不齐。
为了解决这个信息不透明的问题,Hugging Face 团队在 PEFT 库中内置了基准测试。他们做了两套:一套是大语言模型在 MetaMathQA 数据集的数学推理微调,另一套是 FLUX.2 模型在图片生成任务中学习“猫玩偶”新概念。所有技术的训练和评估条件完全一致,追踪的不只是测试准确率,还有 VRAM 峰值占用、训练耗时、遗忘程度和检查点大小。
LLM 微调的 Pareto 前沿上,LoRA 确实占据了一个位置——标准 LoRA 占用 22.5 GB,准确率 48.1%。但它的变体 rs-LoRA(秩稳定初始化)能做到 53.2% 准确率、22.6 GB 内存;LoRA-FA 则用 20.2 GB 内存达到 32.9% 准确率。而 Lily 甚至冲到 54.9% 准确率,但代价是 25.6 GB 内存。
在图片生成基准上 LoRA 表现更差。LoRA 的 dino 相似度得分为 0.697,需要 9.97 GB 显存;OFT 以 0.708 分和 9.01 GB 显存严格优于它——两项指标同时碾压,不在同一水平。
不过作者也列出了不能只看基准的几个限制:基准虽力求公平,但超参数不可能对所有方法公允(欢迎社区发 PR 改进);有些 PEFT 方法有特殊能力,比如 Cartridges 专为压缩长 prompt 设计,但基准测不到;不是所有 PEFT 技术都支持量化基模或适配器合并以降低推理开销。最大的现实约束是:vLLM、llama.cpp 等主流推理引擎目前只支持 LoRA。对此,PEFT 团队新增了适配器转换功能,可以将非 LoRA 的适配器转成 LoRA 格式。作者测试了将 GraLoRA 转换成 LoRA,转换前后 dino 相似度几乎不变(0.702 → 0.694),说明这个方案可行。
核心建议很简单:LoRA 不应该再是默认选项。在 PEFT 库中,用户只需改动一行代码就能替换微调方法,比如从 LoraConfig 换成 OFTConfig。即使坚持用 LoRA,也值得尝试 rs-LoRA、DoRA、LoRA-FA 等变体,它们的表现往往优于原生 LoRA。


