词汇干预实现数据受限下的多语言知识迁移

跨语言知识迁移是构建低资源语言多语言模型的关键,因为目标语言数据稀缺时,科学推理、常识推断和世界知识等下游任务所需的知识主要从高资源语言获取。现有迁移方法大多依赖大规模平行语料、翻译系统、辅助模型或额外训练阶段,这些条件对许多语言而言并不具备。

本文提出 LINK,一种数据层面的干预方法,在预训练阶段通过双语词汇对高资源(英语)训练数据中的部分单词做词汇替换,从而改善知识迁移。具体来说,按设定替换比例,从英语训练语料中随机选取单词,替换为对应的词级翻译。该方法不需要额外训练模型,只需一个双语词汇表——而这类词汇表对几乎所有语言都可以近零成本获得。

评估覆盖八种语言、五种模型规模,结果显示 LINK 能显著提升目标语言的下游任务表现,最高可将达到同等性能所需的训练时间缩短至原来的二分之一,即最高 2 倍训练加速。由于干预只作用于高资源语料,不触碰目标语言数据,因此对低资源语言的适配成本极低。

该方法的价值在于把昂贵且复杂的迁移环节简化为一个轻量的数据预处理步骤,让缺乏平行语料和翻译系统的语言也能受益于跨语言迁移。不过,原文未讨论该方法在不同替换比例下的具体取舍、对词汇覆盖的要求,以及在极低资源语言上的极限表现,这些仍需后续实验验证。

Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions

查看原文