分类流图的规模化扩展

连续扩散和流匹配模型在语言建模中可替代自回归方法,带来加速采样和倾斜等优势。近期工作通过在高斯分布与独热编码数据分布之间进行简单的流匹配,证明了连续生成离散数据的可行性,并借助分类流图(CFMs)实现了加速采样,在少步生成下达到有竞争力的样本质量。但该方法此前仅在小于1B参数的规模上评估,可扩展性未知。

本文作者将基流模型扩展到1.7B参数,在2.1T tokens上训练,并通过自蒸馏得到一个CFM,只需4步推理即可生成多样且高质量的文本,同时保持接近数据级别的token熵。此外,作者为半离散设定下的CFM引入了似然界,证明该模型可用于标准LM基准的评分,结果与离散扩散方法相当。文章还揭示了规模化训练中的一些挑战,并就损失加权时间调度提供了可操作的见解。

Scaling Categorical Flow Maps

查看原文