如何引导语言流:探针引导扩散模型

这篇论文提出了一种名为 probe guidance 的新方法,用来给 flow matching 模型加引导信号。核心思路很直接:不另起炉灶,而是直接利用现有扩散模型已冻结的内部状态来构造引导信号。

原理上和 autoguidance 类似,但它省掉了推理时的额外前向传递。这既降低了计算成本,也为弱模型和强模型之间共享动态提供了一条可靠路径。作者在连续扩散语言模型上做了验证,结果显示 probe guidance 在无条件生成任务上达到了新的 state-of-the-art。

具体数据方面,他们把方法应用到一个 1.7B 的扩散语言模型上,在多项选择题问答基准上持续获得提升。另一个重要发现来自对传统 autoguidance 设置的剖析:当强模型是弱 checkpoint 时,弱模型必须来自训练中的低熵区域,否则引导效果不成立。这个结论既给出了改进扩散语言模型的实用手段,也揭示了 autoguidance 背后此前并不清楚的机制。

作者包括 Rohit Dilip、Tianrong Chen、Yuyang Wang、David Van Valen、Josh Susskind、Miguel Angel Bautista,其中部分工作完成于 Apple,作者单位还涉及 Caltech。整体来看,这是一项直接推动扩散语言模型落地的研究:它不需要额外的模型前向计算,就能在多个基准上稳定提升表现,同时为理解 autoguidance 提供了新视角。

How to Guide Your Language Flow

查看原文