
DACA-GRPO:为扩散语言模型强化学习注入去噪感知信用分配

扩散大语言模型(Diffusion LLM)是自回归模型之外的另一条技术路线,但现有的强化学习(RL)方法在处理这类模型时存在两个根本缺陷:一是把去噪轨迹中的所有步骤一视同仁,缺少时间维度的信用分配;二是用于策略优化的似然估计存在均值场偏差和高方差问题。
针对这些问题,研究团队提出 DACA-GRPO,一个轻量、即插即用的增强模块,可附加在任何 GRPO 风格训练器之上,不改变原有训练流程。方法包含两个互补机制:Denoising Progress Scores 利用中间预测直接提取每个 token 的重要性权重,不增加任何额外前向计算成本;Stratified Masking Likelihood 将 token 位置分层,使每个 token 在生成时能利用更多序列上下文,从而缓解均值场偏差。
在七项基准测试中,DACA-GRPO 分别叠加在三种 GRPO 基础方法上,均取得稳定提升。具体数据为:数学推理提升最多 5.6 个百分点,代码生成提升 7.4 个百分点,约束满足提升 36.3 个百分点,JSON 格式遵循提升 5.9 个百分点。对比基线包括原始 GRPO 及现有改进方法,作者特别指出最大收益出现在约束满足类任务上——这正是扩散模型传统优势场景。
值得注意的边界条件:DACA-GRPO 不改变底层 RL 算法,只改进信用分配和似然估计方式;其有效性在 7B 到 27B 参数规模的模型上均得到验证。相关代码将在 GitHub 公开,但论文未提供量化推理成本或训练时开销的具体数字,也未与 MCTS 等更复杂方法对比。
该研究把时序信用分配和分层掩码两种改进叠加在 GRPO 上,同时保持了插拔式的轻量设计,对扩散 LLM 的 RL 训练有直接参考价值。样本效率的提升意味着更少的交互次数即可达到同等奖励水平,实际训练中每轮采样步数可在 1 至 5 之间调整——实验表明 DACA-GRPO 在采样步数较少时优势更明显。


