
从偏好到原则:基于评分卡的对齐方法用于有依据的知识回答

在开放域问答中,设计有效的奖励信号来对齐模型行为非常困难。高质量的回答需要同时满足多个方面,例如内容构成、事实依据和指令遵循,而这些难以用一个单一的标量目标来捕捉。
本文提出一种基于评分卡(rubric)的奖励框架。该框架首先为每个查询基于检索到的证据生成针对性的评分卡,然后将评分卡分解为多个质量维度(如事实准确性、连贯性、组织性等),从而在训练后的对齐阶段提供细粒度的监督信号。
实验结果量化了收益:在三个评估轴(composition、grounding、instruction-following)上取平均,该方法相比原始的指令微调基线提升了6.5%,相比未分解维度的平面评分卡变体提升了4%。提升在所有评估数据集上保持一致。进一步分析表明,将评分卡条件化于检索证据能够改善事实支持;而将评分卡分解为质量特定维度则进一步提高了回答的连贯性、结构和查询遵循度。
这些结果表明,基于依据的多维评分卡能为复杂开放域问答提供更有效的奖励监督。


