
多模态大语言模型对齐的全面研究

多模态大语言模型(MLLM)的偏好对齐是一个关键但尚未被充分研究的课题。与语言模型类似,MLLM在图像理解任务中面临幻觉问题,不仅会陈述错误事实,还会生成与图像内容不一致的响应。对齐的主要目标是鼓励模型更紧密地贴合图像信息。已有工作引入了多种偏好数据集和算法(如DPO和PPO),但由于数据集、基模型和对齐方法的差异,很难确定哪些具体要素对性能提升贡献最大。
本文独立分析了偏好对齐的各个方面。首先将对齐算法分为两类:离线方法(如DPO)和在线方法(如online-DPO),并发现将离线与在线方法结合可以在某些场景下提升模型性能。系统回顾了多个已发表的多模态偏好数据集,讨论数据集构建细节对模型性能的影响。
基于这些洞察,提出了一种新的多模态偏好数据生成方法——偏差驱动幻觉采样(BDHS)。BDHS不需要额外标注,也不需要外部模型,即可生成偏好数据。在多个基准测试上,BDHS达到了与已有对齐工作有竞争力的性能。


