
超越视觉CoT:内化视觉思考用于主动视频推理

多模态大语言模型常依靠视觉思维链(Visual CoT)来推理空间、时间和具身环境,通过生成中间推理图像来提供视觉预判,但这会带来大量推理开销,尤其对主动视频推理不利。本文提出内化视觉思考(IVT)框架,探索能否在训练阶段学习视觉思考,而推理时直接给出答案。
IVT是一种后训练框架,在无标注视频上联合优化文本预测和下一嵌入预测。给定部分视频,IVT预测未来帧的潜在表示以及目标文本答案,从而让模型捕捉运动、物体转移、交互和潜在意图。推理时,IVT直接生成答案,无需合成或重新编码未来帧。
作者在目标表示、解码器设计、预测范围、数据混合、训练课程和预测目标等多个维度进行了受控研究。结果表明,IVT在所有六种评估设置上均优于纯文本后训练,同时保持相同的高效推理路径。与Visual CoT相比,IVT达到相当或更优的性能,端到端延迟降低超过5倍。这表明,推理时的显式像素空间生成可能并非必需,预测世界建模可在训练中内化,从而得到更准确且更高效的多模态推理器。


