LVSum:时间感知的长视频摘要基准

说实话,长视频摘要这事儿一直挺烦人。模型能认出画面里的狗,但搞不清狗是在第5分钟追球还是在第15分钟睡觉。尤其是视频一拉到十几分钟,生成的摘要经常把前后事件顺序搞反,或者干脆忽略时间关键信息。这背后的病因很清楚:现有MLLM的训练目标根本没把时间推理当回事,模型更依赖单帧的视觉特征,而不是理解整个叙事的时间线。LVSum这个基准就是来给这个毛病拍片的。

作者搞了72个平均16分钟的视频,覆盖13个领域,每个视频让人类标注了最多10个带时间戳的摘要。然后用主流闭源和开源MLLM去跑,拿新设计的LLM打分指标(内容相关性、模态一致性)加上传统指标一起比较。结果三个硬核发现:第一,转录文本对摘要质量的贡献碾压视觉帧——模型基本就是靠字幕在做总结;第二,模型生成的和人类写的摘要之间差着一个量级;第三,模型在时间定位、指令遵循和跨模态对齐上存在系统性的短板。说白了,当前模型做长视频摘要,靠的不是理解,而是听写。

这个工作最直接的启发是:别对纯视觉信号抱幻想了,转录文本才是当前模型唯一靠谱的锚点。但更深的信号是,MLLM在时间推理上几乎还是盲人摸象——它们能答对“有什么”,但答不对“什么时候”。未来的方向要么把时间定位直接塞进训练目标,要么像人类一样利用外部知识(比如脚本、字幕)辅助理解。对做视频AI的同行来说,LVSum提供了一个非常锋利的标尺:你能跑通30秒的短视频摘要,不代表你能搞定16分钟的长叙事结构。想验证模型是真理解还是假理解,拿这个基准跑一跑就知道了。

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

查看原文