
VSAS-Bench:流式视觉助手模型的实时评估

流式视觉语言模型(Streaming VLM)需要根据指令和实时输入帧流连续生成回复,这是实时视觉助手的核心机制。然而,现有VLM评估框架主要面向离线场景,忽略了流式模型特有的指标——如主动性和一致性。为此,论文提出VSAS-Bench,一个面向流式视觉助手的新框架和基准。与以往基于单一问答的基准不同,VSAS-Bench包含超过18,000个时序密集标注,覆盖多种输入域和任务类型。它引入了标准化的同步和异步评估协议,以及能分离并衡量流式VLM不同能力的指标。
利用该框架,论文对近期视频和流式VLM进行了大规模评估,分析了关键设计因素(内存缓冲区长度、内存访问策略、输入分辨率)下的准确率-延迟权衡,得出若干实用结论。一个关键发现是:传统VLM可以不经额外训练直接适配流式场景,且适配后的模型优于专门设计的流式VLM。例如,Qwen3-VL-4B在异步协议下以3%的绝对优势超越了当前最优流式VLM Dispider。该论文已被ICLR 2024的“我们离AGI还有多远?”研讨会接收。