视频评估不靠打分:成对比较才是出路

视频亮点

03:14

Video breaks the text playbook because it has to hold temporal consistency and coherent story across frames.

09:20

Absolute scores collapse to one dimension; pairwise preference held up as a better signal.

13:27

Drift is cheapest to catch early, so the judge runs as a regression gate in CI before users see it.

⭐⭐⭐⭐ 4.2

Character.aiMaor Bril 在本次对谈中直面 AI 生成视频评估的核心困境:静态帧评分标准(如 CLIP)完全抓不住随时间发生的质量崩坏,而人工看片又无法规模化。他详细拆解了视频评估为什么不能照搬文本评估的玩法——因为视频必须同时满足时间一致性、镜头连续性以及叙事连贯性,任何一个维度在帧间塌掉,整体观感就会“翻车”。

Bril 直指“打分”是最大的误区。他观察到,绝对分数最终只能反映画面“氛围”而非实际内容:一段角色僵立四秒的生成视频,单帧打分依然很高,因为它“看起来不错”。他们团队最终的解法是放弃打分,转向成对比较(pairwise preference)——用 Bradley-Terry 损失训练一个 Qwen3-VL 裁判模型,在真实片段和故意破坏的片段之间学习“哪个更像好故事”。这个裁判模型被嵌入 CI 回归门控,每次 AgentX 发版前都会过一遍 eval 墙,校准后的阈值直接拦下漂移严重的生成,用户看到之前就堵住了 slop。他还强调漂移在早期捕获成本最低,尤其是长视频场景。

一个值得持续关注的趋势是“比较型评估”正在替代“打分型评估”。Bril 的方法本质上把生成质量判定从回归任务变成了偏好排序,这跟当前 AI 对齐领域里的 RLHF 思路一脉相承。如果视频生成继续走向长时长、多视角,这种基于成对偏好、嵌入 CI 管道的自动化评估很可能成为工业界的标配。另外,用 Qwen3-VL 这类小型模型做裁判,兼顾了速度和精度,也暗示“评测能力”本身正在产品化——未来每个生成管线都需要一个定制的 eval gate。

Character.aiMaor Bril 在本次对谈中直面 AI 生成视频评估的核心困境:静态帧评分标准(如 CLIP)完全抓不住随时间发生的质量崩坏,而人工看片又无法规模化。他详细拆解了视频评估为什么不能照搬文本评估的玩法——因为视频必须同时满足时间一致性、镜头连续性以及叙事连贯性,任何一个维度在帧间塌掉,整体观感就会“翻车”。

Bril 直指“打分”是最大的误区。他观察到,绝对分数最终只能反映画面“氛围”而非实际内容:一段角色僵立四秒的生成视频,单帧打分依然很高,因为它“看起来不错”。他们团队最终的解法是放弃打分,转向成对比较(pairwise preference)——用 Bradley-Terry 损失训练一个 Qwen3-VL 裁判模型,在真实片段和故意破坏的片段之间学习“哪个更像好故事”。这个裁判模型被嵌入 CI 回归门控,每次 AgentX 发版前都会过一遍 eval 墙,校准后的阈值直接拦下漂移严重的生成,用户看到之前就堵住了 slop。他还强调漂移在早期捕获成本最低,尤其是长视频场景。

一个值得持续关注的趋势是“比较型评估”正在替代“打分型评估”。Bril 的方法本质上把生成质量判定从回归任务变成了偏好排序,这跟当前 AI 对齐领域里的 RLHF 思路一脉相承。如果视频生成继续走向长时长、多视角,这种基于成对偏好、嵌入 CI 管道的自动化评估很可能成为工业界的标配。另外,用 Qwen3-VL 这类小型模型做裁判,兼顾了速度和精度,也暗示“评测能力”本身正在产品化——未来每个生成管线都需要一个定制的 eval gate。

Evaling Video Slop — Maor Bril, Character.ai

查看原文