
Glance 如何用 AI 将数小时视频转化为竖屏片段

内容平台 Glance 每天处理数千小时的长视频,将其转化为 30-180 秒的竖屏片段,用于手机锁屏。他们面临的核心问题在于:手动裁剪不仅效率低,而且无法理解画面内容——简单居中裁剪会丢失关键人物和对话逻辑。
Glance 的完整视频生成管线分为三个模块:
模块一:视频剪辑 从原始视频提取音频,使用 Google Cloud Speech-to-Text v2 转写文字并获得单词级时间戳。然后用 Gemini 2.5 Flash 分析转录文本,识别最吸引人的 60 秒片段,并确定精确的开始和结束时间戳。最终输出成对的视频短片和对应时间对齐的字幕文件。
模块二:智能重构图引擎 这是技术核心,负责将横屏 16:9 转换为竖屏 9:16。系统按帧分析画面:
– 发言人检测:用 Google Cloud Vision API 追踪面部。关键步骤是“活体检测”——通过计算唇部开合距离和头部转动角度(pan/roll/tilt),区分真人和静态图像(如墙上照片)。根据活跃帧占总帧数的比例打分,比率最接近 1.0 的人被认定为当前发言人。
– 分屏检测:识别采访等双人并排布局。通过两种方式定位分割线:用开源追踪工具 Samurai 持续追踪发言人轨迹,分析其是否长时间停在画面一侧;或用 Vision API 逐帧检测面部位置,结合背景色差和纹理差异判断是否为两个独立视频源。确认分屏后,系统沿分割线切分画面,将左右面板竖向堆叠(左面板在上)。
– 自动重构图:根据场景类型应用不同规则——单发言人时锚定面部居中裁剪;分屏时竖向堆叠;多人场景中聚焦于主要发言人;未检测到人脸时做居中裁剪或加黑边。同时,短片段会与前后段合并以避免闪烁;画面切换时模拟摄像机慢滑效果。
模块三:后期与品牌处理 使用 MoviePy 叠加字幕——单词级时间戳支持“卡拉 OK 式”高亮显示(当前词用芥末黄高亮在黑色背景上)。通过 PNG 遮罩层和 Logo 叠加实现品牌一致性。
这套管线的关键洞察在于,它将视频剪辑从“裁剪画面”升级为“理解内容”。系统不仅要知道画面里有什么,还要判断谁在说、该看谁、对话逻辑如何布局。Glance 日处理量预计将从 3500 个视频增长至 10000 个以上,这套自动化方案是他们保持规模与质量兼得的必要条件。


