
使用校准稀疏注意力加速文本到视频生成

当前扩散模型在视频生成任务中能产出高质量结果,但推理速度极慢。主要瓶颈在于时空注意力计算——这类基于 transformer 的模型需要处理大量 token 之间的交互。
作者发现一个关键模式:很大比例的 token-to-token 连接产生的分数可以忽略不计,而且这些模式在不同输入和不同查询之间高度重复。即使是局部 token 块内的连接也是如此。基于此观察,他们提出了 CalibAtt,一种无需额外训练的加速方法。CalibAtt 先执行一次离线校准扫描,识别出那些跨输入稳定的块级稀疏性和重复模式,然后为每一层、每个注意力头和每个扩散时间步编译出优化的注意力操作。推理时,只对选中的输入相关连接进行密集计算,用硬件高效的方式跳过未选中的连接。
实验在 Wan 2.1 14B、Mochi 1 以及若干步数蒸馏模型上以多种分辨率进行。结果表明,CalibAtt 实现了最高 1.58× 的端到端加速,在保持视频生成质量和文本-视频对齐的前提下,超越了现有的各类免训练加速方法。


