单层足矣:适配预训练视觉编码器用于图像生成

搞图像生成的人都知道,预训练视觉编码器(比如DINO、SigLIP)学到的特征,跟生成模型需要的latent空间天生不对付。理解任务要的是高维特征,能保留多种可能性;生成任务却需要低维latent,还得精确保留注入的噪声。这种矛盾让之前的工作要么搞复杂的目标函数,要么堆奇怪的架构,效果还不一定好。FAE直接用一个单层注意力层就解决了这个适配问题,把高维特征压缩成低维latent,同时还能保留足够的信息给重建和生成。

FAE的核心设计其实特别简单:搞两个深度的解码器,一个负责从压缩后的latent重建原始特征,另一个拿重建好的特征去做图像生成。关键就是这两个解码器是分开训练的,让压缩过程只关注生成需要的信号。框架本身很通用,既可以用在扩散模型上,也能用在normalizing flows上。实验结果也硬气:在ImageNet 256×256上,带CFG的扩散模型FID做到1.29(800 epochs),不用CFG反而达到了1.48的SOTA。而且80个epoch就能跑到1.70,说明收敛速度也快。

这个工作的启发在于,预训练视觉编码器和生成模型之间的gap,完全可以被一个极简的映射层弥合,不需要复杂的对齐策略。过去大家总想着怎么让VAE或生成模型内部去适应这些特征,但FAE告诉你,把特征提取器和生成器彻底解耦,中间加个轻量转换器,效果反而更好。这暗示了未来生成模型的基础设施可能更简单:直接用现成的理解模型作为特征提取器,生成模块只负责解码,上下游各司其职。对于做产品的人来说,这意味着可以复用已有的视觉特征服务,快速搭出高质量的生成应用,而不用从头训一个大模型。

One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation

查看原文