STARFlow2:弥合语言模型与归一化流,实现统一多模态生成

现有统一多模态模型在结构上是碎片化的。常见做法要么用离散 token 化图像,牺牲视觉保真度;要么把因果文本生成与迭代扩散去噪拼在一起,造成结构不对称;要么改造 VLM 去生成,降低预训练得到的理解能力。

作者观察到,自回归归一化流本质上就是自回归 Transformer——和 LLM 共享因果掩码、KV 缓存和从左到右的结构。因此它天然适合做真正统一的、连续、单遍、纯因果的多模态生成。

基于这个判断,他们提出 STARFlow2。它搭建在 Pretzel 架构上:把冻结的预训练 VLM 流和 TARFlow 流通过残差跳跃连接垂直交错在一起,两条流共用同一个因果掩码。这样既保留预训练多模态理解,又能生成高保真连续图像,同时在单一因果机制下实现结构统一。

配合深度-浅层流设计和统一的 FAE 潜在空间,STARFlow2 支持缓存友好的交错生成——文本和视觉输出可以直接进入 KV 缓存,无需重新编码。这意味着一套模型内可以同时处理理解、推理和交织的文本-图像生成,避免了现有方法的多阶段拼接。

实验在图像生成和多模态理解基准上均表现出强性能,说明自回归流可以作为统一多模态建模的可行基础。

STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation

查看原文