从图像集合推断视觉概念

当前视觉语言模型(VLM)能理解复杂文本指令,但面对纯视觉示例时却表现得像个盲人。给你几张猫的图片,再给一张狗的图片,让它生成一张“像猫一样狗”的图片?它大概率会忽略视觉示例,直接生成一张狗。这就是VICIS任务暴露的问题:VLM无法从图像集合中推断共享概念并应用到新输入。即使是最先进的模型,也经常出现忽视视觉上下文或产生偏见生成的情况。

作者的方法很直接:先定义一个任务VICIS,然后设计一个训练框架和架构。核心是让模型学会从少量示例图像中提取出概念特定的嵌入向量,再把这个向量和查询图像的特征结合起来,生成新的图像。这样生成的图像既保留了示例中的概念,又匹配查询的形状或内容。实验证明,这个方法在合成数据和ImageNet/WordNet上都表现更好,生成结果更准确、更多样,而且能泛化到训练时没见过的概念,甚至能处理素描这样的不同模态

这个工作让我想到一个关键点:下一代AI交互可能不再需要自然语言作为中介。我们完全可以“用例子说话”,就像给设计师看几张参考图就能得到想要的风格。这种能力对AI Agent、个性化生成、甚至人机协作都有本质提升。它迫使模型真正理解视觉上的“同类”关系,而不是依赖语言标签的捷径。未来,多模态模型可能需要把“视觉推理”提升到与“语言理解”同等重要的地位。

Show Me Examples: Inferring Visual Concepts from Image Sets

查看原文