PRX系列第四部分:我们的数据策略

许多团队在训练大规模文本到图像模型时,往往低估了数据准备的重要性。零散的来源、不一致的标注、冗余的图像不仅浪费算力,还会拉低生成质量。传统做法要么过度追求完美导致多样性丧失,要么放任缺陷导致模型学偏。Photoroom在实践中发现,数据管道的质量直接决定模型输出的上限,而这部分工作往往最不引人注目却最需要精心设计。

他们采取了一套务实高效的管线。首先,用Qwen3-VL-8B为所有图像重新标注详细的长标题,实验证明长标题相比短标题能让FID从21降至13,差别显著。存储方面,经过严格测试后采用JPEG quality 92,相比PNG几乎无感知损失且节省3-10倍空间,训练出的模型在输出质量上无差别。数据探索上,利用Lance格式的列式存储和向量搜索快速了解数据分布,然后转为MDS格式用于流式训练,混合和打乱都非常方便。过滤阶段,仅用标题文本通过Qwen3-8B分类,以跳过列表形式剔除视觉/text/NSFW内容,无需重写整个数据集。去重采用DCT感知哈希,去除近似像素相同的副本,并保留高分辨率版本。

这篇博文最大的价值在于展示了“预训练重广度,微调重品味”的分层理念。数据管道不是一次性的工程,而是需要持续迭代的工具集。例如,跳过列表机制让数据管理和消融实验变得异常灵活,可以随时增减排除集而无须重写数据。JPEG压缩的实测数据打破了PNG必更优的迷信,对大规模训练有实用意义。此外,开放数据集代码和模型,这种透明度值得行业借鉴。未来数据工具对于细粒度微调将更为关键。

PRX Part 4: Our Data Strategy

查看原文