
CLaRa:用连续潜在推理桥接检索与生成

现在做RAG(检索增强生成)的人最头疼两个问题:一是检索回来的文档太长,喂给大模型后推理慢得像乌龟;二是检索器和生成器是分开训练的,检索的好坏跟生成质量没关系,优化起来很割裂。CLaRa这篇文章就是为了解决这两个痛点,它不想再在文本层面折腾了,而是把所有东西都塞到连续向量空间里去搞。
CLaRa的做法很直接:先把文档用个压缩模块变成紧凑的向量,这个向量既要保留语义信息,还得能用来检索。为了让压缩向量质量够高,他们搞了个SCP数据合成框架——用问答和同义句监督来训练,这样压出来的向量自带关键信息。然后最硬核的一步:用可微的top-k估计器让梯度从生成器一路流回检索器,这样整个系统就能用单一的语言模型损失端到端训练了。效果很夸张,压缩16倍之后,在多个QA基准上反而超越了那些在文本上精调的基线。
这个思路挺有意思。以前大家总觉得RAG的瓶颈在检索精度上,拼命优化召回率,但忽略了长上下文本身对生成模型的负担。CLaRa证明,连续空间的联合优化可能才是更优雅的解法——压缩掉冗余信息,同时让检索和生成互相指导,不再各自为政。对做AI基础设施的人来说,这种路子意味着未来我们可能不需要为了支持超长上下文而疯狂堆算力,而是通过高效的压缩和端到端学习来解决问题。现在只是第一步,如果将来能推广到多模态任务,那想象空间会更大。


