LFM2.5 编码器:长上下文推理速度提升 3.7 倍

Liquid AIHugging Face 上发布了两款新的编码器模型:LFM2.5-Encoder-230MLFM2.5-Encoder-350M。它们的核心卖点是:在输入变长时保持推理速度,即便在 CPU 上也能高效运行。

这两款模型源自上个月发布的 LFM2.5-Retrievers 同一系列,但定位更通用。它们采用掩码语言(masked-language)目标进行预训练,适用于分类、词级任务和搜索等多种场景。这区别于专门的检索器,是作者有意为之——因为编码器驱动着大量生产级 NLP 应用(分类器、意图路由、安全过滤器),这些任务通常全天候运行在 CPU 上,且输入越来越长。

模型构建上,它们从各自的 LFM2 解码器主干(LFM2.5-230M 和 LFM2.5-350M)初始化,然后通过三项改动转变为双向编码器:双向注意力掩码(每个 token 能看到其两侧而非仅左边的 token);非因果短卷积(对称填充以混合两侧邻居);以及 30% 的掩码训练。训练分为两个阶段:先在 1024-token 的短上下文上进行通用语言能力训练,再扩展到 8192 token 的长上下文中强化事实、法律和多语言能力。

基准测试结果:LFM2.5-Encoder-350M 在 14 个模型(覆盖 GLUE、SuperGLUE 和多语言分类任务)中排名第四,排在它前面的三个模型都更大(包括一个几乎大 10 倍的 3.5B 模型)。LFM2.5-Encoder-230M 则超过了 ModernBERT-base 和所有 EuroBERT 模型,且体积比其中大部分更小。作者报告了五次不同种子的均值,确保结果稳定。

推理速度是亮点。在 CPU 上,LFM2.5-Encoder-230M 在所有序列长度下都是最快的,甚至在短输入时比更小的 ModernBERT-base 还要快。当输入长度增加到 8192 tokens 时,ModernBERT-base 前向传递需要超过一分钟半,而 LFM2.5-Encoder-230M 只需约 28 秒,快了约 3.7 倍。这意味着开发者可以在笔记本电脑的 CPU 上,用不到 30 秒扫描或分类一份完整的合同、转录文本或长支持线程。在 GPU 上,模式相似但差距缩小:在苹果 GPU 上,ModernBERT-base 在约 1K tokens 以下领先,之后 LFM2.5-Encoders 反超。

Liquid AI 还提供了几个基于微调模型构建的 CPU demo:零样本提示路由(定义自由文本路由通道,模型一次打分)、零样本策略检查(按公司规则逐 token 打分)、拼写检查、PII 检测(覆盖 16 种语言的 40 种个人信息)以及一个遮罩扩散文本生成的彩蛋。

使用上,对于分类、路由、提取或评分等高容量理解任务,微调后的编码器比生成式 LLM 更小、更快、成本更低。作者建议:精度优先选 350M,硬件受限或追求吞吐量选 230M。加载和微调均通过 Hugging Face Transformers 库进行,支持 Flash Attention 2。

两款模型均为开放权重,已在 Hugging Face 上直接可用。

LFM2.5-Encoders for Fast Long-Context Inference on CPU

查看原文