人工智能
LFM2.5-Encoders 为小模型提供了有力论据:CPU 上比 ModernBERT 快 3.7 倍
Liquid AI 的开放权重 LFM2.5-Encoders 证明了生产环境 NLP 应属于小型模型。230M 编码器在基准测试上胜过 ModernBERT-base,在笔记本电脑 CPU 上约 28 秒扫描完整文档,速度大约快 3.7 倍。

一段时间以来,NLP 领域的默认做法是把生成式模型对准问题,然后为这种便利买单。Liquid AI 的新发布提出了一个更低调的论点:那些全天候运行的任务, , 意图路由、策略检查、PII 扫描、文本分类, , 更适合由运行在笔记本电脑 CPU 上的小型编码器来处理。
LFM2.5-Encoders 今天已在 Hugging Face 上线,采用开放权重,基于 Liquid AI 的 LFM2.5 解码器骨干构建。该公司将每个因果解码器转换为双向编码器,并将结果定位为与自 BERT 以来一直把持这一领域的模型类别竞争。其卖点很简单:你不需要一个数十亿参数的模型来决定一张支持工单是否提到退款,或一份合同是否包含禁止条款。
在上下文窗口的顶端拥有 3.7 倍速度优势
LFM2.5-Encoders 和 ModernBERT 都支持 8,192 token 的上下文,因此比较覆盖整个范围。在 CPU 上,差距就在这里显现。ModernBERT-base 在最大长度下每次前向传播需要超过一分半钟。LFM2.5-Encoder-230M 完成同样的前向传播只需约 28 秒。Liquid AI 称这大约快 3.7 倍,并表示 230M 是这次对比中每个序列长度下最快的模型,甚至在短输入上也领先于更小的 ModernBERT-base。
吞吐量则从反面讲述了同样的故事。随着输入变长,ModernBERT 的吞吐量急剧下降,而 LFM2.5 的曲线上升到一个中段区间后才逐渐回落。据该公司称,实际结果是:一份完整合同、一份文字记录或一条冗长的支持线程,可以在笔记本电脑 CPU 上 30 秒内完成扫描或分类。这就是“有选择地运行的任务”与“可以负担得起对所有内容运行的任务”之间的区别。
基准测试表:14 个模型,17 项任务
Liquid AI 在从 GLUE、SuperGLUE 和多语言分类中选取的 17 项任务上微调了 14 个模型,并报告每个模型在五个保留种子上的平均值。LFM2.5-Encoder-350M 在 14 个模型中排名第四。排在其前面的三个模型都更大,其中一个拥有 3.5B 参数,几乎是它的十倍。230M 模型在表中击败了 ModernBERT-base 和所有 EuroBERT 模型,同时比其中大多数模型更小。这两款模型的得分也高于 Liquid AI 上个月发布的 LFM2.5-Retrievers。
| 模型 | 基准测试排名 | 8,192 token 下的 CPU 前向传播 |
|---|---|---|
| LFM2.5-Encoder-230M | 胜过 ModernBERT-base 和所有 EuroBERT 模型 | 约 28 秒 |
| LFM2.5-Encoder-350M | 14 个中排名第 4,落后于三个更大的模型 | 中段区间,在最长端逐渐回落 |
| ModernBERT-base | 在同一张表中低于 230M | 超过一分半钟 |
这些是该公司自己的数字,且框架和原始结果均已开源,因此这张表是可以核实的,而不是需要凭空相信的东西。
为什么 230M 编码器在常驻任务上胜过生成式 LLM
关键在于经济性。据 Liquid AI 称,微调后的编码器比生成式 LLM 更小、更快、运行成本低得多,而且能运行在公司已有的 CPU 上。效率要归功于架构。每个编码器都从一个 LFM2 解码器骨干初始化,然后通过三项改动变为双向:双向注意力掩码、对称填充的非因果短卷积,以及在训练期间隐藏 30% token 的掩码语言目标。
训练分两个阶段进行。第一阶段在大型网络语料库上以 1,024 token 的上下文构建通用语言能力。第二阶段在完整的数据混合上将上下文扩展到 8,192 token,该公司称这会增强事实、法律和多语言能力。其定位很明确:大量理解任务、分类、路由、抽取、评分, , 这些任务持续运行,而且必须保持低成本。
在 GPU 上,这一格局依然成立,但差距更小。在 Apple GPU 上,ModernBERT-base 在约 1,000 token 以下领先,而 LFM2.5 模型从约 2,000 token 起开始领先。CPU 数据才是这一论点的落脚点:这些任务整天运行,通常都在 CPU 上。
你可以构建什么,以及起步成本
Liquid AI 发布了五个演示,每个都在仅使用 CPU 的 Hugging Face Space 中。零样本提示路由会在一次前向中,将整个提示与以自由文本形式编写的路由通道进行评分。策略检查会将文本与公司规则进行核对(同样使用自由文本),对每个 token 与每条规则进行评分。拼写检查会逐 token 纠正拼写错误。PII 检测可去除 16 种语言中的 40 类个人信息。一个额外的演示将编码器变成掩码扩散聊天机器人,通过迭代式去掩码而不是从左到右来生成文本。
入门成本只是几行 transformers 代码。使用 AutoModelForMaskedLM 加载模型进行掩码 token 预测,或使用 AutoModel 加载主体并附加自己的输出头,用于分类、token 分类、回归或检索。微调因任务而异:该公司表示,在最看重准确率时选择 350M,在硬件更紧张或需要更高吞吐量时选择 230M,并附有一个覆盖 8K 上下文长法律文档的教程。
编码器从未真正消失,只是在生成式模型面前不再流行。Liquid AI 所添加的,正是当初推动团队转向生成式模型的东西:长上下文和快速推理。结果是一个在人们真正能感受到的指标, , 延迟和每份文档成本, , 上展开竞争的模型类别,并以开放权重形式在 Hugging Face 上提供两个尺寸。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。