端侧 AI 智能体
LFM2.5-2.6B:性能超越四倍于自身规模模型的微型智能体
Liquid AI 的 LFM2.5-2.6B 将智能体模型压缩到 2.6B 参数、内存占用低于 2.5 GB,并在所有测试过的指令跟随基准上位居榜首。它在笔记本电脑上运行速度为 220 tokens/秒;编码是唯一明显的短板。

构建实用 AI 智能体的竞赛在很大程度上是一场规模游戏:更大的模型、更长的上下文、更多的工具参与其中。Liquid AI 则押注相反的方向。其新的 LFM2.5-2.6B 将智能体技术栈压缩到 26 亿参数,且内存占用低于 2.5 GB。在公司自己的评估中,该模型在工具使用和多步智能体任务上可与规模四倍于自身的竞争对手一较高下,并在指令跟随方面击败了所有对手。
这是其宣传点,而且这一次背后有数据支撑。Liquid AI 发布了与四个更大模型对比的完整基准测试:gemma-4-E2B-it (5.1B)、gemma-4-E4B-it (8B)、Qwen3.5-4B (4.7B) 和 Qwen3.5-9B (9.7B)。LFM2.5-2.6B 是该组中规模最小的模型。
该组中规模最小的模型,在指令跟随上领先
Liquid 报告称,其 2.6B 模型在该套件的每个指令跟随基准测试中都位居第一,并且在除 BFCLv4 之外的每个工具使用基准测试中都排名第一, , 在 BFCLv4 上,仅有 9.7B 的 Qwen 略微领先。
| 基准测试 | LFM2.5-2.6B (2.6B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|---|
| AA Omniscience | -29.50 | -74.47 | -49.03 | -54.30 | -50.43 |
| AIME25 | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
| IFBench | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
| Multi-IF | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
| BFCLv4 | 56.88 | 36.98 | 46.39 | 50.56 | 60.13 |
| ToolSandbox | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
| BrowseComp+ (OpenClaw) | 26.89 | 8.31 | 15.90 | 24.46 | 27.23 |
在智能体任务上,局面更加均衡:LFM2.5-2.6B 击败了两款 Gemma 模型,并与 Qwen 系列持平,同时还取得了该组中最高的 AA Omniscience 分数。Liquid 将结果总结为在知识方面领先、在数学方面接近。这些是公司自身的数据,未经第三方验证,但其中呈现的差距并不小。
四个训练阶段,一个黑盒 harness 技巧
LFM2.5-2.6B 从一个预训练规模约 34 万亿 tokens 的基础模型出发,经过一个将上下文窗口扩展到 128K 的中期训练阶段。智能体行为来自后训练,该过程分为四个阶段。
- 两轮监督微调,重点偏向智能体数据:工具使用、网络搜索和 harness 轨迹。
- 每个领域一个专家教师:数学、代码、工具使用等。
- 多领域在线策略蒸馏,将教师模型合并回一个学生模型。
- 智能体强化学习,多轮 RL 在真实的智能体 harness 中运行,使模型在工具、系统提示和多轮任务环境中学习。
值得注意的工程细节在最后一个阶段。Liquid 将模型优化、推理和环境执行分离,然后在黑盒 harness 中运行智能体,并点名 OpenClaw 和 Hermes Agent 作为示例。一个 Harness Proxy 拦截 harness 的模型调用,并记录训练循环所需的 token 级轨迹,而无需修改 harness。这正是 OpenForgeRL 背后的设计, , 我们一直在跟踪报道的开源框架:一个轻量级代理将 harness 调用转化为标准 RL 代码库的训练数据,每次 rollout 都在自己的 Kubernetes 容器中运行。
这种做法的代价是,harness 本身成为训练面的一部分。OpenForgeRL 的工作记录显示,某些 harness 比其他 harness 更难学习,而且 RL 主要提升可靠性,而错误恢复等关键能力仍然薄弱。
速度快到可用于手机,成本低到可部署集群
接下来是原始速度。Liquid 报告称,在 Apple M5 Max 上解码速度为 220 tokens/秒,在 AMD Ryzen AI Max+ 395 上为 113 tokens/秒,两者内存占用均低于 2.5 GB。公司表示,在 30 tokens/秒的速度下,该模型足以在手机上运行一个能干的智能体。在单块 H100 的高并发下,它每秒可输出近 15,000 个 tokens,每天约 13 亿 tokens。
发布首日即支持 llama.cpp、MLX、vLLM、SGLang 和 ONNX,模型可通过 transformers 5.0.0 或更高版本加载。LFM2.5-2.6B 和 LFM2.5-2.6B-Base 变体均已在 Hugging Face 上发布,一个 WebGPU 演示可在浏览器中运行研究型智能体,Liquid 还发布了在 OpenClaw、Hermes Agent 和 Pi 等 harness 中运行本地智能体的指南。
编码是更大模型展现其规模价值之处
规模优势唯一发生逆转的地方是编码。在 LiveCodeBench v6 上,除 5.1B Gemma 外,所有竞争对手的得分都高于 LFM2.5-2.6B 的 59.41。Liquid 表示,更大的模型在这方面保持着明显领先优势,并建议用户选择更大的模型。这是一个值得细读的让步,因为其他实验室正在将编码作为智能体训练的核心。MiniMax M3, , 我们的报道发现其在真实代码上超越了 GPT-5.5, , 通过交互式用户模拟器,基于多轮交互序列进行训练。Liquid 则选择了另一条路:小型、通用、快速,并且明确不面向编码。
两者都押注于同一个论点:智能体行为来自模型的训练方式,而不仅仅取决于模型规模。Liquid 称此次发布是迈向“随处运行的 AI”的一步。对于本地硬件上的工具使用、指令跟随和多步任务,这些数字让这一主张显得可信。至于其他任务,总有一个更大的模型可用。
- 来源 : LFM2.5-2.6B: the tiny agent that outruns models 4x its size — 2026-08-04
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。