AI 模型
Poolside 的 Laguna XS 2.1 在相同硬件下将编程基准测试成绩提升了 5 个点
Poolside 的 Laguna XS 2.1 在保持相同 33B 总参数量-3B 激活量 MoE 架构的同时,将 SWE-bench Multilingual 成绩提升 5.4 个百分点至 63.1%。该版本包含量化检查点、推测解码草稿模型以及 OpenMDW-1.1 许可证,使本地 AI 编程更加实用。

Poolside 今天发布了 Laguna XS 2.1,这是对其面向编程的混合专家模型的增量更新。最大的数据是 SWE-bench Multilingual 成绩提升了 5.4 个百分点,将任务解决率提高到 63.1%。这听起来像是一个小改进,直到你查看该公司的基准测试表:XS 2.1 现在在多项智能体编程测试中击败了活跃参数多 10 到 40 倍的模型。
该模型保持了与 XS.2 相同的架构, , 33B 总参数、每个 token 3B 激活量, , 但该公司表示,它进行了更长时间的训练或使用了更好数据,或者两者兼有。发布说明并未具体说明训练中发生了什么变化,只表示结果是“在 SWE-bench Multilingual 上取得了显著改进,并在终端式任务上表现更强劲”。这种模糊性在模型发布说明中很常见,但在此处很重要,因为基准测试的改进并未带来硬件成本增加。XS 2.1 在 Poolside API 上的价格与 XS.2 相同:每百万输入 token 0.10 美元,每百万输出 token 0.20 美元,每百万缓存读取 token 0.05 美元。对于已经在单张 GPU 上本地运行 XS.2 的团队来说,升级在计算资源方面基本上是免费的。
基准测试实际显示的内容
Poolside 发布了四个智能体编程基准测试的分数:SWE-bench Verified、SWE-bench Multilingual、SWE-Bench Pro 和 Terminal-Bench 2.0。该公司将 XS 2.1 与 Qwen3.6(35B-A3B)、Cohere 的 North Mini Code(30B-A3B)、MAI-Code-1-Flash(137B-A5B)、GPT-OSS-120B 和 Claude Haiku 4.5 进行了比较。在 SWE-bench Multilingual 上,XS 2.1 以 63.1% 的成绩领先于对比组。在 SWE-bench Verified 上,它落后于几个更大的模型。在 Terminal-Bench 2.0 上,它与 Qwen3.6 大致持平。
结论并非 XS 2.1 统治了每个基准测试, , 事实并非如此。在四项测试中,它领先一项,大致持平一项,并落后两项。但它在仅使用 3B 活跃参数的情况下做到了这一切。一个适合单张消费级 GPU 的模型与需要数据中心硬件的产品竞争,这改变了个人开发者和小型团队的本地 AI 编程经济学。

推测解码与本地推理
Poolside 还为每个 XS 2.1 检查点发布了 DFlash 推测器模型。这些是经过训练的小型草稿模型,可以廉价地预测主模型的下一个 token,这种技术称为推测解码。在该公司的内部测试中,将 XS 2.1 与其推测器配对可将每秒 token 数翻倍。对于任何在本地运行模型(延迟是瓶颈)的人来说,这会使编码代理的响应速度产生有意义的差异。
该模型支持 vLLM、SGLang、NVIDIA TensorRT-LLM、Hugging Face transformers 和 Ollama。量化检查点有 FP8、INT4 和 NVFP4 格式,允许用户折中精度与 VRAM。该公司表示,量化 GGUF 检查点和 llama.cpp 支持即将推出。
许可证变更与生态系统布局
Poolside 正在以 OpenMDW-1.1 许可证发布 XS 2.1,放弃了 XS.2 使用的任何许可证。OpenMDW 是由 NVIDIA 和 Linux 基金会支持的开源模型分发框架。该公司称其为“完全许可开放”,并表示此举“减少了开源模型发布的许可摩擦”。对于评估模型的团队来说,这消除了一个麻烦, , 无需为可能最终用于商业产品的模型进行许可证审查。
时机与 NVIDIA 推动标准化开源模型分发方式的更广泛努力相一致。Poolside 的故事不仅仅是关于基准测试数据;它还关乎让这些数据在本地硬件上、在律师会批准的许可证下变得可用。
优先级调整
Poolside 将在一周后从其 API 上淘汰 XS.2。围绕旧版本模型构建专用部署的团队仍然可以通过 Baseten 的模型库访问它,但该公司明确在推动所有人转向 2.1。API 上一周的淘汰窗口很短, , 正在运行评估或回归测试的团队需要迅速行动。
该公司还做出了一项深思熟虑的决定,即聚焦于智能体编程而非通用推理。XS 2.1 专为“在本地机器上进行长时间跨度的任务”而设计,即智能体循环处理的那种多步骤编程任务。它不是一个通用聊天机器人。将其用于编程以外任务的团队可能会发现它比基准测试表显示的要窄。
更广阔的前景
Poolside 的发布契合了一个已经持续两年的趋势:在本地硬件上运行的小型、高效模型正在侵蚀曾经专属于大规模数据中心部署的领域。XS 2.1 并非突破, , 它是一个增量改进,使一个好的论据变得稍微更好。在一个基准测试上 5.4 个百分点的提升是适度的。重要的是,Poolside 在未增加模型规模、API 定价或硬件要求的情况下实现了这一点。这种改进会随着时间的推移而累积,这也是本地 AI 编程如何从一种新奇事物变为默认工作流程的方式。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。