SWE-bench
3 published articles
基准与测试Featured2 min read
基准测试分析
在SWE-bench Verified上,顶尖模型达到96%。在企业私有代码上,它们仅勉强超过23%
SWE-bench Verified让前沿模型看起来接近于解决真实世界的软件工程问题,最高得分超过95%。而在私有企业仓库上运行的SWE-bench Pro,将同样的模型得分降至23%或更低,揭示了Verified得分在多大程度上依赖于公共数据暴露。
2026-08-02
基准与测试Featured2 min read
基准测试分析
HumanEval 衡量了 AI 能否编程,却从未问过代码是否真正工作
HumanEval 的 164 个函数补全问题成了衡量 AI 编码能力的标准测试,但记忆效应及其狭窄的范围在通过基准测试与处理真实代码库之间留下了巨大鸿沟,而 SWE-bench 正是为了揭示这一差距而构建的。
2026-07-30
人工智能Featured4 min read
AI 模型
Poolside 的 Laguna XS 2.1 在相同硬件下将编程基准测试成绩提升了 5 个点
Poolside 的 Laguna XS 2.1 在保持相同 33B 总参数量-3B 激活量 MoE 架构的同时,将 SWE-bench Multilingual 成绩提升 5.4 个百分点至 63.1%。该版本包含量化检查点、推测解码草稿模型以及 OpenMDW-1.1 许可证,使本地 AI 编程更加实用。
2026-07-21