编程基准测试
2 published articles
Qwen / 阿里巴巴Featured4 min read
AI编码智能体
阿里Qwen-Coder-Qoder在自家测试中击败Cursor,Token消耗降低14.5%
阿里新一代编码模型Qwen-Coder-Qoder在Qoder Bench基准测试中击败Cursor Composer-1。生产指标显示代码保留率提升3.85%,工具错误率下降61.5%,Token使用量减少14.5%。该模型通过奖励者-攻击者框架基于真实智能体轨迹进行训练,以防止奖励作弊。
2026-07-23
AI代理4 min read
AI 代理
AI 代理无法在没有构建服务器干预的情况下完成 Java 迁移
IBM 研究院推出了 ScarfBench,这是一个用于评估 AI 代理在企业级 Java 框架迁移中表现的开放基准测试。早期测试显示,前沿代理系统性地对其自身结果过度自信,配置层占据了大部分工作量,并且即使代码转换成功,Docker 缓存等环境问题也常常导致迁移失败。
2026-07-06