智能体评估
2 published articles
AI代理Featured2 min read
AI代理
没人能说清他们的AI编码代理今天实际做了什么
企业在AI编码代理上投入巨资,却看不到这些代理实际做了什么;衡量其进步的基准可能对公共测试集过拟合;而且它们编写的代码默认未经审查。三个独立问题有着同一个根本原因:采用速度超过了观察工具的发展。
2026-07-30
工具与框架3 min read
AI研究
工具链进化看起来令人印象深刻,直到你在未见过任务上测试它
自动工具链进化本应让LLM智能体变得更好,但一篇新论文认为,许多报道的收益可能来自对公开测试集的过拟合。在实验中,简单的测试时扩展方法匹配或优于进化,而进化后的工具链在未见过的任务上表现有限。
2026-07-27