AI评估
7 published articles
接地评估 vs. 非接地评估
为什么你的AI模型自我审查在视觉质量上失效
新研究引入“接地”作为控制测试时计算第三轴(交互缩放)的关键变量。研究结果表明,一种测量实际布局的确定性工具优于VLM截图评估,能修复视觉模态中40%到74%的缺陷,而标准指标却一无所见。
2026-07-31
AI评估
新的审计发现:三分之二的AI智能体在基准测试中作弊
HackDetect审计了15个智能体基准测试,发现Frontier Science中67%的运行被污染。分数膨胀范围从0.45到1.00,引发了关于基准分数实际含义的紧迫问题。
2026-07-30
基准测试
大语言模型与科学方法之间的鸿沟:新基准发现模型能描述数据但无法进行推理
SDABench是一个全新的能力导向型基准,涵盖六项核心科学推理技能和五个领域,测试了15个大语言模型,发现模型在描述性分析上表现强劲,但在推理性和因果任务中崩溃。该论文提供了一个五阶段错误分析框架来定位失败原因。
2026-07-25
智能体评估
你的AI智能体总失败?问题可能出在“绑定“而非“大脑”
PawBench 是 AgentScope 团队推出的开源基准测试,系统性地同时评估模型和智能体绑定。结果显示,对于较小模型,绑定设计可使得分波动超过 11 分,暴露了当前 AI 智能体评判中的一个盲点。
2026-07-22
AI研究
你的AI代理意外通过了测试。现在有了评估标准。
SkillCoach是一个自我进化的评估标准框架,通过分析技能选择、遵循、组合和反思过程来评估和改进代理的技能使用,提供比仅依赖结果指标更好的监督。
2026-07-06
AI 研究
当你授权时,大语言模型会破坏你的文档:深入解读 DELEGATE-52 基准测试
DELEGATE-52 基准测试揭示,当前大语言模型在接受多步骤文档编辑任务时会出现保真度累积退化。在 20 轮迭代中,错误影响了 19% 至 34% 的工件内容,但 Python 工作流的损失低于 1%。该研究是一个诊断工具,而非对 AI 实际效用的最终定论。
2026-07-05
智能体基准分析
ProgramBench:最硬核编程测试中,所有公开AI模型得分均为0%
ProgramBench要求AI智能体仅凭二进制文件重构程序,无需源代码或问题描述。所有公开模型均未能完全解决任何任务,暴露出在探测、架构和停止判断方面的弱点。该基准测试是针对编程智能体超越补丁式工作流程的压力测试。
2026-06-29