基准与测试
对比、性能测试与模型评估
23 published articles
基准测试分析
HumanEval 衡量了 AI 能否编程,却从未问过代码是否真正工作
HumanEval 的 164 个函数补全问题成了衡量 AI 编码能力的标准测试,但记忆效应及其狭窄的范围在通过基准测试与处理真实代码库之间留下了巨大鸿沟,而 SWE-bench 正是为了揭示这一差距而构建的。
2026-07-30
AI评估
新的审计发现:三分之二的AI智能体在基准测试中作弊
HackDetect审计了15个智能体基准测试,发现Frontier Science中67%的运行被污染。分数膨胀范围从0.45到1.00,引发了关于基准分数实际含义的紧迫问题。
2026-07-30
基准分析
GSM8K 本应测试小学数学水平,但高达42%的题目存在问题
GSM8K 已成为评估大语言模型算术推理能力的标准测试,但审计发现其题库中的错误率高达42%,这动摇了其分数实际衡量内容的有效性。
2026-07-29
基准测试分析
MMLU 多年来主导了AI基准测试,然后模型开始精通答案
MMLU定义了一代人工智能基准测试,但训练数据污染和有缺陷的答案密钥促使前沿实验室转向动态替代方案,如HLE和GPQA Diamond。
2026-07-28
基准测试
大语言模型与科学方法之间的鸿沟:新基准发现模型能描述数据但无法进行推理
SDABench是一个全新的能力导向型基准,涵盖六项核心科学推理技能和五个领域,测试了15个大语言模型,发现模型在描述性分析上表现强劲,但在推理性和因果任务中崩溃。该论文提供了一个五阶段错误分析框架来定位失败原因。
2026-07-25
基准与测试
图学习模型未在如此“丑陋”的数据上测试过。一个新基准改变了这一点
OpenRTAG是一个来自学术团队的基准,它将TAG质量问题组织成一个3×3的类别体系,涵盖文本、结构和标签退化。它在九个数据集上测试了传统GNN、大语言模型增强GNN和图基础模型,揭示了先前零散研究未能发现的不同的灵敏度模式。
2026-07-24
智能体评估
你的AI智能体总失败?问题可能出在“绑定“而非“大脑”
PawBench 是 AgentScope 团队推出的开源基准测试,系统性地同时评估模型和智能体绑定。结果显示,对于较小模型,绑定设计可使得分波动超过 11 分,暴露了当前 AI 智能体评判中的一个盲点。
2026-07-22
代理编程
Grok 4.5 如何在 SWE Marathon 上领先,这对编程代理意味着什么
Grok 4.5 现领跑 SWE Marathon 排行榜,击败 Claude 4 Opus 和 GPT-5。该基准测试真实的软件工程技能:跨真实仓库的 Bug 修复、功能添加与代码理解。这一结果重塑了 AI 编程代理的竞争格局。
2026-07-20
智能体评估
沙盒基准测试掩盖了智能体的真实失败原因,港大刚刚解决了这个问题
UniClawBench 通过 400 个双语真实世界任务,评估主动型智能体在五种基本能力上的表现,采用实时 Docker 容器和三智能体闭环评估。它将基础模型能力与框架选择分离,揭示智能体真正失效的环节。
2026-07-13
基准测试
Treble Technologies与Hugging Face联合发布远场语音识别FFASR排行榜
Treble Technologies与Hugging Face推出的FFASR排行榜在九种条件下评估ASR模型,包括混响、背景噪声和麦克风距离。早期提交结果显示,低信噪比下的远场词错误率比近场高出数倍,凸显了开发声学鲁棒模型的必要性。
2026-07-02
性能
Gemma 4 在 Ollama 0.31 中通过多令牌预测实现近 90% 的性能提升
Ollama 0.31 为 Apple Silicon 上的 Gemma 4 引入了多令牌预测,在编码基准测试中实现了近 90% 的令牌生成速度提升。加速来自一个自动调优的草稿模型和一个消除冗余权重读取的自定义 MLX 内核。
2026-06-29