基准饱和
4 published articles
基准与测试Featured8 min read
特别报道:AI评估
2026年AI基准测试现状:静态测试的崩溃与替代系统的构建
2026年AI基准测试全景深度巡览:MMLU、GSM8K和HumanEval为何失效,动态基准测试和专家级考试(如HLE和GPQA Diamond)如何取代它们,代理式测试和锯齿形智能测试揭示了什么,以及人类偏好、LLM评判和生成式可观测性如何完善整个评估堆栈。
2026-08-03
基准与测试Featured2 min read
基准分析
GPQA Diamond 旨在抵御谷歌搜索,前沿模型如今仍突破 95%
GPQA Diamond 的设计旨在让配备搜索工具的人类也无法可靠回答其专家级科学问题。前沿模型如今已达到 89% 至 96% 的正确率,将该基准推向与已退役的 MMLU 相同的饱和状态。
2026-08-01
基准与测试Featured2 min read
基准分析
GSM8K 本应测试小学数学水平,但高达42%的题目存在问题
GSM8K 已成为评估大语言模型算术推理能力的标准测试,但审计发现其题库中的错误率高达42%,这动摇了其分数实际衡量内容的有效性。
2026-07-29
基准与测试Featured2 min read
基准测试分析
MMLU 多年来主导了AI基准测试,然后模型开始精通答案
MMLU定义了一代人工智能基准测试,但训练数据污染和有缺陷的答案密钥促使前沿实验室转向动态替代方案,如HLE和GPQA Diamond。
2026-07-28