LLM评估
14 published articles
特别报道:AI评估
2026年AI基准测试现状:静态测试的崩溃与替代系统的构建
2026年AI基准测试全景深度巡览:MMLU、GSM8K和HumanEval为何失效,动态基准测试和专家级考试(如HLE和GPQA Diamond)如何取代它们,代理式测试和锯齿形智能测试揭示了什么,以及人类偏好、LLM评判和生成式可观测性如何完善整个评估堆栈。
2026-08-03
基准分析
LiveBench拒绝一成不变, , 这正是关键
LiveBench用不断更新的编程问题、代码库和预测问题池取代了固定的答案集,避开了削弱MMLU和GSM8K的数据污染问题。它是向动态评估更广泛转变的一部分,同行还包括LiveCodeBench、ForecastBench和LLMEval-Fair。
2026-08-03
基准分析
500万次投票,25个Elo分:深入解读无人能撼动的Chatbot Arena排行榜
LMSYS Chatbot Arena通过盲评人类偏好,以Elo量表对模型进行排名,目前近500万张选票将顶级实验室压缩在一个25分区间内。LLM-as-a-Judge方法虽然能扩展此类评估的规模,但其自身存在已记录在案的对冗长和顺序的偏见。
2026-08-02
基准测试分析
在SWE-bench Verified上,顶尖模型达到96%。在企业私有代码上,它们仅勉强超过23%
SWE-bench Verified让前沿模型看起来接近于解决真实世界的软件工程问题,最高得分超过95%。而在私有企业仓库上运行的SWE-bench Pro,将同样的模型得分降至23%或更低,揭示了Verified得分在多大程度上依赖于公共数据暴露。
2026-08-02
基准分析
GPQA Diamond 旨在抵御谷歌搜索,前沿模型如今仍突破 95%
GPQA Diamond 的设计旨在让配备搜索工具的人类也无法可靠回答其专家级科学问题。前沿模型如今已达到 89% 至 96% 的正确率,将该基准推向与已退役的 MMLU 相同的饱和状态。
2026-08-01
AI 研究
思维链中的泡沫:新基准揭示大语言模型在有效但无用的推理上浪费标记
大语言模型通常生成正确但塞满不必要步骤的推理链。一个新的诊断基准和压缩方法表明,当前评估器完全忽略了这种低效性,而人类编写的推理步骤中可能有半数可被压缩。
2026-07-31
基准分析
人类最后的考试以2.7%的得分开场。最佳模型仍无法突破65%
人类最后的考试由CAIS和Scale AI构建,旨在接替MMLU成为最难的通用LLM基准。两年过去了,即使Claude Opus 5领先的64.7%得分也远低于90%的人类专家基线。
2026-07-31
基准测试分析
HumanEval 衡量了 AI 能否编程,却从未问过代码是否真正工作
HumanEval 的 164 个函数补全问题成了衡量 AI 编码能力的标准测试,但记忆效应及其狭窄的范围在通过基准测试与处理真实代码库之间留下了巨大鸿沟,而 SWE-bench 正是为了揭示这一差距而构建的。
2026-07-30
基准分析
GSM8K 本应测试小学数学水平,但高达42%的题目存在问题
GSM8K 已成为评估大语言模型算术推理能力的标准测试,但审计发现其题库中的错误率高达42%,这动摇了其分数实际衡量内容的有效性。
2026-07-29
基准测试分析
MMLU 多年来主导了AI基准测试,然后模型开始精通答案
MMLU定义了一代人工智能基准测试,但训练数据污染和有缺陷的答案密钥促使前沿实验室转向动态替代方案,如HLE和GPQA Diamond。
2026-07-28
AI基础
为什么AI仍然无法解释自己:一个思考严谨性的框架
谷歌DeepMind的一篇论文引入了一个三部分框架来思考AI中的严谨性:概念性、认知性和操作性。它认为,深度学习的快速发展源于优先考虑性能驱动的迭代而非科学理解,要弥合这些差距需要的不仅仅是更好的基准测试。
2026-07-20
智能体评估
沙盒基准测试掩盖了智能体的真实失败原因,港大刚刚解决了这个问题
UniClawBench 通过 400 个双语真实世界任务,评估主动型智能体在五种基本能力上的表现,采用实时 Docker 容器和三智能体闭环评估。它将基础模型能力与框架选择分离,揭示智能体真正失效的环节。
2026-07-13