基准与测试
对比、性能测试与模型评估
23 published articles
财务推理基准
LLM 会背会计公式,FinIndices 却显示它们不会应用
LLM 能够背诵会计公式,但基于中国真实财务报表构建的基准 FinIndices 显示,它们在应用这些公式时颇为吃力。移除公式提示后,Gemini-3.1-Pro 的准确率从 70.70% 跌至 38.22%;生成表格这一动作本身还会明显削弱模型的推理能力。
2026-08-20
教育中的 AI
AI 辅导工具过度帮助是设计使然。一项新基准量化了这一点
基于 462 次真实辅导环节的基准测试发现,AI 辅导工具默认会替学生完成学习任务。明确的提示词有帮助,但模型仍难以做出核心判断:何时推动、何时搭建脚手架、何时退后一步。
2026-08-10
语音智能体
为什么 Grok 4.1 Fast 在电话通话中胜过更智能的模型
综合排行榜为语音通话选错了大语言模型。BenchLM 的 2026 年排名将延迟放在首位:Grok 4.1 Fast 在 0.54 秒内作答,而最高分得主 Claude Opus 4.6 需要 1.78 秒。快速模型承担对话;推理模型留在后台工具调用中。
2026-08-05
AI评估
旧的AI基准测试已失效。以下是替代它们的方法。
像MMLU和GSM8K这样的静态基准测试已经饱和且受污染。行业已转向动态再生、专家级考试和智能体任务环境,以真实衡量AI能力。
2026-08-04
特别报道:AI评估
2026年AI基准测试现状:静态测试的崩溃与替代系统的构建
2026年AI基准测试全景深度巡览:MMLU、GSM8K和HumanEval为何失效,动态基准测试和专家级考试(如HLE和GPQA Diamond)如何取代它们,代理式测试和锯齿形智能测试揭示了什么,以及人类偏好、LLM评判和生成式可观测性如何完善整个评估堆栈。
2026-08-03
基准测试
新基准显示,前沿AI视觉模型在基础感知任务上表现不佳
PerceptionBench通过3000个问题测试十项原子视觉能力。没有前沿模型突破60%,相似的整体分数掩盖了截然不同的弱点分布。
2026-08-03
基准分析
LiveBench拒绝一成不变, , 这正是关键
LiveBench用不断更新的编程问题、代码库和预测问题池取代了固定的答案集,避开了削弱MMLU和GSM8K的数据污染问题。它是向动态评估更广泛转变的一部分,同行还包括LiveCodeBench、ForecastBench和LLMEval-Fair。
2026-08-03
基准分析
500万次投票,25个Elo分:深入解读无人能撼动的Chatbot Arena排行榜
LMSYS Chatbot Arena通过盲评人类偏好,以Elo量表对模型进行排名,目前近500万张选票将顶级实验室压缩在一个25分区间内。LLM-as-a-Judge方法虽然能扩展此类评估的规模,但其自身存在已记录在案的对冗长和顺序的偏见。
2026-08-02
基准测试分析
在SWE-bench Verified上,顶尖模型达到96%。在企业私有代码上,它们仅勉强超过23%
SWE-bench Verified让前沿模型看起来接近于解决真实世界的软件工程问题,最高得分超过95%。而在私有企业仓库上运行的SWE-bench Pro,将同样的模型得分降至23%或更低,揭示了Verified得分在多大程度上依赖于公共数据暴露。
2026-08-02
基准分析
GPQA Diamond 旨在抵御谷歌搜索,前沿模型如今仍突破 95%
GPQA Diamond 的设计旨在让配备搜索工具的人类也无法可靠回答其专家级科学问题。前沿模型如今已达到 89% 至 96% 的正确率,将该基准推向与已退役的 MMLU 相同的饱和状态。
2026-08-01
基准测试
AI桌面代理在前后测试中失败率达35%
DDB在2013个实例中测试了排序和前后配对任务。顶级模型在无诱饵序列上的精确匹配率为65.1%,有诱饵时为65.7%,揭示了代理在验证状态变化方面的差距。
2026-08-01
基准分析
人类最后的考试以2.7%的得分开场。最佳模型仍无法突破65%
人类最后的考试由CAIS和Scale AI构建,旨在接替MMLU成为最难的通用LLM基准。两年过去了,即使Claude Opus 5领先的64.7%得分也远低于90%的人类专家基线。
2026-07-31