人类最终考试
2 published articles
基准与测试Featured2 min read
基准分析
人类最后的考试以2.7%的得分开场。最佳模型仍无法突破65%
人类最后的考试由CAIS和Scale AI构建,旨在接替MMLU成为最难的通用LLM基准。两年过去了,即使Claude Opus 5领先的64.7%得分也远低于90%的人类专家基线。
2026-07-31
大语言模型与模型4 min read
AI研究
四种人格,一个答案:为何异构推理在最难人类测试中击败了最佳AI
PoTRE将推理分解为四个并行工作的代理,然后动态调和它们的答案。它在人类终极考试上达到49.92%,超过了之前的官方最佳成绩。该方法使用的令牌比扩展的基线更少。
2026-07-24