SevenTnewS

AI基准测试

19 published articles

Qwen / 阿里巴巴5 min read

开源AI:阿里巴巴开放Max层级

Qwen 3.8-Max:阿里巴巴最强大模型现已开放免费下载

阿里巴巴正在开源其有史以来最强大的模型Qwen 3.8-Max:一款2.4T参数的MoE模型,在SWE-bench Pro、PaperBench和IFBench上超越GPT-5.6 Sol。我们解析了基准测试的注意事项,以及95B活跃参数的开源旗舰对开发者意味着什么。

2026-08-16

Qwen / 阿里巴巴Featured5 min read

开源AI

Qwen3.8-Max 在24小时内独自击败458支人类团队

Qwen3.8-Max在24小时竞赛中独自击败了526支人类团队中的458支,阿里巴巴将于下周开源其权重。到目前为止,每一个数字都是自我报告的,这正是自主性主张值得审视的原因。

2026-08-03

基准与测试Featured8 min read

特别报道:AI评估

2026年AI基准测试现状:静态测试的崩溃与替代系统的构建

2026年AI基准测试全景深度巡览:MMLU、GSM8K和HumanEval为何失效,动态基准测试和专家级考试(如HLE和GPQA Diamond)如何取代它们,代理式测试和锯齿形智能测试揭示了什么,以及人类偏好、LLM评判和生成式可观测性如何完善整个评估堆栈。

2026-08-03

基准与测试Featured2 min read

基准分析

LiveBench拒绝一成不变, , 这正是关键

LiveBench用不断更新的编程问题、代码库和预测问题池取代了固定的答案集,避开了削弱MMLU和GSM8K的数据污染问题。它是向动态评估更广泛转变的一部分,同行还包括LiveCodeBench、ForecastBench和LLMEval-Fair。

2026-08-03

基准与测试Featured2 min read

基准分析

500万次投票,25个Elo分:深入解读无人能撼动的Chatbot Arena排行榜

LMSYS Chatbot Arena通过盲评人类偏好,以Elo量表对模型进行排名,目前近500万张选票将顶级实验室压缩在一个25分区间内。LLM-as-a-Judge方法虽然能扩展此类评估的规模,但其自身存在已记录在案的对冗长和顺序的偏见。

2026-08-02

基准与测试Featured2 min read

基准测试分析

在SWE-bench Verified上,顶尖模型达到96%。在企业私有代码上,它们仅勉强超过23%

SWE-bench Verified让前沿模型看起来接近于解决真实世界的软件工程问题,最高得分超过95%。而在私有企业仓库上运行的SWE-bench Pro,将同样的模型得分降至23%或更低,揭示了Verified得分在多大程度上依赖于公共数据暴露。

2026-08-02

基准与测试Featured2 min read

基准分析

GPQA Diamond 旨在抵御谷歌搜索,前沿模型如今仍突破 95%

GPQA Diamond 的设计旨在让配备搜索工具的人类也无法可靠回答其专家级科学问题。前沿模型如今已达到 89% 至 96% 的正确率,将该基准推向与已退役的 MMLU 相同的饱和状态。

2026-08-01

基准与测试Featured2 min read

基准分析

人类最后的考试以2.7%的得分开场。最佳模型仍无法突破65%

人类最后的考试由CAIS和Scale AI构建,旨在接替MMLU成为最难的通用LLM基准。两年过去了,即使Claude Opus 5领先的64.7%得分也远低于90%的人类专家基线。

2026-07-31

基准与测试Featured2 min read

基准测试分析

HumanEval 衡量了 AI 能否编程,却从未问过代码是否真正工作

HumanEval 的 164 个函数补全问题成了衡量 AI 编码能力的标准测试,但记忆效应及其狭窄的范围在通过基准测试与处理真实代码库之间留下了巨大鸿沟,而 SWE-bench 正是为了揭示这一差距而构建的。

2026-07-30

人工智能Featured3 min read

基准分析

三项AI基准测试在现实性能评估中的错误

MMLU等AI基准测试是模型对比的标准,但近期三起案例显示它们遗漏了关键维度。英伟达的Nemotron-4缺乏独立验证,Celeris-1以速度换准确率,而最佳病原体监测AI仅能完成半数任务。证据表明,我们需要能够衡量实际应用中重要因素的评估框架。

2026-07-29

基准与测试Featured2 min read

基准分析

GSM8K 本应测试小学数学水平,但高达42%的题目存在问题

GSM8K 已成为评估大语言模型算术推理能力的标准测试,但审计发现其题库中的错误率高达42%,这动摇了其分数实际衡量内容的有效性。

2026-07-29

基准与测试Featured2 min read

基准测试分析

MMLU 多年来主导了AI基准测试,然后模型开始精通答案

MMLU定义了一代人工智能基准测试,但训练数据污染和有缺陷的答案密钥促使前沿实验室转向动态替代方案,如HLE和GPQA Diamond。

2026-07-28

← PreviousPage 1 / 2 · 19 articlesNext →