基准测试
15 published articles
大语言模型与模型1 min read
AI模型发布
MiniMax发布M2.7模型,拥有强大的软件工程和办公生产力能力
MiniMax的M2.7模型在软件工程基准测试和专业办公任务中表现强劲,复杂指令技能遵循率达97%,在GDPval-AA上ELO得分为1495。
2026-07-08
人工智能6 min read
气候科技
AIMIP第一阶段:测试AI气候模型的新基准
AIMIP第一阶段项目,涉及英伟达、谷歌研究院等团队,为AI气候模型提供了开放数据集与评估框架。尽管这些模型能精确重现历史气候模式,但其泛化至未见过条件的能力仍是一大挑战。
2026-07-03
人工智能4 min read
基准测试
牛津大学GauntletBench测试AI代理执行100个真实任务,它们失败了81%
牛津大学的GauntletBench对AI代理提出了100个具有挑战性的真实世界任务。前沿系统的成功率上限为19.1%,远低于人类表现。该基准测试针对五个专业应用中时间感知、图形理解和3D推理等被忽视的能力。
2026-07-01