AI基准测试
5 published articles
人工智能3 min read
生物安全基准
AI智能体未能通过病原体监测测试:这值得我们警惕
BioSecBench-Surveillance 对16种AI智能体配置进行了100项基因组监测任务的测试。表现最佳的智能体准确率仅约50%。错误并非来自选择了错误的工作流程,而是来自围绕工作流程的其他选择, , 参考数据库、阈值、过滤器等, , 这些人类视为理所当然的细节。
2026-07-25
基准与测试Featured3 min read
代理编程
Grok 4.5 如何在 SWE Marathon 上领先,这对编程代理意味着什么
Grok 4.5 现领跑 SWE Marathon 排行榜,击败 Claude 4 Opus 和 GPT-5。该基准测试真实的软件工程技能:跨真实仓库的 Bug 修复、功能添加与代码理解。这一结果重塑了 AI 编程代理的竞争格局。
2026-07-20
人工智能3 min read
研究分析
委托工作流中的AI文档损坏:新压力测试揭示的问题
DELEGATE-52基准测试评估了AI系统在长期委托文档编辑任务中的表现,发现前沿模型在20次迭代后累积语义保真度损失19%, 34%。Python工作流平均退化率低于1%,但研究强调,可靠的长期委托仍是一个未解决的挑战。
2026-07-04
人工智能3 min read
基准深度解析
ARC-AGI-2:衡量AI系统流体智能的基准测试
ARC-AGI-2通过无法靠死记硬背解决的视觉网格谜题测试AI系统的流体智能。顶级前沿模型现得分75-85%,但70万美元的大奖尚未有人领取。本文深度解析该基准测试的设计、评分机制及当前排行榜。
2026-07-01
开源2 min read
开源
首个无需HTML的开源网络智能体击败GPT-4o
MolmoWeb智能体提供4B和8B两种规模,基于新数据集MolmoWebMix训练,该数据集结合了超过13万个合成和人工演示。它们超越了封闭模型,为开源网络智能体研究设定了新标准。
2026-04-10