基准测试
2 published articles
人工智能Featured5 min read
AI研究
制约AI智能体的瓶颈不是探索,而是评估
Hugging Face的两篇新论文从相反的方向着手解决同一个核心问题:如何让AI智能体可靠地评估自身行为。AJ-Bench构建了一个针对环境感知型评判智能体的基准测试,而HeavySkill则认为最好的评判者存在于模型参数内部。
2026-07-17
基准与测试4 min read
智能体评估
沙盒基准测试掩盖了智能体的真实失败原因,港大刚刚解决了这个问题
UniClawBench 通过 400 个双语真实世界任务,评估主动型智能体在五种基本能力上的表现,采用实时 Docker 容器和三智能体闭环评估。它将基础模型能力与框架选择分离,揭示智能体真正失效的环节。
2026-07-13