1 published article
智能体评估
PawBench 是 AgentScope 团队推出的开源基准测试,系统性地同时评估模型和智能体绑定。结果显示,对于较小模型,绑定设计可使得分波动超过 11 分,暴露了当前 AI 智能体评判中的一个盲点。
2026-07-22