LLM评判
3 published articles
基准与测试Featured5 min read
AI评估
旧的AI基准测试已失效。以下是替代它们的方法。
像MMLU和GSM8K这样的静态基准测试已经饱和且受污染。行业已转向动态再生、专家级考试和智能体任务环境,以真实衡量AI能力。
2026-08-04
基准与测试Featured8 min read
特别报道:AI评估
2026年AI基准测试现状:静态测试的崩溃与替代系统的构建
2026年AI基准测试全景深度巡览:MMLU、GSM8K和HumanEval为何失效,动态基准测试和专家级考试(如HLE和GPQA Diamond)如何取代它们,代理式测试和锯齿形智能测试揭示了什么,以及人类偏好、LLM评判和生成式可观测性如何完善整个评估堆栈。
2026-08-03
基准与测试Featured2 min read
基准分析
500万次投票,25个Elo分:深入解读无人能撼动的Chatbot Arena排行榜
LMSYS Chatbot Arena通过盲评人类偏好,以Elo量表对模型进行排名,目前近500万张选票将顶级实验室压缩在一个25分区间内。LLM-as-a-Judge方法虽然能扩展此类评估的规模,但其自身存在已记录在案的对冗长和顺序的偏见。
2026-08-02