gsm8k
2 published articles
大语言模型与模型3 min read
人工智能研究
为什么令牌对数概率不是监控AI推理模型的正确信号
Novelis Research表明,令牌对数概率作为量化推理模型的解码器监控器存在缺陷,无法察觉自信循环。他们引入了一种校准的e-CUSUM控制器,结合了不确定性和重复信号,在DeepSeek-R1-Distill-Qwen-1.5B上的GSM8K任务中实现了选择性。
2026-08-03
基准与测试Featured2 min read
基准分析
GSM8K 本应测试小学数学水平,但高达42%的题目存在问题
GSM8K 已成为评估大语言模型算术推理能力的标准测试,但审计发现其题库中的错误率高达42%,这动摇了其分数实际衡量内容的有效性。
2026-07-29