LLM 基准测试
4 published articles
基准与测试4 min read
财务推理基准
LLM 会背会计公式,FinIndices 却显示它们不会应用
LLM 能够背诵会计公式,但基于中国真实财务报表构建的基准 FinIndices 显示,它们在应用这些公式时颇为吃力。移除公式提示后,Gemini-3.1-Pro 的准确率从 70.70% 跌至 38.22%;生成表格这一动作本身还会明显削弱模型的推理能力。
2026-08-20
大语言模型与模型2 min read
AI研究
为什么你的AI导师看不出数学知识是如何层层递进的
北京大学的K12-Bench揭示,即使是最佳语言模型也几乎不理解学校概念之间的关联。57%和46%的得分显示了AI在处理先决条件链、概念分类和视觉基础方面的盲点, , 这些都是真实导师每天使用的技能。
2026-08-02
基准与测试4 min read
基准测试
大语言模型与科学方法之间的鸿沟:新基准发现模型能描述数据但无法进行推理
SDABench是一个全新的能力导向型基准,涵盖六项核心科学推理技能和五个领域,测试了15个大语言模型,发现模型在描述性分析上表现强劲,但在推理性和因果任务中崩溃。该论文提供了一个五阶段错误分析框架来定位失败原因。
2026-07-25
大语言模型与模型4 min read
LLM性能
一家中国视频生成初创公司悄然在编程领域击败了Claude Opus
MiniMax的M2.7在SWE-Pro上得分56.22%,性能接近Claude Opus,同时宣称在复杂任务中技能遵循率达97%,并在办公生产力编辑方面表现优异。该模型标志着从追逐基准测试向实际部署智能体的转变。
2026-07-14