SevenTnewS

LLM 基准测试

4 published articles

基准与测试4 min read

财务推理基准

LLM 会背会计公式,FinIndices 却显示它们不会应用

LLM 能够背诵会计公式,但基于中国真实财务报表构建的基准 FinIndices 显示,它们在应用这些公式时颇为吃力。移除公式提示后,Gemini-3.1-Pro 的准确率从 70.70% 跌至 38.22%;生成表格这一动作本身还会明显削弱模型的推理能力。

2026-08-20

大语言模型与模型2 min read

AI研究

为什么你的AI导师看不出数学知识是如何层层递进的

北京大学的K12-Bench揭示,即使是最佳语言模型也几乎不理解学校概念之间的关联。57%和46%的得分显示了AI在处理先决条件链、概念分类和视觉基础方面的盲点, , 这些都是真实导师每天使用的技能。

2026-08-02

基准与测试4 min read

基准测试

大语言模型与科学方法之间的鸿沟:新基准发现模型能描述数据但无法进行推理

SDABench是一个全新的能力导向型基准,涵盖六项核心科学推理技能和五个领域,测试了15个大语言模型,发现模型在描述性分析上表现强劲,但在推理性和因果任务中崩溃。该论文提供了一个五阶段错误分析框架来定位失败原因。

2026-07-25

大语言模型与模型4 min read

LLM性能

一家中国视频生成初创公司悄然在编程领域击败了Claude Opus

MiniMax的M2.7在SWE-Pro上得分56.22%,性能接近Claude Opus,同时宣称在复杂任务中技能遵循率达97%,并在办公生产力编辑方面表现优异。该模型标志着从追逐基准测试向实际部署智能体的转变。

2026-07-14