AI研究
为什么你的AI导师看不出数学知识是如何层层递进的
北京大学的K12-Bench揭示,即使是最佳语言模型也几乎不理解学校概念之间的关联。57%和46%的得分显示了AI在处理先决条件链、概念分类和视觉基础方面的盲点, , 这些都是真实导师每天使用的技能。

Gemini-3-Flash作为目前可用的能力较强的模型之一,在一个旨在测试AI系统是否理解学校课程知识结构的新基准上仅得57分。Gemma-4-31B-IT得分为46%。这两个数字来自北京大学研究人员构建的名为K12-Bench的23,640道题的测试。
研究人员认为,现有的教育基准侧重于考试答题,而非模型是否理解学生学习路径中概念之间的关系:他们称这种能力为“课程认知”。一个能解二次方程的模型可能不知道因式分解三项式是该技能的先决条件,也不知道该概念同时出现在代数和物理中。
为了创建该基准,团队首先构建了K12-KGraph,这是一个从官方人民教育出版社教材中提取的知识图谱,涵盖小学到高中的数学、物理、化学和生物。该图谱使用九种节点类型和十四种关系类型来捕捉课程结构和视觉基础:例如,哪些概念需要哪些其他概念作为先决条件,实验如何与理论联系,以及图表或方程在官方材料中出现的位置。
从该图谱中,他们推导出K12-Bench,它包含五个任务族:Ground(教材图像中概念的视觉基础)、Prereq(先决条件识别)、Neighbor(概念邻域匹配)、Evidence(将实验证据与主张联系起来)和Locate(在课程时间线中定位概念)。最难的任务是Prereq和Neighbor,两者都需要推理概念之间的关系,而不仅仅是检索事实。这可能就是即使是强大的模型也难以处理它们的原因。
基于课程结构的训练缩小了部分差距
该论文不仅仅是诊断性的。研究人员构建了K12-Train,一个包含7,335个样本的有监督微调语料库,混合了纯文本问答对和多模态视觉问答对。当他们以匹配的2,300个样本预算训练模型时,K12-Train-Text子集在两个下游基准GaokaoBench和EduEval上始终优于来自其他八个主流指令微调语料库的同等大小子集。
对于视觉语言模型,完整的多模态K12-Train集在三个评估基准上取得了最佳总体得分:Gaokao-MM、MDK12-medium和K12Vista。它在使用比DataFlow和WizardLM等完整基线更少的训练样本的情况下做到了这一点。多模态版本还击败了纯文本和纯视觉变体,这证实了文本概念结构和视觉图表为课程理解提供了互补信号。
差距对课堂意味着什么
考试表现与课程认知之间的差异具有直接影响。如果一个AI辅导系统无法告诉学生他们需要先理解分数才能解决线性方程,那它就不是真正的辅导:它只是在回答问题。K12-KGraph框架为开发者提供了一种衡量和训练这种缺失能力的方法。
整个流程是开放的:图谱、基准、训练数据和构建代码均已发布。这一点很重要,因为该基准是基于特定的国家课程(中国的人教版)构建的,但该方法可适用于任何课程。其他国家教材中是否存在类似差距,取决于是否有人为它们构建同样的图谱。
论文的数据表明,差距是真实且可测量的。更大的问题是,缩小差距是否会带来更好的学习成果,还是仅仅产生听起来更具教学性但理解并不比现在更深入的模型。
- 来源 : Why your AI tutor can't see how math builds on itself — 2026-07-23
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。