教育中的 AI
AI 辅导工具过度帮助是设计使然。一项新基准量化了这一点
基于 462 次真实辅导环节的基准测试发现,AI 辅导工具默认会替学生完成学习任务。明确的提示词有帮助,但模型仍难以做出核心判断:何时推动、何时搭建脚手架、何时退后一步。

会解题的数学模型不等于会教数学的模型。二者差距在于一个贯穿整节课的判断:这名学生此刻是需要支持,还是需要被推一把、自己去完成推理?TutorMoments 背后的团队本周发布了这一基于 462 份真实一对一数学辅导记录构建的基准,并给出了一个直白的发现:在默认本能驱使下,语言模型会过度帮助。
为什么现有辅导基准一直未能捕捉关键时机
大多数现有的 AI 辅导工具评估只奖励一种固定行为,要么是绝不给出答案,要么是始终提供提示。正如 TutorMoments 作者所言,问题在于这两种方式都无法在所有情境下适用。好的辅导是一种判断:在当下、针对这道题,这名学生需要什么;而固定评分标准看不到学生。
这一盲区正在整个领域中显现。北京大学评估模型对学校数学理解程度的 K12-Bench 发现,即使是最强的模型也几乎无法把握概念之间的关联,在围绕先修链和概念分类法(真实辅导教师日常使用的连接组织)构建的题目上分别只得到 57% 和 46%。SDABench 测试了 15 个模型在六种科学推理技能上的表现,发现它们在描述性问题上表现出色,但在推断性和因果性问题上则明显失灵。规律是:模型在“知道什么”上越来越强,而更难的技能, , 决定在特定情境下如何运用这些知识, , 仍然没有被测量。
与此同时,利害关系变得更高。达特茅斯学院一门课程中,AI 辅导工具的效果量高达 1.30 个标准差,带来了真实课堂中罕见的学业增益, , 典型干预措施的效果量通常在 0.4 个标准差左右。该领域对 AI 辅导越有信心,就越需要关注:逐时判断恰恰是现有基准一直没有测量的东西。
只被告知“好好辅导”时,模型急于帮助
TutorMoments-Preview 包含 462 份去标识化的纯文本辅导记录,来自美国一个高剂量辅导项目,主要服务 Title I 学校,学生为 2 至 7 年级。27 名教师标注员标记了 1500 多个关键时刻,每一个都是辅导教师需要权衡的决策点:是搭建脚手架(让问题更容易理解),还是推动严谨性(要求更深入的思考)。
该评估会在某个关键时刻暂停辅导记录,将会话交给语言模型,由它对一名模拟学生进行五轮辅导。评分流程以教师对每个时刻的多数标注为起点,检查模型是否在需要支持时搭建脚手架、在学生准备好了时推动严谨性,并避免过度搭建脚手架。
七个模型分别在该设置下运行了两次:一次使用简单提示,让它们运用自己所知的好辅导方法;一次则明确说明了这一权衡。结果中最清晰的模式是提示词的重要性。每个模型在明确提示下得分都更高,这表明模型默认的“乐于助人的助手”行为本身不足以实现好的辅导。但明确说明权衡只能走到这一步。模型在做出判断时的可靠性仍差异巨大,与始终契合当下情境的人类辅导之间的差距并未缩小。当模型确实推动严谨性时,它们依赖的手段很单一,大多是要求学生解释自己的答案;而人类辅导教师会使用更多样化的策略,并且更有可能退后一步,让学生独立完成。
人类参考得分更低。这不是重点
接下来这部分可能会被断章取义。在同样的决策点上以同样的方式评分,记录中的人类辅导教师得分低于模型:适当搭建脚手架为 0.458,适当推动严谨性为 0.182,避免过度搭建脚手架为 0.496,均为满分 1 分。在了解评估要求的提示词下,模型得分高于这些数值。
| 决策点上的行为 | 人类辅导教师(同一评分标准) |
|---|---|
| 在需要支持时搭建脚手架 | 0.458 |
| 在需要时推动严谨性 | 0.182 |
| 避免过度搭建脚手架 | 0.496 |
作者明确表示,这并不是在声称 AI 辅导工具优于人类教师。标注者寻找的是辅导本可以做得更好的时刻,因此数据集集中于错失的机会,而非理想实践。还有两点提醒:这些分数衡量的是辅导行为,而非学习效果,因为回放是针对一名模拟的“oracle”学生进行的;此外,严谨性是一个更嘈杂的信号,被标注的严谨性时刻较少(260 对 738),而且评分流程对推动严谨性的检测可靠性也较低。
对产品团队而言,最关键的杠杆是提示词设计。明确说明权衡能提高所有分数,这说明通用助手的开箱即用式“乐于助人”并非辅导的正确默认行为。同一结果也警告说,更好的提示词并不是解决方案:K12-Bench 的发现强化了这一警告,因为一个不追踪概念之间先修关系的辅导工具,会在 TutorMoments 所测量的这个决策上遇到困难。
商业背景是真实存在的。基于 GPT-4 构建的 Khanmigo 已展现出潜力,但公开的受控效果数据有限;Duolingo 的 AI 课程以及 Querium、Photomath 等初创公司也推出了辅导功能,结果参差不齐。一个能告诉 AI 辅导工具“你正在替学生做本应由他们自己完成的事”的基准,是整个品类都需要的,即使它只测量决策点上的行为。作者自己也划清了界限:自动化评估不能替代针对真实学生和真实学习效果的研究;该数据集范围狭窄、基于美国、以中小学数学为主,且由同一批教育工作者标注。他们正在向更大的多模态数据集和更强的评分流程推进,并已发布辅导记录、回放代码和模型回放,任何人都可以重新运行评估。
到目前为止,结论相当清晰。该领域终于有了一件能够观察辅导教师做判断的工具,而最初的读数表明:模型会做数学题,却错过了教学。下一个值得关注的基准将追踪真实学生,因为关于学习者需要多少帮助的判断,只能在真实学习发生的地方得到验证。
- 来源 : AI tutors over-help by design. A new benchmark quantifies it — 2026-08-07
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。