达特茅斯实测AI判作业:学生嫌它死板,用的人反而考得更好
- 达特茅斯学院在151名统计课学生中试点了AI学习平台Phosphor,作为完全自愿、不计分的教材替代品,由Claude Sonnet 4.6负责给简答题判分。
- 90.2%的学生至少用过一次该平台,是这门课学生和老师自报阅读达标率(10到15%)的6倍以上。
- 完整使用(24课全上完,加3次跨课复习全通过)对比零使用,期末成绩差距在控制先验成绩后为0.71个标准差,不控制则为1.30个标准差。
- 三个模块因学生反馈换了两次考试形式,意外形成一次自然实验:只有需要学生自己作答的简答题模块保留了「多做题多得分」的关系,纯选择题模块这个关系几乎消失。
- 平台自带的AI答疑聊天侧栏全学期只被查询72次,只有14名学生用过一次以上。
把AI判卷塞进教材,九成学生自愿买账
达特茅斯学院统计课团队最近在151名学生中试点部署了AI学习平台Phosphor,把简答题和选择题测验直接嵌进课文阅读流程,由Claude Sonnet 4.6按老师定的评分标准给简答题判分。
这套平台要解决的,是一对现成的矛盾。一边,大学生几乎不读教材:自1980年代以来阅读达标率一路下滑,学生主动抵触阅读任务,客观测量出来的达标率远低于自报。这门课(MATH 010 统计入门)里,学生自报的阅读达标率约15%,老师估计只有10%,个别学生的原话从「压根没人会去读」到「这也要录下来吗」。
另一边,放任学生自由用AI,反而可能伤学习。Bastani等人在近千名学生的随机对照实验里发现,不加约束地给学生用GPT-4,等工具被拿走后,成绩反而降了17%,学生把它当成了拐杖而非学习工具;只有加了教学护栏的版本才避开了这个副作用。与此同时,学生用AI做作业的比例还在猛涨:2026年高等教育政策研究所(HEPI)的调查显示,94%的大学生在计分作业里用过生成式AI,两年前这个数字才53%。
Phosphor(前身名 Spongium)想做的,是把「主动作答」变成阅读体验里的一道结构性环节:读课文的同时就得做AI判分的小测。它的设计前提是,AI最有用的位置是直接嵌进内容传送系统本身,这也呼应了教育研究里有据可查的「doer效应」,稍后会讲到。
读完课文马上考,考完AI立刻判
Phosphor是一个网页应用,课程内容按「课」组织,每一课配一个15到20题的题库。学生读完一课,就在同一页做一次小测;做完,机器和AI当场给分。
CRQ(构造性问答,也就是简答题)不是从几个选项里挑答案,而是让学生自己写一段话作答,再由AI拿老师定的评分标准和参考答案去比对,给分并说明理由。它比选择题多要求一步:把答案用自己的话组织出来。
这套设计押的是「doer效应」:做练习题带来的学习效果,比单纯阅读大好几倍。真正起作用的是「主动作答」这个动作本身,而不是读了多少页。把练习嵌进阅读,就是想把这个效应变成默认发生的事。至于这个押注对不对,下一节的自然实验给出了一个直接的答案。
简答题和选择题,到底哪个在拉分
三个模块本来该用一样的考试形式,结果因为学生反馈,中途换了两次,反而凑出一个近乎对照实验的局面。
模块1(描述统计,9课)用的是简答加选择的混合小测;模块2(概率与抽样,8课)因为大量学生反馈「简答自动判卷太死板、太打击人」,把小测砍成了纯选择题;到了模块3(统计推断,7课),团队分析了考试结果,觉得纯选择题的小测几乎没带来学习收益,又把简答题加了回来。
于是同一批学生、同一门课,在不同模块里经历了不同的考试形式。把「多完成一课」和「考试多得几分」的关系拉出来看,三个模块给出的斜率完全不一样。
三个模块只差在考试形式:简答题在的时候,「多完成一课、期末多得分」的关系就出现;换成纯选择题,这个关系就消失(R²从0.123掉到0.001);换回简答题,关系又回来。真正拉动分数的,是「要自己组织语言写出答案」这个动作。这也和测验效应的研究一致,Kang等人发现,带反馈的简答题在长期记忆上的效果强于选择题(d=0.41)。
点开看三段回归的完整数字(Table 2)
| 对象 | 模块1 → 期中1(简答+选择) | 模块2 → 期中2(纯选择) | 全24课 → 期末 |
|---|---|---|---|
| 全部平台用户 | 1.64x + 77.9,R²=0.123 | 0.90x + 76.0,R²=0.027 | 0.41x + 84.7,R²=0.091 |
| ≥1课完成 | 1.37x + 80.0,R²=0.111 | −0.29x + 84.7,R²=0.001 | 0.45x + 84.0,R²=0.096 |
模块2「全部用户」那一列看起来有正斜率,只是因为把零完成和非零完成拉开了距离;一旦只看有完成记录的学生,斜率就转负。
真正拉分的,是跨课的复习测验
把所有对照排下来,效果最大的一项不是单课小测,而是覆盖整个模块的复习测验。通过全部三次模块复习的学生,期末比没通过的高出7.1分。
Cohen's d 把两组分数的差异,换算成「相当于几个标准差」,方便跨研究比大小。教育研究里 d=0.66 通常算中到大的效应,而多数课堂干预的效应量远小于这个数。下面这根 d=0.66 的柱子,是全文最大的单一效应。
在五项预先设定的对照里,只有「通过全部三次复习」这一项,经过Holm多重比较校正后仍然成立(p<0.0001)。这批学生也是全研究里最挑过的一群人,所以作者把更硬的证据锚在一个更干净的对比上:在模块2内部,通过复习的学生比没通过的期中多6.1分(d=0.39),内容、时间、班级都固定,方向和量级都对得上。
模块复习和单课小测差在几处:它覆盖多课、把不同话题交错在一起、门槛更高(90%)、还能选做简答题。哪一处是关键分不出来,但最可能起作用的,是「跨话题的交错检索练习」,再加上学生自己长出来的间隔复习节奏。
学生自己攒出了「间隔重复」
三次模块复习里,三分之二的重考尝试(237次里的157次)都会回来重考至少一次,而这些重考大多是隔了一段时间才回来,而不是当场再刷。
重考的间隔中位数约1.5天,三个模块的重考率也接近(分别是61%、77%、56%)。这种「隔一天再回来」的行为,正好是记忆研究里推崇的间隔复习,而它是学生在没有强制的情况下自发形成的。
满分参与和零参与,差多少
把「上了多少课」和「通过了几次复习」两条参与线一起放进一个模型,估算满参与和零参与之间的期末差距。这里用的是Tobit模型。
这次期末有27%的学生考到了满分封顶。如果直接用普通回归,这些封顶的学生看起来和其他高分学生没差别,会把真实的分数差距低估。Tobit模型专门处理这种「一批人撞到天花板」的情况,把那些「本该更高、但被满分挡住」的分数折算回来。
结果给出一个区间,取决于要不要把学生的先验水平也扣掉:
不控制其他变量时,满参与(24课加3次复习全过)对比零参与,期末差14.7分(1.30个标准差)。一旦控制住两次期中成绩,差距腰斩到8.0分(0.71个标准差)。
作者强调,0.71这个数是保守下限,不是最佳估计。因为期末考的是同一批内容,两次期中其实是同一个结果的平行测量,把它当控制变量扣掉,等于连Phosphor在学期早期已经产生的学习效果也一并扣掉了。所以合理的效果区间落在0.71个标准差(过度调整)到1.30个标准差(掺了自选择)之间。按教育干预的观察性研究标准,这个量级不小。
点开看 Tobit 三列模型(Table 4)
| 系数 | 仅参与 | +期中1 | +期中2 |
|---|---|---|---|
| 课时完成(0–24) | 0.074 (1.8) | 0.060 (1.8) | 0.058 (1.6) |
| 复习通过(0–3) | 0.584 (1.8) | 0.162 (0.6) | 0.180 (0.7) |
| 期中控制项 | — | 15.55 (8.0) | 11.63 (6.9) |
| 满参与 vs 零参与差(/100) | 14.7 | 8.0 | 8.0 |
| 换算成标准差 | 1.30 | 0.71 | 0.71 |
控制期中后,复习那一项的系数被大幅吸收(z≈0.6),而每课完成的系数基本没动(z≈1.8):复习的收益到期中时已经兑现,课时剂量则还带着独立的学期末信号。
AI答疑侧栏,几乎没人打开
平台还配了一个AI答疑聊天侧栏,用的是检索增强(RAG)技术。它的使用量和测验功能差了两个数量级。
RAG(检索增强生成)聊天助手,会先把学生的问题转成向量,去匹配这门课的内容库,把最相关的段落塞进AI的回答素材里,让AI只根据这门课的内容作答,不跑题、不瞎编。它就装在阅读页的侧栏,随时能问。
整个学期,聊天侧栏一共只被查询72次,只有14名学生用过一次以上。学生给的理由有两个:通用AI工具对他们的问题更快更强;课程内容本身已经讲够了,读的时候没攒够问题,犯不上专门开个聊天框去问。
这个冷清和外界的观察对得上:可汗学院此前也报告过,只有15%的用户会经常使用他们的辅助聊天机器人。把AI直接嵌进「测验加反馈」这条评估主流程,比做成一个外挂聊天窗口,更容易被学生真正用起来。
这研究有多可信,作者接下来想干嘛
作者把局限摆得很清楚。这是一项观察性研究,只在一所精英院校的一门课里试点,没有随机对照。
最大的解释威胁是自选择:愿意多做题的学生,本身可能就更强、更有动力。作者用两次期中成绩去控制先验水平,给出了效果的上下界,但跨模块的课时对比仍然被内容领域、时间点、以及模块复习的同时引入这几件事搅在一起,而「三次复习全过」那组又是全研究里最被挑过的一群人。问卷数据也来自小样本,可能有社会期许偏差。
研究里还浮出一个潜在的权衡:关掉简答题后,小测完成率从49.6%升到58.8%;重新开启后,又跌到33.4%。效果最强的功能,未必是学生最愿意用的功能。
作者下一步计划把课时完成度和课程成绩挂钩,好拿到更干净的「剂量对效果」测量,并在更多学校的入门课里复现。对简答题和选择题做随机分组的对照实验,也在计划里,这样才能把「简答题更管用」这个因果说法坐实。
这些结果表明,高参与度和可测量的学习效果可以同时达到;AI用大规模、按评分标准给简答题判分的这份能力,在教学上是有意义的,而不只是替老师省事。 Phosphor 论文摘要与讨论段(iTextbooks 2026)