研究解读 · 进化解读

达特茅斯实测AI判作业:学生嫌它死板,用的人反而考得更好

151人实测:简答题比选择题更能拉动分数,AI答疑侧栏却几乎没人用
速览
  • 达特茅斯学院在151名统计课学生中试点了AI学习平台Phosphor,作为完全自愿、不计分的教材替代品,由Claude Sonnet 4.6负责给简答题判分。
  • 90.2%的学生至少用过一次该平台,是这门课学生和老师自报阅读达标率(10到15%)的6倍以上。
  • 完整使用(24课全上完,加3次跨课复习全通过)对比零使用,期末成绩差距在控制先验成绩后为0.71个标准差,不控制则为1.30个标准差。
  • 三个模块因学生反馈换了两次考试形式,意外形成一次自然实验:只有需要学生自己作答的简答题模块保留了「多做题多得分」的关系,纯选择题模块这个关系几乎消失。
  • 平台自带的AI答疑聊天侧栏全学期只被查询72次,只有14名学生用过一次以上。
1 达特茅斯的教材实验

把AI判卷塞进教材,九成学生自愿买账

达特茅斯学院统计课团队最近在151名学生中试点部署了AI学习平台Phosphor,把简答题和选择题测验直接嵌进课文阅读流程,由Claude Sonnet 4.6按老师定的评分标准给简答题判分。

在完全自愿、不计分的前提下,90.2%的学生至少用过一次这个平台;完整参与的学生,期末成绩比零参与的学生最多高出1.3个标准差。
为什么值得看:90.2%这个自愿使用率,是本课程学生和老师自报的教材阅读达标率(10到15%)的6倍以上。它给出的证据是,AI判卷这件事能真正嵌进日常教学、被学生用起来,并且和期末成绩挂上钩。

这套平台要解决的,是一对现成的矛盾。一边,大学生几乎不读教材:自1980年代以来阅读达标率一路下滑,学生主动抵触阅读任务,客观测量出来的达标率远低于自报。这门课(MATH 010 统计入门)里,学生自报的阅读达标率约15%,老师估计只有10%,个别学生的原话从「压根没人会去读」到「这也要录下来吗」。

另一边,放任学生自由用AI,反而可能伤学习。Bastani等人在近千名学生的随机对照实验里发现,不加约束地给学生用GPT-4,等工具被拿走后,成绩反而降了17%,学生把它当成了拐杖而非学习工具;只有加了教学护栏的版本才避开了这个副作用。与此同时,学生用AI做作业的比例还在猛涨:2026年高等教育政策研究所(HEPI)的调查显示,94%的大学生在计分作业里用过生成式AI,两年前这个数字才53%。

−17%
近千人随机对照实验中,不加约束用GPT-4、工具拿走后成绩反降的幅度
94%
2026年大学生在计分作业里用过AI的比例(两年前为53%)
10–15%
这门课学生和老师自报的教材阅读达标率

Phosphor(前身名 Spongium)想做的,是把「主动作答」变成阅读体验里的一道结构性环节:读课文的同时就得做AI判分的小测。它的设计前提是,AI最有用的位置是直接嵌进内容传送系统本身,这也呼应了教育研究里有据可查的「doer效应」,稍后会讲到。

用Phosphor平台
(自愿、不计分)
90.2%
传统教材阅读达标
(学生/老师自报)
10–15%
2 平台怎么运作

读完课文马上考,考完AI立刻判

Phosphor是一个网页应用,课程内容按「课」组织,每一课配一个15到20题的题库。学生读完一课,就在同一页做一次小测;做完,机器和AI当场给分。

读课文 简答小测 模块复习 期末考
1
读一课,页面侧栏显示整门课的目录和每课完成进度。课程内容是团队自己编写的,底子来自开放教育资源。
2
从这一课题库里随机抽4道题做小测。选择题(MCQ)系统自动判;简答题(CRQ)交给 Claude Sonnet 4.6,按老师给每道题定的评分标准和参考答案打分,并给出对错的理由。答到75%以上算「通过」。题库里40%是简答题、60%是选择题。不设阅读门槛,随便读随便考,可无限重考。
3
攒够课时后,触发跨课的模块复习:一次10题,覆盖整个模块的多课内容,要90%才算过,也可无限重考。复习默认只出选择题,学生可以选一个「全题型」模式,把简答题也加进来。
4
课程末尾是纸笔期末考,现场重度监考。全学期对齐两次期中和一次累积期末,本研究就用这三场考试来衡量效果。
CRQ 是什么

CRQ(构造性问答,也就是简答题)不是从几个选项里挑答案,而是让学生自己写一段话作答,再由AI拿老师定的评分标准和参考答案去比对,给分并说明理由。它比选择题多要求一步:把答案用自己的话组织出来。

这套设计押的是「doer效应」:做练习题带来的学习效果,比单纯阅读大好几倍。真正起作用的是「主动作答」这个动作本身,而不是读了多少页。把练习嵌进阅读,就是想把这个效应变成默认发生的事。至于这个押注对不对,下一节的自然实验给出了一个直接的答案。

3 一次意外的自然实验

简答题和选择题,到底哪个在拉分

三个模块本来该用一样的考试形式,结果因为学生反馈,中途换了两次,反而凑出一个近乎对照实验的局面。

模块1(描述统计,9课)用的是简答加选择的混合小测;模块2(概率与抽样,8课)因为大量学生反馈「简答自动判卷太死板、太打击人」,把小测砍成了纯选择题;到了模块3(统计推断,7课),团队分析了考试结果,觉得纯选择题的小测几乎没带来学习收益,又把简答题加了回来。

于是同一批学生、同一门课,在不同模块里经历了不同的考试形式。把「多完成一课」和「考试多得几分」的关系拉出来看,三个模块给出的斜率完全不一样。

完成课数 → 期中分 →
简答加选择的小测下,每多完成一课,期中1约多 1.64 分(有没有把零完成的学生算进来都成立)。 R²=0.123,关系明显。
完成课数 → 期中分 →
换成纯选择题后,在有完成记录的学生里,斜率反而转成轻微负值(−0.29)。 R²=0.001,完成度和分数之间基本没有关系了。
完成课数 → 期末分 →
期末总测覆盖全24课,其中模块1和模块3都是简答题。每完成一课约多 0.4 分,把零完成的学生排除后,这个关系几乎不变( R²=0.091→0.096)。拉动分数的是简答题模块,而不是「有没有参与」这道分界线本身。
核心发现

三个模块只差在考试形式:简答题在的时候,「多完成一课、期末多得分」的关系就出现;换成纯选择题,这个关系就消失(R²从0.123掉到0.001);换回简答题,关系又回来。真正拉动分数的,是「要自己组织语言写出答案」这个动作。这也和测验效应的研究一致,Kang等人发现,带反馈的简答题在长期记忆上的效果强于选择题(d=0.41)。

点开看三段回归的完整数字(Table 2)
对象模块1 → 期中1(简答+选择)模块2 → 期中2(纯选择)全24课 → 期末
全部平台用户1.64x + 77.9,R²=0.1230.90x + 76.0,R²=0.0270.41x + 84.7,R²=0.091
≥1课完成1.37x + 80.0,R²=0.111−0.29x + 84.7,R²=0.0010.45x + 84.0,R²=0.096

模块2「全部用户」那一列看起来有正斜率,只是因为把零完成和非零完成拉开了距离;一旦只看有完成记录的学生,斜率就转负。

4 全文最强的那根杠杆

真正拉分的,是跨课的复习测验

把所有对照排下来,效果最大的一项不是单课小测,而是覆盖整个模块的复习测验。通过全部三次模块复习的学生,期末比没通过的高出7.1分。

Cohen's d 怎么读

Cohen's d 把两组分数的差异,换算成「相当于几个标准差」,方便跨研究比大小。教育研究里 d=0.66 通常算中到大的效应,而多数课堂干预的效应量远小于这个数。下面这根 d=0.66 的柱子,是全文最大的单一效应。

通过全部3次模块复习 → 期末最大
+7.1 · d=0.66
通过模块2复习 → 期中2
+6.1 · d=0.39
≥1次复习通过 → 期末
+4.1 · d=0.37
完成模块2复习 → 期中2
+5.7 · d=0.36
≥1课完成 → 期末
+3.9 · d=0.36

在五项预先设定的对照里,只有「通过全部三次复习」这一项,经过Holm多重比较校正后仍然成立(p<0.0001)。这批学生也是全研究里最挑过的一群人,所以作者把更硬的证据锚在一个更干净的对比上:在模块2内部,通过复习的学生比没通过的期中多6.1分(d=0.39),内容、时间、班级都固定,方向和量级都对得上。

模块复习和单课小测差在几处:它覆盖多课、把不同话题交错在一起、门槛更高(90%)、还能选做简答题。哪一处是关键分不出来,但最可能起作用的,是「跨话题的交错检索练习」,再加上学生自己长出来的间隔复习节奏。

学生自己攒出了「间隔重复」

三次模块复习里,三分之二的重考尝试(237次里的157次)都会回来重考至少一次,而这些重考大多是隔了一段时间才回来,而不是当场再刷。

一小时内立刻回来重考
29%
隔一天以上再回来重考
55%

重考的间隔中位数约1.5天,三个模块的重考率也接近(分别是61%、77%、56%)。这种「隔一天再回来」的行为,正好是记忆研究里推崇的间隔复习,而它是学生在没有强制的情况下自发形成的。

5 参与到底值多少分

满分参与和零参与,差多少

把「上了多少课」和「通过了几次复习」两条参与线一起放进一个模型,估算满参与和零参与之间的期末差距。这里用的是Tobit模型。

为什么要用 Tobit 模型

这次期末有27%的学生考到了满分封顶。如果直接用普通回归,这些封顶的学生看起来和其他高分学生没差别,会把真实的分数差距低估。Tobit模型专门处理这种「一批人撞到天花板」的情况,把那些「本该更高、但被满分挡住」的分数折算回来。

结果给出一个区间,取决于要不要把学生的先验水平也扣掉:

不控制其他变量(含自选择效应)
14.7 分 / 100 · 1.30 SD
控制两次期中成绩后
8.0 分 / 100 · 0.71 SD

不控制其他变量时,满参与(24课加3次复习全过)对比零参与,期末差14.7分(1.30个标准差)。一旦控制住两次期中成绩,差距腰斩到8.0分(0.71个标准差)。

作者强调,0.71这个数是保守下限,不是最佳估计。因为期末考的是同一批内容,两次期中其实是同一个结果的平行测量,把它当控制变量扣掉,等于连Phosphor在学期早期已经产生的学习效果也一并扣掉了。所以合理的效果区间落在0.71个标准差(过度调整)到1.30个标准差(掺了自选择)之间。按教育干预的观察性研究标准,这个量级不小。

点开看 Tobit 三列模型(Table 4)
系数仅参与+期中1+期中2
课时完成(0–24)0.074 (1.8)0.060 (1.8)0.058 (1.6)
复习通过(0–3)0.584 (1.8)0.162 (0.6)0.180 (0.7)
期中控制项15.55 (8.0)11.63 (6.9)
满参与 vs 零参与差(/100)14.78.08.0
换算成标准差1.300.710.71

控制期中后,复习那一项的系数被大幅吸收(z≈0.6),而每课完成的系数基本没动(z≈1.8):复习的收益到期中时已经兑现,课时剂量则还带着独立的学期末信号。

6 被冷落的功能

AI答疑侧栏,几乎没人打开

平台还配了一个AI答疑聊天侧栏,用的是检索增强(RAG)技术。它的使用量和测验功能差了两个数量级。

RAG 聊天助手是什么

RAG(检索增强生成)聊天助手,会先把学生的问题转成向量,去匹配这门课的内容库,把最相关的段落塞进AI的回答素材里,让AI只根据这门课的内容作答,不跑题、不瞎编。它就装在阅读页的侧栏,随时能问。

用过测验功能
(占全体学生)
90.2%
多次用过聊天侧栏
(14人 / 143人)
9.8%

整个学期,聊天侧栏一共只被查询72次,只有14名学生用过一次以上。学生给的理由有两个:通用AI工具对他们的问题更快更强;课程内容本身已经讲够了,读的时候没攒够问题,犯不上专门开个聊天框去问。

这个冷清和外界的观察对得上:可汗学院此前也报告过,只有15%的用户会经常使用他们的辅助聊天机器人。把AI直接嵌进「测验加反馈」这条评估主流程,比做成一个外挂聊天窗口,更容易被学生真正用起来。

7 可信度与下一步

这研究有多可信,作者接下来想干嘛

作者把局限摆得很清楚。这是一项观察性研究,只在一所精英院校的一门课里试点,没有随机对照。

最大的解释威胁是自选择:愿意多做题的学生,本身可能就更强、更有动力。作者用两次期中成绩去控制先验水平,给出了效果的上下界,但跨模块的课时对比仍然被内容领域、时间点、以及模块复习的同时引入这几件事搅在一起,而「三次复习全过」那组又是全研究里最被挑过的一群人。问卷数据也来自小样本,可能有社会期许偏差。

研究里还浮出一个潜在的权衡:关掉简答题后,小测完成率从49.6%升到58.8%;重新开启后,又跌到33.4%。效果最强的功能,未必是学生最愿意用的功能。

49.6%
模块1 小测完成率(简答+选择)
58.8%
模块2 小测完成率(关掉简答后)
33.4%
模块3 小测完成率(换回简答后)

作者下一步计划把课时完成度和课程成绩挂钩,好拿到更干净的「剂量对效果」测量,并在更多学校的入门课里复现。对简答题和选择题做随机分组的对照实验,也在计划里,这样才能把「简答题更管用」这个因果说法坐实。

这些结果表明,高参与度和可测量的学习效果可以同时达到;AI用大规模、按评分标准给简答题判分的这份能力,在教学上是有意义的,而不只是替老师省事。 Phosphor 论文摘要与讨论段(iTextbooks 2026)
来源:Jonah Bard,《Balancing Efficacy and Engagement in Interactive Texts》,达特茅斯学院,iTextbooks'26 第七届智能教材工作坊,2026年6月28日,首尔。文中数据均出自该论文正文与图表(Table 1至Table 4)。这是单所院校单门课的试点观察研究,无随机对照,效应量以0.71到1.30个标准差的区间呈现。