AI 最能“以假乱真”的,恰是拿高分所需的技能
要点
- 博科尼大学一项针对 1000 多名新生的实验显示,GPT-4o 显著提升了一次商业作业的评分成绩。
- 一节关于因果推理的短课没有提高传统分数,但推动学生给出了更多样、更不寻常的解决方案。
- 使用 AI 是否也改善了实际学习仍无答案,因为研究没有安排不使用 ChatGPT 的后续测试。
ChatGPT 显著提升了学生作业的质量,而一项教学干预则鼓励学生给出更多样、更不寻常的解决方案。AI 是否也改善了学习,仍是一个悬而未决的问题。
什么样的学生论文才算好论文?其中哪些部分是 AI 能改进的?博科尼大学一项针对 1053 名新生的随机实验发现,GPT-4o 帮助学生在一次商业作业中拿到了显著更好的成绩。一节关于因果推理的短课虽然没有提高传统分数,但推动学生给出了更多样的解决方案,并更深入地思考原因、假设,以及他们的方案实际上如何奏效。
GPT-4o 大幅提升了评分成绩
2025 年 11 月,一门管理学导论课的 13 个教学班被随机分成四组:对照组、因果推理课组、可使用 GPT-4o 组,或两者兼有。学生需要在最多 180 个词的篇幅内,为学校的纪念品商店撰写营销建议。这节课讲授了连贯的因果逻辑、可证伪性,以及一项拟议行动如何才能带来期望的结果。
使用 GPT-4o 的学生在 1 到 5 分的评分量表上高出近整整 1 分。他们的答案平均多出约两个点子,逻辑更连贯,也更贴近三位领域专家给出的建议。即使研究者在控制了论证质量、点子数量、点子多样性和文本特征之后,GPT-4o 的优势依然可以测量地存在。作者将其归因于更高的内容质量,而非学生掌握了更多知识。
因果推理课没有提高传统分数。这些学生的作业平均得分其实还略低一些,但他们更常解释一项拟议行动为什么应该有效、以及在什么条件下可能失效。他们也生成了更多样、更不同于同龄人所写的点子。
把课程与 GPT-4o 结合,并未给传统分数带来额外提升。在因果推理指标上,两种方式互为补充,而课程组带来的更高点子多样性也保持住了。

评分标准偏爱常规答案
更多点子、更连贯的论证,以及单个答案内更高的点子多样性,都与更高分数相关。但更强的可证伪性、对拟议行动如何奏效的更详细解释,以及与其他学生点子更大的偏离度,则与更低分数相关。
这并不意味着原创性在所有情况下都受到惩罚。就这次作业而言,传统分数主要奖励的是那些停留在预期解答空间内、结构良好的答案。作者的结论是:如果多样性和原创性应该被计入成绩,就需要明确地把它们写进评分标准。
但当前的评分体系衡量的是精致程度、结构和完整性,而不是学习与理解。这让 AI 很容易被当作作弊工具来使用。
这项研究没有证明什么
研究没有安排后续测试,让学生在不使用 ChatGPT 的情况下展示他们真正理解或记住了什么。作者明确承认,GPT 带来的优势究竟来自学生真正学到的知识,还是仅仅体现了借助 AI 交出的更好成品,目前仍不清楚。这项研究显示的是本次作业评分成绩的提升,而不是学习的改善。
实验只考察了一所大学的新生在一项狭窄的营销任务上的表现。随机化是在 13 个教学班之间进行的,而非在全部 1053 名学生中逐人进行。
主要的成绩评分来自不知晓每篇文本所属分组的人类阅卷人。因果推理和点子多样性等若干附加指标,则使用 OpenAI 和 Anthropic 的模型进行评估。
OpenAI 提供了这项研究所考察的技术,并参与了研究。多位作者在 OpenAI 任职,或是在研究期间曾受雇于该公司。
其他研究追问:AI 拿走之后还剩下什么
迄今的研究清楚地表明,关键不在于学生是否使用 AI,而在于 AI 是支持了他们自己的思考,还是取代了思考。当它取代思考时,学生就会受损。
一项涵盖超过 50 万条美国大学成绩记录的研究发现,ChatGPT 发布之后,高分成绩增长最多的是写作和编程比重大、作业占分高的课程。受控实验发现,AI 被拿走之后,参与者的表现比对照组更差。在那些主要用 GPT 直接获取答案的人身上,降幅最为陡峭。
一项对中国超过 2.6 万名学生为期 30 个月的研究在更长时间跨度上显示了类似的模式:有了 AI,作业变得更好更快,但考试成绩却下降了。在后来的升学考试中,成绩长期偏低 18% 到 24%。那些尽管能使用 AI、但在作业上花费时间与非使用者大致相同的学生,没有出现同等幅度的下滑。
尽管相关证据越来越多,OpenAI 仍主要把这些结果解读为对评分体系的挑战:如果 AI 能产出精致、堪比专家的作业,那么仅凭最终成品,已难以说明学生真正理解了多少。作者主张"奖励学生拿出体现原创性、推理过程以及对多种路径加以考量的作业,而不只是最常规或最精致的答案"。这或许没错,但改变评分体系,很可能意味着要连同整个教育体系一起改变。