← 文章 / AI技术
The Decoder 8小时前 · 2026-08-31 08:16:50 · 0 阅读

AI 最能“以假乱真”的,恰是拿高分所需的技能

Image description

要点

  • 博科尼大学一项针对 1000 多名新生的实验显示,GPT-4o 显著提升了一次商业作业的评分成绩。
  • 一节关于因果推理的短课没有提高传统分数,但推动学生给出了更多样、更不寻常的解决方案。
  • 使用 AI 是否也改善了实际学习仍无答案,因为研究没有安排不使用 ChatGPT 的后续测试。

ChatGPT 显著提升了学生作业的质量,而一项教学干预则鼓励学生给出更多样、更不寻常的解决方案。AI 是否也改善了学习,仍是一个悬而未决的问题。

什么样的学生论文才算好论文?其中哪些部分是 AI 能改进的?博科尼大学一项针对 1053 名新生的随机实验发现,GPT-4o 帮助学生在一次商业作业中拿到了显著更好的成绩。一节关于因果推理的短课虽然没有提高传统分数,但推动学生给出了更多样的解决方案,并更深入地思考原因、假设,以及他们的方案实际上如何奏效。

GPT-4o 大幅提升了评分成绩

2025 年 11 月,一门管理学导论课的 13 个教学班被随机分成四组:对照组、因果推理课组、可使用 GPT-4o 组,或两者兼有。学生需要在最多 180 个词的篇幅内,为学校的纪念品商店撰写营销建议。这节课讲授了连贯的因果逻辑、可证伪性,以及一项拟议行动如何才能带来期望的结果。

使用 GPT-4o 的学生在 1 到 5 分的评分量表上高出近整整 1 分。他们的答案平均多出约两个点子,逻辑更连贯,也更贴近三位领域专家给出的建议。即使研究者在控制了论证质量、点子数量、点子多样性和文本特征之后,GPT-4o 的优势依然可以测量地存在。作者将其归因于更高的内容质量,而非学生掌握了更多知识。

因果推理课没有提高传统分数。这些学生的作业平均得分其实还略低一些,但他们更常解释一项拟议行动为什么应该有效、以及在什么条件下可能失效。他们也生成了更多样、更不同于同龄人所写的点子。

把课程与 GPT-4o 结合,并未给传统分数带来额外提升。在因果推理指标上,两种方式互为补充,而课程组带来的更高点子多样性也保持住了。

ChatGPT access and critical thinking training had complementary effects on student work. ChatGPT alone mainly improved traditional scores, while the teaching intervention fostered causal reasoning and idea diversity. | Image: OpenAI
ChatGPT 使用权与批判性思维训练对学生作业产生了互补效应:仅用 ChatGPT 主要提高了传统分数,而教学干预则培养了因果推理和点子多样性。 | 图片:OpenAI

评分标准偏爱常规答案

更多点子、更连贯的论证,以及单个答案内更高的点子多样性,都与更高分数相关。但更强的可证伪性、对拟议行动如何奏效的更详细解释,以及与其他学生点子更大的偏离度,则与更低分数相关。

这并不意味着原创性在所有情况下都受到惩罚。就这次作业而言,传统分数主要奖励的是那些停留在预期解答空间内、结构良好的答案。作者的结论是:如果多样性和原创性应该被计入成绩,就需要明确地把它们写进评分标准。

但当前的评分体系衡量的是精致程度、结构和完整性,而不是学习与理解。这让 AI 很容易被当作作弊工具来使用。

这项研究没有证明什么

研究没有安排后续测试,让学生在不使用 ChatGPT 的情况下展示他们真正理解或记住了什么。作者明确承认,GPT 带来的优势究竟来自学生真正学到的知识,还是仅仅体现了借助 AI 交出的更好成品,目前仍不清楚。这项研究显示的是本次作业评分成绩的提升,而不是学习的改善。

实验只考察了一所大学的新生在一项狭窄的营销任务上的表现。随机化是在 13 个教学班之间进行的,而非在全部 1053 名学生中逐人进行。

主要的成绩评分来自不知晓每篇文本所属分组的人类阅卷人。因果推理和点子多样性等若干附加指标,则使用 OpenAI 和 Anthropic 的模型进行评估。

OpenAI 提供了这项研究所考察的技术,并参与了研究。多位作者在 OpenAI 任职,或是在研究期间曾受雇于该公司。

其他研究追问:AI 拿走之后还剩下什么

迄今的研究清楚地表明,关键不在于学生是否使用 AI,而在于 AI 是支持了他们自己的思考,还是取代了思考。当它取代思考时,学生就会受损。

一项涵盖超过 50 万条美国大学成绩记录的研究发现,ChatGPT 发布之后,高分成绩增长最多的是写作和编程比重大、作业占分高的课程。受控实验发现,AI 被拿走之后,参与者的表现比对照组更差。在那些主要用 GPT 直接获取答案的人身上,降幅最为陡峭。

一项对中国超过 2.6 万名学生为期 30 个月的研究在更长时间跨度上显示了类似的模式:有了 AI,作业变得更好更快,但考试成绩却下降了。在后来的升学考试中,成绩长期偏低 18% 到 24%。那些尽管能使用 AI、但在作业上花费时间与非使用者大致相同的学生,没有出现同等幅度的下滑。

尽管相关证据越来越多,OpenAI 仍主要把这些结果解读为对评分体系的挑战:如果 AI 能产出精致、堪比专家的作业,那么仅凭最终成品,已难以说明学生真正理解了多少。作者主张"奖励学生拿出体现原创性、推理过程以及对多种路径加以考量的作业,而不只是最常规或最精致的答案"。这或许没错,但改变评分体系,很可能意味着要连同整个教育体系一起改变。

原始来源: The Decoder

评论 (0)