OpenAI 在官方博客公布了与意大利博科尼大学(Università Bocconi)研究人员合作开展的一项教育领域随机实验结果[1]。实验以 1,000 多名本科一年级学生为对象,分别检验了使用 ChatGPT 和接受批判性思维训练对学生成果的影响。两者的作用截然不同,并且相互补充。
分为四组的实验设计
实验场景是博科尼大学 1,000 多名本科一年级学生完成的一项实务课题[1]。题目是为学校周边商品店拟定营销方案,学生按课时随机分入四组:可使用 ChatGPT(GPT-4o)的一组、接受因果推理训练的一组、两者兼有的一组,以及两者都没有的对照组。
这里所说的因果推理训练,锻炼的是把原因与结果联系起来、说明某项方案为何有效或在什么情况下失效的能力。训练内容与 AI 无关,通过游戏形式的练习、实例、提问和反馈来讲解概念[1]。
提交的作业由受过培训的人工评分员按五分制评分表打分,另外还用自动文本分析测量了每份作业的想法数量与多样性、因果推理的痕迹,以及与三位专家所写方案的相似度[1]。
使用 ChatGPT 让分数提高近 1 分
能够使用 ChatGPT 的一组,在五分制评分中拿到了接近高出 1 分的成绩[1]。他们的答案包含更多想法,逻辑更清晰,与专家方案的相似度也更高。换句话说,AI 让新手写出了看起来更专业的成果。
不过研究明确指出,学生并没有把作业整个丢给 ChatGPT。决定问什么、评估返回的内容、挑选哪些内容进入最终提交稿,这些环节仍然由学生自己完成[1]。
训练的效果没有体现在评分表上
更出人意料的是批判性思维训练这一侧。完成练习的学生能够更清楚地说明自己的想法为何可行、在什么条件下会失败,但评分表上的分数并没有提高[1]。
原因在于评分表的设计。这次实验使用的评分表只考察方案在多大程度上回应了两个标准营销目标:提升学校商品店的知名度和使用率[1]。而自动文本分析呈现出另一种效果:完成练习的一组产出的想法范围更广,与同学之间的重复度更低。结构工整的答案能拿到分数,而没有人想到过的创意却拿不到分数,评分表的盲区由此显现。
两项都接受的学生进步范围最广
同时获得 ChatGPT 使用权限和批判性思维练习的一组,叠加体现出了两方面的效果[1]。他们的想法多样性与只做练习的一组相当,评分表分数和想法数量与只用 ChatGPT 的一组相当,此外逻辑连贯性更强,寻找解释、质疑前提的痕迹也更多。从全部测量指标来看,这一组在最广的范围内取得了改善。
教育领域的讨论常被框定为培养独立思考还是培养会用 AI 的二选一,但实验结果指向的方向是:两者各有各的价值。
受到质疑的是衡量尺度本身
这次结果更值得重视的一点,是对学校评价方式的提醒。当 AI 让学生轻松产出看起来专业的成果时,仅看最终答案已经很难判断学生究竟理解了什么[1]。OpenAI 的判断是,原创性、推理过程以及考虑过多种方案的痕迹,都需要纳入评价范围。
博科尼大学于 2025 年 5 月与 OpenAI 达成合作,成为意大利首家向全部 17,000 名学生、教师和职员提供 AI 工具的大学[2]。OpenAI 今年 3 月还公布了用于长期衡量学习成果的 Learning Outcomes Measurement Suite,并将博科尼大学列为开展学习与就业交叉研究的院校之一[3]。这次实验正处于这一系列工作之中。
总结
这次实验的意义在于,用随机化设计把两种性质不同的效果区分开来:使用 ChatGPT 提升了答案的质量与逻辑性,批判性思维训练则拓宽了想法的广度。另一方面,研究对象是同一所大学本科一年级学生的单一课题,周期也有限。结论能否直接套用到其他教育场景,还需要后续的重复验证。
来源:https://openai.com/index/what-students-gain-from-chatgpt-critical-thinking-training
来源:https://www.unibocconi.it/en/news/bocconi-and-openai-join-forces-transform-ai-social-sciences
来源:https://openai.com/index/understanding-ai-and-learning-outcomes/
