
ChatGPT与批判性思维训练的实验发现

Bocconi大学与OpenAI经济研究合作进行了一项随机实验,超过1000名大一本科生参与,完成一个真实商业案例:为大学商店制定营销建议。学生被随机分为四组:只使用ChatGPT(GPT-4o)、只接受因果推理训练(一种批判性思维形式)、两者都接受、两者都不接受。因果推理训练通过一个包含游戏、例子、问题和反馈的练习来教授因果推理概念,与AI无关。学生作业由人工评分员用5分制评分,同时用文本分析测量想法数量、多样性、因果推理迹象以及与专家方案相似度。
结果是,使用ChatGPT的学生平均评分高出近1分(5分制)。他们的答案包含更多想法,逻辑更清晰,并且与专家推荐更相似。AI帮助新手产出了更专业的结果。但学生并非简单将作业交给AI,他们仍需决定问什么、评估回答并选择最终内容。
因果推理训练产生了更意想不到的效果。接受训练的学生能更清楚地解释想法为何有效或可能失败,但评分并未提高——因为评分标准只衡量是否达到两个标准营销目标(提高商店知名度和使用率)。不过,文本分析发现了评分未捕捉的收益:接受训练的学生在组内产生了更广泛、更独特的想法,与传统评分标准只奖励清晰结构而忽略原创性形成对比。
实验还发现,同时接受ChatGPT和因果推理训练的学生融合了两者优势。他们想法多样性与仅接受训练的学生相当,评分和想法数量与仅使用ChatGPT的学生相似,同时表现出更强的逻辑连贯性和寻找解释、质疑假设的倾向。整体上,该组在所有衡量指标上提升最大。
实验的随机设计让研究者能够分离不同因素的效果,为AI对学生学习影响的研究提供了有价值的贡献。结果也凸显了教育评估的挑战:如果AI能帮助产出专业答案,仅看最终答案就难以判断学生真实理解。学校可能需要调整任务和评分标准,奖励原创性、推理和多元思考,而非仅仅最常规或最精炼的答案。总结来说,AI帮助答案更优质,批判性思维帮助想法更广阔,两者在培养学生中互补。


