
TutorMoments:AI导师该何时介入?

好的导师知道什么时候该出手,什么时候该让学生自己挣扎。但语言模型被训练成“乐于助人”,在辅导中很容易直接给出答案或步骤,剥夺了学生通过努力思考来巩固理解的机会。现有评测基准往往只看单一行为(比如是否直接给答案),而不考虑当时学生实际需要什么。
Allen AI 推出的 TutorMoments 框架,就是为了衡量 LLM 能否做好这个权衡。它基于 462 个 真实的美国 2-7 年级一对一数学辅导记录(来自 Title I 学校),由 27 位 有经验的数学教师标注了 1500 多个 关键时刻。每个时刻教师判断:导师当时应该选择“脚手架”(让问题更容易入手)还是“推动思考”(鼓励学生深入推理)。评测时,TutorMoments 在关键时刻暂停真实记录,让 LLM 作为导师接手,和一个模拟学生(由另一个 LLM 扮演)对话五轮。然后自动评分管道判断模型的行为是否匹配教师标注的合适类型(适当支架、适当推动、避免过度支架)。
初步结果:在只被告知“好好辅导”的普通提示下,模型普遍倾向于过度帮助,很少主动推动学生思考。当在提示中明确写出“要在帮助与放手之间权衡”后,所有模型得分都有提升,但最佳模型仍有明显空间。作为参照,人类导师在同一时刻的得分为:适当支架 0.458、适当推动 0.182、避免过度支架 0.496——都低于模型在权衡提示下的得分。不过需要注意,数据集特意挑选了辅导本可以更好的时刻,所以人类分数偏低不代表人类差;而且评测的是模拟场景下的行为,不是真实学习效果。
TutorMoments 目前仍是预览版,主要限制包括:自动评测不能替代真实学生对照研究;数据集仅限于美国小学初中数学,由同一组教师标注,结论不一定适用于其他学科、年级或场景。团队正在构建更大规模、多模态的数据集和更强的评分管道。作为开放研究的一部分,他们已发布去标识化的辅导记录、回放代码和模型回放结果,供社区复现与改进。


