OpenAI 8 月 27 日公布了一项与博科尼大学合作的随机对照实验结果。1000 多名一年级本科生做同一份真实商业案例,为学校的周边商品店写营销建议。学生按班级随机分成四组,分别是只用 ChatGPT、只接受因果推理训练、两样都有和两样都没有,用到的模型是 GPT-4o。
因果推理训练本身与 AI 无关,内容是通过一个游戏、若干例子、问题和反馈,教学生把原因和结果连起来,并解释一个方案为什么可能奏效、又可能在哪里失败。作业由受过训练的人工评分员按五分制评分,另外用自动文本分析统计每份作业的想法数量与多样性、因果推理痕迹,以及与三位专家写法的相似度。
两种干预的效果不重叠。拿到 ChatGPT 的学生五分制得分高出接近一整分,想法更多,逻辑更清楚,写法更接近专家。接受因果推理训练的学生在评分表上没有拿到更高分,因为那张表只衡量建议是否解决了提高门店知名度和使用率这两个营销目标。文本分析才看出来,这组学生产出的想法范围更宽,彼此之间也更不一样。
两样都有的那组在最多维度上同时受益,想法多样性追平只受训练的组,评分和想法数量追平只用 ChatGPT 的组。OpenAI 由此提出的问题落在评分方式上。学生用 AI 就能交出打磨过的答案时,只看最终成品能反映的理解程度变少了,作业和评价方式可能需要跟着改。