追踪2.6万中学生后发现,使用AI会让考试成绩大幅下滑!

科普中国公众号    2026-09-01 15:58:32

今天的通用AI已经能够解答常见的中小学题目,而老师尽管可以规定课堂上不用AI,却很难知道学生离开教室以后怎么做作业。2025年,中国青少年研究中心做了一次问卷调查,回收了八千多份有效问卷。调查结果显示,超六成受访中小学生用过AI,其中18.3%经常使用;在列举使用方向时,超过七成学生选了“辅助完成作业”。

学生作业是反映学生学习状态的窗口,作业交得更快、分数更高,通常会被当成学得更好。可如果学生用AI帮助做作业,这个推断还成立吗?在AI的帮助下完成作业,学生是否能学到真本事呢?

最近有一项研究发现,当中学生可以自由选择AI工具和用法时,他们的作业交得更快、分数更高,然而闭卷考试成绩却下滑了。换句话说,学生用AI做作业,可能没有真正掌握知识。这个结论虽然并不算出人意料,但反映出的问题却必须慎重对待。

作业变好了,考试却更差

2026年6月,三位研究者发布了一篇工作论文,名叫《生成式人工智能的学习惩罚:来自中国中等教育的证据》。研究对象是中国中部一个100多万人口的县,包括当地5所初中、4所高中,共26811名初一到高三学生,约占全县中学生的90%。研究者取得了最长30个月的校内闭卷月考成绩、周末作业分数和作业平台记录,还取得了一部分学生的县统考及中高考成绩。

数据来自文献丨由经济学人重制,编者汉化

2025年6月,学生接受调查,并回忆自己第一次使用生成式 AI 的月份。截至调查时,约80%的学生报告使用过AI,常用工具包括豆包、DeepSeek、ChatGLM、文心一言和通义千问。在使用AI的学科中,数学最常见,其次是英语。

研究者用的是一种叫“双重差分法”的统计方法。大概可以这样理解:原来李雷和韩梅梅的成绩走势很接近。从某个月起,李雷开始用AI写作业,韩梅梅没有。那么,如果李雷的成绩曲线从这时候开始明显偏离了原来的轨道,而韩梅梅仍然按原来的走势发展,那么这段额外的偏离就可能与AI有关。放大到两万多名学生的规模,研究者比较的正是这种“用AI前后的变化”与“没用 AI 的同龄人同期变化”之间的差距。

这个方法比单纯的“用 AI 前和用 AI 后”的对比更可靠,但仍然不是随机实验。学生是自己决定什么时候开始用AI的,而如果“开始用AI”这件事本身和其他同时发生的变化有关——比如某个阶段学习动力下降,或者是“因为跟不上进度,才想着找AI帮忙”——那么这些因素带来的成绩变化都可能被算在AI的账上。研究者用了长达30个月的连续月考数据去检查两组学生在用AI之前的走势是否确实接近,这能在一定程度上降低这种风险。

研究结果显示,在使用AI六到十个月后,差距就已经很明显了。周末作业分数平均提高约18%;每次作业从领取到提交的时间,平均从约64分钟缩短到45分钟;与此同时,校内闭卷月考平均成绩下降了约20%。

论文还报告了中考和高考结果。在累计使用AI至少两年的学生中,中考成绩约下降24%,高考成绩约下降18%。不过,因为这些数据只有很少几个结果时点,证据比较弱。

来自文献2 编者汉化

论文还发现,自由使用AI带来的学习损失在不同学科和性别间并不均匀。政治和地理等社会科学类科目的损失最大,其次是理科,语文和英语等语言类相对较小;按性别看,男生的降幅比女生更明显。这可能说明,AI导致的成绩下降和具体学科的作业形式,以及不同群体使用AI的方式有关。

研究者注意到,一部分学生从领取作业到提交作业所用的时间很短,得分却很高,而随后的闭卷考试成绩又比较低。作者按照行为特征分类,把作业完成时间少于50分钟的叫做“外包”,少于45分钟叫做“完全外包”。按这种行为分类,使用AI超过五个月的学生中,81%被归入“外包”组,50%被归入“完全外包”组。

学习损失也主要集中在这些“外包”和“完全外包”组上。那些即使用了AI、但完成作业的时间仍然和不用AI的同学相近的学生,学习损失很小。换句话说,问题似乎不只在于“用没用AI”,还在于AI有没有替代学生自己的尝试和思考。

人们常把AI看成一种能力杠杆,以为它会让强者更强。但至少在这项研究中,结果恰恰相反:原来成绩较高的学生,估算出的成绩降幅反而更大。

研究者按照学生尚未使用AI时的平均考试成绩,把他们从低到高平均分成三组。论文估算,开始使用AI六到十个月后,原来成绩排在前1/3的学生,月考成绩下降约24%;原来排在后1/3的学生,下降约16%。把中考和高考合并估算后,两组的降幅分别约为18%和11%。

研究者还发现,自称每周使用AI不足一小时的学生,月考成绩估计下降约5%;自称使用五小时以上者下降约30%。初中生的成绩降幅也比高中生更大。

不过需要注意,这是一项观察性研究,研究对象也局限于一个县。学生何时开始使用AI的数据来自事后回忆,可能存在误差;论文中的百分比是统计模型估算的平均变化,而不是每名学生都会出现的固定降幅。

AI究竟替学生做了哪一步

虽然数字很吓人,但仅凭这项研究,并不能推出“只要使用AI,中学生就一定学得更差”。毕竟,同样是使用AI,实际发生的事情可能完全不同。

让AI查找一个数据、调整文档格式,是使用;让AI检查自己的答案、指出遗漏和错误,也是使用;要求AI提示一个难懂概念、换一种方式讲解,仍然是使用;让模型生成解题步骤、写好作文,直接交出可以复制粘贴的成品,也叫使用。

一种更有用的分类方法,是看AI在作业中扮演什么角色。它可以是资料助手,帮助搜索、整理和排版。它也可以是编辑,评价学生已经完成的答案。它还可以是导师,只给提示、追问和反馈。AI可以是共同作者,和学生讨论不同方案。但AI也可以是枪手,从理解题目到生成答案全部包办,留给学生的任务只剩提交。

因此,与其问学生有没有用AI,不如继续问:是在动笔前就索要答案,还是做完以后请AI检查?AI给的是完整成品,还是继续思考的提示?关掉AI以后,能不能解释答案,再独立完成一道相似的题目?

最后一个问题尤其重要。关掉AI后还能够解释、重做和举一反三,才是学习的重要证据。前面的数据与“助手、编辑、导师”式使用和“枪手”式使用的区别相一致,虽然使用了AI但作业完成时间没有明显变化的学生,学习损失很小。

异种嵌合技术登场

今天的通用AI很擅长快速组织答案,但作业的目的不只是得到答案。学生先尝试、发现自己的薄弱点,再寻找办法、检查错误并重新完成,这些步骤构成了学习过程。

学习科学早就区分了“表现”和“学习”。表现是做当前任务时的速度、正确率和流畅度;学习则是比较持久的变化——过一段时间还能想起来,换一道题还能做出来。更顺畅地完成作业,不一定意味着真正掌握知识;而有些练习虽然在当时更困难,但以后留下的东西反而更多。

学生自己不一定能察觉这种差别AI把答案直接放到屏幕上以后,“眼前已经有答案”很容易被误认为“我已经会了”。

可以把一次学习粗略地看成回路:先尝试,找到自己卡住的地方;复习或搜索,得到一个暂时答案;再验证、发现错误,修改自己的理解;最后重新做一遍。

而AI可以在每一步给提示、出反例、检查错误,也可以直接跳到终点,交出完整成品。如果学生放弃自己尝试,那么答案不会变成学生自己的能力。看懂一道数学题的解答,并不等于合上屏幕后还能做出来。

宽泛地讲,学习的目的是让我们形成一些知识框架和基础信息,能够提出一个好问题,能把新信息放进已有框架中,能看出错误和不合理之处,以及能做出良好的决策。要形成这些能力,学习者需要反复回忆、理解、判断、纠错和迁移。如果AI直接越过这些环节交出答案,学生就失去了形成能力所需的练习。

当然,学习的关键从来不是“动脑越累越好”,无意义的重复也不会因为痛苦就自动变成有效学习。学习的重点是通过获取和理解新信息而改变大脑加工能力。卡住、犯错、检查和重做,正是这些加工能力的改进过程。

这是学习过程中的必要摩擦,而这些摩擦必然不会愉快。所以容易理解,如果评价只看结果而不看过程,最省力的使用方式——使用AI做作业——就会更受学生欢迎。

那么,是否应该一刀切,彻底禁止AI进学校呢?

这恐怕也不是个好答案。在教师规定用法、安排练习并检查学生是否真正掌握的实验中,AI确实可能帮助学习。

一项综述分析了2022至2024年间发表的69篇ChatGPT相关实验研究,发现平均效果为正;另一项聚焦“批判性思维、创造力、问题解决”等高阶思维能力的三层元分析,综合了19项实验研究,也得到中等程度的正面结果。不过,这些研究大多持续时间较短,以大学生样本居多,不同研究之间的结果差异也很大。

这两项研究和之前我们看到的那篇论文都是成立的。两者回答的问题并不相同:一个问“精心设计的AI教学干预有没有用”,一个问“让学生自由使用AI会发生什么”。

AI既能辅助教学,也能代做作业。区别不在于工具,而在于学生是否自己尝试、判断和纠错。

以后总能用AI

为什么还要闭卷考试?

如果一份作业只要求从公开材料中拼装格式固定的文字,那么作业设计显然有问题。禁止使用 AI,也不会让这样的机械劳动变成有效学习。

但由此得出“以后总能使用AI,现在就不必练习独立完成”,又走得太远了。即使使用AI,人也要拥有判断问题是什么、答案大概应当是什么样,以及哪里必须检查的能力。

学校和职场对一项任务的要求并不相同。工作任务要求成品按时交付且质量合格;而学校布置一道题目,则是希望学生在做题过程中更熟练地掌握方法。

职场里常说AI会让“强者更强”。一位资深人士可以把重复步骤交给AI,把精力投入到检查和取舍上;而一个新人如果把同样的工作交给AI,却会失去学习的机会。

所以,AI时代的教育需要把两类任务分开:一些任务可以允许学生与AI一起完成,用来练习提问、选择和核验;另一些任务需要不使用 AI,用来判断学生是否掌握了所需的知识和方法。

可以用三个问题作判断:

1. 这项任务首先要求尽快交付成品,还是要求学生学会一种以后要独立使用的方法?

2. AI替代的是搜索、排版等辅助劳动,还是本应由学生完成的设计、分析、判断和纠错?

3. 不使用AI时,学生能不能解释、重做,并把所学用到一道稍有变化的新题上?

落实到一次具体学习中,可以先让学生独立尝试,写下自己卡住的地方;遇到困难后,再让AI提示、追问、举反例或指出错误,而不是直接交出成品;最后关闭 AI,由学生重新解释、独立完成,再尝试一道变式题。这样,AI提供了认知支架和反馈,而不是替学生踏过整条学习回路。

美国康涅狄格州的柴郡学院正在做类似尝试。一名法语教师会让学生先用AI修改作业,再逐条检查哪些地方确实改对了,哪些虽然变得更“标准”,却抹掉了自己的表达。AI只给出修改意见,学生仍然要自己判断。

这家学校还给不同作业标上“交通灯”:绿灯允许充分使用AI,红灯禁止使用,黄灯则由教师确定哪些工具和步骤可以交给AI。例如,一份作业可以允许使用AI做拼写检查,却不允许直接问聊天机器人。这种方式也许可以给我们一些启示:学生开始做作业前就知道,当前任务是在练习人机协作,还是在检验自己能否独立完成。

中国《中小学生成式人工智能使用指南(2025年版)》已经提出分学段、以人为本和避免过度依赖,明确不应把生成内容简单复制为作业,也不能把AI作为替代性教学主体。这与上述判断大体一致。

进入职场以后,使用AI的理由会更加充分,但人仍然需要知道什么时候可以委托,什么时候必须接过判断权。一项针对管理咨询顾问的实验发现,在模型擅长的创意、分析和写作任务中,AI可以让参与者完成得更快、更好;换成表面相似但模型不擅长的任务,使用AI的人反而更容易答错。研究者把这种忽高忽低的能力边界称为“锯齿状技术前沿”。能判断什么时候可以相信AI,成了重要的能力。

因此,学校不能只培养一种与工具隔绝的考试能力。没有AI时,学生应当能够回忆、解释、判断,并把学过的方法用到新问题上;有AI时,学生还要会提出问题、交叉核验、发现AI的错误或幻觉,并为最终答案负责。

AI可以参与作业,但不能让学习者完全不做作业。判断AI 是否真正帮助了学习,应该看在不使用AI工具以后,学生还会做些什么。作业成绩和完成速度无法证明是否真正学会,只有关掉AI之后,才见分晓。

(科普中国公众号)

责任编辑:韩爽