AI应用与工作流

AI教学真的能提高成绩吗?证据、试点与学习成效评估

AI可能提高特定任务的学习成效,也可能只提高有工具时的练习表现。判断是否有效,必须区分无辅助测验、延迟保持、迁移、教师实施与数据风险。

从获得AI访问、实际参与、行为改变到独立测验、延迟保持、迁移与长期结果的学习成效因果链
本页目录
  1. 先问:你说的“成绩提高”是哪一种结果?
  2. AI 教学不是一种干预,而是一组完全不同的做法
  3. 怎样读一篇“AI 提高学习成绩”的研究?
  4. “统计显著”为什么不等于“值得上线”?
  5. 试点中最容易破坏结论的五种情况
  6. 从试点扩展到全校,还要重新计算什么?
  7. 没有效果或出现负面结果,怎样处理才算真正循证?
  8. 为什么现有研究会同时出现正面和负面结果?
  9. 正面研究应怎样翻译成学校决策?
  10. 校内试点怎样设计,才知道 AI 是否有效?
  11. 护栏应该限制什么,而不是只过滤敏感词?
  12. 学生数据与权益如何纳入成效评估?
  13. 教师、家长和学生分别看什么?
  14. 常见问题
  15. 一项随机对照试验显示有效,就能全校上线吗?
  16. 学生喜欢使用,是否说明学习效果好?
  17. 练习分数上升但无辅助测验没有变化,算成功吗?
  18. 没有条件随机分组怎么办?

一句话答案:AI 教学可能提高特定任务中的学习成效,也可能只让学生在有工具时做题更快,甚至削弱随后无 AI 的独立表现。判断“是否有效”必须同时说明学生、学科、AI 到底做了什么、与什么对照、测量发生在何时,并至少检查无辅助测验、延迟保持、迁移、提示依赖、教师实施和数据风险。

AI教学从获得访问、实际参与、行为改变、独立测验、延迟保持到迁移与长期结果的学习成效因果链
“有账号”“使用时间长”或“练习分数高”只是中间环节,不能直接证明学生已经独立掌握。原创图:兰塞 AI 编辑部。

本文给学校管理者、教师、家长和学习产品团队一套读研究与做试点的方法,不给出“某款工具必然提分”的承诺。单项研究的结果只适用于其样本、任务、教学设计、对照和测量时间。研究与政策复核日期为 2026 年 7 月 18 日

先问:你说的“成绩提高”是哪一种结果?

结果层级 它能说明什么 不能说明什么
工具可用 学生有账号、设备和网络 学生实际使用,更不能证明学习
参与和满意 使用时长、完成率、学生主观体验 知识掌握或长期效果
有 AI 练习表现 在提示、答案或反馈帮助下完成当前任务 关闭 AI 后仍能独立完成
即时无辅助测验 短期内是否形成可独立调用的知识或技能 隔天、隔周仍然保持
延迟保持 一段时间后是否记得并会用 能否处理不同形式的新问题
迁移 能否把原理用于新题、真实项目或不同情境 正式课程成绩或长期权益一定改善
课程与长期结果 成绩、通过率、留存或后续学习 变化一定由 AI 引起

最常见的错误是把“辅助表现”当成“学习”。学生复制模型答案,当前练习可能更高分,但这并不保证他理解过程。反过来,学生在有护栏的辅导中被要求先尝试、解释和纠错,练习速度未必最快,却可能形成更可迁移的能力。

AI 教学不是一种干预,而是一组完全不同的做法

干预类型 AI 实际动作 需要的主要对照 关键风险
直接答题 生成答案、步骤或成品 教材/搜索/无工具 抄答案、错误吸收和能力外包
苏格拉底式辅导 追问、提示、诊断误解、逐步反馈 教师辅导或结构化练习 提示质量与错误引导
自适应练习 按表现选择题目、难度和复习间隔 固定题序或教师安排 错误画像和窄化学习路径
教师协作 生成备课建议、共性错误和干预草案 教师原流程 教师盲从和材料幻觉
提醒与支持 发送课程提醒、推荐辅导资源 普通通知或不提醒 打扰、标签化和不平等触达
自动评价 评分、反馈或风险标记 教师量表与双人评分 群体偏差与高影响误判

因此,“用了 GPT-4”“接入 AI 平台”不是可复现实验描述。至少要记录系统提示、课程材料、是否给最终答案、是否要求学生先作答、教师能否介入、模型版本、温度或检索配置,以及学生实际看到的界面。需要把 AI 变成学习伙伴而不是答案机时,可结合站内的AI 学习方法与证据闭环设计提示与反思任务。

怎样读一篇“AI 提高学习成绩”的研究?

AI教育研究证据卡包含对象场景、干预对照、结果时间、研究质量、实施条件和利益边界
可靠结论应写成“在这个样本、任务、对照和时间内观察到什么”,而不是一句“AI 提分”。原创图:兰塞 AI 编辑部。
证据卡字段 必须记录的问题 缺失后的风险
对象 年级、学科、语言、学校、基线能力和样本量 把大学物理结果外推到小学语文
干预 模型、提示、课程材料、护栏、时长和教师支持 无法复制,也不知道真正有效成分
对照 无工具、搜索、教材、普通课堂还是一对一教师 “优于对照”失去含义
分配 随机到学生、班级还是自愿选择;基线是否平衡 本来更积极的学生更愿使用
结果 辅助练习、无辅助测验、延迟、迁移和正式成绩 把短期完成度当学习
流失 谁没有使用、谁退出、缺失数据怎样处理 只剩最积极用户造成偏差
分析 是否预注册、主要指标是什么、是否大量挑选显著结果 只报告最漂亮数字
边界 实施期限、模型更新、资助和利益关系 把特定版本结果包装成永久规律

如果研究只展示满意度、点击率或平台内练习分数,应把它归类为“参与或辅助表现证据”,不能直接用于“提高学习”的结论。厂商案例可以帮助理解产品流程,但采购与课程决策还需要独立测量、完整方法和可审计数据。

“统计显著”为什么不等于“值得上线”?

统计检验回答的是:在研究假设和数据成立时,观察到的差异是否难以用随机波动解释。它不自动回答差异有多大、是否能保持、是否值得成本、是否适合本校,也不保证测量工具真的代表学习。样本很大时很小的差异也可能显著;样本很小时,有教育价值的差异也可能因为不确定性而没有达到显著门槛。

结果信息 应该怎样读 还缺什么
平均分差 两组在指定量尺上的原始差异 量尺范围、基线、离散程度和教育意义
标准化效应 差异相对于样本波动的大小 具体能多解决什么问题,是否能迁移
置信区间 与数据相容的效应范围 研究设计偏差和外部适用性
显著性 在分析假设下反对零差异的证据 实际价值、成本、伤害和复现
满意度 学生对体验的主观感受 独立学习、延迟保持和错误吸收

学校应在试点前定义“最小有意义差异”。例如,不只问平均分是否变化,还要问:多少学生从不会解释到能独立解释;错误是否从概念性转为计算性;教师节省的时间是否真正用于个别辅导;改善能否在隔周测验继续出现。若结果虽显著但小于事先确定的教育门槛,不应包装成成功。

试点中最容易破坏结论的五种情况

问题 怎样发生 控制与报告
组间污染 对照组借用 AI,教师把 AI 材料同时用于两组 记录实际使用;按分配和实际接受分别分析并说明局限
差异流失 困难学生更容易退出某一组,只剩高参与者 报告每组分配、开始、完成和缺失原因,不只分析完成人
教师效应 某组由经验更丰富教师带领,或获得额外关注 平衡教师、使用交叉设计并记录额外支持时间
测试泄漏 AI 见过测验题、答案或高度相似练习 隔离题库,增加新题与人工核验的迁移任务
新奇效应 短期兴趣来自新工具,几周后参与下降 延长观察,分周报告使用和结果,不只测首次体验

还要区分“被分配使用”和“实际使用”的效果。按原随机分配分析能保留因果比较,但如果大量学生从未打开工具,平均结果会稀释;只分析积极使用者又会引入自我选择偏差。最稳妥的报告同时呈现分配、实际使用、流失和实施过程,不用一个数字隐藏复杂情况。

从试点扩展到全校,还要重新计算什么?

小规模研究通常有研究人员维护提示、精选课程材料、及时修复错误和提醒学生参与。扩展后这些条件可能消失,效果和成本都会变化。扩容决策需要把模型费用之外的教师时间、培训、内容维护、数据治理、设备、无障碍支持、故障响应和人工申诉计入总成本。

扩容项目 要量化什么 停止或回退信号
教学准备 每单元材料整理、提示校准、回归测试和教师培训工时 维护时间持续超过可替代的教学收益
运行成本 模型调用、检索、存储、账号、设备和峰值容量 成本随使用增长但学习增益不保持
质量保障 抽查比例、教师改判、事实错误和课程更新 错误积压或教师无法及时接管
学生支持 登录帮助、使用指导、无障碍、替代方案和家校沟通 低资源学生参与持续更低
治理 隐私评估、合同、日志、删除、申诉和安全事件响应 数据流无法说明或退出机制失效

扩容可以分为影子模式、一个任务、一个单元、一个年级和全校五个阶段。每一阶段都要重新通过可用、参与、学习和安全四道门,不能因为小样本试点成功就自动进入下一阶段。模型、知识库、量表或课程内容发生重大变化,也应回到小流量验证。

没有效果或出现负面结果,怎样处理才算真正循证?

零结果不等于“AI 永远无效”,负面结果也不应被隐藏。先判断失败发生在哪一环:学生没有访问、访问但没参与、参与方式变成索要答案、系统内容错误、测验不匹配,还是干预本身没有产生可测学习。不同原因对应不同决定,不能一律通过“再多收集一些数据”拖延。

  • 若参与率低,先修复时间安排、可及性和教师支持,再重新验证,不先增加模型能力。
  • 若有辅助表现升高但无辅助表现下降,关闭直接答案,增加先尝试、分级提示和撤架练习。
  • 若教师改判或事实错误过高,暂停学生直用,转为教师端草案并加强课程材料核验。
  • 若只有部分群体获益,检查设备、语言、基线和支持差异,不用全体平均值掩盖不公平。
  • 若在合理实施后仍无教育意义上的改善,应停止扩容,把资源转回更有效的教学干预。

公开或内部复盘应保留研究问题、方案、偏差、完整结果和停止决定。这样下一次团队才能区分“工具没被正确实施”和“即使正确实施也没有价值”,而不是重复购买新的模型名称。

为什么现有研究会同时出现正面和负面结果?

研究 对象与干预 观察到什么 不能外推到什么
PNAS 2025 近千名土耳其高中数学学生;通用 GPT-4、教师设计护栏的 GPT Tutor、无 AI 对照 两种 AI 都提高有辅助练习表现;通用 GPT 组随后无辅助考试低于对照,护栏组消除了主要负面效应但未显示正向考试提升 所有学科、所有年龄或所有聊天模型
Scientific Reports 2025 194 名大学物理学生;定制、遵循教学法的 AI 课与课堂主动学习交叉比较 该定制 AI 课在研究的两个主题和即时后测中取得更高学习增益,学生用时更少、体验更积极 普通聊天窗口自动优于课堂或教师
ACL 2025 四个高中班的英语作业;带互动反馈和追问的 GPT-4 作业辅导 满意度和继续使用意愿更高,整体未损害学习结果,其中一个组出现更高学习增益 长期成绩、其他学科或所有学生群体
Brown 2026 working paper 两个随机试验;小学 AI 读写平台单独使用或配合线下参与支持 人类支持提高使用与参与,但总体使用仍低,干预未改善阅读成绩 “只要开放账号,学生自然会学”

PNAS 高中数学随机实验最重要的启示不是记住“48%、127% 或 -17%”这几个数字,而是区分有 AI 的练习与关闭 AI 后的考试,并看到教师设计的提示护栏改变了学生怎样使用工具。数字只属于该研究的归一化任务、样本和设计,不能直接变成学校采购承诺。

Scientific Reports 大学物理 RCT使用的是研究团队为课程内容精心设计的教学系统,不是开放式聊天。ACL 2025 高中英语作业研究同样包含互动反馈和追问。两者说明教学设计是干预的一部分,不能只写模型名称。

Brown 2026“Access is Not Enough”研究则提醒:即使安排了专门时间,学生也可能根本不使用平台;增加人类参与支持能提高参与,但不必然转化为成绩改善。这正是为什么实施忠实度、教师支持和实际使用必须与结果一起报告。

正面研究应怎样翻译成学校决策?

研究发现 可以支持的决定 不能支持的决定
特定 AI 课即时后测更好 小规模复现该教学设计和测验 全校购买通用聊天账号
学生更满意 继续评估参与与可用性 宣称已经提高知识掌握
有护栏组避免明显负面效应 默认先尝试、分步提示、限制直接答案 宣称护栏一定带来正向学习增益
一个组出现显著增益 检查分组、样本和异质性并复现 只挑这个组写“普遍有效”
人类支持提高平台使用 把教师/导师支持计入成本与实施 认为软件可替代教学组织

教育部《“人工智能+教育”行动计划》提出智能教学、作业管理、循证教研和人机协同。落地时应把“循证”理解为本校目标、基线、实施和结果都能复核,而不是引用一项外部研究就跳过本地验证。

校内试点怎样设计,才知道 AI 是否有效?

校内AI教学试点的可用、参与、学习和安全四道发布门及停止线
先证明系统可用,再证明学生有效参与、独立学习改善且风险可接受。原创图:兰塞 AI 编辑部。
  1. 写清因果问题:例如“有护栏的分步提示能否提高八年级某单元的无辅助延迟测验”,而不是“AI 是否有用”。
  2. 预先确定主要指标:选一个主要学习结果和少量护栏指标,避免结果出来后挑最好看的数字。
  3. 建立公平对照:对照组获得当前正常教学资源;记录额外教师时间、设备和培训。
  4. 测基线与实施:先测相关知识,记录实际登录、有效对话、缺席、故障和退出。
  5. 安排无辅助测验:关闭 AI 与资料,随后增加延迟测验和不同形式的迁移题。
  6. 分层检查:按基线、语言背景、可及性需求等预先定义的群体观察差异,不随意挖掘。
  7. 设停止线:严重事实错误、隐私事件、某组误伤、抄答案增加或教师无法接管时暂停。
试点记录 最小字段 用途
分配 匿名学生号、班级、条件、基线和分配时间 确认组间可比与污染
干预版本 模型、提示、知识库、题目、教师材料和变更 复现与回滚
过程 任务、尝试、提示层级、答案请求、教师介入和故障 判断学生怎样使用
结果 辅助练习、即时无辅助、延迟、迁移和评分规则 区分表现与学习
风险 错误吸收、申诉、隐私、群体差异和退出 决定是否停止或整改

若无法随机分组,可以使用交叉设计、分阶段上线或匹配比较,但必须如实说明限制。不能把“上线前后成绩变化”自动归因于 AI,因为课程难度、教师、学生构成、考试题和其他政策都可能同时改变。

护栏应该限制什么,而不是只过滤敏感词?

学习护栏 具体行为 验证方式
先尝试 学生提交思路或一步计算后才获得提示 检查首条消息和尝试比例
分级提示 概念提醒→定位错误→下一步,避免直接给完整答案 抽查提示层级和答案泄漏
要求解释 学生用自己的话说明为什么,AI 追问关键理由 无辅助口头或书面复述
错误核对 重要结论连接课程材料,模型不确定时升级教师 事实错误率与教师改判
逐步撤架 随着掌握提高减少提示,安排无工具练习 提示使用与独立表现趋势
禁止高影响自动决定 不由模型单独评分、分班、处分或判断能力 权限、日志和申诉演练

护栏不是万能的系统提示。课程知识库可能过时,模型也可能自信地给错答案;需要站内的事实与来源核验流程AI 安全与供应商治理以及教师可见的升级入口共同工作。作文反馈等开放任务可参考AI 作文量表与教师复核指南

学生数据与权益如何纳入成效评估?

如果提高平均分的代价是收集过量未成年人数据、让部分学生承担更高误判或无法退出,这不能算合格成效。中国《个人信息保护法》要求处理目的明确合理、与目的直接相关并采取影响最小的方式,对不满十四周岁未成年人个人信息还有专门规则。

权益指标 要检查什么 常见盲点
可及性 设备、网络、辅助技术和教师支持是否等价 只分析成功登录者
隐私 收集、用途、留存、训练、第三方、跨境和删除 免费账号绕过学校治理
公平 不同群体的使用、错误、改判和学习结果 只报全体平均值
选择 告知、退出、替代方案与人工渠道 不使用 AI 就无法完成课程
申诉 模型错误怎样纠正,成绩和标签怎样恢复 客服回复代替教育复核

UNESCO 的生成式 AI 教育与研究指南强调以人为中心、隐私、年龄适配和教学验证;美国教育部的AI 教学与学习报告也强调让人保持在决策回路中。具体的数据字段、权限与分析边界,可继续阅读AI 学生数据分析指南

教师、家长和学生分别看什么?

角色 最重要的问题 不应只看
教师 学生是否独立解释、错误是否减少、提示能否逐步撤除 完成速度和模型生成量
教研与学校 与当前教学相比的学习增益、教师负担、权益和总成本 厂商演示和平均满意度
家长 孩子如何使用、是否索要答案、数据去哪、能否退出 “个性化”“智能”标签
学生 我能否在没有 AI 时解释和完成新题 当前答案是否更快更漂亮

教师需要把 AI 输出转化为教学行动,而不是成为模型结果的签字人。备课与材料核验可参考AI 辅助备课流程;有关审批者、部署者与供应商之间的边界,可阅读AI 辅助教学的责任与人工审批指南

常见问题

一项随机对照试验显示有效,就能全校上线吗?

不能。先核对对象、课程、系统设计、对照和测量时间,再做小规模本地复现。外部 RCT 可以提高证据可信度,但不能替代本校实施和权益验证。

学生喜欢使用,是否说明学习效果好?

不说明。满意度是重要的实施指标,但必须与无辅助测验、延迟保持和迁移分开报告;学生也可能高估自己从直接答案中学到的内容。

练习分数上升但无辅助测验没有变化,算成功吗?

若目标是短期任务辅助,可能有价值;若目标是学习和独立掌握,则证据不足。应检查是否直接给答案、提示是否撤除以及学生是否真正尝试。

没有条件随机分组怎么办?

可以使用交叉设计、分阶段上线、历史基线或匹配比较,并记录限制。重点是预先写清指标、对照和停止线,避免只看上线后的自然波动。


编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 18 日复核。旧稿无来源声称个性化学习、智能辅导和自动评估能够提高成绩,并把多个产品名称当成“案例”,没有样本、对照、无辅助测验、延迟保持或数据治理。本次删除产品推荐与泛化结论,依据教育主管部门、国际指南和公开实验,重建为研究证据卡、校内试点、护栏与停止线。本站来源与纠错原则见关于本站与编辑规范