一句话答案:AI 教学可能提高特定任务中的学习成效,也可能只让学生在有工具时做题更快,甚至削弱随后无 AI 的独立表现。判断“是否有效”必须同时说明学生、学科、AI 到底做了什么、与什么对照、测量发生在何时,并至少检查无辅助测验、延迟保持、迁移、提示依赖、教师实施和数据风险。

本文给学校管理者、教师、家长和学习产品团队一套读研究与做试点的方法,不给出“某款工具必然提分”的承诺。单项研究的结果只适用于其样本、任务、教学设计、对照和测量时间。研究与政策复核日期为 2026 年 7 月 18 日。
先问:你说的“成绩提高”是哪一种结果?
| 结果层级 | 它能说明什么 | 不能说明什么 |
|---|---|---|
| 工具可用 | 学生有账号、设备和网络 | 学生实际使用,更不能证明学习 |
| 参与和满意 | 使用时长、完成率、学生主观体验 | 知识掌握或长期效果 |
| 有 AI 练习表现 | 在提示、答案或反馈帮助下完成当前任务 | 关闭 AI 后仍能独立完成 |
| 即时无辅助测验 | 短期内是否形成可独立调用的知识或技能 | 隔天、隔周仍然保持 |
| 延迟保持 | 一段时间后是否记得并会用 | 能否处理不同形式的新问题 |
| 迁移 | 能否把原理用于新题、真实项目或不同情境 | 正式课程成绩或长期权益一定改善 |
| 课程与长期结果 | 成绩、通过率、留存或后续学习 | 变化一定由 AI 引起 |
最常见的错误是把“辅助表现”当成“学习”。学生复制模型答案,当前练习可能更高分,但这并不保证他理解过程。反过来,学生在有护栏的辅导中被要求先尝试、解释和纠错,练习速度未必最快,却可能形成更可迁移的能力。
AI 教学不是一种干预,而是一组完全不同的做法
| 干预类型 | AI 实际动作 | 需要的主要对照 | 关键风险 |
|---|---|---|---|
| 直接答题 | 生成答案、步骤或成品 | 教材/搜索/无工具 | 抄答案、错误吸收和能力外包 |
| 苏格拉底式辅导 | 追问、提示、诊断误解、逐步反馈 | 教师辅导或结构化练习 | 提示质量与错误引导 |
| 自适应练习 | 按表现选择题目、难度和复习间隔 | 固定题序或教师安排 | 错误画像和窄化学习路径 |
| 教师协作 | 生成备课建议、共性错误和干预草案 | 教师原流程 | 教师盲从和材料幻觉 |
| 提醒与支持 | 发送课程提醒、推荐辅导资源 | 普通通知或不提醒 | 打扰、标签化和不平等触达 |
| 自动评价 | 评分、反馈或风险标记 | 教师量表与双人评分 | 群体偏差与高影响误判 |
因此,“用了 GPT-4”“接入 AI 平台”不是可复现实验描述。至少要记录系统提示、课程材料、是否给最终答案、是否要求学生先作答、教师能否介入、模型版本、温度或检索配置,以及学生实际看到的界面。需要把 AI 变成学习伙伴而不是答案机时,可结合站内的AI 学习方法与证据闭环设计提示与反思任务。
怎样读一篇“AI 提高学习成绩”的研究?

| 证据卡字段 | 必须记录的问题 | 缺失后的风险 |
|---|---|---|
| 对象 | 年级、学科、语言、学校、基线能力和样本量 | 把大学物理结果外推到小学语文 |
| 干预 | 模型、提示、课程材料、护栏、时长和教师支持 | 无法复制,也不知道真正有效成分 |
| 对照 | 无工具、搜索、教材、普通课堂还是一对一教师 | “优于对照”失去含义 |
| 分配 | 随机到学生、班级还是自愿选择;基线是否平衡 | 本来更积极的学生更愿使用 |
| 结果 | 辅助练习、无辅助测验、延迟、迁移和正式成绩 | 把短期完成度当学习 |
| 流失 | 谁没有使用、谁退出、缺失数据怎样处理 | 只剩最积极用户造成偏差 |
| 分析 | 是否预注册、主要指标是什么、是否大量挑选显著结果 | 只报告最漂亮数字 |
| 边界 | 实施期限、模型更新、资助和利益关系 | 把特定版本结果包装成永久规律 |
如果研究只展示满意度、点击率或平台内练习分数,应把它归类为“参与或辅助表现证据”,不能直接用于“提高学习”的结论。厂商案例可以帮助理解产品流程,但采购与课程决策还需要独立测量、完整方法和可审计数据。
“统计显著”为什么不等于“值得上线”?
统计检验回答的是:在研究假设和数据成立时,观察到的差异是否难以用随机波动解释。它不自动回答差异有多大、是否能保持、是否值得成本、是否适合本校,也不保证测量工具真的代表学习。样本很大时很小的差异也可能显著;样本很小时,有教育价值的差异也可能因为不确定性而没有达到显著门槛。
| 结果信息 | 应该怎样读 | 还缺什么 |
|---|---|---|
| 平均分差 | 两组在指定量尺上的原始差异 | 量尺范围、基线、离散程度和教育意义 |
| 标准化效应 | 差异相对于样本波动的大小 | 具体能多解决什么问题,是否能迁移 |
| 置信区间 | 与数据相容的效应范围 | 研究设计偏差和外部适用性 |
| 显著性 | 在分析假设下反对零差异的证据 | 实际价值、成本、伤害和复现 |
| 满意度 | 学生对体验的主观感受 | 独立学习、延迟保持和错误吸收 |
学校应在试点前定义“最小有意义差异”。例如,不只问平均分是否变化,还要问:多少学生从不会解释到能独立解释;错误是否从概念性转为计算性;教师节省的时间是否真正用于个别辅导;改善能否在隔周测验继续出现。若结果虽显著但小于事先确定的教育门槛,不应包装成成功。
试点中最容易破坏结论的五种情况
| 问题 | 怎样发生 | 控制与报告 |
|---|---|---|
| 组间污染 | 对照组借用 AI,教师把 AI 材料同时用于两组 | 记录实际使用;按分配和实际接受分别分析并说明局限 |
| 差异流失 | 困难学生更容易退出某一组,只剩高参与者 | 报告每组分配、开始、完成和缺失原因,不只分析完成人 |
| 教师效应 | 某组由经验更丰富教师带领,或获得额外关注 | 平衡教师、使用交叉设计并记录额外支持时间 |
| 测试泄漏 | AI 见过测验题、答案或高度相似练习 | 隔离题库,增加新题与人工核验的迁移任务 |
| 新奇效应 | 短期兴趣来自新工具,几周后参与下降 | 延长观察,分周报告使用和结果,不只测首次体验 |
还要区分“被分配使用”和“实际使用”的效果。按原随机分配分析能保留因果比较,但如果大量学生从未打开工具,平均结果会稀释;只分析积极使用者又会引入自我选择偏差。最稳妥的报告同时呈现分配、实际使用、流失和实施过程,不用一个数字隐藏复杂情况。
从试点扩展到全校,还要重新计算什么?
小规模研究通常有研究人员维护提示、精选课程材料、及时修复错误和提醒学生参与。扩展后这些条件可能消失,效果和成本都会变化。扩容决策需要把模型费用之外的教师时间、培训、内容维护、数据治理、设备、无障碍支持、故障响应和人工申诉计入总成本。
| 扩容项目 | 要量化什么 | 停止或回退信号 |
|---|---|---|
| 教学准备 | 每单元材料整理、提示校准、回归测试和教师培训工时 | 维护时间持续超过可替代的教学收益 |
| 运行成本 | 模型调用、检索、存储、账号、设备和峰值容量 | 成本随使用增长但学习增益不保持 |
| 质量保障 | 抽查比例、教师改判、事实错误和课程更新 | 错误积压或教师无法及时接管 |
| 学生支持 | 登录帮助、使用指导、无障碍、替代方案和家校沟通 | 低资源学生参与持续更低 |
| 治理 | 隐私评估、合同、日志、删除、申诉和安全事件响应 | 数据流无法说明或退出机制失效 |
扩容可以分为影子模式、一个任务、一个单元、一个年级和全校五个阶段。每一阶段都要重新通过可用、参与、学习和安全四道门,不能因为小样本试点成功就自动进入下一阶段。模型、知识库、量表或课程内容发生重大变化,也应回到小流量验证。
没有效果或出现负面结果,怎样处理才算真正循证?
零结果不等于“AI 永远无效”,负面结果也不应被隐藏。先判断失败发生在哪一环:学生没有访问、访问但没参与、参与方式变成索要答案、系统内容错误、测验不匹配,还是干预本身没有产生可测学习。不同原因对应不同决定,不能一律通过“再多收集一些数据”拖延。
- 若参与率低,先修复时间安排、可及性和教师支持,再重新验证,不先增加模型能力。
- 若有辅助表现升高但无辅助表现下降,关闭直接答案,增加先尝试、分级提示和撤架练习。
- 若教师改判或事实错误过高,暂停学生直用,转为教师端草案并加强课程材料核验。
- 若只有部分群体获益,检查设备、语言、基线和支持差异,不用全体平均值掩盖不公平。
- 若在合理实施后仍无教育意义上的改善,应停止扩容,把资源转回更有效的教学干预。
公开或内部复盘应保留研究问题、方案、偏差、完整结果和停止决定。这样下一次团队才能区分“工具没被正确实施”和“即使正确实施也没有价值”,而不是重复购买新的模型名称。
为什么现有研究会同时出现正面和负面结果?
| 研究 | 对象与干预 | 观察到什么 | 不能外推到什么 |
|---|---|---|---|
| PNAS 2025 | 近千名土耳其高中数学学生;通用 GPT-4、教师设计护栏的 GPT Tutor、无 AI 对照 | 两种 AI 都提高有辅助练习表现;通用 GPT 组随后无辅助考试低于对照,护栏组消除了主要负面效应但未显示正向考试提升 | 所有学科、所有年龄或所有聊天模型 |
| Scientific Reports 2025 | 194 名大学物理学生;定制、遵循教学法的 AI 课与课堂主动学习交叉比较 | 该定制 AI 课在研究的两个主题和即时后测中取得更高学习增益,学生用时更少、体验更积极 | 普通聊天窗口自动优于课堂或教师 |
| ACL 2025 | 四个高中班的英语作业;带互动反馈和追问的 GPT-4 作业辅导 | 满意度和继续使用意愿更高,整体未损害学习结果,其中一个组出现更高学习增益 | 长期成绩、其他学科或所有学生群体 |
| Brown 2026 working paper | 两个随机试验;小学 AI 读写平台单独使用或配合线下参与支持 | 人类支持提高使用与参与,但总体使用仍低,干预未改善阅读成绩 | “只要开放账号,学生自然会学” |
PNAS 高中数学随机实验最重要的启示不是记住“48%、127% 或 -17%”这几个数字,而是区分有 AI 的练习与关闭 AI 后的考试,并看到教师设计的提示护栏改变了学生怎样使用工具。数字只属于该研究的归一化任务、样本和设计,不能直接变成学校采购承诺。
Scientific Reports 大学物理 RCT使用的是研究团队为课程内容精心设计的教学系统,不是开放式聊天。ACL 2025 高中英语作业研究同样包含互动反馈和追问。两者说明教学设计是干预的一部分,不能只写模型名称。
Brown 2026“Access is Not Enough”研究则提醒:即使安排了专门时间,学生也可能根本不使用平台;增加人类参与支持能提高参与,但不必然转化为成绩改善。这正是为什么实施忠实度、教师支持和实际使用必须与结果一起报告。
正面研究应怎样翻译成学校决策?
| 研究发现 | 可以支持的决定 | 不能支持的决定 |
|---|---|---|
| 特定 AI 课即时后测更好 | 小规模复现该教学设计和测验 | 全校购买通用聊天账号 |
| 学生更满意 | 继续评估参与与可用性 | 宣称已经提高知识掌握 |
| 有护栏组避免明显负面效应 | 默认先尝试、分步提示、限制直接答案 | 宣称护栏一定带来正向学习增益 |
| 一个组出现显著增益 | 检查分组、样本和异质性并复现 | 只挑这个组写“普遍有效” |
| 人类支持提高平台使用 | 把教师/导师支持计入成本与实施 | 认为软件可替代教学组织 |
教育部《“人工智能+教育”行动计划》提出智能教学、作业管理、循证教研和人机协同。落地时应把“循证”理解为本校目标、基线、实施和结果都能复核,而不是引用一项外部研究就跳过本地验证。
校内试点怎样设计,才知道 AI 是否有效?

- 写清因果问题:例如“有护栏的分步提示能否提高八年级某单元的无辅助延迟测验”,而不是“AI 是否有用”。
- 预先确定主要指标:选一个主要学习结果和少量护栏指标,避免结果出来后挑最好看的数字。
- 建立公平对照:对照组获得当前正常教学资源;记录额外教师时间、设备和培训。
- 测基线与实施:先测相关知识,记录实际登录、有效对话、缺席、故障和退出。
- 安排无辅助测验:关闭 AI 与资料,随后增加延迟测验和不同形式的迁移题。
- 分层检查:按基线、语言背景、可及性需求等预先定义的群体观察差异,不随意挖掘。
- 设停止线:严重事实错误、隐私事件、某组误伤、抄答案增加或教师无法接管时暂停。
| 试点记录 | 最小字段 | 用途 |
|---|---|---|
| 分配 | 匿名学生号、班级、条件、基线和分配时间 | 确认组间可比与污染 |
| 干预版本 | 模型、提示、知识库、题目、教师材料和变更 | 复现与回滚 |
| 过程 | 任务、尝试、提示层级、答案请求、教师介入和故障 | 判断学生怎样使用 |
| 结果 | 辅助练习、即时无辅助、延迟、迁移和评分规则 | 区分表现与学习 |
| 风险 | 错误吸收、申诉、隐私、群体差异和退出 | 决定是否停止或整改 |
若无法随机分组,可以使用交叉设计、分阶段上线或匹配比较,但必须如实说明限制。不能把“上线前后成绩变化”自动归因于 AI,因为课程难度、教师、学生构成、考试题和其他政策都可能同时改变。
护栏应该限制什么,而不是只过滤敏感词?
| 学习护栏 | 具体行为 | 验证方式 |
|---|---|---|
| 先尝试 | 学生提交思路或一步计算后才获得提示 | 检查首条消息和尝试比例 |
| 分级提示 | 概念提醒→定位错误→下一步,避免直接给完整答案 | 抽查提示层级和答案泄漏 |
| 要求解释 | 学生用自己的话说明为什么,AI 追问关键理由 | 无辅助口头或书面复述 |
| 错误核对 | 重要结论连接课程材料,模型不确定时升级教师 | 事实错误率与教师改判 |
| 逐步撤架 | 随着掌握提高减少提示,安排无工具练习 | 提示使用与独立表现趋势 |
| 禁止高影响自动决定 | 不由模型单独评分、分班、处分或判断能力 | 权限、日志和申诉演练 |
护栏不是万能的系统提示。课程知识库可能过时,模型也可能自信地给错答案;需要站内的事实与来源核验流程、AI 安全与供应商治理以及教师可见的升级入口共同工作。作文反馈等开放任务可参考AI 作文量表与教师复核指南。
学生数据与权益如何纳入成效评估?
如果提高平均分的代价是收集过量未成年人数据、让部分学生承担更高误判或无法退出,这不能算合格成效。中国《个人信息保护法》要求处理目的明确合理、与目的直接相关并采取影响最小的方式,对不满十四周岁未成年人个人信息还有专门规则。
| 权益指标 | 要检查什么 | 常见盲点 |
|---|---|---|
| 可及性 | 设备、网络、辅助技术和教师支持是否等价 | 只分析成功登录者 |
| 隐私 | 收集、用途、留存、训练、第三方、跨境和删除 | 免费账号绕过学校治理 |
| 公平 | 不同群体的使用、错误、改判和学习结果 | 只报全体平均值 |
| 选择 | 告知、退出、替代方案与人工渠道 | 不使用 AI 就无法完成课程 |
| 申诉 | 模型错误怎样纠正,成绩和标签怎样恢复 | 客服回复代替教育复核 |
UNESCO 的生成式 AI 教育与研究指南强调以人为中心、隐私、年龄适配和教学验证;美国教育部的AI 教学与学习报告也强调让人保持在决策回路中。具体的数据字段、权限与分析边界,可继续阅读AI 学生数据分析指南。
教师、家长和学生分别看什么?
| 角色 | 最重要的问题 | 不应只看 |
|---|---|---|
| 教师 | 学生是否独立解释、错误是否减少、提示能否逐步撤除 | 完成速度和模型生成量 |
| 教研与学校 | 与当前教学相比的学习增益、教师负担、权益和总成本 | 厂商演示和平均满意度 |
| 家长 | 孩子如何使用、是否索要答案、数据去哪、能否退出 | “个性化”“智能”标签 |
| 学生 | 我能否在没有 AI 时解释和完成新题 | 当前答案是否更快更漂亮 |
教师需要把 AI 输出转化为教学行动,而不是成为模型结果的签字人。备课与材料核验可参考AI 辅助备课流程;有关审批者、部署者与供应商之间的边界,可阅读AI 辅助教学的责任与人工审批指南。
常见问题
一项随机对照试验显示有效,就能全校上线吗?
不能。先核对对象、课程、系统设计、对照和测量时间,再做小规模本地复现。外部 RCT 可以提高证据可信度,但不能替代本校实施和权益验证。
学生喜欢使用,是否说明学习效果好?
不说明。满意度是重要的实施指标,但必须与无辅助测验、延迟保持和迁移分开报告;学生也可能高估自己从直接答案中学到的内容。
练习分数上升但无辅助测验没有变化,算成功吗?
若目标是短期任务辅助,可能有价值;若目标是学习和独立掌握,则证据不足。应检查是否直接给答案、提示是否撤除以及学生是否真正尝试。
没有条件随机分组怎么办?
可以使用交叉设计、分阶段上线、历史基线或匹配比较,并记录限制。重点是预先写清指标、对照和停止线,避免只看上线后的自然波动。
编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 18 日复核。旧稿无来源声称个性化学习、智能辅导和自动评估能够提高成绩,并把多个产品名称当成“案例”,没有样本、对照、无辅助测验、延迟保持或数据治理。本次删除产品推荐与泛化结论,依据教育主管部门、国际指南和公开实验,重建为研究证据卡、校内试点、护栏与停止线。本站来源与纠错原则见关于本站与编辑规范。
