当今,AI 已经进入教师日常的备课与教学中。然而,许多问题接踵而至:

这些由 AI 生成的教案,真的具备教育学意义上的专业性吗?
它们是真正符合现代教育理论的教学设计,还是仅仅披着华丽辞藻外衣的文字拼凑?
文章信息

中文标题:科学教育专家视角下AI辅助教案的适用性
作者:Karaismailoglu F, Surmeli H, Yildirim M.(土耳其梅尔辛大学 / 马尔马拉大学)
期刊:Journal of Science Education and Technology
线上发表日期: 2026 年 6 月 18 日
关键词:AI;基于工程设计的学习方法;教案设计;科学教育技能
(点击页面底部“阅读原文”跳转原网页)
01
研究背景与问题

(1)研究背景
现有研究大多只关注 AI 工具的可用性——能不能省时间、能不能激发创意。但很少有人深究一个关键问题:这些 AI 生成的教案,到底符不符合既定的学习理论和课程标准?
更具体的痛点是:面对像工程设计式学习(EDBL) 这样强调"过程导向、迭代试错"的复杂教学法,AI 能否真正驾驭?
💡 什么是工程设计导向学习(EDBL)?
这是一种根植于问题导向学习(PBL)和建构主义理论的教学模式,它要求学生像真正的工程师一样,面对真实世界的问题,通过不断地提出方案、制作原型、测试并迭代修改,最终解决问题。与传统的“听讲 - 做题”模式不同,EDBL 极其考验教案在过程引导和深度试错上的设计功力。
(2)研究问题
RQ:针对一个六年级科学单元,AI 生成的教案在"教学质量"和"EDBL契合度"上表现如何?当用国家课程标准的技能要求和EDBL各阶段来衡量时,它们的优势与短板在哪?
02
概念框架

工程设计式学习(EDBL)六阶段理论
EDBL 理论植根于问题本位学习和建构主义理论,让学生通过真实的、迭代的设计挑战来发展科学理解和实践技能。它包含六个核心阶段:

发现问题;
研究问题;
提出可能方案;
选择并发展最佳方案;
制作原型并测试;
评估并重新设计。
在实际科学课堂中,最难的部分往往是第5和第6阶段 —— 如何引导学生在失败中反思并迭代。 研究正是要检验 AI 能否在教案中精准设计出支撑这种“反思性试错”的脚手架。
土耳其 2024 版能力导向科学课标框架
土耳其2024年修订的中学科学课程采用了能力导向框架,强调四大技能领域:
概念技能(问题解决、提问、讨论);
领域特定技能(假设建立、观察、推断);
素养技能(数据素养、媒体素养、视觉素养);
社会情感学习技能(情绪调节、共情、健康自我概念)。
而本研究还额外加入了工程技能作为 EDBL 框架的内在要求 —— 构成完整的五大技能评估维度。
03
研究方法

(1)任务设置与AI平台
a)两个被测AI平台:
C1(通用型):ChatGPT-4(OpenAI);
C2(教育专用型):Teacher's Buddy(专门的教案生成工具)。


b)任务内容:
生成六年级科学 “可持续生活与生物多样性” 单元教案,核心目标为 “质疑生物多样性对自然生命的重要性”,要求覆盖 5 项子目标(定义、提问、收集信息、评估信息可靠性、做出推断)、四大技能维度,并适配土耳其的本地情境。
👉 一个意外的关键发现:最初用土耳其语撰写提示词时,两款 AI 均无法准确理解 EDBL 的迭代本质,生成的教案全是线性流程;切换为英文提示词后,教学法连贯性大幅提升。最终的英文提示词经过两轮专家打磨,确保所有要求清晰、完整、可执行。
(2)专家被试信息
a)专家样本:通过标准抽样选出11位专家(E1~E11),全部具备科学教育或课程研究的硕士以上学历,且有EDBL模型的实操经验。
b)翻译问题的处理:由于 Teacher's Buddy 当时不支持土耳其语,英文输出由两位精通英语的科学教育专家作者独立翻译成土耳其语,并交叉核对消除分歧。
(3)评估与分析方法
采用双盲评审设计:所有教案去除来源标识,仅标注 C1、C2,专家全程不知道对应平台;
10分制评分量表(1=完全不适切,10=完全适切):涵盖12项教学质量标准,归类为七大类(五个EDBL阶段 + 两个实施标准)跨五大技能领域;
定性分析:采用 Braun & Clarke 的六阶段主题分析法处理开放式回答。两名研究者独立编码,最终归纳为三个适用性类别:可直接应用;修改后可应用;不应应用;
编码信度:使用二次加权kappa,达到κ = 0.79(95%置信区间0.68~0.90),表示高度一致。
04
结果

结果1:EDBL阶段——两个AI的分工差异明显
(1)C1(通用型)的表现——擅长开头,弱于迭代:

(2)C2(教育专用型)的表现——全程更均衡:

两款 AI 呈现出一个共同特征:“呈现方案” 环节得分均为全场最高(C1 均值 47.00,C2 均值 49.09),说明 AI 普遍擅长设计收尾展示环节,输出结构清晰、形式丰富。
但核心差异体现在过程环节:
C1 在早期阶段表现更优,“识别问题” 44.73 分、“调研问题” 45.00 分,适合做课程导入与背景铺垫;但到了最体现 EDBL 精髓的 “评估与重设计” 环节,C1 得分跌至 42.55 分 ,为所有环节最低,且专家评分分歧极大。
反观教育专属 AI C2,全程表现更均衡,尤其是 “评估与重设计”(48.45 分)和 “原型制作与测试”(47.45 分)两个迭代核心环节,显著高于 C1,真正还原了 EDBL 的循环属性。
👉 简言之:C1 写的是 “一步到位的教案”,C2 写的是 “有迭代的探究课”。
结果2:整体质量C2八项全胜,但工程技能成为共同短板
两个 AI 平台的五大技能得分对比:

五大技能维度中,工程技能是两款 AI 的共同最低分:C1 仅 37.45 分,C2 为 41.45 分,相差 4 分。这说明无论通用还是教育 AI,都难以真正还原工程设计中的试错、失败分析、原型迭代等过程性能力,大多停留在 “口头讲步骤” 的表面。
其余维度各有侧重:C1 在概念技能(49.45 分)和社会情绪技能(47.64 分)上略有优势,内容表达更生动,更关注学生感受;C2 则在领域特定技能(50.72 分)、素养技能(49.45 分)上表现更好,更贴合科学学科的专业要求。
👉 整体质量的 8 项指标中,C2 全面高于 C1,教育专属 AI 在教学节奏、本地化适配等教学细节上,考虑得明显更周全。
结果3:专家偏好出现分裂
在八项整体质量标准上,C2在全部八项的平均分都高于C1:

C2优势最大的三项是时长安排(+1.4)、情境定制(+1.2)、吸引注意力(+1.0)。
但一个有趣的反转出现了:尽管C2定量得分全面领先,专家偏好却出现了分裂:

为什么会这样? 那4位偏好C1的专家给出了关键理由——C1更强调学生主体性和社会情感学习。专家E11说:
"第一份方案更详尽,把学生放在首位,鼓励学生学得更多,更强调社会情感技能……所以我会选第一份。"
💡 深层启示:这说明专家的判断不仅看"结构契合度",还看"情感和情境维度"。AI教案不能只评估技术保真度,更要看它能否培养以人为本、包容的学习环境。
05
讨论

(1)启示:数字公平的隐忧
研究指出土耳其语提示词产出的教案质量远低于英语提示词。这暴露了一个严重的"数字公平"问题,即 AI 工具可能不成比例地服务于英语能力强的用户,在不同语言语境中制造教学质量的鸿沟。
对全球非英语国家的教育者而言,这意味着 AI 带来的"便利"可能伴随着"不平等"。
(2)研究局限
仅依赖专家评估,缺乏真实课堂实施和学生学习成果的数据;
仅限单一学科(科学)和单一年级(六年级),泛化性受限;
缺乏纵向视角,无法考察教师如何随时间改编 AI 教案。
💬 留给读者的问题:
你是否也遇到过"用母语提示 AI 效果差、用英语效果好"的情况?
欢迎在评论区分享~
原文标题:Suitability of Artificial Intelligence Supported Lesson Plans from the Perspective of Science Education Experts
Doi:https://doi.org/10.1007/s10956-026-10342-4

= END =
往期推荐

点赞
收藏
分享
↙左下角点击
阅读原文
查看原文