橘子加速器Citrus education desk

线路观察

随堂测验分数提高,为什么还要看题目重用、反馈与延后测试

同一组随堂题重做后分数提高,可能同时包含学习、反馈、题目记忆与界面熟悉。本文依据IES与EEF证据,区分即时表现、延后保持和新情境迁移。

同一组随堂题第一次答对六成,查看解析后再做一次变成九成。平台曲线明显上升,很容易让人写出“学生已经掌握”。可是这个分数同时混合了学习、记住题目、看过答案和熟悉操作界面的影响,不能独自证明知识在几天后仍能提取,也不能证明换一种问题仍会使用。

随堂测验可以是很有价值的教学工具。关键不是否定分数,而是先说清它回答什么问题,再为“保持”和“迁移”安排独立证据。即时得分、延后得分和新情境表现是三个不同观察窗口。

形成性评估的目的不是给学习盖章

美国教育部IES在2017年证据综述中,把形成性评估定义为教师与学生收集、解释并使用学习证据,以便在较短期间内促进后续学习的过程。重点落在“使用证据调整教学”,而不是把每次活动变成最终认证。

一次随堂题可以揭示某个概念尚未理解、某种错误很常见,或当前讲解没有连接到已有知识。教师据此改变例子、补充示范、安排练习或让学生解释思路,才完成形成性用途。若平台只显示一个分数,却没有改变后续教与学,它更像一张状态快照。

IES也指出,形成性评估可以很轻量,例如让学生反思并讨论本节课学到了什么;也可以更正式,持续追踪学习表现以调整教学。形式并不决定价值,是否围绕目标收集并使用证据才是核心。

因此,“本次测验90分”最多说明学生在规定题目、时间、提示和评分规则下取得了这一表现。要说“已经学会”,还需定义学会指的是立即识别、独立回忆、解释机制、解决新问题,还是长期保持。

重做原题为何会让分数自然上升

第一次作答后,学生可能看见正确答案、解析、错题标记和选项位置。第二次遇到相同题干时,不必重新建立全部知识,可以直接记住答案字母、关键词或页面布局。分数上升可能包含真实理解,也可能包含项目记忆。

题目顺序固定会增加界面线索。选项顺序固定又会让“第三项是答案”替代概念判断。若平台允许无限次重做并立即显示正确项,最后一次分数更接近“在这一套题里学会找到答案”,不能自动外推到陌生任务。

这不表示重复测验没有学习价值。提取知识本身可以促进学习,反馈也能纠正错误。问题在于,训练过程与成效测量若使用完全相同的题目,就难以区分练习效应和广泛能力变化。

更清楚的设计是把原题用于练习,把等值但不相同的题用于检查。等值并非只换数字或姓名,而是保持目标知识和难度,同时改变表面情境、提问角度或需要的推理步骤。

正确或错误只是反馈的起点

EEF在2021年教师反馈指南中指出,有效反馈应建立在高质量教学与形成性评估之上。学习目标帮助确定反馈要朝哪里推进,形成性证据则帮助识别需要处理的学习缺口。

只显示“答错了”能提示结果,却不说明错误来自概念混淆、步骤遗漏、读题偏差还是计算失误。只显示正确答案又可能让学生短暂记住选项,没有机会解释为什么原先的推理不成立。

有用反馈通常要连接任务、知识或自我调节。它可以指出当前答案与目标之间的差距,给出足够线索,让学生重新产生答案,并把后续行动交还给学习者。反馈过多也可能把所有思考替学生完成。

EEF特别提醒,不是所有反馈都会产生正面效果;做得不好甚至可能伤害进展,而且反馈需要真实时间成本。评价平台时不能只统计“发送了多少条反馈”,还要看反馈是否及时、可理解、可执行,以及学生有没有机会回应。

得分提高后,学生做了什么

若反馈之后直接进入下一章,平台可能记录了分数,却没有观察学生是否使用反馈。更完整的循环包括:学生读懂信息、修改答案或策略、解释修改原因,再在相近任务中试用。

教师也需要行动。若全班在同一概念上出错,问题可能不在个别学生粗心,而在讲解、例子或前置知识。形成性评估的证据应回到课程设计,而不只是生成学生排名。

可以在记录中加入“下一次教学调整”字段:重教哪一概念、换用什么表示方式、为谁提供额外示范、何时再次检查。这样,测验不再是孤立分数,而是教学决策的一部分。

也要记录学生看到的反馈类型。简单正误、答案解析、提示层级、教师评论和同伴讨论不是同一种干预。若不同班级或年份采用不同反馈,却只比较最后分数,就会把过程差异藏起来。

即时测试回答当前可提取性

刚看完解析就重做,学生仍可利用工作记忆和近期线索。即时测试适合检查讲解是否被理解、操作步骤能否跟上,也适合迅速找出需要重教之处。

即时高分的限制在于,它没有让遗忘发生。学习者可能在十分钟内正确复述,却在一周后无法独立提取。若教学目标要求下个月考试、下一单元应用或真实工作中使用,立即测量的时间范围太窄。

延后测试不是为了惩罚遗忘,而是让评价与目标时间尺度一致。需要保留一周的知识,就至少安排跨越相应间隔的检查;需要学期末应用,就不能只依赖课堂结束前的退出题。

延后多久没有统一答案。它取决于课程目标、知识类型和使用情境。报告应写实际间隔,而不是只写“后测”。一天、一周和三个月测到的是不同保持阶段。

延后测试也要避免照搬训练题

若一周后仍重复完全相同的题,项目记忆可能继续发挥作用。延后虽然减少近期记忆,却没有完全解决题目重用。最好保留一部分锚定题用于比较,再加入新的等值题。

锚定题可以观察同一项目随时间的变化,新题则检查知识是否超越原项目。两类结果应分别报告。若锚定题高、新题低,可能表示学生记得练习项目,却没有形成稳定概念。

新题也不能随意更难。若它引入额外阅读负担、新术语或复杂计算,分数下降可能来自无关难度。设计者应先明确目标构念,再让题目差异集中在需要测试的迁移程度。

评估还应避免让答案仅由表面线索决定。训练题和新题若共享同一句关键词,学生可能用匹配策略作答。改变情境并要求解释理由,更能看出知识结构是否可用。

保持与迁移不是同一个结果

保持是经过一段时间后仍能提取或使用学过的信息。迁移则要求把知识带到未练过的任务、材料或情境。一个学生可以很好地记住定义,却无法在真实案例中识别适用条件。

近迁移通常保留大部分结构,只改变数字、表述或情境。远迁移会改变更多表面特征,要求学习者辨认更深层的原则。两者难度不同,不宜用一个“应用能力”总分掩盖。

随堂测验若以选择题练习概念,后续可以用新选择题检查近迁移,再用解释、设计或解决案例检查较远迁移。不同任务的评分可靠度也要说明。

随堂测验分数提高,为什么还要看题目重用、反馈与延后测试 配图 1
随堂测验分数提高,为什么还要看题目重用、反馈与延后测试 配图 1

迁移失败不一定证明教学毫无价值。可能是概念尚未抽象、练习情境过窄、学生没有识别何时使用,或新任务加入太多无关负担。形成性用途是根据这种证据调整练习,而不是急着贴标签。

题目格式会改变分数意义

选择题提供候选答案,主要要求识别并区分。填空题提供线索但要求产生答案,开放题则需要组织表达。即使目标知识相同,三种格式调用的提取过程和评分误差也不同。

若训练全是选择题,最终只用相同选择题,结论应限制为在该格式下的表现。要主张学生能独立解释,应加入需要生成解释的任务,并制定明确评分标准。

选项设计也会改变难度。明显错误的干扰项让分数偏高,多个合理选项会增加歧义。重做时学生还可能排除曾选错的选项。平台报告若没有保存题目版本,就无法解释历年变化。

开放题不是天然更好。评分者一致性、语言表达和书写速度都会进入结果。评估设计要选择最贴近目标的证据,并承认每种格式的限制。

分数需要分母和测量条件

“从60分升到90分”听起来明确,但还要知道总题数、每题权重、是否允许提示、是否限时、缺答如何计分,以及是否只统计完成者。五道题多答对一题,与五十道题多答对十题具有不同稳定性。

若只分析完成第二次测验的学生,主动退出者会消失,提升幅度可能被高估。报告应交代参与人数、缺失数据和重复次数,而不只展示完成者平均值。

班级平均分还会掩盖分布。少数学生提升很大、部分不变和所有人小幅提升,可能得到相同平均。至少同时看人数、分位数或个体变化范围。

平台自动评分也要验证。答案键错误、多个正确答案未设置、数学等价形式识别失败,都可能制造假变化。正式比较前应抽查项目和评分规则。

与学习目标一致,才谈得上有效

如果目标是记住术语,延后回忆题合理;若目标是解释证据,纯记忆题覆盖不足;若目标是完成真实项目,最终应有接近真实限制的表现任务。

这种一致性通常称为评估与目标对齐。对齐不是让教学只围着测试转,而是确保声称的能力确实被任务观察。不能用观看时长证明推理,也不能用一次定义选择题证明复杂应用。

同一课程可以保留多种证据:平台行为数据说明学习过程,随堂题说明当下理解,延后测验说明保持,新任务说明迁移,作品说明综合表现。它们互相补充,不应被压成单一活跃度。

明确证据层次也能减少误用。管理员可以看完成率安排支持,教师用错题调整讲解,学生用反馈规划复习,而认证决定采用更稳健的综合评估。

形成性评估研究能告诉我们什么

IES综述从76项相关研究中,依据类似What Works Clearinghouse的严格标准筛选。最后认定23项研究足以对形成性评估干预与观察结果的因果关系更有信心。

其中22项比较参与与未参与形成性评估的学生,19项提供足以计算效应量的信息。综述报告总体上形成性评估对学业成就有正向效果,但不同学科、实施主体和评估方式之间存在差异。

这项结果支持把形成性评估当作可认真设计的教学过程,却不能推出任何自动测验平台必然有效。综述研究中的干预包含如何收集证据、谁来引导、怎样调整教学等过程,不能只复制“多测几次”。

EEF的反馈指南同样把反馈放在高质量教学之后,并强调原则与实施,而非执着于书面或口头形式。两份来源共同指向一个边界:工具和分数只有被纳入教学决策,才可能发挥作用。

不要从相关性直接跳到因果

经常重做测验的学生可能本来就更投入、基础更强或有更多时间。如果平台数据显示重做次数与期末成绩相关,不能立即说重做导致高分。

要判断因果,需要合理对照、相近起点、明确干预和结果测量。班级前后比较仍可能受到教师、课程难度、学生组成和考试变化影响。

即使随机实验发现平均效果,也要核对样本、年龄、学科、任务与实施条件。把某种反馈在一门课程的结果外推到所有学生,需要额外证据。

公开报告可以使用更克制的语言:“参与者中观察到提升”“结果与该做法一致”,并同时说明替代解释。没有对照时不要写成“证明提升了学习”。

给平台报表增加五个字段

第一个字段是题目状态:原题、等值题或新情境题。第二个是时间间隔:距离学习和上次作答多久。第三个是反馈条件:只显示正误、提供提示、给完整解析,还是教师讨论。

第四个是目标层级:识别、回忆、解释、应用或迁移。第五个是后续行动:学生修改了什么,教师调整了什么,何时再次检查。

有了这些字段,同样的90分就不再模糊。它可以被写成“看过解析后立即重做原题90分”,也可以是“一周后独立完成新情境题90分”。两句话的证据强度明显不同。

报表还应保留题目版本和评分规则。若题库更新或难度调整,跨期曲线必须标注断点,不能把测量工具变化误认成学习变化。

反馈数量不能代替反馈质量

平台常把“教师发送了多少条评论”当成反馈强度。数量能说明工作量,却不能说明信息是否对准学习目标。十条笼统的“继续努力”,可能不如一条指出错误概念并要求重新解释的反馈。

反馈时间也没有单一最优答案。太晚可能错过修改机会,太快又可能在学生尚未充分尝试前提供答案。应根据任务难度、错误风险和学生是否还能独立修正来决定,并记录实际时间。

反馈是否被打开也只是行为指标。学生打开页面,不表示读懂或采用。可以要求提交修改说明、标出改变的推理步骤,或在后续题中观察同类错误是否减少。

教师之间的反馈标准也可能不同。若平台比较班级,需要先明确共同目标与评分示例,并允许专业判断。把字数或点击数设成硬性绩效,容易诱发大量低价值评论。

公平性会影响谁能完成第二次测验

重复测验常在课后线上进行。设备、网络、安静空间、照护责任和可用时间会影响谁能回来重做。若只看第二次完成者,资源不足的学生可能被系统性排除。

辅助技术兼容性同样重要。键盘操作、屏幕阅读器、字幕、额外时间和题目语言都会改变可访问性。分数差异若来自界面障碍,不应被解释成知识差异。

报告可按是否获得足够作答机会检查缺失模式,但不应公开识别个别学生。发现某组完成率较低时,先检查安排和访问条件,再讨论动机。

形成性评估的目标是让证据改善后续教学。若测量设计只让最容易参与的人留下数据,就会让教学调整偏向已有优势者。

什么时候可以说“更可能学会”

最强的说法需要多种证据方向一致:学生在原题上改正错误,在延后测试仍能独立提取,在未见过的新题中能解释或应用,作品质量也支持同一结论。

还要排除明显替代解释。题目不能提前泄露,评分规则不能在两次之间无记录改变,参与者差异和缺失要被说明。若有合理对照,因果判断会更稳。

证据不完整时,可以报告较窄结果。例如“学生在收到概念反馈后,第二次原题正确率提高”,这是真实、可复查的观察;把它扩成“长期学习显著提升”则越过现有证据。

好的教育报告不是永远拒绝结论,而是让结论大小匹配测量范围。即时、延后与迁移三层都通过时,“已经学会”的说法才更有根据。

一套可执行的检查顺序

先写学习目标,明确希望学生在何时、何种情境下做什么。随后选择最贴近目标的任务,并准备不同于训练题的等值项目。

第一次随堂测验用于发现缺口。提供反馈后,让学生解释并修改,再把结果用于下一次教学。即时重做只记录为练习过程,不承担最终掌握结论。

经过合适间隔后,用锚定题与新题组成延后测试。锚定题观察保持,新题观察迁移。若目标包含真实表现,再加入案例或作品。

分析时同时报告题目数、参与者、缺失、反馈、间隔和题目版本。解释结果时区分观察、推论和不确定性。

形成性评估是收集、解释并使用学习证据来调整后续教学的过程。重复原题后的分数上升,可能同时包含学习、反馈、题目记忆与界面熟悉。即时分数回答当前任务表现,延后测试观察保持,新情境任务观察迁移。只有把三者分开,随堂测验才会从漂亮曲线变成真正可用的学习证据。

资料来源

  • 美国教育部教育科学研究所:《Formative assessment and elementary school student academic achievement: A review of the evidence》,发布或更新于 2017-01-01
  • Education Endowment Foundation:《Teacher Feedback to Improve Pupil Learning》,发布或更新于 2021-06-11

参考资料

  • 美国教育部教育科学研究所,《Formative assessment and elementary school student academic achievement》,2017年1月。
  • Education Endowment Foundation,《Teacher Feedback to Improve Pupil Learning》,2021年6月11日。