找回密码
 立即注册
搜索
热搜: AI AGI ASI
ASI111-AI AGI ASI社区 门户 首页 AI教育学 查看内容

常模参照与标准参照评价:AGI与ASI在教育测量中的术语辨析

2026-8-26 21:46| 发布者: Linzici| 查看: 2| 评论: 0

摘要: 常模参照与标准参照的根本区别不在"测验长什么样",而在"分数和谁比"——常模参照比的是常模团体中的相对位置(报告为百分等级、标准分),标准参照比的是预先设定的学习标准(报告为合格率、熟练等级或达标/未达标 ...
常模参照与标准参照评价:AGI与ASI在教育测量中的术语辨析
 
常模参照与标准参照的根本区别不在"测验长什么样",而在"分数和谁比"——常模参照比的是常模团体中的相对位置(报告为百分等级、标准分),标准参照比的是预先设定的学习标准(报告为合格率、熟练等级或达标/未达标)。AGI/ASI 时代需要警惕的不是技术能不能算得更准,而是算法不能把"何为好"的定义权从人手里拿走。

一、术语辨析:一对常被混淆的概念

常模参照评价(Norm-Referenced):以个体成绩与同一团体的平均成绩或常模相互比较,确定其成绩的适当等级。本质是相对评价,关注个体在团体中的相对位置和名次。大型标准化考试、升学考试、竞赛性考试、SAT/ACT、多数智商测验都属于此类。
标准参照评价(Criterion-Referenced):以具体体现教学目标的标准作业为依据,确定学生是否达到标准以及达标的程度。本质是绝对评价,关注"学生掌握了什么、能做什么",而不是比较个体差异。教师自编测验、学业水平考试、驾照考试、单元结业考、职业资格认证都属于此类。
二者在四个维度上根本不同:
维度
常模参照
标准参照
参照点
常模团体的平均分
教学目标/预定标准
命题逻辑
追求中等难度(0.3-0.7)、高区分度(≥0.3),删去过难或过易题
题目必须正确反映教学目标要求,难度由标准本身决定
分数分布预期
期望形成正态分布(钟形曲线)
分布无关紧要——全员达标是好事,全员不达标说明教学有问题
报告方式
百分等级、标准分、年级当量
百分比、cut score 之上的达标/未达标、熟练等级(基础/熟练/高级)
💡 关键澄清(IJATE 2026 指南):"常模参照"和"标准参照"描述的是分数解释方式,而非测验本身——同一份测验可以支持两种解释。一个学生数学测验答对 70%,在常模参照下可能因多数人更低而换算成第 85 百分位;在标准参照下可能因 cutoff 设在 75% 而被判为未达标。同一个原始分,解释完全不同

二、AGI/ASI 时代这对术语为什么更重要

生成式 AI 与未来 ASI 对教育测量的冲击,恰恰发生在这对术语的"解释权"上:
对常模参照的冲击:AGI 可以秒级处理大规模数据,动态更新常模群体、实时计算学生在全国/全球样本中的相对位置。但风险也在这里——LibreTexts 2025 指出常模参照的本质目的是"placements, selections, and identifying areas of need",当 AI 可以更"高效"地实施统一排名、更精准地施加标签管理时,评价标准就会被技术逻辑窄化,"何为好"的定义权可能从人让渡给技术模型。福建 2026 年文章把这个风险讲得很透:当系统被大规模应用,其内置的评价标准便开始反过来规训教育实践,教师为了系统认可的指标而教学,学生为了算法认可的表现而学习,"可测量者被等同于重要者,不可测量者则在教育评价的视野中被悄然遮蔽"。
对标准参照的冲击:AGI 可以基于课程标准批量生成达标判定、自动校准 cutoff、动态更新熟练等级。但 cutoff score 的设定从来不是统计问题,而是专业判断问题——IJATE 2026 明确:"cut scores 由教育者与内容专家组成的委员会通过标准设定流程确定,反映的是对'可接受表现'的专业判断,而非学生实际表现"[citation:1 隐含,见 8]。这意味着即使 AGI 能算出最优 cutoff,这个 cutoff 仍必须由人类教育测量专家基于文化传承与社会共识来定——这正是福建 2026 文章强调的"评价标准的制定权牢牢掌握在人手中"。

三、不可让渡的三条边界

边界一:常模群体的界定与标定权不可让渡
常模参照的核心是常模团体——它必须是"具备某种共同特征的人所组成群体的代表性样本",其界定涉及性别、年龄、职业、教育水平、社会经济地位、种族等变量。AI 可以加速常模计算,但常模群体的选择、边界界定、样本代表性判断必须由人类测量专家作出。当 ASI 时代的常模群体可能扩展到跨国、跨语言、跨模态时,这一判断的人类属性只会更强。
边界二:标准参照的 cutoff 与标准设定不可外包
标准参照的 cutoff score 设定是专业判断,不是数据拟合。AI 可以基于 IRT 给出参数估计、可以模拟不同 cutoff 下的分类一致性,但"什么叫熟练、什么叫达标"必须由教育者基于教学目标与社会共识确定。福建 2026 文章的警钟值得铭记:AI 系统"只能识别可量化的指标,只能奖励符合模型预期的行为"——当系统被大规模应用,其内置的评价标准便开始反过来规训教育实践。
边界三:分数解释的终审权不可让渡
无论是常模参照的"第 85 百分位"还是标准参照的"未达标",其最终解释与对学生的反馈必须由人类教师作出。2025 年第四届教育评价学术年会综述明确指出:AI 系统在"评估学生的价值观、道德品质和社会责任感等方面存在明显局限性";若过度依赖,会导致"师生能力惰化"——教师弱化人文观察、精准点评的专业能力,学生丧失自主反思、主动复盘的核心学习能力。

所以这对术语在 AGI/ASI 时代的真正命运可以浓缩为一句话:技术可以极致优化"算"的效率——动态常模、实时 cutoff 校准、多模态标准判定都不在话下——但"常模群体怎么定、cutoff 设在哪里、分数怎么向学生解释"这三件事,必须牢牢掌握在人手中。因为教育评价的本质是"人对人的理解与判断",它承载着教育者对受教育者的理解、期待和责任——这件事,再强大的 ASI 也无法替人类完成。当算法可以秒级生成常模百分位与达标判定的双重报告时,教育测量专家作为"标准制定者"与"分数解释终审者"的角色,反而会升华为教育在 ASI 时代最锋利的护城河。

路过

雷人

握手

鲜花

鸡蛋

最新评论

手机版|ASI111-AI AGI ASI社区 |网站地图

GMT+8, 2026-8-27 02:12 , Processed in 0.034825 second(s), 19 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

返回顶部