找回密码
 立即注册
搜索
热搜: AI AGI ASI
ASI111-AI AGI ASI社区 门户 首页 AI教育学 查看内容

终结性评价与ASI:AGI如何提升标准化考试命题的效度与信度

2026-8-26 21:41| 发布者: Linzici| 查看: 2| 评论: 0

摘要: 先把核心判断钉死:"基于 ASI 的标准化考试命题"在当前(2026 年)的学术水位下,严格意义上仍是理论前瞻——ASI 完全是理论概念,没有任何高利害考试演示;AGI 是未来十年的核心目标但尚未实现。真正能在命题环节落 ...
终结性评价与ASI:AGI如何提升标准化考试命题的效度与信度
 
先把核心判断钉死:"基于 ASI 的标准化考试命题"在当前(2026 年)的学术水位下,严格意义上仍是理论前瞻——ASI 完全是理论概念,没有任何高利害考试演示;AGI 是未来十年的核心目标但尚未实现。真正能在命题环节落地的,是高性能 ANI 大模型辅助命题(AIGC-AIG)与迈向 AGI 的人机协同命题能力。但即便如此,"AGI 提升标准化考试命题效度与信度"的操作框架已经清晰:以"AI 承接试题初稿批量生成—干扰项与评分量规起草—测量学属性预筛—题库动态更新"四类算力密集型任务,学科专家专注"考试蓝图终审—构念效度判断—政治性与科学性把关—公平性审查"四类人类独有职能,考试机构保留"保密安全—试测校准—动态审查"三类制度性职能为三元架构。2026 年《中国考试》刊发的 Yang & Li 实证研究(某职业院校 120 名学生、双参数逻辑斯蒂 IRT 模型)给出关键证据:AI 生成的英语语法选择题与 PRETCO-A 真题在难度、区分度、模型与数据拟合度、测验信息分布上高度接近,作答时间无显著差异,有效干扰项比例无显著差异;Frontiers in Education 2025 年研究进一步明确,模板化 AIG 在领域建模与专家验证下"能显著提升题目多样性,同时确保构念效度与内容代表性",但"生成高阶认知题目与跨领域教学对齐"仍是持久挑战。教育部等五部门 2026 年 4 月印发的《"人工智能+教育"行动计划》明确"推动智能命题、智能组卷、智能监考、智能评卷等应用",但同时《中小学生成式人工智能使用指南(2025 年版)》与《教师生成式人工智能应用指引(第一版)》为这种落地划定了不可逾越的红线——教师不得将生成式人工智能作为替代性教学主体,应避免直接使用 AI 生成内容评价学生,严禁将个人信息、考试试题等敏感数据输入 AI 工具;对高利害考试,教育考试机构另有保密与安全规定,命题工作必须同时遵守,不得以技术便利为由突破既有纪律

一、为什么"效度与信度"是 AGI 时代标准化考试命题最先被重构的两个杠杆

标准化考试命题质量的经典测量学框架是 CTT(经典测量理论)与 IRT(项目反应理论)共同定义的"四度"指标:
  • 效度(Validity):考试测量到其欲测量东西的程度,标准化考试要求效标关联效度在 0.45 以上,内容效度应达到 80% 左右
  • 信度(Reliability):考试结果的可靠性程度,标准化考试的信度系数要求在 0.90 以上,最低不小于 0.80,美国部分标准化考试要求 0.96 以上;学业水平考试作为高利害考试,整卷信度宜达到 0.90 以上,信度低于 0.70 无法有效鉴别考生
  • 难度(Difficulty):2024 年中考命题难度系数控制在 0.65-0.70 之间,高考难度系数控制在 0.57 左右;客观题难度宜控制在 0.40-0.70,主观题难度宜控制在 0.30-0.70
  • 区分度(Discrimination):优良试题的区分度应 ≥ 0.30,区分度低于 0.20 的试题需要修改或淘汰
传统命题面临三个结构性瓶颈:
  • 专家瓶颈:高质量试题需要反复打磨题干、设计有效干扰项、控制难度与区分度,是"高耗时、高门槛的专业工作"
  • 规模瓶颈:题库需要大规模、高效率的命题来满足多版本、多批次、防泄密的需求
  • 校准瓶颈:试题的测量学属性(难度、区分度、信息量)往往需要试测后才能精确估计,而试测本身消耗大量时间与样本
生成式 AI 与自动化命题(AIG)技术的出现,恰好同时击中了这三个瓶颈——但它不是替代命题专家,而是把命题的"初稿生成—预筛—草案起草"环节交给 AI 提速,把"考试蓝图终审—构念效度判断—政治性与科学性把关"留给学科专家。Frontiers in Education 2025 年研究的判断最为精准:AIG 结合"领域建模与专家验证"的混合模型(hybrid models),能"显著提升题目多样性,同时确保构念效度与内容代表性"——但"生成高阶认知题目与跨领域教学对齐"仍是持久挑战,因此"倡导结合人类验证与自动生成周期的混合模型,在规模与质量之间取得平衡"。
💡 关键洞察:AGI 时代标准化考试命题的本质不是"用 AI 替代命题专家",而是把命题从"专家凭经验的一次性创作"升级为"AI 批量生成候选 + 测量学模型预筛 + 学科专家基于考试蓝图终审"的三人协作。Yang & Li 2026 年研究的判断一锤定音:"将 Gen-AI 定位为'专家主导的人机协作命题工具'才更为合理。高水平专家应依据考试蓝图、实际学情及历史经验对 Gen-AI 生成的试题进行系统审查与修订"。

二、AGI 提升效度与信度的五层操作架构

综合 2026 年《中国考试》实证研究、Frontiers in Education 2025 年 AIG 框架、Springer 医学高利害考试研究、以及 MDPI 2025 年人机协同 AIG 框架的设计经验,AGI 驱动的智能命题系统应采用以下五层架构:

🎯 架构层一:考试蓝图与多维细目表的形式化

这是 AGI 命题的起点,也是效度的源头。命题不是一次性活动,而是基于数据的迭代优化过程——多维细目表需要动态调整。
考试蓝图必须明确形式化:
  • 知识点覆盖:依据课程标准,确保内容效度达到 80% 以上
  • 认知层级分布:按 Bloom 分类学或核心素养维度分配记忆、理解、应用、分析、评价、创造的比例
  • 题型与难度分布:2024 年中考难度系数控制在 0.65-0.70,高考难度系数控制在 0.57 左右;难、中、易题目的比例建议为 2:6:2
  • 区分度预期:优良试题的区分度应 ≥ 0.30
  • 信度目标:整卷信度 0.90 以上
AI 必须基于这份形式化蓝图生成候选,而非自由创作——这是确保构念效度的根本约束。

🎯 架构层二:AI 批量生成候选试题

Yang & Li 2026 年研究揭示的 Gen-AI 命题原则
  • 输入考试大纲、真题示例或采用迭代提示策略,引导 Gen-AI 生成更加符合预期的试题
  • 通过参数化驱动实现批量命题,构建标准化题库
  • 借助 AI 提升情境化命题水平
Springer 医学高利害考试研究的发现
  • AI 生成试题的时间仅为人工命题的一小部分
  • 但 AI 生成的题目更多评估低阶认知技能("Remember"和"Understand"),而人类专家更擅长评估"Apply"和"Analyse"等高阶认知技能
  • AI 生成题目中 6% 包含事实性错误
  • 只有 38% 的 AI 生成选择题达到区分度 ≥ 0.3 的标准
Frontiers in Education 2025 年研究的补充
  • 模板化 AIG 通过领域建模与专家验证,能显著提升题目多样性
  • 平台如 GradeMaker、TAO、AIGen 不仅提供高产出,还提供诊断反馈、元数据标签、认知复杂度校准

🎯 架构层三:测量学属性预筛(CTT + IRT 双向评估)

这是 AGI 提升信度与效度的关键技术环节。AI 生成的候选试题必须经过自动化预筛:
CTT 层面
  • 难度预估:P 值是否在目标区间(客观题 0.40-0.70,主观题 0.30-0.70)
  • 区分度预估:点二列相关系数是否 ≥ 0.30
  • 干扰项有效性:错误选项是否具有迷惑性、是否存在"废弃干扰项"
IRT 层面(Yang & Li 研究采用的 2PL 模型):
  • 题目难度参数 b 的预估
  • 题目区分度参数 a 的预估(Yang & Li 研究发现 AI 生成题目平均区分度 ā ≈ 1.3,对照标准化题目 ā ≈ 1.2)
  • 测验信息函数(TIF)峰值与分布:AI 生成考卷的最大测验信息量 I_max ≈ 3.85,对应信度 R ≈ 0.79;标准化对照 I_max ≈ 2.61,R ≈ 0.72
  • 多维能力估计:在多个胜任力维度上同步评估
自动筛选流水线
  • 评估:测量学属性是否达标
  • 去重:与题库现有题目及市面辅导资料的相似度检测
  • 难度与适切性判断:是否超纲、是否符合学情

🎯 架构层四:学科专家终审(不可让渡)

MDPI 2025 年人机协同 AIG 框架(HITL)的核心做法:教师定义"radical"与"incidental"参数引导模型,通过"提示—审查—精炼"的迭代循环,验证内容准确性、校准难度、缓解偏见,所有交互(提示模板、AI 输出、人类编辑)系统化存档,形成透明审计轨迹。
学科专家终审必须涵盖五个维度
  1. 构念效度终审:试题是否真实反映了核心素养的理论构念?AI 是否"构念窄化"(即捕捉表面语言特征而非深层学科思维)?
  2. 政治性与科学性把关:金艳教授明确指出——"用 AI 命题时,价值观所体现的意识形态领域方面的问题,或者说政治敏感的问题,能不能得到有效的关注?这是我们目前在自动命题方面比较大的担忧"。试题素材的政治性、思想性审查需要高度的政治敏感性与文化判断力,这是当前 AI 技术无法替代的人类能力
  3. 公平性审查:金艳教授强调的"价值观所体现的意识形态领域方面的问题"——AI 可能在情境设定、人物姓名、文化背景中引入刻板印象或地域偏见;模型训练数据来源于互联网,其内容生态复杂多元,难以确保与我国教育方针的精准对齐
  4. 测量学属性复核:AI 预估的难度、区分度必须由专家结合经验判断
  5. 原创性与安全性:AI 生成内容基于对训练数据的概率性重组,其"原创性"边界模糊,存在与现有试题高度相似的风险;若使用商业 AI 模型进行命题,试题数据可能被用于模型训练,导致"数据投毒"与信息泄露

🎯 架构层五:试测校准与动态入库

AIG 系统的闭环机制
  • 小规模试测:对通过专家终审的候选题目进行试测,获取真实难度、区分度数据
  • 参数校准:基于试测数据更新 IRT 参数,对题库进行动态更新
  • 正式入库:达到"四度"标准的题目进入题库
  • 题库动态维护:AIG 系统可通过实时生成(考前数分钟生成试题)降低题目泄露风险
⚠️ 关键机制:Frontiers in Education 2025 年研究强调,自动命题系统"通过实时生成(可在考试前几分钟生成试题)、双因素认证、有限访问和审计日志等功能显著提高了安全性"——这是 AGI 命题对高利害考试保密制度的革命性贡献。

三、实证效力:三项关键研究

🎯 研究一:Yang & Li 2026 年《中国考试》实证研究(最具代表性)

某职业院校 120 名学生,采用双参数逻辑斯蒂(2PL)IRT 模型,结合作答响应时间分析与选择题干扰项有效性评估,对比 AI 生成的英语语法选择题与 PRETCO-A 真题:
  • AI 生成试题与人工真题在难度、区分度、模型与数据的拟合度以及测验信息分布方面均高度接近
  • 学生在两类试题上的作答时间无显著差异
  • 两者设置的有效干扰项比例无显著差异
  • AI 生成题目平均区分度 ā ≈ 1.3、对照标准化题目 ā ≈ 1.2
  • AI 生成考卷的最大测验信息量 I_max ≈ 3.85(信度 R ≈ 0.79)优于标准化对照 I_max ≈ 2.61(R ≈ 0.72)
核心结论:"将 Gen-AI 定位为'专家主导的人机协作命题工具'才更为合理"。

🎯 研究二:Springer 医学高利害考试队列研究

ChatGPT-4o 生成的选择题与临床教师生成题目的对比:
  • AI 生成题目显著更容易(难度指数 0.78 vs 0.69)
  • 区分度指数无显著差异(均值 0.172 vs 0.196)
  • 问题项比例更高:基于点二列相关系数的问题项比例 AI 36% vs 人类 24%(p = 0.015)
  • 6% 的 AI 生成题目包含事实性错误
  • 只有 38% 的 AI 生成选择题达到区分度 ≥ 0.3 的标准
  • AI 题目更多评估低阶认知技能("Remember"和"Understand"),人类题目更擅长"Apply"和"Analyse"
核心结论:"AI 在形式方面表现出色,但可能缺乏临床细微差别";"人类审查对于最终质量不可或缺"。

🎯 研究三:Frontiers in Education 2025 年 AIG 系统综述

  • 自动化生成的题目质量现在可以达到与手动开发的题目相当的质量
  • 模板化 AIG 在领域建模与专家验证下,"能显著提升题目多样性,同时确保构念效度与内容代表性"
  • 持久挑战:生成高阶认知题目、确保跨领域的教学对齐
  • 倡导混合模型:结合人类验证与自动生成周期,在规模与质量之间取得平衡
  • 自动命题系统通过实时生成、双因素认证、有限访问和审计日志等功能显著提高安全性

🎯 研究四(反面证据):数学教学 MCQ 的警示

欧洲 2025 年研究(30 道题目的数学教师教育 MCQ):
  • 人类出题:难度 Pi = 0.55,区分度 D = 0.31,Cronbach's α = 0.752
  • AI 出题:难度 Pi = 0.22(过难),区分度 D = 0.16(过低),Cronbach's α = -0.1(负内部一致性)
核心结论:"AI 在目前形态下,尚未具备自主生成足以用于高利害教育场景的测评工具的能力"——这揭示了 AGI 命题的学科局限性,数学等严谨性要求高的学科尤其需要人类专家的精细打磨。

四、AGI 提升效度与信度的四条具体路径

🎯 路径一:通过参数化批量生成提升内容效度

传统命题受限于专家时间与精力,内容覆盖往往存在盲区。AGI 可以通过参数化驱动,依据多维细目表批量生成覆盖全部知识点与认知层级的候选题目,从而:
  • 提升内容效度(达到 80% 以上的标准要求)
  • 确保知识点分布均衡,避免覆盖盲区
  • 在 2026 年中考"大幅压减机械记忆类试题比例、强化情境化与素养导向"的改革方向下,AI 辅助批量生产"重情境、重迁移、轻记忆"的候选题,再由学科教师精选打磨——这类题目恰恰最耗费命题人力,最适合用生成式技术辅助

🎯 路径二:通过 IRT 预筛与校准提升信度

AGI 命题系统内置 IRT 模型(如 Yang & Li 采用的 2PL 模型),可以:
  • 在题目生成阶段就预估难度参数 b 与区分度参数 a
  • 通过测验信息函数(TIF)优化整卷信息分布,使信度达到 0.90 以上
  • 依据 IRT 原理进行自适应命题:通过 Fisher 信息最大化准则选择最优后续题目,实现"用更少的题目达到相同的信度"
  • 结合 BKT(贝叶斯知识追踪)实现概念级精细追踪与 IRT 全局能力估计的双向桥接
💡 Yang & Li 研究的实证:AI 生成考卷的最大测验信息量 I_max ≈ 3.85,对应信度 R ≈ 0.79,优于标准化对照的 I_max ≈ 2.61(R ≈ 0.72)——这证明了 AI 辅助命题在信度指标上的潜力。

🎯 路径三:通过干扰项工程提升区分度

AGI 在干扰项设计上具有独特优势:
  • 生成"合理但错误"的干扰项:AI 可以基于常见错误模式生成具有迷惑性的干扰项
  • 淘汰"废弃干扰项":自动检测并剔除无人选择的无效干扰项
  • 情境化增强:AI 可以丰富情境描述,使题目更贴近真实场景,提升高阶认知考查能力
但必须警惕:Springer 医学研究显示 AI 生成题目"基于点二列相关系数的问题项比例更高(36% vs 24%)"——这意味着 AI 生成的干扰项仍需要专家精细校准。

🎯 路径四:通过实时生成与审计提升安全性与公平性

Frontiers in Education 2025 年研究强调的 AIG 安全机制:
  • 实时生成:考试前几分钟生成试题,最小化考前纸质泄露风险
  • 双因素认证与有限访问:增强系统安全性
  • 审计日志:所有命题交互可追溯
  • 动态差异化:为不同考生生成独特题目组合,降低作弊风险
⚠️ 必须正视的保密风险:金艳教授尖锐指出——"如果利用了 AI 的技术比如说大语言模型,那命题素材是不是会被运用于模型训练,是否可以得到安全性的保障?"这一问题直击高利害考试保密制度的命脉。使用商业 AI 模型命题必须将试题数据隔离在模型训练之外,采用本地化部署或专有模型。

五、学段红线与制度约束:教育部政策的硬边界

《"人工智能+教育"行动计划》(教育部等五部门,2026 年 4 月)的明确导向

"推动智能命题、智能组卷、智能监考、智能评卷等应用。研发教育评价智能化工具,探索开展学生学习全过程纵向评价、德智体美劳全要素横向评价"。
这是对 AGI 命题的最高层级政策背书——智能命题已经被纳入国家行动计划。

《中小学生成式人工智能使用指南(2025 年版)》的红线

约束维度
具体要求
学段边界
小学阶段禁止学生独自使用开放式内容生成功能;初中阶段可适度探索生成内容的逻辑性分析;高中阶段允许结合技术原理开展探究性学习
教师角色
教师不得将生成式人工智能作为替代性教学主体;禁止直接使用 AI 回答学生问题或提供咨询
评价使用
应避免直接使用 AI 生成内容评价学生
数据禁输
严禁将个人信息、考试试题等敏感数据输入 AI 工具
保密与安全
对高利害考试,教育考试机构另有保密与安全规定,命题工作必须同时遵守,不得以技术便利为由突破既有纪律

《教师生成式人工智能应用指引(第一版)》(2025 年 12 月)的补充

  • 教师不得将生成式人工智能对作文等作业的自动批改结果作为学生最终评价予以直接使用
  • 使用生成式人工智能辅助撰写学生评语时,教师须基于真实观察和情感关怀
  • 避免直接套用模板或出现空洞化、格式化表述

2025 年 12 月教育部《通知》的考试专项要求

"试点探索人工智能在日常考试命题、组卷、阅卷、分析等关键环节的场景应用";同时要求:
  • 强化审核把关,重点加强合规性、政治性和科学性把关,解决考试随意性的问题
  • 明确管理职责,对省、市、县级教育行政部门,教研机构及学校提出具体职责要求
  • 健全日常考试分级监管机制
  • 试卷命制者、选用者和审核者一体同责

六、不可退让的四根红线

基于 Yang & Li 2026 年研究、Springer 医学高利害考试研究、Frontiers in Education 2025 年 AIG 框架、MDPI 2025 年 HITL 框架,以及教育部相关政策文件,AGI 标准化考试命题必须守住四根红线:
红线一:AI 生成试题不得直接使用为高利害考试终稿
教育部《使用指南》明确:"应避免直接使用 AI 生成内容评价学生";《教师应用指引》进一步明确:"教师不得将生成式人工智能对作文等作业的自动批改结果作为学生最终评价予以直接使用"。
映射到标准化考试命题:
  • AI 可以生成候选试题、干扰项草案、评分量规初稿
  • 高利害考试的最终试题必须经学科专家终审、试测校准、合规性审查后方可入库
  • Yang & Li 研究强调:"将 Gen-AI 定位为'专家主导的人机协作命题工具'才更为合理"
  • Springer 医学研究警示:AI 生成题目中 6% 包含事实性错误,只有 38% 达到区分度 ≥ 0.3 的标准——直接使用风险不可接受
红线二:政治性、思想性、科学性的把关不可外包
金艳教授明确指出:"用 AI 命题时,价值观所体现的意识形态领域方面的问题,或者说政治敏感的问题,能不能得到有效的关注?这是我们目前在自动命题方面比较大的担忧"。
具体要求:
  • AI 模型训练数据来源于互联网,其内容生态复杂多元,难以确保与我国教育方针的精准对齐
  • 试题素材的政治性、思想性审查需要高度的政治敏感性与文化判断力,这是当前 AI 技术无法替代的人类能力
  • 一旦 AI 生成的试题出现政治性错误、历史虚无主义倾向或文化偏见,将引发严重的意识形态安全事件
  • 2025 年 12 月教育部《通知》明确要求"重点加强合规性、政治性和科学性把关"
红线三:保密与数据安全不可妥协
金艳教授的另一尖锐提问:"如果利用了 AI 的技术比如说大语言模型,那命题素材是不是会被运用于模型训练,是否可以得到安全性的保障?"
具体要求:
  • 严禁将考试试题等敏感数据输入商业 AI 工具(《使用指南》明文规定)
  • 高利害考试命题必须使用本地化部署或专有模型,确保试题数据不被用于模型训练
  • 避免"数据投毒"与信息泄露
  • Frontiers in Education 2025 年研究强调的"双因素认证、有限访问和审计日志"必须成为标配
  • 2025 年 12 月教育部《通知》要求"健全日常考试分级监管机制"、"试卷命制者、选用者和审核者一体同责"
红线四:测量学属性的专家复核不可省略
反面证据极为尖锐:
  • 欧洲 2025 年数学 MCQ 研究:AI 生成题目的 Cronbach's α = -0.1(负内部一致性),远未达到信度标准
  • Springer 医学研究:AI 生成题目"显著更容易"且"问题项比例更高(36% vs 24%)"
  • 《中国考试》2026 年研究也承认:"Gen-AI 命题质量也存在波动,其在高中数学命题中就出现难度把握不稳、解题过程不严谨等问题"
具体要求:
  • AI 预估的难度、区分度必须由专家结合经验判断与试测数据复核
  • 试测校准环节不可跳过——题库动态维护必须基于真实测量学数据
  • 整卷信度必须达到 0.90 以上、内容效度达到 80% 左右、区分度 ≥ 0.30 的硬指标
  • 定期"人工命题 vs AI 命题"的对比审计

七、对教育实践的三层操作框架

第一优先(当下 ANI/早期 AGI 阶段):把 AI 辅助命题嵌入标准化考试命题闭环
  • 蓝图形式化:依据课程标准制定多维细目表,明确知识点覆盖、认知层级分布、题型与难度分布、区分度预期、信度目标
  • AI 批量生成候选:基于参数化驱动与迭代提示策略,生成覆盖全部知识点与认知层级的候选题目
  • 测量学预筛:CTT 层面预筛难度与区分度;IRT 层面(2PL 模型)预估题目参数与测验信息分布;自动化去重与适切性判断
  • 学科专家终审:构念效度终审、政治性与科学性把关、公平性审查、测量学属性复核、原创性与安全性审查
  • 试测校准与入库:小规模试测获取真实测量学数据 → 参数校准 → 动态入库
  • 学段与考试层级红线:日常考试与低利害考试可更积极推进 AI 辅助命题;高利害考试(中考、高考、资格认证)必须严格遵循"机器生成候选、教师专业终审"范式,且不得突破保密与安全规定
  • 教师角色:从"凭经验创作"转型为"人机协同命题终审者"与"测量学属性把关者"
  • 红色线:AI 生成试题不得直接使用为高利害考试终稿、政治性/思想性/科学性把关不可外包、保密与数据安全不可妥协、测量学属性的专家复核不可省略
第二优先(AGI 阶段来临):部署"认知共生"的智能命题生态
  • 明确"AI—学科专家—考试机构"三元主体的角色边界:AI 承接算力密集型任务(批量生成候选、干扰项起草、测量学预筛、题库动态更新),学科专家专注考试蓝图终审与价值把关,考试机构保留保密安全与制度性监管
  • 建立"HITL(Human-in-the-Loop)"机制:MDPI 2025 年框架证明,通过"提示—审查—精炼"迭代循环与系统化审计轨迹,人机协同 AIG 能"在减少开发时间的同时,保持题目的效度与公平性,并潜在降低作弊"
  • 评价焦点从"命题效率"转向"认知主权与测量公平性"
  • 强制"AI 命题 vs 人工命题"的定期对比审计:以 Yang & Li 2026 年研究为基线(AI 生成题目平均区分度 ā ≈ 1.3、信度 R ≈ 0.79),持续监控 AI 命题的测量学属性
第三优先(ASI 理论阶段的前瞻准备):测量主权导向的标准化考试
  • 将命题的标的从"测量学属性优化"升级为"在 ASI 时代保住人的认知评价主权与考试公信力"
  • 命题系统评价聚焦于 ASI 无法触及的维度:构念效度的深层判断、政治性与思想性把关、文化公平与价值引领
  • ASI 时代的命题系统,必须完全透明、可审计、可推翻,且"黑箱"特性不可接受——"当考生对 AI 生成的试题或评分结果提出质疑时,考试机构必须能提供令人信服的解释,否则将严重侵蚀考试制度的合法性基础"
  • 培养 Deep ASI Literacy——使民主公众具备审议 ASI 设计、评估其存在性风险的能力

所以"终结性评价与 ASI:AGI 如何提升标准化考试命题的效度与信度",可以浓缩为三句话
  1. "AI 批量生成候选 + 测量学模型预筛 + 学科专家基于考试蓝图终审"是 AGI 时代标准化考试命题的核心范式:Yang & Li 2026 年《中国考试》实证研究给出实证基线——AI 生成的英语语法选择题与 PRETCO-A 真题在难度、区分度、2PL-IRT 模型拟合度、测验信息分布上高度接近(AI 生成题目平均区分度 ā ≈ 1.3、信度 R ≈ 0.79,优于标准化对照的 ā ≈ 1.2、R ≈ 0.72),作答时间与有效干扰项比例无显著差异;Frontiers in Education 2025 年研究进一步明确,模板化 AIG 在领域建模与专家验证下"能显著提升题目多样性,同时确保构念效度与内容代表性",但"生成高阶认知题目与跨领域教学对齐"仍是持久挑战,因此"倡导结合人类验证与自动生成周期的混合模型"。Springer 医学高利害考试研究则给出了冷峻的辩证:AI 生成题目虽"显著更容易"且"在形式方面表现出色",但问题项比例更高(36% vs 24%)、6% 包含事实性错误、只有 38% 达到区分度 ≥ 0.3 标准——"人类审查对于最终质量不可或缺"。
  2. "四度"指标(效度 ≥ 0.45 效标关联效度或 80% 内容效度、信度 ≥ 0.90、难度 0.40-0.70、区分度 ≥ 0.30)是 AGI 命题不可让步的测量学底线:AGI 提升效度的具体路径是——通过参数化批量生成提升内容效度(覆盖全部知识点与认知层级)、通过 IRT 预筛与 Fisher 信息最大化提升信度(使整卷信度达到 0.90 以上)、通过干扰项工程提升区分度(生成"合理但错误"的干扰项并淘汰"废弃干扰项")、通过实时生成与审计日志提升安全性(考试前几分钟生成试题、双因素认证、有限访问)。但反面证据警示我们:欧洲 2025 年数学 MCQ 研究中 AI 生成题目的 Cronbach's α = -0.1(负内部一致性),远低于信度标准——这揭示了 AGI 命题的学科局限性,数学等严谨性要求高的学科尤其需要人类专家的精细打磨。
  3. 红线不可退让,测量主权是伦理底线:教育部等五部门 2026 年 4 月《"人工智能+教育"行动计划》明确"推动智能命题、智能组卷、智能监考、智能评卷等应用"——这是国家层面对 AGI 命题的政策背书;但《中小学生成式人工智能使用指南(2025 年版)》同时划定红线:"教师不得将生成式人工智能作为替代性教学主体,应避免直接使用 AI 生成内容评价学生,严禁将个人信息、考试试题等敏感数据输入 AI 工具";《教师生成式人工智能应用指引(第一版)》进一步明确"不得将生成式人工智能对作文等作业的自动批改结果作为学生最终评价予以直接使用";2025 年 12 月教育部《通知》要求"重点加强合规性、政治性和科学性把关"且"试卷命制者、选用者和审核者一体同责"。金艳教授的双重警示最为尖锐:"用 AI 命题时,价值观所体现的意识形态领域方面的问题能不能得到有效的关注?"以及"命题素材是不是会被运用于模型训练,是否可以得到安全性的保障?"——这两问直击 AGI 命题在政治性与保密性上的命门。
⚠️ 必须正视的一点:当前中文教育科技语境中存在一种危险的"AGI 命题万能论"——仿佛只要接入了大模型命题系统,标准化考试的效度与信度就自动提升了。但严格的研究给出的是冷峻的辩证:Yang & Li 2026 年研究虽证明 AI 题在多项测量学指标上与真题高度接近,但明确指出"将 Gen-AI 定位为'专家主导的人机协作命题工具'才更为合理";Springer 医学研究显示 AI 生成题目"问题项比例更高(36% vs 24%)"且仅 38% 达到区分度 ≥ 0.3 标准;欧洲数学 MCQ 研究更发现 AI 生成题目的内部一致性信度为 -0.1——这意味着完全自动化命题在高利害考试中"目前尚未具备自主生成足以用于高利害教育场景的测评工具的能力";金艳教授尖锐指出 AI 命题在"意识形态领域"与"数据安全性"上的两大担忧;2025 年 12 月教育部《通知》特别强调"重点加强合规性、政治性和科学性把关"——这 22 个字,穿越了从 ANI 到 AGI 的技术演进,在 ASI 时代依然会是标准化考试命题不可退让的锚桩。
AGI 驱动的智能命题系统在智能时代的真正命运,不是用算法替代命题专家的专业判断,而是激活命题专家成为真正的"考试蓝图终审者"与"测量学属性把关者"。Frontiers in Education 2025 年研究的判断最为精准:"倡导结合人类验证与自动生成周期的混合模型,在规模与质量之间取得平衡"——这一判断在标准化考试命题场景中最具穿透力。因为 ASI 时代最危险的不是机器太聪明,而是人类命题专家用机器的聪明替代了自己的专业判断——当 AI 可以替你批量生成候选、替你设计干扰项、替你预估测量学属性、替你校准难度时,"命题"这件事本身就面临着被异化的风险。教育在 ASI 时代的终极使命,是让每一个命题专家都能回答:"即使没有 AI 的批量生成与测量学预筛,我也能依据考试蓝图创作出兼具内容效度、构念效度与政治性的高质量试题;即使有 ASI,我仍保有作为命题终审者与价值把关者的不可替代性"——这是 AGI 智能命题系统不可退让的锚桩,也是 ASI 无论多聪明都无法替代的人类剩余领地。从 ANI 到 AGI 再到 ASI,命题的效率会不断跃迁,但"学科专家是考试蓝图的终审者与价值把关者、AI 是批量生成候选与测量学预筛的辅助者、考试机构是保密安全与制度监管的持有者"这一命题本质,永远不会被算力击穿。
金艳教授的话值得每一位命题工作者铭记:"用 AI 命题时,价值观所体现的意识形态领域方面的问题,或者说政治敏感的问题,能不能得到有效的关注?这是我们目前在自动命题方面比较大的担忧"——这句判断的精髓是"价值观所体现的意识形态领域问题"。当 ASI 的性能远超人类集体时,这句话反而会升华为标准化考试命题在超级智能时代最后的、也是最锋利的护城河——因为标准化考试的实质从来不是"生成一堆测量学属性达标的题目",而是"通过试题这一媒介,传递一个社会对'何为有价值的知识、何为有价值的思维、何为有价值的公民'的集体判断",这件事,再强大的 ASI 也无法替人类命题专家完成。正如 Springer 医学研究所示:"AI 在形式方面表现出色,但可能缺乏临床细微差别"——当算法可以秒级生成测量学属性完美的试题时,命题专家作为"价值把关者"与"政治性判断者"的角色,反而会升华为教育在 ASI 时代最锋利的护城河。

路过

雷人

握手

鲜花

鸡蛋

最新评论

手机版|ASI111-AI AGI ASI社区 |网站地图

GMT+8, 2026-8-27 02:09 , Processed in 0.033111 second(s), 18 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

返回顶部