从作答到能力,再到定位。
测评要回答的不是“算没算总分”,而是:这份作答可靠吗、能解释到哪一层、下一步做什么。 两个核心指标——本卷表现与能力结构——加一个有参照才出现的群体定位,构成“二指标一定位”。 跨卷量表、百分位和预测只有在等值、常模与签署完成之后才能出现。
先看题目质量,
再决定能不能报告。
下面是 12 名学生 × 8 道题的合成作答矩阵。点击格子切换 0/1,Cronbach α 与测量标准误即时重算。这是当前可进入描述性报告的 CTT 基线,不是跨卷能力值。
方法成熟,
不等于已经过闸。
YANZ 按“测什么、数据是否够、用户要做什么决定”选用方法。下列卡片保留完整方法目录,并标明当前仓库成熟度:可描述 可进入本卷事实;研究原型 仅受控演示或内部研究;未过闸 不得写入个体结论。
经典测验理论
难度 P、校正点二列区分度、上下 27% 区分度 D、Cronbach α、测量标准误 SEM——题目与试卷质量的基础体检,也是当前可报告的基线。
项目反应理论
用潜在能力 θ 解释作答;EAP 给出点估计与后验标准差,信息量不足时抑制量表分。跨卷可比必须另过等值闸门。
多维项目反应理论
概念上可估计细分维度的潜在能力。当前仓库未形成可报告实现,雷达图若出现在样张中,应读作本卷标签题得分率,而不是 MIRT 能力。
认知诊断模型
借助 Q 矩阵把答题模式反演为知识点掌握概率。缺少足够题目覆盖或未完成 EM/拟合时,不输出“会/不会”标签。
等级反应模型
处理主观题多级评分。当前用于概念教学,不作个体高阶/低阶思维定论。
跨次考试等值
没有锚题设计与等值误差,就只能并列历次原始记录,不能写成“能力成长”。
潜在增长曲线
估计起点与斜率属于研究问题。不得把样张中的成长曲线写成已验证的升学预测。
多层线性模型
教师净效应需要明确用途、嵌套数据与公平审查。当前不报告对教师的问责数字。
梯度提升预测
上线概率、临界生预警若未完成外部验证与签署,必须抑制。不得宣传“±2%”一类未过闸精度。
EA×EB 班级分型
整体效能 × 均衡效能可用于校级研究反馈。班级分型必须标注样本、口径与限制,不能替代课堂观察。
个性化练习推荐
错题本可以列出本卷未掌握条目;协同过滤推荐在未验证前不自动推送。
数据质量与抑制规则
缺考、评分不一致、条件 SEM 过大时,字段状态变为 P 或 S。抑制比补一个默认值更正确。
把能力 θ 翻译成看得懂的等级。
当 IRT 当次标定通过且个体后验标准差可接受时,量表分 = 500 + 100 × θ,并必须同时给出区间。百分位 PR 另需明确常模,不得用本卷得分率冒充。 样张里的升学档是解释语言示意,不是已经批准的全省定位。两套等级语言如下:
一 · 统一能力等级(1 / 2 / 3 / 4 / 5 / 5+ / 5++)
这是个人报告与校级报告共用的同一套能力语言——按全省排位百分位 PR 映射到升学录取线,给个体一个"够得着"的目标参照(符合"不排名、不公布",仅个人可见):
个人报告给出本人落在哪一档;校级报告把全校学生按同一套 1–5++ 等级做人数分布与升学出口预测——两份报告等级口径完全一致。
二 · 等级 → 自主权限(学力通行证达标认证)
「学力通行证」的自主权限按能力等级分级开放;达标判定不仅看总分:须各核心知识点掌握概率(CDM)达阈值方可认证——这是制度的诚信基石。
先交付可核验的本卷事实,
再谈模型。
仓库里已有真实联考研究数据与 2PL / DINA 原型,也有 CTT、EAP、测验信息量和证据闸门的可运行实现。 这不等于 IRT 量尺、全省百分位或升学预测已经获准写入每一份个体报告。公开页面遵循同一条规则:
- 现在可以写进报告的:原始分、得分率、题目质量、本卷维度得分率、缺考与数据质量、精度不足时的抑制说明。
- 现在只作研究或示意的:2PL/EAP、DINA 掌握概率、E 值分型。出现时必须标“示意 / 研究原型”,并给出条件精度。
- 现在不能对当事人说的:MIRT 雷达即潜在能力、全省/全国 PR、跨卷能力成长、教师净效应、上线率 ±2%。