研值 YANZ教育测评与学习管理平台
测评方法 · ALGORITHMS & SCORING

同样的分数,
不同的含义

原始分数只说“考了多少”。YANZ 把算法分成两层:当前可报告的本卷事实,以及完成证据包之前不得写入个体结论的研究原型。 有代码不等于可报告;样张中的 IRT、CDM、预测图如果未过闸,只是方法示意。

01 · 核心范式 · 二指标一定位

作答能力,再到定位

测评要回答的不是“算没算总分”,而是:这份作答可靠吗能解释到哪一层下一步做什么。 两个核心指标——本卷表现能力结构——加一个有参照才出现的群体定位,构成“二指标一定位”。 跨卷量表、百分位和预测只有在等值、常模与签署完成之后才能出现。

① 作答与评分
逐题得分 / 客观题选项
缺失、异常与评分复核
② 证据闸门
CTT 题目质量 · 得分率 · SEM
模型仅在标定后进入
③ 可报告字段
本卷事实 · 限制 · 下一步
精度不足则抑制点估计
为什么不能只看总分:同样 75 分,在均分 66 的科目里约处该次群体前 30%,在均分 41 的难卷里却可能是前 2%。 这首先是本卷参照;要用 IRT 做成跨卷可比的能力值,必须完成当次标定、拟合和等值,而不是把研究原型直接印进报告。
02 · 本卷实验室

先看题目质量,
再决定能不能报告

下面是 12 名学生 × 8 道题的合成作答矩阵。点击格子切换 0/1,Cronbach α 与测量标准误即时重算。这是当前可进入描述性报告的 CTT 基线,不是跨卷能力值。

03 · 算法体系 · 先问能不能报告

方法成熟,
不等于已经过闸

YANZ 按“测什么、数据是否够、用户要做什么决定”选用方法。下列卡片保留完整方法目录,并标明当前仓库成熟度:可描述 可进入本卷事实;研究原型 仅受控演示或内部研究;未过闸 不得写入个体结论。

CTT可描述

经典测验理论

难度 P、校正点二列区分度、上下 27% 区分度 D、Cronbach α、测量标准误 SEM——题目与试卷质量的基础体检,也是当前可报告的基线。

→ 题目筛查 · 本卷信度 · 描述性报告
IRT · 2PL研究原型

项目反应理论

用潜在能力 θ 解释作答;EAP 给出点估计与后验标准差,信息量不足时抑制量表分。跨卷可比必须另过等值闸门。

→ 受控研究 · 示意量尺 · 不得单独决策
MIRT未过闸

多维项目反应理论

概念上可估计细分维度的潜在能力。当前仓库未形成可报告实现,雷达图若出现在样张中,应读作本卷标签题得分率,而不是 MIRT 能力。

→ 概念与前提 · 不展示结果
CDM · DINA研究原型

认知诊断模型

借助 Q 矩阵把答题模式反演为知识点掌握概率。缺少足够题目覆盖或未完成 EM/拟合时,不输出“会/不会”标签。

→ 教学与研究 · 真人掌握概率需另签
GRM未过闸

等级反应模型

处理主观题多级评分。当前用于概念教学,不作个体高阶/低阶思维定论。

→ 示意 · 不进入决策
垂直等值未过闸

跨次考试等值

没有锚题设计与等值误差,就只能并列历次原始记录,不能写成“能力成长”。

→ 方案研究 · 隐藏跨卷趋势
LGCM未过闸

潜在增长曲线

估计起点与斜率属于研究问题。不得把样张中的成长曲线写成已验证的升学预测。

→ 受控研究概念
HLM未过闸

多层线性模型

教师净效应需要明确用途、嵌套数据与公平审查。当前不报告对教师的问责数字。

→ 不进入人事决策
XGBoost未过闸

梯度提升预测

上线概率、临界生预警若未完成外部验证与签署,必须抑制。不得宣传“±2%”一类未过闸精度。

→ 研究仿真 · 不写入个体报告
E 值矩阵研究原型

EA×EB 班级分型

整体效能 × 均衡效能可用于校级研究反馈。班级分型必须标注样本、口径与限制,不能替代课堂观察。

→ 校级研究反馈 · 显著限制
推荐未过闸

个性化练习推荐

错题本可以列出本卷未掌握条目;协同过滤推荐在未验证前不自动推送。

→ 本卷错题清单优先
质量闸门可描述

数据质量与抑制规则

缺考、评分不一致、条件 SEM 过大时,字段状态变为 P 或 S。抑制比补一个默认值更正确。

→ 发布闸门 · 报告字段状态
04 · 评分量表 · 能力等级

把能力 θ 翻译成看得懂的等级

当 IRT 当次标定通过且个体后验标准差可接受时,量表分 = 500 + 100 × θ,并必须同时给出区间。百分位 PR 另需明确常模,不得用本卷得分率冒充。 样张里的升学档是解释语言示意,不是已经批准的全省定位。两套等级语言如下:

一 · 统一能力等级(1 / 2 / 3 / 4 / 5 / 5+ / 5++)

这是个人报告与校级报告共用的同一套能力语言——按全省排位百分位 PR 映射到升学录取线,给个体一个"够得着"的目标参照(符合"不排名、不公布",仅个人可见):

1 不上线
2 民办专科
3 公办专科
4 本科线
5 重本线
5+ 211/985
5++ 前千名

个人报告给出本人落在哪一档;校级报告把全校学生按同一套 1–5++ 等级做人数分布与升学出口预测——两份报告等级口径完全一致

二 · 等级 → 自主权限(学力通行证达标认证)

「学力通行证」的自主权限按能力等级分级开放;达标判定不仅看总分:须各核心知识点掌握概率(CDM)达阈值方可认证——这是制度的诚信基石。

1–2 级
未上本科
夯实基础,达标前不开放自主权限。
3 级
专科段
限额开放自主申请,红色预警学科强制基础任务。
4–5 级
本科–重本
开放常规自主申请与变式拓展。
5+ 及以上
211/985+
高自主权限 + 探究 / 竞赛拓展。
05 · 当前可报告,与尚在研究

先交付可核验的本卷事实
再谈模型

仓库里已有真实联考研究数据与 2PL / DINA 原型,也有 CTT、EAP、测验信息量和证据闸门的可运行实现。 这不等于 IRT 量尺、全省百分位或升学预测已经获准写入每一份个体报告。公开页面遵循同一条规则:

  • 现在可以写进报告的:原始分、得分率、题目质量、本卷维度得分率、缺考与数据质量、精度不足时的抑制说明。
  • 现在只作研究或示意的:2PL/EAP、DINA 掌握概率、E 值分型。出现时必须标“示意 / 研究原型”,并给出条件精度。
  • 现在不能对当事人说的:MIRT 雷达即潜在能力、全省/全国 PR、跨卷能力成长、教师净效应、上线率 ±2%。
完整闸门、字段状态与解读口径见 报告 2.0 标准。 研究方法与联考指标见 研究院 · 测评技术; 报告结构见 报告样张