我的证据、我的选择
60 秒摘要、代表题、事实与假设分栏、两个行动候选、复查日期,以及“我不同意/数据有误/需要帮助”的入口。
报告 2.0 的目标不是堆叠算法名,而是建立一条客户能理解、专业人员能审计的证据链:我参加了什么、发生了什么、能解释到哪里、下一步怎样验证。
所有版本都从同一结构化数据和声明库生成。学生看到事实、选择与反例入口;家长看到参照、限制与支持方式;专业人员看到字段来源、模型、误差、失败闸门和审计记录。
60 秒摘要、代表题、事实与假设分栏、两个行动候选、复查日期,以及“我不同意/数据有误/需要帮助”的入口。
说明参照总体、覆盖和不确定性;提供可说/禁说对照与支持性提问,不把一次结果变成家庭审判。
显示版本护照、方法、拟合、精度、常模、等值、公平、AI/OCR 记录,以及每一个被抑制结论的原因。
默认先给身份、读法、摘要和行动;模型、参照与趋势只在相应证据通过时出现。条件模块失败时要解释“为什么当前不报告”,不能用空图或默认值代替。
| 页 | 用户问题 | 主要内容 | 条件与边界 |
|---|---|---|---|
| 01–03 | 这是谁的报告?怎样读?最重要的是什么? | 身份与来源水印;观察/派生/模型/假设/行动标签;三条摘要。 | 合成、试点、正式必须机器可读;每句摘要关联声明 ID。 |
| 04–06 | 整体、维度和题目发生了什么? | 原始分与作答覆盖;有题数的维度证据;3–5 道代表题。 | 低覆盖不排名;模型未过闸只保留可重算事实。 |
| 07–08 | 可能为什么?下一步做什么? | 事实/假设/反例;1–3 个共同行动及复查日期。 | 假设永不自动升级为事实;行动需学生参与,可撤回。 |
| 09–10 | 与谁相比?是否真的变化? | 有合格常模时显示位置;有等值与误差时显示趋势。 | 无适用参照则隐藏 PR;未等值只并列历次记录。 |
| 11–12 | 哪些不能解释?有异议怎么办? | 被抑制模块、补证方式、teach-back、更正/申诉/删除/支持。 | 权利入口失效即阻断发布;旧报告更正后标记被替代。 |
| A1+ | 专业人员如何复核? | 字段护照、模型卡、题表、质量闸门、哈希、签署和撤回记录。 | 按授权访问,不与客户正文混写。 |
复杂模型不会自动提升证据等级。每个字段要依次回答用途、身份、数据、构念、模型、精度、可比性、公平性与运行理解问题;任何一关失败,都有明确降级或抑制动作。
为谁、支持什么决定、谁能看;用途不清时阻断。
人员、试卷、评分、题库、模型和报告模板必须相配。
逐题可重算;缺失、OCR、异常和评分争议都有状态。
任务与蓝图能否代表拟议解释;不足时不报子分或等级。
收敛、拟合、参数误差、局部依赖和复现都要检查。
点估计与条件区间同显;跨切点时不强制归档。
等值、链接、常模或标准设置不足时隐藏趋势、PR 与等级。
DIF、群体适配、语言、便利与设备影响需按用途复核。
用户能否正确复述;生产能否监控、暂停、更正和撤回。
研发成熟度与本份报告字段状态分别管理。AM0–AM2 可用于概念、合成演示或受控研究;只有 AM4 且本份报告通过全部相关闸门,字段才可能进入已核验呈现。
| 成熟度 | 定义 | 允许环境 | 客户报告最高呈现 |
|---|---|---|---|
| AM0 | 概念、说明或计划 | 方案讨论 | 不展示结果 |
| AM1 | 静态、合成或近似演示 | 教学和版式演示 | 只可显著标“示意” |
| AM2 | 有代码与部分数据,验证/治理未完整 | 受控研发 | 不作个体决定 |
| AM3 | 流水线与验证包完整,待独立复核 | 影子运行/有限试点 | 试点估计+显著警示 |
| AM4 | 按总体、用途、语言、版本和有效期签署 | 批准范围生产 | 逐份过闸后可核验呈现 |
本轮仓库审阅尚未发现达到 AM3/AM4 的测量模型证据包。现阶段应优先产品化原始计分、得分率、透明的题目/维度描述、数据质量、证据状态和行动复盘;IRT、PR、DINA、跨卷趋势、CAT 与预测仅在各自证据包完成后分范围开放。
字段状态不靠颜色猜。四种状态直接决定最高呈现方式;低状态不能被“高置信度”或 AI 文案升级。
可以显示,但仍需同时说明口径、限制、版本与适用范围。
显著警示;不可单独驱动决定,也不能说成正式个体结论。
不代表真人;水印、元数据和导出物必须保持相同标识。
抑制数值或图表,并用普通语言说明缺少什么和下一步。
只有报告字段、状态与边界稳定,解读师课程、考题、口播稿和公开课才不会互相矛盾。下一步可先打开完全合成的 Report 2.0 样板,再查看完整课程与八条端到端流程。