文档目录

第十七章 数据就绪度自评

本文提供二十项数据就绪度自评表,帮助学校判断现有系统与报表是否具备支撑数据判断的地基,并给出评分解读与采购答疑用法。

  • 数据四道关有先后:先归位、再定口径、再分级、最后落到责任
  • 二十项分五组:归位、唯一性与来源、口径、分级安全、治理生命周期
  • 10至14项是多数学校区间,应先补一张签字的指标字典
  • 9项以下先做三件事:名册归位、拦住唯一性、记下来源
  • 第12项与第18项买不到,只能由学校自己签发责任人

前三篇讲了不少能力。能力清单看完,一所学校其实还是答不出那个最要紧的问题:我们学校现在到底能不能拿数据做判断?

所以给一张表。二十项,五项一组,每项只答"是/部分/否"。

这张表不是考系统,是考准备度。 它假设学校已经有一套迎新系统——有报表、有大屏、每年也在导名单。表要量的是这些东西底下有没有地基。

17.1 从"有记录"到"能做判断",中间有四道关

第一道:归位。 所有业务数据是否挂在同一个学生主记录上;一个人是不是只有一份进度;学院、批次、组织是不是切视图而不是复制数据。归位没过,后面每一次统计都要先做一次人肉合并。

第二道:口径。 每个"率"有没有唯一算法,分母是谁、量纲是什么、由谁解释。口径没过,第一次汇报会就把所有结论推翻。

第三道:分级。 哪些字段能拿去算、哪些只能人看、哪些要单独同意、哪些不能出系统。分级没过,数据要么全员可看、要么没人敢用。

第四道:负责。 一列数据有没有主责部门,改动能不能还原到人,出去有没有留痕,过期有没有退役动作。这关最软,也最硬——它决定前三关明年还在不在。

四道关不是并列的,是有先后的:先归位,再定口径,再分级,最后落到责任。 顺序颠倒的结果很常见——先做了一块大屏,再回来吵分母是什么。

17.2 二十项自评表

A 组|数据归位

  1. 全校新生只有一份主记录,同一个人不会因导入两次变成两个人。
  2. 学院、批次、组织是通过授权范围切视图,不是各自复制一份名单。
  3. 组织架构(学院/专业/班级)可从导入自动建树,不靠人工一层层录。
  4. 一个学生的全部迎新信息(身份、采集、任务、缴费、体检、住宿、行程)可以在一处看全。

B 组|唯一性与来源

  1. 身份证号重复在导入当场被拦下,不是导完再清理。
  2. 关键关联关系有强制唯一保障,不靠操作规范维持。
  3. 每一条数据能看出它是从哪个来源进的(接口同步/批量导入/本人填报/管理端录入)。
  4. 关键信息带采集时间与采集人,能区分"招办给的号"与"他自己改的号"。

C 组|指标口径

  1. 报到率、任务完成率、缴费率这类常用指标有一份书面定义。
  2. 每个率的分子、分母写死,含不含走读、保留资格、已退档都写明。
  3. 同一个指标在不同视图里的量纲一致(都是小数,或都是百分数)。
  4. 每个指标有一个能对外的解释人,争议时有人定它。

D 组|分类分级与安全

  1. 敏感字段有一列一列的清单,不停在"学生信息属敏感数据"这句话上。
  2. 数据离开系统的出口(页面、名单导出、记录留存)处理方式一致。
  3. 敏感字段采集时有单独告知与同意,且同意可撤回。
  4. 导出走审批、有用途登记、文件带水印、记录长期留存。

E 组|治理与生命周期

  1. 关键值的修改留有改前改后两值,能回答"从哪个改成哪个"。
  2. 有一张字段责任表,写明每一列由哪个部门主责、冲突以谁为准。
  3. 完整率、冲突率、异常率三项可观测,不只是出问题再查。
  4. 一届数据有明确的保留年限与退役动作(封存、去标识化、注销流程)。

17.3 打完分之后怎么读

20 项全"是"的学校,接下来的内容比这张表更要紧——直接去读智能化那五章,那里的门槛在别处。

15 项以上:地基在,缺的是收尾。通常缺 D 组与 E 组——分级与生命周期。这两组不影响今天办业务,影响三年后敢不敢继续用。

10 到 14 项这是大多数学校的区间,也是最适合从 C 组下手的区间。 归位勉强过关、口径没有统一,此时做任何分析都会在第一场会上被质疑。先补一张签字的指标字典,成本最低、见效最快。

9 项以下:暂时不要把力气放在报表和大屏上。在 A、B 两组补齐之前,任何一张图都可能是在放大错误。 这一年该做的是三件事:把名册归位、把唯一性拦住、把来源记下来。

有一项要单独说:第 12 项和第 18 项,几乎全中国的学校第一遍打都是"否"。 这两项不是花钱买系统能解决的,它们分别要求"有人对数字负责"和"有人对字段负责"。买不到,只能定。

17.4 五种常见误判

有报表 ≠ 有数据资产。 报表是每年重新做一次的产物,数据资产是不重做也能得到同一个数的东西。区别在于:报表底下有没有一份能追溯的原始记录。

有大屏 ≠ 有口径。 大屏是把数摆到一块画面上,画面越漂亮,口径问题越容易被盖住。判断方法很朴素:挑一个数问"分母是谁",屏幕上答不出来,就不算有。

能导出 ≠ 有数据主权。 主权是两半:拿得走,以及每一次被拿走都知道是谁拿的。只有前一半的系统,防住了厂商绑定,没防住内部扩散。

采集得多 ≠ 画像准。 多采十列,如果值域没收敛、来源不可分,画像的可用性不升反降——因为可用的判断必须建立在能对得上的字段上,而不是字段多。

上了线 ≠ 治理了。 系统上线是治理的可能起点,不是完成。真正的标志只有一个:出现一个错的数据时,多久能找到它从哪来、还能不能防止它再来一次。

17.5 这张表,我们自己打

一张只让学校打的表没有说服力,所以同样二十项,我们也给自己打。结果先摆出来:二十项里能勾"是"的是 4 项(第 1、2、3、5 项),第 12 与第 18 项不该由厂商作答,其余 14 项全是"部分"或"在建"。 没打满的这些项列在下面。

我们的实情对应处
4 一处看全学生本人可看;工作人员侧的跨域汇总视图在建第十六章
6 强制唯一少数关联关系尚无强制约束,补齐排在批次里第十四章
7、8 来源与采集痕迹来源标记只区分两类、导入统一归"手工",采集人与采集时间两列待补第十五章
9 至 11 口径三件报到率分母为已导入名册的应到数,两种分子判定并存,量纲曾不一致第十四章
13、14 标签与出口遮盖能力已实现但只在一处生效,字段级标签与统一出口在建第十三章
15 单独同意与字段标签同批,先有标签才判得出哪些字段需要第十三章
16 导出治理有发起记录、无审批与水印,四件套按批次建设第十三章
17 改前改后值留痕记到人、时间、动作,两值未进链路第八、十五章
19 质量看板缺项与重复可查,三项比率的看板与字典同批第十五章
20 生命周期归档、去标识化、注销流程不在当前版本范围内第十五章

这十行覆盖十四项,也就是全书前面所有"按批次建设"的汇总位置。一份白皮书最该被读的不是它说自己做了什么,是它愿意把自己没打满的那几格写在同一张表里。

第 12 项与第 18 项我们不给自己打分——那是学校的动作,不是厂商的功能。这两项也是这张表里唯一两行:花多少钱都买不来,只能由学校自己签发一次。

17.6 把这张表用在采购里

最后给一个实际用法。

招标答疑或现场演示时,把二十项交给参评的每一家,要求逐条答"是/部分/否",并且**"是"必须指到具体功能位置,"部分"必须说清缺哪一段。** 一份这样的答卷,比十场产品介绍有用:同一张表收上来四五份,差别自然浮出纸面。

答"全部是"的那一家要格外追问——二十项里凡是涉及治理与责任的,很难有系统能独自做到全"是"。答得越满,越说明它没读懂这张表在问什么。