Isi Kandungan

第十五章 数据治理与质量运营

数据治理的检验标准是出现争议时能否还原"谁、何时、依据什么"写入数据;本文给出补齐来源、操作人、采集时间三列、记录改动前后值,并建立字段责任表与质量看板的落地路径。

  • 治理检验标准:争议时能否还原谁、何时、依据什么写入
  • 依据断在三处:改动值不可见、导入无身份、师生端不留痕
  • 关键字段补来源、操作人、采集时间,改动前后值入留痕
  • 每列数据定主责部门与冲突规则,责任表须学校自己签发
  • 质量看板依赖指标字典,生命周期含归档、保留、注销、去标识化

一位家长打来电话,说孩子的手机号一直是另一个号,学校系统里那个是错的,催办短信发给了不相干的人。学工助理打开系统,看到了这个手机号,看不到的是:这个号是谁什么时候填进去的、是本人改的还是导入带的、要不要改回去。

她只能猜。这是学校数据工作里最普遍的一种处境:大多数争议不是没有答案,是系统里没有那条能给出答案的记录。

治理这件事的检验标准只有一条——出现争议时,能不能还原出"谁、什么时候、依据什么"写了这条数据。 按这一条往下量,就能把已做到的、待补齐的、以及学校现在自己就能办的分开摆清楚。

15.1 还原三要素:人、时间、依据

人是查得到的。 管理端的每一次改动都自动留下记录:哪个人、什么时候、动了哪个功能的哪个动作、从哪个地址来的。这份记录由系统写入,不依赖操作人自觉,也没人能被排除在这条链路之外。少数会带走大量名单的查询动作同样在记录范围内。

时间也在。 每条记录带时间戳,可按人、按功能、按时间段倒查。

"依据"这一环,眼下是断的。 具体差在三处,一处处说:

  • 改了什么看不到。 记录里存的是动作,不含改动前后的值。能查出"某日某人改过某生的联系方式",查不出"从哪个号改成哪个号"。
  • 导入的数据没有身份。 通过批量导入写进去的记录,来源标记目前只区分"接口同步"与"手工录入"两类,所有导入一律落在"手工"这一类里;新生信息上也没有采集人、采集时间这两列。也就是说,一份由招办发来的名单和一个管理员手工敲进去的值,在系统里长得一模一样。
  • 师生端的动作不留痕。 留痕目前覆盖管理侧,学生自己在手机上改了手机号、志愿者代操作了一步,这些不在这条链路里。

这三处加起来意味着:那份"依据",眼下主要靠人脑和聊天记录。 一个助理为什么改这个号,最好的证据往往是她还记得。

15.2 把"依据"补成三条记录

差距要落成能验收的东西,才有意义。三件事:

第一件,关键字段补三列。 来源、操作人、采集时间。这三列不是加字段这么简单——它要求每一个写入路径都带上这三样,包括导入。补齐之后,开头那通电话里助理可以直接答"这个号是他本人在八月十七日自己填的"。

第二件,改动前后值进留痕链路。 敏感字段的修改要留下旧值与新值。这一条与第十三章的字段标签必须一起做:先知道哪些字段算敏感,才谈得上给它们记变更历史。

第三件,留痕不可删、且存得住。 记录本身应当只可追加,且保留期长于业务数据的保留期——争议通常发生在事情过去很久之后。现在有一类临时文件与它的记录会在 12 小时后一并清掉,那属于过程数据,不是治理记录,两者要分开存放。

这三件都在批次上,没有一件是"打开配置就行"。但它们也不是最难的事——最难的是定规矩:谁来对一列数据负责。

15.3 谁的数据谁负责,以及冲突谁来裁

一个字段有争议,最坏的处理方式是"大家商量一下"。商量没有输赢,下次还会吵。

有效的做法是给每一列数据指定一个责任部门,并事先写下冲突时谁说了算。 这份东西在学校这边通常是这样的:

数据主责部门冲突时以谁为准
身份证号、生源地、录取专业招办/学籍核验结果与学籍数据
手机号、家庭住址、紧急联系人本人(学生)本人最新自填
床位、入住与退宿宿管部门宿舍系统的分配结果
缴费、缓缴、绿色通道财务/资助到账与审批记录
体检结论、既往病史校医院医疗侧录入

这就是第七章那条"先定权威性,再谈合并"的制度化版本。权威性不来自哪个部门的电脑更先进,来自谁对这个字段的准确性负责。

系统的角色是把这张表记下来、执行下去:哪个部门的用户改哪几列有权限,改了留痕,冲突时按既定规则提示以谁为准。这一层里已经落地的是权限划分与改动留痕;字段级的归属登记与冲突自动裁决还在批次上,眼下有一部分写在实施约定里,靠执行的人记着。

一句提醒:这张表必须由学校自己签发,厂商不能代签。 代签的那张表在第一次真实争议时就会被推翻。

15.4 质量看板:把"数据好像有问题"变成一句可查的话

治理不能靠家长来电触发。该主动看着的是三项比率。

完整率——必填与关键列的缺失情况。哪一列缺了多少人、集中在哪个学院、集中在哪一批导入。这项在系统里最实在:名册、采集项、任务的完成状态都可以逐列清点,缺项名单是直接可导出的。

冲突率——同一个人身上互相矛盾的值。证件号重复、性别与核验结果不符、一个号挂在多人名下。这类判定一部分在导入时执行并当场拦下,一部分仍要人工比对。

异常率——不合理值的占比,口径见第十四章。

三项现在能算什么、不能算什么,照实说:缺项与重复这两类是可查的;把三项做成持续观测、可看趋势、能定位到批次与责任人的一块看板,尚在建设,与第十四章的指标字典同批。 原因不难理解——没有口径就没有比率,没有分母就没有趋势。看板是字典的下游,不能反过来先建看板再定字典。

15.5 数据生命周期:进来之后要能退出去

迎新数据有一个别人不太会想的性质:它极其敏感,但它的业务有效期很短。报到完成后,绝大多数敏感列几年内不再被使用,却一直在库里活着。

生命周期要有四件动作:归档(过期数据搬离业务库)、保留期(每一类数据定一个明确的保存年限与依据)、注销与被遗忘(本人申请后按流程处理)、去标识化(保留统计价值但切断与具体人的关联)。

这四件不在当前版本的能力范围内。 现在存在的是:备份文件按 30 天保留、软删除标记分散在各业务处理里。也就是说,一届数据用完之后"怎么处理它",眼下没有一个标准动作。

这一条对学校比对我们更要紧。没有生命周期,数据只进不出,敏感信息的存量随届数线性增长,而风险是按存量算的,不是按增量算的。学校现在就能做两件成本很低的事:给每一类迎新数据定一个保留年限并写进制度;明确一届数据在什么条件下可以封存、由谁签字。这两件事不需要等厂商排期。

15.6 一次采集多处复用:省的是学生的麻烦,管的是暴露面

"别让学生填第二遍"是好事。照片拍一次,用于身份核验、用于证件制作、用于档案;姓名与证件号采一次,用于审核、用于名单、用于分析。复用是采集端最大的善意,也是敏感数据最大的扩散路径。

流转要有三条规则,不是原则。

其一,复用要留痕。 一张证件照被核验用了、被审核看了、被导进另一份名单了,这几次动作用的是同一份文件——如果每一次取用都不留记录,事后就无法回答"这张照片流到哪去了"。

其二,复用范围按级别收敛。 第十三章的字段标签在这里第一次产生实际收益:同一个照片路径,核验环节需要原图,进度统计环节只需要"有没有传"。能给结论就不给原件。 这一层依赖标签与统一出口管道,在它们建成前,做不到按用途区分给什么。

其三,不复用给"更好用"的用途。 人脸核验只保存比对分数、不保存特征值,就是这一条的具体形态(见第十三章):技术上完全可以把特征值留下来,下次比对省一步,但那份生物识别信息就多活了很多年。"以后也许用得上"不是留数据的理由。

15.7 治理的检验,就是那一通电话

回到开头那位家长。

治理做得好不好,不看制度文件有几份,看这一通电话能不能在十分钟内答清楚:这个号谁填的、什么时候填的、改过没有、依据是什么。

现在这一问我们还答不全——答得中人和时间,答不准依据。 这一句写在这里,比在别处写十句"完善的质量管理体系"有用。

留给学校的,是三件今天就能做的动作:把字段责任表签出来(15.3 那张表,一周可以办完);给导出与复用立两条规矩(谁能导、导了给谁、用完怎么处理);给一届数据定一个退役动作(保留多久、到期谁封存)。这三件没有一件依赖厂商排期,也恰恰是三件在系统里最容易被"以后再补"的事。

治理不是把数据管死。治理是让一线的人敢按数据做判断——他知道万一被问起来,答得上来。