Contenido

第十三章 数据分类分级与安全

本文档解决迎新系统敏感数据「哪些能参与分析、哪些只能特定岗位查看、哪些须先取得本人单独同意」的分级判断问题,并逐项说明脱敏、加密、导出治理的现状与建设路径。

  • 迎新数据按可公开、内部、敏感个人信息、行踪四层分级
  • 先分级、再定防护标准,最后才谈能否做智能分析
  • 分级的产出是许可清单,不是把所有数据锁起来
  • 存储侧敏感字段仍为明文,字段级加密需另行排期
  • 44项导出有记录无治理,审批水印留痕待建设
  • 人脸核验只存比对分数,不保存人脸特征值

一个新生从填报到离校,在系统里留下的东西,比多数人想象的多。他的证件号、他的照片、他哪天几点到哪个站、他有过什么病、他家里一年挣多少、他父母手机号是谁的——这些不在同一张表上,但它们指向同一个人。

迎新系统对敏感数据的密度,高于学校里大多数业务系统。 因为它服务的正是那一个星期的极端场景:一个人在最短时间内把身家信息交给一所还不认识他的学校。

真正要紧的问题不是"我们安不安全",而是一个更实际的判断:这些数据里,哪些可以拿去算,哪些永远只能人看,哪些必须先问过本人。 分级的意义在这里,不在"不出事"三个字上。

13.1 先把家里有什么东西点清楚

按能不能拿去分析来分,迎新数据实际上是四层。

第一层是可公开层:学院、专业、班级、批次、任务名称、报到时段。这几样出现在大屏上、印在迎新手册里都没问题。

第二层是内部层:报到率、任务完成数、宿舍入住分布、缴费状态。这些是管理语言,汇总之后可以给全校看,落到具体人就要问一句给谁看。

第三层是敏感个人信息:身份证号、手机号、家庭住址、既往病史、家庭年收入、困难认定、人脸比对结果。《中华人民共和国个人信息保护法》把这类信息单列出来,要求处理敏感个人信息须取得单独同意。这一层的共同特点是:一旦泄露,伤害不发生在系统里,发生在他身上。

第四层最容易被忽略:行踪类信息。 到站登记、接站车次、打卡时间、体检到场——这些记录合起来能推出"这个人哪天几点在哪里"。它不在任何一份敏感字段清单的显著位置,但它在家长群里被念出来的一秒钟里,杀伤力比手机号大。

四层点清楚,后面所有判断才有落脚点。没点清楚就谈安全,只能得到一句"我们很重视数据安全"。

13.2 分级不是为了不出事,是为了知道什么能拿去算

国家层面的依据是明确的。《数据安全技术 数据分类分级规则》(GB/T 43697-2024,2024-03-15 发布、2024-10-01 实施)给出分类分级的通用规则;教育行业标准《教育数据分类分级指南》(JY/T 0661-2025,教科信函〔2025〕97 号,2025-12 发布)把这套规则收到教育数据上;《"人工智能+教育"行动计划》(教科信〔2026〕1 号)在建设要求里写的是分类分级确定安全防护标准

三份文件连起来读,重点不在"分几级",在一个动作顺序上:先分级,再定防护标准,再谈能不能做智能分析。

这个顺序决定了这一级到底有什么用。它不是为了给数据上一把锁——全锁起来最安全,也最没用。分级的真正产出是一份许可清单:

  • 哪些字段可以参与统计与建模,可以出现在聚合视图里;
  • 哪些字段只能被具体岗位的人,在具体的事务里看到;
  • 哪些字段必须先取得本人单独同意,且同意要能撤回;
  • 哪些字段一旦要出系统(导出、报送、交给第三方),必须走审批。

一张没有分级的表,谁都不敢用,谁都能用。 前者让数据白攒,后者让学校白担风险。这是同一件事的两个方向,也是第十四章指标口径得以成立的前提。

13.3 落地路径:先列清单,再打标签,后接管道

分级不是文件,得落成软件里的三件事。

第一件是字段清单。 53 类业务数据里,哪几列是敏感字段,必须一列一列列出来,不能停在"学生信息属于敏感数据"这种句子上——那种句子在系统里执行不了。

第二件是字段标签。 每一列带上自己的级别,级别跟着字段走,不跟着页面走。同一个手机号,出现在学生自己的页面上、出现在学院秘书的名单里、出现在给校医院的统计表上,是三种不同的处理结果。标签打在字段上,才可能做到这一点。

第三件是统一的出口管道。 数据离开系统的所有出口——接口返回、页面渲染、名单导出、日志记录——都过同一道处理,按"标签+当前用户能看到的级别"决定给明文还是给遮盖。

这三件事,我们做到了哪一步,说清楚比含糊过去更有用。

已经有的:出口侧的遮盖能力已经实现,规则是具体的——身份证号保留前 6 位与后 4 位,手机号保留前 3 位与后 4 位;这条能力目前用在大屏的地名统计上。尚未落地的:字段级标签,以及统一的出口管道。因此库内、日志、导出这三处的处理目前不一致。

"三处一致"是这一层的验收标准,也是它的难点所在。 只在页面遮、在导出里不遮,等于没做;只在导出里遮、日志里留明文,等于把风险换了一个更隐蔽的地方存着。字段级标签与统一出口处理已列入建设批次,在它们落地之前,"自动脱敏"这四个字不该出现在一份对外文档里。

13.4 哪些环节已经加密,哪些还没有

这一段最容易写出无法兑现的承诺,所以逐项说。

已经做到的属于传输与凭证。 全站走加密通道,生产环境强制跳转并启用严格传输安全策略;页面响应带一组安全头,用于防止嵌入与类型混淆。登录口令不以明文保存,新设置的口令统一使用带盐的强哈希;早期存量使用弱摘要的,在本人下次登录时自动升级为强哈希——这是有历史包袱的做法,但比"要求所有人立刻改密码"更少打扰,也更可能被真正执行。

数据源的连接口令、令牌的签名密钥这类东西,通过环境变量注入,不写进随包分发的配置文件,也不随文档流转。密钥进过文档的,等于没有密钥。

尚未覆盖的是存储侧。 上一节列出的那些敏感字段,目前在库里是明文列——没有做字段级加密,也没有值一级的加解密转换。这一句必须写在这里。 原因很实际:字段级加密要面对一个绕不开的问题,加密之后的列没法用于查询、匹配和分组;而迎新系统的全部价值恰恰在这些列的分组与匹配上。所以这不是"打开一个开关"的事,涉及检索方案与密钥管理两条一起设计,属于要单独排期的建设内容。

这一段若略去不写,后果更严重。 学校按"已加密"去判断风险,上线后一次导出外泄,才发现明文可拼回完整身份——那时候失去的不是数据,是学生对学校的信任。承认现状并给出路径,比在白皮书里提前收下一份信任要便宜得多。

13.5 最小必要与单独同意:能少采一条就少采一条

《中华人民共和国个人信息保护法》确立的原则是"最小必要",落到迎新上是一条能执行的标准:这一列数据,有没有一个正在提供的服务在用它?答不出来就不该采。

有一条我们已经做在系统里,值得当例子说:人脸核验环节只保存比对结果分数,不保存人脸特征值。核验用的是当场比对,比对完就只留一个"多少分、通没通过"的事实。特征值是生物识别信息里最重的一类,不存就是最彻底的防护——少存一条,比多锁一层更可靠。

其余几条按同一把尺子量:

  • 采集字段由学校自己配,不是厂商给一张必填清单。学校用不上的字段,就不要为了"表结构齐全"而留着;
  • 不默认申请定位权限,到站与到场信息靠本人填报与一次登记取得;
  • 敏感字段单独同意:健康信息、家庭经济信息在填报时应有独立的告知与同意环节,同意要可撤回。这一段与字段标签同批建设——没有标签,"哪些字段需要单独同意"在系统里就无从判断。

单独同意这件事,法律是硬要求,学校也是硬需求:真正会引发家长追问的,从来不是"学校收了我的信息",而是"学校收了我没答应给的信息"。

13.6 导出:数据出去的那道门

统计下来,系统里能把名单带走的导出功能共 44 项。导出是这套系统对外敞口最大的一条路,也是最容易被善意滥用的一条——辅导员导出一个班的联系方式建群,这个动作没有恶意,但它让 40 个手机号从此离开了系统的可见范围。

现状要说实:导出目前有记录、无治理。 谁在什么时候发起过一次导出会被记下来,异步导出的文件在 12 小时后连同记录一并清理;导出前的审批流、文件上的水印、用途登记与长期留痕尚在建设。导出的内容按当前字段处理,敏感列不在导出侧做遮盖。

"数据能出去"和"出去得有名有姓、还盖了戳"是两件事,我们只做到了前一件。 治理四件套——审批、水印、用途登记、留痕不删——按批次建设。在此之前,学校可以用一条成本很低的制度补住敞口:明确哪几个岗位有导出权、每一次导出登记用途与接收人、名单类文件用完即删。制度的作用不是替代功能,是让功能补齐之前不至于裸奔。

问一句就知道一家厂商做没做:我导出的这份名单,三年后你能不能告诉我当时是谁导的、导去了哪里? 答不上来,说明这条路是敞开的。

13.7 位置数据:最敏感的一类,不能默认采集

迎新场景里,位置看起来是天然有用的:接站要不要派人、派几路、在哪个口等,都想知道人到了哪里。

但位置数据是所有类别里最容易越界的一种。它的敏感性不在于单条记录,而在于连续:一条"某生在 10:24 到南站"是服务信息,一串就变成行踪轨迹,而行踪轨迹在《中华人民共和国个人信息保护法》里明确属于敏感个人信息。

我们的选择说清楚:不做持续定位,不申请定位权限。 到站信息来自学生自己填报的车次与时刻,或来自一次性的到场登记;接站调度用这份填报数据算,不用设备位置算。这不是技术上做不到——移动端拿到定位不难——而是这件事一旦开始,收回去就难了。

判断标准可以留给学校:这份服务能不能靠学生主动填一次就完成?能,就不要持续采集。 能少拿的一律不多拿,因为位置数据泄露之后没有补救动作——手机号能换,行踪换不掉。

13.8 数据主权三条,与它没写完的半句

《关于构建数据基础制度更好发挥数据要素作用的意见》("数据二十条",中共中央、国务院,2022-12-19)把数据资源持有权、加工使用权、产品经营权分置。落到迎新这一段,判断只有一句:学校是持有方,厂商是受托处理方。

由此派生的三条,各自做到什么程度,逐条对照:

其一,这批数据只属于学校。 一校一实例,本校数据不与别校混存,跨校共享的只有结构与模板,不含任何一个人的信息(见第十二章)。这一条成立。

其二,学校随时可以完整导出。 44 项导出功能加通用表格格式,学校不必请求厂商配合就能把自己的一届数据带走。这一条成立。

其三,导出要留痕。 只做到一半——发起动作有记录,但记录 12 小时即清、内容侧无审批与水印。上一节已经写明,此处不重复。

第三条的后半句是这一章最该被记住的判断:数据主权不只是"我随时拿得走",还是"每一次被拿走,我都知道是谁拿的"。 前半句防的是厂商绑定,后半句防的是内部失控。学校采购时两半都要问,只问前一半的系统,往往在第二年起最出事。