Contenido

第十六章 数字档案与学生画像

本文说明迎新系统内学生数字档案由六类数据构成,仅支撑分群服务、精准资助、宿舍匹配与接站调度四种用途,并划定不用于处分、不自动决策、不贴标签、预警不提示同学、不对外展示五条禁区。

  • 迎新档案当前只对学生本人成立,管理侧跨域聚合视图尚未成形
  • 六类数据可算出当天要谈的人、要加窗的环节、要单独提醒的批次
  • 不接入成绩、消费、借阅等全校域数据,四条理由含够不着与代价不对称
  • 四种正当用途:分群服务、精准资助、宿舍匹配、接站调度
  • 五条禁区:不处分依据、不自动决策、不贴标签、预警不示同学、不对外展示

一位辅导员在迎新高潮期被问了三件事:这个班有几个家庭困难的学生需要当天谈话、哪几个学生是独自来校且没有紧急联系方式的、明天上午哪个宿舍楼集中办理会挤。

三个问题都不过分,三个问题她都是靠翻聊天记录和去年名单答的。

这三个问题的共同点是:答案全在学校已有的数据里,只是没人替她拼起来。 数字档案与画像,说到底就是"拼起来"这件事。而一谈起画像,边界比能力更容易出问题,所以能拼出什么、哪几道线不能碰,两样都得先摆到明面上。

16.1 一生一档,在迎新域里到底指什么

《"人工智能+教育"行动计划》(教科信〔2026〕1 号)在服务对象那一部分提出建设学生数字档案。这个词的分量容易被低估:它暗示的是一样以"人"为单位组织起来的东西,而不是一堆以"功能"为单位的表。

先把话说实在:我们这套系统里的档案,是迎新域的档案。 它包含的范围是明确的——身份与组织归属、采集填报的信息、每一项任务的办理进度与时间、缴费与资助、体检与健康登记、宿舍分配、行程与到站、志愿与活动参与。这些落在同一个学生主记录上,一个人只有一份进度。

学生自己是看得到的。 移动端上的个人档案,把采集项分组呈现,把该办的事和办到哪一步摆在同屏——这是已经上线的部分,也是"档案"这个词能被学生感知的唯一形式:他不必下载一份表格就知道自己还差什么。

管理侧的跨域聚合视图尚未成形。 今天要在系统里看一个学生全部六类信息的汇总页,需要在几个功能之间来回。把这件事补上,是档案从"学生自用"扩展到"工作可用"的关键一步,列在批次上。在它落地前,"一生一档"这句口号只对本人成立,不对工作人员成立。

还有一条更要紧的边界:这个档案不会自动变成四年档案。 迎新阶段的数据能延续到后续学段的,是身份、组织归属与少量基础信息;真正构成四年成长记录的成绩、借阅、消费、获奖,都在迎新系统之外。把迎新档案说成"大学四年数据地基"是夸张,它是一段地基,不是一栋楼。

16.2 迎新域能拼出什么:六类数据与各能回答的问题

类别里面有什么能回答不能回答
身份与组织证件号、学院专业班级、生源地这批人的构成、哪些人属于同一个班他学得怎么样
家庭与联系父母号码、家庭住址、紧急联系人找不到人时该打给谁家庭关系好不好
经济困难认定、绿色通道、缓缴、缴费状态谁当天可能办不完谁真的需要资助
健康既往病史登记、体检预约与到场哪些人要安排到特定时段他现在的心理状态
行程与住宿车次、到站时刻、楼栋房间床位哪路车该多派人、哪个楼会挤他到没到校(不定位)
任务行为每项任务的完成时间、卡在哪一项卡点在哪一步、谁还没办他为什么不办

六类合起来,能支撑的判断比多数学校预期的要多——当天要谈哪几个人、哪个环节要加窗口、哪批人要单独提醒,这三件都算得出来。

支撑不住的判断同样要写出来:这六类里没有一项能回答"这个学生过得怎么样"。 把前一类判断当成后一类,是画像最常见的越界方式。

16.3 边界声明:我们拿不到的那半壁数据

头部高校走的是全校域路线。西安电子科技大学的"学生成长数据中台"是这条路上有代表性的一例——把成绩、消费、图书、行为等多源数据汇聚到一个中台,再做成长画像与隐性困难识别。这类实践水平高,也确实是这个方向该有的样子。

这条路我们不走,也不建议多数学校从迎新这一头切入。 原因说清楚,不含贬义:

其一,够不着。 迎新系统能对接的是招生、学籍、宿管、财务、校医院这几段的名单类数据。教务成绩、一卡通消费、图书借阅、网络行为,这些在别的系统里,由学校层面的数据治理决定能不能给、给多少。这不是接一个接口的问题,是学校愿不愿意把学生全部行为数据汇聚到一处的问题——这个决定不该由厂商替学校做。

其二,代价不对称。 全校域汇聚换来的识别精度,和一旦泄露或误用带来的伤害,不是同一个量级。隐性困难识别做到了很准,前提也是配套的学校级数据治理与安全等级。

其三,与迎新的目标无关。 迎新要解决的是"这两天把这个学生接住",不需要知道他一个学期在图书馆待了多少小时。

所以给学校的判断标准是一句反向的话:一家厂商主动承诺能给你全校域画像,先问它凭什么拿得到这些数据的授权。

16.4 四种正当用途

画像的正当终点,是服务到他,不是评判他。迎新域里能站得住的用途就四种。

分群服务。 按生源地、批次、任务分组,把不同的通知发给不同的人——这是第一章那条"从一份通知给全校,到只给他那一条"的执行层。它只要求把人群分开,不要求对个人下判断。

精准资助。 绿色通道与困难认定本来就是敏感数据,它的使用要极窄:给到负责资助的那几个人、只用于把材料补齐、不进入任何公开视图。这里的原则是——资助的准确性靠数据,资助的体面靠不声张。 一个学生有没有被公示,比有没有被识别出来伤害更大。

宿舍匹配。 同专业、同生源地、采集过的兴趣与作息,这些条件落在同一个房间号上,是"隔壁那张床是谁"这类问题的依据(见第十章)。数据具备,把它做成学生可查的一屏与匹配建议,是批次上的内容。 眼下的选宿只提供床位与性别过滤,没有推荐算法——这件事不夸大。

接站调度。 到站时刻与车次分布决定哪一路车、哪个时段要加人。这是纯粹的人群层面用途,不涉及对个人的评判,也是迎新里最容易见效的一类。

16.5 五条禁区,写下来才算有

有了数据,一定会被问"能不能顺便……"。以下五件不能顺便。

不用于处分依据。 画像里的行为记录不能作为认定违纪的证据链。它是服务的输入,不是纪律的输入。

不自动决策。 系统可以提示"这个学生可能当天办不完",不可以直接判定"该生不符合某项条件"。任何影响学生权益的结论,必须由人作出并承担责任。

不给学生贴标签。 这一条我们执行得很简单:系统里不存在学生标签体系。 现存的"标签"是给通知与内容分类用的,不是挂在人名下的属性。把"疑似困难""高延迟风险"做成一个人的永久属性,是画像最坏的一种用法——它会跟着转专业、跟着评奖、跟着毕业,而它当初只是三周前的一个推测。

预警只提示工作人员,不提示同学。 不出现"某某被重点关注"这类任何同级可见的呈现。

不对外展示。 大屏与统计视图只输出聚合结果,敏感列不出现(第十三章);个体信息不进任何公共场所的画面。

五条的共同逻辑是一句话:画像每一步都停在手该停的地方——从"他需要帮助"到"他被人看住了",中间只隔一次滥用。

16.6 两种资产,各归各位

第十二章说过复利只发生在标准上,档案这件事把那条原则具体化。

跨校复用的是结构:六类数据的划分方式、任务与进度的组织模型、字段字典与口径模板、四类正当用途与五条禁区的配置边界。这些让第十所学校不必重新想一遍"档案该长什么样"。

只属于本校的是内容:这个学生叫什么、他卡在哪一项、他家在哪、他几点到站。这些一件都不出这所学校。

而学校自己还有一笔四年资产,不由迎新系统代管——它需要的是学校层面的数据治理决定,不是买一套系统。 迎新档案的正确定位,是给学校一个干净、有边界、带分级标注的起点:这一段数据是谁的、谁改的、能拿去做什么,从入学第一天就记清楚了。四年之后能不能长成真正的成长档案,取决于学校是否愿意把这套规矩往下延伸。

16.7 "被看见"有两种

档案与画像这两词,容易被写成一句很动人的话:让每个学生都被看见。

问题在于"看见"有两种。一种是看见他卡在哪一步,然后有人来帮他把这一步走完;另一种是把他算成一个分数,然后决定他值多少关注

同一批数据、同一套技术,两条路都能走。分别不在算法,在有没有那份清单:哪些字段能拿去算,谁负责,哪些用途不能碰。清单在先,画像才有资格在后。