一句话回答:AI 离职风险分析只能作为发现组织问题的辅助信号,不能当作“谁会离职”的事实判断,更不能直接决定解雇、降薪、晋升或调岗。合格方案应先限定目的和数据边界,再完成时间外验证、概率校准、分群公平性检查、人工复核、说明申诉与停止机制;如果无法做到这些,就不应上线个人级评分。

本文面向中国境内组织,同时提示跨境或海外用工时需要额外核对的规则。资料复核日期为 2026 年 7 月 18 日。本文是产品与治理方法说明,不构成法律意见;实际处理员工数据前,应由法务、个人信息保护、劳动用工和员工代表结合适用法域复核。
先纠正旧稿:不存在可直接复用的“提前六个月、降低 31%”结论
本页旧稿用一个无法核验的企业故事,声称系统可提前六个月预测离职并把核心人才流失率降低 31%。本站没有该项目的原始数据、模型、对照组、统计方案或客户授权,因此这些数字不能作为事实保留。本次重写撤回该叙述,并把页面改为可审计的方法与边界指南。任何供应商若给出类似效果,都应提供样本定义、基线、时间范围、干预方式、置信区间和独立复核材料。
| 听起来有吸引力的说法 | 为什么证据不足 | 应要求的材料 |
|---|---|---|
| “准确预测谁会离职” | 离职是未来行为,标签、岗位和环境会变 | 目标定义、外部时间窗、校准与错误成本 |
| “准确率达到 90%” | 离职率低时,全预测“不离职”也可能很高 | 混淆矩阵、基准率、精确率、召回率 |
| “流失率下降 31%” | 预测、干预和结果之间可能没有因果关系 | 对照设计、分母、周期、其他政策变化 |
| “完全匿名所以无风险” | 组合字段可能重识别,员工关系仍是高影响场景 | 重识别评估、访问控制和最小化证明 |
先选用途:组织级诊断优先于个人级评分
最安全且通常更有业务价值的起点,是分析团队或岗位层面的工作负荷、排班、薪酬公平、管理变化、内部流动与离职趋势,帮助组织改善普遍条件。个人级分数更容易被误解为事实,并可能改变经理对员工的态度,形成自证预言。
| 用途 | 建议 | 最低防护 | 停止条件 |
|---|---|---|---|
| 部门级趋势与工作条件改善 | 优先 | 最小群组、抑制小样本、只报告可行动因素 | 可反推出个人或被用于惩罚团队 |
| 向所有员工提供普惠支持 | 可试点 | 自愿、无惩罚、效果评估 | 拒绝参与影响待遇 |
| 个人级关怀提醒 | 高风险 | 独立复核、有限人员可见、可解释与申诉 | 经理把分数当作离职事实 |
| 解雇、降薪、晋升、调岗自动决策 | 禁止 | 不能靠免责声明补救 | 任何由分数直接触发的重大决定 |
中国《个人信息保护法》第二十四条要求自动化决策具备透明度和结果公平、公正;对于对个人权益有重大影响的决定,个人有权要求说明,并有权拒绝仅通过自动化决策作出决定。该条文应直接进入产品需求,而不是只放在隐私政策脚注中。可核对国家网信办公布的《个人信息保护法》全文。
立项前写清楚四个定义
模型失败往往不是算法不够复杂,而是团队没有统一“离职”“预测时间”和“可以采取的行动”。定义应在看模型结果之前冻结,否则团队很容易为了得到漂亮数字反复调整口径。
| 定义 | 必须写清 | 常见陷阱 |
|---|---|---|
| 目标事件 | 主动离职、合同到期、内部调动是否分开 | 把所有离开组织的人混成一个标签 |
| 观察窗口 | 用哪一段历史数据生成特征 | 使用预测时点之后才出现的信息 |
| 预测窗口 | 未来 30、90 或 180 天中的哪个任务 | 不同窗口混用却报告一个指标 |
| 允许行动 | 改善条件、提供支持还是人事决定 | 先建分数,之后再决定怎么用 |
如果无法说明“错误地把某人标为高风险会造成什么伤害”,项目尚未具备立项条件。用途卡至少应由业务负责人、HR、数据负责人、个人信息保护负责人和劳动用工专业人员共同签收。
员工数据不是越多越好:建立允许、限制与禁止清单
数据与离职相关,不代表收集它具有正当性和必要性。应从完成已声明目的所需的最少字段开始,并逐项评估数据来源、员工预期、敏感程度、代理歧视、保留期和删除方式。聊天内容、健康、家庭、宗教、工会、非工作时间定位、键盘与屏幕监控等数据,通常会制造远高于收益的隐私与劳动关系风险。
| 数据类型 | 示例 | 默认处理 | 审计问题 |
|---|---|---|---|
| 组织与岗位 | 岗位族、任职时间、团队规模 | 可评估,优先聚合 | 是否成为年龄或其他属性代理 |
| 工作安排 | 排班、加班、远程比例 | 限定用途与时间窗 | 数据是否准确、员工能否更正 |
| 薪酬与绩效 | 薪酬带宽、晋升等待、考核 | 严格分权 | 历史偏见是否被模型复制 |
| 沟通内容 | 邮件、聊天、会议文本 | 原则上排除内容级监控 | 是否真有必要且符合员工合理预期 |
| 敏感个人信息 | 健康、身份、生物识别、宗教 | 默认禁止进入模型 | 是否存在明确法律依据与单独保护 |
| 非工作行为 | 私人设备、位置、社交网络 | 禁止 | 为什么组织认为有权收集 |
《个人信息保护法》第五十五条列出需要事前进行个人信息保护影响评估的情形,包括利用个人信息进行自动化决策;第五十六条要求评估处理目的和方式是否合法、正当、必要,对个人权益的影响及安全风险,以及保护措施是否有效,并至少保存相关报告和记录三年。更完整的数据清单与跨境检查可参见站内AI 数据合规指南。
防止时间泄漏:只使用预测时点真正可获得的信息
离职模型特别容易发生时间泄漏。例如“已提交离职流程”“账号即将停用”“交接文档数量”能把指标做得很好,却在业务需要采取行动时根本不可用。随机拆分同一时期的员工记录,也可能让相邻月份和同一团队的信息同时进入训练与测试。
| 泄漏来源 | 错误做法 | 修复方式 |
|---|---|---|
| 结果后字段 | 使用离职申请、停权、交接状态 | 按每个预测时点截断数据 |
| 回填字段 | 历史快照后来被最终状态覆盖 | 保存不可变的时点快照 |
| 同人跨集合 | 同一员工不同月份随机分散 | 按时间并结合人员分组切分 |
| 组织变化 | 重组前后样本随机混合 | 保留真正未来时期作时间外测试 |
| 人工标签泄漏 | 经理已知离职意向后写入评价 | 核对字段生成流程与可用时间 |

指标不能只看 AUC,更不能只看准确率
模型输出最好被解释为在特定数据、时间窗和人群中的风险估计,不是确定性标签。评估报告应同时呈现基准率、排序能力、校准、阈值后的错误、分群结果和业务后果。阈值不是数据团队单独选择的技术参数,而是对误报与漏报伤害的政策决定。
| 指标 | 回答的问题 | 必须同时报告 |
|---|---|---|
| 基准离职率 | 不使用模型时事件多常见 | 岗位、地区、周期与样本量 |
| 精确率 | 被标高风险者中实际发生多少 | 阈值与假阳性人数 |
| 召回率 | 实际事件中识别多少 | 漏报人数与代价 |
| ROC-AUC / PR-AUC | 总体排序能力 | 类别不平衡下优先看 PR 曲线 |
| 校准 | 20% 风险是否约对应 20% 事件率 | 校准图、误差与时间切片 |
| 提升度 | 某分位相对基准提高多少 | 分母、分位大小与置信区间 |
应提供“无模型”基线与简单可解释基线,例如只用岗位、任职时间和组织变化的规则。如果复杂模型没有在未来时间窗稳定胜出,或提升不足以抵消治理成本,就选择更简单的方案或完全不使用个人评分。
公平性评估:比较结果,也追问数据和制度从哪里来
历史绩效、晋升和经理评价可能已包含制度性差异;删除性别或年龄字段并不会自动消除代理变量。应在法律允许且保护充分的条件下,由隔离的审计流程检查相关群体的覆盖、误报、漏报、校准与实际干预差异,并报告小样本不确定性。
| 检查层 | 问题 | 不能接受的捷径 |
|---|---|---|
| 数据代表性 | 哪些岗位、地点、合同类型缺失 | 用总体样本量掩盖小群体缺口 |
| 标签质量 | “主动离职”是否被一致记录 | 把管理性解除与自愿离职混合 |
| 模型结果 | 各群体误报、漏报与校准是否不同 | 只比较平均分 |
| 实际行动 | 谁收到支持、谁被额外监控 | 只审模型不审后续流程 |
| 长期反馈 | 干预是否改变数据并强化偏见 | 上线后永不复核 |
NIST SP 1270强调偏差可能贯穿技术流程并在无主观歧视意图时造成伤害。美国场景中,EEOC 的就业测试与选择程序说明要求雇主关注不利影响、岗位相关性、业务必要性和更少歧视的替代方案。常被引用的“四分之五规则”只是美国统一指南中的经验筛查规则,EEOC 的解释也要求结合完整选择流程、岗位与有效性证据;它不是全球通用的公平证明或法律安全港。
中国《就业促进法》第二十六条规定,用人单位招用人员应提供平等就业机会和公平就业条件,不得实施就业歧视;可核对教育部政府门户公布的法律文本。具体到在职人员管理、解除或其他决定,仍需结合其他适用法律和个案事实审查。
模型不能证明干预有效:把“预测”与“改善”分开评估
高风险分数只表示统计关联;它不能告诉管理者“给谁加薪就会留下”,也不能证明某项干预造成了结果变化。组织应优先实施对员工普遍有益且风险较低的措施,例如改善排班、经理培训、内部流动透明度和工作负荷,再用合适的对照或分阶段推广评估效果。
| 阶段 | 要回答 | 证据 |
|---|---|---|
| 问题诊断 | 哪些可改变条件与流失同时变化 | 趋势、访谈、员工调查与运营数据 |
| 方案设计 | 措施是否普惠、自愿且无惩罚 | 政策说明与影响评估 |
| 试点 | 是否真的改善目标与员工体验 | 预注册指标、对照或分阶段方案 |
| 伤害检查 | 是否引入监控、标签或机会不均 | 投诉、申诉、分群结果与人工复核 |
| 扩展或停止 | 收益是否大于隐私和劳动关系成本 | 决策记录与退出计划 |
人工复核不是点一下“同意”:必须有独立判断与否决权
如果复核者只能看到一个红黄绿标签、工作量过大或否决模型会被追责,所谓“人工在环”只是形式。复核界面应显示数据时点、主要因素、缺失与不确定性、适用范围、禁止用途和申诉入口;复核者必须能忽略模型,并记录独立依据。
| 人工门禁 | 合格证据 | 失败信号 |
|---|---|---|
| 知情 | 复核者接受用途、限制和偏差培训 | 只收到一列风险分 |
| 时间 | 有时间核对来源并与员工沟通 | 批量一键确认 |
| 权力 | 可以否决或要求补充材料 | 系统默认动作且难以撤销 |
| 独立依据 | 重大决定基于合法、相关、可核实事实 | 把模型分数写进处分理由 |
| 可追溯 | 记录谁在何时依据什么作出决定 | 只有最终状态没有过程 |
欧盟业务还需注意:EU AI Act 附件 III把用于招聘、工作关系条款、晋升或终止、基于行为或个人特征分配任务,以及监控或评估员工的部分系统列入高风险场景。实际分类存在适用范围与例外条件,应逐项记录判定,不能把“只给建议”当作当然豁免。
供应商评估:买的是持续责任,不是一份模型演示
| 供应商问题 | 必须获得 | 拒绝上线的回答 |
|---|---|---|
| 训练与目标 | 标签、时间窗、适用人群和排除项 | “专有算法,无法说明” |
| 数据路径 | 字段、区域、保留、子处理者与删除 | “遵循行业惯例” |
| 验证 | 时间外、分群、校准、基线与限制 | 只有准确率和客户宣传 |
| 变更 | 版本通知、复测范围、回滚和退出 | 模型可静默自动升级 |
| 审计与事件 | 日志、独立评估、事故通知与配合 | 不允许客户验证 |
| 责任 | 人机分工、申诉支持和合同责任 | 把全部责任转嫁给使用方 |
供应商材料只能作为输入,不能替代使用组织对自身数据、人群和流程的验证。NIST 的AI 风险管理框架用 Govern、Map、Measure、Manage 组织风险工作;其页面目前明确提示 AI RMF 1.0 正在修订。NIST AI RMF Playbook也说明建议是自愿且可裁剪的,不是全量勾选清单。因此报告应记录采用的版本和本地化判断。
上线门禁:从影响评估到申诉、漂移与退役

| 门禁 | 交付物 | 硬停止条件 |
|---|---|---|
| 用途与责任 | 用途卡、禁止用途、业务与合规责任人 | 没有明确受益人或可行动问题 |
| 数据与影响评估 | 数据清单、必要性、PIPIA、保留删除 | 来源不明或无法满足个人权利 |
| 离线验证 | 时间外、校准、分群、错误成本 | 泄漏、明显失准或关键群体证据不足 |
| 受控试点 | 小范围、只读、独立复核、停止开关 | 分数进入重大人事决定 |
| 上线运营 | 漂移、投诉、访问、干预效果与事件日志 | 无法解释、申诉或快速停用 |
| 变更与退役 | 复测、数据删除、权限撤销和退役证明 | 供应商变更不可见或数据无法退出 |
可把这套流程与站内AI 审计实务指南、AI 安全生命周期和AI 威胁建模方法组合使用。员工或复核者的界面、错误恢复和申诉可用性,可参考AI 可用性测试指南;伦理与滥用边界分别见AI 伦理落地框架和AI 滥用风险防范。
上线后的监控要看人和流程,不只看模型漂移
| 监控对象 | 最小指标 | 触发动作 |
|---|---|---|
| 数据 | 缺失、分布、来源、延迟、权限异常 | 冻结评分并回溯受影响批次 |
| 模型 | 校准、精确率、召回率、分群差异 | 降低用途、重训或停用 |
| 人类复核 | 采纳率、否决率、处理时间、理由质量 | 检查自动化偏见与工作量 |
| 员工影响 | 投诉、申诉、机会变化、额外监控 | 暂停相关干预并独立调查 |
| 干预效果 | 目标、体验、非预期伤害与成本 | 停止无效或伤害更大的措施 |
| 供应商 | 版本、条款、子处理者、事件 | 触发复测、合同审查或退出 |
英国业务可参考 ICO 的招聘与选择中的数据保护指导,但不得把海外监管指南直接当作中国法律结论。无论在哪个法域,组织都应保存版本、数据快照、审批、输出、人工判断、申诉和纠正记录,并以最小权限控制可见范围。
30 天受控试点模板
| 阶段 | 工作 | 验收结果 |
|---|---|---|
| 第 1 周 | 冻结用途、禁止用途、目标事件和数据清单 | 用途卡、PIPIA 计划、员工沟通草案 |
| 第 2 周 | 建立时点快照、简单基线与时间外测试 | 无泄漏证据、完整指标和分群样本量 |
| 第 3 周 | 影子运行,不向经理显示个人分数 | 校准、漂移、错误案例与复核训练 |
| 第 4 周 | 只评估组织级改善建议与申诉流程 | 收益、伤害、停止或扩大决定 |
如果 30 天后仍不能证明数据必要、时间外有效、分群风险可控、人工复核真实有效和员工权利可执行,正确结论不是“再买更强模型”,而是停止个人级评分,转向组织级调查和普惠改善。
常见问题
能否把离职风险分数给直属经理看?
默认不建议。先问经理能采取什么合法且普惠的行动,以及看到标签是否会改变对员工的机会分配。若确有必要,应限制可见范围、显示不确定性与禁止用途、培训复核者、记录访问,并提供说明与申诉。
删除姓名后是不是匿名数据?
不是。员工编号、岗位、团队、时间和行为组合仍可能识别个人。去标识化只是一层控制,仍需最小化、访问控制、重识别风险评估、保留期限与删除验证。
生成式 AI 能否替代传统模型解释离职原因?
可以辅助归纳已获授权的开放文本或生成报告草稿,但不得把模型生成的理由当作员工真实动机。任何总结都要追溯到允许处理的来源,防止幻觉、敏感信息扩散与无依据的人格判断。
模型比经理判断更一致,是否就更公平?
一致不等于公平。模型可能稳定复制历史偏见或对某些群体持续失准。需要比较数据、错误、校准、实际行动和长期反馈,不能只比较“人工会不会主观”。
什么时候应彻底停止项目?
当用途无法合法正当必要地说明、数据来源不透明、存在泄漏、结果不能在未来时间窗复现、关键群体证据不足、分数进入重大人事决定、申诉无法执行,或收益不足以抵消隐私与劳动关系伤害时,应停止并删除不再需要的数据和权限。
编辑复核与纠错记录
本文由兰塞 AI 编辑流程于 2026 年 7 月 18 日重建。旧稿中的虚构企业故事、“提前 6 个月”和“核心人才流失率降低 31%”均缺少可核验依据,现已明确撤回;新版改用用途边界、数据最小化、时间外验证、校准、公平性、人工决策、申诉和退役门禁。来源、更新与纠错原则见关于本站与编辑规范。
