直接答案:AI 信用风险评估不是让模型直接决定“放款或拒绝”,而是在明确产品、预测时点、表现窗口和违约定义后,用申请时点可获得的数据估计未来信用损失风险。可上线的流程至少包括:标签成熟与数据截断、按时间验证、概率校准、阈值与业务动作分离、人工复核、具体原因说明、异议更正、版本审计和持续监控。AUC 或 KS 较高只说明排序可能较好,不代表输出就是违约概率,也不能证明坏账率会下降。

本文面向准备建设或复核个人及小微信贷评分流程的产品、数据、风控和审计人员,提供通用技术与治理框架,不构成授信建议、法律意见或针对具体金融机构的监管结论。资料复核日期为 2026 年 7 月 16 日。旧稿虚构消费金融公司、日申请量、审核团队、欺诈损失和“坏账率下降 18%、效率提升 300%”等结果,本次重写已全部删除。
先分清:信用风险不是欺诈检测或异常检测
信用风险关注的是借款人在约定未来期间内能否履约,以及可能发生多少损失;欺诈检测关注申请或交易是否存在冒用、伪造和恶意行为;异常检测只回答某条记录是否偏离常态。三个问题可以共享部分特征和调查流程,但标签、时间尺度、处置动作和消费者影响不同,不能共用一个“AI 风控准确率”。
| 任务 | 核心问题 | 典型标签 | 主要动作 |
|---|---|---|---|
| 信用风险评估 | 未来约定期间内是否违约、损失可能多大 | 逾期、违约、核销或损失 | 进入审批、额度、定价或人工复核策略 |
| 申请/交易欺诈 | 当前身份、材料或交易是否存在恶意行为 | 确认欺诈、拒付、调查结论 | 验证、拦截、冻结、升级调查 |
| 异常检测 | 记录是否偏离自身或同类基线 | 可有标签,也可无标签 | 生成线索或复核队列 |
| 催收排序 | 已逾期账户采用何种联系和处置顺序 | 回收、承诺履行、滚动率 | 联系策略和资源排序 |
如果目标是实时交易拦截,应阅读站内的AI 欺诈检测指南;如果目标是从财务记录中筛选线索,应阅读AI 财务异常检测指南。信用风险页不应声称自己能替代身份核验、反洗钱调查或审计程序。
第一步:把“坏账”写成可复算的标签
“预测坏客户”不是可训练目标。团队必须固定产品、观察时点、表现窗口、逾期口径、余额口径和成熟日期。例如,以放款日为预测时点,观察之后 12 个月是否出现 90 天以上逾期;或者预测未来 6 个月是否发生核销。不同定义会产生不同标签,不能在训练、验证和上线报告之间悄悄替换。
| 标签字段 | 必须写清什么 | 常见错误 | 最低证据 |
|---|---|---|---|
| 预测时点 | 申请、审批、签约还是放款时点 | 把放款后信息放进贷前模型 | 事件时间与数据快照 |
| 表现窗口 | 未来 3、6、12 个月或完整期限 | 不同期限样本混用 | 窗口起止和产品期限 |
| 违约定义 | 逾期天数、核销、重组或损失条件 | 把一次轻微逾期等同最终违约 | 规则版本与业务依据 |
| 余额口径 | 账户、客户、合同还是风险敞口 | 按账户训练却按客户汇报 | 主键和聚合规则 |
| 成熟日期 | 何时可确认正负标签 | 把尚未走完整窗口的新贷款算作正常 | 数据截断日和标签状态 |
近期发放的贷款尚未经历完整表现窗口,属于右删失或标签未成熟样本。它们不能因为“目前未逾期”就自动进入负类。报告应分别列出成熟正类、成熟负类、未成熟和无法确认四种状态,并记录标签被更正或撤销的时间。
第二步:只使用决策时点真正可见的数据
贷前模型最隐蔽的错误通常不是算法,而是未来信息泄漏。催收结果、最终审批意见、放款后交易、后补材料、人工调查结论和表现期内征信变化都可能让离线分数异常漂亮,却无法在真实申请时获得。特征表必须采用 point-in-time join:每条特征同时保存事件时间、系统入库时间、版本和缺失原因。
| 数据类型 | 申请时可用条件 | 泄漏示例 | 控制办法 |
|---|---|---|---|
| 申请信息 | 申请提交前已填写并通过格式校验 | 使用审核后补录值 | 保留原始版本与修改时间 |
| 征信/信用信息 | 在合法授权和适用规则下取得的当时快照 | 使用数月后更新的报告 | 快照 ID、查询时间和来源 |
| 内部历史 | 预测时点前已发生且身份关联可靠 | 加入表现期内还款或催收 | 按事件时间截断 |
| 设备与行为 | 用途、必要性和保存边界明确 | 把审批后的人工操作当申请人行为 | 字段字典和主体标识 |
| 人工意见 | 仅在模型之后作为独立复核结果 | 把最终拒绝原因回填为训练特征 | 分离模型输入与策略输出 |
中国《个人信息保护法》对自动化决策的透明、公平、公正以及重大影响决定的说明和拒绝权作出规定,原文见中国人大网。涉及信用信息时,还应核对司法部公布的《征信业务管理办法》和国家行政法规库的《征信业管理条例》。具体业务是否属于征信、信贷或其他受监管活动,需要由机构依据自身角色、数据来源和适用规则判断,不能靠模型项目名称推断。
数据用途、权限、委托处理和留存设计可结合站内企业 AI 数据合规指南与本地和云端模型隐私决策指南复核。文章中的字段示例不代表所有字段都可以合法采集或用于授信。
第三步:处理标签未成熟和“只看见已批准客户”
历史还款结果通常只在曾经获批并放款的客户中可见,被拒申请人的反事实结果不可直接观察。这会产生选择偏差:模型学到的是旧审批策略筛选后的群体,不是全部申请人。所谓 reject inference(拒绝推断)并不存在适用于所有机构的标准答案;简单把被拒客户当坏客户,或用现有模型给他们生成伪标签,会把旧策略偏差再次写入数据。
| 样本状态 | 结果是否可见 | 能否直接训练 | 建议处理 |
|---|---|---|---|
| 已放款且标签成熟 | 通常可见 | 满足定义后可用 | 核对完整性、撤销和产品变化 |
| 已放款但标签未成熟 | 尚不可见 | 不可当正常样本 | 单列等待成熟或采用适合删失的方法 |
| 历史被拒申请 | 通常不可见 | 不可凭空标好坏 | 记录旧策略,做敏感性和覆盖分析 |
| 撤销/资料不全 | 与风险结果不同 | 不宜混入违约标签 | 建立独立状态 |
| 欺诈确认 | 可能可见 | 不应默认等同信用违约 | 按独立任务和处置流程管理 |
更稳妥的做法是:报告训练总体与真实申请总体的覆盖差异;对旧策略变化、批准率和分群表现做敏感性分析;在合规和风险可控的前提下设计小规模影子评测或随机化探索;同时保留传统规则和人工判断作为比较基线。任何推断方法都要单独验证,不能把推断后的标签当成观察事实。
第四步:按时间验证,而不是随机打乱全部历史
信贷环境会随产品、渠道、宏观条件、客群和政策变化。随机切分会把相邻月份、同一客户、同一营销批次甚至同一资料版本分到训练和测试两侧,从而高估未来表现。至少应按申请或放款时间建立训练、验证、测试和时间外(out-of-time)窗口,并让每个窗口等待标签成熟。
| 窗口 | 用途 | 允许的调整 | 禁止事项 |
|---|---|---|---|
| 训练期 | 拟合参数和特征处理 | 仅使用当时可见的成熟标签 | 使用未来月份统计量 |
| 验证期 | 选择模型、校准器和阈值候选 | 比较预先定义方案 | 反复查看测试期后继续调参 |
| 测试期 | 一次性估计冻结方案 | 只运行锁定流程 | 根据结果修改同一版本 |
| 时间外期 | 检验跨月份、渠道和政策稳定性 | 分析漂移和失败分群 | 只汇报总体平均值 |
| 影子期 | 观察生产输入和操作负荷 | 不影响真实授信动作 | 把未成熟结果立即回训 |
scikit-learn 的 TimeSeriesSplit 文档说明了按时间顺序评估的一般方法,但信贷项目还要额外处理客户重复、表现窗口、标签延迟和数据截断。不能仅调用一个交叉验证类就宣称完成时间外验证。
第五步:区分排序分数、校准概率、预期损失和策略阈值
很多模型输出 0 到 1 的数字,但这不自动意味着“12 个月违约概率”。只有当标签、预测期限和总体固定,并经过适当概率校准与验证后,输出才可以在相应范围内解释为 PD(Probability of Default)。排序分数回答谁更高风险;校准 PD 回答相似分数群体中实际违约比例;预期损失还需要敞口和损失率;策略阈值则由风险偏好、资金、人工容量、消费者影响和适用规则共同决定。
| 输出 | 回答什么 | 不能直接推出什么 | 验证方式 |
|---|---|---|---|
| 风险排序分数 | 样本相对风险顺序 | 绝对违约概率 | AUC、PR 曲线、分箱单调性 |
| 校准 PD | 固定期限内的估计违约概率 | 最终审批动作 | 校准曲线、Brier、分箱观察率 |
| LGD/EAD | 违约损失率与违约时敞口 | 由 PD 单独代替 | 独立定义、回测和分群分析 |
| 预期损失 | PD、LGD、EAD 组合后的损失估计 | 客户价值或全部成本 | 金额加权回测与情景分析 |
| 策略阈值 | 分数如何映射到批准、复核或拒绝 | 模型本身“客观决定” | 固定策略的离线、影子和上线评测 |
scikit-learn 的概率校准指南说明,良好校准的分类器在预测约 0.8 的样本中应有接近 80% 的正类比例;这一定义必须结合本文明确的违约标签和期限理解。校准器要在与训练模型分离的数据上拟合,并在时间外样本和关键分群中复核。产品、客群或批准策略变化后,旧校准关系可能失效。
第六步:指标必须绑定阈值、基准率和业务总体
AUC 衡量排序,不使用单一业务阈值;Precision 和 Recall 随阈值变化;总体准确率在违约率很低时可能具有误导性;校准指标回答概率是否可信。报告至少同时展示类别数量、时间窗口、审批总体、阈值、混淆矩阵、排序、校准和金额影响。
| 指标 | 回答的问题 | 使用条件 | 常见误读 |
|---|---|---|---|
| AUC/ROC | 随机正负样本的相对排序能力 | 标签可靠且总体明确 | AUC 高就等于坏账会下降 |
| Precision | 被判高风险者中多少最终违约 | 固定阈值和标签成熟 | 忽略被筛选总体和批准策略 |
| Recall | 成熟违约中多少被识别 | 分母标签尽量完整 | 用提高拒绝率换取更高召回 |
| Brier/校准曲线 | 预测概率与观察频率是否一致 | 概率定义和期限固定 | 总体校准掩盖分群偏差 |
| 批准率/复核率 | 策略对申请总体的操作影响 | 明确阈值和规则覆盖 | 把策略结果归因给模型 |
| 金额损失 | 风险敞口和损失的业务影响 | 金额与回收口径一致 | 只数账户、不看敞口 |
可参考 scikit-learn 的Precision-Recall 示例、模型评测指南和混淆矩阵定义。如果团队无法从原始四格计数重新计算报告指标,就不应只保留百分比截图。
第七步:先确定人工容量和风险边界,再选择阈值
scikit-learn 的决策阈值指南强调,分类概率的统计估计与将概率转成类别的业务决策是两个问题。贷前场景更适合使用多段策略:低风险进入常规流程,中间区间人工复核,高风险触发补充验证或按适用政策处理。阈值不能只按离线 F1 最大化,因为人工队列、等待时间、错误拒绝成本和风险敞口都没有进入 F1。
下面是教学用假设,不代表任何机构实测:一批 10,000 个申请被固定模型评分。策略 A 将 8% 送人工复核,策略 B 将 20% 送复核。即使 B 捕获更多成熟违约,如果每天只有 50 个复核席位,它也会造成积压、超时和选择性处理。真正的阈值评审要报告每个动作区间的人数、金额、成熟结果和队列负荷。
| 策略区间 | 模型输出的角色 | 业务动作 | 必须监控 |
|---|---|---|---|
| 低风险 | 提供相对低风险信号 | 进入常规审批和其他规则 | 漏判、敞口和后续表现 |
| 灰区 | 表示不确定或成本权衡 | 补充材料、验证或人工复核 | 队列、等待、推翻率和一致性 |
| 高风险 | 提供相对高风险信号 | 按批准政策与适用规则处理 | 具体原因、误伤、申诉和金额 |
| 数据不足 | 模型可能不适用 | 走独立缺失数据流程 | 覆盖率和群体集中情况 |
| 系统异常 | 不得输出可信决定 | 降级、暂停或人工接管 | 失败率、恢复时间和补处理 |
第八步:解释必须对应真实决策原因
特征重要性、SHAP 值、规则命中和最终原因代码不是同一件事。局部解释可以帮助模型开发人员分析,但对外说明必须准确对应实际使用的数据、模型、规则和策略,不应把“模型分数不足”当成唯一原因,也不应从预设列表中选择一个最接近但并未实际影响决策的理由。
| 解释层 | 面向对象 | 应保存的证据 | 不能替代 |
|---|---|---|---|
| 模型分析 | 开发与验证团队 | 特征贡献、敏感性、稳定性和局限 | 消费者可理解原因 |
| 策略命中 | 审批与运营人员 | 阈值、规则版本、覆盖顺序 | 模型输入事实 |
| 具体原因 | 受影响个人或企业 | 实际影响决定的主要因素 | 泛化的“内部政策” |
| 人工复核 | 复核员和申诉人员 | 原始字段、材料、修改记录和推翻理由 | 自动模型再打一次分 |
| 审计轨迹 | 内审、合规与模型治理 | 数据、代码、模型、阈值、决定和通知版本 | 只有最终 PDF 报告 |
中国业务首先应依据适用的本地法律、监管要求和机构制度设计说明与异议流程。作为法域比较,美国 CFPB 的Circular 2022-03指出,在美国 ECOA/Regulation B 框架下,复杂算法不能成为无法提供准确、具体不利行动原因的借口。该要求不能直接当作中国法律结论,但它说明了一个通用工程问题:如果系统不能把最终动作追溯到真实输入、规则和模型版本,就难以进行纠错、申诉和审计。
第九步:人工复核要能推翻模型,并形成干净反馈
人工复核不是让操作员点击“同意模型”。复核界面应展示原始材料、字段来源、缺失状态、模型与规则版本、触发原因和允许动作;复核员应能补充证据、纠正数据、升级处理或推翻建议。推翻理由必须结构化,但不能强迫人员从不准确的有限选项中选择。
| 复核环节 | 最低要求 | 质量指标 | 风险信号 |
|---|---|---|---|
| 队列分配 | 按风险、时限和专业能力路由 | 等待时间、超时率 | 高风险样本长期无人处理 |
| 证据查看 | 可回看申请时点原始数据 | 证据缺失率 | 只显示模型结论 |
| 决定记录 | 记录动作、理由和责任人 | 理由完整率、一致性 | 大量复制粘贴同一理由 |
| 推翻机制 | 允许纠正错误和升级审批 | 推翻率、分群差异 | 推翻被当成操作员错误 |
| 反馈入库 | 区分事实标签、复核意见和申诉结果 | 标签撤销率、成熟时长 | 把模型建议循环当真值 |
可借鉴站内规则—模型—人工复核闭环的队列和申诉设计,以及AI 审计分析证据清单的原始凭证、抽样和工作底稿要求。若系统无法重现某次决定看到的字段和版本,就不能靠“当前模型结果相近”替代当时证据。
第十步:上线后同时监控数据、概率、策略和消费者结果
生产监控不能只看接口成功率和 AUC。违约标签可能数月后才成熟,因此要把即时先行指标与滞后结果分开:即时监控缺失、分布、分数、批准、复核和系统异常;按 vintage 或月份等待成熟后,再回测校准、坏账、损失和分群差异。
| 监控层 | 先行指标 | 成熟结果 | 触发动作 |
|---|---|---|---|
| 数据 | 缺失、范围、来源、延迟、分布变化 | 字段与违约关系变化 | 暂停特征、切换版本或回滚 |
| 模型 | 分数/PD 分布、覆盖率、失败率 | AUC、PR、校准和分箱表现 | 重新校准、再验证或停用 |
| 策略 | 批准率、复核率、队列与推翻 | 各动作区间的损失和收益 | 调整阈值但保留版本审批 |
| 群体 | 覆盖、缺失、动作和错误差异 | 成熟结果与申诉结果差异 | 调查数据、策略或流程原因 |
| 运行 | 超时、降级、重试和人工接管 | 事故与补处理完整性 | 停止自动动作并启动事件响应 |
NIST AI Risk Management Framework及其Measure Playbook强调持续测量、监控、审计日志、漂移和风险响应。美国联储 2026 年发布的SR 26-2 Revised Guidance on Model Risk Management强调与机构模型风险状况相适应的治理、验证、持续监控和结果分析;其适用范围是美国受监管银行体系,本文仅将其作为模型治理参考,不外推为中国机构的直接监管义务。
模型版本、策略版本和数据版本必须分别管理
一次审批动作可能由数据快照、特征代码、模型、校准器、阈值、硬规则、人工决定和通知模板共同产生。只记录“模型 v3”无法重现最终结果。每次变更都应有负责人、影响分析、验证证据、生效时间、回滚条件和受影响总体。
| 对象 | 应记录的版本 | 变更前验证 | 回滚条件 |
|---|---|---|---|
| 数据 | 来源、字段、快照和质量规则 | 覆盖、时点、合法性和泄漏检查 | 缺失或分布超限 |
| 特征/模型 | 代码、参数、训练集和依赖 | 时间外、分群、校准和压力测试 | 性能或稳定性跌破门槛 |
| 校准器 | 样本期、方法和适用总体 | 可靠性曲线与分箱观察率 | PD 系统性偏离 |
| 策略 | 阈值、规则、优先级和例外 | 动作量、队列、损失和消费者影响 | 积压、误伤或风险超限 |
| 人工流程 | 界面、权限、理由和升级路径 | 可用性、一致性和回放演练 | 无法查看证据或无法纠错 |
产品声明、截图、测试样本和版本证据的组织方法可参考站内AI 产品证据核验方法;代码、配置和回滚关系可结合模型与流程版本管理指南实施。任何“上线后自动学习”都必须说明哪些数据可进入训练、何时成熟、谁批准新版本,以及出现异常怎样恢复。
30 天影子试点:先证明可测量,再影响真实审批
| 阶段 | 主要工作 | 交付证据 | 停止条件 |
|---|---|---|---|
| 第 1–5 天 | 冻结产品、标签、时间点、总体和禁止用途 | 目标卡、数据字典、责任矩阵 | 标签或合法用途无法确认 |
| 第 6–12 天 | 构建 point-in-time 数据和时间窗口 | 泄漏检查、成熟状态和覆盖报告 | 关键字段无法追溯 |
| 第 13–18 天 | 比较规则、简单模型和候选模型 | 时间外排序、校准、分群和误差表 | 复杂模型无稳定增益 |
| 第 19–24 天 | 设计阈值、人工复核和原因代码 | 动作模拟、队列容量、申诉演练 | 无法解释或无法人工接管 |
| 第 25–30 天 | 影子运行,不影响真实决定 | 数据漂移、延迟、覆盖和回放记录 | 系统异常、分群偏差或队列失控 |
试点通过不等于模型已经证明能降低坏账。坏账和损失需要等待表现窗口成熟,并用同期策略、产品、渠道和经济环境解释。上线初期应小范围、可逆、带人工接管;扩量必须同时满足质量、风险、运行和消费者影响门槛,而不是只看模型分数。
常见问题
信用评分越高,违约概率就一定越低吗?
取决于评分方向和定义。有的系统高分代表高风险,有的代表低风险;即使排序方向明确,分数也不自动等于概率。必须查看模型卡、校准关系、期限和适用总体。
AUC 很高,为什么上线后坏账仍可能上升?
AUC 只衡量排序。产品、渠道、批准率、额度、经济环境、策略阈值和客群变化都能影响最终坏账;概率校准和数据分布也可能漂移。必须将模型表现与策略和 vintage 结果分开报告。
是否应该让大模型直接阅读材料并决定授信?
不应把生成式模型输出直接当作最终授信决定。若用大模型提取材料或生成摘要,应验证字段准确性、引用原文、权限和提示注入风险,并让最终模型、规则和人工流程基于可追溯的结构化证据工作。
模型解释可以直接使用 SHAP 吗?
SHAP 可用于分析特征贡献,但它是对模型行为的解释工具,不自动等于最终业务动作的真实原因,也不替代数据纠错、规则命中、人工决定和适用说明义务。必须验证解释的稳定性和忠实度。
什么时候应该停止或回滚模型?
当关键数据来源异常、覆盖大幅下降、概率持续失准、分群错误或申诉异常、无法生成准确原因、人工队列失控、系统无法降级,或风险超出预先批准边界时,应暂停自动动作并回滚到已验证版本或人工流程。
编辑复核与纠错记录
本文由兰塞 AI 编辑流程于 2026 年 7 月 16 日复核。旧稿把信用风险、交易欺诈和异常检测混写,并使用无法核验的客户案例、坏账降幅、申请量、人力成本和提效数字;A 级候选稿删除这些断言,改为“标签定义—时点数据—时间验证—概率校准—策略阈值—具体原因—人工复核—监控治理”的可执行框架。本站的来源、更新与纠错原则见关于本站与编辑规范。
