AI企业与行业应用

AI 信用风险评估怎么做?违约概率、阈值、解释与人工复核

AI信用风险模型如何定义违约、避免时间泄漏并把分数转成可靠概率和业务动作?本文提供标签成熟、时间外验证、概率校准、阈值、原因说明、人工复核和上线监控清单。

AI 信用风险评估从申请时点数据、风险分数、校准违约概率、策略阈值、人工复核到结果成熟与持续监控的闭环
本页目录
  1. 先分清:信用风险不是欺诈检测或异常检测
  2. 第一步:把“坏账”写成可复算的标签
  3. 第二步:只使用决策时点真正可见的数据
  4. 第三步:处理标签未成熟和“只看见已批准客户”
  5. 第四步:按时间验证,而不是随机打乱全部历史
  6. 第五步:区分排序分数、校准概率、预期损失和策略阈值
  7. 第六步:指标必须绑定阈值、基准率和业务总体
  8. 第七步:先确定人工容量和风险边界,再选择阈值
  9. 第八步:解释必须对应真实决策原因
  10. 第九步:人工复核要能推翻模型,并形成干净反馈
  11. 第十步:上线后同时监控数据、概率、策略和消费者结果
  12. 模型版本、策略版本和数据版本必须分别管理
  13. 30 天影子试点:先证明可测量,再影响真实审批
  14. 常见问题
  15. 信用评分越高,违约概率就一定越低吗?
  16. AUC 很高,为什么上线后坏账仍可能上升?
  17. 是否应该让大模型直接阅读材料并决定授信?
  18. 模型解释可以直接使用 SHAP 吗?
  19. 什么时候应该停止或回滚模型?
  20. 编辑复核与纠错记录

直接答案:AI 信用风险评估不是让模型直接决定“放款或拒绝”,而是在明确产品、预测时点、表现窗口和违约定义后,用申请时点可获得的数据估计未来信用损失风险。可上线的流程至少包括:标签成熟与数据截断、按时间验证、概率校准、阈值与业务动作分离、人工复核、具体原因说明、异议更正、版本审计和持续监控。AUC 或 KS 较高只说明排序可能较好,不代表输出就是违约概率,也不能证明坏账率会下降。

AI 信用风险评估从申请时点数据、风险分数、校准违约概率、策略阈值、人工复核到结果成熟与持续监控的闭环
信用模型只提供风险信号;数据时点、策略阈值、人工责任、结果成熟和再验证共同决定系统能否长期运行。图:兰塞 AI 编辑部原创。

本文面向准备建设或复核个人及小微信贷评分流程的产品、数据、风控和审计人员,提供通用技术与治理框架,不构成授信建议、法律意见或针对具体金融机构的监管结论。资料复核日期为 2026 年 7 月 16 日。旧稿虚构消费金融公司、日申请量、审核团队、欺诈损失和“坏账率下降 18%、效率提升 300%”等结果,本次重写已全部删除。

先分清:信用风险不是欺诈检测或异常检测

信用风险关注的是借款人在约定未来期间内能否履约,以及可能发生多少损失;欺诈检测关注申请或交易是否存在冒用、伪造和恶意行为;异常检测只回答某条记录是否偏离常态。三个问题可以共享部分特征和调查流程,但标签、时间尺度、处置动作和消费者影响不同,不能共用一个“AI 风控准确率”。

任务 核心问题 典型标签 主要动作
信用风险评估 未来约定期间内是否违约、损失可能多大 逾期、违约、核销或损失 进入审批、额度、定价或人工复核策略
申请/交易欺诈 当前身份、材料或交易是否存在恶意行为 确认欺诈、拒付、调查结论 验证、拦截、冻结、升级调查
异常检测 记录是否偏离自身或同类基线 可有标签,也可无标签 生成线索或复核队列
催收排序 已逾期账户采用何种联系和处置顺序 回收、承诺履行、滚动率 联系策略和资源排序

如果目标是实时交易拦截,应阅读站内的AI 欺诈检测指南;如果目标是从财务记录中筛选线索,应阅读AI 财务异常检测指南。信用风险页不应声称自己能替代身份核验、反洗钱调查或审计程序。

第一步:把“坏账”写成可复算的标签

“预测坏客户”不是可训练目标。团队必须固定产品、观察时点、表现窗口、逾期口径、余额口径和成熟日期。例如,以放款日为预测时点,观察之后 12 个月是否出现 90 天以上逾期;或者预测未来 6 个月是否发生核销。不同定义会产生不同标签,不能在训练、验证和上线报告之间悄悄替换。

标签字段 必须写清什么 常见错误 最低证据
预测时点 申请、审批、签约还是放款时点 把放款后信息放进贷前模型 事件时间与数据快照
表现窗口 未来 3、6、12 个月或完整期限 不同期限样本混用 窗口起止和产品期限
违约定义 逾期天数、核销、重组或损失条件 把一次轻微逾期等同最终违约 规则版本与业务依据
余额口径 账户、客户、合同还是风险敞口 按账户训练却按客户汇报 主键和聚合规则
成熟日期 何时可确认正负标签 把尚未走完整窗口的新贷款算作正常 数据截断日和标签状态

近期发放的贷款尚未经历完整表现窗口,属于右删失或标签未成熟样本。它们不能因为“目前未逾期”就自动进入负类。报告应分别列出成熟正类、成熟负类、未成熟和无法确认四种状态,并记录标签被更正或撤销的时间。

第二步:只使用决策时点真正可见的数据

贷前模型最隐蔽的错误通常不是算法,而是未来信息泄漏。催收结果、最终审批意见、放款后交易、后补材料、人工调查结论和表现期内征信变化都可能让离线分数异常漂亮,却无法在真实申请时获得。特征表必须采用 point-in-time join:每条特征同时保存事件时间、系统入库时间、版本和缺失原因。

数据类型 申请时可用条件 泄漏示例 控制办法
申请信息 申请提交前已填写并通过格式校验 使用审核后补录值 保留原始版本与修改时间
征信/信用信息 在合法授权和适用规则下取得的当时快照 使用数月后更新的报告 快照 ID、查询时间和来源
内部历史 预测时点前已发生且身份关联可靠 加入表现期内还款或催收 按事件时间截断
设备与行为 用途、必要性和保存边界明确 把审批后的人工操作当申请人行为 字段字典和主体标识
人工意见 仅在模型之后作为独立复核结果 把最终拒绝原因回填为训练特征 分离模型输入与策略输出

中国《个人信息保护法》对自动化决策的透明、公平、公正以及重大影响决定的说明和拒绝权作出规定,原文见中国人大网。涉及信用信息时,还应核对司法部公布的《征信业务管理办法》和国家行政法规库的《征信业管理条例》。具体业务是否属于征信、信贷或其他受监管活动,需要由机构依据自身角色、数据来源和适用规则判断,不能靠模型项目名称推断。

数据用途、权限、委托处理和留存设计可结合站内企业 AI 数据合规指南本地和云端模型隐私决策指南复核。文章中的字段示例不代表所有字段都可以合法采集或用于授信。

第三步:处理标签未成熟和“只看见已批准客户”

历史还款结果通常只在曾经获批并放款的客户中可见,被拒申请人的反事实结果不可直接观察。这会产生选择偏差:模型学到的是旧审批策略筛选后的群体,不是全部申请人。所谓 reject inference(拒绝推断)并不存在适用于所有机构的标准答案;简单把被拒客户当坏客户,或用现有模型给他们生成伪标签,会把旧策略偏差再次写入数据。

样本状态 结果是否可见 能否直接训练 建议处理
已放款且标签成熟 通常可见 满足定义后可用 核对完整性、撤销和产品变化
已放款但标签未成熟 尚不可见 不可当正常样本 单列等待成熟或采用适合删失的方法
历史被拒申请 通常不可见 不可凭空标好坏 记录旧策略,做敏感性和覆盖分析
撤销/资料不全 与风险结果不同 不宜混入违约标签 建立独立状态
欺诈确认 可能可见 不应默认等同信用违约 按独立任务和处置流程管理

更稳妥的做法是:报告训练总体与真实申请总体的覆盖差异;对旧策略变化、批准率和分群表现做敏感性分析;在合规和风险可控的前提下设计小规模影子评测或随机化探索;同时保留传统规则和人工判断作为比较基线。任何推断方法都要单独验证,不能把推断后的标签当成观察事实。

第四步:按时间验证,而不是随机打乱全部历史

信贷环境会随产品、渠道、宏观条件、客群和政策变化。随机切分会把相邻月份、同一客户、同一营销批次甚至同一资料版本分到训练和测试两侧,从而高估未来表现。至少应按申请或放款时间建立训练、验证、测试和时间外(out-of-time)窗口,并让每个窗口等待标签成熟。

窗口 用途 允许的调整 禁止事项
训练期 拟合参数和特征处理 仅使用当时可见的成熟标签 使用未来月份统计量
验证期 选择模型、校准器和阈值候选 比较预先定义方案 反复查看测试期后继续调参
测试期 一次性估计冻结方案 只运行锁定流程 根据结果修改同一版本
时间外期 检验跨月份、渠道和政策稳定性 分析漂移和失败分群 只汇报总体平均值
影子期 观察生产输入和操作负荷 不影响真实授信动作 把未成熟结果立即回训

scikit-learn 的 TimeSeriesSplit 文档说明了按时间顺序评估的一般方法,但信贷项目还要额外处理客户重复、表现窗口、标签延迟和数据截断。不能仅调用一个交叉验证类就宣称完成时间外验证。

第五步:区分排序分数、校准概率、预期损失和策略阈值

很多模型输出 0 到 1 的数字,但这不自动意味着“12 个月违约概率”。只有当标签、预测期限和总体固定,并经过适当概率校准与验证后,输出才可以在相应范围内解释为 PD(Probability of Default)。排序分数回答谁更高风险;校准 PD 回答相似分数群体中实际违约比例;预期损失还需要敞口和损失率;策略阈值则由风险偏好、资金、人工容量、消费者影响和适用规则共同决定。

输出 回答什么 不能直接推出什么 验证方式
风险排序分数 样本相对风险顺序 绝对违约概率 AUC、PR 曲线、分箱单调性
校准 PD 固定期限内的估计违约概率 最终审批动作 校准曲线、Brier、分箱观察率
LGD/EAD 违约损失率与违约时敞口 由 PD 单独代替 独立定义、回测和分群分析
预期损失 PD、LGD、EAD 组合后的损失估计 客户价值或全部成本 金额加权回测与情景分析
策略阈值 分数如何映射到批准、复核或拒绝 模型本身“客观决定” 固定策略的离线、影子和上线评测

scikit-learn 的概率校准指南说明,良好校准的分类器在预测约 0.8 的样本中应有接近 80% 的正类比例;这一定义必须结合本文明确的违约标签和期限理解。校准器要在与训练模型分离的数据上拟合,并在时间外样本和关键分群中复核。产品、客群或批准策略变化后,旧校准关系可能失效。

第六步:指标必须绑定阈值、基准率和业务总体

AUC 衡量排序,不使用单一业务阈值;Precision 和 Recall 随阈值变化;总体准确率在违约率很低时可能具有误导性;校准指标回答概率是否可信。报告至少同时展示类别数量、时间窗口、审批总体、阈值、混淆矩阵、排序、校准和金额影响。

指标 回答的问题 使用条件 常见误读
AUC/ROC 随机正负样本的相对排序能力 标签可靠且总体明确 AUC 高就等于坏账会下降
Precision 被判高风险者中多少最终违约 固定阈值和标签成熟 忽略被筛选总体和批准策略
Recall 成熟违约中多少被识别 分母标签尽量完整 用提高拒绝率换取更高召回
Brier/校准曲线 预测概率与观察频率是否一致 概率定义和期限固定 总体校准掩盖分群偏差
批准率/复核率 策略对申请总体的操作影响 明确阈值和规则覆盖 把策略结果归因给模型
金额损失 风险敞口和损失的业务影响 金额与回收口径一致 只数账户、不看敞口

可参考 scikit-learn 的Precision-Recall 示例模型评测指南混淆矩阵定义。如果团队无法从原始四格计数重新计算报告指标,就不应只保留百分比截图。

信用风险从排序分数、校准违约概率、策略阈值、业务动作到具体原因与申诉复核的五层关系图
分数不是概率,概率不是动作,动作也不能替代具体原因和申诉渠道。五层必须分别记录版本与责任。图:兰塞 AI 编辑部原创。

第七步:先确定人工容量和风险边界,再选择阈值

scikit-learn 的决策阈值指南强调,分类概率的统计估计与将概率转成类别的业务决策是两个问题。贷前场景更适合使用多段策略:低风险进入常规流程,中间区间人工复核,高风险触发补充验证或按适用政策处理。阈值不能只按离线 F1 最大化,因为人工队列、等待时间、错误拒绝成本和风险敞口都没有进入 F1。

下面是教学用假设,不代表任何机构实测:一批 10,000 个申请被固定模型评分。策略 A 将 8% 送人工复核,策略 B 将 20% 送复核。即使 B 捕获更多成熟违约,如果每天只有 50 个复核席位,它也会造成积压、超时和选择性处理。真正的阈值评审要报告每个动作区间的人数、金额、成熟结果和队列负荷。

策略区间 模型输出的角色 业务动作 必须监控
低风险 提供相对低风险信号 进入常规审批和其他规则 漏判、敞口和后续表现
灰区 表示不确定或成本权衡 补充材料、验证或人工复核 队列、等待、推翻率和一致性
高风险 提供相对高风险信号 按批准政策与适用规则处理 具体原因、误伤、申诉和金额
数据不足 模型可能不适用 走独立缺失数据流程 覆盖率和群体集中情况
系统异常 不得输出可信决定 降级、暂停或人工接管 失败率、恢复时间和补处理

第八步:解释必须对应真实决策原因

特征重要性、SHAP 值、规则命中和最终原因代码不是同一件事。局部解释可以帮助模型开发人员分析,但对外说明必须准确对应实际使用的数据、模型、规则和策略,不应把“模型分数不足”当成唯一原因,也不应从预设列表中选择一个最接近但并未实际影响决策的理由。

解释层 面向对象 应保存的证据 不能替代
模型分析 开发与验证团队 特征贡献、敏感性、稳定性和局限 消费者可理解原因
策略命中 审批与运营人员 阈值、规则版本、覆盖顺序 模型输入事实
具体原因 受影响个人或企业 实际影响决定的主要因素 泛化的“内部政策”
人工复核 复核员和申诉人员 原始字段、材料、修改记录和推翻理由 自动模型再打一次分
审计轨迹 内审、合规与模型治理 数据、代码、模型、阈值、决定和通知版本 只有最终 PDF 报告

中国业务首先应依据适用的本地法律、监管要求和机构制度设计说明与异议流程。作为法域比较,美国 CFPB 的Circular 2022-03指出,在美国 ECOA/Regulation B 框架下,复杂算法不能成为无法提供准确、具体不利行动原因的借口。该要求不能直接当作中国法律结论,但它说明了一个通用工程问题:如果系统不能把最终动作追溯到真实输入、规则和模型版本,就难以进行纠错、申诉和审计。

第九步:人工复核要能推翻模型,并形成干净反馈

人工复核不是让操作员点击“同意模型”。复核界面应展示原始材料、字段来源、缺失状态、模型与规则版本、触发原因和允许动作;复核员应能补充证据、纠正数据、升级处理或推翻建议。推翻理由必须结构化,但不能强迫人员从不准确的有限选项中选择。

复核环节 最低要求 质量指标 风险信号
队列分配 按风险、时限和专业能力路由 等待时间、超时率 高风险样本长期无人处理
证据查看 可回看申请时点原始数据 证据缺失率 只显示模型结论
决定记录 记录动作、理由和责任人 理由完整率、一致性 大量复制粘贴同一理由
推翻机制 允许纠正错误和升级审批 推翻率、分群差异 推翻被当成操作员错误
反馈入库 区分事实标签、复核意见和申诉结果 标签撤销率、成熟时长 把模型建议循环当真值

可借鉴站内规则—模型—人工复核闭环的队列和申诉设计,以及AI 审计分析证据清单的原始凭证、抽样和工作底稿要求。若系统无法重现某次决定看到的字段和版本,就不能靠“当前模型结果相近”替代当时证据。

第十步:上线后同时监控数据、概率、策略和消费者结果

生产监控不能只看接口成功率和 AUC。违约标签可能数月后才成熟,因此要把即时先行指标与滞后结果分开:即时监控缺失、分布、分数、批准、复核和系统异常;按 vintage 或月份等待成熟后,再回测校准、坏账、损失和分群差异。

监控层 先行指标 成熟结果 触发动作
数据 缺失、范围、来源、延迟、分布变化 字段与违约关系变化 暂停特征、切换版本或回滚
模型 分数/PD 分布、覆盖率、失败率 AUC、PR、校准和分箱表现 重新校准、再验证或停用
策略 批准率、复核率、队列与推翻 各动作区间的损失和收益 调整阈值但保留版本审批
群体 覆盖、缺失、动作和错误差异 成熟结果与申诉结果差异 调查数据、策略或流程原因
运行 超时、降级、重试和人工接管 事故与补处理完整性 停止自动动作并启动事件响应

NIST AI Risk Management Framework及其Measure Playbook强调持续测量、监控、审计日志、漂移和风险响应。美国联储 2026 年发布的SR 26-2 Revised Guidance on Model Risk Management强调与机构模型风险状况相适应的治理、验证、持续监控和结果分析;其适用范围是美国受监管银行体系,本文仅将其作为模型治理参考,不外推为中国机构的直接监管义务。

模型版本、策略版本和数据版本必须分别管理

一次审批动作可能由数据快照、特征代码、模型、校准器、阈值、硬规则、人工决定和通知模板共同产生。只记录“模型 v3”无法重现最终结果。每次变更都应有负责人、影响分析、验证证据、生效时间、回滚条件和受影响总体。

对象 应记录的版本 变更前验证 回滚条件
数据 来源、字段、快照和质量规则 覆盖、时点、合法性和泄漏检查 缺失或分布超限
特征/模型 代码、参数、训练集和依赖 时间外、分群、校准和压力测试 性能或稳定性跌破门槛
校准器 样本期、方法和适用总体 可靠性曲线与分箱观察率 PD 系统性偏离
策略 阈值、规则、优先级和例外 动作量、队列、损失和消费者影响 积压、误伤或风险超限
人工流程 界面、权限、理由和升级路径 可用性、一致性和回放演练 无法查看证据或无法纠错

产品声明、截图、测试样本和版本证据的组织方法可参考站内AI 产品证据核验方法;代码、配置和回滚关系可结合模型与流程版本管理指南实施。任何“上线后自动学习”都必须说明哪些数据可进入训练、何时成熟、谁批准新版本,以及出现异常怎样恢复。

30 天影子试点:先证明可测量,再影响真实审批

阶段 主要工作 交付证据 停止条件
第 1–5 天 冻结产品、标签、时间点、总体和禁止用途 目标卡、数据字典、责任矩阵 标签或合法用途无法确认
第 6–12 天 构建 point-in-time 数据和时间窗口 泄漏检查、成熟状态和覆盖报告 关键字段无法追溯
第 13–18 天 比较规则、简单模型和候选模型 时间外排序、校准、分群和误差表 复杂模型无稳定增益
第 19–24 天 设计阈值、人工复核和原因代码 动作模拟、队列容量、申诉演练 无法解释或无法人工接管
第 25–30 天 影子运行,不影响真实决定 数据漂移、延迟、覆盖和回放记录 系统异常、分群偏差或队列失控

试点通过不等于模型已经证明能降低坏账。坏账和损失需要等待表现窗口成熟,并用同期策略、产品、渠道和经济环境解释。上线初期应小范围、可逆、带人工接管;扩量必须同时满足质量、风险、运行和消费者影响门槛,而不是只看模型分数。

常见问题

信用评分越高,违约概率就一定越低吗?

取决于评分方向和定义。有的系统高分代表高风险,有的代表低风险;即使排序方向明确,分数也不自动等于概率。必须查看模型卡、校准关系、期限和适用总体。

AUC 很高,为什么上线后坏账仍可能上升?

AUC 只衡量排序。产品、渠道、批准率、额度、经济环境、策略阈值和客群变化都能影响最终坏账;概率校准和数据分布也可能漂移。必须将模型表现与策略和 vintage 结果分开报告。

是否应该让大模型直接阅读材料并决定授信?

不应把生成式模型输出直接当作最终授信决定。若用大模型提取材料或生成摘要,应验证字段准确性、引用原文、权限和提示注入风险,并让最终模型、规则和人工流程基于可追溯的结构化证据工作。

模型解释可以直接使用 SHAP 吗?

SHAP 可用于分析特征贡献,但它是对模型行为的解释工具,不自动等于最终业务动作的真实原因,也不替代数据纠错、规则命中、人工决定和适用说明义务。必须验证解释的稳定性和忠实度。

什么时候应该停止或回滚模型?

当关键数据来源异常、覆盖大幅下降、概率持续失准、分群错误或申诉异常、无法生成准确原因、人工队列失控、系统无法降级,或风险超出预先批准边界时,应暂停自动动作并回滚到已验证版本或人工流程。

编辑复核与纠错记录

本文由兰塞 AI 编辑流程于 2026 年 7 月 16 日复核。旧稿把信用风险、交易欺诈和异常检测混写,并使用无法核验的客户案例、坏账降幅、申请量、人力成本和提效数字;A 级候选稿删除这些断言,改为“标签定义—时点数据—时间验证—概率校准—策略阈值—具体原因—人工复核—监控治理”的可执行框架。本站的来源、更新与纠错原则见关于本站与编辑规范