直接答案:AI 可以帮助审计团队整理数据、执行确定性勾稽、筛选异常、归纳合同条款和起草工作底稿,但每项输出都必须回到明确的审计目标、完整的数据总体、可复现的程序和可靠原始证据。异常分数不是错报或舞弊证据;“扫描全部数据”也不能自动取消抽样、询证、观察、重新计算、重新执行和审计人员的职业判断。

本文提供技术与流程设计参考,不构成审计意见、鉴证结论或针对具体企业的专业服务建议。外部财务报表审计、内部审计、合规检查和持续控制监控具有不同目标和责任。资料复核日期为 2026 年 7 月 16 日。旧稿中的 50 亿元零售集团、数百万凭证、68% 事后发现、2000 小时、70% 提效和“100% 全量实时审计”等数据均无来源,已全部删除。
先区分:AI 审计、内部审计和自动化监控不是一回事
| 活动 | 主要目标 | AI 可辅助 | 不能自动替代 |
|---|---|---|---|
| 外部财务报表审计 | 按适用准则获取充分、适当证据并形成审计意见 | 数据整理、选取项目、异常筛选、文档检索 | 独立性、风险评估、程序设计、证据评价和审计意见 |
| 内部审计 | 评价治理、风险管理和控制并提出改进 | 流程挖掘、控制测试、主题聚类、持续监测 | 授权范围、客观性、访谈、判断和结果沟通 |
| 财务分析 | 解释经营结果和支持管理决策 | 报表汇总、差异解释草稿、预测和情景分析 | 审计保证和舞弊认定 |
| 持续控制监控 | 及时发现控制偏差和异常交易 | 规则、阈值、异常检测和告警分流 | 独立审计程序和根因调查 |
| 合规/调查 | 核对具体规则、事件或举报 | 文档搜索、时间线和关系分析 | 法律判断、事实认定和纪律处分决定 |
IIA 2024 Global Internal Audit Standards把内部审计标准组织为职业道德、治理、管理和执行审计服务等领域,并要求保持客观性、专业能力和应有职业审慎。工具可以改变程序效率,但不能把管理层的模型输出变成审计人员自己的独立判断。
如果审计对象本身就是企业的 AI 系统,可进一步使用 IIA 的Artificial Intelligence Auditing Framework,从治理、管理和内部审计三个领域建立检查范围。审计 AI 系统与“在审计中使用 AI”是两个不同任务:前者评价企业如何管理 AI 风险,后者还必须控制审计工具自身的数据、权限、版本和输出。涉及模型调用外部工具或执行业务动作时,可结合站内AI 智能体与自动化治理指南设置只读、人工批准、审计日志与回滚边界。
第一步:从审计目标出发,不从“有什么 AI”出发
先写清要测试的认定、控制或风险,再决定数据和程序。比如“检查重复付款”与“验证费用发生认定”不同:前者可以通过供应商、金额、日期和发票号组合筛选,后者还可能需要合同、验收、物流、付款和外部证据。
| 审计目标 | 可能的数据程序 | 命中后追加证据 | 错误捷径 |
|---|---|---|---|
| 重复付款 | 标准化供应商、发票号、金额、日期后匹配 | 发票、付款流水、冲销和退款记录 | 相似记录即认定重复付款 |
| 异常手工分录 | 筛选非常时段、特殊账号、整数金额和罕见组合 | 审批、业务依据、权限和后续冲回 | 高异常分数即认定舞弊 |
| 收入截止 | 比较发货、验收、开票、记账和退货时间 | 合同、物流、客户验收和期后退货 | 只看开票日期 |
| 供应商关联 | 匹配地址、电话、账户、人员和关系图谱 | 工商、合同、利益冲突声明和询问 | 共享地址即认定关联交易 |
| 控制执行 | 核对每笔交易是否存在审批和权限证据 | 系统配置、日志、重新执行和访谈 | 数据库字段非空即认定控制有效 |
中国注册会计师审计准则第 1301 号——审计证据要求获取充分、适当的审计证据,并区分证据数量与相关性、可靠性。会计记录本身并不足以为审计意见提供全部证据;更多低质量或同来源数据,也不能补偿证据质量缺陷。
PCAOB AS 2301要求审计程序的性质、时间和范围回应已识别并评估的重大错报风险。这意味着“工具能跑什么”不能反过来定义审计范围。中国准则也会修订,正式项目应从财政部现行注册会计师执业准则发布通知核对适用于报告期的文本,而不是只依赖搜索结果中的旧版页面。
第二步:怎样证明导入 AI 的数据总体完整、准确?
审计分析最常见的失败不是模型,而是总体不完整:漏了子公司、期间、冲销表、手工分录、已删除记录或某个币种。若模型只看导出的部分数据,它可能稳定地产生错误结论。
数据进入审计分析环境前,还要确认处理目的、最小权限、供应商、保留期限和事件响应。站内企业 AI 数据合规指南提供了从数据清单到审计日志的控制表;这些合规控制不能证明审计证据充分,却能防止审计资料在上传、检索、模型调用和日志环节产生新的泄露风险。
| 总体检查 | 要核对的证据 | 可自动化部分 | 停止线 |
|---|---|---|---|
| 范围 | 法人、账套、期间、科目、币种、系统和状态 | 与总账/子账清单对比 | 无法说明缺失范围 |
| 数量 | 记录数、金额合计、借贷平衡、首末编号 | 控制总数与哈希 | 导出前后无法勾稽 |
| 字段 | 字段定义、空值、编码、时区和单位 | 数据剖析和异常类型检查 | 同名字段口径不一致 |
| 转换 | ETL、OCR、汇率、映射和去重逻辑 | 版本化脚本和测试 | 只保留转换后文件 |
| 访问 | 提取账号、权限、审批和时间 | 日志与不可变存储 | 使用共享管理员账号 |
| 重跑 | 输入、代码、参数、环境和输出哈希 | 流水线自动生成运行清单 | 结果无法复现 |
PCAOB AS 1105 Audit Evidence同样强调审计证据的充分性、相关性与可靠性,并指出公司生成或从外部取得的电子信息,其可靠性受相关控制影响。若使用管理层导出的数据、OCR 文本或 AI 生成的结构化字段,就需要评价生成、转换和维护这些信息的控制。
建立最小数据合同:凭证核查至少要交付什么?
“把总账导成 Excel 给模型”不是可验收的数据交付。审计团队应先与数据提供方签署一份任务级数据合同:列明源系统、法人和账套、会计期间、提取时间、筛选条件、字段定义、主键、时区、币种、金额精度、空值含义、冲销逻辑、删除记录处理和控制总数。数据合同不是法律合同模板,而是一份双方可以逐项确认的技术与审计范围记录。
| 数据合同字段 | 凭证核查示例 | 验收动作 | 不合格表现 |
|---|---|---|---|
| 总体边界 | 全部纳入范围公司的 2026 年第二季度已过账及冲销分录 | 与法人、账套和期间清单逐项核对 | 只写“第二季度数据”,未说明子公司和状态 |
| 唯一标识 | 账套、凭证号、行号组成复合主键 | 检查重复键、空键和跨系统映射 | 模型输出无法回到唯一原始行 |
| 金额口径 | 原币金额、本位币金额、借贷方向、汇率和精度 | 复算换算并与总账借贷合计勾稽 | 把负号、贷方或小数截断当作异常 |
| 时间字段 | 业务日、记账日、创建时间、审批时间和时区 | 验证格式、时区转换和关账边界 | 把 UTC 深夜记录误判为本地非工作时间 |
| 主数据版本 | 供应商、员工、科目、成本中心和审批权限的生效区间 | 按交易发生日关联有效版本 | 使用当前主数据解释历史交易 |
| 控制总数 | 记录数、凭证数、借贷合计、期间首末号和导出哈希 | 源系统、落地文件和分析表三方勾稽 | 只比较文件大小或模型读取行数 |
提取程序应保留只读 SQL、API 参数或报表条件,不能只留下最终 CSV。若系统不允许直接导出查询,应保存报表名称、版本、筛选截图、执行账号和审批记录。所有转换步骤都要输出输入行数、输出行数、被丢弃或合并的记录数以及原因;“清洗了无效数据”不是足够说明,因为被清洗的记录可能正是需要调查的异常。
对 OCR 和大模型抽取结果,应把原始文件 ID、页码或坐标与结构化字段一起保存。比如合同金额抽取为 100 万元时,复核者必须能够打开对应合同、定位原句,并判断它是合同总额、年度上限、单次限额还是违约责任。没有原文定位的结构化字段只能进入待复核区,不能直接参与金额勾稽或形成结论。
重跑测试至少包含三种情况:同一输入和同一版本能否得到一致结果;增加一条已知异常后是否能按预期命中;更换模型、提示、OCR 或规则版本后,差异能否逐项解释。对于具有随机性的模型,不能要求每个字完全相同,但关键字段、引用位置、异常级别和停止条件必须满足预先定义的容差。超出容差时,应回退到上一个已认证版本,并把失败样本加入冻结测试集。
最后,数据提供人只负责确认提取范围和控制总数,不应替审计人员判断证据是否充分;模型开发者只负责说明程序、限制和测试结果,也不应批准审计结论。把数据所有者、工具负责人、执行人和复核人分开记录,可以避免出现“系统已通过,所以结论已通过”的责任混淆。
第三步:AI 能执行哪些审计辅助程序?
| 能力 | 适合任务 | 必要输入 | 主要限制 |
|---|---|---|---|
| 确定性规则 | 金额、日期、编号、授权、阈值和勾稽 | 字段定义清晰的结构化数据 | 难以覆盖新模式和语境 |
| 异常检测 | 发现罕见组合、行为偏离和聚类离群点 | 足够历史、分组口径和业务日历 | 异常不等于错报,正常舞弊也可能不异常 |
| OCR/文档抽取 | 从发票、合同和单据提取字段 | 清晰图像、模板和字段规则 | 低质量扫描、表格和印章会产生错误 |
| 大模型摘要 | 归纳合同条款、访谈和异常说明 | 授权文档、问题清单和引用要求 | 可能遗漏、误引或生成不存在条款 |
| 关系图谱 | 连接供应商、员工、账户、地址和交易 | 实体解析、唯一标识和时间范围 | 同名、共享地址不等于利益关联 |
| 自然语言查询 | 帮助审计员探索数据和生成候选查询 | 受控语义层和只读权限 | 生成 SQL 可能口径错误或访问越权 |
这些能力应该输出“候选项目和证据路径”,不是“已发现舞弊”的结论。模型和供应商选型可沿用站内AI 产品证据与风险评估方法,分别记录官方能力、实际观察和本地测试,不能用演示截图替代审计证据。
第四步:全量分析是否意味着不再需要抽样?
不意味着。对某个规则进行全量运行,只能说明该规则在所提供总体上检查了全部记录。它不能证明总体完整、规则覆盖所有错报模式,也不能替代需要外部确认、观察、询问、重新执行或实物检查的程序。
| 选取方式 | 回答的问题 | 优势 | 不能推断 |
|---|---|---|---|
| 全量规则/分析 | 全部记录中哪些满足既定条件? | 覆盖已知规则和全部可用记录 | 不存在其他类型错报 |
| 目标选取 | 哪些大额、关联、异常或高风险项目需检查? | 聚焦重要和可疑项目 | 未选项目总体无误 |
| 代表性抽样 | 样本结果如何支持对总体的判断? | 控制抽样风险并对总体推断 | 每个未抽项目都正确 |
| 随机/系统抽样 | 如何让总体项目有被选机会? | 减少有意选择偏差 | 样本设计自动适合所有目标 |
| 异常模型选取 | 哪些记录在模型特征上更少见? | 发现规则外的候选项目 | 异常即错报或正常即无风险 |
中国注册会计师审计准则第 1314 号将审计抽样定义为对低于百分之百的项目实施程序,并要求样本项目的选取与审计目标、总体属性和抽样风险相匹配。PCAOB AS 2315 Audit Sampling也强调统计和非统计抽样都需要职业判断。使用时要核对适用于具体审计期间的有效版本,不能引用未来生效修订作为当前要求。
第五步:异常检测结果怎样转成可审计证据?
模型命中只是线索。必须记录为什么命中、使用哪些字段、阈值和版本,并针对每个高影响项目追加原始程序。否则审计人员只能看到一个无法解释的分数。
| 证据层级 | 示例 | 可以支持什么 | 仍需补什么 |
|---|---|---|---|
| 模型或规则命中 | 异常分数、重复付款候选、条款抽取 | 确定后续检查的候选项目 | 原始记录、程序设计和命中原因 |
| 系统内原始记录 | 总账、审批、合同、发票和操作日志 | 证明系统记录了什么 | 完整性、准确性及生成控制 |
| 重新执行或重新计算 | 重跑规则、复算金额、重建勾稽 | 验证程序和计算能否复现 | 输入总体和参数版本 |
| 独立外部证据 | 银行回函、客户确认、监管或工商资料 | 交叉验证内部信息 | 来源身份、期间和适用范围 |
| 综合审计判断 | 结合相互一致或矛盾的多项证据形成结论 | 回应具体认定和已评估风险 | 复核、重要性与残余不确定性记录 |
| 异常线索 | 模型可能依据 | 追加程序 | 可能的正常解释 |
|---|---|---|---|
| 非常时段分录 | 周末、深夜或关账后 | 检查权限、审批、业务事件和冲回 | 跨时区、批处理或紧急关账 |
| 整数或临界金额 | 接近审批阈值、重复整数 | 核对合同、拆分、收货和审批链 | 固定租金、套餐或标准费率 |
| 新供应商大额交易 | 缺少历史和突然放量 | 供应商准入、受益人、合同和外部信息 | 新项目或集中采购 |
| 相似发票 | 号码、金额、日期或图像近似 | 原票、付款、红冲、退款和税务状态 | 分期、重复模板或合法更正 |
| 员工与供应商信息重合 | 电话、地址、账户或联系人相同 | 利益冲突、授权、身份和关系调查 | 园区地址、集团共享服务 |
若不同来源证据相互矛盾,应追加程序,而不是让大模型选择“更可信的一方”。财政部 1301 号准则明确指出,从不同来源取得的证据不一致可能表明某项证据不可靠。审计工作底稿应保留矛盾本身、调查动作和最终判断。
第六步:大模型读取合同、发票和邮件时有哪些风险?
| 风险 | 表现 | 控制 | 验证 |
|---|---|---|---|
| 遗漏 | 摘要忽略例外、附录或手写修改 | 按问题抽取并引用页码/段落 | 对高风险字段人工回看原文 |
| 幻觉 | 生成不存在的金额、条款或解释 | 只允许基于给定材料回答,要求证据定位 | 逐项回指原文,证据不足就标记未知 |
| OCR 错误 | 数字、小数点、币种和日期识别错误 | 版面模型、字段校验和双录比较 | 与控制总数和原图抽样核对 |
| 隐私与保密 | 合同、员工和客户资料外发或进入日志 | 批准环境、最小片段、脱敏和访问控制 | 供应商配置、日志和删除测试 |
| 提示注入 | 文档内指令诱导模型忽略审计问题或外传数据 | 将文档视为不可信数据,隔离工具权限 | 对抗样本与工具调用回归 |
使用云端或本地模型前,应参考本地与云端大模型隐私决策指南核对数据地域、保留、权限和退出;涉及审计资料、员工或供应商个人信息时,还要按照个人信息保护法判断处理目的、必要性和权限。即使供应商承诺不用于训练,也要区分输入日志、文件存储、人工支持和子处理方;站内大模型训练数据记忆与提取研究说明了为什么不能把“模型通常不会复述”当成保密控制。
第七步:工作底稿需要记录哪些 AI 证据?
| 底稿字段 | 内容 | 作用 | 缺失风险 |
|---|---|---|---|
| 审计目标 | 认定、控制、风险和预期程序 | 判断 AI 输出是否相关 | 发现很多异常却无法支持结论 |
| 数据总体 | 系统、表、期间、记录数、金额和完整性勾稽 | 证明分析覆盖范围 | 未知缺失造成虚假安心 |
| 程序版本 | 代码、规则、模型、提示、阈值和环境 | 复现结果 | 升级后无法解释差异 |
| 运行记录 | 操作者、时间、参数、输入/输出哈希和错误 | 形成审计轨迹 | 无法证明结果来源 |
| 异常处置 | 命中原因、追加证据、负责人和结论 | 把线索转成程序 | 模型分数替代证据 |
| 复核 | 复核人、问题、修改和批准 | 保持责任与质量 | 自动生成底稿未经审阅 |
PCAOB 在技术辅助分析相关标准修订说明中强调,当审计人员使用电子信息进行技术辅助分析时,仍需履行审计证据和风险应对责任。站内代码补丁与回归验证指南可用于管理脚本和规则变更,但底稿还需要记录审计目标、总体与职业判断。
异常队列和模型解释还需要清晰的人工复核、升级和申诉路径,不能只显示一个“高风险”标签。站内AI 内容审核的规则—模型—人工复核闭环虽然面向内容治理,但其中关于规则版本、严重度分层、人工复核、申诉和审计轨迹的设计原则,同样适合用来检查审计异常处置工作流。
第八步:如何验收 AI 审计工具,而不是相信演示?
| 验收维度 | 测试 | 通过标准 | 停止线 |
|---|---|---|---|
| 总体完整性 | 与源系统控制总数、总账和子账勾稽 | 差异可解释且有批准 | 关键总体无法证明完整 |
| 确定性正确 | 用已知结果测试规则、计算和映射 | 重复运行结果一致 | 同输入产生不同金额结果 |
| 异常检测 | 冻结历史已确认样本和正常边界样本 | 类别级召回、精确率和复核成本可接受 | 重大已知异常持续漏检 |
| 文档抽取 | 按字段比较 OCR/模型与人工金标准 | 数字、币种、日期和关键条款分别报告 | 只给整体字符准确率 |
| 安全 | 权限、提示注入、日志、导出和删除 | 无越权且证据可追踪 | 跨项目或跨客户数据可见 |
| 恢复 | 模型、规则或索引升级失败时回退 | 可恢复到已认证版本 | 只能继续使用最新黑盒版本 |
NIST AI RMF提供治理、映射、测量和管理框架;NIST AI 600-1强调生成式 AI 的数据来源、第三方、测试、人工监督和变更管理。这些框架不能代替审计准则,但能帮助团队把 AI 工具风险纳入审批、监控和复审。
第九步:一个 20 天试点应该怎样安排?
| 阶段 | 交付物 | 验收 | 不要做 |
|---|---|---|---|
| 第 1–3 天 | 一个具体审计目标、认定和总体定义 | 目标能对应程序和证据 | 从“做一个审计大模型”开始 |
| 第 4–7 天 | 只读数据提取、控制总数和转换清单 | 源到分析层可完整勾稽 | 把未知缺失当空值处理 |
| 第 8–11 天 | 确定性规则、异常模型和证据链接 | 每个命中能回到原始记录 | 只保留风险分数 |
| 第 12–14 天 | 冻结测试集和人工复核 | 报告类别级错误和重大漏检 | 只展示最好案例 |
| 第 15–17 天 | 底稿模板、版本、复核和权限 | 第三人可复现程序和结论路径 | 复制模型回答进底稿即完成 |
| 第 18–20 天 | 小范围运行、回滚与残余风险 | 工具故障不会破坏审计证据 | 以提效承诺替代质量验收 |
试点的成功标准应是“证据更可追踪、程序可复现、异常队列更有决策价值”,而不是预设节省 70% 时间。时间和成本可以测量,但必须报告原流程、任务范围、人员、数据量、质量差异和复核成本。
常见问题
AI 能否直接判断一笔交易是舞弊?
不能把异常分数直接当舞弊认定。模型可以发现模式和线索,审计或调查人员仍需核对原始证据、业务解释、权限、外部资料和相互矛盾的信息。
全量扫描是否一定比抽样更可靠?
不一定。全量扫描只对已定义规则和可用总体有效;总体缺失、字段错误或规则遗漏会让全部记录一起被错误处理。抽样、目标选取和全量分析应按不同审计目标组合。
大模型生成的合同摘要能否作为审计证据?
摘要可以作为工作辅助,不能替代原合同及其可靠性评价。关键金额、日期、权利义务、例外和修改条款必须回到原文,并记录页码或段落。
使用公开模型是否可以上传经过脱敏的凭证?
需要判断脱敏后是否仍可识别个人或暴露商业秘密,并核对产品条款、保留、训练使用、地域和访问控制。删除姓名并不必然构成匿名化。
AI 审计工具最重要的指标是什么?
没有单一指标。至少需要总体完整性、规则正确性、类别级召回和精确率、重大漏检、证据可追踪性、复核时间、安全与恢复能力。
如何避免审计人员过度依赖模型?
要求每个结论引用原始证据和适用程序;隐藏或弱化无依据的“结论式”评分;抽查模型未命中的正常样本;保留独立复核和回退到人工程序的能力。
编辑复核与纠错记录
编辑主体:兰塞 AI 编辑流程;事实复核:2026 年 7 月 16 日。旧稿虚构 50 亿元零售集团、数百万凭证、5%–10% 抽样、68% 事后发现、10–15 人团队、2000 小时加班、70% 提效与“100% 全量实时扫描”,并把异常检测结果直接描述为舞弊发现。本次 A 级重写删除全部无来源案例与数字,依据财政部审计准则、PCAOB、IIA 和 NIST 官方资料,建立“目标—总体—程序—异常—原始证据—判断”的可复现证据链。本站来源、更新与纠错原则见关于本站与编辑规范。
