AI安全、版权与合规

AI 安全是什么?从威胁建模到上线与事件响应的全生命周期指南

AI安全不只是越狱与敏感词过滤。本指南从系统边界、数据与供应链、RAG、智能体权限、红队测试、上线门禁、日志和事件响应,给出可执行的全生命周期检查表。

AI系统从立项到退役经过范围数据构建测试上线运营六道安全门禁
本页目录
  1. 先分清:AI 安全到底保护什么
  2. 第一步:先画系统边界,再谈模型风险
  3. 第二步:用威胁场景取代抽象的“注意安全”
  4. 第三步:把安全要求分配到六个生命周期门禁
  5. 第四步:数据、模型和供应商要分别验收
  6. 第五步:RAG 与智能体必须分开设防
  7. 第六步:测试计划必须覆盖正常、失败、攻击和恢复
  8. 第七步之前:把“看起来安全”变成可量化验收
  9. 残余风险必须有人签收,不能藏在报告附件里
  10. 模型、提示或供应商变化时,不能默认安全结论继续有效
  11. 第七步:上线门禁要能直接作出“放行或停止”决定
  12. 第八步:日志要支持调查,但不能成为新的数据仓库
  13. 第九步:事件响应要围绕 AI 特有证据设计
  14. 中国团队还要核对哪些现行要求
  15. 小团队的最小可行安全清单
  16. 常见问题
  17. 通过内容审核,是否就代表 AI 系统安全?
  18. 使用知名大模型,应用层还需要做安全测试吗?
  19. 系统提示词能阻止提示注入吗?
  20. 多久应重新评估一次?
  21. 结论:安全不是“模型会不会拒答”,而是系统能否受控失败

一句话回答:AI 安全不是给模型加一个“敏感词开关”,而是对数据、模型、提示、检索、工具、身份、输出和运行环境建立贯穿设计、开发、测试、上线、运营与退役的控制闭环。真正可上线的 AI 系统必须能回答四个问题:保护什么、谁能做什么、失败时如何发现、出事后如何停止和恢复。

AI系统从立项到退役经过范围数据构建测试上线运营六道安全门禁
兰塞 AI 原创:AI 安全生命周期的六道门禁。每一关都要有负责人、证据、停止条件和未解决风险。

本文面向准备采购、开发或部署生成式 AI、RAG 与智能体的产品、研发、安全和业务团队。它不把“安全”缩减为越狱测试,也不把一次红队结果当成永久保证;重点是给出可以进入需求文档、测试计划、上线审批和事故复盘的检查方法。资料复核日期为 2026 年 7 月 18 日

先分清:AI 安全到底保护什么

AI safety 常关注系统是否造成意外伤害、歧视、误导或失控;AI security 更关注攻击者如何窃取、操纵、越权或破坏系统。真实产品同时面对两类问题。例如,模型编造医疗建议可能是可靠性与安全风险;攻击者把恶意指令藏进检索文档,诱使智能体外发客户数据,则同时涉及提示注入、访问控制和数据泄露。

保护对象 常见失败 最低控制 可核验证据
用户与公众 误导、歧视、有害建议、未标识合成内容 场景限制、拒答与转人工、输出检测、标识 分群测试、失败样本、人工复核记录
数据 敏感信息上传、训练或日志泄露 数据分级、最小收集、脱敏、保留期限 数据清单、处理目的、删除测试
模型与提示 模型窃取、提示泄露、对抗操纵 访问控制、速率限制、机密隔离、滥用监测 权限矩阵、告警与响应记录
知识库与供应链 污染文档、恶意模型或依赖、来源漂移 来源允许清单、签名与哈希、版本锁定 物料清单、来源与版本台账
工具和业务系统 越权写入、重复付款、不可逆删除 服务端授权、参数校验、预览、幂等、回滚 调用日志、审批记录、恢复演练

NIST AI 风险管理框架使用 Govern、Map、Measure、Manage 组织风险工作;其AI Resource Center目前明确提示 AI RMF 1.0 正在修订。面向生成式 AI 的风险与建议行动可核对NIST AI 600-1 Generative AI Profile。因此团队应记录采用的框架版本与复核日期,不应把任何清单写成永不过期的合规证明。

第一步:先画系统边界,再谈模型风险

用户看到的是一个聊天框,攻击面却可能包括登录、API 网关、文件上传、向量库、对象存储、第三方模型、浏览器、插件、工具执行器、人工审批和日志平台。只测最终回答,会漏掉身份、供应链和传统 Web 安全问题。先建立资产与数据流图,并明确哪些组件由自己控制、供应商控制或共同负责。

边界问题 必须记录的答案 危险的模糊说法
谁在使用 匿名、员工、管理员、客户、租户和机器身份 “只有内部人员”
输入从哪里来 键盘、文件、网页、邮件、数据库、传感器或第三方 API “都是可信资料”
模型能访问什么 知识库、会话记忆、工具、密钥、网络和文件系统 “模型只负责回答”
系统能改变什么 发信、下单、退款、改价、删除、发布或执行代码 “智能体会自己判断”
失败影响多大 人数、金额、数据范围、可逆性和恢复时间 “概率很低”
AI应用输入检索模型工具输出和运营六层攻击面以及跨层身份数据供应链控制
兰塞 AI 原创:AI 应用的攻击面不止模型。身份、数据与供应链控制必须贯穿输入、检索、模型、工具、输出和运营。

第二步:用威胁场景取代抽象的“注意安全”

威胁模型要写成可测试的路径:攻击者是谁,通过什么入口,操纵哪项资产,系统为什么会接受,造成什么影响,现有控制如何阻断。MITRE ATLAS是持续更新的 AI 对抗战术、技术和案例知识库;OWASP Top 10 for LLM Applications 2025则适合检查提示注入、敏感信息泄露、供应链、数据与模型污染、输出处理、过度授权等应用风险。二者是建模输入,不是勾选完即可“认证安全”的标准。

威胁场景 攻击路径 首要控制 验证方式
间接提示注入 恶意指令藏在网页、邮件或检索文档 内容与指令分离、来源限制、工具最小权限 带毒文档回归集与工具调用断言
敏感数据泄露 回答、日志、缓存或共享链接暴露数据 字段级授权、输出过滤、最小日志、过期删除 跨角色与跨租户测试
不安全输出处理 模型输出直接进入 HTML、SQL、Shell 或代码执行 把输出当不可信输入,使用参数化与沙箱 注入测试、静态分析与运行隔离
过度代理 模型可调用高权限工具且缺少确认 服务端鉴权、动作分级、人工审批、回滚 越权、重放、超时与幂等测试
知识或供应链污染 恶意数据、模型、插件或依赖进入生产 来源、签名、哈希、审批和版本锁定 物料清单核对与污染样本测试

如果团队需要专门设计攻击样本,可继续参考站内的AI 红队测试方法;若主要问题是虚假陈述与引用失真,应把回答拆成可逐条核对的原子主张,并分别检查来源忠实度、完整性、充分性与潜在影响。红队负责主动寻找失败,不替代日常权限控制、监控和恢复机制。

第三步:把安全要求分配到六个生命周期门禁

CISA 对联合指南的说明英国 NCSC 的 Guidelines for Secure AI System Development覆盖安全设计、开发、部署和运营,并强调 Secure by Design。落实时应让每一阶段产生可审计交付物,而不是上线前临时让安全团队“测一下”。

门禁 必须回答 交付物 不能上线的条件
1. 立项与范围 为何需要 AI,错误影响和责任人是谁 用例卡、风险等级、禁止用途 没有业务责任人或不可接受风险
2. 数据与采购 数据、模型、插件从哪里来 数据清单、供应商核查、合同与退出条款 用途、保留、训练与删除边界不清
3. 构建与集成 身份、检索、工具和密钥如何隔离 架构图、权限矩阵、物料清单 客户端自行授权或共享高权密钥
4. 测试与验收 正常、边界、攻击和恢复是否达标 版本化测试集、结果、残余风险 高风险失败无负责人和截止期
5. 上线与放量 如何灰度、观察、停止和回滚 放量计划、告警、开关、回滚演练 没有紧急停用能力
6. 运营与退役 漂移、事件、升级和数据删除如何处理 监控报告、事件记录、退役证明 无人复核供应商或模型变更

第四步:数据、模型和供应商要分别验收

“供应商说不会训练”不能替代合同、配置和删除验证。对外部模型 API,至少确认数据用途、存储区域、保留时间、子处理者、管理员权限、训练退出、删除机制、事故通知、版本变更和退出导出。对开源模型,还要核对来源、许可证、权重哈希、模型卡、依赖与推理镜像。

对象 采购或引入前 运行中 退出时
业务数据 目的、合法性、分级、最小字段 访问、日志、保留、跨境与泄露监控 删除、导出和备份清理证明
模型服务 版本、能力边界、数据条款、SLA 版本漂移、限额、错误和安全公告 替代模型、提示与评测迁移
开源权重 官方来源、许可证、哈希、模型卡 漏洞、依赖、镜像和访问审计 归档或安全销毁
插件与工具 权限、网络、密钥和维护者 调用范围、异常动作和版本变更 撤销令牌、删除集成和验证残留

更完整的个人信息、训练数据和合规边界可结合站内的AI 数据合规指南;版权、训练材料和生成内容归属问题见AI 版权核验清单

第五步:RAG 与智能体必须分开设防

RAG 的核心风险是检索到不该看的、被污染的或已经过期的内容;智能体又增加了“把错误判断变成真实动作”的风险。检索质量高不等于权限正确,模型拒答也不能代替服务端鉴权。

组件 最低安全要求 测试断言
文档摄取 来源允许清单、恶意内容扫描、版本与所有者 未知来源不能静默进入生产索引
切分与索引 租户、角色和保密级别元数据不可丢失 跨租户检索结果必须为零
检索 先鉴权再检索,引用保留文档与版本 无权用户不能靠改写问题绕过
生成 把资料视为数据而非系统指令 文档内恶意指令不能触发工具
工具执行 服务端重新鉴权、严格 schema、预览与幂等 越权、重复和超额动作均被拒绝
高风险动作 人工确认、金额或范围上限、可撤销 拒绝或超时后不得继续执行

知识库的权限与来源设计见企业 AI 知识库教程;工具调用的参数、服务端授权和生产验收见Function Calling 与 Tool Use 指南。两篇文章分别解决“能读什么”和“能做什么”,不要混成一个模型提示词。

第六步:测试计划必须覆盖正常、失败、攻击和恢复

只展示几个成功对话是演示,不是验收。测试集应版本化,记录输入、预期、模型与知识版本、配置、实际结果、判定人和复现步骤。模型输出有随机性时,可重复运行并报告通过率与最坏失败,不要只保留最好的一次。

测试层 示例 通过标准
功能 已批准任务、正常文档和标准工具调用 完成任务且引用、格式和动作正确
边界 缺字段、歧义、超长材料、过期知识 澄清、降级或拒绝,不编造补齐
权限 跨角色、跨租户、直接对象引用 服务端拒绝且不泄露对象存在性
对抗 直接与间接注入、编码绕过、数据外带 无越权读取、写入或秘密泄露
负载与费用 长上下文、并发、循环工具调用 触发预算、速率、超时和循环上限
恢复 模型不可用、索引污染、错误批量动作 可停止、回滚、切换并保留审计证据

内容审核只是其中一层。审核系统本身仍需版本化回归、误拦与漏放分析,实施方式见AI 内容审核工程指南。模型滥用、深度伪造、欺诈与自动化攻击的组织级风险,可结合AI 滥用风险与防范框架建立升级路径。

第七步之前:把“看起来安全”变成可量化验收

AI 安全指标不能只统计拦截次数。拦得越多可能意味着攻击增多,也可能意味着规则误伤正常用户;平均通过率也可能掩盖某个租户、语言或高风险动作的严重失败。指标必须同时说明分母、样本来源、版本、影响等级和人工判定方法,并将硬门禁与趋势指标分开。

指标 正确口径 常见误导 触发动作
越权成功率 按角色、租户、对象和动作分别统计 把被拒绝的普通请求也放入分母 任何高影响越权即停止放量
注入攻击成功率 直接、间接、多轮、编码与跨模态分组 只测试公开的十条提示词 失败样本进入回归并检查真实工具影响
敏感信息泄露率 按字段等级、来源与可识别性判定 只查手机号关键词 隔离数据源、撤销访问并调查传播范围
有依据回答率 主张能否由可访问来源直接支持 有链接就算正确 降低自动化范围或强制人工复核
误拒与漏放 同时报告,按用户与场景切片 只优化其中一个数字 调整策略并重新评估业务伤害
停止与恢复时间 从发现到限制影响、从修复到安全恢复 只记录关闭前端所需时间 超出目标就改造开关、权限和回滚路径

对存在随机性的模型,单个样本运行一次只能说明那次结果。高风险测试应固定环境并重复执行,记录模型版本、温度、系统提示、知识版本和工具配置;如果供应商使用不可见的滚动更新,则应增加基准样本监控,以行为变化触发复测。指标阈值也不能从网上抄一个统一数字,而应由影响、可逆性、人工复核能力和组织风险容忍度共同决定。

残余风险必须有人签收,不能藏在报告附件里

测试结束后仍可能存在无法完全消除的风险,例如低概率幻觉、供应商不可见更新或少量误拒。团队应为每项残余风险记录失败场景、影响对象、当前控制、监控信号、临时限制、责任人、复核日期和接受者。技术人员可以说明证据,但不能替业务所有者替代决定可接受的损失。

残余风险字段 示例写法 不合格写法
具体失败 扫描版中文合同可能漏检关键金额 模型偶尔不准确
影响与范围 仅限合同摘要,不允许自动审批或付款 影响较小
补偿控制 金额与期限必须显示原文定位并由法务复核 加强提示词
监控和退出 漏检率超阈值立即关闭扫描件入口 持续关注
责任与期限 合同产品负责人在下一模型版本后复核 AI 团队负责

模型、提示或供应商变化时,不能默认安全结论继续有效

生成式 AI 产品常在没有传统版本发布仪式的情况下变化:供应商可能更新底层模型,团队可能调整系统提示、检索切分、嵌入模型、审核策略或工具 schema。每一项变化都可能改变拒答、引用、权限和动作行为。变更管理应先判断影响面,再决定执行完整回归还是针对性复测。

变化 至少重新测试 上线策略
主模型或模型版本 核心任务、拒答、引用、注入、工具调用和费用 新旧版本并行小流量对照
系统提示或审核策略 正常任务、误拒、漏放、多轮绕过 保留旧版本与快速回滚
知识库、切分或嵌入 权限、召回、过期内容、污染与引用定位 先影子索引,核验后切流
新增工具或扩大权限 鉴权、参数、幂等、预算、审批和撤销 默认只读,再逐项开放写入
供应商条款或数据路径 保留、训练、区域、子处理者、删除与退出 法务和数据责任人重新签收

如果供应商不提供精确模型版本,团队至少要保留一组稳定基准请求,持续观察输出结构、拒答、引用、延迟、费用和工具选择的变化。检测到明显漂移时,先冻结扩大使用范围,再决定是否回退、切换模型或接受新的残余风险。所谓“自动升级到更强模型”不是安全理由,因为能力提高也可能扩大可执行范围和攻击收益。

第七步:上线门禁要能直接作出“放行或停止”决定

上线问题 放行证据 停止条件示例
高风险失败是否关闭 复测通过或书面接受残余风险 仍可跨租户读取或未经确认写入
是否能限制影响范围 用户、地域、租户、金额与速率灰度 只能全量开或全量关
是否能观察 权限拒绝、异常工具、费用和质量告警 无法关联请求、模型、知识和动作版本
是否能停止与恢复 紧急开关、降级、回滚与演练记录 关掉聊天仍不能停止后台动作
谁承担决定 业务、安全、数据和系统责任人签字 责任留给“AI 团队”或供应商

不要用一个总分掩盖致命缺陷。跨租户泄露、未授权付款、不可逆删除和密钥暴露应设为硬门禁,即使平均回答质量很高也不能抵消。低风险内部摘要工具与可操作生产系统的门槛也不应相同,应按影响范围和可逆性分级。

第八步:日志要支持调查,但不能成为新的数据仓库

建议记录 目的 默认不应完整长期保存
请求 ID、时间、租户与角色 关联身份与事件 不必要的真实姓名与证件
模型、提示模板、知识与工具版本 复现和定位漂移 系统提示中的秘密与令牌
权限决策、工具参数摘要与结果码 审计真实动作 完整敏感业务载荷
耗时、令牌、费用、拒绝与错误 发现滥用、循环和退化 无期限保存的原始对话
人工审批、修改、撤销与复盘编号 确认责任与恢复路径 与调查无关的附件副本

日志字段、访问者、保存期限和删除机制应在上线前确定。为调试临时打开完整提示记录时,应限定范围、脱敏、审批并设置自动到期;不能把“以后可能有用”作为永久收集理由。

第九步:事件响应要围绕 AI 特有证据设计

AI安全事件从发现止损取证修复回归到复盘的闭环以及模型知识提示工具版本证据
兰塞 AI 原创:AI 事件响应闭环。先限制真实影响,再保存模型、知识、提示、权限和工具动作的可复现证据。
阶段 关键动作 AI 特有证据
发现与分级 确认用户、数据、动作、金额和传播范围 模型、提示、知识库、工具和策略版本
止损 撤销令牌、关闭工具、隔离索引、降级模型 不要只关闭前端聊天入口
保全证据 保存请求链、权限决策、来源和动作结果 记录可复现参数,同时控制敏感数据访问
修复 修权限、数据、解析、策略或供应链问题 不能只追加一句“忽略恶意指令”
回归与恢复 加入失败样本,分批恢复并持续观察 验证同义改写、跨租户和工具副作用
通知与复盘 按合同、法规和影响通知,跟踪根因整改 区分模型行为、应用缺陷和运营失误

中国团队还要核对哪些现行要求

安全工程与法律适用范围不能互相替代。面向中国境内公众提供生成文本、图片、音频或视频服务时,应核对《生成式人工智能服务管理暂行办法》。国家标准信息平台显示,GB/T 45654—2025《网络安全技术 生成式人工智能服务安全基本要求》已于 2025 年 11 月 1 日实施,范围包括语料安全、模型安全、安全措施与评估要求。做组织级风险梳理时,还可参照全国网络安全标准化技术委员会发布的《人工智能安全治理框架》理解风险分类与治理思路。

生成合成内容还应核对《人工智能生成合成内容标识办法》及配套标准。普通企业内部使用、面向公众提供服务、受监管行业和高风险自动决策的适用义务不同;本文提供工程核验框架,不替代针对具体业务、地区和行业的法律意见。

场景 优先核对 额外负责人
员工内部助手 数据、权限、劳动与商业秘密边界 信息安全、人力与业务所有者
面向公众的生成式 AI 服务 暂行办法、GB/T 45654—2025、备案与公示范围 法务、合规、内容安全与运营
生成图片、音视频或文本发布 生成合成内容标识、版权和平台规则 内容、法务与发布责任人
金融、医疗、教育等高影响场景 行业规则、专业复核、可解释与申诉 行业合规与专业责任人

小团队的最小可行安全清单

资源有限不等于省略控制。小团队可以先把最危险的权限与数据问题做对,再逐步扩展测试覆盖:

优先级 今天能做的动作 完成标准
P0 列出用户、数据、模型、知识库和所有工具 每项有所有者与环境
P0 移除共享管理员密钥,读写工具分离 服务端按身份重新鉴权
P0 为付款、删除、外发和发布加入人工确认 可预览、取消和回滚
P1 建立 30 至 50 条正常、边界、注入与越权样本 随版本自动回归并保留结果
P1 配置费用、循环、异常工具与跨租户告警 告警有值班人与处置时限
P1 演练模型下线、索引污染与错误动作 实测停止和恢复时间
P2 按月复核模型、供应商、依赖和残余风险 变更触发重新测试

常见问题

通过内容审核,是否就代表 AI 系统安全?

不代表。内容审核主要处理输入或输出类别;跨租户访问、提示注入、工具越权、密钥泄露、供应链污染和不可逆动作仍需要独立控制与测试。

使用知名大模型,应用层还需要做安全测试吗?

需要。供应商负责其服务边界,你仍负责身份、数据、检索、提示、插件、工具、业务规则和用户告知。更换模型也可能改变拒答、工具调用和输出格式,应触发回归。

系统提示词能阻止提示注入吗?

不能把它当作唯一边界。提示可以降低部分失败,但真正的保护来自来源限制、内容与指令分离、服务端鉴权、最小权限、参数校验、人工审批、监控和回滚。

多久应重新评估一次?

固定周期只是下限。模型、知识库、提示模板、工具、权限、供应商条款或高风险失败发生变化时,都应立即触发相应范围的重新测试;重大事件后还要把失败样本加入回归集。

结论:安全不是“模型会不会拒答”,而是系统能否受控失败

判断 AI 系统是否具备上线条件,不要只问模型回答得多聪明。应检查资产和数据流是否清楚、权限是否在服务端执行、测试是否覆盖攻击与恢复、真实动作是否可预览和撤销、日志是否足以复现、事件发生时是否能迅速限制影响。能发现、停止、解释、恢复并持续改进,才是全生命周期 AI 安全的核心。

编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 18 日重构。旧稿将 AI 安全泛化为“数字免疫系统”,缺少可验证来源、内链和运行门禁,并使用来源不明的百度图片;本次删除无法核验的抽象断言,依据 NIST、OWASP、MITRE、CISA/NCSC、中国网信办和国家标准信息平台的一手资料,重建为系统边界、威胁场景、六阶段门禁、RAG 与智能体控制、测试、上线、日志和事件响应框架。本站的来源、更新与纠错原则见关于本站与编辑规范