一句话回答:AI 安全不是给模型加一个“敏感词开关”,而是对数据、模型、提示、检索、工具、身份、输出和运行环境建立贯穿设计、开发、测试、上线、运营与退役的控制闭环。真正可上线的 AI 系统必须能回答四个问题:保护什么、谁能做什么、失败时如何发现、出事后如何停止和恢复。

本文面向准备采购、开发或部署生成式 AI、RAG 与智能体的产品、研发、安全和业务团队。它不把“安全”缩减为越狱测试,也不把一次红队结果当成永久保证;重点是给出可以进入需求文档、测试计划、上线审批和事故复盘的检查方法。资料复核日期为 2026 年 7 月 18 日。
先分清:AI 安全到底保护什么
AI safety 常关注系统是否造成意外伤害、歧视、误导或失控;AI security 更关注攻击者如何窃取、操纵、越权或破坏系统。真实产品同时面对两类问题。例如,模型编造医疗建议可能是可靠性与安全风险;攻击者把恶意指令藏进检索文档,诱使智能体外发客户数据,则同时涉及提示注入、访问控制和数据泄露。
| 保护对象 | 常见失败 | 最低控制 | 可核验证据 |
|---|---|---|---|
| 用户与公众 | 误导、歧视、有害建议、未标识合成内容 | 场景限制、拒答与转人工、输出检测、标识 | 分群测试、失败样本、人工复核记录 |
| 数据 | 敏感信息上传、训练或日志泄露 | 数据分级、最小收集、脱敏、保留期限 | 数据清单、处理目的、删除测试 |
| 模型与提示 | 模型窃取、提示泄露、对抗操纵 | 访问控制、速率限制、机密隔离、滥用监测 | 权限矩阵、告警与响应记录 |
| 知识库与供应链 | 污染文档、恶意模型或依赖、来源漂移 | 来源允许清单、签名与哈希、版本锁定 | 物料清单、来源与版本台账 |
| 工具和业务系统 | 越权写入、重复付款、不可逆删除 | 服务端授权、参数校验、预览、幂等、回滚 | 调用日志、审批记录、恢复演练 |
NIST AI 风险管理框架使用 Govern、Map、Measure、Manage 组织风险工作;其AI Resource Center目前明确提示 AI RMF 1.0 正在修订。面向生成式 AI 的风险与建议行动可核对NIST AI 600-1 Generative AI Profile。因此团队应记录采用的框架版本与复核日期,不应把任何清单写成永不过期的合规证明。
第一步:先画系统边界,再谈模型风险
用户看到的是一个聊天框,攻击面却可能包括登录、API 网关、文件上传、向量库、对象存储、第三方模型、浏览器、插件、工具执行器、人工审批和日志平台。只测最终回答,会漏掉身份、供应链和传统 Web 安全问题。先建立资产与数据流图,并明确哪些组件由自己控制、供应商控制或共同负责。
| 边界问题 | 必须记录的答案 | 危险的模糊说法 |
|---|---|---|
| 谁在使用 | 匿名、员工、管理员、客户、租户和机器身份 | “只有内部人员” |
| 输入从哪里来 | 键盘、文件、网页、邮件、数据库、传感器或第三方 API | “都是可信资料” |
| 模型能访问什么 | 知识库、会话记忆、工具、密钥、网络和文件系统 | “模型只负责回答” |
| 系统能改变什么 | 发信、下单、退款、改价、删除、发布或执行代码 | “智能体会自己判断” |
| 失败影响多大 | 人数、金额、数据范围、可逆性和恢复时间 | “概率很低” |

第二步:用威胁场景取代抽象的“注意安全”
威胁模型要写成可测试的路径:攻击者是谁,通过什么入口,操纵哪项资产,系统为什么会接受,造成什么影响,现有控制如何阻断。MITRE ATLAS是持续更新的 AI 对抗战术、技术和案例知识库;OWASP Top 10 for LLM Applications 2025则适合检查提示注入、敏感信息泄露、供应链、数据与模型污染、输出处理、过度授权等应用风险。二者是建模输入,不是勾选完即可“认证安全”的标准。
| 威胁场景 | 攻击路径 | 首要控制 | 验证方式 |
|---|---|---|---|
| 间接提示注入 | 恶意指令藏在网页、邮件或检索文档 | 内容与指令分离、来源限制、工具最小权限 | 带毒文档回归集与工具调用断言 |
| 敏感数据泄露 | 回答、日志、缓存或共享链接暴露数据 | 字段级授权、输出过滤、最小日志、过期删除 | 跨角色与跨租户测试 |
| 不安全输出处理 | 模型输出直接进入 HTML、SQL、Shell 或代码执行 | 把输出当不可信输入,使用参数化与沙箱 | 注入测试、静态分析与运行隔离 |
| 过度代理 | 模型可调用高权限工具且缺少确认 | 服务端鉴权、动作分级、人工审批、回滚 | 越权、重放、超时与幂等测试 |
| 知识或供应链污染 | 恶意数据、模型、插件或依赖进入生产 | 来源、签名、哈希、审批和版本锁定 | 物料清单核对与污染样本测试 |
如果团队需要专门设计攻击样本,可继续参考站内的AI 红队测试方法;若主要问题是虚假陈述与引用失真,应把回答拆成可逐条核对的原子主张,并分别检查来源忠实度、完整性、充分性与潜在影响。红队负责主动寻找失败,不替代日常权限控制、监控和恢复机制。
第三步:把安全要求分配到六个生命周期门禁
CISA 对联合指南的说明及英国 NCSC 的 Guidelines for Secure AI System Development覆盖安全设计、开发、部署和运营,并强调 Secure by Design。落实时应让每一阶段产生可审计交付物,而不是上线前临时让安全团队“测一下”。
| 门禁 | 必须回答 | 交付物 | 不能上线的条件 |
|---|---|---|---|
| 1. 立项与范围 | 为何需要 AI,错误影响和责任人是谁 | 用例卡、风险等级、禁止用途 | 没有业务责任人或不可接受风险 |
| 2. 数据与采购 | 数据、模型、插件从哪里来 | 数据清单、供应商核查、合同与退出条款 | 用途、保留、训练与删除边界不清 |
| 3. 构建与集成 | 身份、检索、工具和密钥如何隔离 | 架构图、权限矩阵、物料清单 | 客户端自行授权或共享高权密钥 |
| 4. 测试与验收 | 正常、边界、攻击和恢复是否达标 | 版本化测试集、结果、残余风险 | 高风险失败无负责人和截止期 |
| 5. 上线与放量 | 如何灰度、观察、停止和回滚 | 放量计划、告警、开关、回滚演练 | 没有紧急停用能力 |
| 6. 运营与退役 | 漂移、事件、升级和数据删除如何处理 | 监控报告、事件记录、退役证明 | 无人复核供应商或模型变更 |
第四步:数据、模型和供应商要分别验收
“供应商说不会训练”不能替代合同、配置和删除验证。对外部模型 API,至少确认数据用途、存储区域、保留时间、子处理者、管理员权限、训练退出、删除机制、事故通知、版本变更和退出导出。对开源模型,还要核对来源、许可证、权重哈希、模型卡、依赖与推理镜像。
| 对象 | 采购或引入前 | 运行中 | 退出时 |
|---|---|---|---|
| 业务数据 | 目的、合法性、分级、最小字段 | 访问、日志、保留、跨境与泄露监控 | 删除、导出和备份清理证明 |
| 模型服务 | 版本、能力边界、数据条款、SLA | 版本漂移、限额、错误和安全公告 | 替代模型、提示与评测迁移 |
| 开源权重 | 官方来源、许可证、哈希、模型卡 | 漏洞、依赖、镜像和访问审计 | 归档或安全销毁 |
| 插件与工具 | 权限、网络、密钥和维护者 | 调用范围、异常动作和版本变更 | 撤销令牌、删除集成和验证残留 |
更完整的个人信息、训练数据和合规边界可结合站内的AI 数据合规指南;版权、训练材料和生成内容归属问题见AI 版权核验清单。
第五步:RAG 与智能体必须分开设防
RAG 的核心风险是检索到不该看的、被污染的或已经过期的内容;智能体又增加了“把错误判断变成真实动作”的风险。检索质量高不等于权限正确,模型拒答也不能代替服务端鉴权。
| 组件 | 最低安全要求 | 测试断言 |
|---|---|---|
| 文档摄取 | 来源允许清单、恶意内容扫描、版本与所有者 | 未知来源不能静默进入生产索引 |
| 切分与索引 | 租户、角色和保密级别元数据不可丢失 | 跨租户检索结果必须为零 |
| 检索 | 先鉴权再检索,引用保留文档与版本 | 无权用户不能靠改写问题绕过 |
| 生成 | 把资料视为数据而非系统指令 | 文档内恶意指令不能触发工具 |
| 工具执行 | 服务端重新鉴权、严格 schema、预览与幂等 | 越权、重复和超额动作均被拒绝 |
| 高风险动作 | 人工确认、金额或范围上限、可撤销 | 拒绝或超时后不得继续执行 |
知识库的权限与来源设计见企业 AI 知识库教程;工具调用的参数、服务端授权和生产验收见Function Calling 与 Tool Use 指南。两篇文章分别解决“能读什么”和“能做什么”,不要混成一个模型提示词。
第六步:测试计划必须覆盖正常、失败、攻击和恢复
只展示几个成功对话是演示,不是验收。测试集应版本化,记录输入、预期、模型与知识版本、配置、实际结果、判定人和复现步骤。模型输出有随机性时,可重复运行并报告通过率与最坏失败,不要只保留最好的一次。
| 测试层 | 示例 | 通过标准 |
|---|---|---|
| 功能 | 已批准任务、正常文档和标准工具调用 | 完成任务且引用、格式和动作正确 |
| 边界 | 缺字段、歧义、超长材料、过期知识 | 澄清、降级或拒绝,不编造补齐 |
| 权限 | 跨角色、跨租户、直接对象引用 | 服务端拒绝且不泄露对象存在性 |
| 对抗 | 直接与间接注入、编码绕过、数据外带 | 无越权读取、写入或秘密泄露 |
| 负载与费用 | 长上下文、并发、循环工具调用 | 触发预算、速率、超时和循环上限 |
| 恢复 | 模型不可用、索引污染、错误批量动作 | 可停止、回滚、切换并保留审计证据 |
内容审核只是其中一层。审核系统本身仍需版本化回归、误拦与漏放分析,实施方式见AI 内容审核工程指南。模型滥用、深度伪造、欺诈与自动化攻击的组织级风险,可结合AI 滥用风险与防范框架建立升级路径。
第七步之前:把“看起来安全”变成可量化验收
AI 安全指标不能只统计拦截次数。拦得越多可能意味着攻击增多,也可能意味着规则误伤正常用户;平均通过率也可能掩盖某个租户、语言或高风险动作的严重失败。指标必须同时说明分母、样本来源、版本、影响等级和人工判定方法,并将硬门禁与趋势指标分开。
| 指标 | 正确口径 | 常见误导 | 触发动作 |
|---|---|---|---|
| 越权成功率 | 按角色、租户、对象和动作分别统计 | 把被拒绝的普通请求也放入分母 | 任何高影响越权即停止放量 |
| 注入攻击成功率 | 直接、间接、多轮、编码与跨模态分组 | 只测试公开的十条提示词 | 失败样本进入回归并检查真实工具影响 |
| 敏感信息泄露率 | 按字段等级、来源与可识别性判定 | 只查手机号关键词 | 隔离数据源、撤销访问并调查传播范围 |
| 有依据回答率 | 主张能否由可访问来源直接支持 | 有链接就算正确 | 降低自动化范围或强制人工复核 |
| 误拒与漏放 | 同时报告,按用户与场景切片 | 只优化其中一个数字 | 调整策略并重新评估业务伤害 |
| 停止与恢复时间 | 从发现到限制影响、从修复到安全恢复 | 只记录关闭前端所需时间 | 超出目标就改造开关、权限和回滚路径 |
对存在随机性的模型,单个样本运行一次只能说明那次结果。高风险测试应固定环境并重复执行,记录模型版本、温度、系统提示、知识版本和工具配置;如果供应商使用不可见的滚动更新,则应增加基准样本监控,以行为变化触发复测。指标阈值也不能从网上抄一个统一数字,而应由影响、可逆性、人工复核能力和组织风险容忍度共同决定。
残余风险必须有人签收,不能藏在报告附件里
测试结束后仍可能存在无法完全消除的风险,例如低概率幻觉、供应商不可见更新或少量误拒。团队应为每项残余风险记录失败场景、影响对象、当前控制、监控信号、临时限制、责任人、复核日期和接受者。技术人员可以说明证据,但不能替业务所有者替代决定可接受的损失。
| 残余风险字段 | 示例写法 | 不合格写法 |
|---|---|---|
| 具体失败 | 扫描版中文合同可能漏检关键金额 | 模型偶尔不准确 |
| 影响与范围 | 仅限合同摘要,不允许自动审批或付款 | 影响较小 |
| 补偿控制 | 金额与期限必须显示原文定位并由法务复核 | 加强提示词 |
| 监控和退出 | 漏检率超阈值立即关闭扫描件入口 | 持续关注 |
| 责任与期限 | 合同产品负责人在下一模型版本后复核 | AI 团队负责 |
模型、提示或供应商变化时,不能默认安全结论继续有效
生成式 AI 产品常在没有传统版本发布仪式的情况下变化:供应商可能更新底层模型,团队可能调整系统提示、检索切分、嵌入模型、审核策略或工具 schema。每一项变化都可能改变拒答、引用、权限和动作行为。变更管理应先判断影响面,再决定执行完整回归还是针对性复测。
| 变化 | 至少重新测试 | 上线策略 |
|---|---|---|
| 主模型或模型版本 | 核心任务、拒答、引用、注入、工具调用和费用 | 新旧版本并行小流量对照 |
| 系统提示或审核策略 | 正常任务、误拒、漏放、多轮绕过 | 保留旧版本与快速回滚 |
| 知识库、切分或嵌入 | 权限、召回、过期内容、污染与引用定位 | 先影子索引,核验后切流 |
| 新增工具或扩大权限 | 鉴权、参数、幂等、预算、审批和撤销 | 默认只读,再逐项开放写入 |
| 供应商条款或数据路径 | 保留、训练、区域、子处理者、删除与退出 | 法务和数据责任人重新签收 |
如果供应商不提供精确模型版本,团队至少要保留一组稳定基准请求,持续观察输出结构、拒答、引用、延迟、费用和工具选择的变化。检测到明显漂移时,先冻结扩大使用范围,再决定是否回退、切换模型或接受新的残余风险。所谓“自动升级到更强模型”不是安全理由,因为能力提高也可能扩大可执行范围和攻击收益。
第七步:上线门禁要能直接作出“放行或停止”决定
| 上线问题 | 放行证据 | 停止条件示例 |
|---|---|---|
| 高风险失败是否关闭 | 复测通过或书面接受残余风险 | 仍可跨租户读取或未经确认写入 |
| 是否能限制影响范围 | 用户、地域、租户、金额与速率灰度 | 只能全量开或全量关 |
| 是否能观察 | 权限拒绝、异常工具、费用和质量告警 | 无法关联请求、模型、知识和动作版本 |
| 是否能停止与恢复 | 紧急开关、降级、回滚与演练记录 | 关掉聊天仍不能停止后台动作 |
| 谁承担决定 | 业务、安全、数据和系统责任人签字 | 责任留给“AI 团队”或供应商 |
不要用一个总分掩盖致命缺陷。跨租户泄露、未授权付款、不可逆删除和密钥暴露应设为硬门禁,即使平均回答质量很高也不能抵消。低风险内部摘要工具与可操作生产系统的门槛也不应相同,应按影响范围和可逆性分级。
第八步:日志要支持调查,但不能成为新的数据仓库
| 建议记录 | 目的 | 默认不应完整长期保存 |
|---|---|---|
| 请求 ID、时间、租户与角色 | 关联身份与事件 | 不必要的真实姓名与证件 |
| 模型、提示模板、知识与工具版本 | 复现和定位漂移 | 系统提示中的秘密与令牌 |
| 权限决策、工具参数摘要与结果码 | 审计真实动作 | 完整敏感业务载荷 |
| 耗时、令牌、费用、拒绝与错误 | 发现滥用、循环和退化 | 无期限保存的原始对话 |
| 人工审批、修改、撤销与复盘编号 | 确认责任与恢复路径 | 与调查无关的附件副本 |
日志字段、访问者、保存期限和删除机制应在上线前确定。为调试临时打开完整提示记录时,应限定范围、脱敏、审批并设置自动到期;不能把“以后可能有用”作为永久收集理由。
第九步:事件响应要围绕 AI 特有证据设计

| 阶段 | 关键动作 | AI 特有证据 |
|---|---|---|
| 发现与分级 | 确认用户、数据、动作、金额和传播范围 | 模型、提示、知识库、工具和策略版本 |
| 止损 | 撤销令牌、关闭工具、隔离索引、降级模型 | 不要只关闭前端聊天入口 |
| 保全证据 | 保存请求链、权限决策、来源和动作结果 | 记录可复现参数,同时控制敏感数据访问 |
| 修复 | 修权限、数据、解析、策略或供应链问题 | 不能只追加一句“忽略恶意指令” |
| 回归与恢复 | 加入失败样本,分批恢复并持续观察 | 验证同义改写、跨租户和工具副作用 |
| 通知与复盘 | 按合同、法规和影响通知,跟踪根因整改 | 区分模型行为、应用缺陷和运营失误 |
中国团队还要核对哪些现行要求
安全工程与法律适用范围不能互相替代。面向中国境内公众提供生成文本、图片、音频或视频服务时,应核对《生成式人工智能服务管理暂行办法》。国家标准信息平台显示,GB/T 45654—2025《网络安全技术 生成式人工智能服务安全基本要求》已于 2025 年 11 月 1 日实施,范围包括语料安全、模型安全、安全措施与评估要求。做组织级风险梳理时,还可参照全国网络安全标准化技术委员会发布的《人工智能安全治理框架》理解风险分类与治理思路。
生成合成内容还应核对《人工智能生成合成内容标识办法》及配套标准。普通企业内部使用、面向公众提供服务、受监管行业和高风险自动决策的适用义务不同;本文提供工程核验框架,不替代针对具体业务、地区和行业的法律意见。
| 场景 | 优先核对 | 额外负责人 |
|---|---|---|
| 员工内部助手 | 数据、权限、劳动与商业秘密边界 | 信息安全、人力与业务所有者 |
| 面向公众的生成式 AI 服务 | 暂行办法、GB/T 45654—2025、备案与公示范围 | 法务、合规、内容安全与运营 |
| 生成图片、音视频或文本发布 | 生成合成内容标识、版权和平台规则 | 内容、法务与发布责任人 |
| 金融、医疗、教育等高影响场景 | 行业规则、专业复核、可解释与申诉 | 行业合规与专业责任人 |
小团队的最小可行安全清单
资源有限不等于省略控制。小团队可以先把最危险的权限与数据问题做对,再逐步扩展测试覆盖:
| 优先级 | 今天能做的动作 | 完成标准 |
|---|---|---|
| P0 | 列出用户、数据、模型、知识库和所有工具 | 每项有所有者与环境 |
| P0 | 移除共享管理员密钥,读写工具分离 | 服务端按身份重新鉴权 |
| P0 | 为付款、删除、外发和发布加入人工确认 | 可预览、取消和回滚 |
| P1 | 建立 30 至 50 条正常、边界、注入与越权样本 | 随版本自动回归并保留结果 |
| P1 | 配置费用、循环、异常工具与跨租户告警 | 告警有值班人与处置时限 |
| P1 | 演练模型下线、索引污染与错误动作 | 实测停止和恢复时间 |
| P2 | 按月复核模型、供应商、依赖和残余风险 | 变更触发重新测试 |
常见问题
通过内容审核,是否就代表 AI 系统安全?
不代表。内容审核主要处理输入或输出类别;跨租户访问、提示注入、工具越权、密钥泄露、供应链污染和不可逆动作仍需要独立控制与测试。
使用知名大模型,应用层还需要做安全测试吗?
需要。供应商负责其服务边界,你仍负责身份、数据、检索、提示、插件、工具、业务规则和用户告知。更换模型也可能改变拒答、工具调用和输出格式,应触发回归。
系统提示词能阻止提示注入吗?
不能把它当作唯一边界。提示可以降低部分失败,但真正的保护来自来源限制、内容与指令分离、服务端鉴权、最小权限、参数校验、人工审批、监控和回滚。
多久应重新评估一次?
固定周期只是下限。模型、知识库、提示模板、工具、权限、供应商条款或高风险失败发生变化时,都应立即触发相应范围的重新测试;重大事件后还要把失败样本加入回归集。
结论:安全不是“模型会不会拒答”,而是系统能否受控失败
判断 AI 系统是否具备上线条件,不要只问模型回答得多聪明。应检查资产和数据流是否清楚、权限是否在服务端执行、测试是否覆盖攻击与恢复、真实动作是否可预览和撤销、日志是否足以复现、事件发生时是否能迅速限制影响。能发现、停止、解释、恢复并持续改进,才是全生命周期 AI 安全的核心。
编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 18 日重构。旧稿将 AI 安全泛化为“数字免疫系统”,缺少可验证来源、内链和运行门禁,并使用来源不明的百度图片;本次删除无法核验的抽象断言,依据 NIST、OWASP、MITRE、CISA/NCSC、中国网信办和国家标准信息平台的一手资料,重建为系统边界、威胁场景、六阶段门禁、RAG 与智能体控制、测试、上线、日志和事件响应框架。本站的来源、更新与纠错原则见关于本站与编辑规范。
