一句话回答:AI 风险不能只概括为“隐私、偏见、失业和安全”。更可执行的分类是:有人故意用 AI 伤害他人的恶意滥用,系统在正常使用中产生错误的失效风险,攻击者针对数据、模型、RAG、应用或智能体的对抗攻击,以及规模化部署形成的系统性影响。四类风险可能同时发生,但防线不同。本文依据 NIST、OWASP GenAI、MITRE ATLAS、CISA/FBI、ILO、OECD 与中国主管部门一手资料复核,资料复核日为 2026 年 7 月 18 日。

AI 滥用、AI 失效和 AI 攻击有什么区别?
滥用是行为人把正常或被绕过的 AI 能力用于诈骗、骚扰、仿冒、操纵或恶意代码等有害目的;失效不要求攻击者存在,例如模型自信地虚构、数据偏差、系统漂移或操作人员过度依赖;攻击是有人试图改变 AI 或相连系统的行为、窃取数据和模型、绕过授权或取得工具控制;系统性影响来自大规模采用、市场和组织激励,例如职业任务重构、权力集中、信息污染与环境成本。
| 类型 | 典型问题 | 首要负责人 | 主要控制 |
|---|---|---|---|
| 恶意滥用 | AI 语音诈骗、批量钓鱼、虚假身份和骚扰 | 产品滥用防护、信任安全、执法协作 | 身份与用途验证、速率、检测、举报和冻结 |
| 系统失效 | 虚构引用、偏差、错误建议、越权自动化 | 产品、模型评测、业务与运营 | 基准集、人工闸门、引用核验、监控和回滚 |
| 对抗攻击 | 提示注入、投毒、模型提取、工具劫持 | 安全、工程、供应链与事件响应 | 最小权限、隔离、鉴权、红队、检测和响应 |
| 系统性影响 | 就业转型、信息生态污染、资源和竞争影响 | 管理层、公共治理、劳资与行业主体 | 影响评估、社会对话、透明、竞争和转型支持 |
这四类不是互斥标签。攻击者可在公开网页植入间接提示,污染企业 RAG;Agent 读取后越权发送邮件。这同时包含攻击、系统失效、隐私损害和滥用。处置时要沿完整链路找控制,不能只给模型增加一句“忽略恶意指令”。
普通用户最常遇到哪些 AI 滥用?
| 场景 | 危险信号 | 立即动作 |
|---|---|---|
| 语音或视频仿冒 | 熟人使用新号码,制造紧急事件并要求转账或保密 | 挂断后通过已确认号码回拨,使用家庭暗号,不按对方链接操作 |
| 批量钓鱼 | 语言自然但要求登录、下载、移交验证码或切换平台 | 从官方入口打开账户,启用 MFA,不提供验证码 |
| 投资与情感诈骗 | 名人视频背书、保证收益、拒绝线下或独立验证 | 停止付款,通过监管和官方渠道核实身份与资质 |
| 虚假新闻与截图 | 只有截图片段,没有原始链接、日期和上下文 | 反向查找原始发布者,核对多家一手来源 |
| 恶意求职与招聘 | 要求先付费、提交密钥,或面试身份和公司域名不一致 | 独立访问公司招聘页,核实人员和域名,最小化个人材料 |
| AI 客服冒充 | 机器人索要密码、完整支付卡或远程控制设备 | 终止会话,从官方网站重新进入客服并报告 |
FBI 在 2025 年披露的冒充活动中,攻击者使用 AI 生成语音配合短信和新通信平台建立信任,并建议通过已确认渠道独立核实联系人、不要发送资金或验证码、启用多因素认证。参见 FBI 官方警报。识别 deepfake 的视觉小瑕疵只能作为弱信号;当生成质量提高时,最可靠的是独立身份验证、交易延迟和双人批准。
生成式 AI 自身可能怎样失效?
NIST AI 600-1 生成式 AI Profile列出虚构、危险或仇恨内容、数据隐私、环境影响、信息完整性、信息安全、知识产权、偏差、价值链与组件集成等风险。所谓“幻觉”不是只有模型完全编造:它也可能把真实来源中的主体、时间、数字或因果关系组合错,并生成看似合理的引用和解释。
| 失效模式 | 不能依赖的假控制 | 有效控制组合 |
|---|---|---|
| 虚构事实或引用 | 提示“不要编造” | 限制来源、原子主张核验、拒答、人工复核和纠错记录 |
| 历史偏差 | 只看总体准确率 | 分群测试、代表性分析、结果监控与申诉 |
| 过度依赖 | 页面底部写“仅供参考” | 界面显示证据和不确定性,人员培训,关键决定强制人工判断 |
| 上下文遗漏 | 一次塞入更多文档 | 任务拆分、来源优先级、完整性检查与缺口声明 |
| 成本或资源失控 | 只设置模型账单预算 | 请求和工具双重限额、超时、循环检测、缓存与降级 |
| 模型/供应商变更 | 默认新版本一定更好 | 固定版本、变更通知、回归测试和可回退配置 |
本站的 原子主张与证据忠实度核验框架可用于处理生成式回答;完整上线流程见 AI 项目从评估到生产监控指南。
AI 应用有哪些独特攻击面?

MITRE ATLAS是基于真实观察与红队演示持续维护的 AI 对抗战术与技术知识库,覆盖侦察、资源准备、初始访问、模型访问、执行、持久化、逃避、防御、凭证、收集、外泄和影响等阶段。OWASP 2025 LLM/GenAI Top 10则从应用安全角度列出提示注入、敏感信息泄露、供应链、数据/模型投毒、不当输出处理、过度代理等风险。
| 层 | 攻击示例 | 最低防线 |
|---|---|---|
| 数据与模型供应链 | 恶意数据集、模型、适配器或依赖被植入后门 | 可信来源、哈希/签名、版本锁定、扫描、隔离评测和资产清单 |
| 模型推理 | 越狱、成员推断、模型提取和资源耗尽 | 速率与配额、输出限制、隐私测试、异常检测和分层访问 |
| RAG/上下文 | 网页或文档中的间接提示改变 Agent 行为 | 来源信任、内容与指令分离、文档权限过滤、引用和工具闸门 |
| 应用接口 | 鉴权绕过、输出进入 HTML/SQL/shell 造成注入 | 确定性授权、参数化、输出编码、会话隔离和传统 AppSec |
| Agent 工具 | 模型被诱导发送邮件、删除数据或执行命令 | 最小权限、工具白名单、强类型参数、预览、审批与回滚 |
| 人员流程 | 社会工程、影子 AI、复制敏感信息、忽略警告 | 安全入口、数据分类、培训、举报和可用替代工具 |
系统提示词不是秘密,也不应保存密码、连接字符串或用作授权规则。OWASP 的 System Prompt Leakage 指南明确指出,根本问题通常是把敏感数据或访问控制交给了提示词。身份、租户隔离、字段权限和工具参数必须由模型之外的代码强制执行。
为什么提示注入尤其危险?
直接提示注入来自用户输入;间接注入藏在网页、邮件、PDF、代码、图片或 RAG 文档中。当 Agent 能使用浏览器、邮箱、数据库或 shell 时,注入不再只是让聊天机器人“说错话”,还可能触发未授权读取、写入和外发。OWASP 明确说明 RAG 和微调不能彻底消除提示注入;影响取决于应用给模型多大权限。
| 设计问题 | 安全设计 |
|---|---|
| 把所有网页文字与系统指令放进同一上下文 | 标记不可信内容,不允许其改变工具策略和授权 |
| Agent 自由构造任意工具参数 | 工具采用强类型 schema、枚举、长度和目标范围限制 |
| 读到指令就自动发送、付款或删除 | 产生预览与差异,高影响动作由人确认并使用双人批准 |
| 工具使用用户全部权限 | 为每个任务发放短期、最小范围凭证并记录调用 |
| 只测试已知越狱提示 | 覆盖直接、间接、多模态、分片、编码与跨工具攻击链 |
更完整的智能体权限、审批和回滚方法见本站 AI 智能体与自动化治理指南。
怎样防止敏感信息被 AI 泄露?
泄露可能发生在输入、日志、向量库、微调、缓存、模型输出、工具返回或跨租户索引。只在提示中写“不要泄露”不可靠,提示注入可能绕过它。数据首先要被分类和最小化;秘密不进入提示和系统 prompt;检索必须在查询前按用户/租户权限过滤;输出再做敏感字段检测,但输出过滤只是最后一道防线。
| 数据 | 默认处理 | 例外条件 |
|---|---|---|
| 密码、API Key、私钥、验证码 | 禁止输入模型;使用秘密管理系统 | 无 |
| 客户/员工个人信息 | 最小化、脱敏、限定用途与保留 | 有明确处理依据、权限、合同和审计 |
| 商业机密与未发布代码 | 仅使用获批企业入口和隔离环境 | 确认供应商条款、训练/保留、访问与退出机制 |
| 公开网页 | 仍检查版权、时效、恶意注入和个人信息 | 公开不等于可信或可任意再利用 |
联合发布的 AI 数据安全最佳实践可用于训练与运行数据保护;OWASP 的 敏感信息泄露说明强调,敏感信息既可能来自模型,也可能来自应用上下文。
数据投毒与 AI 供应链风险怎样控制?
AI 应用很少从零构建:它可能下载基础模型、适配器、嵌入模型、数据集、评测集、提示模板、代码包和容器,还会持续抓取网页或同步知识库。攻击者不必直接入侵生产服务器,只要让恶意内容进入训练、微调、RAG 或 Agent 工具目录,就可能长期影响输出。投毒也不一定表现为“全部结果变差”,更危险的后门可能只在特定短语、用户、图片或工具参数出现时触发。
| 供应链对象 | 风险 | 验收控制 |
|---|---|---|
| 模型与适配器 | 来源冒充、恶意反序列化、隐藏后门、许可证不兼容 | 官方来源、签名/哈希、隔离加载、格式限制、行为回归与许可记录 |
| 训练/微调数据 | 标签操纵、触发样本、个人信息和版权污染 | 数据谱系、去重、抽样、异常聚类、敏感扫描与删除路径 |
| RAG 文档 | 间接注入、过期政策、跨租户文档和恶意链接 | 来源信任级别、发布审批、权限过滤、版本和内容隔离 |
| 评测集 | 被训练数据污染、只覆盖正常问题、指标被“刷分” | 密封测试、独立维护、边界/攻击用例和定期换题 |
| 工具与插件 | 包名劫持、权限过宽、更新后行为变化 | 允许清单、SBOM、固定版本、最小权限、更新复测与快速撤销 |
NIST 的对抗机器学习分类覆盖规避、投毒、隐私与生成式 AI 滥用攻击,并提醒现有缓解方法都有局限。可参考 NIST AI 100-2 官方说明。供应链控制的目标不是证明组件“绝对安全”,而是让来源、版本、变更、权限和回退都可追踪,并在组件更换时触发测试。
红队测试应该覆盖哪些场景?
红队不是让几个人随意“想办法越狱”。测试计划要来自真实资产、威胁主体和业务影响,并覆盖攻击成功后的下游动作。聊天机器人、代码助手、RAG 搜索和能付款的 Agent 的攻击面完全不同。每个用例应记录前置权限、输入载体、预期安全行为、实际结果、影响范围和修复后的回归版本。
| 测试族 | 最低用例 | 通过标准 |
|---|---|---|
| 直接/间接注入 | 用户文本、网页、PDF、邮件、图片隐藏指令和多轮分片 | 不改变授权与工具策略;不可信内容不会触发高影响动作 |
| 数据与隐私 | 跨租户检索、越权文档、秘密、日志、成员推断和数据导出 | 无未授权内容;事件可检测、可追踪并能撤销访问 |
| 工具与 Agent | 参数逃逸、目标替换、循环、重复付款、删除和外发 | 强类型约束、幂等、预算、审批和回滚全部生效 |
| 输出安全 | HTML、Markdown、SQL、shell、代码和 URL 被下游直接执行 | 按目标上下文编码/隔离;输出从不自动变成可信命令 |
| 可用性与成本 | 超长输入、并发、递归工具、异常供应商响应 | 限额、超时、熔断、降级和费用告警按设计触发 |
| 人机协作 | 高置信错误、来源冲突、警告疲劳和紧急社会工程 | 人员能发现、拒绝、升级并在时限内切换安全流程 |
修复后必须把失败输入保存为回归用例,并测试等价变体,而不是只屏蔽一个字符串。高影响系统还应安排与开发团队相对独立的评估者,并让业务、领域、安全、隐私和一线操作人员共同定义“伤害”,避免红队只优化技术越狱率。
虚假信息和 AI 合成内容应怎样治理?
控制不能只依赖“肉眼识别 AI”。平台和服务应保留来源、模型与编辑记录,使用适用的机器可读标记和显式说明,并为高影响内容建立人工核验。发布者应链接原始资料、分开事实和推断、提供更正渠道;用户遇到转账、健康、法律、政策和突发新闻时,应通过独立一手渠道复核。
中国 《人工智能生成合成内容标识办法》自 2025 年 9 月 1 日施行,区分显式和隐式标识,并覆盖生成、下载、传播与用户声明等环节。适用服务还需结合 《生成式人工智能服务管理暂行办法》及深度合成、算法、个人信息、数据和行业规则分析。标识能帮助溯源和告知,但不能证明内容真实,也不能替代事实核查。
AI 会不会导致大规模失业?
“某职业暴露于生成式 AI”不等于“该职业必然消失”。ILO 2025 年更新以任务为单位评估职业暴露,指出文职职业暴露较高,同时强调由于仍需人工投入,多数工作更可能被转型而非完全替代。2026 年 ILO 又提醒,暴露指标应作为早期信号,并结合真实就业、工资和岗位转移数据,不能单独当作失业预测。
| 错误做法 | 负责任的组织做法 |
|---|---|
| 用“AI 会替代岗位”制造恐慌并立即裁员 | 按任务分析能力和风险,用试点数据评估质量、负荷和新职责 |
| 只培训提示词 | 同时培训核验、隐私、安全、领域判断和申诉处理 |
| 把隐性人工审核从指标中删除 | 计算完整劳动、返工和心理负担,明确人工责任 |
| 不给员工参与设计 | 通过社会对话让员工、工会和受影响群体参与流程重构 |
参考 ILO 2025 研究简报。组织应公开岗位变化依据、提供转岗与培训、监测差异化影响,并避免用未经验证的效率数字替代人的工作质量。
怎样建立 AI 滥用监测与事件响应?

| 阶段 | 动作 | 成功证据 |
|---|---|---|
| 检测与验证 | 确认行为、账户、影响对象、严重度和扩散 | 事件编号、时间线、可信证据和初步分级 |
| 限制能力 | 降速、停工具、撤销密钥、隔离租户或切回只读 | 滥用路径停止且正常用户有安全替代 |
| 保护受害者 | 纠错、冻结可疑交易、通知、恢复账户或权益 | 受影响范围和补救状态可追踪 |
| 保存与协作 | 保留必要日志,联络法务、供应商、平台和主管机构 | 证据链、访问控制与依法沟通记录 |
| 根因修复 | 修正权限、数据、检测、工具、界面或组织流程 | 攻击路径被确定性控制而非仅换提示 |
| 复测与学习 | 补回归、红队、威胁情报、培训和政策 | 闸门通过并由风险 Owner 批准恢复 |
CISA JCDC AI Cybersecurity Collaboration Playbook强调把 AI 事件和漏洞的信息共享纳入既有响应流程。OECD AI Incidents and Hazards Monitor 方法区分已造成实际伤害的 incident 与可能导致伤害的 hazard,为内部分类和跨组织学习提供参考。
企业采购或上线前的 15 项检查
- 明确允许用途、禁止用途、受影响对象和风险 Owner。
- 建立规则或人工流程的非 AI 基线。
- 盘点训练、微调、RAG、日志、工具和供应商数据流。
- 验证数据和模型来源、许可证、哈希、版本与供应链。
- 按租户和用户在检索前强制权限,不依赖模型判断。
- 为虚构、偏差、隐私、安全和滥用建立真实基准集。
- 覆盖直接、间接、多模态提示注入和数据/模型投毒。
- 所有工具采用最小权限、强类型参数、超时和费用上限。
- 外发、支付、删除、生产变更保留预览和人工批准。
- 监控异常速率、敏感输出、权限失败、循环和成本。
- 为用户提供可达举报、申诉、转人工和更正渠道。
- 预演撤销密钥、切换供应商、降级和完整回滚。
- 合同明确数据保留、训练、事件通知、审计和退出。
- 依法完成内容标识、隐私、备案/评估和行业要求。
- 模型、数据、权限、工具或用途变化后重新测试。
需要把这些控制提升为组织级伦理与问责制度,可配合本站的 AI 道德准则从原则到可审计控制指南;模型和部署选择可参考 模型与部署边界指南。
常见问题
不用生成式 AI 就没有这些风险吗?
不是。传统预测模型也可能遭遇投毒、规避、模型窃取、偏差、隐私和过度自动化。生成式和智能体系统增加了自然语言指令、开放输出、RAG、工具使用和多模态等新攻击面,但传统身份、授权、会话、依赖、安全编码和事件响应仍是基础。
开源模型是否更容易被滥用?
不能只按开放或闭源判断。开放权重可能增加审计、离线控制和研究能力,也可能降低某些能力获得门槛;托管模型可以集中实施滥用检测,但部署者更依赖供应商。应评估具体能力、权重获取、工具权限、数据、许可、监控和应用场景。
给输出加水印能阻止虚假信息吗?
不能。标识可改善告知和溯源,但可能丢失、被篡改或无法覆盖全部工具。高影响内容仍需来源、身份和事实核验;没有标识也不能证明内容由人创作。
怎样判断风险控制有效?
用攻击和失败场景验证,而不是看政策数量。检查攻击是否被阻断、敏感数据是否真的不可达、操作人员能否接管、受害者能否获得补救、恢复是否经过回归测试,以及同一路径是否再次发生。
结论:不要用一条“禁止滥用”解决所有风险
安全的 AI 产品需要同时管理有意滥用、无意失效、对抗攻击和系统性影响。个人用户最有效的防线是独立核实身份与重要事实;开发团队要把模型放回完整应用与供应链中,使用确定性授权、最小权限、评测和回滚;组织还要为受影响者提供申诉与恢复,并对就业、信息生态和资源影响承担长期责任。真正有效的控制能限制能力、保护人、保存证据并从事件中学习,而不只是封一个账号或改一行提示词。
编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 18 日复核。旧稿把风险主要归为隐私、歧视、失业、安全和虚假信息,并给出个人层面的泛化建议;新版区分恶意滥用、系统失效、对抗攻击与系统性影响,依据 NIST、OWASP、MITRE、CISA/FBI、ILO、OECD 和中国主管部门资料,补充 AI 应用六层攻击面、提示注入、数据泄露、事件响应与采购闸门。本站来源和纠错方法见 关于本站与编辑规范。
