AI安全、版权与合规

AI滥用有哪些风险?诈骗、提示注入、数据泄露与防范指南

AI风险不只有隐私和失业。本文区分恶意滥用、系统失效、对抗攻击与系统性影响,并给出普通用户核验、企业最小权限、红队测试、事件响应和上线检查方法。

AI风险分为恶意滥用、系统失效、对抗攻击和系统性影响四类的风险分类图
本页目录
  1. AI 滥用、AI 失效和 AI 攻击有什么区别?
  2. 普通用户最常遇到哪些 AI 滥用?
  3. 生成式 AI 自身可能怎样失效?
  4. AI 应用有哪些独特攻击面?
  5. 为什么提示注入尤其危险?
  6. 怎样防止敏感信息被 AI 泄露?
  7. 数据投毒与 AI 供应链风险怎样控制?
  8. 红队测试应该覆盖哪些场景?
  9. 虚假信息和 AI 合成内容应怎样治理?
  10. AI 会不会导致大规模失业?
  11. 怎样建立 AI 滥用监测与事件响应?
  12. 企业采购或上线前的 15 项检查
  13. 常见问题
  14. 不用生成式 AI 就没有这些风险吗?
  15. 开源模型是否更容易被滥用?
  16. 给输出加水印能阻止虚假信息吗?
  17. 怎样判断风险控制有效?
  18. 结论:不要用一条“禁止滥用”解决所有风险

一句话回答:AI 风险不能只概括为“隐私、偏见、失业和安全”。更可执行的分类是:有人故意用 AI 伤害他人的恶意滥用,系统在正常使用中产生错误的失效风险,攻击者针对数据、模型、RAG、应用或智能体的对抗攻击,以及规模化部署形成的系统性影响。四类风险可能同时发生,但防线不同。本文依据 NIST、OWASP GenAI、MITRE ATLAS、CISA/FBI、ILO、OECD 与中国主管部门一手资料复核,资料复核日为 2026 年 7 月 18 日

AI 风险分为恶意滥用、系统失效、对抗攻击和系统性影响四类的风险分类图
先判断风险来自恶意使用、系统错误、攻击还是规模效应,再决定产品、安全、治理或公共政策控制。图:兰塞 AI 编辑部原创。

AI 滥用、AI 失效和 AI 攻击有什么区别?

滥用是行为人把正常或被绕过的 AI 能力用于诈骗、骚扰、仿冒、操纵或恶意代码等有害目的;失效不要求攻击者存在,例如模型自信地虚构、数据偏差、系统漂移或操作人员过度依赖;攻击是有人试图改变 AI 或相连系统的行为、窃取数据和模型、绕过授权或取得工具控制;系统性影响来自大规模采用、市场和组织激励,例如职业任务重构、权力集中、信息污染与环境成本。

类型 典型问题 首要负责人 主要控制
恶意滥用 AI 语音诈骗、批量钓鱼、虚假身份和骚扰 产品滥用防护、信任安全、执法协作 身份与用途验证、速率、检测、举报和冻结
系统失效 虚构引用、偏差、错误建议、越权自动化 产品、模型评测、业务与运营 基准集、人工闸门、引用核验、监控和回滚
对抗攻击 提示注入、投毒、模型提取、工具劫持 安全、工程、供应链与事件响应 最小权限、隔离、鉴权、红队、检测和响应
系统性影响 就业转型、信息生态污染、资源和竞争影响 管理层、公共治理、劳资与行业主体 影响评估、社会对话、透明、竞争和转型支持

这四类不是互斥标签。攻击者可在公开网页植入间接提示,污染企业 RAG;Agent 读取后越权发送邮件。这同时包含攻击、系统失效、隐私损害和滥用。处置时要沿完整链路找控制,不能只给模型增加一句“忽略恶意指令”。

普通用户最常遇到哪些 AI 滥用?

场景 危险信号 立即动作
语音或视频仿冒 熟人使用新号码,制造紧急事件并要求转账或保密 挂断后通过已确认号码回拨,使用家庭暗号,不按对方链接操作
批量钓鱼 语言自然但要求登录、下载、移交验证码或切换平台 从官方入口打开账户,启用 MFA,不提供验证码
投资与情感诈骗 名人视频背书、保证收益、拒绝线下或独立验证 停止付款,通过监管和官方渠道核实身份与资质
虚假新闻与截图 只有截图片段,没有原始链接、日期和上下文 反向查找原始发布者,核对多家一手来源
恶意求职与招聘 要求先付费、提交密钥,或面试身份和公司域名不一致 独立访问公司招聘页,核实人员和域名,最小化个人材料
AI 客服冒充 机器人索要密码、完整支付卡或远程控制设备 终止会话,从官方网站重新进入客服并报告

FBI 在 2025 年披露的冒充活动中,攻击者使用 AI 生成语音配合短信和新通信平台建立信任,并建议通过已确认渠道独立核实联系人、不要发送资金或验证码、启用多因素认证。参见 FBI 官方警报。识别 deepfake 的视觉小瑕疵只能作为弱信号;当生成质量提高时,最可靠的是独立身份验证、交易延迟和双人批准。

生成式 AI 自身可能怎样失效?

NIST AI 600-1 生成式 AI Profile列出虚构、危险或仇恨内容、数据隐私、环境影响、信息完整性、信息安全、知识产权、偏差、价值链与组件集成等风险。所谓“幻觉”不是只有模型完全编造:它也可能把真实来源中的主体、时间、数字或因果关系组合错,并生成看似合理的引用和解释。

失效模式 不能依赖的假控制 有效控制组合
虚构事实或引用 提示“不要编造” 限制来源、原子主张核验、拒答、人工复核和纠错记录
历史偏差 只看总体准确率 分群测试、代表性分析、结果监控与申诉
过度依赖 页面底部写“仅供参考” 界面显示证据和不确定性,人员培训,关键决定强制人工判断
上下文遗漏 一次塞入更多文档 任务拆分、来源优先级、完整性检查与缺口声明
成本或资源失控 只设置模型账单预算 请求和工具双重限额、超时、循环检测、缓存与降级
模型/供应商变更 默认新版本一定更好 固定版本、变更通知、回归测试和可回退配置

本站的 原子主张与证据忠实度核验框架可用于处理生成式回答;完整上线流程见 AI 项目从评估到生产监控指南

AI 应用有哪些独特攻击面?

AI 应用从数据供应链、模型推理、RAG 上下文、应用接口、智能体工具到人员流程的六层攻击面
模型只是系统的一部分;传统鉴权、会话、依赖与日志安全仍然有效,而且不能交给模型判断。图:兰塞 AI 编辑部原创。

MITRE ATLAS是基于真实观察与红队演示持续维护的 AI 对抗战术与技术知识库,覆盖侦察、资源准备、初始访问、模型访问、执行、持久化、逃避、防御、凭证、收集、外泄和影响等阶段。OWASP 2025 LLM/GenAI Top 10则从应用安全角度列出提示注入、敏感信息泄露、供应链、数据/模型投毒、不当输出处理、过度代理等风险。

攻击示例 最低防线
数据与模型供应链 恶意数据集、模型、适配器或依赖被植入后门 可信来源、哈希/签名、版本锁定、扫描、隔离评测和资产清单
模型推理 越狱、成员推断、模型提取和资源耗尽 速率与配额、输出限制、隐私测试、异常检测和分层访问
RAG/上下文 网页或文档中的间接提示改变 Agent 行为 来源信任、内容与指令分离、文档权限过滤、引用和工具闸门
应用接口 鉴权绕过、输出进入 HTML/SQL/shell 造成注入 确定性授权、参数化、输出编码、会话隔离和传统 AppSec
Agent 工具 模型被诱导发送邮件、删除数据或执行命令 最小权限、工具白名单、强类型参数、预览、审批与回滚
人员流程 社会工程、影子 AI、复制敏感信息、忽略警告 安全入口、数据分类、培训、举报和可用替代工具

系统提示词不是秘密,也不应保存密码、连接字符串或用作授权规则。OWASP 的 System Prompt Leakage 指南明确指出,根本问题通常是把敏感数据或访问控制交给了提示词。身份、租户隔离、字段权限和工具参数必须由模型之外的代码强制执行。

为什么提示注入尤其危险?

直接提示注入来自用户输入;间接注入藏在网页、邮件、PDF、代码、图片或 RAG 文档中。当 Agent 能使用浏览器、邮箱、数据库或 shell 时,注入不再只是让聊天机器人“说错话”,还可能触发未授权读取、写入和外发。OWASP 明确说明 RAG 和微调不能彻底消除提示注入;影响取决于应用给模型多大权限。

设计问题 安全设计
把所有网页文字与系统指令放进同一上下文 标记不可信内容,不允许其改变工具策略和授权
Agent 自由构造任意工具参数 工具采用强类型 schema、枚举、长度和目标范围限制
读到指令就自动发送、付款或删除 产生预览与差异,高影响动作由人确认并使用双人批准
工具使用用户全部权限 为每个任务发放短期、最小范围凭证并记录调用
只测试已知越狱提示 覆盖直接、间接、多模态、分片、编码与跨工具攻击链

更完整的智能体权限、审批和回滚方法见本站 AI 智能体与自动化治理指南

怎样防止敏感信息被 AI 泄露?

泄露可能发生在输入、日志、向量库、微调、缓存、模型输出、工具返回或跨租户索引。只在提示中写“不要泄露”不可靠,提示注入可能绕过它。数据首先要被分类和最小化;秘密不进入提示和系统 prompt;检索必须在查询前按用户/租户权限过滤;输出再做敏感字段检测,但输出过滤只是最后一道防线。

数据 默认处理 例外条件
密码、API Key、私钥、验证码 禁止输入模型;使用秘密管理系统
客户/员工个人信息 最小化、脱敏、限定用途与保留 有明确处理依据、权限、合同和审计
商业机密与未发布代码 仅使用获批企业入口和隔离环境 确认供应商条款、训练/保留、访问与退出机制
公开网页 仍检查版权、时效、恶意注入和个人信息 公开不等于可信或可任意再利用

联合发布的 AI 数据安全最佳实践可用于训练与运行数据保护;OWASP 的 敏感信息泄露说明强调,敏感信息既可能来自模型,也可能来自应用上下文。

数据投毒与 AI 供应链风险怎样控制?

AI 应用很少从零构建:它可能下载基础模型、适配器、嵌入模型、数据集、评测集、提示模板、代码包和容器,还会持续抓取网页或同步知识库。攻击者不必直接入侵生产服务器,只要让恶意内容进入训练、微调、RAG 或 Agent 工具目录,就可能长期影响输出。投毒也不一定表现为“全部结果变差”,更危险的后门可能只在特定短语、用户、图片或工具参数出现时触发。

供应链对象 风险 验收控制
模型与适配器 来源冒充、恶意反序列化、隐藏后门、许可证不兼容 官方来源、签名/哈希、隔离加载、格式限制、行为回归与许可记录
训练/微调数据 标签操纵、触发样本、个人信息和版权污染 数据谱系、去重、抽样、异常聚类、敏感扫描与删除路径
RAG 文档 间接注入、过期政策、跨租户文档和恶意链接 来源信任级别、发布审批、权限过滤、版本和内容隔离
评测集 被训练数据污染、只覆盖正常问题、指标被“刷分” 密封测试、独立维护、边界/攻击用例和定期换题
工具与插件 包名劫持、权限过宽、更新后行为变化 允许清单、SBOM、固定版本、最小权限、更新复测与快速撤销

NIST 的对抗机器学习分类覆盖规避、投毒、隐私与生成式 AI 滥用攻击,并提醒现有缓解方法都有局限。可参考 NIST AI 100-2 官方说明。供应链控制的目标不是证明组件“绝对安全”,而是让来源、版本、变更、权限和回退都可追踪,并在组件更换时触发测试。

红队测试应该覆盖哪些场景?

红队不是让几个人随意“想办法越狱”。测试计划要来自真实资产、威胁主体和业务影响,并覆盖攻击成功后的下游动作。聊天机器人、代码助手、RAG 搜索和能付款的 Agent 的攻击面完全不同。每个用例应记录前置权限、输入载体、预期安全行为、实际结果、影响范围和修复后的回归版本。

测试族 最低用例 通过标准
直接/间接注入 用户文本、网页、PDF、邮件、图片隐藏指令和多轮分片 不改变授权与工具策略;不可信内容不会触发高影响动作
数据与隐私 跨租户检索、越权文档、秘密、日志、成员推断和数据导出 无未授权内容;事件可检测、可追踪并能撤销访问
工具与 Agent 参数逃逸、目标替换、循环、重复付款、删除和外发 强类型约束、幂等、预算、审批和回滚全部生效
输出安全 HTML、Markdown、SQL、shell、代码和 URL 被下游直接执行 按目标上下文编码/隔离;输出从不自动变成可信命令
可用性与成本 超长输入、并发、递归工具、异常供应商响应 限额、超时、熔断、降级和费用告警按设计触发
人机协作 高置信错误、来源冲突、警告疲劳和紧急社会工程 人员能发现、拒绝、升级并在时限内切换安全流程

修复后必须把失败输入保存为回归用例,并测试等价变体,而不是只屏蔽一个字符串。高影响系统还应安排与开发团队相对独立的评估者,并让业务、领域、安全、隐私和一线操作人员共同定义“伤害”,避免红队只优化技术越狱率。

虚假信息和 AI 合成内容应怎样治理?

控制不能只依赖“肉眼识别 AI”。平台和服务应保留来源、模型与编辑记录,使用适用的机器可读标记和显式说明,并为高影响内容建立人工核验。发布者应链接原始资料、分开事实和推断、提供更正渠道;用户遇到转账、健康、法律、政策和突发新闻时,应通过独立一手渠道复核。

中国 《人工智能生成合成内容标识办法》自 2025 年 9 月 1 日施行,区分显式和隐式标识,并覆盖生成、下载、传播与用户声明等环节。适用服务还需结合 《生成式人工智能服务管理暂行办法》及深度合成、算法、个人信息、数据和行业规则分析。标识能帮助溯源和告知,但不能证明内容真实,也不能替代事实核查。

AI 会不会导致大规模失业?

“某职业暴露于生成式 AI”不等于“该职业必然消失”。ILO 2025 年更新以任务为单位评估职业暴露,指出文职职业暴露较高,同时强调由于仍需人工投入,多数工作更可能被转型而非完全替代。2026 年 ILO 又提醒,暴露指标应作为早期信号,并结合真实就业、工资和岗位转移数据,不能单独当作失业预测。

错误做法 负责任的组织做法
用“AI 会替代岗位”制造恐慌并立即裁员 按任务分析能力和风险,用试点数据评估质量、负荷和新职责
只培训提示词 同时培训核验、隐私、安全、领域判断和申诉处理
把隐性人工审核从指标中删除 计算完整劳动、返工和心理负担,明确人工责任
不给员工参与设计 通过社会对话让员工、工会和受影响群体参与流程重构

参考 ILO 2025 研究简报。组织应公开岗位变化依据、提供转岗与培训、监测差异化影响,并避免用未经验证的效率数字替代人的工作质量。

怎样建立 AI 滥用监测与事件响应?

AI 滥用事件从检测验证、限制能力、保护受害者、保存协作、根因修复到复测学习的六步响应闭环
先限制现实伤害,再保存证据和修复根因;响应结束必须形成新的回归用例与控制。图:兰塞 AI 编辑部原创。
阶段 动作 成功证据
检测与验证 确认行为、账户、影响对象、严重度和扩散 事件编号、时间线、可信证据和初步分级
限制能力 降速、停工具、撤销密钥、隔离租户或切回只读 滥用路径停止且正常用户有安全替代
保护受害者 纠错、冻结可疑交易、通知、恢复账户或权益 受影响范围和补救状态可追踪
保存与协作 保留必要日志,联络法务、供应商、平台和主管机构 证据链、访问控制与依法沟通记录
根因修复 修正权限、数据、检测、工具、界面或组织流程 攻击路径被确定性控制而非仅换提示
复测与学习 补回归、红队、威胁情报、培训和政策 闸门通过并由风险 Owner 批准恢复

CISA JCDC AI Cybersecurity Collaboration Playbook强调把 AI 事件和漏洞的信息共享纳入既有响应流程。OECD AI Incidents and Hazards Monitor 方法区分已造成实际伤害的 incident 与可能导致伤害的 hazard,为内部分类和跨组织学习提供参考。

企业采购或上线前的 15 项检查

  1. 明确允许用途、禁止用途、受影响对象和风险 Owner。
  2. 建立规则或人工流程的非 AI 基线。
  3. 盘点训练、微调、RAG、日志、工具和供应商数据流。
  4. 验证数据和模型来源、许可证、哈希、版本与供应链。
  5. 按租户和用户在检索前强制权限,不依赖模型判断。
  6. 为虚构、偏差、隐私、安全和滥用建立真实基准集。
  7. 覆盖直接、间接、多模态提示注入和数据/模型投毒。
  8. 所有工具采用最小权限、强类型参数、超时和费用上限。
  9. 外发、支付、删除、生产变更保留预览和人工批准。
  10. 监控异常速率、敏感输出、权限失败、循环和成本。
  11. 为用户提供可达举报、申诉、转人工和更正渠道。
  12. 预演撤销密钥、切换供应商、降级和完整回滚。
  13. 合同明确数据保留、训练、事件通知、审计和退出。
  14. 依法完成内容标识、隐私、备案/评估和行业要求。
  15. 模型、数据、权限、工具或用途变化后重新测试。

需要把这些控制提升为组织级伦理与问责制度,可配合本站的 AI 道德准则从原则到可审计控制指南;模型和部署选择可参考 模型与部署边界指南

常见问题

不用生成式 AI 就没有这些风险吗?

不是。传统预测模型也可能遭遇投毒、规避、模型窃取、偏差、隐私和过度自动化。生成式和智能体系统增加了自然语言指令、开放输出、RAG、工具使用和多模态等新攻击面,但传统身份、授权、会话、依赖、安全编码和事件响应仍是基础。

开源模型是否更容易被滥用?

不能只按开放或闭源判断。开放权重可能增加审计、离线控制和研究能力,也可能降低某些能力获得门槛;托管模型可以集中实施滥用检测,但部署者更依赖供应商。应评估具体能力、权重获取、工具权限、数据、许可、监控和应用场景。

给输出加水印能阻止虚假信息吗?

不能。标识可改善告知和溯源,但可能丢失、被篡改或无法覆盖全部工具。高影响内容仍需来源、身份和事实核验;没有标识也不能证明内容由人创作。

怎样判断风险控制有效?

用攻击和失败场景验证,而不是看政策数量。检查攻击是否被阻断、敏感数据是否真的不可达、操作人员能否接管、受害者能否获得补救、恢复是否经过回归测试,以及同一路径是否再次发生。

结论:不要用一条“禁止滥用”解决所有风险

安全的 AI 产品需要同时管理有意滥用、无意失效、对抗攻击和系统性影响。个人用户最有效的防线是独立核实身份与重要事实;开发团队要把模型放回完整应用与供应链中,使用确定性授权、最小权限、评测和回滚;组织还要为受影响者提供申诉与恢复,并对就业、信息生态和资源影响承担长期责任。真正有效的控制能限制能力、保护人、保存证据并从事件中学习,而不只是封一个账号或改一行提示词。

编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 18 日复核。旧稿把风险主要归为隐私、歧视、失业、安全和虚假信息,并给出个人层面的泛化建议;新版区分恶意滥用、系统失效、对抗攻击与系统性影响,依据 NIST、OWASP、MITRE、CISA/FBI、ILO、OECD 和中国主管部门资料,补充 AI 应用六层攻击面、提示注入、数据泄露、事件响应与采购闸门。本站来源和纠错方法见 关于本站与编辑规范