AI概念与词典

大模型越狱是什么?与提示注入的区别、风险与防御清单

解释大模型越狱、直接提示注入和间接提示注入的区别,并提供内容隔离、最小权限、参数校验、人工审批、日志回滚和授权红队测试清单。

大模型越狱、直接提示注入和间接提示注入的入口、目标与影响对比
本页目录
  1. 越狱、提示注入和传统代码注入有什么区别?
  2. 为什么接入工具后风险会放大?
  3. 常见风险入口:只讲防守识别,不提供攻击载荷
  4. 六层防御:把“模型可能被骗”当作设计前提
  5. 1. 区分指令与不可信数据
  6. 2. 给模型最小权限
  7. 3. 在模型之外做确定性校验
  8. 4. 高风险动作必须人工批准
  9. 5. 记录并监控完整决策链
  10. 6. 持续做授权红队与回归测试
  11. 上线前最低检查清单
  12. 如何安全开展越狱测试?
  13. 常见问题
  14. 更长的系统提示能彻底防止越狱吗?
  15. RAG 能解决提示注入吗?
  16. 发现越狱成功后应该做什么?
  17. 站内延伸与复核记录

直接答案:大模型“越狱”(jailbreak)通常指通过特制输入诱导模型绕过原本的安全规则,生成不应提供的内容或执行不应执行的行为。它与提示注入相关但不完全相同:越狱主要针对模型的安全限制;提示注入还包括让模型偏离应用指令、误用工具、泄露数据或被网页、邮件、文档中的隐藏指令操纵。防御不能只靠一段更强的系统提示词,而要把模型当作不可信组件,用最小权限、内容隔离、确定性校验、人工批准、监控和持续测试限制影响范围。

大模型越狱、直接提示注入和间接提示注入的区别与影响路径
越狱关注绕过模型安全限制;提示注入关注不可信指令改变应用行为。接入网页、邮件、RAG 和工具后,间接注入的业务影响通常更大。

越狱、提示注入和传统代码注入有什么区别?

概念 主要目标 常见入口 可能影响
大模型越狱 让模型忽略内容安全规则 用户直接输入、多轮上下文 输出被禁止或不安全的内容
直接提示注入 覆盖应用或开发者设定的指令 聊天框、表单、API 输入 偏离任务、泄露信息、误用工具
间接提示注入 让外部内容中的指令劫持模型 网页、邮件、PDF、图片、RAG 文档 错误摘要、数据外传、未经授权的动作
传统代码注入 让解释器执行恶意代码或命令 SQL、Shell、模板、脚本参数 直接修改系统、数据或权限

OWASP LLM01:2025将越狱视为提示注入的一种相关形式,并指出 RAG 和微调并不能完全消除风险。传统代码注入有更明确的解释器语法,而大模型对自然语言和上下文的处理具有概率性,因此“过滤几个关键词”不是可靠边界。

为什么接入工具后风险会放大?

只会生成文本的模型发生越狱,影响通常停留在输出层;能读取私有数据、发邮件、修改工单、调用支付或运行代码的智能体,错误输出可能变成真实动作。风险大小取决于模型能访问什么、能代表谁行动、动作是否需要批准,以及失败能否撤销。

OWASP 列出的影响包括敏感信息泄露、应用指令暴露、未经授权的函数调用和关键决策被操纵。NIST 的对抗性机器学习分类报告也强调,生成式 AI 面临规避、投毒、隐私和滥用等多类攻击,现有缓解措施各有局限。

常见风险入口:只讲防守识别,不提供攻击载荷

  • 用户输入:试图让模型改变角色、忽略策略或把不可信内容当作高优先级指令。
  • 外部文档:网页、邮件、简历、PDF 或知识库中嵌入面向模型的隐藏指令。
  • 多模态内容:图片或其他媒体中的文字、元数据和可被模型解析的信号。
  • 工具返回值:搜索、数据库、插件或第三方 API 返回的数据被错误当作可执行命令。
  • 长会话状态:早期输入、记忆或摘要在后续步骤中改变决策边界。

本文不展示可复制的越狱提示词、危险任务拆解方法或自动生成攻击后缀。安全测试应只在自有或明确授权的系统中进行,使用无害目标和隔离环境,并遵守供应商的测试政策。

六层防御:把“模型可能被骗”当作设计前提

大模型提示注入从数据隔离、最小权限到人工审批与监控的六层防御图
没有单一过滤器可以保证安全。防御目标是同时降低成功概率、限制可执行权限,并让异常能够被发现和撤销。

1. 区分指令与不可信数据

系统指令、用户目标和外部内容必须在应用结构中分开。网页、邮件和 RAG 文档默认只是数据,不能自行提升为系统指令;对外部内容标注来源、权限和可信等级。

2. 给模型最小权限

使用独立服务账号和细粒度工具。读取、草拟、写入、发送、付款等权限分开;限定数据范围、参数、单次金额、调用次数和有效时间。模型不应直接持有管理员凭据。

3. 在模型之外做确定性校验

用普通代码验证工具名称、参数类型、资源 ID、收件人、金额、路径和域名白名单。不能因为模型声称“已检查安全”就跳过校验。

4. 高风险动作必须人工批准

付款、退款、删除、对外发送、改权限、运行代码和处理敏感数据等动作,在执行前向用户展示真实参数和影响。微软的间接提示注入防御指南同样把人工介入列为纵深防御的一层。

如果组织还使用浏览器或网络访问层,可把提示注入检测与阻断作为补充控制。但它只能降低已知模式进入模型的概率,不能替代应用侧权限、参数校验和人工审批。

5. 记录并监控完整决策链

保存输入来源、模型与提示版本、检索片段、工具请求、批准人、结果和错误码,同时对敏感字段脱敏。监控异常拒绝率、跨租户访问、非常用工具、参数突变和重复失败。

6. 持续做授权红队与回归测试

建立覆盖直接输入、外部文档、多轮会话、工具返回和多模态内容的测试集。每次模型、系统提示、RAG 数据源或工具权限变化后重新测试。NIST 明确提醒目前没有万无一失的防御,因此验收应关注防线失效后影响是否仍被隔离。

上线前最低检查清单

  • 模型是否能读取与任务无关的私有数据?
  • 外部网页、邮件和文档是否被明确标记为不可信数据?
  • 每个工具是否有独立权限、参数校验、限额和超时?
  • 高风险动作是否展示最终参数并要求人工确认?
  • 能否撤销操作、轮换凭据并停止整个智能体?
  • 日志是否能还原“输入—检索—决策—工具—结果”的链路?
  • 是否测试过异常内容,而不仅是正常演示?

如何安全开展越狱测试?

  1. 取得系统所有者书面授权,明确目标、时间、数据和禁止事项。
  2. 使用测试租户、假数据、无害工具和无法触达生产的凭据。
  3. 测试目标设为“能否改变预期分类或触发无害标记”,避免生成真实危险内容。
  4. 记录模型版本、配置和输入来源,但控制敏感测试样本的访问。
  5. 按影响修复应用权限与流程,而不是只把某一句输入加入黑名单。
  6. 修复后执行回归,并检查是否破坏正常用户任务。

常见问题

更长的系统提示能彻底防止越狱吗?

不能。系统提示可以表达规则,但不能替代权限、参数校验和人工批准。越高风险的动作,越应在模型之外设置确定性控制。

RAG 能解决提示注入吗?

不能自动解决。RAG 会把外部内容放入上下文,如果数据源被污染或文档含隐藏指令,反而可能引入间接提示注入。需要来源控制、内容隔离和输出验证。

发现越狱成功后应该做什么?

先判断是否发生数据访问或工具调用,必要时撤销凭据、停止相关自动化并保全日志;随后修复权限和流程边界,再更新检测与回归测试。不要只删除对话记录或屏蔽一个关键词。

站内延伸与复核记录

复核记录:AI问答站编辑部于 2026 年 7 月 15 日依据 OWASP LLM01、NIST 对抗性机器学习分类与微软纵深防御指南重写。删除旧稿中的可复制角色越狱、危险任务拆解、自动化攻击后缀和错误神经元解释,移除 Markdown 残留;新版本只提供授权测试与防御性治理方法。本文不含厂商赞助或联盟链接。