直接答案:大模型“越狱”(jailbreak)通常指通过特制输入诱导模型绕过原本的安全规则,生成不应提供的内容或执行不应执行的行为。它与提示注入相关但不完全相同:越狱主要针对模型的安全限制;提示注入还包括让模型偏离应用指令、误用工具、泄露数据或被网页、邮件、文档中的隐藏指令操纵。防御不能只靠一段更强的系统提示词,而要把模型当作不可信组件,用最小权限、内容隔离、确定性校验、人工批准、监控和持续测试限制影响范围。
越狱、提示注入和传统代码注入有什么区别?
| 概念 | 主要目标 | 常见入口 | 可能影响 |
|---|---|---|---|
| 大模型越狱 | 让模型忽略内容安全规则 | 用户直接输入、多轮上下文 | 输出被禁止或不安全的内容 |
| 直接提示注入 | 覆盖应用或开发者设定的指令 | 聊天框、表单、API 输入 | 偏离任务、泄露信息、误用工具 |
| 间接提示注入 | 让外部内容中的指令劫持模型 | 网页、邮件、PDF、图片、RAG 文档 | 错误摘要、数据外传、未经授权的动作 |
| 传统代码注入 | 让解释器执行恶意代码或命令 | SQL、Shell、模板、脚本参数 | 直接修改系统、数据或权限 |
OWASP LLM01:2025将越狱视为提示注入的一种相关形式,并指出 RAG 和微调并不能完全消除风险。传统代码注入有更明确的解释器语法,而大模型对自然语言和上下文的处理具有概率性,因此“过滤几个关键词”不是可靠边界。
为什么接入工具后风险会放大?
只会生成文本的模型发生越狱,影响通常停留在输出层;能读取私有数据、发邮件、修改工单、调用支付或运行代码的智能体,错误输出可能变成真实动作。风险大小取决于模型能访问什么、能代表谁行动、动作是否需要批准,以及失败能否撤销。
OWASP 列出的影响包括敏感信息泄露、应用指令暴露、未经授权的函数调用和关键决策被操纵。NIST 的对抗性机器学习分类报告也强调,生成式 AI 面临规避、投毒、隐私和滥用等多类攻击,现有缓解措施各有局限。
常见风险入口:只讲防守识别,不提供攻击载荷
- 用户输入:试图让模型改变角色、忽略策略或把不可信内容当作高优先级指令。
- 外部文档:网页、邮件、简历、PDF 或知识库中嵌入面向模型的隐藏指令。
- 多模态内容:图片或其他媒体中的文字、元数据和可被模型解析的信号。
- 工具返回值:搜索、数据库、插件或第三方 API 返回的数据被错误当作可执行命令。
- 长会话状态:早期输入、记忆或摘要在后续步骤中改变决策边界。
本文不展示可复制的越狱提示词、危险任务拆解方法或自动生成攻击后缀。安全测试应只在自有或明确授权的系统中进行,使用无害目标和隔离环境,并遵守供应商的测试政策。
六层防御:把“模型可能被骗”当作设计前提
1. 区分指令与不可信数据
系统指令、用户目标和外部内容必须在应用结构中分开。网页、邮件和 RAG 文档默认只是数据,不能自行提升为系统指令;对外部内容标注来源、权限和可信等级。
2. 给模型最小权限
使用独立服务账号和细粒度工具。读取、草拟、写入、发送、付款等权限分开;限定数据范围、参数、单次金额、调用次数和有效时间。模型不应直接持有管理员凭据。
3. 在模型之外做确定性校验
用普通代码验证工具名称、参数类型、资源 ID、收件人、金额、路径和域名白名单。不能因为模型声称“已检查安全”就跳过校验。
4. 高风险动作必须人工批准
付款、退款、删除、对外发送、改权限、运行代码和处理敏感数据等动作,在执行前向用户展示真实参数和影响。微软的间接提示注入防御指南同样把人工介入列为纵深防御的一层。
如果组织还使用浏览器或网络访问层,可把提示注入检测与阻断作为补充控制。但它只能降低已知模式进入模型的概率,不能替代应用侧权限、参数校验和人工审批。
5. 记录并监控完整决策链
保存输入来源、模型与提示版本、检索片段、工具请求、批准人、结果和错误码,同时对敏感字段脱敏。监控异常拒绝率、跨租户访问、非常用工具、参数突变和重复失败。
6. 持续做授权红队与回归测试
建立覆盖直接输入、外部文档、多轮会话、工具返回和多模态内容的测试集。每次模型、系统提示、RAG 数据源或工具权限变化后重新测试。NIST 明确提醒目前没有万无一失的防御,因此验收应关注防线失效后影响是否仍被隔离。
上线前最低检查清单
- 模型是否能读取与任务无关的私有数据?
- 外部网页、邮件和文档是否被明确标记为不可信数据?
- 每个工具是否有独立权限、参数校验、限额和超时?
- 高风险动作是否展示最终参数并要求人工确认?
- 能否撤销操作、轮换凭据并停止整个智能体?
- 日志是否能还原“输入—检索—决策—工具—结果”的链路?
- 是否测试过异常内容,而不仅是正常演示?
如何安全开展越狱测试?
- 取得系统所有者书面授权,明确目标、时间、数据和禁止事项。
- 使用测试租户、假数据、无害工具和无法触达生产的凭据。
- 测试目标设为“能否改变预期分类或触发无害标记”,避免生成真实危险内容。
- 记录模型版本、配置和输入来源,但控制敏感测试样本的访问。
- 按影响修复应用权限与流程,而不是只把某一句输入加入黑名单。
- 修复后执行回归,并检查是否破坏正常用户任务。
常见问题
更长的系统提示能彻底防止越狱吗?
不能。系统提示可以表达规则,但不能替代权限、参数校验和人工批准。越高风险的动作,越应在模型之外设置确定性控制。
RAG 能解决提示注入吗?
不能自动解决。RAG 会把外部内容放入上下文,如果数据源被污染或文档含隐藏指令,反而可能引入间接提示注入。需要来源控制、内容隔离和输出验证。
发现越狱成功后应该做什么?
先判断是否发生数据访问或工具调用,必要时撤销凭据、停止相关自动化并保全日志;随后修复权限和流程边界,再更新检测与回归测试。不要只删除对话记录或屏蔽一个关键词。
站内延伸与复核记录
复核记录:AI问答站编辑部于 2026 年 7 月 15 日依据 OWASP LLM01、NIST 对抗性机器学习分类与微软纵深防御指南重写。删除旧稿中的可复制角色越狱、危险任务拆解、自动化攻击后缀和错误神经元解释,移除 Markdown 残留;新版本只提供授权测试与防御性治理方法。本文不含厂商赞助或联盟链接。
