快速结论:AI Agent 劫持(agent hijacking)通常不是用户直接输入一句越狱提示,而是攻击者把恶意指令藏进邮件、网页、代码仓库、文档或工具返回结果,诱使智能体泄露数据、下载代码或执行越权动作。NIST 2026 年公开的大规模红队研究说明,当前领先模型面对间接提示注入仍存在现实风险。有效防护不能只靠系统提示词,而要同时隔离不可信内容、限制工具和数据权限、把高风险动作交给确定性策略与人工审批、保存审计轨迹,并用自有攻击集持续回归。
一次劫持怎样发生

- 攻击者在智能体将读取的外部内容中植入隐藏或伪装指令,例如邮件正文、网页文字、Issue、README、PDF 或图片中的文本。
- 智能体为了完成用户任务读取该内容,却没有可靠地区分可信指令与不可信数据。
- 恶意内容要求模型改变目标、读取秘密、调用外部工具、下载代码或向攻击者控制的地址发送结果。
- 如果工具权限过大、动作无需确认、输出渠道无限制,模型错误判断就会变成真实损害。
因此,防护重点不是争论模型是否“理解恶意”,而是让任一不可信文本都无法单独获得新的权限。网页搜索、邮箱、代码库和附件都应该视为数据源,而不是能够覆盖用户与系统规则的控制面。
六层防护模型
| 防护层 | 最低控制 | 阻断的风险 |
|---|---|---|
| 目标与数据分离 | 明确标记用户目标、系统策略和外部内容;外部内容默认不可信 | 网页或邮件伪装成高优先级指令 |
| 内容隔离 | 清洗活动内容、限制渲染、附件沙箱、禁止自动执行代码 | 隐藏文本、脚本与恶意文件直接进入执行环境 |
| 最小权限 | 每个任务只开放必要数据、工具、目录、域名和凭据 | 一次注入横向读取全部系统 |
| 动作门禁 | 发送、付款、删除、部署、下载执行等动作必须预览和确认 | 模型输出直接造成不可逆影响 |
| 出站控制 | 域名白名单、数据分类、敏感字段遮蔽、请求与费用上限 | 数据外泄与无限调用 |
| 监控与回归 | 记录输入来源、工具参数、授权、结果和模型版本;持续红队 | 攻击无法追踪、修复后再次复发 |
高风险动作不能只由模型批准

| 风险级别 | 例子 | 建议策略 |
|---|---|---|
| 低 | 读取公开文档、在隔离目录总结 | 可自动,但限制来源、大小、时间和输出位置 |
| 中 | 修改代码、创建工单、写入草稿 | 先生成差异或预览,跑测试后由规则或人确认 |
| 高 | 发送外部消息、发布内容、访问私有数据 | 明确展示收件人、字段、来源和影响,逐次审批 |
| 关键 | 付款、删除、部署生产、运行下载代码、改变权限 | 模型不得自批;使用独立策略引擎、多因素确认与可恢复操作 |
“用户已经允许智能体工作”不是无限授权。批准查看一封邮件,不等于批准把所有历史邮件发送到外部;批准修复代码,也不等于批准下载并运行未知二进制。授权必须绑定具体身份、对象、动作、范围和有效期。
怎样建立自己的劫持回归集
- 列出智能体会读取的每类外部来源和能执行的每个工具动作。
- 为邮件、网页、文档、代码和工具结果分别设计显式、隐藏、编码、跨文件和多轮注入样本。
- 把成功标准写成系统结果:不得泄露字段、不得访问非白名单域名、不得执行未批准命令,而非只看模型是否说“拒绝”。
- 同时测试正常任务,避免防护把所有有用工作都阻断。
- 每次更换模型、提示词、工具、权限或解析器后重跑,并保存失败样本与修复版本。
需要通用智能体架构可先看AI 智能体与自动化治理指南;若通过 MCP 接工具,继续使用MCP 与能力层选择指南检查工具定义、认证和人工同意。防护结论应落在实际权限与日志,不应只写一段“忽略恶意指令”的提示词。
发生疑似劫持后的处理
- 立即暂停相关自动化和高风险工具,不要让智能体继续“自行调查”。
- 撤销或轮换可能暴露的短期令牌和密钥,检查出站请求与外部写入。
- 保存原始输入、来源 URL、解析后内容、模型版本、工具参数、审批和返回结果。
- 确认影响范围并恢复受改动资源;将攻击样本加入回归集。
- 修复权限和动作门禁后再调整提示词,最后小流量恢复。
来源与复核记录
本文依据 NIST CAISI 2026 年智能体安全红队研究说明、NIST 智能体劫持评测说明与 NIST 对抗机器学习分类与术语整理,资料复核日期为 2026 年 8 月 19 日。本文给出的是防御架构与验收方法,不声称任何单一模型或提示词能够彻底消除劫持。本站规则见关于兰塞 AI 与编辑规范。
