直接答案:大模型确实可能逐字记忆训练样本,并在特定查询、筛选和足够预算下输出其中一部分;但不存在脱离模型、数据、攻击方法和指标的统一“泄露率”。2021 年 GPT-2 提取研究、2022 年训练数据去重研究和 2023 年针对生产模型的规模化提取研究回答的是不同问题,不能拼成“GPT-3.5 最高 10% 成功率”。尤其不能根据 2023 年针对当时 gpt-3.5-turbo 的特定方法,断言 2026 年所有 ChatGPT 模型仍能用同一方式提取。

旧稿的论文链接只是“相关论文编号”占位符,还混入无法找到来源的作者引语和 10% 数字。本次改写以USENIX Security 2021 GPT-2 提取论文、2022 训练数据去重研究与2023 生产语言模型规模化提取研究为核心来源,资料复核日期为 2026 年 7 月 16 日。
三项核心研究分别证明了什么?
| 研究 | 对象 | 主要结果 | 不能外推 |
|---|---|---|---|
| Carlini 等,2021 | OpenAI 已公开权重的 GPT-2,训练源为公开网络抓取 | 1800 个候选中确认 604 个逐字训练样本;最佳配置中 67% 候选为训练样本 | 不能称为 GPT-3.5、ChatGPT 或所有大模型的 67% 泄露率 |
| Kandpal 等,2022 | 117M–1.5B 参数模型及普通/去重 C4 数据 | 重复序列更容易再生;去重模型约少输出 20 倍训练数据 | 去重是缓解,不是零记忆或零隐私风险保证 |
| Nasr 等,2023 | 开放、半开放与闭源生产模型,包括当时的 gpt-3.5-turbo | 特定 divergence attack 让 ChatGPT 输出训练数据的频率比正常行为高 150 倍;约 200 美元查询得到超过 1 万个唯一逐字样本 | 作者明确称攻击特定于该模型,不能据此判断其他生产模型或当前版本 |
论文中的“超过 10 倍”指研究者估计增加查询预算后可能提取更多数据,不是“10% 成功率”。2021 论文中的 9%、3%、67% 又是不同生成和筛选策略下,人工检查候选是否为训练样本的比例;2022 论文中的约 20 倍是去重模型与普通模型输出训练数据数量的比较;这些数字不能互换。
旧稿的关键错误应该怎样修正?
| 旧稿说法 | 问题 | 可核验写法 |
|---|---|---|
| “一项最新研究” | 没有论文题目、作者、编号和日期 | 分别列出 2021、2022、2023 三篇论文 |
| “类似 GPT-3.5 架构的模型” | 把模型身份和架构混为一谈 | 2021 研究对象是 GPT-2;2023 研究明确查询当时的 gpt-3.5-turbo |
| “最高 10% 成功率” | 没有对应统一指标,疑似把 10 倍、9% 等数字拼接 | 每个数字必须带模型、分母、候选筛选和攻击条件 |
| “个人信息被重构出来” | 模糊了逐字匹配与模型生成 | 论文将输出与辅助训练数据集合匹配,确认逐字记忆样本及其中 PII |
| 伪造主要作者直接引语 | 原文中没有旧稿那段可逐字核对的话 | 使用论文结论的近源转述,不加虚假引号 |
| Common Crawl、Wikipedia、论坛均被确认 | 把多项研究和一般训练数据背景拼成单一研究结果 | 按每篇论文实际数据集和辅助语料分别说明 |
纠错的关键不是把“10%”换成另一个更大的数字,而是重建分母。没有“生成了多少、筛选了多少、人工确认多少、与哪个训练集匹配、攻击花费多少”的指标,任何百分比都不适合出现在标题或摘要里。
训练数据“记忆”“提取”和“成员推断”有什么区别?
| 概念 | 问题 | 需要的证据 | 常见误读 |
|---|---|---|---|
| 逐字记忆 | 模型是否对某训练序列赋予异常高概率并可能原样生成 | 模型输出与已知训练数据的长片段精确匹配 | 把任何相似表达都叫逐字记忆 |
| 可提取记忆 | 不知道训练集的攻击者能否通过查询高效恢复训练样本 | 黑盒查询、候选筛选、训练集或辅助集匹配与误报分析 | 只要模型“知道”某事实就算提取 |
| 可发现记忆 | 已知部分训练样本或前缀时,能否让模型续写剩余内容 | 给定训练前缀后的逐字续写率 | 与无先验攻击混为一谈 |
| 成员推断 | 判断某条记录是否参加过训练 | 低误报率下的 TPR、AUROC、置信度或损失差异 | 成员推断成功等于拿到了完整记录 |
| 一般知识复述 | 模型回答公开事实或常见文本 | 独特长片段、稀有标识符及数据源匹配 | 把常识回答当训练集证据 |
Quantifying Memorization Across Neural Language Models等研究还会使用不同的记忆定义。比较论文前必须确认它测的是逐字生成、前缀续写、成员推断还是其他指标;“模型记住了”不是一个足够精确的实验结论。
2021 GPT-2 研究中的数字应该怎样读?
2021 论文使用 GPT-2 作为代表模型,理由之一是模型与原始训练数据源已经公开,可降低真实伤害。研究者从模型生成大量文本,再用 perplexity、参考模型、zlib、大小写和滑动窗口等方法对候选排序,最后人工检查并与 OpenAI 协作查询原始训练数据确认。
| 数字 | 准确含义 | 不能写成 |
|---|---|---|
| 600,000 | 论文在“诚实”生成设置下分析的样本规模 | 60 万条均为泄露内容 |
| 1800 | 3 种生成策略 × 6 种筛选指标下人工检查的候选总数 | 完整训练集或全部高风险输出 |
| 604 | 确认属于 GPT-2 训练数据的唯一逐字样本 | 604 名用户的私人聊天 |
| 至少 0.1% | 604 / 600,000 的保守下限,作者强调只检查了候选的一小部分 | 所有 GPT 模型固定泄露率 |
| 最佳 67% | 某一生成+zlib 筛选配置的前 100 个候选中,67 个被确认记忆 | 随机问 GPT-2 有 67% 概率吐出隐私 |
| 78 个 PII 类例子 | 确认样本中涉及姓名、电话、地址或社交账号的分类数量 | 78 条私有数据库记录;论文强调训练源为公开网络 |
完整方法和分类见USENIX Security 2021 论文页面。研究还指出更大 GPT-2 模型在一个设置中记忆内容比小模型多 18 倍,但规模只是因素之一;重复次数、训练轮次、采样与数据清洗同样重要。
2023 ChatGPT 研究究竟发现了什么?
Nasr 等研究者为了让对齐后的聊天模型偏离常规对话行为,设计了特定 divergence attack。本文不会复现可直接执行的攻击提示,也不会展示论文提取的个人信息。论文说明该方法针对当时的 gpt-3.5-turbo,研究者在 2023 年 7 月发现问题,8 月 30 日向 OpenAI 披露,并等待 90 天后发表。
| 结果 | 论文中的范围 | 当前文章的边界 |
|---|---|---|
| 150 倍 | 特定攻击下,ChatGPT 产生训练数据的频率比正常聊天行为高 | 不是回答准确率、隐私泄露概率或所有模型比例 |
| 约 200 美元 | 研究团队查询当时 ChatGPT API 的实验成本 | 价格、API 和模型均可能已变化 |
| 超过 10,000 个 | 与 9TB 辅助数据集匹配的唯一逐字训练样本 | 不是 1 万条私人 ChatGPT 用户会话 |
| 最长超过 4000 字符 | 提取样本中最长文本长度 | 不能推断任意长文都可完整提取 |
| PII | 研究者在抽查输出中确认数十人的个人可识别信息 | 论文不证明这些信息来自付费用户私聊 |
| 可能多 10 倍以上 | 增加查询预算后的扩展估计 | 不是旧稿所称“10% 成功率” |
论文 PDF 的Ethics & Responsible Disclosure 与 ChatGPT 实验章节还明确写道:该攻击对这个模型具有特异性,据作者所知不适用于他们测试过的其他生产模型。因此,文章只能说“2023 年研究证明对齐并不自动消除记忆”,不能说“当前 ChatGPT 仍可用同一提示提取训练集”。
论文中的 PII 是否等于私人用户数据泄露?
| 问题 | 论文能支持的结论 | 仍不能确认 |
|---|---|---|
| 模型是否会逐字输出含个人信息的训练文本 | 会;2021 与 2023 研究均确认过含 PII 的记忆样本 | 任意个人信息是否在当前模型训练集中 |
| 信息是否来自公开互联网 | 2021 GPT-2 训练源是公开网络;2023 使用大型公开辅助数据集做匹配 | 每条 PII 最初的收集授权、公开范围和后续变化 |
| 是否来自 ChatGPT 用户对话 | 这些实验没有证明所列 PII 来自用户私人会话 | 闭源训练集的每条数据来源 |
| 公开信息是否没有隐私风险 | 不能这样推断;聚合、持久化和重新暴露仍可能造成伤害 | 具体地区法律责任,需要专业判断 |
| 匹配是否可能误报 | 研究使用训练/辅助集匹配和人工核验降低误报 | 辅助数据集不完整时对全部记忆量的精确估计 |
训练数据提取研究回答的是模型与训练语料之间的技术关系,不自动决定版权、隐私或数据保护法律结论。法律新闻应另看具体案件与请求,例如站内的P.M. v. OpenAI 诉讼复盘;产品跨用户缓存错配则见ChatGPT 2023 数据暴露事件复盘。
哪些“AI 泄露”其实不是训练数据提取?
| 现象 | 更可能的风险类型 | 先查什么 |
|---|---|---|
| 模型逐字输出一段罕见公开网页、代码或联系方式 | 训练数据记忆/提取 | 长片段搜索、训练源、重复次数、模型与版本 |
| 攻击者判断某病历是否参加微调,但拿不到原文 | 成员推断 | 低 FPR 指标、对照模型、数据分布 |
| 模型吐出系统提示、工具描述或隐藏规则 | 运行时提示泄露 | 系统上下文是否包含秘密,工具和日志权限 |
| 用户读到无权访问的企业文档 | RAG/连接器 ACL 或租户隔离失败 | 检索日志、文档 ACL、身份映射和缓存键 |
| 陌生用户看到聊天标题、共享链接或账号历史 | 产品事故、账号接管或主动分享 | 登录、链接、事件通知和产品日志 |
系统提示不是秘密保险箱,RAG 也不会自动继承原系统权限。构建带工具和文件访问的智能体时,应使用AI 智能体权限与治理指南的身份、审批、日志和回滚门禁;高权限编码工具还应参考Claude Code 权限与安全操作指南。
普通用户怎样降低自己的内容进入训练或被外发的风险?
| 动作 | 作用 | 限制 |
|---|---|---|
| 关闭 Improve the model for everyone | OpenAI 说明关闭后,新对话不用于改进模型 | 不会删除已有聊天、共享链接或第三方收到的数据 |
| 使用 Temporary Chat | 不进入历史、不创建记忆、不用于训练 | 为安全目的可能保留副本最多 30 天;第三方 actions 有独立政策 |
| 不提交秘密 | 从源头减少密码、密钥、身份和客户数据暴露 | “请保密”提示不能替代产品和组织控制 |
| 最小化与脱敏 | 只提供完成任务所需字段,替换姓名、账号和标识符 | 稀有组合仍可能重新识别,需要评估 |
| 使用组织批准方案 | 业务产品通常提供默认不训练、管理员与保留控制 | 还要核对连接器、地区、合同和实际设置 |
OpenAI 当前Data Controls FAQ说明如何关闭模型改进;Temporary Chat FAQ说明历史、训练和最长 30 天安全保留边界。业务数据页面称 ChatGPT Business、Enterprise、Edu 和 API 输入输出默认不用于训练。具体设置会变化,使用当天应重新核对账号与合同。
训练或微调团队应该建立哪些技术门禁?
| 阶段 | 最低控制 | 验收证据 |
|---|---|---|
| 数据进入 | 来源与用途记录、敏感字段识别、权利与保留边界 | 数据清单、许可/法律基础、删除路径 |
| 去重 | 文档级与长序列级去重,识别模板、页脚、日志和重复 PII | 重复分布、去重阈值、前后样本和误删抽查 |
| 隐私训练 | 高风险数据评估记录级差分隐私、裁剪和噪声预算 | epsilon/delta、utility、训练稳定性和攻击评测 |
| 记忆 canary | 插入受控稀有序列,测量曝光与逐字续写 | 不同规模、轮次、重复次数与采样下的 exposure |
| 黑盒提取红队 | 在授权环境测试无先验与已知前缀攻击 | 查询预算、候选筛选、误报率、人工确认 |
| 部署控制 | 输出过滤、速率限制、异常重复检测、日志和响应 | 阻断率、误伤、可复现工单和模型回滚 |
The Secret Sharer提出用 canary 和 exposure 测量非预期记忆;Deep Learning with Differential Privacy提供差分隐私训练基础。差分隐私需要明确记录级定义、隐私预算和效用代价,不能只在产品页写“采用 DP”就认为风险已经关闭。
2022 去重论文发现,训练数据中出现 10 次的序列平均比只出现一次的序列多生成约 1000 倍,去重训练模型约少输出 20 倍训练数据。这说明去重是高价值控制,但论文也没有宣称完全阻止攻击。评测流程可结合站内AI 产品证据与风险评估方法与AI 知识和数据治理指南。
模型修复后不能只验证某个攻击提示“失效”一次。团队应把已经确认的逐字样本类型、重复模式、PII 格式、长代码片段和异常输出速率加入版本化回归集;每次更换基础模型、分词器、数据混合、微调集、系统提示或输出过滤器都重新运行,并保存修复前后的差异、失败样本和停止条件。如何把一次修复转成持续可复现的验收,可参考代码补丁与回归验证指南。
网站运营者怎样控制公开内容用于未来模型训练?
| 需求 | 动作 | 边界 |
|---|---|---|
| 控制 GPTBot 抓取 | 根据 OpenAI crawler 文档在 robots.txt 设置 GPTBot 规则 | 影响未来抓取,不等于从已经训练的模型删除 |
| 允许搜索、限制训练 | 区分 OAI-SearchBot 与 GPTBot 的用途后分别配置 | 不同 crawler 与产品用途必须看最新官方说明 |
| 删除个人信息 | 使用服务商隐私请求入口并提供可识别页面和理由 | 搜索删除、网页删除和模型输出处理是不同流程 |
| 证明内容权属 | 保留作者、发布日期、原稿、图片许可和更新记录 | 元数据不能代替真实权利链 |
| 降低重复与垃圾信号 | 合并重复 URL,减少模板化重复段落和批量相似稿 | 主要价值是内容与抓取质量,也可能减少被重复学习的文本 |
OpenAI 的crawler 与 robots.txt 文档说明 GPTBot 等用户代理的控制方式;模型开发与训练数据说明称训练来源包括公开互联网、合作方数据和用户/训练人员/研究人员提供或生成的信息,并说明去重、过滤与个人信息处理措施。robots.txt 是访问控制信号,不是追溯删除协议。
如何设计一套不泄露真实隐私的内部评测?
- 先用合成 canary:生成没有现实含义的稀有标识符,不把真实身份证、密钥或客户资料当测试材料。
- 建立重复梯度:让同类 canary 分别出现 1、2、5、10 次,测量重复与记忆关系。
- 隔离训练与验证:保存数据 hash、模型版本、轮次、采样配置与随机种子。
- 同时测两类攻击:已知前缀续写和无先验黑盒提取不能只选容易通过的一种。
- 报告低误报指标:成员推断应报告 TPR@低 FPR,不只报整体准确率或 AUROC。
- 执行删除重训测试:删除样本后重新训练或使用支持的删除方法,验证 canary 曝光是否下降。
- 部署前设停止线:发现长段逐字敏感输出、密钥模式或跨租户内容时不得上线。
NIST 的生成式 AI 风险管理资料强调数据隐私、信息完整性、监控和治理应贯穿生命周期。内部评测记录也应像生产事故一样可复现:保存输入、模型、上下文、输出、匹配来源、人工判定与处置,不用“测试感觉安全”代替证据。
常见问题
模型能回答我的名字,是否证明训练数据泄露?
不能。名字可能来自公开知识、当前上下文、记忆、搜索、RAG 或训练数据。需要罕见长片段、明确数据源和逐字匹配等更强证据。
2023 年攻击现在还能直接用于 ChatGPT 吗?
本文不提供复现提示。论文作者明确说该攻击特定于当时的 gpt-3.5-turbo,并不适用于他们测试的其他生产模型;没有当前验证就不能宣称仍有效。
关闭训练能删除以前已经训练的数据吗?
OpenAI 当前说明是关闭后“新对话”不用于改进模型。它不等于从已经训练的模型、历史记录、共享链接或第三方系统追溯删除。
去重能彻底消除训练数据泄露吗?
不能。去重显著降低重复序列被再生的风险,但唯一序列、过度训练、大模型容量、微调数据和其他攻击仍需独立评测。
把秘密写进系统提示是否比放进训练集安全?
不是。系统提示属于运行时上下文,可能通过提示注入、工具日志、错误信息或模型输出泄露。密码和密钥应放在受控秘密管理系统,不应进入模型可见文本。
公开网页中的个人信息是否可以放心用于训练?
公开可访问不等于没有隐私、版权、合同或数据保护限制。还要考虑收集目的、地区法律、敏感性、聚合伤害、删除请求和模型再暴露风险。
编辑复核与纠错记录
编辑主体:兰塞 AI 编辑流程;事实复核:2026 年 7 月 16 日。旧稿使用占位论文链接,把 GPT-2、去重实验与 gpt-3.5-turbo 研究混为“一项最新研究”,虚构最高 10% 成功率和作者引语。本次 A 级重写依据 USENIX 2021、arXiv:2202.06539、arXiv:2311.17035 及 OpenAI 当前数据控制资料,重建模型、攻击、分母、PII、外推和防护边界,新增两张原创信息图,并避免传播可直接执行的隐私提取提示。本站来源、更新与纠错原则见关于本站与编辑规范。
