AI动态与更新

大模型会泄露训练数据吗?GPT-2、ChatGPT 提取研究与隐私防护

拆解GPT-2、训练数据去重和gpt-3.5-turbo三项真实研究:逐字记忆、提取攻击、PII、10倍与67%等数字分别代表什么,以及用户、团队和网站如何防护。

2021 GPT-2 提取、2022 数据去重和 2023 gpt-3.5-turbo 规模化提取研究的对象、数字与外推边界
本页目录
  1. 三项核心研究分别证明了什么?
  2. 旧稿的关键错误应该怎样修正?
  3. 训练数据“记忆”“提取”和“成员推断”有什么区别?
  4. 2021 GPT-2 研究中的数字应该怎样读?
  5. 2023 ChatGPT 研究究竟发现了什么?
  6. 论文中的 PII 是否等于私人用户数据泄露?
  7. 哪些“AI 泄露”其实不是训练数据提取?
  8. 普通用户怎样降低自己的内容进入训练或被外发的风险?
  9. 训练或微调团队应该建立哪些技术门禁?
  10. 网站运营者怎样控制公开内容用于未来模型训练?
  11. 如何设计一套不泄露真实隐私的内部评测?
  12. 常见问题
  13. 模型能回答我的名字,是否证明训练数据泄露?
  14. 2023 年攻击现在还能直接用于 ChatGPT 吗?
  15. 关闭训练能删除以前已经训练的数据吗?
  16. 去重能彻底消除训练数据泄露吗?
  17. 把秘密写进系统提示是否比放进训练集安全?
  18. 公开网页中的个人信息是否可以放心用于训练?
  19. 编辑复核与纠错记录

直接答案:大模型确实可能逐字记忆训练样本,并在特定查询、筛选和足够预算下输出其中一部分;但不存在脱离模型、数据、攻击方法和指标的统一“泄露率”。2021 年 GPT-2 提取研究、2022 年训练数据去重研究和 2023 年针对生产模型的规模化提取研究回答的是不同问题,不能拼成“GPT-3.5 最高 10% 成功率”。尤其不能根据 2023 年针对当时 gpt-3.5-turbo 的特定方法,断言 2026 年所有 ChatGPT 模型仍能用同一方式提取。

2021 GPT-2 提取、2022 数据去重和 2023 gpt-3.5-turbo 规模化提取研究的对象、数字与外推边界
604 个样本、67%、约少 20 倍、150 倍和超过 1 万个样本分别来自不同实验;离开原始分母和攻击条件,数字就失去意义。图:兰塞 AI 编辑部原创。

旧稿的论文链接只是“相关论文编号”占位符,还混入无法找到来源的作者引语和 10% 数字。本次改写以USENIX Security 2021 GPT-2 提取论文2022 训练数据去重研究2023 生产语言模型规模化提取研究为核心来源,资料复核日期为 2026 年 7 月 16 日

三项核心研究分别证明了什么?

研究 对象 主要结果 不能外推
Carlini 等,2021 OpenAI 已公开权重的 GPT-2,训练源为公开网络抓取 1800 个候选中确认 604 个逐字训练样本;最佳配置中 67% 候选为训练样本 不能称为 GPT-3.5、ChatGPT 或所有大模型的 67% 泄露率
Kandpal 等,2022 117M–1.5B 参数模型及普通/去重 C4 数据 重复序列更容易再生;去重模型约少输出 20 倍训练数据 去重是缓解,不是零记忆或零隐私风险保证
Nasr 等,2023 开放、半开放与闭源生产模型,包括当时的 gpt-3.5-turbo 特定 divergence attack 让 ChatGPT 输出训练数据的频率比正常行为高 150 倍;约 200 美元查询得到超过 1 万个唯一逐字样本 作者明确称攻击特定于该模型,不能据此判断其他生产模型或当前版本

论文中的“超过 10 倍”指研究者估计增加查询预算后可能提取更多数据,不是“10% 成功率”。2021 论文中的 9%、3%、67% 又是不同生成和筛选策略下,人工检查候选是否为训练样本的比例;2022 论文中的约 20 倍是去重模型与普通模型输出训练数据数量的比较;这些数字不能互换。

旧稿的关键错误应该怎样修正?

旧稿说法 问题 可核验写法
“一项最新研究” 没有论文题目、作者、编号和日期 分别列出 2021、2022、2023 三篇论文
“类似 GPT-3.5 架构的模型” 把模型身份和架构混为一谈 2021 研究对象是 GPT-2;2023 研究明确查询当时的 gpt-3.5-turbo
“最高 10% 成功率” 没有对应统一指标,疑似把 10 倍、9% 等数字拼接 每个数字必须带模型、分母、候选筛选和攻击条件
“个人信息被重构出来” 模糊了逐字匹配与模型生成 论文将输出与辅助训练数据集合匹配,确认逐字记忆样本及其中 PII
伪造主要作者直接引语 原文中没有旧稿那段可逐字核对的话 使用论文结论的近源转述,不加虚假引号
Common Crawl、Wikipedia、论坛均被确认 把多项研究和一般训练数据背景拼成单一研究结果 按每篇论文实际数据集和辅助语料分别说明

纠错的关键不是把“10%”换成另一个更大的数字,而是重建分母。没有“生成了多少、筛选了多少、人工确认多少、与哪个训练集匹配、攻击花费多少”的指标,任何百分比都不适合出现在标题或摘要里。

训练数据“记忆”“提取”和“成员推断”有什么区别?

概念 问题 需要的证据 常见误读
逐字记忆 模型是否对某训练序列赋予异常高概率并可能原样生成 模型输出与已知训练数据的长片段精确匹配 把任何相似表达都叫逐字记忆
可提取记忆 不知道训练集的攻击者能否通过查询高效恢复训练样本 黑盒查询、候选筛选、训练集或辅助集匹配与误报分析 只要模型“知道”某事实就算提取
可发现记忆 已知部分训练样本或前缀时,能否让模型续写剩余内容 给定训练前缀后的逐字续写率 与无先验攻击混为一谈
成员推断 判断某条记录是否参加过训练 低误报率下的 TPR、AUROC、置信度或损失差异 成员推断成功等于拿到了完整记录
一般知识复述 模型回答公开事实或常见文本 独特长片段、稀有标识符及数据源匹配 把常识回答当训练集证据

Quantifying Memorization Across Neural Language Models等研究还会使用不同的记忆定义。比较论文前必须确认它测的是逐字生成、前缀续写、成员推断还是其他指标;“模型记住了”不是一个足够精确的实验结论。

2021 GPT-2 研究中的数字应该怎样读?

2021 论文使用 GPT-2 作为代表模型,理由之一是模型与原始训练数据源已经公开,可降低真实伤害。研究者从模型生成大量文本,再用 perplexity、参考模型、zlib、大小写和滑动窗口等方法对候选排序,最后人工检查并与 OpenAI 协作查询原始训练数据确认。

数字 准确含义 不能写成
600,000 论文在“诚实”生成设置下分析的样本规模 60 万条均为泄露内容
1800 3 种生成策略 × 6 种筛选指标下人工检查的候选总数 完整训练集或全部高风险输出
604 确认属于 GPT-2 训练数据的唯一逐字样本 604 名用户的私人聊天
至少 0.1% 604 / 600,000 的保守下限,作者强调只检查了候选的一小部分 所有 GPT 模型固定泄露率
最佳 67% 某一生成+zlib 筛选配置的前 100 个候选中,67 个被确认记忆 随机问 GPT-2 有 67% 概率吐出隐私
78 个 PII 类例子 确认样本中涉及姓名、电话、地址或社交账号的分类数量 78 条私有数据库记录;论文强调训练源为公开网络

完整方法和分类见USENIX Security 2021 论文页面。研究还指出更大 GPT-2 模型在一个设置中记忆内容比小模型多 18 倍,但规模只是因素之一;重复次数、训练轮次、采样与数据清洗同样重要。

2023 ChatGPT 研究究竟发现了什么?

Nasr 等研究者为了让对齐后的聊天模型偏离常规对话行为,设计了特定 divergence attack。本文不会复现可直接执行的攻击提示,也不会展示论文提取的个人信息。论文说明该方法针对当时的 gpt-3.5-turbo,研究者在 2023 年 7 月发现问题,8 月 30 日向 OpenAI 披露,并等待 90 天后发表。

结果 论文中的范围 当前文章的边界
150 倍 特定攻击下,ChatGPT 产生训练数据的频率比正常聊天行为高 不是回答准确率、隐私泄露概率或所有模型比例
约 200 美元 研究团队查询当时 ChatGPT API 的实验成本 价格、API 和模型均可能已变化
超过 10,000 个 与 9TB 辅助数据集匹配的唯一逐字训练样本 不是 1 万条私人 ChatGPT 用户会话
最长超过 4000 字符 提取样本中最长文本长度 不能推断任意长文都可完整提取
PII 研究者在抽查输出中确认数十人的个人可识别信息 论文不证明这些信息来自付费用户私聊
可能多 10 倍以上 增加查询预算后的扩展估计 不是旧稿所称“10% 成功率”

论文 PDF 的Ethics & Responsible Disclosure 与 ChatGPT 实验章节还明确写道:该攻击对这个模型具有特异性,据作者所知不适用于他们测试过的其他生产模型。因此,文章只能说“2023 年研究证明对齐并不自动消除记忆”,不能说“当前 ChatGPT 仍可用同一提示提取训练集”。

论文中的 PII 是否等于私人用户数据泄露?

问题 论文能支持的结论 仍不能确认
模型是否会逐字输出含个人信息的训练文本 会;2021 与 2023 研究均确认过含 PII 的记忆样本 任意个人信息是否在当前模型训练集中
信息是否来自公开互联网 2021 GPT-2 训练源是公开网络;2023 使用大型公开辅助数据集做匹配 每条 PII 最初的收集授权、公开范围和后续变化
是否来自 ChatGPT 用户对话 这些实验没有证明所列 PII 来自用户私人会话 闭源训练集的每条数据来源
公开信息是否没有隐私风险 不能这样推断;聚合、持久化和重新暴露仍可能造成伤害 具体地区法律责任,需要专业判断
匹配是否可能误报 研究使用训练/辅助集匹配和人工核验降低误报 辅助数据集不完整时对全部记忆量的精确估计

训练数据提取研究回答的是模型与训练语料之间的技术关系,不自动决定版权、隐私或数据保护法律结论。法律新闻应另看具体案件与请求,例如站内的P.M. v. OpenAI 诉讼复盘;产品跨用户缓存错配则见ChatGPT 2023 数据暴露事件复盘

哪些“AI 泄露”其实不是训练数据提取?

大模型数据风险分为逐字训练样本、成员推断、系统提示泄露、RAG 文件越权和账号或共享事故五类
来源层不同,责任和修复也不同:预训练参数、运行时上下文、外部知识库与产品账号不能用同一种控制处理。图:兰塞 AI 编辑部原创。
现象 更可能的风险类型 先查什么
模型逐字输出一段罕见公开网页、代码或联系方式 训练数据记忆/提取 长片段搜索、训练源、重复次数、模型与版本
攻击者判断某病历是否参加微调,但拿不到原文 成员推断 低 FPR 指标、对照模型、数据分布
模型吐出系统提示、工具描述或隐藏规则 运行时提示泄露 系统上下文是否包含秘密,工具和日志权限
用户读到无权访问的企业文档 RAG/连接器 ACL 或租户隔离失败 检索日志、文档 ACL、身份映射和缓存键
陌生用户看到聊天标题、共享链接或账号历史 产品事故、账号接管或主动分享 登录、链接、事件通知和产品日志

系统提示不是秘密保险箱,RAG 也不会自动继承原系统权限。构建带工具和文件访问的智能体时,应使用AI 智能体权限与治理指南的身份、审批、日志和回滚门禁;高权限编码工具还应参考Claude Code 权限与安全操作指南

普通用户怎样降低自己的内容进入训练或被外发的风险?

动作 作用 限制
关闭 Improve the model for everyone OpenAI 说明关闭后,新对话不用于改进模型 不会删除已有聊天、共享链接或第三方收到的数据
使用 Temporary Chat 不进入历史、不创建记忆、不用于训练 为安全目的可能保留副本最多 30 天;第三方 actions 有独立政策
不提交秘密 从源头减少密码、密钥、身份和客户数据暴露 “请保密”提示不能替代产品和组织控制
最小化与脱敏 只提供完成任务所需字段,替换姓名、账号和标识符 稀有组合仍可能重新识别,需要评估
使用组织批准方案 业务产品通常提供默认不训练、管理员与保留控制 还要核对连接器、地区、合同和实际设置

OpenAI 当前Data Controls FAQ说明如何关闭模型改进;Temporary Chat FAQ说明历史、训练和最长 30 天安全保留边界。业务数据页面称 ChatGPT Business、Enterprise、Edu 和 API 输入输出默认不用于训练。具体设置会变化,使用当天应重新核对账号与合同。

训练或微调团队应该建立哪些技术门禁?

阶段 最低控制 验收证据
数据进入 来源与用途记录、敏感字段识别、权利与保留边界 数据清单、许可/法律基础、删除路径
去重 文档级与长序列级去重,识别模板、页脚、日志和重复 PII 重复分布、去重阈值、前后样本和误删抽查
隐私训练 高风险数据评估记录级差分隐私、裁剪和噪声预算 epsilon/delta、utility、训练稳定性和攻击评测
记忆 canary 插入受控稀有序列,测量曝光与逐字续写 不同规模、轮次、重复次数与采样下的 exposure
黑盒提取红队 在授权环境测试无先验与已知前缀攻击 查询预算、候选筛选、误报率、人工确认
部署控制 输出过滤、速率限制、异常重复检测、日志和响应 阻断率、误伤、可复现工单和模型回滚

The Secret Sharer提出用 canary 和 exposure 测量非预期记忆;Deep Learning with Differential Privacy提供差分隐私训练基础。差分隐私需要明确记录级定义、隐私预算和效用代价,不能只在产品页写“采用 DP”就认为风险已经关闭。

2022 去重论文发现,训练数据中出现 10 次的序列平均比只出现一次的序列多生成约 1000 倍,去重训练模型约少输出 20 倍训练数据。这说明去重是高价值控制,但论文也没有宣称完全阻止攻击。评测流程可结合站内AI 产品证据与风险评估方法AI 知识和数据治理指南

模型修复后不能只验证某个攻击提示“失效”一次。团队应把已经确认的逐字样本类型、重复模式、PII 格式、长代码片段和异常输出速率加入版本化回归集;每次更换基础模型、分词器、数据混合、微调集、系统提示或输出过滤器都重新运行,并保存修复前后的差异、失败样本和停止条件。如何把一次修复转成持续可复现的验收,可参考代码补丁与回归验证指南

网站运营者怎样控制公开内容用于未来模型训练?

需求 动作 边界
控制 GPTBot 抓取 根据 OpenAI crawler 文档在 robots.txt 设置 GPTBot 规则 影响未来抓取,不等于从已经训练的模型删除
允许搜索、限制训练 区分 OAI-SearchBot 与 GPTBot 的用途后分别配置 不同 crawler 与产品用途必须看最新官方说明
删除个人信息 使用服务商隐私请求入口并提供可识别页面和理由 搜索删除、网页删除和模型输出处理是不同流程
证明内容权属 保留作者、发布日期、原稿、图片许可和更新记录 元数据不能代替真实权利链
降低重复与垃圾信号 合并重复 URL,减少模板化重复段落和批量相似稿 主要价值是内容与抓取质量,也可能减少被重复学习的文本

OpenAI 的crawler 与 robots.txt 文档说明 GPTBot 等用户代理的控制方式;模型开发与训练数据说明称训练来源包括公开互联网、合作方数据和用户/训练人员/研究人员提供或生成的信息,并说明去重、过滤与个人信息处理措施。robots.txt 是访问控制信号,不是追溯删除协议。

如何设计一套不泄露真实隐私的内部评测?

  1. 先用合成 canary:生成没有现实含义的稀有标识符,不把真实身份证、密钥或客户资料当测试材料。
  2. 建立重复梯度:让同类 canary 分别出现 1、2、5、10 次,测量重复与记忆关系。
  3. 隔离训练与验证:保存数据 hash、模型版本、轮次、采样配置与随机种子。
  4. 同时测两类攻击:已知前缀续写和无先验黑盒提取不能只选容易通过的一种。
  5. 报告低误报指标:成员推断应报告 TPR@低 FPR,不只报整体准确率或 AUROC。
  6. 执行删除重训测试:删除样本后重新训练或使用支持的删除方法,验证 canary 曝光是否下降。
  7. 部署前设停止线:发现长段逐字敏感输出、密钥模式或跨租户内容时不得上线。

NIST 的生成式 AI 风险管理资料强调数据隐私、信息完整性、监控和治理应贯穿生命周期。内部评测记录也应像生产事故一样可复现:保存输入、模型、上下文、输出、匹配来源、人工判定与处置,不用“测试感觉安全”代替证据。

常见问题

模型能回答我的名字,是否证明训练数据泄露?

不能。名字可能来自公开知识、当前上下文、记忆、搜索、RAG 或训练数据。需要罕见长片段、明确数据源和逐字匹配等更强证据。

2023 年攻击现在还能直接用于 ChatGPT 吗?

本文不提供复现提示。论文作者明确说该攻击特定于当时的 gpt-3.5-turbo,并不适用于他们测试的其他生产模型;没有当前验证就不能宣称仍有效。

关闭训练能删除以前已经训练的数据吗?

OpenAI 当前说明是关闭后“新对话”不用于改进模型。它不等于从已经训练的模型、历史记录、共享链接或第三方系统追溯删除。

去重能彻底消除训练数据泄露吗?

不能。去重显著降低重复序列被再生的风险,但唯一序列、过度训练、大模型容量、微调数据和其他攻击仍需独立评测。

把秘密写进系统提示是否比放进训练集安全?

不是。系统提示属于运行时上下文,可能通过提示注入、工具日志、错误信息或模型输出泄露。密码和密钥应放在受控秘密管理系统,不应进入模型可见文本。

公开网页中的个人信息是否可以放心用于训练?

公开可访问不等于没有隐私、版权、合同或数据保护限制。还要考虑收集目的、地区法律、敏感性、聚合伤害、删除请求和模型再暴露风险。

编辑复核与纠错记录

编辑主体:兰塞 AI 编辑流程;事实复核:2026 年 7 月 16 日。旧稿使用占位论文链接,把 GPT-2、去重实验与 gpt-3.5-turbo 研究混为“一项最新研究”,虚构最高 10% 成功率和作者引语。本次 A 级重写依据 USENIX 2021、arXiv:2202.06539、arXiv:2311.17035 及 OpenAI 当前数据控制资料,重建模型、攻击、分母、PII、外推和防护边界,新增两张原创信息图,并避免传播可直接执行的隐私提取提示。本站来源、更新与纠错原则见关于本站与编辑规范