一句话答案:AI 幻觉(Hallucination)指大语言模型生成的内容看起来流畅自信,但在事实上不正确、凭空捏造或偏离了给定来源。它不是模型"故意说谎",而是自回归生成机制在缺乏事实锚点时的副产品。幻觉无法被完全消除,但可以通过分层策略将其降低到可接受水平。
几乎所有大语言模型都会产生幻觉。OpenAI、Anthropic、Google 和 Meta 的模型在各自的安全文档中都承认了这一现象。Anthropic 研究团队将幻觉定义为"模型生成的内容与来源内容不一致或无意义";Google Research 则强调幻觉包括"事实错误"和"忠实性偏离"两种不同性质的问题。
本文根据 Huang 等人 2023 年综述、Tong 等人 2024 年幻觉分类框架、Anthropic 与 Google 的公开研究,以及 Microsoft Learn 幻觉指南整理,资料复核日期为 2026 年 7 月 20 日。模型能力与基准结果会持续变化,具体数据请核对最新文献。建议读者在阅读时关注论文发表时间,因为该领域的研究进展非常快,早期结论可能已被后续的新工作修正或更新细化。
AI 幻觉的两种核心类型
把"AI 胡说八道"笼统称为幻觉会掩盖真正的问题。研究社区通常将幻觉分为两个正交维度:事实性(Factuality)和忠实性(Faithfulness)。理解这个区分是治理幻觉的第一步,因为不同类型的幻觉需要不同的检测和缓解策略。
| 维度 | 定义 | 典型表现 | 检测难度 |
|---|---|---|---|
| 事实性幻觉 | 生成内容与客观世界事实不符 | 捏造数据、虚构人物、错误日期、伪造引用 | 需要外部知识源验证 |
| 忠实性幻觉 | 生成内容偏离了给定输入或来源 | 摘要添加原文没有的信息、翻译篡改原意、推理超出前提 | 需要对比输入与输出 |
一个例子:用户问"中国最长的河流是哪条",模型回答"黄河,全长 5464 公里"——这是事实性幻觉,因为正确答案是长江。另一个例子:给定一段关于某公司营收的新闻,模型摘要中写"该公司利润增长了 30%"——原文只提到营收增长,利润数字是模型自行添加的,这是忠实性幻觉。
事实性幻觉的子类型
| 子类型 | 说明 | 示例 |
|---|---|---|
| 捏造事实 | 生成完全不存在的实体或事件 | "2024 年诺贝尔物理学奖授予了张三"——实际并未发生 |
| 错误归因 | 将真实属性归到错误对象 | "相对论是牛顿提出的"——实际是爱因斯坦 |
| 虚构引用 | 生成看似真实但不存在的论文、书籍或 URL | 引用一篇不存在的 Nature 论文,含真实格式但 DOI 无效 |
| 数值错误 | 数据、日期、统计数字不准确 | "全球人口在 2025 年达到 90 亿"——实际约 81 亿 |
| 时间错位 | 将事件放到错误的时间段 | "ChatGPT 在 2019 年发布"——实际是 2022 年 11 月 |
忠实性幻觉的子类型
| 子类型 | 说明 | 示例 |
|---|---|---|
| 添加信息 | 摘要或回答中引入输入未提及的内容 | 原文说"公司裁员 200 人",摘要写"裁员 200 人并关闭了北京办公室" |
| 矛盾 | 输出内部自相矛盾或与输入直接冲突 | 前文说"收入增长",后文说"收入下降" |
| 推理越界 | 基于给定前提推出逻辑上不成立的结论 | 前提"A 公司市值超过 B 公司"→ 结论"A 公司利润更高" |
| 遗漏关键信息 | 在摘要中丢弃输入的核心要点 | 一篇关于药物副作用的文章,摘要只提疗效不提风险 |
事实性幻觉需要外部知识库来验证,忠实性幻觉需要对比输入与输出来检测。两者的缓解策略不同,后文将分别讨论。在实际应用中,同一段生成文本可能同时包含两种类型的幻觉,这增加了检测和治理的复杂度。
为什么大模型会产生幻觉?
幻觉的成因是多层次的,从训练数据到推理阶段都有贡献因素。理解这些成因有助于选择针对性的缓解策略,而不是笼统地"换个更好的模型"。
| 成因层 | 机制 | 影响 |
|---|---|---|
| 训练数据 | 语料中包含错误、矛盾或过时信息;模型学到了统计关联但无法区分真假 | 模型"记住"了错误事实,或在相似语境下复现错误模式 |
| 知识截止 | 模型只知道训练数据截止日期之前的事件 | 对截止日期后的事件,模型会基于旧模式"猜测",产生看似合理但错误的答案 |
| 自回归解码 | 模型逐 token 生成,选择条件概率最高的下一个词 | 早期错误会被后续生成放大;高温度增加多样性但也增加错误概率 |
| 上下文限制 | 上下文窗口有限,长文档可能被截断或关键信息在注意力中衰减 | 模型可能"忘记"前文约束,导致忠实性偏离 |
| 缺乏验证能力 | 模型没有内置搜索、计算或数据库查询能力 | 无法在生成过程中核实事实,只能依赖参数中存储的"印象" |
| 训练目标 | 优化目标是最大化似然(生成流畅文本),而非最大化事实准确性 | 模型更擅长生成"看起来对"的内容,而非"确实对"的内容 |
OpenAI 的技术解释指出,幻觉与模型的"校准"有关——模型有时对自己的错误输出过于自信。Google DeepMind 的研究也表明,即使是经过 RLHF 对齐的模型,在面对训练数据覆盖不足的领域时仍然容易产生幻觉。这意味着幻觉不是某个模型的特有问题,而是当前生成式 AI 范式的结构性挑战。
从实用角度看,理解成因有助于选择正确的缓解策略。如果幻觉主要来自知识截止,那么 RAG 是最直接的解决方案;如果来自自回归解码的概率放大效应,那么降低温度和多次采样会更有效;如果来自上下文限制,那么优化检索策略和提示结构比换模型更实际。不同成因需要不同的对策,笼统地"换个更好的模型"往往不是最经济的选择。
还有一个重要的技术背景:当前大模型的训练目标本质上是"预测下一个 token",而不是"判断内容是否真实"。这意味着模型在训练过程中没有被明确教导区分"真实"和"虚假",它只学会了生成在统计上看起来合理的文本。这个根本性的设计约束是幻觉难以完全消除的深层原因。
哪些场景下 AI 幻觉最危险?
不是所有幻觉都有同等危害。写一首诗时"创造性偏离事实"几乎无害,但在医疗或法律场景中,一个错误数字可能导致人身伤害或经济损失。理解幻觉的风险梯度是合理分配治理资源的前提。
| 场景 | 幻觉风险等级 | 主要风险 | 最低要求 |
|---|---|---|---|
| 创意写作、头脑风暴 | 低 | 内容不准确但不影响决策 | 基本事实检查 |
| 内部知识问答(员工使用) | 中低 | 误导内部决策,但可被同事纠正 | 标注来源 + 人工抽检 |
| 客户面向的客服/营销内容 | 中 | 损害品牌信誉、引发投诉 | RAG + 输出审核 + 免责声明 |
| 教育辅导内容 | 中高 | 学生可能将错误信息当作事实记忆 | 来源标注 + 教师审核 |
| 医疗建议、药物信息 | 高 | 直接影响健康和安全 | RAG + 专业审核 + 拒绝超范围回答 |
| 法律建议、合规解读 | 高 | 错误法律信息可能导致违规或诉讼 | 专业律师审核 + 严格来源约束 |
| 金融分析、投资建议 | 高 | 直接经济损失、监管风险 | 实时数据接入 + 合规审核 + 免责声明 |
风险矩阵的关键变量是:错误代价(是否可逆)、验证难度(用户能否自行核实)、影响范围(一个人还是一万人)。在高风险场景中,不能仅依赖模型自身能力,必须引入外部验证层。
还有一个常被忽略的维度:错误的不对称性。在某些场景中,"漏报"(该说没说)和"误报"(不该说却说了)的代价不同。例如医疗场景中,模型遗漏一个罕见但严重的药物副作用(漏报)可能比错误地多报一个不存在的副作用(误报)危害更大。理解这种不对称性有助于设计更有针对性的缓解策略。
此外,幻觉的影响还与用户群体有关。当用户具备领域知识时,他们可能能够识别幻觉并忽略错误信息;但当用户是普通消费者、儿童或弱势群体时,幻觉的影响会被放大。这意味着面向不同受众的应用需要不同级别的幻觉治理投入。
怎样检测和量化 AI 幻觉?
检测幻觉是治理的前提。目前的方法分为人工评估和自动检测两类,各有适用场景和局限性。
| 方法 | 原理 | 优势 | 局限 |
|---|---|---|---|
| 人工标注 | 领域专家逐条审核输出内容的事实准确性 | 最可靠,能发现细微错误 | 成本高、速度慢、不可扩展 |
| 基于参考的自动评估 | 将模型输出与标准答案对比(如 F1、BLEU、ROUGE) | 可批量运行、可重复 | 依赖高质量参考答案;无法评估开放式回答 |
| 基于 LLM 的评估 | 用另一个模型判断输出是否包含幻觉(如 G-Eval、RAGAS) | 可扩展、支持开放式输出 | 评估模型本身也可能有幻觉;需要校准 |
| 事实核查 API | 将输出中的声明提取出来,与知识图谱或搜索引擎交叉验证 | 接近实时、可追溯 | 只能检查可查询的事实声明;无法处理主观内容 |
| 自一致性检查 | 对同一问题多次采样,检查回答是否一致 | 不需要外部知识源 | 一致不等于正确;增加推理成本 |
RAGAS 框架是目前 RAG 场景中最常用的幻觉检测工具之一,它通过"忠实性分数"和"答案相关性分数"两个维度量化生成质量。Hallucination Benchmark 综述对比了多个基准,指出目前没有单一基准能全面覆盖幻觉的所有类型。
在实际部署中,最常用的检测方案是"基于 LLM 的评估 + 定期人工抽检"的组合。前者提供持续、可扩展的监控,后者提供校准和兜底。需要注意的是,评估模型本身也可能产生幻觉——例如错误地将正确内容标记为幻觉,或放过实际的错误。因此评估系统需要定期用人工标注结果进行校准,确保其判断标准与业务需求一致。
另一个值得关注的方向是可解释性检测:不仅判断输出是否包含幻觉,还要指出具体哪句话有问题、可能的正确内容是什么。这对人工审核流程特别有价值,因为审核员可以直接关注被标记的部分,而不是重新阅读全部内容。SelfCheckGPT 提供了一种基于多次采样的方法,通过比较不同生成的重叠度来定位可能幻觉的片段。
降低 AI 幻觉的分层策略
没有单一方法能消除幻觉。有效的策略是在四个层面同时设防,每层解决不同类型和阶段的幻觉。以下逐一介绍每层的策略、实施方式和效果边界。
第一层:提示层(Prompt Layer)
通过 Prompt Engineering 在输入端约束模型的生成行为。
| 策略 | 做法 | 效果 |
|---|---|---|
| 明确拒绝指令 | 在系统提示中写"如果你不确定,请说'我不知道',不要编造" | 减少事实性幻觉,但可能降低回答覆盖率 |
| 来源约束 | 要求模型"只根据以下提供的文本回答,不要使用自己的知识" | 减少忠实性幻觉,适合 RAG 场景 |
| 结构化输出 | 要求模型以 JSON 或固定格式输出,便于后续验证 | 降低格式层面的"自由发挥"空间 |
| 思维链引导 | 要求模型先列出推理步骤再给出结论 | 暴露推理过程中的错误,便于检测忠实性幻觉 |
提示层成本最低、实施最快,但效果有限——它不能解决模型"不知道自己不知道"的根本问题。实际测试中,仅靠提示约束通常能减少 20–40% 的幻觉,但具体效果取决于任务复杂度、模型能力和提示设计质量。建议将提示约束作为基线方案,而不是最终方案。
第二层:知识层(Knowledge Layer)
通过 RAG(检索增强生成)为模型提供外部事实依据,这是目前降低事实性幻觉最有效的手段。
| 策略 | 做法 | 效果 |
|---|---|---|
| RAG 接入 | 检索权威文档并注入上下文,让模型基于检索结果回答 | 大幅减少事实性幻觉;知识可更新 |
| 知识图谱增强 | 将结构化知识(实体、关系)注入提示 | 对数值、日期等硬事实特别有效 |
| 多源交叉验证 | 检索多个来源,要求模型在来源一致时才回答 | 减少单源偏差和错误传播 |
但 RAG 不是万能的。RAG 幻觉研究表明,即使提供了检索文档,模型仍然可能:(1) 忽略文档内容而依赖参数知识;(2) 在文档中找到相关信息但错误地改写;(3) 被检索到的错误文档误导。因此 RAG 必须配合验证层使用。
RAG 的效果还高度依赖检索质量。如果检索到的文档本身不准确、不相关或相互矛盾,模型可能会产生更多幻觉而不是更少。这就是为什么 RAG 系统需要同时投资于文档质量治理、检索策略优化和上下文窗口管理。在实践中,一个经过精心调优的 RAG 系统通常比简单堆砌文档的效果好得多。
第三层:验证层(Verification Layer)
在模型输出后、用户看到前,自动检查内容的准确性。
| 策略 | 做法 | 效果 |
|---|---|---|
| NLI 忠实性检测 | 用自然语言推理模型判断输出是否可从输入推导 | 有效检测忠实性幻觉 |
| 实体/数值核查 | 提取输出中的实体和数值,与知识源交叉验证 | 有效检测事实性幻觉中的数值错误 |
| 引用验证 | 检查模型引用的 URL、论文、书籍是否真实存在 | 直接消除虚构引用类幻觉 |
| 自一致性投票 | 多次采样取共识,标记不一致的部分 | 降低随机性幻觉,但增加推理成本 |
验证层的关键设计决策是延迟 vs 准确性的权衡。实时验证(如 NLI)增加几百毫秒延迟但可在线使用;深度验证(如多源事实核查)可能需要数秒,适合异步场景。选择哪种方案取决于你的用户体验要求和场景风险等级。
一个实用的设计模式是"分级验证":对低风险内容(如创意写作)只做基本格式检查;对中等风险内容(如客服回答)做 NLI 忠实性检测和关键词核查;对高风险内容(如医疗建议)做完整的事实核查和专家审核。这样可以在不牺牲整体用户体验的前提下,将验证资源集中在最需要的地方。
第四层:人工层(Human Layer)
在高风险场景中,人工审核是不可替代的最后一道防线。
| 策略 | 做法 | 适用场景 |
|---|---|---|
| 专家审核 | 领域专家在发布前审核 AI 生成内容 | 医疗、法律、金融等高风险内容 |
| 用户反馈闭环 | 允许用户标记"这个回答有误",收集并用于改进 | 所有面向用户的场景 |
| 定期抽检 | 对 AI 输出进行随机抽样审核 | 内部知识库、客服系统 |
| 红队测试 | 专门团队尝试诱导模型产生幻觉,发现薄弱点 | 上线前的安全评估 |
在 AI Agent 场景中,人工层还涉及"人在回路"(Human-in-the-Loop)设计:Agent 在执行高影响动作前暂停等待人类确认,这既防止幻觉导致的错误操作,也建立了责任归属。对于内容发布类场景,人工层还应包括发布前的最终审核流程,确保 AI 生成的内容在对外发布前经过至少一位领域专家的确认。
AI 幻觉能否被完全消除?
不能。至少在当前技术范式下不能。
幻觉的根源在于大语言模型的本质——它们是概率性的文本生成器,不是知识数据库。模型"知道"什么取决于训练数据,"怎么说"取决于解码策略,而它并不"理解"自己说了什么。即使模型在训练中学到了正确事实,在生成时也可能因为上下文干扰、概率采样或注意力分散而偏离。这就像一个人凭记忆回答问题时,可能会记错细节或混淆相似的信息,但模型的"记忆"问题被放大了数十亿倍。
| 常见误解 | 事实 |
|---|---|
| "下一代模型会消除幻觉" | 幻觉率会持续降低,但不可能归零;它是生成式 AI 的结构性特征 |
| "RAG 能解决所有幻觉" | RAG 大幅减少事实性幻觉,但可能引入新的忠实性幻觉(改写错误) |
| "温度设为 0 就没有幻觉" | 低温度减少随机性但不消除系统性偏差和知识缺失导致的错误 |
| "模型越自信越准确" | 研究表明模型的置信度与准确性相关性很弱;流畅不等于正确 |
| "只有小模型才有幻觉" | GPT-4、Claude、Gemini 等前沿模型同样存在幻觉,只是类型和频率不同 |
正确的目标不是"消除幻觉",而是将幻觉率降低到场景可接受的水平,并建立检测和兜底机制。这需要根据场景风险选择合适层次的缓解策略组合。
从工程角度看,幻觉治理与软件质量保障有相似之处:我们不会说"代码没有 bug",而是通过测试、监控、回滚和事后复盘将 bug 的影响控制在可接受范围内。同样,幻觉治理也需要建立多层防线、持续监控和快速响应机制。关键是设定明确的幻觉率目标,并随业务发展和模型进步定期调整。
对于正在评估模型供应商的团队,建议在采购流程中加入幻觉评估环节:要求供应商提供其模型在你特定场景中的幻觉率数据,而不是仅依赖通用基准分数。同时,在合同中明确幻觉相关的 SLA(服务等级协议),包括幻觉率上限、检测责任归属和错误响应流程。
实战建议:从你的场景出发
不同场景需要的治理深度不同。以下是一个简化的决策路径,帮助你从自己的场景出发逐步建立幻觉治理方案:
- 评估你的场景风险。AI 幻觉在你的应用中会导致什么后果?如果只是创意写作,提示层就够了;如果是医疗问答,需要四层全上。
- 识别主要幻觉类型。你的模型更容易犯事实性错误还是忠实性偏离?前者优先投入 RAG,后者优先投入来源约束和 NLI 验证。
- 建立基线。用人工标注或自动评估工具测量当前幻觉率,作为改进参照。
- 逐层叠加。先加提示约束(成本最低),再看 RAG 能否解决剩余问题,最后加验证层和人工层。
- 持续监控。幻觉率会随模型更新、数据变化和用户行为漂移而变化。建立定期抽检机制。
- 建立响应流程。当用户报告幻觉时,需要有明确的升级路径:谁负责审核、多快响应、如何修复和通知用户。
以上步骤不是一次性项目,而是持续循环。每次模型更新、数据源变化或用户反馈都可能暴露新的幻觉模式,需要重新评估和调整策略。建议每季度进行一次全面的幻觉率审计,并在每次模型版本升级前后进行对比测试。
如果你的应用涉及 Function Calling,幻觉还可能表现为模型返回格式正确但语义错误的参数——比如调用"查询天气"工具时传入不存在的城市代码。这类幻觉需要在工具调用层做参数校验,而不是只检查最终文本输出。
不同模型的幻觉表现差异
虽然幻觉是所有大语言模型的共性问题,但不同模型在幻觉类型和频率上存在差异。2024 年幻觉基准研究对比了多个主流模型在事实性问答、摘要忠实性和开放式对话中的表现,发现几个共性规律:
| 模型特征 | 幻觉倾向 | 原因 |
|---|---|---|
| 参数规模较小(7B 以下) | 事实性幻觉频率较高 | 参数中存储的知识有限,更容易"猜错" |
| 经过 RLHF 对齐 | 忠实性幻觉可能减少,但事实性幻觉不一定减少 | 对齐训练让模型更倾向于"给出回答"而非"拒绝回答" |
| 支持工具调用 | 可通过外部工具减少事实性幻觉 | 模型可以查询实时信息而非依赖参数记忆 |
| 长上下文窗口 | 忠实性幻觉可能减少(更多来源信息可参考) | 但注意力稀释可能导致中间信息被忽略("Lost in the Middle" 问题) |
| 多模态模型 | 新增视觉幻觉类型(图像描述中的错误) | 视觉编码器与语言模型之间的对齐不完全 |
需要注意的是,模型发布方公布的幻觉率通常在受控基准上测量,实际部署中的幻觉率会因提示设计、领域分布和用户行为而显著不同。不要将基准分数直接外推为你的应用场景的表现。
幻觉治理的常见陷阱
在实施幻觉缓解策略时,团队常犯以下错误。提前识别这些陷阱可以节省大量调试时间:
| 陷阱 | 为什么是问题 | 正确做法 |
|---|---|---|
| 只依赖提示层 | 提示约束效果有限,模型可能在复杂问题中忽略指令 | 提示层作为第一道防线,但必须配合知识层和验证层 |
| 上线后才考虑幻觉 | 事后修补成本远高于设计阶段预防 | 在架构设计阶段就纳入幻觉治理方案 |
| 用单一指标衡量 | 幻觉率下降可能只是模型学会了"拒绝回答",而非真正更准确 | 同时监控幻觉率、回答覆盖率和用户满意度 |
| 忽略忠实性幻觉 | 团队通常只关注事实准确性,忽略摘要/翻译中的来源偏离 | 对涉及来源的场景单独建立忠实性检测流程 |
| 不做持续监控 | 模型更新后幻觉模式可能变化 | 建立定期回归测试机制,每次模型更新前后对比 |
延伸与相关概念
AI 幻觉与多个 AI 安全议题密切相关,理解这些关系有助于建立更全面的治理框架:
| 相关概念 | 与幻觉的关系 |
|---|---|
| RAG(检索增强生成) | 最直接的幻觉缓解手段,通过外部知识约束生成内容 |
| Prompt Engineering | 通过提示设计约束模型行为,是成本最低的缓解层 |
| AI Agent | Agent 的工具调用和验证循环可以发现并纠正幻觉输出 |
| 大语言模型(LLM) | 幻觉的载体;理解 LLM 的工作原理是理解幻觉的前提 |
| AI 安全与对齐 | 幻觉是 AI 对齐问题的一个表现——模型输出不符合人类意图 |
| 模型评估与基准 | 幻觉率是模型评估的重要维度,但不同基准的测量方式差异大 |
幻觉治理不是一次性工程,而是持续的过程。随着模型能力提升、应用场景扩展和监管要求变化,你的缓解策略也需要定期回顾和更新。建议关注 arXiv 计算语言学最新论文、Anthropic 研究博客、OpenAI 研究页面以及 DOI 论文索引的最新进展。
本文不构成对任何特定模型或产品的推荐。文中提到的模型能力和研究结论基于发表时的状态,可能随版本更新而变化。请在实际部署前自行验证最新信息。