AI 幻觉是什么?为什么大模型会一本正经地答错
AI 幻觉是什么?解释大模型产生幻觉的原因、常见表现形式,以及如何识别和减少幻觉的影响。
什么是 AI 幻觉
你让 ChatGPT 帮你找一篇论文,它给你列出了标题、作者、发表期刊——看起来像模像样,但你去搜,发现这篇论文根本不存在。
这就是 AI 幻觉(Hallucination)。
AI 幻觉是指大模型生成的内容看起来合理、流畅、自信,但实际上是错误的或编造的。模型不会说"我不知道",它会一本正经地给你一个编造的答案。
这个术语来自计算机视觉领域——早期的图像识别模型会"看到"不存在的物体。大语言模型的幻觉是类似的:它"说出"不存在的事实。
为什么会产生幻觉
要理解幻觉,首先要理解大模型的工作原理。
大模型不是在"理解"语言,而是在做概率预测。给定前面的文字,预测下一个最可能的词是什么。它没有真正的知识库,没有事实核查机制,不知道什么是"真的"。这导致几个根本问题:
1. 训练数据的局限
模型的知识来自训练数据。如果训练数据中有错误、过时信息、或者某些领域数据不足,模型就会在这些地方产生幻觉。
2. 概率生成的特性
模型选择下一个词是基于概率,不是基于事实。有时候概率最高的词组合起来恰好是事实,有时候不是。特别是当模型对某个领域"不确定"的时候,它倾向于生成看起来合理但实际错误的内容。
3. 不会说"不知道"
模型被训练成"尽量回答问题",而不是"承认不知道"。当你问一个超出它知识范围的问题,它不会说"我不确定",而是会编一个看起来合理的答案。
4. 上下文误导
如果用户的提问中包含了错误的前提,模型可能会顺着用户的错误继续编下去,而不是纠正用户。
幻觉的常见表现
| 类型 | 例子 | 危害程度 |
|---|---|---|
| 编造事实 | 虚构不存在的论文、数据、人物 | 高 |
| 错误引用 | 引用真实作者的不存在作品 | 高 |
| 过时信息 | 用 2023 年的数据回答 2026 年的问题 | 中 |
| 逻辑错误 | 推理过程看似合理但结论错误 | 中 |
| 过度自信 | 对不确定的事情给出确定性答案 | 中 |
| 顺从错误 | 用户说了错误前提,模型不纠正 | 低-高 |
如何减少幻觉的影响
1. RAG(检索增强生成)
让模型在回答前先检索相关资料,基于检索结果回答,而不是纯粹靠"记忆"。这是目前最有效的减少幻觉的方法。
想了解 RAG 的原理,可以看 RAG 是什么。
2. 事实核查
对 AI 输出的关键信息做验证。特别是:
- 具体数字和日期
- 人名和机构名
- 引用的文献和链接
- 法律和医学相关陈述
3. 多模型交叉验证
用不同的模型回答同一个问题,对比答案的一致性。如果多个模型给出不同的答案,说明这个问题可能存在幻觉风险。
4. 推理模型
推理模型(如 o3、DeepSeek-R1)有思考过程,会在推理中自我验证,幻觉率比普通模型低。但不是零。
5. 提示词工程
在提示词中明确要求模型:
- 不确定时说"我不确定"
- 区分事实和推测
- 给出信息来源
6. 温度参数
降低模型的"温度"(temperature)参数可以减少随机性,让输出更确定,但也会减少创造性。
幻觉在不同场景的影响
| 场景 | 幻觉影响 | 应对策略 |
|---|---|---|
| 创意写作 | 低(编造是优势) | 不需要特别处理 |
| 代码生成 | 中(可能用不存在的 API) | 测试验证 |
| 学术研究 | 高(引用可能虚构) | 必须人工核查 |
| 医疗咨询 | 极高(可能误导治疗) | 必须专业审核 |
| 法律建议 | 极高(可能引用错误法条) | 必须专业审核 |
幻觉是 bug 还是 feature
有趣的是,在某些场景下,幻觉反而是优势:
- 创意写作:模型的"编造"能力可以产生新颖的想法
- 头脑风暴:不拘泥于已知事实,提供新视角
- 故事创作:虚构是核心需求
问题出在把幻觉当成事实使用。所以关键是:理解你的场景,决定你需要多高的事实准确性。
下一步
- 想减少幻觉?看 RAG 是什么
- 想用推理模型降低幻觉?看 AI 推理模型是什么
- 想了解不同模型的幻觉表现?看 AI 大模型有哪些
---
本文最后更新于 2026-07-27。AI 幻觉是活跃的研究领域,新的缓解方法可能随时出现。常见问题
相关推荐
AI Agent 是什么?从实际工作场景理解智能体
AI Agent 是什么?从实际开发经验出发,解释 Agent 的工作原理、与普通 AI 的区别、主流框架选择,以及落地时的真实边界。
AI 推理模型是什么?和普通聊天模型有什么区别
AI 推理模型是什么?解释推理模型的原理、与普通聊天模型的区别,以及推理模型的适用场景和局限性。
RAG 是什么?用外部知识增强大模型回答的实用方案
RAG(检索增强生成)是什么?从实际项目经验出发,解释 RAG 的工作原理、与微调的区别、常见坑点,以及什么场景该用什么场景不该用。
AI 大模型有哪些?2026 年主流模型选型指南
2026 年主流 AI 大模型有哪些?从实际使用角度出发,梳理 GPT-4o、Claude、Gemini、Llama、Qwen、DeepSeek 等模型的特点、优劣和选型建议。
获取更多 AI 内容
订阅更新,第一时间获取新教程和工具推荐。