幻觉:为什么 AI 会一本正经胡说
上一篇你知道了大模型的本质是"超级接龙"。这一篇,用一个原理讲清它最著名的毛病——幻觉。
你大概遇到过:问它一篇论文,它报出作者、期刊、页码,头头是道——结果这论文根本不存在。
奇怪的是,它胡说时毫不心虚,语气和说真话时一模一样。为什么?
🔑 本篇心法:AI 不是在"回忆事实",而是在"续写最像真的文字"。像不像真,和是不是真,是两回事。
什么是幻觉
幻觉 = AI 自信地编造不存在的事实。
注意定义里的两个词:
- "编造":内容是凭空生成的,不是从哪查的
- "自信":它不会脸红、不会迟疑,编得和真话一样流利
它不像人撒谎(人撒谎知道自己在撒谎)。它更像一个记不清事又爱面子的人——把"大概是吧"直接说成了"就是这样"。
为什么会这样:三个原因
原因一:它在"接龙",不是在"查资料"
上一篇讲过,AI 的本质是预测"下一个最像样的字"。
当你问一本不存在的书时,它不会"查一下发现没有"——它的机制里没有"查"这一步。它只会想:"这个话题下,最像真的书名长什么样?"然后流畅地续写一个出来。
"最像真的",从来就不等于"是真的"。
原因二:训练数据里没有,它也得接
接龙没有"弃权"这个选项。你问的问题它训练时没见过,它也必须给你一个"读起来合理"的答案——就像接龙接不下去也得硬接。
数据没覆盖的角落(冷门人物、新政策、小众论文),正是幻觉的高发区。
原因三:你引导性太强,它顺着你说
看这个对话:
你:李白和杜甫哪一年在长安见的面?
AI:李白与杜甫于天宝三年(744 年)在洛阳相见……
听起来像真的?这道题本身就是坑——"李杜相遇"的细节历史上本有争议,而你把"在哪年见的面"当成既定事实来问,AI 就顺着你的预设,编一个具体年份出来。
你的问题里藏了错误前提,AI 不会纠正,只会配合。(对策见下面第 1 条。)
典型幻觉长什么样
| 类型 | 例子 |
|---|---|
| 编文献 | 作者、期刊、页码齐全的论文——查无此文 |
| 编引用 | "爱因斯坦说过:……"——爱因斯坦没说过 |
| 编网址 | 给你一个格式完美的链接——点开是 404 |
| 编细节 | 冷门人物的经历、小城市的数据——看似具体,全是脑补 |
| 张冠李戴 | 把甲的观点安给乙,把 A 城的事安给 B 城 |
减少幻觉的四个办法
① 别在问题里埋前提
❌ "李白杜甫哪年见的面?"(预设了见过面) ✅ "李白和杜甫有可能见过面吗?历史记载是怎么说的?"
② 直接要求它"不知道就说不知道"
在提问前加一句魔法咒语:
如果不确定或没有可靠依据,请直接说"不确定",不要推测。
③ 要求标注来源,且自己去核
"请给出信息来源"——它给的来源也要抽查(它可能连来源都编,第 2 篇讲过核实方法)。
④ 事实类问题,用联网搜索的 AI
联网 AI(第 8 章讲过)会先搜索再回答,"查资料"替代"凭记忆接龙",幻觉率大幅下降。
什么时候绝对不能信 AI
再复习一遍第 2 篇的红线,原理层面你就明白了——这些领域代价太高,一次幻觉都承受不起:
- 🏥 医疗:药量错一个数字,是健康问题
- ⚖️ 法律:条款引用错了,是损失问题
- 💰 投资:"据分析必涨",是你的真金白银
这些领域,AI 只当预习和线索,拍板永远找专业人士。
本篇小结
🔑 幻觉是"接龙机制"的必然副产品——它生成"像真的",不生成"是真的"。四招防御:不埋前提、允许说不知道、要来源、用联网。
下一篇讲另一个日常困扰:为什么 AI 聊着聊着就"忘了"你说过的话?——"记忆"和"上下文窗口"是怎么回事。
💬 评论(0)
请登录后参与评论
加载中...