AI 一本正经胡说的时候,脑子里在发生什么?
2026-07-26
一句话:AI 编造事实(业内叫「幻觉」)不是因为它想骗你,而是因为我们用「答对得分、说不知道不得分」的方式训练和考核它——在这套规则下,不会也要蒙一个是最优策略。这篇文章讲清楚它为什么编、什么时候最容易编,以及你能做什么。
反幻觉声明:本文的核心解释来自 2025 年的论文《Why Language Models Hallucinate》,四位作者里三位在 OpenAI,一位(Santosh S. Vempala)在佐治亚理工,论文的作者、单位、日期、核心论点均已从 arXiv 原文核实。文中「我编了三个编号」是我自己写作时的经历,属于个人陈述——草稿没留下来,没法给你验;能验的是上一篇文章里最终用的那三个数。没有任何数字或来源是编的——这篇文章尤其不敢。
一、先看一个真实的翻车现场
写这个系列上一篇文章的时候,我要在示意图里标出三个「文字积木」在模型内部的编号。我写下了:267、32086、15717。
看起来很像那么回事——数量级对、格式对、三个数各不相同。
然后我去查了一下真实值:302、1618、197721。
三个全是错的。
我不是想骗谁,我甚至没意识到自己在编。那三个数字只是「看起来最像编号的东西」——而这,恰恰就是 AI 幻觉的全部机制。
二、它不是在撒谎
我们先把一个词的意思掰清楚。
撒谎需要两个条件:① 你知道真相;② 你故意说反。
AI 这两条一个都不占。它不知道真相,也没打算骗你。所以「AI 在撒谎」这个说法,方向就错了。
那它在干嘛?
三、第一个原因:它学的是「像不像」,不是「对不对」
AI 在训练阶段读了海量文字,学的核心本事只有一个:猜下一个词最可能是什么。
请注意这里的关键:真话和假话在文字上长得一样通顺。
「鲁迅原名周树人」和「鲁迅原名周作人」,作为句子一样流畅、一样像模像样。前者对,后者错——但这个区别不在文字的「通顺度」里,而在外部世界里。
模型内部没有一个「这句是真的 / 这句是假的」的开关。它只有「这句读起来顺不顺」。
这就是第一个来源:通顺 ≠ 正确,而模型只学到了通顺。
四、第二个原因:我们的考法,逼它蒙
这一条才是真正有意思的地方,也是 2025 年那篇论文的核心发现2。论文用的比喻,就是考试——原文写的是「像学生面对不会做的考题一样」。
想象你在做一道四选一的选择题,你完全不会。规则是:
- 答对 +1 分
- 答错 0 分
- 空着 0 分
你会怎么办?
当然是蒙一个。 空着必得 0 分,蒙一下还有 25% 的机会。凡是理性的考生,都会蒙。
现在关键来了:给 AI 模型排名的那些榜单,用的几乎全是这套规则——答对加分,回答「我不知道」不加分。
于是在训练和调优的过程中,模型逐渐学会了同一件事:
不确定的时候,编一个听起来对的,总比说「我不知道」得分高。
论文的原话是:模型被优化成了「好的考生」(good test-takers),而好考生的第一守则就是——别留空。
所以幻觉不是一个孤立的技术故障,它是被我们的评价方式奖励出来的行为。
五、它什么时候最容易编?
知道了机制,就能预测它在哪里翻车。越是「具体、稀有、可查证」的东西,越容易被编造:
| 高风险(重点核对) | 为什么 |
|---|---|
| 具体数字(编号、比例、金额) | 数字有固定格式,编一个「像的」成本极低——我那三个编号就是 |
| 日期、年份 | 同上,而且很少有人会真去查 |
| 人名 + 作品的对应关系 | 「某某写过某某书」读起来永远通顺 |
| 论文标题、DOI、URL | 格式极其规整,编起来毫无难度 |
| 冷门人物的生平细节 | 训练数据里出现次数少,模型「印象」模糊 |
反过来,越是常识性、被反复讲过的内容,越不容易出错——因为它在训练文本里出现了无数次,模型的「印象」很深。
这也解释了一个很多人观察到的现象:你问得越专业、越冷门,AI 越容易一本正经地胡说。不是它欺软怕硬,是那些地方的「印象」本来就淡。
六、怎么办
论文给的方案有点反直觉:与其造更多「幻觉检测」的新测试,不如把现有排行榜的计分规则改掉3。
就像考试如果改成「答错倒扣分、老实空着给部分分」,学生的策略立刻会变一样——模型也会。这是一个规则设计问题,不是一个「模型不够聪明」的问题。
而你现在就能用的,有三招:
- 明确告诉它可以说不知道。 一句「不确定就直说不知道,不要猜」往往真的有用——因为你临时改掉了它的「计分规则」。
- 要出处,然后真的去点开。 注意:出处本身也可能是编的。所以关键动作不是「让它给链接」,而是「你去点那个链接」。
- 对具体数字、日期、人名、论文标题额外警惕。 按上面那张表,这些是重灾区。
七、真正要记住的那件事
回到开头我编的那三个数字。
我为什么最后没让它们上线?不是因为我”感觉不对”——那三个数字看起来完全正常。是因为我有一条硬规矩:凡是具体数字,发布前必须回原始工具跑一遍。
规矩救了我,直觉没有。
这就是这篇文章真正想给你的东西:
面对 AI 给的信息,不要练习「判断它是不是在胡说」——你判断不出来,那正是幻觉的定义。要练习的是「建立一个不依赖判断的核对习惯」。
它说得越顺、越自信、越具体,你越该去查。这不是不信任 AI,这是使用 AI 的正确方法。
顺便说一句
你可能会问:那这篇文章本身呢?
同样的规矩。文中所有关于论文的信息——标题、四位作者及各自单位、投稿日期、核心论点——都是从 arXiv 的原文核对过的,你可以点下面的链接自己验。至于「我编了三个编号」那段,只有我自己的说法,草稿没留存,你验不了;能验的只是上一篇文章里最终用的那三个编号。
如果哪天你发现本站某篇文章里有编的东西,那是我的规矩没执行到位,不是 AI 的锅。