班级群里 200 条未读,AI 到底在看谁说话?
2026-07-26
一句话:「注意力」(attention)是今天所有大模型的核心零件,但它做的事情简单到你每天都在做:面对一大堆信息,先扫一眼各自是讲什么的,再决定重点看哪几条。这篇文章用班级群把它讲完,最后再说一件很多科普文章会讲错的事。
反幻觉声明:注意力机制出自 2017 年的论文《Attention Is All You Need》,作者与年份已核实。文末关于「注意力权重算不算解释」的学术争论,引用了正反双方三篇有明确标题的论文。
一、你每天都在用注意力
放学回家,班级群里 200 条未读。你想知道:周五体育课要带什么?
你会怎么做?
肯定不是从第 1 条一字不落读到第 200 条。你会飞快地往下扫,眼睛只在那些看起来跟「体育课」有关的地方停一下,然后细读那两三条。
恭喜,你刚刚执行了一次注意力机制。
二、拆成三个零件
AI 干的是同一件事,只是给三个角色起了名字:
- Query(查询)——「我在找什么」。你脑子里那个搜索条件:周五、体育课、带东西。
- Key(标签)——「每条消息大概是讲什么的」。相当于每条消息贴的一张小标签:第 37 条是关于体育课的,第 38 条是关于午饭的。
- Value(内容)——「消息里到底说了啥」。真正有用的那段话:周五体育课带跳绳和运动鞋。
然后三步走:
- 拿 Query 去和每一条的 Key 比一比,算出「这条跟我要找的有多相关」
- 把这些相关度变成比例(加起来等于 1,比如第 37 条占 0.8,其它 199 条分剩下的 0.2)
- 按这个比例,把各条的 Value 加权混合起来
出来的结果,就是「我关注完这堆消息之后,脑子里剩下的东西」。
注意力机制的全部数学,就是这三步。 剩下的都是工程细节。
三、为什么这个设计这么厉害
在它出现之前(2017 年之前),主流做法是让模型按顺序一个词一个词地读,像读磁带一样。这有两个大问题:
- 慢:必须读完第 100 个词才能读第 101 个,没法并行
- 远的记不住:第 1 个词的信息传到第 500 个词那里,早就衰减得差不多了
注意力把这两个问题一起解决了:任何两个词之间都可以直接「对上眼」,不管隔多远;而且所有比对可以同时算,特别适合用显卡跑。
2017 年那篇论文的标题就很有底气——《Attention Is All You Need》(你只需要注意力)1。今天几乎所有大模型,都建立在这个零件上。
四、「多头」是什么?找不同东西的几个同学
实际用的时候不止一组 Q/K/V,而是好几组并排跑,这叫多头注意力(multi-head attention)。
还是班级群的例子:与其你一个人找,不如叫上几个同学一起——
- 同学 A 专门找「时间相关」的(周五、明天、下周)
- 同学 B 专门找「物品相关」的(带什么、要不要交钱)
- 同学 C 专门盯「谁说的」(老师说的比同学说的重要)
每个人关注的角度不一样,最后把各自找到的合起来。这就是「多头」——同时从多个角度看同一堆信息。
五、一件很多科普会讲错的事
你可能见过那种漂亮的图:一句话里的词之间连着深深浅浅的线,说这是「AI 的注意力分布」,仿佛能看到它在想什么。
这里要非常小心。
注意力权重看起来像解释,但它到底算不算解释,学界吵了很多年,而且吵得很凶:
- 2019 年 Jain 和 Wallace 发表《Attention is not Explanation》(注意力不是解释),指出注意力权重经常和其它衡量「哪个词重要」的方法对不上;他们还构造出完全不同的注意力分布却得到几乎相同输出的例子——甚至把注意力权重随机打乱,模型的输出也常常几乎不变。
- 同年 Serrano 和 Smith 的《Is Attention Interpretable?》换了个查法:把权重最高的那个位置的注意力抹成 0,再看模型的答案会不会翻。结果大多数时候都不翻;反过来,按「梯度」(另一种算重要性的方法)排出来的顺序去抹,往往更快让模型改口。他们的结论是:注意力权重只是重要性的一个有噪声的近似,不能拿它当模型做判断的依据。
- 但也有反方:Wiegreffe 和 Pinter 的《Attention is not not Explanation》(注意力不是不是解释,标题就是在回怼)认为,注意力单独看确实不够,但结合其它方法一起看仍然有意义。
还有研究发现,模型的注意力经常大量落在标点符号和分隔符这类看起来毫无意义的位置上2。
所以正确的说法是:
注意力权重告诉你信息是怎么流动的,但不等于告诉你模型为什么这么答。
看到注意力热力图时,把它当成一张「线路图」,别当成「口供」。
六、小结
| 概念 | 大白话 | 一句话记住 |
|---|---|---|
| Query | 我在找什么 | 你的搜索条件 |
| Key | 每条内容的标签 | 贴在消息上的便签 |
| Value | 内容本身 | 真正要用的那段话 |
| 注意力权重 | 每条该分多少注意力 | 加起来等于 1 的比例 |
| 多头 | 几个人从不同角度同时找 | 分工协作 |
下一篇我们把注意力放回它所在的那条完整流水线里——Transformer。你会发现一个很多文章都讲错的点:Transformer 并不等于注意力,它还有好几个同样关键的零件。