Transformer 不是一个机器人,是一条流水线
2026-07-26
一句话:Transformer 是今天几乎所有大模型的骨架。它不是什么神秘的「电子大脑」,而是一条把同样几道工序重复几十遍的流水线。上一篇讲的注意力只是其中一道——而且如果只有它,模型连词的先后顺序都分不清。
反幻觉声明:架构描述基于 2017 年的原始论文《Attention Is All You Need》(作者、年份已核实)。本文不涉及任何厂商未公开的实现细节,也不引用未经核实的参数规模。
一、先看一条流水线
你可以把 Transformer 想成工厂里的一条传送带。文字从这头进去,经过几道固定的工序,重复很多遍,最后从那头出来一个预测:下一个词最可能是什么。
二、进厂前的两步准备
第一步,切词。 上一篇讲过:文字先被切成一块块 token(文字积木)。
第二步,变成数字。 每块积木被换成一串数字(几百到几千个数)。这串数字就是这个词的「坐标」——意思相近的词,坐标也靠得近。
到这里为止都还好懂。接下来是最容易被漏讲、但极其关键的第三步。
三、关键:注意力根本不知道谁在前谁在后
这是这篇文章最想让你记住的一点。
上一篇说,注意力做的事是「拿我在找什么,去和每一条的标签比一比」。
请你仔细想想这个操作:它跟顺序有关系吗?
没有。 比对第 1 条和比对第 100 条,用的是完全一样的算法,谁先谁后完全不影响结果。
也就是说,注意力这个零件本身对顺序视而不见:你把词的顺序打乱,它算出来的东西也只是跟着换个位置,内容一点没变。所以单看这一步,这两句话没有任何区别:
今天我请你 / 今天你请我
同样的词、同样的数量,只是顺序不同。
所以必须额外给每块积木加一个「位置信息」,明确告诉模型「你是第 3 个」「你是第 7 个」。这一步叫位置编码(positional encoding)。
少了它,注意力这一步就只会看「有哪些词」、不会看「什么顺序」。这也是为什么说「Transformer 就是注意力」是错的。
不过这里得补一句实话。 今天的大模型基本都是「只准往前看」的:第 3 个词只能看第 1、2、3 个,看不到后面。这条规矩叫因果掩码(causal mask)。光是这条规矩本身就已经漏进了一点顺序信息——每个词能看到几个人,其实就暗示了它排第几。实验也确实发现,这类模型哪怕一点位置编码都不加,也能自己摸索出位置感1。所以更准确的说法是:「完全分不清顺序」说的是注意力这个零件本身,而不是整个模型。但结论不变——现役模型没有一个真的裸奔,因为靠掩码硬猜出来的那点顺序感又弱又不好使。
还有一件事,和大多数流水线图画的不一样。 2017 年原始论文的做法是:进入这几十层之前,给每块积木一次性加上一串表示位置的数字(正弦编码),加完就不管了。今天主流模型换了个做法,叫 RoPE(旋转位置编码)——它不在入口加,而是在每一层的注意力里动手:把参与比对的那两串数字按「你排第几」转一个角度,位置越靠后转得越多。Llama、Qwen、Gemma、DeepSeek 这些现役模型用的都是这一类2。所以上面那张图里的「加位置」只是个示意,真实情况是每一层都要再来一遍。
四、一层里面发生什么
准备好之后,数据进入层。每一层做两件事,然后这一整层会重复几十次。
① 注意力:大家互相看一眼
每块积木去看看别的积木,决定「我该参考谁」。这一步的本质是交流——让每个词的表示里融进上下文的信息。
同一个「苹果」,在「苹果很好吃」和「苹果发布会」里,经过这一步之后就变成了两个不同的东西。
② 前馈网络:各自回去消化
交流完,每块积木单独再做一遍加工,这次不看别人。这一步叫前馈网络(FFN),本质是独立思考。
这里有个反直觉的事实:前馈网络的参数量通常比注意力还大。很多研究认为模型「记住的知识」主要就存在这部分里。所以「Transformer 的核心是注意力」这个说法,连在参数占比上都站不住。
③ + ④ 两个保命零件
- 残差连接:每做完一道工序,把「加工前的原样」也一并带到下一步。好比抄作业时保留原稿——万一这步加工搞砸了,还有原件兜底。没有它,几十层堆下去信息会越传越糊。
- 归一化:每步之后把数值拉回正常范围,防止数字越滚越大或越缩越小。
这两个零件不产生新信息,但没有它们,深层网络根本训练不起来。
五、然后重复几十次
上面这一整套(注意力 → 前馈 → 残差 → 归一化)会原样重复几十遍。
- 浅层:处理比较表面的东西,比如词性、搭配
- 深层:处理比较抽象的东西,比如指代、逻辑关系
最后一层出来,接一个输出,给出「下一个词是什么」的概率分布。然后挑一个词,把它接到后面,整条流水线再跑一遍——一个字一个字地,就这么写出来了。
六、为什么这个设计赢了
2017 年之前的主流做法要按顺序一个词一个词读,没法并行。Transformer 把这件事变成了「所有词同时比对」3,特别适合显卡这种「一次算一大批」的硬件。
能并行 → 能用更多显卡 → 能训练更大的模型 → 效果更好。
这条路径基本解释了过去这些年 AI 的爆发。不是某个算法突然变聪明了,而是一个可以无限加机器的架构被找到了。
七、小结
| 零件 | 干什么 | 少了会怎样 |
|---|---|---|
| 切词 + 向量 | 把文字变成数字 | 模型读不了文字 |
| 位置编码 | 告诉模型谁在前谁在后 | 注意力这一步只剩「有哪些词」,「我请你」和「你请我」没区别 |
| 注意力 | 词之间互相交流 | 每个词只能孤立理解 |
| 前馈网络 | 各自独立加工(参数量最大) | 没地方存知识 |
| 残差连接 | 保留原样一起传下去 | 层一深信息就糊 |
| 归一化 | 把数值拉回正常范围 | 训练直接崩 |
| 重复几十层 | 从表面特征到抽象关系 | 只能学到浅层规律 |
下次再看到「Transformer 就是注意力机制」这种说法,你可以补一句:那它怎么知道词的顺序呢?