Transformer 不是一个机器人,是一条流水线

2026-07-26

← AI 与大模型

一句话:Transformer 是今天几乎所有大模型的骨架。它不是什么神秘的「电子大脑」,而是一条把同样几道工序重复几十遍的流水线。上一篇讲的注意力只是其中一道——而且如果只有它,模型连词的先后顺序都分不清。

反幻觉声明:架构描述基于 2017 年的原始论文《Attention Is All You Need》(作者、年份已核实)。本文不涉及任何厂商未公开的实现细节,也不引用未经核实的参数规模。

一、先看一条流水线

你可以把 Transformer 想成工厂里的一条传送带。文字从这头进去,经过几道固定的工序,重复很多遍,最后从那头出来一个预测:下一个词最可能是什么

Transformer 的完整流水线:切词、变数字、加位置、然后是重复几十次的注意力+前馈层。图里把「加位置」画在入口、只做一次,那是 2017 年原始论文的做法;今天主流模型改成了每一层都做一次,见第三节

二、进厂前的两步准备

第一步,切词。 上一篇讲过:文字先被切成一块块 token(文字积木)。

第二步,变成数字。 每块积木被换成一串数字(几百到几千个数)。这串数字就是这个词的「坐标」——意思相近的词,坐标也靠得近。

到这里为止都还好懂。接下来是最容易被漏讲、但极其关键的第三步

三、关键:注意力根本不知道谁在前谁在后

这是这篇文章最想让你记住的一点。

上一篇说,注意力做的事是「拿我在找什么,去和每一条的标签比一比」。

请你仔细想想这个操作:它跟顺序有关系吗?

没有。 比对第 1 条和比对第 100 条,用的是完全一样的算法,谁先谁后完全不影响结果。

也就是说,注意力这个零件本身对顺序视而不见:你把词的顺序打乱,它算出来的东西也只是跟着换个位置,内容一点没变。所以单看这一步,这两句话没有任何区别:

今天 / 今天

同样的词、同样的数量,只是顺序不同。

所以必须额外给每块积木加一个「位置信息」,明确告诉模型「你是第 3 个」「你是第 7 个」。这一步叫位置编码(positional encoding)。

少了它,注意力这一步就只会看「有哪些词」、不会看「什么顺序」。这也是为什么说「Transformer 就是注意力」是错的。

不过这里得补一句实话。 今天的大模型基本都是「只准往前看」的:第 3 个词只能看第 1、2、3 个,看不到后面。这条规矩叫因果掩码(causal mask)。光是这条规矩本身就已经漏进了一点顺序信息——每个词能看到几个人,其实就暗示了它排第几。实验也确实发现,这类模型哪怕一点位置编码都不加,也能自己摸索出位置感1。所以更准确的说法是:「完全分不清顺序」说的是注意力这个零件本身,而不是整个模型。但结论不变——现役模型没有一个真的裸奔,因为靠掩码硬猜出来的那点顺序感又弱又不好使。

还有一件事,和大多数流水线图画的不一样。 2017 年原始论文的做法是:进入这几十层之前,给每块积木一次性加上一串表示位置的数字(正弦编码),加完就不管了。今天主流模型换了个做法,叫 RoPE(旋转位置编码)——它不在入口加,而是在每一层的注意力里动手:把参与比对的那两串数字按「你排第几」转一个角度,位置越靠后转得越多。Llama、Qwen、Gemma、DeepSeek 这些现役模型用的都是这一类2。所以上面那张图里的「加位置」只是个示意,真实情况是每一层都要再来一遍

四、一层里面发生什么

准备好之后,数据进入。每一层做两件事,然后这一整层会重复几十次。

① 注意力:大家互相看一眼

每块积木去看看别的积木,决定「我该参考谁」。这一步的本质是交流——让每个词的表示里融进上下文的信息。

同一个「苹果」,在「苹果很好吃」和「苹果发布会」里,经过这一步之后就变成了两个不同的东西。

② 前馈网络:各自回去消化

交流完,每块积木单独再做一遍加工,这次不看别人。这一步叫前馈网络(FFN),本质是独立思考

这里有个反直觉的事实:前馈网络的参数量通常比注意力还大。很多研究认为模型「记住的知识」主要就存在这部分里。所以「Transformer 的核心是注意力」这个说法,连在参数占比上都站不住。

③ + ④ 两个保命零件

这两个零件不产生新信息,但没有它们,深层网络根本训练不起来

五、然后重复几十次

上面这一整套(注意力 → 前馈 → 残差 → 归一化)会原样重复几十遍

最后一层出来,接一个输出,给出「下一个词是什么」的概率分布。然后挑一个词,把它接到后面,整条流水线再跑一遍——一个字一个字地,就这么写出来了。

六、为什么这个设计赢了

2017 年之前的主流做法要按顺序一个词一个词读,没法并行。Transformer 把这件事变成了「所有词同时比对」3,特别适合显卡这种「一次算一大批」的硬件。

能并行 → 能用更多显卡 → 能训练更大的模型 → 效果更好。

这条路径基本解释了过去这些年 AI 的爆发。不是某个算法突然变聪明了,而是一个可以无限加机器的架构被找到了。

七、小结

零件 干什么 少了会怎样
切词 + 向量 把文字变成数字 模型读不了文字
位置编码 告诉模型谁在前谁在后 注意力这一步只剩「有哪些词」,「我请你」和「你请我」没区别
注意力 词之间互相交流 每个词只能孤立理解
前馈网络 各自独立加工(参数量最大) 没地方存知识
残差连接 保留原样一起传下去 层一深信息就糊
归一化 把数值拉回正常范围 训练直接崩
重复几十层 从表面特征到抽象关系 只能学到浅层规律

下次再看到「Transformer 就是注意力机制」这种说法,你可以补一句:那它怎么知道词的顺序呢?