AI 的「记性」其实有四种,完全不是一回事

2026-07-26

← AI 与大模型

一句话:训练结束后,AI 模型的「脑子」就冻住了——你跟它说的任何话都不会改变它。所谓「它记得我」,其实是四种完全不同的机制在起作用,每一种的有效期、存放位置和失败方式都不一样。分不清这四样,你就会一会儿觉得它神通广大,一会儿又觉得它蠢得离谱。

反幻觉声明:本文涉及的三项技术均标注了原始论文(RAG、KV 缓存/PagedAttention、以及长上下文的位置效应),作者、年份、核心结论都从 arXiv 原文页核实过。文中没有引用任何厂商未公开验证的性能数字。

一、先破一个最大的误会

很多人以为:跟 AI 聊得越多,它就越了解你,像朋友一样慢慢「学会」你。

这是错的。

一个 AI 模型训练完成之后,它的参数(可以理解成「脑子里的连接方式」)就固定住了。你跟它聊一万句,它的参数一个都不会变。

那为什么它有时候确实”记得”事情?

因为有人在你看不见的地方,把资料重新塞回给它

二、四种「记性」,四种完全不同的东西

上下文、KV 缓存、检索、长期记忆——四种机制的位置、有效期和失败方式各不相同

① 上下文 = 摊开的书桌

上下文(context)就是这次对话里的所有文字:你发的每一句、它回的每一句,全都摊在一张「桌子」上。它每次回答,都会把整张桌子重新看一遍。

「怎么上一轮说过的事它就忘了」——多半就是桌子被收了,或者太长被挤掉了。

② KV 缓存 = 随手记的速记本

这个最容易被误解。

模型每写一个字,理论上都要把桌上所有资料重算一遍——太慢了。于是它把算过的中间结果暂存起来,下一个字直接用,这就是 KV 缓存(KV cache)。

这项技术之所以重要,是因为这个缓存非常占内存,而且长度会动态变化,管不好就浪费大量显存。2023 年有篇很有影响的论文(就是 vLLM 那套)专门解决这个问题,做法是把操作系统管内存的「分页」思路搬过来,让缓存的浪费接近零,吞吐量提升到原来的 2–4 倍1

但请记住关键一点

KV 缓存纯粹是为了快,它不增加任何新知识,也不会让模型「记住」什么。它是草稿纸,不是笔记本。

不过它的存活期这些年变了。早期确实是一次回答用完就扔;现在 Anthropic、OpenAI、Google 都把它做成了明码标价的正式功能,叫 prompt caching(提示词缓存)——干的事就是把这份算好的 KV 跨请求留着,你下次发来开头一模一样的内容,直接读缓存,不用重算。

存活期因此分出了三档:一次回答之内(用完即扔)→ 几分钟到一小时(Anthropic 的缓存默认存 5 分钟,也可以选 1 小时;Google 的默认存 1 小时)→ 跨请求复用(只要开头对得上就能命中,哪怕是另一次对话)。省下的是真金白银:Anthropic 那边,往缓存里写一次按基础输入价的 1.25 倍收费(要存 1 小时就按 2 倍),之后每次读缓存只收 0.1 倍,便宜 90%;OpenAI 那边是自动开的,不用你改代码2

存活期变长了,性质没变:缓存里存的还是算好的中间结果,不是新知识。放了一小时没扔的草稿纸,也还是草稿纸。

③ 检索(RAG)= 临时跑一趟图书馆

如果你想让 AI 回答「我们学校请假要走什么流程」,而校规根本不在它的训练数据里,怎么办?

办法是:先去找,再回答。系统先从一个外部资料库里搜出最相关的几段,搬到桌上,然后连同你的问题一起交给模型。

这套做法叫 RAG(检索增强生成),2020 年由 Lewis 等十二位研究者提出3。论文里的说法很精确:把模型自己的「参数化记忆」和外部的「非参数化记忆」结合起来——翻译成大白话就是:脑子里记不住的,就去书架上找

RAG 的好处是知识在模型外面,随时能更新(校规改了,换掉那份文件就行,不用重新训练模型)。

它的失败方式也很明确:可能找错书。搜出来的段落不对,后面答得再流畅也是错的。

④ 长期记忆 = 你的个人档案袋

「这个人是初二学生」「他不喜欢长篇大论」——这类关于的事实,被单独存进一个数据库。你每次提问,系统悄悄把它拼在你的问题前面。

所以「AI 记住我了」的真相是:

有个程序把你的资料存在别处,每次你提问时,把它重新喂给那个什么都不记得的模型。

三、一次问答里,四者分别在哪一步

一次「请假流程」问答中四种记忆的登场顺序,以及对话结束后各自的命运

对话结束后的命运完全不同,这张表最值得记住:

存在哪 对话关掉后 典型失败
① 上下文 这次请求里 全部清空 太长被挤掉、位置不好被忽略
② KV 缓存 显存里 默认立刻丢弃;开了 prompt caching 能留 5 分钟到 1 小时 只影响速度和成本,不影响对错
③ 检索库 外部数据库 原地不动 搜错段落,答案跟着错
④ 长期记忆 外部数据库 留下来 记了过时的事、或该记的没记

四、四个常见误解

误解 1:「上下文窗口越大=记性越好」

不对。桌子更大,不等于你能同时看清桌上每一样东西。2023 年斯坦福等机构的研究发现了一个著名现象:关键信息放在长文档的开头或结尾时模型表现最好,放在中间时性能明显下降——论文标题就叫《Lost in the Middle》(迷失在中间)4。这个问题在专门为长上下文设计的模型上同样存在。

误解 2:「KV 缓存是它的记忆库」

不对。它是草稿纸,不含任何你以为的「记住的知识」。开了 prompt caching 之后它能多留几分钟到一小时,但留下来的只是「算过一遍的中间结果」,跟「学会了什么」没有半点关系。

误解 3:「有了 RAG 就不会胡说了」

不对。RAG 能降低胡说的概率,因为它给了模型真实材料。但如果检索这一步找错了段落,模型会基于错误材料流畅地胡说——有时反而更难识破,因为它还煞有介事地引了「出处」。

误解 4:「它记住我,说明它学会我了」

不对。模型参数没变一个数。变的是每次发给它的那包资料。你随时可以删掉那个档案,它就立刻「失忆」——这也是为什么各家 AI 产品都能让你一键清除记忆。

五、这对你实际有什么用