AI 的「记性」其实有四种,完全不是一回事
2026-07-26
一句话:训练结束后,AI 模型的「脑子」就冻住了——你跟它说的任何话都不会改变它。所谓「它记得我」,其实是四种完全不同的机制在起作用,每一种的有效期、存放位置和失败方式都不一样。分不清这四样,你就会一会儿觉得它神通广大,一会儿又觉得它蠢得离谱。
反幻觉声明:本文涉及的三项技术均标注了原始论文(RAG、KV 缓存/PagedAttention、以及长上下文的位置效应),作者、年份、核心结论都从 arXiv 原文页核实过。文中没有引用任何厂商未公开验证的性能数字。
一、先破一个最大的误会
很多人以为:跟 AI 聊得越多,它就越了解你,像朋友一样慢慢「学会」你。
这是错的。
一个 AI 模型训练完成之后,它的参数(可以理解成「脑子里的连接方式」)就固定住了。你跟它聊一万句,它的参数一个都不会变。
那为什么它有时候确实”记得”事情?
因为有人在你看不见的地方,把资料重新塞回给它。
二、四种「记性」,四种完全不同的东西
① 上下文 = 摊开的书桌
上下文(context)就是这次对话里的所有文字:你发的每一句、它回的每一句,全都摊在一张「桌子」上。它每次回答,都会把整张桌子重新看一遍。
- 桌子有大小上限(就是你常听到的「20 万 token」「100 万 token」)
- 关掉对话 = 收桌子,下次开新对话,桌上空空如也
「怎么上一轮说过的事它就忘了」——多半就是桌子被收了,或者太长被挤掉了。
② KV 缓存 = 随手记的速记本
这个最容易被误解。
模型每写一个字,理论上都要把桌上所有资料重算一遍——太慢了。于是它把算过的中间结果暂存起来,下一个字直接用,这就是 KV 缓存(KV cache)。
这项技术之所以重要,是因为这个缓存非常占内存,而且长度会动态变化,管不好就浪费大量显存。2023 年有篇很有影响的论文(就是 vLLM 那套)专门解决这个问题,做法是把操作系统管内存的「分页」思路搬过来,让缓存的浪费接近零,吞吐量提升到原来的 2–4 倍1。
但请记住关键一点:
KV 缓存纯粹是为了快,它不增加任何新知识,也不会让模型「记住」什么。它是草稿纸,不是笔记本。
不过它的存活期这些年变了。早期确实是一次回答用完就扔;现在 Anthropic、OpenAI、Google 都把它做成了明码标价的正式功能,叫 prompt caching(提示词缓存)——干的事就是把这份算好的 KV 跨请求留着,你下次发来开头一模一样的内容,直接读缓存,不用重算。
存活期因此分出了三档:一次回答之内(用完即扔)→ 几分钟到一小时(Anthropic 的缓存默认存 5 分钟,也可以选 1 小时;Google 的默认存 1 小时)→ 跨请求复用(只要开头对得上就能命中,哪怕是另一次对话)。省下的是真金白银:Anthropic 那边,往缓存里写一次按基础输入价的 1.25 倍收费(要存 1 小时就按 2 倍),之后每次读缓存只收 0.1 倍,便宜 90%;OpenAI 那边是自动开的,不用你改代码2。
但存活期变长了,性质没变:缓存里存的还是算好的中间结果,不是新知识。放了一小时没扔的草稿纸,也还是草稿纸。
③ 检索(RAG)= 临时跑一趟图书馆
如果你想让 AI 回答「我们学校请假要走什么流程」,而校规根本不在它的训练数据里,怎么办?
办法是:先去找,再回答。系统先从一个外部资料库里搜出最相关的几段,搬到桌上,然后连同你的问题一起交给模型。
这套做法叫 RAG(检索增强生成),2020 年由 Lewis 等十二位研究者提出3。论文里的说法很精确:把模型自己的「参数化记忆」和外部的「非参数化记忆」结合起来——翻译成大白话就是:脑子里记不住的,就去书架上找。
RAG 的好处是知识在模型外面,随时能更新(校规改了,换掉那份文件就行,不用重新训练模型)。
它的失败方式也很明确:可能找错书。搜出来的段落不对,后面答得再流畅也是错的。
④ 长期记忆 = 你的个人档案袋
「这个人是初二学生」「他不喜欢长篇大论」——这类关于你的事实,被单独存进一个数据库。你每次提问,系统悄悄把它拼在你的问题前面。
所以「AI 记住我了」的真相是:
有个程序把你的资料存在别处,每次你提问时,把它重新喂给那个什么都不记得的模型。
三、一次问答里,四者分别在哪一步
对话结束后的命运完全不同,这张表最值得记住:
| 存在哪 | 对话关掉后 | 典型失败 | |
|---|---|---|---|
| ① 上下文 | 这次请求里 | 全部清空 | 太长被挤掉、位置不好被忽略 |
| ② KV 缓存 | 显存里 | 默认立刻丢弃;开了 prompt caching 能留 5 分钟到 1 小时 | 只影响速度和成本,不影响对错 |
| ③ 检索库 | 外部数据库 | 原地不动 | 搜错段落,答案跟着错 |
| ④ 长期记忆 | 外部数据库 | 留下来 | 记了过时的事、或该记的没记 |
四、四个常见误解
误解 1:「上下文窗口越大=记性越好」
不对。桌子更大,不等于你能同时看清桌上每一样东西。2023 年斯坦福等机构的研究发现了一个著名现象:关键信息放在长文档的开头或结尾时模型表现最好,放在中间时性能明显下降——论文标题就叫《Lost in the Middle》(迷失在中间)4。这个问题在专门为长上下文设计的模型上同样存在。
误解 2:「KV 缓存是它的记忆库」
不对。它是草稿纸,不含任何你以为的「记住的知识」。开了 prompt caching 之后它能多留几分钟到一小时,但留下来的只是「算过一遍的中间结果」,跟「学会了什么」没有半点关系。
误解 3:「有了 RAG 就不会胡说了」
不对。RAG 能降低胡说的概率,因为它给了模型真实材料。但如果检索这一步找错了段落,模型会基于错误材料流畅地胡说——有时反而更难识破,因为它还煞有介事地引了「出处」。
误解 4:「它记住我,说明它学会我了」
不对。模型参数没变一个数。变的是每次发给它的那包资料。你随时可以删掉那个档案,它就立刻「失忆」——这也是为什么各家 AI 产品都能让你一键清除记忆。
五、这对你实际有什么用
- 重要信息放开头或结尾,别埋在一长段中间(第 3 条研究直接支持这一点)
- 换新对话前,把关键结论复制一份——桌子要被收了
- 它突然”忘了”很正常,不是坏了;重发一次关键信息通常立刻恢复
- 它引用的出处要点开看,尤其当它用了检索——找错书是 RAG 最典型的翻车方式
- 在意隐私就去清记忆:那是一个外部数据库里的条目,删了就是真删了