【人工智能】彻底搞懂AI技术:Memory,RAG,Token,多模态
彻底搞懂AI技术:Memory,RAG,Token,多模态
- 【人工智能】彻底搞懂AI技术:Memory,RAG,Token,多模态
-
- 一. LLM的特征:多模态
- 二. LLM的局限性:健忘
- 三. 什么是记忆Memory
- 四. 两者Memory区别
- 五. 什么是RAG
- 六. 什么是Token
- 七. 模型上下文能放多少Token
一. LLM的特征:多模态
现在的大模型不仅能处理文字,还能看图、听声音、生成图片。这种能力叫「多模态」;只能纯文字的处理模型我们就叫它单模态LLM。
二. LLM的局限性:健忘
LLM是健忘的系统,或者更准确地说,在与它们交互时根本不执行任何记忆操作。 例如,当你向LLM提问后紧接着又问一个问题,它不会记得前者。
三. 什么是记忆Memory
短期记忆,也称为工作记忆,它作为(近)即时上下文的缓冲区。这包括LLM Agent最近采取的行动。启用短期记忆最直接的方法是使用模型的上下文窗口;而长期记忆,LLM Agent理论上可能需要数十甚至数百个步骤需要被记住,启用长期记忆的常见技术是将所有以前的交互、行动和对话存储在外部向量数据库中。
四. 两者Memory区别
| 实现载体 | 模型上下文窗口 (Context Window)、KV Cache、运行时内存,历史对话拼入Prompt传入模型 | 1. 参数化长期:模型训练固化在权重;2. 工程外置:向量库、SQL / 文档、知识库、知识图谱 (RAG) |
| 生命周期 | 仅限同一次会话,会话结束 / 请求销毁自动清空;超出窗口容量被截断遗忘 | 跨会话、跨日期、跨用户永久持久存储,关闭程序下次启动仍可读取 |
| 容量上限 | 受模型 token 规格限制(如 8K/32K/128K/1M),token 越多推理算力成本越高(Attention O (n²)) | 理论无上限,TB/PB 级海量数据,不受上下文约束 |
| 读取方式 | 全量拼入 Prompt,模型自注意力一次性读取,实时超快 | 先做语义 / 关键词检索→摘要压缩→再塞进上下文,多一步检索开销、速度偏慢 |
| 数据更新 | 实时追加对话,新内容不断挤占旧内容,无落地存储 | 按需归档、筛选后入库,可新增 / 修改 / 删除知识库内容,不改动模型权重 |
| 适用场景 | 本轮多轮对话连贯、链式思考CoT、临时工具返回结果、当前任务中间步骤 | 用户历史偏好、企业文档、产品手册、跨月历史聊天、静态行业知识库 |
| 遗忘规则 | 对话过长超出窗口,早期内容直接丢弃(长文易丢前面信息) | 不会自动遗忘,需人工删除才失效;可按需筛选历史入库 |
五. 什么是RAG
RAG全称是:Retrieval-Augmented Generation检索增强生成。RAG相当于AI的长期外置记忆,它可以读完你提供的资料之后再给出我们想要的答复。它解决了私域内容记不住的问题。 因为知识已经存入了向量数据库,那么在使用RAG时就可以依托真实文档作答,可溯源、不误报。
六. 什么是Token
他是AI世界里的文字最小单位,也叫做小碎片。在LLM中(GPT、文心一言、通义千问、豆包)不会一个字一个字处理文本,而是把文字切成一小段一小段,这一小段就叫Token。一个Token相当于半个到一个中文字,四个左右的英文字母。一行代码一般可以分解成3-6个Token拿来记忆。
七. 模型上下文能放多少Token
代码密度越高,Token越多。上下文窗口通常至少为8192个token,有时可以扩展到数十万个 token! 大型上下文窗口可用于跟踪作为输入提示一部分的完整对话历史。 8K Token → 能放 1500~2000 行 C 代码 32K Token → 能放 6000~8000 行 C 代码 128K Token → 能放 2~3 万行 C 代码 通过持续总结对话,我们可以保持对话规模较小。这将减少 token 数量,同时只跟踪最重要的信息。



