欢迎光临
我们一直在努力

【人工智能】彻底搞懂AI技术:Memory,RAG,Token,多模态

【人工智能】彻底搞懂AI技术:Memory,RAG,Token,多模态

彻底搞懂AI技术:Memory,RAG,Token,多模态

  • 【人工智能】彻底搞懂AI技术:Memory,RAG,Token,多模态
    • 一. LLM的特征:多模态
    • 二. LLM的局限性:健忘
    • 三. 什么是记忆Memory
    • 四. 两者Memory区别
    • 五. 什么是RAG
    • 六. 什么是Token
    • 七. 模型上下文能放多少Token

一. LLM的特征:多模态

现在的大模型不仅能处理文字,还能看图、听声音、生成图片。这种能力叫「多模态」;只能纯文字的处理模型我们就叫它单模态LLM。

  • 不同模态数据(图 / 音 / 字)各自经过 编码器(Encoder)转为统一维度特征向量;
  • 映射到大模型共用的语义空间;
  • 共用Transformer主干做理解、生成文字/画图。
  • 二. LLM的局限性:健忘

    LLM是健忘的系统,或者更准确地说,在与它们交互时根本不执行任何记忆操作。 例如,当你向LLM提问后紧接着又问一个问题,它不会记得前者。

    三. 什么是记忆Memory

    短期记忆,也称为工作记忆,它作为(近)即时上下文的缓冲区。这包括LLM Agent最近采取的行动。启用短期记忆最直接的方法是使用模型的上下文窗口;而长期记忆,LLM Agent理论上可能需要数十甚至数百个步骤需要被记住,启用长期记忆的常见技术是将所有以前的交互、行动和对话存储在外部向量数据库中。

    四. 两者Memory区别

    对比维度短期记忆(Short-term / 上下文记忆)长期记忆(Long-term)
    实现载体 模型上下文窗口 (Context Window)、KV Cache、运行时内存,历史对话拼入Prompt传入模型 1. 参数化长期:模型训练固化在权重;2. 工程外置:向量库、SQL / 文档、知识库、知识图谱 (RAG)
    生命周期 仅限同一次会话,会话结束 / 请求销毁自动清空;超出窗口容量被截断遗忘 跨会话、跨日期、跨用户永久持久存储,关闭程序下次启动仍可读取
    容量上限 受模型 token 规格限制(如 8K/32K/128K/1M),token 越多推理算力成本越高(Attention O (n²)) 理论无上限,TB/PB 级海量数据,不受上下文约束
    读取方式 全量拼入 Prompt,模型自注意力一次性读取,实时超快 先做语义 / 关键词检索→摘要压缩→再塞进上下文,多一步检索开销、速度偏慢
    数据更新 实时追加对话,新内容不断挤占旧内容,无落地存储 按需归档、筛选后入库,可新增 / 修改 / 删除知识库内容,不改动模型权重
    适用场景 本轮多轮对话连贯、链式思考CoT、临时工具返回结果、当前任务中间步骤 用户历史偏好、企业文档、产品手册、跨月历史聊天、静态行业知识库
    遗忘规则 对话过长超出窗口,早期内容直接丢弃(长文易丢前面信息) 不会自动遗忘,需人工删除才失效;可按需筛选历史入库

    五. 什么是RAG

    RAG全称是:Retrieval-Augmented Generation检索增强生成。RAG相当于AI的长期外置记忆,它可以读完你提供的资料之后再给出我们想要的答复。它解决了私域内容记不住的问题。 因为知识已经存入了向量数据库,那么在使用RAG时就可以依托真实文档作答,可溯源、不误报。

  • 知识库预处理:PDF / 文档 / 代码 / 手册 → 切片 → 向量编码 → 存入向量数据库(长期记忆)
  • 用户提问:问题转向量,去库搜相似文档片段
  • 检索内容 + 用户问题一起塞进Prompt,交给LLM生成答案
  • 六. 什么是Token

    他是AI世界里的文字最小单位,也叫做小碎片。在LLM中(GPT、文心一言、通义千问、豆包)不会一个字一个字处理文本,而是把文字切成一小段一小段,这一小段就叫Token。一个Token相当于半个到一个中文字,四个左右的英文字母。一行代码一般可以分解成3-6个Token拿来记忆。

    七. 模型上下文能放多少Token

    代码密度越高,Token越多。上下文窗口通常至少为8192个token,有时可以扩展到数十万个 token! 大型上下文窗口可用于跟踪作为输入提示一部分的完整对话历史。 8K Token → 能放 1500~2000 行 C 代码 32K Token → 能放 6000~8000 行 C 代码 128K Token → 能放 2~3 万行 C 代码 通过持续总结对话,我们可以保持对话规模较小。这将减少 token 数量,同时只跟踪最重要的信息。

    赞(0)
    未经允许不得转载:171主机测评 » 【人工智能】彻底搞懂AI技术:Memory,RAG,Token,多模态
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址