欢迎光临
我们一直在努力

多模态大模型实战13

第13章 多模态RAG——图文检索增强生成

学习目标

  • 回顾RAG基础原理
  • 掌握多模态RAG架构(混合索引、跨模态检索)
  • 了解多模态嵌入模型
  • 端到端实战:图文混合知识库问答

  • 13.1 RAG基础回顾

    纯文本RAG

    用户问题 → 文本嵌入 → 向量检索 → 召回文档片段 → LLM生成答案

    为什么需要多模态RAG

    很多知识存在于图表、图片、PDF扫描件中,纯文本RAG无法利用这些信息。


    13.2 多模态RAG架构

    三种架构

    1. 文本优先

    图片 → VLM描述 → 文本嵌入 → 文本向量库 → LLM

    最简单,但图片信息在描述过程中有损。

    2. 多模态嵌入

    图片/文本 → 多模态嵌入模型 → 统一向量空间 → 检索 → LLM

    无损,但需要多模态嵌入模型。

    3. 原生多模态

    图片

    赞(0)
    未经允许不得转载:171主机测评 » 多模态大模型实战13
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址