第13章 多模态RAG——图文检索增强生成
学习目标
13.1 RAG基础回顾
纯文本RAG
用户问题 → 文本嵌入 → 向量检索 → 召回文档片段 → LLM生成答案
为什么需要多模态RAG
很多知识存在于图表、图片、PDF扫描件中,纯文本RAG无法利用这些信息。
13.2 多模态RAG架构
三种架构
1. 文本优先
图片 → VLM描述 → 文本嵌入 → 文本向量库 → LLM
最简单,但图片信息在描述过程中有损。
2. 多模态嵌入
图片/文本 → 多模态嵌入模型 → 统一向量空间 → 检索 → LLM
无损,但需要多模态嵌入模型。
3. 原生多模态
图片




