这是 2025-2026 年 RAG 领域最大的变化之一——视觉模型取代传统文档解析器。下面深度展开。
先梳理一下这条演进的脉络,你就知道为什么视觉模型方案这么重要了。
一、传统 RAG 的「天花板」
经典 RAG Pipeline 的输入是一条文本,而不是原文档本身:
传统 RAG:
复杂 PDF → PyMuPDF/PDFPlumber → 提取文本 → 分段 → 嵌入
文档中的信息在\”提取文本\”这一步大量丢失:
✅ 纯文字 PDF → 还行
❌ 多栏布局 → 文本串成一团,语义混乱
❌ 表格 → 行列关系丢失,变成毫无意义的字符串
❌ 图表 / 流程图 / 示意图 → 完全丢失
❌ 扫描件 → 得先 OCR,还有错别字
❌ 手写标注 → 几乎没法处理
这条路径的上限,被文本提取的质量锁死了。花再多精力调分段、选模型,原始文本质量差,后面全白费。
二、视觉模型处理文档的核心思路
视觉模型(VLM,如 GPT-4o / Qwen2.5-VL / Gemini 2.5 Pro / Claude 3.5 Sonnet)可以直接把文档页面当图片看,理解的是整个页面布局。
VLM 方案:
复杂 PDF → 每页转图片 → VLM 理解图片 → 输出结构化文本/描述
↓
保留了:布局结构、表格关系、图表含义、图片中的文字
两种路线对比
传统 OCR/文本提取 VLM 文档理解
────────────────── ──────────────────
输入: PDF 文件 → 文本 每页截图
理解: 字级别的字符识别 整页布局 + 语义理解
输出: 纯文本字符序列 带结构的 Markdown/JSON
流畅: ⚠️ 支持 ✅ 原生表格/列表/层级
图表: ❌ 完全丢失 ✅ 能描述图表含义
速度: ✅ 快(毫秒级) ⚠️ 慢(1-3秒/页)
成本: ✅ 基本免费 ⚠️ 有 API 费用
三、三种具体的技术方案
方案一:VLM 替代文本提取器(最简单的改进)
这是最实用的过渡方案——不改变 Dify RAG 的整体链路,只是在预处理阶段用 VLM 替换掉 PDF 解析器。
文档 → 页转图片 → VLM 描述每页 → 得到结构化文本
→ 用传统流程:分
