欢迎光临
我们一直在努力

多模态 Embedding:图片也能变成向量吗

多模态 Embedding 把文字、图片、表格等不同形态的内容映射到同一套向量空间,让它们能够互相比较。图片确实可以变成向量。一个核心判断是:知识不只在字里,也在图里,多模态能力在很大程度上影响语义检索的覆盖范围。

什么是 Embedding

Embedding 把一段内容压缩成一串固定长度的数字,这串数字叫向量。两个向量在空间中离得近,代表它们语义相近。传统全文检索靠关键词命中,用 BM25 按词频和逆文档频率打分,主要抓字面匹配的词。向量检索改用余弦相似度,抓的是含义接近的内容,用户换个说法通常仍能命中。

这套做法有清晰的演进脉络。早年的词袋模型只统计词出现次数,近义词之间难以建立关联。Word2Vec 让含义相近的词向量自然靠近。BERT 引入上下文,同一个词在不同句子里有不同的向量。多模态把这套机制从纯文本扩展到图像与表格。向量维度常见为数百至上千维,以 float32 存储时单条占用一定空间。

多模态 Embedding 的原理

视觉编码器(如 ViT,把图片切成小块逐个编码)和文本编码器(基于 Transformer)各自处理自己的输入,再通过对比学习把两者的输出拉进同一个向量空间。训练时,一张电路板照片和它对应的文字描述被拉近,和无关内容推远。CLIP 是这类模型的代表之一,发布后在多模态检索领域被广泛引用。

对齐完成后,你拿一段“设备外壳出现裂纹”的文字去搜,有可能直接命中一张没写任何字的现场照片。这里有个工程上的要点:向量空间是模型训练出来的产物,换模型意味着全部向量要重算,这跟改个配置参数完全两回事。

企业知识为什么卡在图里

部分制造业与金融业文档以图片或扫描件形式存在。这些内容的文字没有被提取出来,纯文本检索往往难以覆盖。

一个具体例子能说明缺口在哪。一张增值税发票扫描件,供应商名称、税号、金额、开票日期都印在固定版式上,人一眼能读,关键词搜索引擎通常难以检索到,除非先把图里的字提取出来。有些企业知识沉淀的盲区,往往就藏在这类图里。

原生多模态与解析后嵌入

落地路径一是原生多模态,直接用视觉语言模型把图片整体编码成向量,版面、颜色、图表结构都进入向量。用户搜"红色告警柱状图",有可能命中对应的监控截图。代价是这类模型选择少、推理吃算力、部署成本高。

路径二是解析后嵌入,先用 OCR 或文档解析把图片里的文字与表格抽出来,再把抽出的文本当作普通段落去向量化。这套复用成熟的文本管线,可控且工程简单,缺点是丢了视觉特征,搜"和这个 logo 长得像的图"难以实现。两条路按业务是否依赖视觉特征来选,各自覆盖不同的需求。

三个常见误区

第一个误区,以为所有 Embedding 模型都支持多模态。BGE-M3 这类主流文本模型通常用于处理文字,直接输入图片时可能无法处理,或被忽略。

第二个误区,以为图片向量和文本向量天然可比。它们必须来自同一个经过对齐训练的模型空间。文本模型产出的向量和视觉模型产出的向量放进一个库,可能彼此偏离,影响检索结果。

第三个误区,以为把两路分数拼起来就是混合检索。余弦相似度落在 [-1,1],BM25 分数没有上界,直接加权相加可能被数值大的那一路主导,本该命中的文本片段可能排到后面。

小艾智能体如何接住图里的知识

小艾智能体的文档处理引擎可覆盖 PDF、Word、Excel、CSV、TXT、MD、HTML 与图片,可自动识别类型并提取原始文本。图片与扫描件可先经过解析,内容可被切分为语义片段,再通过 BGE-M3 转换为向量存入 Milvus,与文本片段进入同一个库。

混合检索时系统可不区分来源,一张发票扫描件和一段说明书文字可按同一套相似度参与排序。知识图谱系统可补充一层实体与关系,将“某设备型号、所在图纸、对应供应商”关联为网络。配置化的 Agent 工作流可支持将检索图纸、提取参数、生成报告与邮件发出的步骤串联为自动化流程,有助于将图里的知识转化为业务动作。

赞(0)
未经允许不得转载:171主机测评 » 多模态 Embedding:图片也能变成向量吗
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址