Embedding 模型怎么选?维度、兼容性、换模型成本与评测验证(RAG 地基篇)
前言
RAG 检索的地基是 Embedding:文字变坐标,所有相似度计算都建立在坐标上。模型选不好,切块、混合检索、重排全是白搭。这篇讲选型五观察点、换模型的真实代价(全库重嵌)、怎么用评测集验证,以及配置驱动的工程做法。
一、它决定"什么算相似"
文字变坐标的原理此前专门写过(把文字变成坐标的魔法),不重讲。带走一句就够:检索效果的上限,在选模型这一刻就定了——"电脑坏了"和"设备故障"是不是近邻,不同模型答案不同,而全部检索都建立在这个答案上。
二、选型五观察点
| 语言匹配 | 中文场景选中文语料多的模型,国际榜单高分不等于中文好用 |
| 维度 | 1024 上下起步;越高表达越强、存储计算越贵;维度牵动向量列宽 |
| 领域贴合 | 通用文档用通用模型,医疗/法律/金融有专用增强版 |
| 兼容性 | 有的云不接受维度参数——工程上要兼容两种请求路径,接入姿势算进成本 |
| 成本速度 | 全库向量化按量付费,批量吞吐决定入库时长 |
三、换模型的代价:全库重嵌
换模型 = 坐标体系变了 = 库里所有旧向量作废,几万块向量重新生成。钱、时间、期间检索质量波动全要算。所以排查顺序里它排在后面(见前篇《问法的错》):收益上限最高、代价也最大。选型一次选对,别频繁换。
四、验证:评测集说话
固定几十个真实问题、标好标准出处;候选模型各跑一遍,比召回率(正确片段进没进前排)和排名。评测集同时是升级体检表:换模型前后各跑一遍,跌了就不动。不看榜单感觉,看自己的数据。
五、工程做法
六、三个常见误区
总结
口诀:五看选型(语言/维度/领域/兼容/成本),换模型=全库重嵌,评测集说话;配置驱动切换,维度牵动表设计。
下一篇:RAG 进阶最后一个盲区——多模态,怎么让大模型看懂 PDF 和图片。
你的 Embedding 选了哪家?评论区聊聊。


