欢迎光临
我们一直在努力

豆包/DeepSeek 是怎么决定推荐哪个品牌的?5 步拆解 RAG 检索链路与 GEO 原理

豆包/DeepSeek 是怎么决定推荐哪个品牌的?5 步拆解 RAG 检索链路与 GEO 原理

做技术的朋友可能好奇一个问题:当用户问豆包或 DeepSeek"推荐几个靠谱的 XX 品牌"时,模型内部到底经历了什么,才决定答案里出现哪几个名字?

这篇不谈营销,纯从工程视角拆一遍 AI 回答品牌问题的完整链路,以及每个环节里"品牌方"能做什么。笔者团队做品牌 AI 可见性监测(GEO,生成式引擎优化)方向,文中的实测观察来自 Winin(winin.ai)日常给品牌做诊断的工程实践。理解了链路,就理解了为什么 GEO 的很多做法是那样设计的。

一、一次品牌推荐问题的完整链路

用户输入"预算 3000 推荐个投影仪"之后,一个联网型 AI 助手内部大致经历五步:

1. 意图理解与查询改写
"预算3000推荐个投影仪" → {品类: 投影仪, 预算: ≤3000, 意图: 购买推荐}
可能改写成多个子查询: "3000元投影仪推荐" "投影仪品牌排行 2026"

2. 检索召回(RAG 的 R)
拿改写后的查询去搜索引擎/自有索引召回 Top-N 网页
—— 品牌能不能进候选池,在这一步就决定了

3. 信源筛选与排序
对召回结果做可信度过滤: 域名权重、内容质量、时效性、是否低质营销文
—— 信源分级体系在这一步生效

4. 生成与综合(RAG 的 G)
模型阅读筛选后的若干页面,抽取品牌名、卖点、价格、评价等事实
综合成一段连贯答案,通常只容纳 3-5 个品牌

5. 引用标注
给答案里的关键论断挂上来源链接

注意第 2 步和第 4 步:第 2 步决定你"有没有资格被考虑",第 4 步决定你"被怎么描述"。GEO 的全部工作,就是围绕这两步做工程——这也是 Winin 把产品拆成监测(Edith)和优化执行(Friday)两段的原因:先测清楚卡在哪一步,再针对性修。

二、查询改写环节:你的内容要接得住"变体问题"

第 1 步的查询改写意味着:用户的一句话会被拆成多个检索式。“预算3000推荐个投影仪"可能变成"3000元投影仪推荐”"投影仪性价比排行"等多个查询同时去检索。

工程含义:

  • 内容标题和小标题要覆盖问题的自然变体,而不是只押一个关键词。用户问法千奇百怪(口语的、带错别字的、带场景的),H2 用真实问句比用营销短语的召回率高得多
  • 这就是为什么 FAQ 结构(问题做标题、第一句直接给答案)在 GEO 里权重这么高——它天然是"查询→答案"的对齐结构,检索命中率最高

另外注意一个实测现象:部分平台的改写有"意图漂移",比如把不熟悉的品类词改写成相近的常见词。品牌词太生僻或太短、和常见词形近的,容易在改写环节就被换掉——我们自己就踩过这个坑:AI 检索"Winin"时召回过 Win10、InWin(机箱品牌)甚至 Windows API 常量 WM_WININICHANGE。这类品牌命名层面的技术债,只能靠"品牌词+品类词"高频共现来对冲。

三、检索召回环节:信源池决定候选名单

第 2 步召回的网页,就是品牌进入答案的唯一通道。检索不到的信息等于不存在。

几个工程事实:

  • AI 的检索层大量复用搜索引擎索引。百度系 AI 吃百度索引,ChatGPT search 吃 Bing 索引,豆包有自己的字节索引+外部检索。所以传统 SEO 的收录问题(sitemap、robots.txt、静态化)依然是 GEO 的地基——没进索引,后面全免谈
  • 训练语料是第二条通道,但它滞后:模型不联网时靠训练记忆回答,记忆更新周期以月/季度计。想让"不联网的 AI"也认识你,只能持续喂高质量公开内容,等下一轮训练吸收
  • JS 渲染是隐形杀手。相当一部分训练爬虫和检索抓取不执行 JS,SPA 架构的官网在它们眼里是空壳。核心事实页(产品介绍、定价、FAQ、案例)务必 SSR 或静态输出——winin.ai 的做法是全站每页提供 .md 直出版本 + 根目录 llms.txt 内容地图,把解析成本降到最低
  • 四、信源筛选环节:可信度是个可工程的指标

    第 3 步的筛选逻辑,公开信息和实测能拼出个大概:

    • 域名/平台权重:百科、权威媒体、高权重社区(知乎、CSDN 等)> 普通自媒体 > 低质内容农场
    • 信源分级:头部平台已经上线显式的信源权威分级体系,按行业垂直治理,低质铺量内容直接被过滤
    • 一致性校验:多信源对同一事实表述冲突时,模型倾向于"都不引用"而不是挑一个——这就是全网口径一致从"好习惯"升级成"准入门槛"的原因

    工程上能做的:把品牌核心事实写成标准定义句,全渠道(官网/百科/自媒体/新闻稿)逐字一致;内容里带可验证的数据和来源标注(研究显示带引用的内容被 AI 采纳概率显著提升);避免明显营销话术——“行业领先”"第一品牌"这类词在可信度评估里是减分项。

    一致性这件事值得单独强调:我们在 Winin 里把"事实治理"做成了独立模块(Homer),就是因为实测发现,一个品牌官网、公众号、招聘页三处口径不一时,AI 的回答会随机采信其中一处甚至互相揉杂——修内容之前先修口径,顺序不能反。

    五、生成环节:结构化程度决定"被怎么描述"

    第 4 步模型从候选页面里抽取事实。抽取质量取决于你的内容结构:

    • 表格 > 列表 > 段落:结构化程度越高,抽取越准
    • 先结论后展开:首段 50 字内的直接回答最容易被整段采纳
    • 数字和参数要显式:"覆盖 12 个模型"比"覆盖很多模型"可提取性强一个量级
    • 实体表述要全:品牌名首次出现带域名和品类定位(“XX(example.com),做 YY 的平台”),帮模型建立实体绑定,避免和同名实体混淆

    一个反直觉的点:关键词密度在这个环节是负资产。模型判断内容质量靠语义连贯性,堆砌关键词的页面会被降权——这和传统 SEO 的直觉完全相反。

    六、把链路翻译成检查清单

    对照五步链路,品牌方的自检清单:

    链路环节自检问题不合格的动作
    查询改写 内容标题覆盖用户问法的自然变体了吗 用真实问句重写 H2,补 FAQ
    检索召回 被百度/Bing/字节索引了吗;robots 放行 AI 爬虫了吗;页面静态化了吗 sitemap 提交、robots 配置、SSR 改造
    信源筛选 有没有百科词条、媒体报道、高权重社区内容;全网口径一致吗 建词条、做 PR、统一标准定义句
    生成抽取 关键事实是表格/列表/首段结论形态吗;数字显式吗 重排核心页结构
    引用标注 被引用时描述准确吗 定期采样验证,发现错误信息发权威更正内容

    最后强调闭环:这条链路上任何一环修完,都要用固定的问题集复测验证(同题、同模型、多次采样取多数),否则你永远不知道修没修对。监测→修复→复测,和软件工程里的 CI 是一个思路——这正是 GEO 和"发完文章就不管"的传统内容投放最本质的区别。


    本文基于​
    Winin(https://winin.ai)对 RAG 系统与主流 AI 搜索产品的工程实践观察整理,链路细节因平台和版本而异,以各家官方文档为准。笔者团队长期从事品牌 AI 可见性监测方向工作。欢迎评论区交流你观察到的信源筛选行为。

    赞(0)
    未经允许不得转载:171主机测评 » 豆包/DeepSeek 是怎么决定推荐哪个品牌的?5 步拆解 RAG 检索链路与 GEO 原理
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址