欢迎光临
我们一直在努力

SEAKR: Self-aware Knowledge Retrievalfor Adaptive Retrieval Augmented Generation

论文聚焦自适应检索增强生成(Adaptive RAG)的核心痛点,提出了基于大语言模型(LLMs)内部状态自感知的创新框架 SEAKR,首次实现了从 “输出层面判断” 到 “内部状态感知” 的自适应检索升级,为解决 LLMs 幻觉问题、提升复杂任务知识整合能力提供了全新思路。其核心价值在于通过挖掘 LLMs 的内在自感知不确定性,动态优化 “何时检索” 与 “如何整合知识” 两大关键环节,在复杂问答与简单问答任务中均显著超越现有自适应检索方法。

一、研究背景与核心问题

1.1 传统 RAG 与现有自适应 RAG 的局限

检索增强生成(RAG)通过融合外部知识有效缓解了 LLMs 幻觉问题,但传统 RAG 默认对所有查询执行检索,存在两大核心缺陷:

  • 效率低下:当 LLMs 自身参数知识足够回答问题时,冗余检索会引入噪声知识,误导生成结果;
  • 适配性差:无法动态匹配任务复杂度,对简单事实查询与复杂多跳推理查询采用相同检索策略。

现有自适应 RAG 方法(如 FLARE、DRAGIN、Self-RAG)虽试图解决 “何时检索” 的问题,但仍存在明显不足:

  • 决策依据表层化:仅基于 LLMs 的输出结果(如低概率 token、生成的检索标记)判断知识需求,易受 LLMs 自偏置(Self-bias)与过度自信特性影响,决策准确性低;
  • 知识整合缺失:忽视对多源检索结果的筛选与推理路径优化,直接采用检索引擎排序结果,难以匹配 LLMs 内在知识体系。

1.2 核心发现:LLMs 的自感知特性

论文基于已有研究(Kadavath et al., 2022; Chen et al., 2023a)发现:LLMs 对自身生成内容的不确定性具有自感知能力,且这种不确定性可从其内部状态(Transformer 层的隐藏表示)中精准提取 —— 相比输出层面的不确定性判断,内部状态能更本质地反映 LLMs 的知识充足度,避免表层语义干扰。

1.3 SEAKR 的核心定位

论文提出Self-aware Knowledge Retrieval(SEAKR) 框架,核心目标是:

  • 从 LLMs 内部状态中提取自感知不确定性,精准判断 “何时需要检索”;
  • 基于不确定性优化知识整合,通过 “自感知重排序” 筛选最优知识片段;
  • 针对复杂任务,通过 “自感知推理” 选择最优推理策略,实现多轮检索知识的有效融合。
  • 二、核心方法:SEAKR 框架设计

    SEAKR 的核心设计理念是 “自感知不确定性驱动的全流程自适应”,框架包含三大核心组件:自感知不确定性估计器、自感知检索、自感知知识整合(重排序 + 推理),整体采用链式思维(CoT)风格的迭代推理流程。

    2.1 核心组件 1:自感知不确定性估计器(Self-aware Uncertainty Estimator)

    这是 SEAKR 的核心创新,负责从 LLMs 内部状态中量化不确定性,为后续决策提供依据。其工作流程如下:

  • 伪生成采样:对输入上下文c,生成k个不同的伪输出(论文中k=20),保留每个输出末尾⟨EOS⟩ token 对应的隐藏表示H<EOS>(l)​(l为 LLM 中间层,论文中l=L/2,L为总层数);
  • 一致性计算:将k个隐藏表示视为随机变量,计算其格拉姆矩阵(Gram Matrix),衡量向量间的相关性;
  • 不确定性评分:将正则化格拉姆矩阵的行列式作为不确定性分数 —— 行列式值越小,表明多个伪生成的内部状态一致性越高,LLMs 对该任务的知识越充足;反之则不确定性越高,需要检索外部知识。
  • 选择格拉姆矩阵行列式作为评分指标的原因:

    • LLMs 生成错误内容时,内部状态一致性更低(Kadavath et al., 2022);
    • 内部状态层面的一致性不受自然语言同义表达干扰,判断更精准。

    2.2 核心组件 2:自感知检索(Self-aware Retrieval)

    基于不确定性评分动态决定是否触发检索,解决 “何时检索” 的问题:

  • 输入上下文构建:将用户查询q与历史推理记录R整合为输入上下文cr​,prompt LLM 生成单步推理;
  • 检索触发判断:若cr​的不确定性评分U(cr​)>δ(δ为经验阈值,论文中δ=−6),触发检索;否则直接基于 LLMs 参数知识生成推理步骤;
  • 检索查询生成:对伪生成结果rs​,移除低概率的高不确定性 token,生成精准检索查询,确保检索知识能填补 LLMs 的知识缺口;
  • 推理步骤生成:若触发检索,将筛选后的知识片段加入上下文,生成推理步骤并存入推理缓冲区R;否则直接生成推理步骤。
  • 2.3 核心组件 3:自感知知识整合(Self-aware Knowledge Integration)

    针对检索到的多源知识,通过 “重排序” 与 “推理策略选择” 实现高效整合,解决 “如何整合” 的问题:

    (1)自感知重排序(Self-aware Re-ranking)

    传统 RAG 按检索引擎相关性排序知识,SEAKR 则优先选择能最大程度降低 LLMs 不确定性的知识:

    • 对检索引擎返回的前N个知识片段(论文中N=3),分别构建 “历史推理 + 单条知识” 的输入上下文;
    • 计算每个上下文的不确定性评分,选择评分最低(不确定性最小)的知识片段作为增强上下文,有效过滤噪声知识。
    (2)自感知推理(Self-aware Reasoning)

    针对复杂任务的多轮检索知识,提供两种推理策略并自适应选择:

    • 策略 1:基于推理记录推理(Rationales-only):在历史推理记录后添加 “So the final answer is” 指令,直接生成最终答案;
    • 策略 2:基于检索知识推理(Knowledge-only):将所有筛选后的知识片段拼接为参考上下文,结合查询进行完整 CoT 推理;
    • 策略选择:计算两种策略生成结果的不确定性评分,选择评分更低的结果作为最终答案,本质是通过集成学习提升推理可靠性。

    2.4 整体工作流程

    SEAKR 采用迭代推理模式,核心流程如下:

  • 初始化:推理缓冲区R=∅,知识缓冲区K=∅;
  • 迭代推理:a. 构建输入上下文cr​,计算不确定性评分U(cr​);b. 若U(cr​)>δ,生成检索查询,检索后通过自感知重排序筛选知识存入K;c. 基于cr​(含 / 不含检索知识)生成推理步骤,存入R;
  • 终止条件:当 LLM 生成 “So the final answer is” 或达到最大迭代次数时停止;
  • 最终答案生成:通过自感知推理选择最优策略,输出最终答案。
  • 三、实验设计与结果

    3.1 实验设置

    (1)模型与工具
    • 骨干 LLM:LLaMA-2-chat-7B(主要实验)、LLaMA-3-8B(扩展性实验);
    • 检索引擎:基于 Elastic Search 实现 BM25 算法;
    • 外部知识库:2018 年 12 月英文维基百科快照;
    • 加速工具:vLLM 实现并行推理,降低 20 次伪生成的 latency。
    (2)评估任务

    覆盖复杂问答与简单问答两类知识密集型任务:

    • 复杂问答(多跳推理 + 多知识支持):2WikiMultiHopQA、HotpotQA、IIRC(可回答子集);
    • 简单问答(单事实查询):NaturalQuestions(NQ)、TriviaQA、SQuAD。
    (3)基准方法
    • 非自适应 RAG:CoT(仅推理无检索)、IRCoT(每步强制检索);
    • 自适应 RAG:Self-RAG(微调 LLM 生成检索标记)、FLARE(低概率 token 触发检索)、DRAGIN(注意力权重优化查询生成)。

    3.2 核心实验结果

    (1)复杂问答任务结果

    表格

    模型2WikiMultiHop(EM/F1)HotpotQA(EM/F1)IIRC(EM/F1)
    CoT 14.6/22.3 18.4/27.5 13.9/17.3
    IRCoT 18.9/26.5 21.4/30.4 17.8/21.6
    Self-RAG 4.6/19.6 6.8/17.5 0.9/5.7
    FLARE 14.3/21.3 14.9/22.1 13.6/16.4
    DRAGIN 22.4/30.0 23.7/34.2 19.1/22.9
    SEAKR 30.2/36.0 27.9/39.7 19.5/23.5

    关键发现:

    • SEAKR 在三大复杂数据集上均显著超越所有基线,2WikiMultiHop 和 HotpotQA 的 F1 分数分别比最优基线 DRAGIN 提升 6.0% 和 5.5%;
    • IIRC 任务因包含大量数值推理(LLaMA-2-7B 短板),性能提升相对有限(0.6%),验证了 SEAKR 不优化 LLM 固有推理能力,仅聚焦检索与整合优化;
    • IRCoT 因强制每步检索引入冗余知识,性能低于 SEAKR,证明自适应检索的必要性。
    (2)简单问答任务结果

    表格

    模型NQ(EM/F1)TriviaQA(EM/F1)SQuAD(EM/F1)
    CoT 13.4/18.7 42.6/48.6 8.7/13.6
    Self-RAG 32.3/40.2 21.2/37.9 5.1/18.3
    FLARE 25.3/35.9 51.5/60.3 19.4/28.3
    DRAGIN 23.2/33.2 54.0/62.3 18.7/28.7
    SEAKR 25.6/35.5 54.4/63.1 27.1/36.5

    关键发现:

    • SEAKR 在 TriviaQA 和 SQuAD 上实现最优性能,SQuAD 的 F1 分数比 DRAGIN 提升 7.8%;
    • NQ 任务上 SEAKR 与 FLARE 性能相当,但低于 Self-RAG(Self-RAG 基于 NQ 数据微调,存在数据泄露优势);
    • 简单任务中 SEAKR 与基线的性能差距小于复杂任务,因简单任务知识整合需求低,凸显 SEAKR 在复杂知识整合场景的优势。

    四、深度分析与消融实验

    4.1 消融实验:各组件有效性验证

    论文通过消融实验验证核心组件的必要性,结果如下(以 2Wiki、HotpotQA、NQ 为例):

    表格

    模型配置2Wiki(F1)HotpotQA(F1)NQ(F1)
    SEAKR(完整模型) 37.8 38.1 36.1
    移除自感知不确定性估计器(Prompt 替代) 33.9 37.3 34.2
    移除自感知检索(强制每步检索) 35.7 37.6 35.8
    移除自感知重排序(检索引擎排序) 35.0 36.6 35.0
    移除自感知推理(仅用 Rationales-only) 35.9 36.3
    移除自感知推理(仅用 Knowledge-only) 37.0 37.2

    关键结论:

    • 自感知不确定性估计器是核心:替换为 Prompt 询问 “是否需要知识” 后,性能显著下降,证明内部状态感知比输出层面判断更精准;
    • 自感知重排序影响最大:移除后性能下降幅度超过自感知检索,凸显知识筛选对整合效果的关键作用;
    • 自感知推理通过集成策略提升性能:两种单一策略均不如自适应选择,验证了策略适配的价值。

    4.2 骨干 LLM 扩展性分析

    验证 SEAKR 在更强 LLM 上的适配性:

    • LLaMA-3-8B(Base 版):2Wiki 的 F1 达 44.7%,HotpotQA 达 39.2%,比 LLaMA-2-7B 显著提升;
    • LLaMA-3-8B(Instruct 版):2Wiki 的 F1 进一步提升至 48.1%,HotpotQA 达 47.7%,因对齐微调后的 LLM 指令跟随能力更强,与 SEAKR 框架适配性更好。

    结论:SEAKR 的有效性随 LLM 能力增强而提升,框架具有良好的扩展性。

    4.3 案例分析

    以 HotpotQA 问题 “Who lived longer, Alejandro Jodorowsky or Philip Saville?” 为例,展示 SEAKR 的工作过程:

  • 伪生成与不确定性判断:LLM 伪生成 “Alejandro Jodorowsky was born on 7 July 1929”,不确定性评分U(c)=−4.4>δ,触发检索;
  • 知识检索与重排序:检索引擎返回 3 条知识,其中检索排序第 1 的知识无关(讨论电影资金问题),SEAKR 通过不确定性评分筛选出排序第 2 的知识(含 Jodorowsky 准确出生日期);
  • 推理与答案生成:结合筛选后的知识与 Philip Saville 的生平信息,通过自感知推理选择最优策略,生成正确答案 “Alejandro Jodorowsky”。
  • 案例证明:SEAKR 能精准识别知识缺口,筛选有效知识,避免检索噪声干扰。

    4.4 效率分析

    尽管 SEAKR 需要 20 次伪生成计算不确定性,但通过 vLLM 并行推理优化, latency 优于现有自适应 RAG 方法:

    表格

    模型2Wiki 平均处理时间(秒)HotpotQA 平均处理时间(秒)
    FLARE 8.44 13.25
    DRAGIN 29.75 19.25
    SEAKR 4.94 7.30

    SEAKR 的检索调用次数更少(2Wiki 平均 2.81 次,DRAGIN 为 2.92 次),进一步提升了效率。

    五、相关工作对比

    表格

    方法检索决策依据知识整合方式是否需要微调核心优势核心局限
    FLARE 输出低概率 token 检索后重新生成 实现简单 决策表层化,无知识筛选
    DRAGIN 输出低概率 token + 注意力权重 优化查询生成 查询生成更精准 无知识筛选与推理优化
    Self-RAG 微调生成检索标记 生成批判文本筛选 端到端优化 依赖微调,闭源模型不友好
    SEAKR 内部状态自感知不确定性 重排序 + 推理策略选择 决策精准,知识整合高效 依赖开源 LLM 内部状态访问

    六、局限性与未来方向

    6.1 现有局限性

    • 适用范围受限:需访问 LLMs 内部状态,仅支持开源模型(如 LLaMA 系列),无法适配 GPT 等闭源商业模型;
    • 任务覆盖单一:仅评估短文本问答任务,未涉及长文本生成、创意写作等场景;
    • 计算开销:20 次伪生成虽通过并行优化降低 latency,但仍比单次生成消耗更多计算资源;
    • 模型缩放有限:未验证在 10B 以上参数 LLM 上的性能,且未优化 LLM 本身的推理能力(如数值推理)。

    6.2 未来研究方向

    • 闭源模型适配:探索从 LLM 输出中间接估计自感知不确定性的方法,突破开源模型限制;
    • 任务扩展:将 SEAKR 框架应用于长文本生成、代码生成等复杂任务;
    • 高效计算:优化伪生成次数,在保证不确定性估计准确性的同时降低计算开销;
    • 多模态扩展:将自感知不确定性估计扩展至图文多模态检索增强生成。

    七、结论

    SEAKR 框架通过挖掘 LLMs 内部状态的自感知不确定性,创新性地解决了自适应 RAG 中 “何时检索” 与 “如何整合知识” 两大核心问题。其核心贡献在于:

  • 提出基于 LLM 内部状态的自感知不确定性估计方法,决策准确性超越输出层面判断;
  • 设计自感知重排序与推理策略选择机制,实现知识的高效整合;
  • 框架无需微调,适配开源 LLM,兼具灵活性与高效性。
  • 实验证明,SEAKR 在复杂问答(2WikiMultiHop、HotpotQA)与简单问答(TriviaQA、SQuAD)任务中均显著超越现有自适应 RAG 方法,平均性能提升 6.0% 以上,为构建更可靠、高效的检索增强生成系统提供了关键技术支撑。

    论文代码已开源: https://github.com/THU-KEG/SeaKR

    赞(0)
    未经允许不得转载:171主机测评 » SEAKR: Self-aware Knowledge Retrievalfor Adaptive Retrieval Augmented Generation
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址