
论文聚焦自适应检索增强生成(Adaptive RAG)的核心痛点,提出了基于大语言模型(LLMs)内部状态自感知的创新框架 SEAKR,首次实现了从 “输出层面判断” 到 “内部状态感知” 的自适应检索升级,为解决 LLMs 幻觉问题、提升复杂任务知识整合能力提供了全新思路。其核心价值在于通过挖掘 LLMs 的内在自感知不确定性,动态优化 “何时检索” 与 “如何整合知识” 两大关键环节,在复杂问答与简单问答任务中均显著超越现有自适应检索方法。
一、研究背景与核心问题
1.1 传统 RAG 与现有自适应 RAG 的局限
检索增强生成(RAG)通过融合外部知识有效缓解了 LLMs 幻觉问题,但传统 RAG 默认对所有查询执行检索,存在两大核心缺陷:
- 效率低下:当 LLMs 自身参数知识足够回答问题时,冗余检索会引入噪声知识,误导生成结果;
- 适配性差:无法动态匹配任务复杂度,对简单事实查询与复杂多跳推理查询采用相同检索策略。
现有自适应 RAG 方法(如 FLARE、DRAGIN、Self-RAG)虽试图解决 “何时检索” 的问题,但仍存在明显不足:
- 决策依据表层化:仅基于 LLMs 的输出结果(如低概率 token、生成的检索标记)判断知识需求,易受 LLMs 自偏置(Self-bias)与过度自信特性影响,决策准确性低;
- 知识整合缺失:忽视对多源检索结果的筛选与推理路径优化,直接采用检索引擎排序结果,难以匹配 LLMs 内在知识体系。
1.2 核心发现:LLMs 的自感知特性
论文基于已有研究(Kadavath et al., 2022; Chen et al., 2023a)发现:LLMs 对自身生成内容的不确定性具有自感知能力,且这种不确定性可从其内部状态(Transformer 层的隐藏表示)中精准提取 —— 相比输出层面的不确定性判断,内部状态能更本质地反映 LLMs 的知识充足度,避免表层语义干扰。
1.3 SEAKR 的核心定位
论文提出Self-aware Knowledge Retrieval(SEAKR) 框架,核心目标是:
二、核心方法:SEAKR 框架设计
SEAKR 的核心设计理念是 “自感知不确定性驱动的全流程自适应”,框架包含三大核心组件:自感知不确定性估计器、自感知检索、自感知知识整合(重排序 + 推理),整体采用链式思维(CoT)风格的迭代推理流程。
2.1 核心组件 1:自感知不确定性估计器(Self-aware Uncertainty Estimator)
这是 SEAKR 的核心创新,负责从 LLMs 内部状态中量化不确定性,为后续决策提供依据。其工作流程如下:
选择格拉姆矩阵行列式作为评分指标的原因:
- LLMs 生成错误内容时,内部状态一致性更低(Kadavath et al., 2022);
- 内部状态层面的一致性不受自然语言同义表达干扰,判断更精准。
2.2 核心组件 2:自感知检索(Self-aware Retrieval)
基于不确定性评分动态决定是否触发检索,解决 “何时检索” 的问题:
2.3 核心组件 3:自感知知识整合(Self-aware Knowledge Integration)
针对检索到的多源知识,通过 “重排序” 与 “推理策略选择” 实现高效整合,解决 “如何整合” 的问题:
(1)自感知重排序(Self-aware Re-ranking)
传统 RAG 按检索引擎相关性排序知识,SEAKR 则优先选择能最大程度降低 LLMs 不确定性的知识:
- 对检索引擎返回的前N个知识片段(论文中N=3),分别构建 “历史推理 + 单条知识” 的输入上下文;
- 计算每个上下文的不确定性评分,选择评分最低(不确定性最小)的知识片段作为增强上下文,有效过滤噪声知识。
(2)自感知推理(Self-aware Reasoning)
针对复杂任务的多轮检索知识,提供两种推理策略并自适应选择:
- 策略 1:基于推理记录推理(Rationales-only):在历史推理记录后添加 “So the final answer is” 指令,直接生成最终答案;
- 策略 2:基于检索知识推理(Knowledge-only):将所有筛选后的知识片段拼接为参考上下文,结合查询进行完整 CoT 推理;
- 策略选择:计算两种策略生成结果的不确定性评分,选择评分更低的结果作为最终答案,本质是通过集成学习提升推理可靠性。
2.4 整体工作流程
SEAKR 采用迭代推理模式,核心流程如下:
三、实验设计与结果
3.1 实验设置
(1)模型与工具
- 骨干 LLM:LLaMA-2-chat-7B(主要实验)、LLaMA-3-8B(扩展性实验);
- 检索引擎:基于 Elastic Search 实现 BM25 算法;
- 外部知识库:2018 年 12 月英文维基百科快照;
- 加速工具:vLLM 实现并行推理,降低 20 次伪生成的 latency。
(2)评估任务
覆盖复杂问答与简单问答两类知识密集型任务:
- 复杂问答(多跳推理 + 多知识支持):2WikiMultiHopQA、HotpotQA、IIRC(可回答子集);
- 简单问答(单事实查询):NaturalQuestions(NQ)、TriviaQA、SQuAD。
(3)基准方法
- 非自适应 RAG:CoT(仅推理无检索)、IRCoT(每步强制检索);
- 自适应 RAG:Self-RAG(微调 LLM 生成检索标记)、FLARE(低概率 token 触发检索)、DRAGIN(注意力权重优化查询生成)。
3.2 核心实验结果
(1)复杂问答任务结果
表格
| CoT | 14.6/22.3 | 18.4/27.5 | 13.9/17.3 |
| IRCoT | 18.9/26.5 | 21.4/30.4 | 17.8/21.6 |
| Self-RAG | 4.6/19.6 | 6.8/17.5 | 0.9/5.7 |
| FLARE | 14.3/21.3 | 14.9/22.1 | 13.6/16.4 |
| DRAGIN | 22.4/30.0 | 23.7/34.2 | 19.1/22.9 |
| SEAKR | 30.2/36.0 | 27.9/39.7 | 19.5/23.5 |
关键发现:
- SEAKR 在三大复杂数据集上均显著超越所有基线,2WikiMultiHop 和 HotpotQA 的 F1 分数分别比最优基线 DRAGIN 提升 6.0% 和 5.5%;
- IIRC 任务因包含大量数值推理(LLaMA-2-7B 短板),性能提升相对有限(0.6%),验证了 SEAKR 不优化 LLM 固有推理能力,仅聚焦检索与整合优化;
- IRCoT 因强制每步检索引入冗余知识,性能低于 SEAKR,证明自适应检索的必要性。
(2)简单问答任务结果
表格
| CoT | 13.4/18.7 | 42.6/48.6 | 8.7/13.6 |
| Self-RAG | 32.3/40.2 | 21.2/37.9 | 5.1/18.3 |
| FLARE | 25.3/35.9 | 51.5/60.3 | 19.4/28.3 |
| DRAGIN | 23.2/33.2 | 54.0/62.3 | 18.7/28.7 |
| SEAKR | 25.6/35.5 | 54.4/63.1 | 27.1/36.5 |
关键发现:
- SEAKR 在 TriviaQA 和 SQuAD 上实现最优性能,SQuAD 的 F1 分数比 DRAGIN 提升 7.8%;
- NQ 任务上 SEAKR 与 FLARE 性能相当,但低于 Self-RAG(Self-RAG 基于 NQ 数据微调,存在数据泄露优势);
- 简单任务中 SEAKR 与基线的性能差距小于复杂任务,因简单任务知识整合需求低,凸显 SEAKR 在复杂知识整合场景的优势。
四、深度分析与消融实验
4.1 消融实验:各组件有效性验证
论文通过消融实验验证核心组件的必要性,结果如下(以 2Wiki、HotpotQA、NQ 为例):
表格
| SEAKR(完整模型) | 37.8 | 38.1 | 36.1 |
| 移除自感知不确定性估计器(Prompt 替代) | 33.9 | 37.3 | 34.2 |
| 移除自感知检索(强制每步检索) | 35.7 | 37.6 | 35.8 |
| 移除自感知重排序(检索引擎排序) | 35.0 | 36.6 | 35.0 |
| 移除自感知推理(仅用 Rationales-only) | 35.9 | 36.3 | – |
| 移除自感知推理(仅用 Knowledge-only) | 37.0 | 37.2 | – |
关键结论:
- 自感知不确定性估计器是核心:替换为 Prompt 询问 “是否需要知识” 后,性能显著下降,证明内部状态感知比输出层面判断更精准;
- 自感知重排序影响最大:移除后性能下降幅度超过自感知检索,凸显知识筛选对整合效果的关键作用;
- 自感知推理通过集成策略提升性能:两种单一策略均不如自适应选择,验证了策略适配的价值。
4.2 骨干 LLM 扩展性分析
验证 SEAKR 在更强 LLM 上的适配性:
- LLaMA-3-8B(Base 版):2Wiki 的 F1 达 44.7%,HotpotQA 达 39.2%,比 LLaMA-2-7B 显著提升;
- LLaMA-3-8B(Instruct 版):2Wiki 的 F1 进一步提升至 48.1%,HotpotQA 达 47.7%,因对齐微调后的 LLM 指令跟随能力更强,与 SEAKR 框架适配性更好。
结论:SEAKR 的有效性随 LLM 能力增强而提升,框架具有良好的扩展性。
4.3 案例分析
以 HotpotQA 问题 “Who lived longer, Alejandro Jodorowsky or Philip Saville?” 为例,展示 SEAKR 的工作过程:
案例证明:SEAKR 能精准识别知识缺口,筛选有效知识,避免检索噪声干扰。
4.4 效率分析
尽管 SEAKR 需要 20 次伪生成计算不确定性,但通过 vLLM 并行推理优化, latency 优于现有自适应 RAG 方法:
表格
| FLARE | 8.44 | 13.25 |
| DRAGIN | 29.75 | 19.25 |
| SEAKR | 4.94 | 7.30 |
SEAKR 的检索调用次数更少(2Wiki 平均 2.81 次,DRAGIN 为 2.92 次),进一步提升了效率。
五、相关工作对比
表格
| FLARE | 输出低概率 token | 检索后重新生成 | 否 | 实现简单 | 决策表层化,无知识筛选 |
| DRAGIN | 输出低概率 token + 注意力权重 | 优化查询生成 | 否 | 查询生成更精准 | 无知识筛选与推理优化 |
| Self-RAG | 微调生成检索标记 | 生成批判文本筛选 | 是 | 端到端优化 | 依赖微调,闭源模型不友好 |
| SEAKR | 内部状态自感知不确定性 | 重排序 + 推理策略选择 | 否 | 决策精准,知识整合高效 | 依赖开源 LLM 内部状态访问 |
六、局限性与未来方向
6.1 现有局限性
- 适用范围受限:需访问 LLMs 内部状态,仅支持开源模型(如 LLaMA 系列),无法适配 GPT 等闭源商业模型;
- 任务覆盖单一:仅评估短文本问答任务,未涉及长文本生成、创意写作等场景;
- 计算开销:20 次伪生成虽通过并行优化降低 latency,但仍比单次生成消耗更多计算资源;
- 模型缩放有限:未验证在 10B 以上参数 LLM 上的性能,且未优化 LLM 本身的推理能力(如数值推理)。
6.2 未来研究方向
- 闭源模型适配:探索从 LLM 输出中间接估计自感知不确定性的方法,突破开源模型限制;
- 任务扩展:将 SEAKR 框架应用于长文本生成、代码生成等复杂任务;
- 高效计算:优化伪生成次数,在保证不确定性估计准确性的同时降低计算开销;
- 多模态扩展:将自感知不确定性估计扩展至图文多模态检索增强生成。
七、结论
SEAKR 框架通过挖掘 LLMs 内部状态的自感知不确定性,创新性地解决了自适应 RAG 中 “何时检索” 与 “如何整合知识” 两大核心问题。其核心贡献在于:
实验证明,SEAKR 在复杂问答(2WikiMultiHop、HotpotQA)与简单问答(TriviaQA、SQuAD)任务中均显著超越现有自适应 RAG 方法,平均性能提升 6.0% 以上,为构建更可靠、高效的检索增强生成系统提供了关键技术支撑。
论文代码已开源: https://github.com/THU-KEG/SeaKR




