Less is More for RAG: Information Gain Pruning for Generator-Aligned Reranking and Evidence Selection
Authors: Zhipeng Song, Yizhi Zhou, Xiangyu Kong, Jiulong Jiao, Xinrui Bao, Xu You, Xueqing Shi, Yuhang Zhou, Heng Qi
Deep-Dive Summary:
Less is More for RAG: Information Gain Pruning for Generator-Aligned Reranking and Evidence Selection
论文作者: Zhipeng Song 等(大连理工大学、大连医科大学、大连海洋大学、辽东学院、青海大学、辽宁工程技术大学、腾讯)
摘要 (ABSTRACT)
关键词: 大语言模型、检索增强生成(RAG)、重排、截断、模型不确定性
检索增强生成(RAG)通过外部证据增强大语言模型(LLM),但在有限的上下文预算下,核心挑战在于决定注入哪些检索到的段落。研究表明,检索相关性指标(如 NDCG)与最终端到端的问答质量相关性较弱,在多段落注入的情况下甚至可能呈负相关,因为冗余和轻微的冲突会导致生成不稳定。
本文提出了 信息增益剪枝(Information Gain Pruning, IGP),这是一个部署友好的重排与剪枝模块。它使用与生成器对齐的效用信号来选择证据,并在截断前过滤掉弱效用或有害的段落,且无需更改现有的预算接口。在五个开源问答基准测试以及多个检索器和生成器上的实验表明,IGP 一致地改善了质量与成本的权衡。在典型的多证据设置中,与仅使用检索器的基线相比,IGP 在平均 F1 值上实现了约
+
12
−
20
%
+12 – 20\\%
+12−20% 的相对提升,同时减少了约
76
−
79
%
76 – 79\\%
76−79% 的输入 Token 消耗。
2. 相关工作 (Related Work)
本文针对 RAG 部署中的瓶颈,即在预算有限的情况下,哪些证据最有助于生成。
4. 实验 (Experiments)
评估 IGP 在不同基准(如开源问答)上的表现,固定检索器、提示词和预算执行器,仅改变重排/准入策略以观察端到端效果。
4. 研究问题 (RQs)
- RQ1 (质量-成本权衡):IGP 是否在不同的证据预算下改善了端到端的质量-成本前沿?(见 4.2 节)
- RQ2 (机制与敏感性):增益源自何处(重排序 vs. 准入控制)?IGP 对剪枝阈值和不确定性估计超参数的敏感性如何?(见 4.3 节)
- RQ3 (相关性 ≠ 效用):在不同预算下,离线相关性指标 (NDCG) 预测端到端 QA 质量 (F1) 的效果如何?(见 4.4.1 节)
- RQ4 (检索器鲁棒性):当更换第一阶段检索器时,IGP 的增益是否依然存在?(见 4.4.2 节)
- RQ5 (生成器鲁棒性):IGP 能否跨生成器家族和参数规模进行泛化?(见 4.4.3 节)
4.1. 实验设置
本小节详细介绍了语料库、数据集、生成器主干、提示/解码协议、基准方案和评估指标。为了公平比较,我们固定了实验流水线——相同的语料库、候选集大小
N
N
N、提示词、解码设置和预算执行器(截断:Top-
M
M
M,可选令牌保护
B
B
B)——仅改变重排序/准入策略(以及预算扫描中的
M
M
M)。除非另有说明,IGP 是重排序阶段的即插即用替代方案;RQ4 额外改变了第一阶段检索器,RQ5 改变了生成器家族/规模。
4.1.1. 语料库
我们使用 FlashRAG (Jin et al., 2024) 发布的 Wikipedia 检索语料库作为外部知识库。该语料库基于 2018-12-20 的英文维基百科快照。清洗后将其分割为 100 词的非重叠段落,最终得到约 2100 万个段落。除非另有说明,所有检索、重排序和截断均在此语料库上进行。
4.1.2. 数据集
| Dataset | #Train | #Dev | #Test | Category |
| NQ | 79,168 | 8,757 | 3,610 | Real queries |
| TriviaQA | 78,785 | 8,837 | 11,313 | Trivia facts |
| PopQA | / | / | 14,267 | Long-tail knowledge |
| SQuAD | 87,599 | 10,570 | / | Reading comprehension |
| AmbigQA | 10,036 | 2,002 | / | Disambiguation |
表 2:数据集统计和类别标签(加粗表示评估中使用的划分)。
我们在五个具有互补特性的经典 QA 基准上进行评估:NQ(真实世界搜索查询)、TriviaQA(开放域事实性 QA)、PopQA(流行文化和长尾实体)、SQuAD(阅读理解/抽取式)、以及 AmbigQA(具有歧义的开放域 QA,需要多个有效的解释/答案)。如表 2 所示,我们默认报告测试集(test)结果;当测试集不可公开获取时,我们使用开发集(dev)(即 NQ/TriviaQA/PopQA 使用 test,SQuAD/AmbigQA 使用 dev)。
4.1.3. 语言模型(生成器主干)
为了验证 IGP 的黑盒可用性和模型无关性,并系统研究模型家族和参数规模对端到端 RAG 的影响(见 4.4.3 节),我们选择了两个主流的开源指令微调模型家族作为生成器:Qwen2.5-Instruct 和 Llama-3.x-Instruct。所有模型均来自 Hugging Face (HF) 中心。推理使用 vLLM 实现,我们在不使用梯度或微调的情况下导出逐步 logits(或等效的 TopK 对数概率)。这些输出用于计算 TopK 归一化不确定性(NU)和信息增益(IG),从而驱动 IGP 的重排序和剪枝。
Qwen2.5 家族(主实验和规模消融): Qwen2.5 提供了多个规模的指令模型。除非另有说明,我们的主要设置使用:
- 主要模型: Qwen/Qwen2.5-7B-Instruct。
- 不同规模: Qwen2.5-0.5B, 1.5B, 3B, 7B-Instruct。
Llama 3.x 家族(跨家族泛化和规模消融): 为了测试 IGP 是否能跨模型家族泛化,我们引入了 Meta 的 Llama 3.x 指令模型,涵盖中小尺寸:
- 不同规模: Llama-3.2-1B, 3B-Instruct 以及 Llama-3.1-8B-Instruct。
4.1.4. 提示词与解码协议
为了确保不同检索/重排序/截断策略之间端到端比较的公平性,我们固定了所有实验的提示词模板。我们使用两种提示词:(A) 最终的 RAG 答案生成提示词;(B) NU/IG 探测提示词。提示词 (A) 强制要求模型根据证据进行端到端 QA,而提示词 (B) 则简短且中性,以便在较低的提示词诱导干扰下获得更可靠的 logit 变化信号。除了文档排序/选择外,所有其他输入格式均保持一致。
(A) 最终 RAG 答案生成提示词(基于证据的 QA): 该阶段要求模型仅使用提供的文档进行回答,且仅输出答案。设拼接后的文档为 {reference},问题为 {question}:
System: You are given a question and a set of documents. Answer the question using only the information in the documents. Output only the answer.
User: Documents: {reference}
Question: {question} Answer:
文档拼接格式: [DOC 1] {passage_1} [DOC 2] {passage_2} … [DOC M] {passage_M}
此处
M
M
M 是保留的段落数量,由截断深度或预算决定。所有方法共享此格式,区别仅在于段落的顺序和过滤方式。
Original Abstract: Retrieval-augmented generation (RAG) grounds large language models with external evidence, but under a limited context budget, the key challenge is deciding which retrieved passages should be injected. We show that retrieval relevance metrics (e.g., NDCG) correlate weakly with end-to-end QA quality and can even become negatively correlated under multi-passage injection, where redundancy and mild conflicts destabilize generation. We propose \\textbf{Information Gain Pruning (IGP)}, a deployment-friendly reranking-and-pruning module that selects evidence using a generator-aligned utility signal and filters weak or harmful passages before truncation, without changing existing budget interfaces. Across five open-domain QA benchmarks and multiple retrievers and generators, IGP consistently improves the quality–cost trade-off. In a representative multi-evidence setting, IGP delivers about +12–20% relative improvement in average F1 while reducing final-stage input tokens by roughly 76–79% compared to retriever-only baselines.
PDF Link: 2601.17532v1
部分平台可能图片显示异常,请以我的博客内容为准





