欢迎光临
我们一直在努力

Less is More for RAG Information Gain Pruning for Generator-Aligned Reranking and Evidence Selection

Less is More for RAG: Information Gain Pruning for Generator-Aligned Reranking and Evidence Selection

Authors: Zhipeng Song, Yizhi Zhou, Xiangyu Kong, Jiulong Jiao, Xinrui Bao, Xu You, Xueqing Shi, Yuhang Zhou, Heng Qi

Deep-Dive Summary:

Less is More for RAG: Information Gain Pruning for Generator-Aligned Reranking and Evidence Selection

论文作者: Zhipeng Song 等(大连理工大学、大连医科大学、大连海洋大学、辽东学院、青海大学、辽宁工程技术大学、腾讯)

摘要 (ABSTRACT)

关键词: 大语言模型、检索增强生成(RAG)、重排、截断、模型不确定性

检索增强生成(RAG)通过外部证据增强大语言模型(LLM),但在有限的上下文预算下,核心挑战在于决定注入哪些检索到的段落。研究表明,检索相关性指标(如 NDCG)与最终端到端的问答质量相关性较弱,在多段落注入的情况下甚至可能呈负相关,因为冗余和轻微的冲突会导致生成不稳定。

本文提出了 信息增益剪枝(Information Gain Pruning, IGP),这是一个部署友好的重排与剪枝模块。它使用与生成器对齐的效用信号来选择证据,并在截断前过滤掉弱效用或有害的段落,且无需更改现有的预算接口。在五个开源问答基准测试以及多个检索器和生成器上的实验表明,IGP 一致地改善了质量与成本的权衡。在典型的多证据设置中,与仅使用检索器的基线相比,IGP 在平均 F1 值上实现了约

+

12

20

%

+12 – 20\\%

+1220% 的相对提升,同时减少了约

76

79

%

76 – 79\\%

7679% 的输入 Token 消耗。

2. 相关工作 (Related Work)

本文针对 RAG 部署中的瓶颈,即在预算有限的情况下,哪些证据最有助于生成。

  • RAG 框架: 如 DPR、FiD 等,遵循“高召回检索 + 强阅读器/融合”范式。
  • 重排与证据选择: 常用方法包括交叉编码器(Cross-encoder)、MonoT5 等生成式重排。这些方法多优化相关性,而非生成效用。
  • 不确定性量化(UQ): 现有 UQ 研究多用于幻觉检测。IGP 则将 UQ 信号前置,用于在进入上下文前筛选证据。
  • 4. 实验 (Experiments)

    评估 IGP 在不同基准(如开源问答)上的表现,固定检索器、提示词和预算执行器,仅改变重排/准入策略以观察端到端效果。

    4. 研究问题 (RQs)

    • RQ1 (质量-成本权衡):IGP 是否在不同的证据预算下改善了端到端的质量-成本前沿?(见 4.2 节)
    • RQ2 (机制与敏感性):增益源自何处(重排序 vs. 准入控制)?IGP 对剪枝阈值和不确定性估计超参数的敏感性如何?(见 4.3 节)
    • RQ3 (相关性 ≠ 效用):在不同预算下,离线相关性指标 (NDCG) 预测端到端 QA 质量 (F1) 的效果如何?(见 4.4.1 节)
    • RQ4 (检索器鲁棒性):当更换第一阶段检索器时,IGP 的增益是否依然存在?(见 4.4.2 节)
    • RQ5 (生成器鲁棒性):IGP 能否跨生成器家族和参数规模进行泛化?(见 4.4.3 节)

    4.1. 实验设置

    本小节详细介绍了语料库、数据集、生成器主干、提示/解码协议、基准方案和评估指标。为了公平比较,我们固定了实验流水线——相同的语料库、候选集大小

    N

    N

    N、提示词、解码设置和预算执行器(截断:Top-

    M

    M

    M,可选令牌保护

    B

    B

    B)——仅改变重排序/准入策略(以及预算扫描中的

    M

    M

    M)。除非另有说明,IGP 是重排序阶段的即插即用替代方案;RQ4 额外改变了第一阶段检索器,RQ5 改变了生成器家族/规模。

    4.1.1. 语料库

    我们使用 FlashRAG (Jin et al., 2024) 发布的 Wikipedia 检索语料库作为外部知识库。该语料库基于 2018-12-20 的英文维基百科快照。清洗后将其分割为 100 词的非重叠段落,最终得到约 2100 万个段落。除非另有说明,所有检索、重排序和截断均在此语料库上进行。

    4.1.2. 数据集

    Dataset #Train #Dev #Test Category
    NQ 79,168 8,757 3,610 Real queries
    TriviaQA 78,785 8,837 11,313 Trivia facts
    PopQA / / 14,267 Long-tail knowledge
    SQuAD 87,599 10,570 / Reading comprehension
    AmbigQA 10,036 2,002 / Disambiguation

    表 2:数据集统计和类别标签(加粗表示评估中使用的划分)。

    我们在五个具有互补特性的经典 QA 基准上进行评估:NQ(真实世界搜索查询)、TriviaQA(开放域事实性 QA)、PopQA(流行文化和长尾实体)、SQuAD(阅读理解/抽取式)、以及 AmbigQA(具有歧义的开放域 QA,需要多个有效的解释/答案)。如表 2 所示,我们默认报告测试集(test)结果;当测试集不可公开获取时,我们使用开发集(dev)(即 NQ/TriviaQA/PopQA 使用 test,SQuAD/AmbigQA 使用 dev)。

    4.1.3. 语言模型(生成器主干)

    为了验证 IGP 的黑盒可用性和模型无关性,并系统研究模型家族和参数规模对端到端 RAG 的影响(见 4.4.3 节),我们选择了两个主流的开源指令微调模型家族作为生成器:Qwen2.5-Instruct 和 Llama-3.x-Instruct。所有模型均来自 Hugging Face (HF) 中心。推理使用 vLLM 实现,我们在不使用梯度或微调的情况下导出逐步 logits(或等效的 TopK 对数概率)。这些输出用于计算 TopK 归一化不确定性(NU)和信息增益(IG),从而驱动 IGP 的重排序和剪枝。

    Qwen2.5 家族(主实验和规模消融): Qwen2.5 提供了多个规模的指令模型。除非另有说明,我们的主要设置使用:

    • 主要模型: Qwen/Qwen2.5-7B-Instruct。
    • 不同规模: Qwen2.5-0.5B, 1.5B, 3B, 7B-Instruct。

    Llama 3.x 家族(跨家族泛化和规模消融): 为了测试 IGP 是否能跨模型家族泛化,我们引入了 Meta 的 Llama 3.x 指令模型,涵盖中小尺寸:

    • 不同规模: Llama-3.2-1B, 3B-Instruct 以及 Llama-3.1-8B-Instruct。

    4.1.4. 提示词与解码协议

    为了确保不同检索/重排序/截断策略之间端到端比较的公平性,我们固定了所有实验的提示词模板。我们使用两种提示词:(A) 最终的 RAG 答案生成提示词;(B) NU/IG 探测提示词。提示词 (A) 强制要求模型根据证据进行端到端 QA,而提示词 (B) 则简短且中性,以便在较低的提示词诱导干扰下获得更可靠的 logit 变化信号。除了文档排序/选择外,所有其他输入格式均保持一致。

    (A) 最终 RAG 答案生成提示词(基于证据的 QA): 该阶段要求模型仅使用提供的文档进行回答,且仅输出答案。设拼接后的文档为 {reference},问题为 {question}:

    System: You are given a question and a set of documents. Answer the question using only the information in the documents. Output only the answer.

    User: Documents: {reference}

    Question: {question} Answer:

    文档拼接格式: [DOC 1] {passage_1} [DOC 2] {passage_2} … [DOC M] {passage_M}

    此处

    M

    M

    M 是保留的段落数量,由截断深度或预算决定。所有方法共享此格式,区别仅在于段落的顺序和过滤方式。

    Original Abstract: Retrieval-augmented generation (RAG) grounds large language models with external evidence, but under a limited context budget, the key challenge is deciding which retrieved passages should be injected. We show that retrieval relevance metrics (e.g., NDCG) correlate weakly with end-to-end QA quality and can even become negatively correlated under multi-passage injection, where redundancy and mild conflicts destabilize generation. We propose \\textbf{Information Gain Pruning (IGP)}, a deployment-friendly reranking-and-pruning module that selects evidence using a generator-aligned utility signal and filters weak or harmful passages before truncation, without changing existing budget interfaces. Across five open-domain QA benchmarks and multiple retrievers and generators, IGP consistently improves the quality–cost trade-off. In a representative multi-evidence setting, IGP delivers about +12–20% relative improvement in average F1 while reducing final-stage input tokens by roughly 76–79% compared to retriever-only baselines.

    PDF Link: 2601.17532v1

    部分平台可能图片显示异常,请以我的博客内容为准

    赞(0)
    未经允许不得转载:171主机测评 » Less is More for RAG Information Gain Pruning for Generator-Aligned Reranking and Evidence Selection
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址