欢迎光临
我们一直在努力

美团:高难度搜索智能体基准LoHoSearch

在这里插入图片描述

📖标题:LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling
🌐来源:arXiv, 2606.12837v1

🛎️文章简介
🔸研究问题:如何解决现有人工构建的搜索智能体基准测试因缺乏全局视角而迅速饱和、难以评估长程推理能力的问题?
🔸主要贡献:论文提出了基于知识图谱自动化构建的高难度基准LoHoSearch,通过系统控制搜索空间与结构复杂度,突破了人工标注的难度上限。

📝重点思路
🔸构建包含760万实体的维基百科知识图谱,利用全局统计信息筛选低流行度实体与大搜索空间关系,从根源上避免简单推断。
🔸设计树状与图状两种子图采样策略,树状结构侧重扩大搜索空间,图状结构引入循环依赖与交叉约束以增加结构复杂性,并确保答案在图谱层面的唯一性。
🔸采用“子图采样-关系混淆-搜索验证-人工审核”的全自动QA生成流水线,将结构化子图转化为自然语言问题,并通过多轮自动化与人工校验保证质量与难度。
🔸建立双重评估机制,结合GPT-4.1与Qwen2.5-32B作为裁判模型取平均分,以更准确地衡量模型在极高难度下的真实表现与置信度校准误差。

🔎分析总结
🔸最强模型GPT-5.5在LoHoSearch上准确率仅为34.74%,远低于其在BrowseComp上的表现,证实该基准具有极强的区分度与挑战性。
🔸解决LoHoSearch问题所需的平均工具调用次数比BrowseComp多出74%,表明其对长程推理和多步检索能力提出了更高要求。
🔸现有的上下文管理策略(如摘要或丢弃重置)在该基准上仅带来6.8%的提升,远低于旧基准上的收益,暴露了当前技术在处理高复杂度任务时的根本局限。
🔸对比分析显示,LoHoSearch中隐藏实体的流行度显著更低且关系搜索空间更大,证明了知识图谱驱动方法在构建高难度问题上优于人工编写。

💡个人观点
论文将搜索基准的构建从“人工经验驱动”转变为“数据指标驱动”。传统基准依赖标注者的主观认知,容易受限于人类知识盲区而导致难度封顶。LoHoSearch巧妙地利用知识图谱的全局拓扑属性,将“搜索空间大小”和“结构复杂度”量化为可控制的生成参数。
在这里插入图片描述

赞(0)
未经允许不得转载:171主机测评 » 美团:高难度搜索智能体基准LoHoSearch
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址