欢迎光临
我们一直在努力

百度:可追溯的多智能体深度研究框架

在这里插入图片描述

📖标题:DuMate-DeepResearch: An Auditable Multi-Agent System with Recursive Search and Rubric-Grounded Reasoning
🌐来源:arXiv, 2606.07299v1

🛎️文章简介
🔸研究问题:如何解决现有深度研究系统在长程规划、任务分解调度、幻觉抑制及过程可审计性方面的局限?
🔸主要贡献:论文提出DuMate-DeepResearch框架,通过解耦架构、图动态规划、递归执行及评分标准引导机制,实现了高质量且可追溯的深度研究。

📝重点思路
🔸构建解耦的多智能体基础设施,将负责认知推理的智能体核心与负责检索渲染的工具生态系统分离,使所有中间决策和工具调用显式可追踪,解决过程审计难题。
🔸设计基于图的动态规划策略,将研究路线图建模为有向无环图,支持从粗到细的扩展、反思、重规划及并行分支,克服传统逐步推理缺乏全局视野的问题。
🔸采用递归两级执行架构,外层研究智能体负责全局调度,内层搜索智能体独立处理复杂子任务的检索循环,有效隔离噪声干扰并稳定长程执行。
🔸引入基于评分标准的测试时优化机制,动态生成任务特定的质量标准作为实时推理支架,指导证据锚定合成并提供自适应停止准则,缓解幻觉问题。

🔎分析总结
🔸在DeepResearch Bench上取得58.03%的最佳总分,在全面性和洞察力维度均排名第一,显著优于OpenAI及Gemini等商业基线系统。
🔸在DeepResearch Bench II上获得61.95%的最佳总分,并在信息召回和分析维度领先,证明其在证据获取与综合分析方面的卓越能力。
🔸消融实验表明,移除评分标准引导会导致报告质量下降,且报告生成模型的选择对最终质量影响最大,验证了推理支架与合成能力的协同价值。
🔸定性案例分析显示,系统能通过多轮检索和跨源验证生成包含条件结论与量化模型的长文报告,体现了动态边界定义与自适应深度的有效性。

💡个人观点
论文的创新点在于将“评分标准”从离线评估指标转化为在线推理的认知支架,递归嵌套的智能体设计巧妙平衡了全局战略与局部执行的冲突。
在这里插入图片描述
在这里插入图片描述

赞(0)
未经允许不得转载:171主机测评 » 百度:可追溯的多智能体深度研究框架
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址