欢迎光临
我们一直在努力

2025_NIPS_FELM: Benchmarking Factuality Evaluation of Large Language Models

文章总结与翻译

一、主要内容

本文聚焦大型语言模型(LLMs)生成文本的事实性评估这一关键研究领域,针对现有事实性评估方法缺乏全面、精细的元评估基准的问题,提出了名为FELM(Factuality Evaluation of large Language Models)的基准数据集。

核心构建内容

  • 覆盖多领域场景:突破传统基准仅关注世界知识领域的局限,涵盖世界知识、科技、数学、写作与推荐、推理五大核心领域,贴合LLMs的多任务应用场景。
  • 精细标注体系:采用文本片段(segment)级别的标注粒度,不仅标注事实正确性标签,还补充了预定义错误类型(知识错误、推理错误、无关错误、受误导错误)、错误原因及支持/反驳的参考链接,实现错误的精准定位。
  • 严谨构建流程:通过多源prompt收集(含Quora、标准基准数据集、人工撰写等)、ChatGPT零样本生成响应、文本分段(句子边界分割或ChatGPT辅助分割)、专家标注与多重验证(标注一致性校验、参考可靠性与安全性验证)四大步骤构建数据集,最终包含847个样本、4425个片段,响应级错误率33.3%,标注一致性达91.3%。
  • 实验与关键发现

  • 评估对象与方案:以Vicuna-33B、ChatGPT、GPT-4为基础模型,设计了片段级与声明级(提取原子事实)两种评估范式,每种范式下包含 va
  • 赞(0)
    未经允许不得转载:171主机测评 » 2025_NIPS_FELM: Benchmarking Factuality Evaluation of Large Language Models
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址