欢迎光临
我们一直在努力

2025_NIPS_MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM

在这里插入图片描述

文章核心总结

本文聚焦多模态大语言模型(MLLMs)的推理型幻觉问题,提出了首个专门隔离推理幻觉的基准测试集MIRAGE和缓解方法Logos。核心发现包括模型/数据规模与训练阶段显著影响逻辑、事实类幻觉,但对空间幻觉改善有限,且不同问题类型对应独特幻觉模式。


主要创新点

  • MIRAGE基准测试集:首份专注推理幻觉的数据集,含1329个问题,确保模型正确感知输入但存在推理错误,提供最终答案、中间推理步骤、真实推理链三层标注。
  • 多粒度评估指标:提出准确性(整体答案正确性)、事实性(中间步骤/主张正确性)、LLMs幻觉分数(全推理链幻觉程度)三类指标,全面量化幻觉。
  • Logos缓解方法:结合课程强化微调(CRFT)逐步降低学习难度,以及协同提示推理(CHI)减少推理复杂度,有效降低逻辑幻觉并提升答案准确性。
  • 关键实证发现:揭示模型/数据规模、训练阶段与幻觉类型的关联,明确空间幻觉是当前MLLMs的核心视觉推理短板。

  • 翻译部分(Markdown格式)

    Abstract
    赞(0)
    未经允许不得转载:171主机测评 » 2025_NIPS_MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址