
文章核心总结
本文聚焦多模态大语言模型(MLLMs)的推理型幻觉问题,提出了首个专门隔离推理幻觉的基准测试集MIRAGE和缓解方法Logos。核心发现包括模型/数据规模与训练阶段显著影响逻辑、事实类幻觉,但对空间幻觉改善有限,且不同问题类型对应独特幻觉模式。

本文聚焦多模态大语言模型(MLLMs)的推理型幻觉问题,提出了首个专门隔离推理幻觉的基准测试集MIRAGE和缓解方法Logos。核心发现包括模型/数据规模与训练阶段显著影响逻辑、事实类幻觉,但对空间幻觉改善有限,且不同问题类型对应独特幻觉模式。