文章核心总结与创新点
主要内容
本文针对大型语言模型(LLMs)的不确定性量化(UQ)问题,提出了一个基于随机游走理论的全概率框架Inv-Entropy。该框架通过输入扰动与双马尔可夫链建模,捕捉输入与输出的语义关联,以逆模型视角量化给定输出下输入空间的多样性,从而实现更可靠的不确定性评估。同时,文章提出了GAAP扰动算法提升输入采样多样性,并引入TSU评估指标,无需依赖真实标签即可衡量不确定性量化效果。在问答、多选、数学推理等多类数据集上的实验表明,Inv-Entropy优于现有语义UQ方法,且适用于黑盒与灰盒模型。
创新点
翻译部分(Markdown格式)
Abstract
大型语言模型(LLMs)已彻底改变自然语言处理领域,但它们的可靠部署需要有效的不确定性量化(UQ)方法。现有UQ方法通常基于启发式设计,缺乏概率解释。本文首先为扰动在LLMs不确定性量化中的作用提


