一、问题:当审核者只剩下一段纯文本
作者首先论证了一个现实场景:在开放世界里,审核与生成是解耦的。第三方审核者(社交平台、新闻机构)要审海量用户上传文本,根本不知道背后是哪个模型;而绝大多数终端用户是通过 ChatGPT、Gemini、Claude 这类网页界面与模型交互的,唯一可得的输出就是一段纯文本。于是商业 API、模型内部状态、外部知识库,通常统统不可用。
在这个约束下,主流方法几乎全部失效,作者将其归为三类并逐一指出局限:
- 检索增强 / 事实核查类(WikiChat、FactCHD 等):依赖 Web 或知识库,可用性与可靠性都难保证;
- 置信度 / 度量类(Perplexity、Semantic Entropy、TSV 等):依赖 logits 或隐藏层,对黑盒系统不可用;
- 自监督 / 一致性类(SelfCheckGPT 等):虽不碰内部状态,但用的是静态、任务无关的启发式,难以刻画跨领域、依赖上下文的精细判断。
更关键的是,多数检测器只给出二元标签或一个标量分,缺乏可解释性。作者由此提炼出核心观察:人类专家从不用单一标准下判断,而是把评估分解为多个维度、按上下文调整权重、给出有证据的判定。整篇论文就是把这一过程算法化。
形式上,记查询空间为 Q\\mathcal{Q}Q、回答空间为 A\\mathcal{A}A,对 q∈Qq \\in \\mathcal{Q}q∈Q 与生成回答 a∈Aa \\in \\mathcal{A}a∈A,检测器 fff 需输出二元标签 y∈{0,1}y \\in \\{0,1\\}y∈{0,1}。零信源约束意味着 fff 既不能访问模型内部状态或输出分布,也没有外部知识库或参考文本,只能基于 (q,a)(q,a)(q,a) 本身作判断。
二、方法总览:HCP 机制
HCPD 的核心是 HCP(Human-like Criteria Probing) 机制:用一个预训练 LLM 充当自适应评分 agent,把"打分"拆成可解释的多步。整体流程如下。

2.1 自适应标准生成与加权聚合
给定 (q,a)(q,a)(q,a),agent fθf_\\thetafθ 先从一个预定义的通用评价标准集 C\\mathcal{C}C 中实例化出一组细粒度标准 {ci}i=1m\\{c_i\\}_{i=1}^{m}{ci}i=1m,再自主分配上下文敏感的权重 {wi}i=1m\\{w_i\\}_{i=1}^{m}{wi}i=1m,最后逐条打分并加权汇总:
sp=∑i=1mwi⋅si,{(ci,wi,si)}i=1m←fθ(q,a;C)s_p = \\sum_{i=1}^{m} w_i \\cdot s_i, \\qquad \\{(c_i, w_i, s_i)\\}_{i=1}^{m} \\leftarrow f_\\theta(q, a; \\mathcal{C})sp=i=1∑mwi⋅si,{(ci,wi,si)}i=1m←fθ(q,a;C)
其中权重满足 wi≥0w_i \\ge 0wi≥0 且 ∑iwi=1\\sum_i w_i = 1∑iwi=1,各分项分数 sis_isi 为 {1,…,10}\\{1, \\dots, 10\\}{1,…,10} 的整数。通用标准集为:
C={Factual, Logical, Semantic, Temporal, Social}\\mathcal{C} = \\{\\text{Factual},\\ \\text{Logical},\\ \\text{Semantic},\\ \\text{Temporal},\\ \\text{Social}\\}C={Factual, Logical, Semantic, Temporal, Social}
在附录的提示词模板里,这五条展开为带四档评分量规的维度:事实核查、逻辑一致性、语义准确性、社会公平性、时间线核查。所谓"人味",体现在权重随上下文浮动——历史类问题会抬高时间准确性,科学解释类会抬高逻辑严密性。
一个极易看反的约定:分数方向是反的。分越高代表幻觉风险越低、越可靠;Score 1 = 严重幻觉,Score 10 = 完全无幻觉。
2.2 结构化输出
为保证可解释性与下游可聚合,agent 被强制按固定 schema 输出:
Specific Criteria: <实例化的标准及其权重>
Analysis: <逐条标准的证据分析>
Scores: \\boxed{x} # x ∈ {1, …, 10}
举例(原文 Table 1):对 “1948 年冬奥会在哪个国家举办?/ 挪威” 这一对,agent 生成 Factual Grounding (60%)、Temporal Consistency (20%)、Semantic Precision (20%),分析指出冬奥会实际在瑞士圣莫里茨而非挪威,最终给出 Score 1。
三、弱监督对齐训练:不要标注,借语义一致性"白嫖"信号
这是全文工程上最实在的一环。作者不依赖人工标注的幻觉标签,而是从标准 QA benchmark 里构造弱监督。
3.1 训练数据与弱标签
每个查询 qqq(取自 TriviaQA 等数据集)都有人工核验过的参考答案 a^\\hat{a}a^。作者再用一个辅助 LLM 为同一查询生成一批候选回答 {a(n)}n=1N\\{a^{(n)}\\}_{n=1}^{N}{a(n)}n=1N,有意覆盖从完全正确到明显捏造的全谱。随后用 BLEURT 计算每个候选与参考答案的语义一致性 sim(a^,a(n))∈[0,1]\\mathrm{sim}(\\hat{a}, a^{(n)}) \\in [0,1]sim(a^,a(n))∈[0,1],并离散化为 1–10 的弱标签:
sl(n)=clip (⌊10⋅sim(a^,a(n))⌉, 1, 10)s_l^{(n)} = \\mathrm{clip}\\!\\left(\\left\\lfloor 10 \\cdot \\mathrm{sim}(\\hat{a}, a^{(n)}) \\right\\rceil,\\ 1,\\ 10\\right)sl(n)=clip(⌊10⋅sim(a^,a(n))⌉, 1, 10)
参考答案 a^\\hat{a}a^ 直接赋满分 10。沿用 HaloScope 的做法,一致性 >0.5> 0.5>0.5 视为可信、<0.5< 0.5<0.5 视为幻觉,由此得到弱监督数据集 D\\mathcal{D}D。
3.2 得分对齐奖励
用 GRPO 训练 agent,奖励函数极简:
r={1−∣sp−sl∣9,well-formed0,otherwiser = \\begin{cases} 1 – \\dfrac{|s_p – s_l|}{9}, & \\text{well-formed} \\\\[6pt] 0, & \\text{otherwise} \\end{cases}r=⎩⎨⎧1−9∣sp−sl∣,0,well-formedotherwise
预测分等于弱标签时奖励为 1,偏差越大线性衰减;分母 9 来自最大可能偏差 10−110 – 110−1。格式不合规、解析不出分的输出直接归零——因此这个奖励顺带把结构化输出当成了硬约束。优化目标沿用 GRPO 的单组形式:
J(θ)=1G∑g=1G[fθ(Yg∣x)f0(Yg∣x)Ag]−β⋅DKL (fθ(⋅∣x) ∥ f0(⋅∣x))\\mathcal{J}(\\theta) = \\frac{1}{G}\\sum_{g=1}^{G}\\left[\\frac{f_\\theta(Y_g \\mid x)}{f_0(Y_g \\mid x)} A_g\\right] – \\beta \\cdot D_{\\mathrm{KL}}\\!\\left(f_\\theta(\\cdot \\mid x) \\,\\|\\, f_0(\\cdot \\mid x)\\right)J(θ)=G1g=1∑G[f0(Yg∣x)fθ(Yg∣x)Ag]−β⋅DKL(fθ(⋅∣x)∥f0(⋅∣x))
其中组相对优势 Ag=r(Yg)−1G∑j=1Gr(Yj)A_g = r(Y_g) – \\frac{1}{G}\\sum_{j=1}^{G} r(Y_j)Ag=r(Yg)−G1∑j=1Gr(Yj),β\\betaβ 控制 KL 正则强度。
3.3 为什么是可微打分而非二元分类
作者把"可微打分 vs. 二元 True/False"作为一个核心设计选择来论证,理由有三:其一,幻觉本身有严重程度梯度(从轻微数值偏差到完全捏造),二元标签会把这些信息压平;其二,线性惩罚给出的奖励地形比 0/1 稠密得多,policy gradient 信号更具方向性;其三,标量分在推理时可按不同阈值灵活权衡 precision/recall,无需重训。后文消融(第五节)确认了这一选择的必要性。
四、多采样聚合推理
由于语言模型生成的随机性,单次评估方差不小。作者对同一 (q,a)(q,a)(q,a) 独立调用 agent KKK 次,对最终分作算术平均:
sˉ=1K∑k=1Ksp(k)\\bar{s} = \\frac{1}{K}\\sum_{k=1}^{K} s_p^{(k)}sˉ=K1k=1∑Ksp(k)
这一步抑制随机波动、提升决策稳定性,同时保留了每次评估的标准与权重,不牺牲可解释性。
五、理论分析:三个保证及其推导
这一节是作者的理论支撑,给出训练侧与推理侧的端到端刻画。需要清醒的是:这些结论锚定的是弱标签 sls_lsl,而非真相——这一点在批判部分会展开。
5.1 Theorem 1(训练期望对齐)
优化 KL 正则的 GRPO 目标,使 agent 的期望解析分 μθ(x)≜E[Sθ(x)∣x]\\mu_\\theta(x) \\triangleq \\mathbb{E}[S_\\theta(x)\\mid x]μθ(x)≜E[Sθ(x)∣x] 在训练分布上逼近弱标签 sl(x)s_l(x)sl(x):
Ex [∣μθ(x)−sl(x)∣]≤J′(θ)\\mathbb{E}_x\\!\\left[|\\mu_\\theta(x) – s_l(x)|\\right] \\le J'(\\theta)Ex[∣μθ(x)−sl(x)∣]≤J′(θ)
其中 J′(θ)J'(\\theta)J′(θ) 与式 J(θ)\\mathcal{J}(\\theta)J(θ) 仿射等价。
推导。 固定输入 xxx,因 sl(x)s_l(x)sl(x) 是确定量:
∣μθ(x)−sl(x)∣=∣E[Sθ(x)−sl(x)∣x]∣|\\mu_\\theta(x) – s_l(x)| = \\left|\\mathbb{E}[S_\\theta(x) – s_l(x)\\mid x]\\right|∣μθ(x)−sl(x)∣=∣E[Sθ(x)−sl(x)∣x]∣
绝对值函数为凸函数,由 Jensen 不等式:
∣E[Sθ(x)−sl(x)∣x]∣≤E [∣Sθ(x)−sl(x)∣∣x]\\left|\\mathbb{E}[S_\\theta(x) – s_l(x)\\mid x]\\right| \\le \\mathbb{E}\\!\\left[|S_\\theta(x) – s_l(x)|\\mid x\\right]∣E[Sθ(x)−sl(x)∣x]∣≤E[∣Sθ(x)−sl(x)∣∣x]
对训练分布取期望:
Ex [∣μθ(x)−sl(x)∣]≤Ex,Y [∣sp(x,Y)−sl(x)∣](∗)\\mathbb{E}_x\\!\\left[|\\mu_\\theta(x) – s_l(x)|\\right] \\le \\mathbb{E}_{x,Y}\\!\\left[|s_p(x,Y) – s_l(x)|\\right] \\tag{$\\ast$}Ex[∣μθ(x)−sl(x)∣]≤Ex,Y[∣sp(x,Y)−sl(x)∣](∗)
而由 3.2 的奖励结构,最小化 KL 正则的 GRPO 目标等价(仿射常数意义下)于最小化
J′(θ)=Ex,Y [∣sp(x,Y)−sl(x)∣]+λ⋅ExDKL (fθ(⋅∣x) ∥ f0(⋅∣x)),λ∝βJ'(\\theta) = \\mathbb{E}_{x,Y}\\!\\left[|s_p(x,Y) – s_l(x)|\\right] + \\lambda \\cdot \\mathbb{E}_x D_{\\mathrm{KL}}\\!\\left(f_\\theta(\\cdot\\mid x)\\,\\|\\,f_0(\\cdot\\mid x)\\right),\\quad \\lambda \\propto \\betaJ′(θ)=Ex,Y[∣sp(x,Y)−sl(x)∣]+λ⋅ExDKL(fθ(⋅∣x)∥f0(⋅∣x)),λ∝β
由 KL 项非负,得 Ex,Y[∣sp−sl∣]≤J′(θ)\\mathbb{E}_{x,Y}[|s_p – s_l|] \\le J'(\\theta)Ex,Y[∣sp−sl∣]≤J′(θ),与 (∗)(\\ast)(∗) 合并即证。
5.2 Proposition 1(多采样集中)
固定推理输入 xxx,设 KKK 个良构生成 Y1,…,YK∼i.i.d.fθ(⋅∣x)Y_1, \\dots, Y_K \\overset{\\text{i.i.d.}}{\\sim} f_\\theta(\\cdot\\mid x)Y1,…,YK∼i.i.d.fθ(⋅∣x),解析分 Sθ(k)(x)∈{1,…,10}S_\\theta^{(k)}(x) \\in \\{1, \\dots, 10\\}Sθ(k)(x)∈{1,…,10}。则对任意 u>0u > 0u>0:
P (∣sˉ(x)−E[Sθ(x)∣x]∣≥u∣x)≤2exp (−2Ku281)P\\!\\left(|\\bar{s}(x) – \\mathbb{E}[S_\\theta(x)\\mid x]| \\ge u \\mid x\\right) \\le 2\\exp\\!\\left(-\\frac{2Ku^2}{81}\\right)P(∣sˉ(x)−E[Sθ(x)∣x]∣≥u∣x)≤2exp(−812Ku2)
推导。 条件于 xxx,{Sθ(k)(x)}\\{S_\\theta^{(k)}(x)\\}{Sθ(k)(x)} 独立同分布且取值有界于 [1,10][1, 10][1,10],区间长度 b−a=10−1=9b – a = 10 – 1 = 9b−a=10−1=9。直接套用有界变量的 Hoeffding 不等式,将 (10−1)2=81(10-1)^2 = 81(10−1)2=81 代入即得。这就是"多采样降方差"的形式化。
5.3 Corollary 1(排序误差分解)
这是理论部分最有价值的一块。作者把弱标签建模为 sl(x)=g(s⋆(x))+ϵ(x)s_l(x) = g(s^\\star(x)) + \\epsilon(x)sl(x)=g(s⋆(x))+ϵ(x),其中 s⋆s^\\stars⋆ 是几乎不可得的真实幻觉严重度,ggg 单调非减,ϵ\\epsilonϵ 是有界代理偏差 ∣ϵ(x)∣≤bmax|\\epsilon(x)| \\le b_{\\max}∣ϵ(x)∣≤bmax。设 x+x^+x+、x−x^-x− 分别独立取自真实(非幻觉)与幻觉输入的分布,定义排序误差 Erank≜P(sˉ(x+)≤sˉ(x−))E_{\\text{rank}} \\triangleq P(\\bar{s}(x^+) \\le \\bar{s}(x^-))Erank≜P(sˉ(x+)≤sˉ(x−))。
对任意 Δ>bmax\\Delta > b_{\\max}Δ>bmax:
Erank≤P (g(s⋆(x+))−g(s⋆(x−))≤2Δ)⏟intrinsic separability+4J′(θ)Δ−bmax⏟training alignment+4exp (−2K81(Δ−bmax2)2)⏟multi-sampling concentrationE_{\\text{rank}} \\le \\underbrace{P\\!\\left(g(s^\\star(x^+)) – g(s^\\star(x^-)) \\le 2\\Delta\\right)}_{\\text{intrinsic separability}} + \\underbrace{\\frac{4J'(\\theta)}{\\Delta – b_{\\max}}}_{\\text{training alignment}} + \\underbrace{4\\exp\\!\\left(-\\frac{2K}{81}\\left(\\frac{\\Delta – b_{\\max}}{2}\\right)^{2}\\right)}_{\\text{multi-sampling concentration}}Erank≤intrinsic separabilityP(g(s⋆(x+))−g(s⋆(x−))≤2Δ)+training alignmentΔ−bmax4J′(θ)+multi-sampling concentration4exp(−812K(2Δ−bmax)2)
推导思路。 令 δ≜Δ−bmax2>0\\delta \\triangleq \\frac{\\Delta – b_{\\max}}{2} > 0δ≜2Δ−bmax>0,并定义事件 A≜{g(s⋆(x+))−g(s⋆(x−))≤2Δ}A \\triangleq \\{g(s^\\star(x^+)) – g(s^\\star(x^-)) \\le 2\\Delta\\}A≜{g(s⋆(x+))−g(s⋆(x−))≤2Δ}。在补集 AcA^cAc 上有 g(s⋆(x+))−g(s⋆(x−))≥2Δg(s^\\star(x^+)) – g(s^\\star(x^-)) \\ge 2\\Deltag(s⋆(x+))−g(s⋆(x−))≥2Δ;此时若两个样本的分都接近其真值(∣sˉ(x)−g(s⋆(x))∣≤Δ|\\bar{s}(x) – g(s^\\star(x))| \\le \\Delta∣sˉ(x)−g(s⋆(x))∣≤Δ),则
sˉ(x+)≥g(s⋆(x+))−Δ≥g(s⋆(x−))+Δ≥sˉ(x−)\\bar{s}(x^+) \\ge g(s^\\star(x^+)) – \\Delta \\ge g(s^\\star(x^-)) + \\Delta \\ge \\bar{s}(x^-)sˉ(x+)≥g(s⋆(x+))−Δ≥g(s⋆(x−))+Δ≥sˉ(x−)
即保序。因此排序误差事件被包含于 A∪{∣sˉ(x+)−g(s⋆(x+))∣>Δ}∪{∣sˉ(x−)−g(s⋆(x−))∣>Δ}A \\cup \\{|\\bar{s}(x^+) – g(s^\\star(x^+))| > \\Delta\\} \\cup \\{|\\bar{s}(x^-) – g(s^\\star(x^-))| > \\Delta\\}A∪{∣sˉ(x+)−g(s⋆(x+))∣>Δ}∪{∣sˉ(x−)−g(s⋆(x−))∣>Δ},由并集界:
Erank≤P(A)+P (∣sˉ(x+)−g(s⋆(x+))∣>Δ)+P (∣sˉ(x−)−g(s⋆(x−))∣>Δ)E_{\\text{rank}} \\le P(A) + P\\!\\left(|\\bar{s}(x^+) – g(s^\\star(x^+))| > \\Delta\\right) + P\\!\\left(|\\bar{s}(x^-) – g(s^\\star(x^-))| > \\Delta\\right)Erank≤P(A)+P(∣sˉ(x+)−g(s⋆(x+))∣>Δ)+P(∣sˉ(x−)−g(s⋆(x−))∣>Δ)
对单个 xxx,由三角不等式 ∣sˉ(x)−g(s⋆(x))∣≤∣sˉ(x)−sl(x)∣+bmax|\\bar{s}(x) – g(s^\\star(x))| \\le |\\bar{s}(x) – s_l(x)| + b_{\\max}∣sˉ(x)−g(s⋆(x))∣≤∣sˉ(x)−sl(x)∣+bmax,故 ∣sˉ(x)−g(s⋆(x))∣>Δ|\\bar{s}(x) – g(s^\\star(x))| > \\Delta∣sˉ(x)−g(s⋆(x))∣>Δ 蕴含 ∣sˉ(x)−sl(x)∣>Δ−bmax=2δ|\\bar{s}(x) – s_l(x)| > \\Delta – b_{\\max} = 2\\delta∣sˉ(x)−sl(x)∣>Δ−bmax=2δ。再拆 ∣sˉ(x)−sl(x)∣≤∣sˉ(x)−μθ(x)∣+∣μθ(x)−sl(x)∣|\\bar{s}(x) – s_l(x)| \\le |\\bar{s}(x) – \\mu_\\theta(x)| + |\\mu_\\theta(x) – s_l(x)|∣sˉ(x)−sl(x)∣≤∣sˉ(x)−μθ(x)∣+∣μθ(x)−sl(x)∣,于是
P (∣sˉ(x)−g(s⋆(x))∣>Δ)≤P (∣sˉ(x)−μθ(x)∣>δ)⏟Prop. 1+P (∣μθ(x)−sl(x)∣>δ)⏟Markov + Thm. 1P\\!\\left(|\\bar{s}(x) – g(s^\\star(x))| > \\Delta\\right) \\le \\underbrace{P\\!\\left(|\\bar{s}(x) – \\mu_\\theta(x)| > \\delta\\right)}_{\\text{Prop. 1}} + \\underbrace{P\\!\\left(|\\mu_\\theta(x) – s_l(x)| > \\delta\\right)}_{\\text{Markov + Thm. 1}}P(∣sˉ(x)−g(s⋆(x))∣>Δ)≤Prop. 1P(∣sˉ(x)−μθ(x)∣>δ)+Markov + Thm. 1P(∣μθ(x)−sl(x)∣>δ)
第一项由 Proposition 1 得 ≤2exp(−2Kδ2/81)\\le 2\\exp(-2K\\delta^2/81)≤2exp(−2Kδ2/81);第二项由 Markov 不等式与 Theorem 1 得 ≤J′(θ)/δ\\le J'(\\theta)/\\delta≤J′(θ)/δ。两项之和对 x+x^+x+、x−x^-x− 各算一次代回并集界,再把 δ=Δ−bmax2\\delta = \\frac{\\Delta – b_{\\max}}{2}δ=2Δ−bmax 代入,即得三项分解。
这个分解的价值:它把检测性能干净地归因到三件事——数据内在可分性、训练对齐损失 J′(θ)J'(\\theta)J′(θ)、采样数 KKK。结论很漂亮:减小 J′(θ)J'(\\theta)J′(θ)、增大 KKK 都能压低错误界,且第三项随 KKK 指数衰减,为"GRPO 对齐 + 多采样聚合"两个设计选择各自提供了理论说法。
六、实验结果
设定:四个标准 QA 数据集(TriviaQA、SciQ、NQ Open、CoQA),3:1 划分,5 次随机种子取平均,指标为 AUROC,以 BLEURT >0.5> 0.5>0.5 作为真值代理。Agent 本体为 Qwen-2.5-7B,用 Open-R1 实现的 GRPO 在 2 张 A800 上训练。被测目标模型覆盖 7 个:LLaMA-3.1-8B/70B、LLaMA-2-7B/13B、Qwen-3-8B、Qwen-2.5-7B/14B。
6.1 主实验
下表为 LLaMA-3.1-8B 上的完整对比(AUROC %,♣ 表示用全标注数据训练的方法;HCPD 仅用弱监督且只看 (q,a)(q,a)(q,a))。
| LN-Entropy | 73.62 | 62.69 | 52.36 | 74.52 | 65.80 |
| Self-evaluation | 56.07 | 54.12 | 59.83 | 62.51 | 58.13 |
| CCS | 78.20 | 58.85 | 55.50 | 68.98 | 65.38 |
| SelfCKGPT | 74.58 | 59.68 | 62.13 | 70.61 | 66.75 |
| Perplexity | 80.62 | 66.12 | 57.92 | 81.41 | 71.52 |
| SAPLMA ♣ | 78.51 | 85.63 | 76.23 | 71.58 | 77.99 |
| Semantic Entropy | 78.71 | 77.81 | 61.04 | 75.26 | 73.21 |
| Lexical Similarity | 77.96 | 67.09 | 62.85 | 77.53 | 71.36 |
| EigenScore | 51.35 | 51.52 | 52.17 | 52.00 | 51.76 |
| HaloScope ♣ | 58.19 | 69.04 | 63.38 | 72.11 | 65.68 |
| TAD ♣ | 72.01 | 66.75 | 68.88 | 74.86 | 70.63 |
| TSV ♣ | 79.78 | 80.01 | 70.17 | 69.31 | 74.82 |
| HCPD(Ours) | 86.25 | 86.04 | 90.38 | 90.07 | 88.19 |
HCPD 平均 AUROC 88.19%,比次优的 SAPLMA(77.99%)高 10.20%。但增益分布并不均匀:NQ Open 上对 SAPLMA 提升达 14.15%、CoQA 对 Perplexity 提升 8.66%、TriviaQA 对 Perplexity 提升 5.63%,而 SciQ 仅比 SAPLMA 高 0.41%,基本打平。在 Qwen-3-8B 上结论类似:HCPD 平均 89.62%(93.69 / 92.63 / 87.35 / 84.80),领先次优 SAPLMA(79.47%)10.15%。
6.2 跨模型迁移性(最关键的结果)
我认为这才是 HCPD 真正的差异化优势所在。HCPD 在自然语言空间工作,而自然语言为所有 LLM 共享,因此天然具备跨模型迁移能力。下表为"源模型 LLaMA-3.1-8B、数据集 TriviaQA"下,检测器迁移到 7 个不同目标模型的表现(AUROC %)。
| SAPLMA | 78.51 | 77.63 | 78.13 | 78.25 | 71.63 | 69.70 | 63.77 |
| HaloScope | 58.19 | 86.50 | 82.68 | 90.88 | 54.99 | 68.37 | 68.33 |
| TSV | 79.78 | 81.29 | 82.85 | 88.06 | 59.89 | 77.07 | 61.17 |
| HCPD(Ours) | 86.25 | 86.87 | 90.74 | 93.43 | 78.89 | 88.84 | 83.34 |
当迁移到异构目标模型(尤其跨家族的 Qwen 系列)时,依赖代理模型内部特征的 TSV、HaloScope 因分布漂移显著掉点(TSV 在 Qwen-3-8B 上掉到 59.89、在 Qwen-2.5-14B 上 61.17),而 HCPD 始终稳定在 78~93。这正是零信源方法在"不知道文本由谁生成"的真实部署中最该具备的性质。一个有意思的副现象:面对更老的模型(LLaMA-2、Qwen-2.5),检测反而更准——作者解释为老模型输出不够流畅逼真,幻觉更易辨认。
6.3 消融实验
控制分解(Table 4)把贡献拆开看,结论很说明问题:
| Self-evaluation(基线) | 56.07 |
| HCPD(仅 HCP 机制,Pre-RL) | 66.54 |
| HCPD(HCP + GRPO,Post-RL) | 86.25 |
仅靠"假装人类评审拆标准"的 HCP 机制只带来 +10.47% 的提升;真正的大头来自 GRPO 对齐的 +19.71%。换言之,把打分校准到弱标签上,才是性能的主引擎,prompt 层面的标准分解只是前提。
奖励设计(Figure 3):把可微打分换成二元 0/1 信号后,TriviaQA 从 86.25% 掉到 79.06%,CoQA 更是从 90.07% 崩到 51.75%。作者归因于决策边界附近样本缺失了严重程度信息——这与 3.3 的设计论证形成闭合验证。
采样数 KKK(Table 5):这里有一处值得留意的反差。理论上 KKK 带来指数级收益,但经验增益很小——TriviaQA 上 K=1→5K{=}1 \\to 5K=1→5 仅从 85.21% 涨到 86.25%(约 1 个点),K=5→10K{=}5 \\to 10K=5→10 基本持平,而推理时间随 KKK 线性增长(K=1/2/5/10K{=}1/2/5/10K=1/2/5/10 分别为 0.2349 / 0.4675 / 1.1313 / 2.2807 秒)。作者据此取 K=5K{=}5K=5,并坦承 K=1K{=}1K=1 时就已超过所有基线。
6.4 效率
HCPD 在效率上并不吃亏(Table 11,TriviaQA / LLaMA-3.1-8B):
| SelfCKGPT | 74.58 | 6.5310 | 17540 |
| Semantic Entropy | 78.71 | 14.3026 | 17185 |
| Lexical Similarity | 77.96 | 36.5646 | 17185 |
| EigenScore | 51.35 | 37.7550 | 17453 |
| HCPD(K = 1) | 85.21 | 0.2349 | 18513 |
| HCPD(K = 5) | 86.25 | 1.1313 | 19051 |
K=1K{=}1K=1 时延迟与轻量度量同级,远快于一致性类方法;且因无需提取内部状态,不额外吃显存,固定 7B 体量在评估大模型输出时反而更省。此外作者验证 BLEURT 只是选项而非依赖——换成 ROUGE 或 DeepSeek-V3 作判官,HCPD 同样能对齐到对应信号(Table 6)。
七、批判性评估
该给的肯定要给:零信源问题的形式化、模型无关带来的强迁移性、免标注的弱监督方案、可微打分的设计,这几条是实打实的,迁移性那组实验尤其有说服力,作者也诚实地放出了失败案例(Figure 9)。但有四处问题,技术读者必须看清。
其一,形式化与实际行为之间存在裂缝。 式 (2)(2)(2) 声称 sp=∑iwisis_p = \\sum_i w_i s_isp=∑iwisi 是聚合机制,但 agent 本质上只是一个生成最终 \\boxed{} 数字的 LLM,没有任何机制保证这个数字等于它自己列出的各分项加权和。论文自己的失败图就直接证伪了这一点:SciQ 的 “vestigial structures” 案例中,agent 给各标准打了 7/8/9/10,加权怎么算都该在 7~8,最终却输出 \\boxed{4};CoQA 的 “Franz Bussman” 案例各标准全是 9/10,最终却 \\boxed{2}。奖励 r=1−∣sp−sl∣/9r = 1 – |s_p – s_l|/9r=1−∣sp−sl∣/9 只对齐最终数字,于是模型完全可以无视自己声称的标准与权重。这让"可解释性"的根基有点悬——展示出来的标准/权重可能是事后装饰,并不真正驱动那个分数。
其二,知识天花板,且可解释性反而可能放大风险。 零信源没有外部查证,agent 完全押注在 Qwen-2.5-7B 的参数化知识上。一旦它记错或不知道,就会自信地误判。最讽刺的证据藏在论文的成功案例里:Figure 5 中,对"1940 年 4 月出生、本名 Ronald William Wycherley 的已故英国歌手是谁",被测回答"Tom Jones"是幻觉,agent 给了低分 2、与真值对上——但它给出的理由是"正确答案应为 Roddy Woomble",而这个人实为 Billy Fury(本名 Ronald Wycherley,1940 年 4 月 17 日生于利物浦),Roddy Woomble 是 1976 年出生的 Idlewild 主唱。agent 在打分理由里幻觉了,分数却蒙对了。 一个结构工整、五条标准齐全的错误分析,比一个朴素的正确判断更具误导性。
其三,评估存在循环性。 训练标签来自 BLEURT >0.5> 0.5>0.5,评估的 AUROC 真值也是 BLEURT >0.5> 0.5>0.5。本质上是在训练 agent 模仿 BLEURT,再评估它模不模仿得像 BLEURT。Corollary 1 用 sl=g(s⋆)+ϵs_l = g(s^\\star) + \\epsilonsl=g(s⋆)+ϵ 隐晦承认了"弱标签 ≠\\ne= 真相",但最该担心的代理偏差 bmaxb_{\\max}bmax 全程只是一个有界假设,没有任何经验刻画。补充的 ROUGE / DeepSeek-V3 信号只是换了个代理,并未跳出代理。所以理论证明的是"对齐到代理信号",而非"对齐到真相"。
其四,理论与经验的落差,加上单一 agent。 6.3 已显示:Hoeffding 指数界很漂亮,但 K=1→5K{=}1 \\to 5K=1→5 实际只涨约 1 个点,说明主导误差源是 agent 的知识/偏差,而非采样方差——那套精致的集中不等式,相对其实际回报是被高估了的。此外,全部实验只用一个 Qwen-2.5-7B 作 agent,没有任何 agent 消融,"换更强或更弱的评审模型,结论是否成立"完全未知,而这个 7B 的知识边界被焊死在了所有结论里。
八、结语
HCPD 给出了一个动机扎实、迁移性结果亮眼的零信源幻觉检测范式:把单一打分拆成"自适应标准 + 上下文权重 + 加权聚合",再用 GRPO 把这套行为校准到免标注的语义一致性信号上,并辅以多采样聚合与一套三项分解的理论。它真正的价值不在主榜单的绝对数字,而在模型无关的迁移稳定性——这恰好对应了它所主张的现实场景。
但读者也应清醒:这套方法的能力天花板是评审 agent 自身的参数化知识,它的"可解释性"在错误判断上同样工整可信,而它的评估范式与真相之间隔着一个未被刻画的 BLEURT 偏差。把它当作一个廉价、可迁移、带证据输出的黑盒检测器来用是合理的;但若把它产出的标准与权重当作可信的诊断依据,则需要额外的验证——因为论文自己的失败图已经表明,那个最终分数未必真的来自它所展示的推理。




