文章主要内容总结
本文针对大型语言模型(LLMs)面临的后门攻击问题,提出了一种轻量且高效的后门检测方法ConfGuard。后门攻击通过在训练过程中植入隐藏触发器,使模型在正常输入下表现正常,但在特定触发器输入时生成攻击者指定的恶意输出。现有防御方法多针对分类任务,难以适应LLMs的自回归特性和庞大输出空间,存在性能差、延迟高的问题。
研究发现,后门模型存在“序列锁定”(sequence lock)现象:在生成目标序列时,其输出token的置信度异常高且稳定,几乎无分支点;而良性模型生成时,置信度会因分支点波动。基于此,ConfGuard通过滑动窗口实时监控输出token的top-1置信度,当连续高置信度token的长度超过阈值时,判定为后门样本。
实验表明,ConfGuard在3种LLMs(Llama-3.1-8B-INST、Qwen2.5-7B-Instruct、Deepseek-7b-chat)、3种数据集(CommonsenseQA、SIQA、UltraChat 200k)和5种后门攻击类型上,真阳性率(TPR)接近100%,假阳性率(FPR)极低,且几乎无额外延迟,显著优于现有方法(如PPL、ONION、Cleangen)。

