欢迎光临
我们一直在努力

ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models

文章主要内容总结

本文针对大型语言模型(LLMs)面临的后门攻击问题,提出了一种轻量且高效的后门检测方法ConfGuard。后门攻击通过在训练过程中植入隐藏触发器,使模型在正常输入下表现正常,但在特定触发器输入时生成攻击者指定的恶意输出。现有防御方法多针对分类任务,难以适应LLMs的自回归特性和庞大输出空间,存在性能差、延迟高的问题。

研究发现,后门模型存在“序列锁定”(sequence lock)现象:在生成目标序列时,其输出token的置信度异常高且稳定,几乎无分支点;而良性模型生成时,置信度会因分支点波动。基于此,ConfGuard通过滑动窗口实时监控输出token的top-1置信度,当连续高置信度token的长度超过阈值时,判定为后门样本。

实验表明,ConfGuard在3种LLMs(Llama-3.1-8B-INST、Qwen2.5-7B-Instruct、Deepseek-7b-chat)、3种数据集(CommonsenseQA、SIQA、UltraChat 200k)和5种后门攻击类型上,真阳性率(TPR)接近100%,假阳性率(FPR)极低,且几乎无额外延迟,显著优于现有方法(如PPL、ONION、Cleangen)。

创新点

  • 发现“序列锁定”现象:首次揭示后门LLMs在生成目标序列时,会表现出异常高且稳定的token级置信度,形成“锁定”的生成路径,与良性生成存在显著行为差异。
  • 提出轻量实时的检测方法ConfGuard:通过滑动窗口机制监控输出token的top-1置信度,无需额外模型或数据集,仅需黑盒访
  • 赞(0)
    未经允许不得转载:171主机测评 » ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址