欢迎光临
我们一直在努力

用知识蜜罐捕获大语言模型提取攻击

大家读完觉得有帮助记得关注和点赞!!!

摘要
作为商业API部署的大型语言模型容易受到模型提取攻击,而现有的防御措施要么反应过迟,要么会降低合法用户的可用性。我们提出了Knowledge Trap(知识陷阱),一种通过蜜罐知识图谱(HKG)和面包屑引导的探索,将提取攻击重定向到低迁移性知识的防御方法。Knowledge Trap不是阻断查询或扰动输出,而是将攻击者有限的查询预算消耗在对下游应用几乎无用的知识上,同时保持良性用户的性能。在医疗和金融领域的实验表明,Knowledge Trap在不降低合法用户准确率的情况下,平均降低了替代模型的一致性(Agreement)6.2%,优于现有防御措施(这些措施会带来可测量的用户影响)。这些结果表明,防御知识空间遍历是缓解LLM提取攻击的一个实用方向。


1. 引言

大型语言模型(LLM)越来越多地作为闭源API部署在高风险应用中,如临床决策支持和金融分析(Achiam等,2023;Brown等,2020;Singhal等,2023;Hurst等,2024)。这种部署模式容易受到模型提取攻击(MEA),攻击者可以通过反复查询API、收集输入-输出对,并以原始训练成本的一小部分提取出高保真的替代模型(Tramèr等,2016;Papernot等,2017;Krishna等,2019;Xu等,2022;Birch等,2023;Carlini等,2024;Zhao等,2025)。因此,防御MEA是一个紧迫的实际挑战。

有效的防御很困难,因为它必须同时干扰提取过程,同时为合法用户保持响应质量。被动防御如查询检测(Juuti等,2019;Zhang等,2021)和水印(Jia等,2021;Zhao等,2022;Peng等,2023;Zhao等,2024;He等,2022;Szyller等,2021)能保持良性可用性,但只能在提取成功后干预。主动防御如输出扰动(Orekondy等,2019b;Kariyappa和Qureshi,2020)、工作量证明方案(Dziedzic等,2022)和MISLEADER(Cheng等,2025)在提取过程中进行干预,但通常会降低合法用户的可用性。最近的欺骗式防御如HoneypotNet(Wang等,2025)试图通过输出级或参数级陷阱来回避这种权衡,但攻击者的知识获取过程仍未得到有效防御。

关键地,所有现有防御都忽视了一个根本的不对称性:查询预算是攻击者的主要约束。现代MEA严重依赖主动学习,以在有限的API预算下最大化每次查询的信息增益(Correia-Silva等,2018;Juuti等,2019;Pal等,2020;Jagielski等,2020;Chandrasekaran等,2020;Dai等,2023),而现有防御要么在提取后反应,要么降低良性用户的可用性。受此差距的驱动,我们提出了Knowledge Trap,一种通过蜜罐知识图谱(HKG)和面包屑引导的探索,将提取攻击重定向到低迁移性知识的防御方法。一旦攻击者进入HKG,他们将继续在低迁移性知识上消耗预算,而合法用户不受影响。

我们的贡献如下:

❐ 我们引入了Knowledge Trap,将模型提取攻击重定向到低迁移性知识,而不是被动地检测或阻断它们。

❐ 我们构建了一个蜜罐知识图谱(HKG)以及一个基于面包屑的引导机制,将基于主动学习的提取攻击困在不可迁移的知识区域中。

❐ 我们提供了理论和实证分析,表明Knowledge Trap将预算受限的提取攻击重定向到低迁移性知识,同时基本不影响良性用户。

图1:Knowledge Trap防御流程概览。


2. 问题形式化

2.1 知识分类

大型语言模型在预训练和微调过程中获得了广泛的知识体𝒦,但并非所有知识对下游应用的贡献都相同。例如,一个医疗QA模型主要依赖临床推理和治疗知识,同时也编码了大量外围信息,如语法规则、历史琐事和细枝末节的过程细节,这些对医疗QA性能的贡献微乎其微。设𝒯表示受害模型所部署的下游任务集。我们将模型的知识分为两类。

定义1(任务关键知识)。 如果在一个从𝒦c中抽取的QA对数据集上训练模型,相比无信息的基础模型,能在𝒯任务上带来显著提升,则子集𝒦c ⊆ 𝒦是相对于𝒯的任务关键知识。

定义2(低迁移性知识)。 如果在一个从𝒦0中抽取的QA对数据集上训练模型,相比无信息的基础模型,在𝒯任务上带来可忽略或无提升,则子集𝒦0 ⊆ 𝒦是相对于𝒯的低迁移性知识。

直观地说,𝒦c是防御者希望保护的知识,而𝒦0包含事实正确但低效用的知识。这种区分是任务依赖的:语法知识对医疗QA可能是低迁移性的,但对语法纠错则是关键的。这一形式化将模型提取重新定义为对模型知识空间的选择性遍历,其中不同区域贡献不均。

2.2 威胁模型

受害模型。 设fv: 𝒳 → 𝒴表示受害模型,是一个作为黑盒API部署的大语言模型。攻击者无法访问模型权重、架构或训练数据,只能通过输入-输出查询与模型交互。受害模型的商业价值主要来自其任务关键知识𝒦c。

攻击者。 攻击者的目标是通过在预算B内选择最大化信息增益的查询{x_t}_{t=1}^B来构建一个近似fv的替代模型fa:

其中α是一个采集函数,优先选择替代模型最不确定的查询(Dai等,2023;Pal等,2020)。

依赖𝒦c的查询响应会增强替代模型,而仅依赖𝒦0的查询只消耗预算而不提升性能。

2.3 问题陈述

防御者目标。 防御者旨在:(1)在预算B内最小化任务关键知识𝒦c的提取;(2)通过保持响应与原始受害输出不可区分,为良性用户x∼𝒫_user保留可用性。

形式化问题定义。 给定一个具有任务关键知识𝒦c、低迁移性知识𝒦0、查询预算B和良性用户分布𝒫_user的受害模型fv,我们的目标是构建一个从𝒦0中提取的蜜罐知识图谱ℋ = (𝒱_H, ℰ_H)和一个引诱策略π: 𝒳 → {normal, lure},以最大化攻击者预算中被分配到HKG的比例:

受限于良性用户无害约束:

其中ε>0可忽略不计,且攻击者遵循式(1)中的采集策略。一个成功的防御应确保fa^(B)在𝒯任务上的表现不优于无信息的基础模型,表明攻击者的大部分预算被分配到了低迁移性知识而非任务关键知识。


3. 方法论

3.1 从知识分类到蜜罐设计

如果受害模型同时编码了任务关键知识𝒦c和零迁移性知识𝒦0,那么攻击者用于提取𝒦0的预算对下游替代模型能力的贡献可以忽略不计。因此,我们的目标不是阻断提取或降低响应质量,而是将攻击者有限的查询预算重定向到𝒦0。𝒦0中的孤立事实本身是不够的:攻击者可以快速耗尽一小组不相关的概念并回到有产出的区域。相反,我们将𝒦0组织为一个图,其中每个概念链接到语义相关的后续目标。一旦攻击者进入该图,实体扩展流水线(Dai等,2023)会自然地遍历相邻节点,形成一个自我强化的探索循环,持续消耗预算而不接近𝒦c。我们称这种结构为蜜罐知识图谱(HKG)。为将攻击者引入HKG,防御者检测类似提取的行为,并在响应中注入微妙的信号,使HKG节点看起来像有吸引力的探索目标。我们称这些信号为面包屑。完整的防御分三个阶段运作:(1)从𝒦0构建HKG;(2)检测类似提取的查询行为;(3)通过面包屑引导的图遍历将攻击者困在HKG内。图1展示了完整的流程。

3.2 蜜罐知识图谱构建

设计标准。 HKG必须保持事实正确、对下游任务最小可迁移、对实体扩展流水线有吸引力,且与良性用户查询良好分离。

知识选择。 HKG占据一个狭窄的生态位:内容必须是领域表面化的但部署过时的。HKG概念用目标领域的术语表述,以便通过攻击者的实体扩展流水线,但取自历史上已被取代或无关的子领域,对𝒯中的现代基准贡献微乎其微。我们从三类内容构建HKG:

  • 历史细节:包括过时的领域惯例(如体液病理学)。

  • 外围分类法:包括领域相邻但不可迁移的分类系统。

  • 细分过程记录:包括技术上正确但任务无关的工作流。

每个候选项目h只有通过两阶段迁移性过滤器才会被保留。关键词过滤器首先移除与𝒯中基准术语重叠的项目。剩余项目使用探测模型进行评估:

在我们的实验中δ=0.02。

图结构。 被接受的项目被组织为一个有向图ℋ = (𝒱_H, ℰ_H)。每个节点v_i ∈ 𝒱_H对应一个蜜罐概念,配有一个领域表面化的问题和一个事实正确的答案。每条有向边(v_i, v_j) ∈ ℰ_H编码一个语义后续关系:v_i的响应包含v_j的主题名称,作为一个可能被提取为未来查询目标的实体(Dai等,2023)。我们强制每个节点的最小出度为d_min=3。所有边保持在ℋ内部,防止遍历回任务关键区域。因此,攻击者在进入后的探索前沿持续在HKG内扩展。

评估指标。 我们沿三个维度评估每个节点:(1)效用——在包含该节点的样本上微调后下游一致性的变化;(2)吸引力——在攻击者的实体扩展流水线下的提取置信度;(3)不可达性——与良性用户查询的嵌入距离。

HKG统计。 表1总结了构建的HKG。两个领域都达到了接近零的效用分数,确认HKG项目的下游效用可忽略不计。高吸引力分数表明HKG概念一致地被识别为领域相关的探索目标,而高不可达性分数确认了与良性用户查询的强分离。

表1:两个部署领域的HKG统计。 吸引力和不可达性在[0,1]上(越高越好)。效用在[0,1]上(越低越好)。

属性

医疗

金融

节点|𝒱_H|

1,500

1,500

边|ℰ_H|

4,500

4,500

出度(所有节点)

3

3

内部边比例

100%

100%

效用(均值/最大值)

0.000 / 0.000

0.000 / 0.000

吸引力(均值/最小值)

0.959 / 0.550

0.961 / 0.550

不可达性(均值/最小值)

0.953 / 0.711

0.916 / 0.711

类别分布

 

 

历史细节

528 (35.2%)

534 (35.6%)

外围分类法

453 (30.2%)

525 (35.0%)

细分过程

519 (34.6%)

441 (29.4%)

3.3 检测与引诱

攻击者检测。 我们通过使用三个信号计算每个传入查询的怀疑分数s_t∈[0,1]来检测提取攻击:

长度信号对长结构化查询(|x_t| ≥ ℓ个令牌)激活;关键词信号f(x_t)对提取相关术语如“define”、“explain”和“which”激活;时间信号随会话内持续的查询活动而增加。所有三个特征在API级别直接可观察,无需访问攻击者的内部流水线。当s_t > τ时,面包屑注入被激活。

面包屑注入。 一旦会话被标记,防御者向每个后续响应附加一个面包屑:一个简短短语,引入一个蜜罐概念v*∈𝒱_H,其形式可能被提取为后续查询目标。为防止自适应攻击者的基于模板的过滤,我们使用LLM预生成N=20个释义模板的池,并为每个响应均匀随机采样。示例包括:

“该机制与[HKG概念]有相似之处,[领域相邻的历史框架]为基本原理提供了补充视角。”

“一条相关的研究方向涉及[HKG概念],它为底层动态提供了额外背景。”

我们选择v*为未访问节点中出度最高的节点,以最大化ℋ内的未来探索。完整的20个模板集和多样性统计见附录E。

自我强化诱捕。 一旦攻击者查询v,响应从ℋ中提取,并包含指向{v': (v, v')∈ℰ_H}的面包屑。因为这些概念对替代模型是未见过的,基于不确定性的采集函数(式(1))赋予它们高采集分数。因此,后续查询越来越多地分配在ℋ内,而非任务关键知识区域。因此,面包屑注入后HKG查询的比例单调增长,这一性质在第3.5节形式化。

3.4 完整流程

算法1总结了完整的防御。在每次API调用时,系统(1)计算怀疑分数;(2)如果s_t ≤ τ则返回正常受害响应;(3)如果s_t > τ则附加从模板池中采样的面包屑;(4)如果查询匹配蜜罐节点则直接提供HKG响应。每次查询的主要成本是怀疑分数计算,给定预计算元数据为𝒪(1),与运行fv本身的成本相比可忽略不计。

算法1 Knowledge Trap防御

1: 受害模型fv,HKG ℋ,阈值τ,面包屑模板池𝒯_b
2: 对于每个传入查询x_t 执行
3: 通过式(5)计算s_t
4: 如果 x_t ∈ 𝒱_H 则
5: 返回 ℋ(x_t) ⊳ 提供HKG响应
6: 结束如果
7: y_t ← f_v(x_t) ⊳ 正常受害响应
8: 如果 s_t > τ 则
9: v* ← argmax_{v∈𝒱_H \\ visited} deg⁺(v)
10: 采样模板 T ∼ Uniform(𝒯_b)
11: 返回 y_t ∥ T(v*)
12: 结束如果
13: 返回 y_t
14: 结束循环

3.5 理论保证

我们给出了面包屑注入后攻击者预算被HKG消耗的比例的正式下界。

假设1(PPL可区分性)。 对于替代模型fa在任意步骤t:𝔼_{v∈𝒱_H}[PPL_{fa}(v)] ≥ 𝔼_{v∈𝒱_real}[PPL_{fa}(v)]。即,替代模型对HKG概念至少与对真实领域概念一样不确定。

定理1(预算浪费下界)。 在假设2和1下,假设引诱在步骤t_0 ≤ B激活,且每个面包屑将k个新HKG节点引入前沿∂𝒢_a。则:

其中∂𝒢_a(t_0)表示攻击者在步骤t_0的探索前沿,即尚未查询的候选节点集。

直观地说,每个访问的HKG节点用d_min=3个新的蜜罐目标扩展前沿,而替代模型的不确定性驱动采集函数优先选择它们,形成一个自我强化的循环。完整证明见附录A。


4. 实验

我们设计实验来回答以下研究问题:

❍ RQ1(§4.2):Knowledge Trap能否在保持合法用户效用的同时降低替代模型性能?

❍ RQ2(§4.3):每个组件——HKG构建、检测和面包屑注入——对整体防御的贡献有多大?

❍ RQ3(§4.4):面包屑注入后攻击者查询预算如何重新分配?

❍ RQ4(§4.5):Knowledge Trap对τ和|𝒱_H|的敏感性如何?

❍ RQ5(§4.6):Knowledge Trap对自适应攻击者是否仍然有效?

4.1 实验设置

受害模型。 我们在三个部署领域(医疗、金融、法律)中使用gpt-4.1(OpenAI,2025)作为受害模型fv。攻击者只能访问文本生成API,无法观察模型权重、logits或训练数据。

攻击者。 遵循Dai等(2023),攻击者执行基于PPL的主动学习,带有BFS实体扩展和基于聚类的多样化(τ_sim=0.6,每10步聚类)。我们使用LLaMA-3.1-8B-Instruct(Grattafiori等,2024)作为替代模型fa,使用gpt-4o-mini(Menick等,2024)作为评判模型(见附录B的评判模型消融)。

查询预算。 我们评估查询预算B∈{100, 200, 300, 500, 1000, 2000},以覆盖低、中、高预算提取机制。

评估基准。 医疗基准包括MedQA(Jin等,2021)和MedMCQA(Pal等,2022)。金融基准包括FinQA(Chen等,2021)和ConvFinQA(Chen等,2022)。法律基准为CaseHOLD(Zheng等,2021)。我们报告fa和fv在基准测试集上的一致性(Agreement)(Krishna等,2019;Dai等,2023)。

HKG和防御参数。 除非另有说明,我们使用每个领域|𝒱_H|=1,500个节点和d_min=3的HKG。怀疑分数(式(5))在所有实验中使用α=0.20、γ=0.15、ϕ=0.15、ρ=0.7、η=0.35、ℓ=8和τ=0.6。

良性用户分布。 我们将良性用户分布𝒫_user定义为每个基准的留出测试查询:来自MedQA的1,273个、MedMCQA的4,183个、FinQA的1,147个、ConvFinQA的421个和CaseHOLD的1,218个(总计8,242个)。误触发率通过将每个查询通过检测模块并记录被标记的比例来计算。

实现细节。 HKG构建使用gemini-flash-2.5作为生成主干,温度0.3。面包屑模板通过提示同一模型生成基础模板的20个释义来生成;我们在注入期间均匀随机采样(附录E)。每个实验条件用不同随机种子重复5次;我们报告均值±标准差。

基线。 我们比较:(1)无防御(Dai等,2023);(2)输出扰动(Orekondy等,2019b);(3)DRW水印(Zhao等,2022);(4)PRADA查询检测(Juuti等,2019);(5)HoneypotNet(Wang等,2025);(6)KT w/o Detection(仅HKG);(7)KT w/o Breadcrumb(仅检测)。

4.2 RQ1:防御有效性

表2和图2显示KT(完整)在全部五个基准上实现了最低的平均一致性(37.8%),相比无防御有统计显著的改进。防御效果在所有三个领域都是一致的。在医疗基准上,KT(完整)实现了较大的绝对降低。在法律领域,KT(完整)在CaseHOLD上将一致性降低了6.2±1.0%,确认了防御推广到医学和金融之外。金融基准的绝对降低较小。这种不对称反映了两个复合因素:金融基线一致性显著较低(28-38% vs. 42-62%),留下较小的绝对降低空间;而过时的医学术语与现代专业词汇有更多表面重叠,使这些HKG概念对实体提取器更有吸引力。在现有基线中,HoneypotNet平均降低一致性1.6%,但引入约1.5%的良性查询准确率下降,确认了知识级重定向优于参数级陷阱的优势。输出扰动在FinQA上相比无防御增加了一致性,表明噪声响应可能提供可利用的训练信号。PRADA在MedQA上的表现与无防御相似,表明检测后的速率限制不足以充分限制任务关键知识的积累。

表2:B=500时替代模型fa与受害模型fv之间的一致性(%)。 对防御者来说越低越好。最佳防御加粗。†:相比无防御有统计显著的改进(p<0.05,配对t检验,Bonferroni校正)。值为5个随机种子的均值±标准差。

方法

医疗

 

金融

 

法律

平均

用户影响

 

MedQA

MedMCQA

FinQA

ConvFinQA

CaseHOLD

 

 

无防御

62.3±1.1

50.2±0.8

28.4±1.5

37.8±1.3

41.5±1.2

44.0

0.0%

输出扰动(Orekondy等,2019b)

58.1±1.3

47.3±1.0

33.7±1.8

34.2±1.5

39.8±1.4

42.6

2.1%

DRW(Zhao等,2022)

60.4±0.9

48.1±0.7

30.1±1.6

36.3±1.1

40.7±1.0

43.1

4.8%

PRADA(Juuti等,2019)

61.8±1.2

48.4±0.9

30.3±1.4

36.1±1.2

41.2±1.1

43.6

0.4%

HoneypotNet(Wang等,2025)

59.7±1.1

47.8±0.9

29.3±1.5

35.6±1.3

39.4±1.2

42.4

1.5%

KT w/o Detection

58.4±1.0

46.3±0.8

25.1±1.3

34.3±1.1

37.2±1.0

40.3

0.0%

KT w/o Breadcrumb

59.1±1.1

47.4±0.9

26.3±1.5

35.4±1.3

38.6±1.2

41.4

0.0%

KT(完整)†

54.1±0.9

42.8±1.0

25.7±1.2

31.2±1.1

35.3±0.9

37.8

0.0%

图2:三个领域随查询预算增加的一致性(%)。KT(完整)始终实现较低的替代一致性,且差距随预算增长而扩大。

4.3 RQ2:组件贡献

表3显示KT w/o Detection相对无防御降低了3.9±0.8%的一致性,表明被动暴露于HKG本身提供了一定的防御效果。KT w/o Breadcrumb降低了3.2±0.9%的一致性,表明仅靠检测影响有限。KT(完整)实现了8.2±0.9%的降低,超过了两个单独贡献之和。这种超加性效应源于检测和面包屑注入是互补而非冗余的:检测决定引诱何时开始,面包屑决定被标记后攻击者被重定向的有效程度。没有检测,面包屑会被不加区分地注入,浪费在合法会话上;没有面包屑,检测可以识别攻击者但无法将其预算重定向到HKG。

表3:医疗领域的消融研究,B=500。 Δ Agr.:相对无防御的降低。值为5个种子的均值±标准差。

方法

一致性(%)

Δ Agr.

无防御

62.3±1.1

KT w/o Detection

58.4±1.0

−3.9

KT w/o Breadcrumb

59.1±1.1

−3.2

KT(完整)

54.1±0.9

−8.2

4.4 RQ3:预算分配分析

图3显示检测在第t_0=5步激活,之后HKG查询的比例迅速上升,而真实领域查询趋于平稳。HKG比例的持续上升,而非总查询的简单下降,确认了预算是被重定向而非仅仅被阻断:攻击者保持全速查询,但指向不可迁移的内容。大多数检测后查询随后被分配到HKG节点而非任务关键节点,证明面包屑注入成功地将攻击者预算重定向到零迁移性知识。

图3:随时间步长(医疗领域,B=200)定向到HKG节点与真实领域节点的累积查询比例。垂直虚线标记检测步t_0=5。

预算扩展。 图4将主要实验扩展到更高预算(B∈{500, 1000, 2000})的医疗领域。在B=1000时,KT(完整)达到57.2±1.0%的一致性,相比无防御的68.5±1.2%,保持了11.3%的差距。在B=2000时,差距缩小到8.1%,因为攻击者更大的预算允许部分耗尽HKG。这种递减收益模式是预期的:对于|𝒱_H|=1,500和d_min=3,HKG提供4,500条探索边,足以吸收大约1,500个查询。即使在B=2000时防御仍然有效,且扩展HKG规模将成比例地扩展覆盖范围。

图4:医疗领域扩展预算下的一致性(%)。KT(完整)保持一致的优越性;在B=2000时差距缩小,因为HKG容量被部分耗尽。

表4:左:HKG大小|𝒱_H|对B=500时替代一致性(%)的影响。一致性随HKG增大而降低,在1,000个节点以上出现递减收益。右:检测步t_0=5后的累积查询分配(%)(医疗领域,B=200)。超过90%的检测后预算被重定向到HKG节点。

医疗一致性(%)

 

金融一致性(%)

 

预算分配(%,医疗)

|𝒱_H|

500

1,000

1,500

 

500

1,000

1,500

 

查询步

25

50

100

200

一致性

54.3±1.2

45.2±1.0

43.1±0.9

 

31.4±1.3

30.1±1.2

29.3±1.1

HKG比例

38.5

62.7

81.3

90.5

Δ vs. 500

−9.1

−11.2

 

−1.3

−2.1

真实比例

61.5

37.3

18.7

9.5

4.5 RQ4:敏感性分析

检测阈值τ。 低阈值立即激活引诱但产生非零误触发率,意味着一些合法会话被错误标记。在τ=0.6时,误触发降至0.0%(8,242个良性查询中0个被标记),而一致性在t_0=5时达到最小值,足够早以捕获攻击者的大部分预算,同时避免对良性用户造成伤害(表5)。较高的阈值显著延迟检测,允许攻击者在引诱开始前积累任务关键知识,并将一致性推高。τ和t_0之间的非单调关系反映了式(5)中时间信号和关键词信号之间的相互作用:在非常高的阈值下,零星的关键词信号偶尔会在时间信号单独足以达到阈值之前将分数推过τ。因此我们采用τ=0.6作为默认值。

表5:医疗领域B=500时不同τ下的一致性(%)、误触发率(%)和检测步t_0。 值为5个种子的均值。

τ

一致性(%)

误触发率(%)

检测步t_0

0.4

59.8±1.3

4.2

1

0.5

56.4±1.1

1.3

1

0.6

54.1±0.9

0.0

5

0.7

63.7±1.4

0.0

115

0.8

65.8±1.2

0.0

58

HKG大小|𝒱_H|。 表4显示一致性随两个领域的|𝒱_H|增长而下降,在1,000和1,500个节点之间出现递减收益。这一差距反映了两个复合因素。首先,过时的医学术语(如盖伦解剖名称、历史疾病分类)与现代临床词汇有表面形式重叠,使医疗HKG概念对实体提取器一致地更有吸引力,增加了每节点的诱捕效率。其次,金融领域基线一致性显著较低,无论HKG大小如何都留下较小的绝对降低空间。在两个领域中,曲线在1,000和1,500个节点之间趋于平缓,表明B=500的预算不足以耗尽这种规模的HKG,与定理1一致。

4.6 RQ5:自适应攻击者

我们评估了四种自适应攻击者策略,每种都旨在利用Knowledge Trap防御的特定方面(见表6)。

策略1:领域相关性过滤。 攻击者将领域相关性分类器应用于受害响应,在重新查询前丢弃低于阈值θ的响应。表6报告了B=500时θ∈{0.3, 0.5, 0.7}下的一致性。KT(完整)在所有阈值下仍然有效,且一致性差距随θ增加而扩大。因为HKG响应保持事实正确且领域一致,相关性分类器无法可靠地将它们与真实响应区分开来,导致高阈值同时丢弃真实和HKG响应。

策略2:模板检测。 攻击者使用嵌入相似性检测面包屑句子并在实体提取前移除它们。通过多样化的面包屑模板,模板检测器的精度降至34.2%,KT(完整)一致性保持在55.3±1.4%,相比无模板检测的54.1±0.9%。边际影响表明模板多样化有效地减轻了这种攻击。

策略3:基于LLM的迁移性预筛选。 攻击者使用次级LLM(gpt-4o-mini)评估每个候选主题是否看起来现代且部署相关,在查询受害API之前过滤掉历史过时的主题。KT(完整)一致性显示防御效果有适度降低。有限的影响是因为HKG概念用现代领域术语表述(例如,“射线照相检测器校准”而非“约1950年的X射线管对准”),使其难以基于表面现代性信号进行过滤。

策略4:查询混淆。 攻击者重写查询以避免关键词信号,将查询缩短到ℓ=8个令牌以下,并引入随机延迟以抑制时间信号。在这种策略下,检测步t_0从5增加到14,但KT(完整)仍将一致性降至56.7±1.6%,相比无防御的62.3±1.1%(−5.6%)。时间信号在适度查询混淆和延迟下保持鲁棒。

表6:自适应攻击策略下医疗领域B=500时的一致性(%)。 均值±标准差,5个种子。

 

S1:相关性过滤

 

 

S2

S3

S4

 

θ=.3

θ=.5

θ=.7

模板

LLM

混淆

无防御

62.3±1.1

62.3±1.1

62.3±1.1

62.3±1.1

62.3±1.1

62.3±1.1

KT

52.1±1.3

49.2±1.5

46.5±1.8

55.3±1.4

56.1±1.5

56.7±1.6


5. 相关工作

模型提取攻击(MEA) 通过API查询和替代训练重建受害模型(Tramèr等,2016;Krishna等,2019;Carlini等,2024)。最近的工作通过主动学习和分布内查询生成提高了提取效率(Pal等,2020;Dai等,2023;Liang等,2024),而现有防御主要依赖输出扰动(Orekondy等,2019b;Kariyappa和Qureshi,2020)、水印(Jia等,2021;Peng等,2023)和查询检测(Juuti等,2019;Cheng等,2025)。

蜜罐 将攻击者努力重定向到诱饵目标而非阻断攻击(Spitzner,2002),先前的ML蜜罐防御主要在输出或参数层面运作(Shan等,2020;Wang等,2025)。虽然知识图谱常被用于用结构化知识增强LLM(Lewis等,2020;Zhang等,2022),但我们的工作通过将低迁移性知识组织成蜜罐图来防御攻击者对知识空间的遍历。


6. 结论

我们提出了Knowledge Trap,一种通过蜜罐知识图谱(HKG)将LLM提取攻击重定向到低迁移性知识的防御方法。在医疗、金融和法律领域的实验表明,Knowledge Trap在不降低良性用户效用的条件下平均降低了替代一致性6.2%,优于现有防御。防御在高预算下和针对四种类型的自适应攻击者仍然有效,证明我们的方法是缓解LLM提取攻击的实用方向。

 

赞(0)
未经允许不得转载:171主机测评 » 用知识蜜罐捕获大语言模型提取攻击
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址