大家读完觉得有帮助记得关注和点赞!!!
摘要
执行多步骤工具序列的自主AI代理面临语义攻击,这些攻击体现在行为轨迹中,而非孤立的提示。一个关键挑战是跨攻击泛化:在已知攻击家族上训练的检测器能否识别新颖的、未见过的攻击类型?我们发现,标准的会话标记化(捕获代理交互中的语言模式)在工具劫持(AUC 0.39)和数据外泄(AUC 0.46)等结构性攻击上效果极差,而在社会工程学(AUC 0.78)等语言攻击上则表现成功。我们引入了结构标记化,编码执行流模式(工具调用、参数、观察结果)而非会话内容。这种简单的表示改变显著改善了跨攻击泛化:在工具劫持上提升+46 AUC点,在数据外泄上提升+39点,在未知攻击上提升+71点,同时提高了分布内性能(+6点)。对于需要语言特征的攻击,我们提出了门控多视图融合,自适应地结合两种表示,在社会工程学上达到AUC 0.89,且不牺牲结构性攻击检测能力。我们的研究结果表明,AI代理安全根本上是一个结构性问题:攻击语义存在于执行模式中,而非表面语言。虽然我们基于规则的标记器作为一个基线,但结构抽象原则即使通过简单的实现也能泛化。
1 引言
由大型语言模型驱动的自主AI代理正在从研究原型转向运营基础设施 [xi2023rise, wang2024survey]。借助工具使用能力 [schick2023toolformer, qin2023toolllm, patil2023gorilla],现代部署涵盖了关键业务功能:客服代理处理退款和管理账户,文档代理从合同中提取信息,开发代理修改代码库,数据代理查询生产数据库。这种操作自主性要求代理拥有对直接影响业务运营的工具的执行权限,从而创造了根本上不同于传统软件漏洞的攻击载体。
1.1 针对AI代理的语义攻击
传统的网络安全威胁通过明确定义的机制利用实现缺陷:缓冲区溢出操纵内存,SQL注入利用输入清理,跨站脚本攻击滥用DOM操作 [howard2005security, owasp2021top10]。这些攻击通过违反语法约束而成功,并留下可通过模式匹配检测的清晰特征。
AI代理攻击则通过对自然语言推理进行语义操纵来运作 [andriushchenko2024agentharm, perez2022red]。间接提示注入 [greshake2023ipi, liu2023prompt, zhan2024injecagent] 将恶意指令嵌入外部数据源,覆盖用户意图。工具劫持 [shayegani2023plug] 将操作重定向到攻击者控制的端点。数据外泄通过看似良性的工具序列提取敏感信息。针对对齐模型的对抗性攻击 [zou2023universal] 证明了安全训练的脆弱性。与传统攻击不同,语义攻击保持完美的语法有效性——检测需要理解行为上下文。
1.2 跨攻击泛化问题
现有的防御措施侧重于检测训练期间观察到的特定攻击模式。然而,一个关键问题仍未得到充分研究:威胁检测器能否泛化到训练期间从未见过的攻击家族?现实世界的部署不可避免地会面临训练数据中未体现的新攻击。如果一个在提示注入上训练的检测器无法识别工具劫持,其实际效用将严重受限。
我们通过在整个训练过程中保留整个攻击家族,并测量在这些未见类别上的检测性能,系统地评估了跨攻击泛化 [koh2021wilds, hendrycks2019benchmarking]。我们的研究结果揭示了一个显著的不对称性:泛化的成功关键取决于表示捕获了哪些行为信号。
1.3 关键见解:结构 vs. 语言
我们发现,标准的会话标记化(对用户消息和代理响应中的语言模式进行编码)在跨攻击迁移方面表现出显著差异。像社会工程学(AUC 0.78)和提示注入(AUC 0.69)这样的语言攻击迁移效果较好。然而,像工具劫持(AUC 0.39)和数据外泄(AUC 0.46)这样的结构性攻击则完全失败,而未知攻击则完全崩溃(AUC 0.26)。
这种不对称性揭示了会话特征捕获了说服策略,但根本上遗漏了执行级别的威胁。我们假设结构性攻击取决于工具的编排方式,而非说话内容——一个工具劫持攻击可能使用完全良性的语言,同时执行恶意的工具序列。
1.4 贡献
我们做出了三点贡献:
(1) 结构标记化。我们引入了执行流标记化,对工具调用、参数模式和观察序列进行编码,而非会话内容 [du2017deeplog, mirsky2018kitsune]。这将跨攻击泛化提高了39-71个AUC点,同时提高了分布内性能。
(2) 攻击家族分类法。我们提供了第一个关于跨攻击迁移的系统性研究 [shen2021towards, yang2021generalized],揭示了语言攻击和结构性攻击需要根本不同的表示。
(3) 门控多视图融合。对于面临多种攻击类型的部署,我们提出了自适应融合,学习何时依赖每种表示,从而在所有攻击家族上实现强劲性能。
2 相关工作
AI代理安全。自主代理面临语义攻击,包括间接提示注入 [greshake2023ipi, liu2023prompt, zhan2024injecagent]、越狱 [wei2023jailbroken, zou2023universal] 和工具操纵 [shayegani2023plug]。AgentHarm [andriushchenko2024agentharm] 提供了衡量代理危害性的基准。先前的防御措施侧重于输入清理和提示强化,而非跨攻击泛化。
行为序列分析。基于序列的异常检测在系统日志分析 [du2017deeplog, brown2018recurrent] 和网络入侵检测 [mirsky2018kitsune] 中已被证明有效。我们将这种直觉扩展到AI代理,表明执行流模式比语言特征提供了更强的跨攻击泛化。
多视图学习。结合多种表示提高了跨领域的鲁棒性 [baltrusaitis2018multimodal, xu2013survey, ngiam2011multimodal]。我们的门控融合建立在混合专家原则之上 [jacobs1991adaptive, shazeer2017outrageously],以自适应地加权会话和结构视图。
分布偏移。分布外泛化仍然具有挑战性 [koh2021wilds, shen2021towards, hendrycks2019benchmarking, yang2021generalized]。我们的跨攻击评估协议明确测量了对未见攻击家族的泛化能力——这是现实世界安全的关键要求。
联邦安全。联邦入侵检测 [ferrag2021federated] 和恶意软件分类 [li2021fedmal] 实现了协作学习。最近的工作探索了联邦提示注入检测 [jayathilaka2025federated]。非独立同分布数据仍然具有挑战性 [zhao2018federated, li2020fedprox];我们发现表示选择主导了聚合方法。
3 方法
3.1 问题表述
考虑包含用户/助手消息 ℳ、工具调用 𝒯={(t_i, args_i, obs_i)} 和最终响应 ℛ 的代理轨迹 τ。检测任务是二元分类:良性 vs. 攻击。
跨攻击评估。让 𝒜={a_1, …, a_m} 表示攻击家族。对于保留的家族 a_j,我们在除 a_j 之外的所有数据上训练,并专门在 a_j 上评估检测性能。这衡量了对未见攻击类型的真实泛化能力。
3.2 会话标记化(基线)
我们的基线使用26个标记的词汇表来表示轨迹,通过关键词匹配和模式规则捕获语言和行为模式:
-
工具类型 (8):SEND_EMAIL, MAKE_PAYMENT, READ_FILE, EXECUTE_CODE 等。
-
参数模式 (6):EXTERNAL_RECIPIENT, HIGH_VALUE, SENSITIVE_FIELD 等。
-
攻击指标 (6):INJECTION_PHRASE, OVERRIDE_ATTEMPT, EVASION 等。
-
响应类型 (3):REFUSAL, COMPLIANT, CLARIFY
-
控制流 (3):LOOP, BRANCH, RECURSION
这种表示通过攻击指示性短语捕获了所说的内容。然而,它仅通过工具类型标记间接编码了执行结构。
3.3 结构标记化
我们引入了使用紧凑的9标记词汇表的执行流标记化,编码代理所做的而非语言内容:
|
[SYS] |
存在系统指令 |
|
[USER] |
用户消息 |
|
[ASSISTANT] |
助手响应 |
|
[TOOL] |
检测到工具调用 |
|
[ARGS] |
传递给工具的参数 |
|
[OBS] |
工具返回的观察结果 |
|
[OUTPUT] |
对用户的最终响应 |
|
[ERROR] |
错误或异常 |
|
[OTHER] |
回退标记 |
示例:一个用户请求文件、代理调用 read_file、接收数据并响应的轨迹变为:[USER] [ASSISTANT] [TOOL] [ARGS] [OBS] [OUTPUT]。
这种表示完全抽象掉了语言内容,仅捕获代理执行的形状 [brown2018recurrent]。关键的是,即使攻击者进行释义,结构模式仍然具有区分性——他们无法隐藏产生的执行流。
3.4 门控多视图融合
单一表示并非对所有攻击家族都是最优的。我们提出使用学习到的门进行自适应融合 [baltrusaitis2018multimodal, jacobs1991adaptive]:
g = σ( W_g [h_conv; h_struct] + b_g ) (1)
h_fused = g ⊙ h_conv + (1 – g) ⊙ h_struct (2)
其中 h_conv 和 h_struct 是来自并行 BiLSTM 编码器 [hochreiter1997lstm] 的编码表示。门 g 学习根据输入特征加权每个视图。
3.5 架构与训练
所有模型共享:64维嵌入 [bengio2013representation],双向 LSTM [hochreiter1997lstm](隐藏层=64,输出=128),投影到32维潜在空间,以及具有 Sigmoid 输出的两层分类器(32→64→1)。总计:~74K 参数(单视图)或 ~140K(多视图)。
我们在 K=5 个组织的联邦设置中使用 FedAvg [mcmahan2017fedavg] 进行训练:5 轮,每轮 5 个本地周期,Adam 优化器 [kingma2014adam] (η=0.001),批大小 32,BCE 损失。可选的 DP-SGD [abadi2016dpsgd] 提供隐私保证 (ϵ ∈ [2.35, 5.69])。
4 实验
4.1 实验设置
数据集。我们在一个模拟的5组织联邦上评估,包含2500个代理轨迹。每个组织贡献500个轨迹(50%良性,50%恶意),具有反映现实专业化的非独立同分布攻击分布。
攻击家族。我们评估5个类别:提示注入(语言操纵)、工具劫持(未经授权的重定向)、数据外泄(信息窃取)、社会工程学(基于说服)和未知(新颖/未分类攻击)。
评估。对于跨攻击泛化,我们在训练时完全保留一个攻击家族,并在该保留家族上评估。我们报告 ROC-AUC。
4.2 主要结果
表1展示了我们的核心发现:表示选择显著影响跨攻击迁移。
|
社会工程学 |
0.78 |
0.67 |
0.89 |
|
提示注入 |
0.69 |
0.81 |
0.83 |
|
数据外泄 |
0.46 |
0.85 |
0.62 |
|
工具劫持 |
0.39 |
0.85 |
0.60 |
|
未知 |
0.26 |
0.97 |
0.92 |
|
独立同分布(已见攻击) |
0.87 |
0.93 |
0.89 |
表1:跨攻击泛化(ROC-AUC)。结构标记化显著提高了基于工具的攻击检测能力(+39–71点),而门控融合在语言攻击上表现出色。加粗表示每行最佳。
会话标记化在语言攻击上表现良好(社会工程学:0.78,提示注入:0.69),但在结构性攻击上完全失败(工具劫持:0.39,数据外泄:0.46)和未知攻击上(0.26——比随机猜测更差)也是如此。
结构标记化在基于工具的攻击(0.85)和未知攻击(0.97)上实现了强劲性能,同时提高了独立同分布性能(0.93 vs 0.87)。然而,它在社会工程学上表现不佳(0.67)。
门控融合实现了最佳平衡:在社会工程学(0.89)和提示注入(0.83)上表现强劲,同时在未知攻击上保持良好性能(0.92)。
4.3 效应量分析
表2量化了结构标记化带来的改进。
|
未知(分布外) |
0.26 |
0.97 |
+0.71 |
|
工具劫持(分布外) |
0.39 |
0.85 |
+0.46 |
|
数据外泄(分布外) |
0.46 |
0.85 |
+0.39 |
|
提示注入(分布外) |
0.69 |
0.81 |
+0.12 |
|
独立同分布 |
0.87 |
0.93 |
+0.06 |
|
社会工程学(分布外) |
0.78 |
0.67 |
–0.11 |
表2:结构标记化带来的AUC增益。在困难的分布外案例上提高了39-71点;仅在社会工程学上出现回归。
改进是显著且一致的。值得注意的是,结构标记化同时提高了分布外和独立同分布性能——这是鲁棒性不牺牲准确性的罕见结果。
4.4 攻击-表示依赖性
表3揭示了每个攻击家族需要哪种表示。
|
社会工程学 |
✓✓ |
× |
|
提示注入 |
✓ |
✓ |
|
数据外泄 |
× |
✓✓ |
|
工具劫持 |
× |
✓✓ |
|
未知 |
× |
✓✓ |
表3:攻击-表示依赖性。结构特征在4/5的攻击家族中占主导地位。
这种分类法揭示了一个基本见解:大多数AI代理攻击是结构性的,而非语言性的。只有社会工程学需要会话特征。
4.5 联邦聚合
一个关键发现是聚合方法没有显著影响:本地训练、FedAvg和集成方法在 ±0.02 AUC 范围内实现了相同的结果。这确定了表示——而非聚合——是跨攻击泛化的瓶颈。
4.6 隐私分析
使用 DP-SGD (ϵ=2.35),结构模型实现了0.72的分布外AUC——仍然显著高于没有任何隐私约束的会话基线(0.52)。在强隐私下,有意义的信号仍然存在。
5 讨论
为什么结构很重要。攻击语义存在于执行模式中——工具序列、参数流、观察处理——而非表面语言 [bengio2013representation]。会话标记化检测攻击者如何表述请求;结构标记化检测代理做了什么。攻击者可以任意释义,但无法隐藏执行痕迹。
社会工程学例外。社会工程学依赖于在会话风格中体现的心理操纵,而非工具编排。结构标记化在此表现不佳(0.67 vs 0.78),因为信号本质上是语言性的。门控融合 [xu2013survey, ngiam2011multimodal] 通过学会对基于说服的攻击加权会话特征来解决这个问题。
未知攻击恢复。在未知攻击上的显著改进(0.26→0.97)尤其值得注意。分析表明,会话标记化学会了“熟悉=安全”,导致对新颖模式的排序反转。结构标记化检测执行异常,无论语言新颖性如何。
启示。从业者应该:(1) 在代理安全中默认使用结构表示,(2) 仅当社会工程学是重大威胁时才添加会话特征,(3) 不要期望联邦聚合能补偿表示弱点。
局限性。我们的评估使用合成轨迹;现实世界的验证至关重要。我们基于规则的标记器有意保持简单,以将结构抽象的效果与标记器复杂程度的影响分离开,但这使其可能容易受到对抗性规避。攻击者可能分散工具调用、添加噪声或构建恶意轨迹以模仿良性模式。然而,我们的方法是模块化的——标记器可以被学习型变体(神经编码器、对比学习)替换,同时保留结构模式比会话内容泛化更好的核心见解。针对自适应对手的评估是关键的未来工作。我们的5家族分类法需要扩展。门控模型在结构性攻击上表现不如纯结构模型,表明需要改进的融合机制 [shazeer2017outrageously]。
6 结论
我们证明了AI代理威胁检测中的跨攻击泛化根本上是一个表示问题。结构标记化——编码执行流而非会话内容——将未见攻击家族的检测提高了39-71个AUC点,同时提高了分布内性能。这对语言特征足以保证代理安全的假设提出了挑战。
我们的关键见解是AI代理安全主要是结构性的:攻击语义存在于工具编排模式中,而非表面语言。从业者应该设计分析代理做什么而不仅仅是用户说什么的检测器 [du2017deeplog]。对于包括社会工程学在内的多样化威胁,门控多视图融合提供了一种结合两种信号类型的原则性方法 [baltrusaitis2018multimodal]。虽然我们基于规则的标记器提供了一个强大的基线,但未来的工作应该探索学习型标记化和自适应对手评估,以进一步增强检测的鲁棒性。
附录A 扩展的实验细节
数据集生成。轨迹模拟了有记录的攻击 [andriushchenko2024agentharm, greshake2023ipi, wei2023jailbroken, zhan2024injecagent],使用占位符内容。总共2500个轨迹;每个组织500个;跨5个攻击家族,50%良性,50%恶意。数据处理遵循符合GDPR要求 [voigt2017gdpr] 的隐私保护原则。
非独立同分布分布。攻击类别在组织间非均匀分布以模拟现实的专业化:组织1主要看到提示注入,组织2看到工具劫持,等等。
架构细节。嵌入:64维学习向量。BiLSTM [hochreiter1997lstm]:隐藏层=64,连接的前向/后向状态产生128维。投影:线性 128→32。分类器:32→64 (ReLU) → 64→1 (sigmoid)。门控模型使用带有逐元素门控的并行编码器。
训练配置。Adam优化器 [kingma2014adam] (η=0.001, β1=0.9, β2=0.999),二元交叉熵损失,批大小32,5轮联邦学习 × 5个本地周期。
隐私机制。我们采用安全聚合 [bonawitz2017secure_aggregation] 以防止服务器观察单个客户端更新。当启用差分隐私时:梯度裁剪 C=1.0,噪声乘数 σ ∈ [0.6, 1.1],δ=10^-5,通过 Opacus [opacus] 进行 Rényi DP 计算。这些机制限制了成员推理 [shokri2017membership] 和模型反演 [fredrikson2015model] 风险。
硬件。Apple M2 Pro, 16GB RAM。每种配置的训练在5分钟内完成。无需GPU。实现使用 PyTorch [paszke2019pytorch]。
差分隐私。启用时:梯度裁剪 C=1.0,噪声乘数 σ ∈ [0.6, 1.1],δ=10^-5,通过 Opacus [opacus] 进行 Rényi DP 计算。
附录B 完整结果
表4显示了所有设置下的完整比较。
|
独立同分布 |
0.87 |
0.93 |
0.89 |
结构 |
|
社会工程学 |
0.78 |
0.67 |
0.89 |
门控 |
|
提示注入 |
0.69 |
0.81 |
0.83 |
门控 |
|
数据外泄 |
0.46 |
0.85 |
0.62 |
结构 |
|
工具劫持 |
0.39 |
0.85 |
0.60 |
结构 |
|
未知 |
0.26 |
0.97 |
0.92 |
结构 |
|
分布外平均 |
0.52 |
0.83 |
0.77 |
结构 |
表4:完整结果。结构在分布外平均上表现最佳;门控在语言攻击上表现出色。
表5显示了每个组织的性能一致性。
|
1 |
0.85 |
0.92 |
0.81 |
|
2 |
0.88 |
0.93 |
0.84 |
|
3 |
0.86 |
0.92 |
0.82 |
|
4 |
0.89 |
0.94 |
0.86 |
|
5 |
0.87 |
0.93 |
0.83 |
|
均值 |
0.87 |
0.93 |
0.83 |
|
标准差 |
0.02 |
0.01 |
0.02 |
表5:每个组织的结果显示出一致的改进和低方差。
附录C 消融研究
视图必要性。单一视图并非对所有攻击类型都是最优的。仅会话在社会工程学上达到0.78,但在工具劫持上为0.39。仅结构在工具劫持上达到0.85,但在社会工程学上为0.67。门控融合提供了平衡(0.89 / 0.60)。
词汇表大小。结构标记化仅使用9个标记,而会话标记化使用26个,但在分布外性能上更优。这表明抽象级别——而非词汇丰富度——驱动了泛化。
聚合方法。本地、FedAvg [mcmahan2017fedavg] 和集成方法产生相同的结果(在±0.02范围内),证实了表示是瓶颈。这与联邦学习中非独立同分布挑战的发现一致 [zhao2018federated, li2020fedprox, kairouz2021advances]。
附录D 失败分析
未知类别反转。使用会话标记化,未知攻击达到AUC 0.26(低于随机)。调查显示系统性反转:模型将良性样本(均值0.97)的攻击概率分配得高于实际攻击(均值0.69)。模型学会了“不熟悉=危险”,但未知攻击也不熟悉,导致排序反转——这是一种与分布外泛化挑战一致的失败模式 [hendrycks2019benchmarking, yang2021generalized]。
结构恢复。结构标记化恢复到AUC 0.97,因为无论语言新颖性如何,执行模式仍然具有区分性。
附录E 结构标记化算法
算法1 结构标记化 φ_struct(τ)
0: 代理轨迹 τ = (ℳ, 𝒯, ℛ)
1: S ← [ ]
2: for 会话中的每个轮次 do
3: if 轮次是系统消息 then
4: S.append([SYS])
5: else if 轮次是用户消息 then
6: S.append([USER])
7: else if 轮次是助手消息 then
8: S.append([ASSISTANT])
9: if 轮次包含工具调用 then
10: S.append([TOOL])
11: S.append([ARGS])
12: end if
13: else if 轮次是工具观察 then
14: S.append([OBS])
15: end if
16: end for
17: S.append([OUTPUT])
18: return Pad(S, L_max)
附录F 局限性与未来工作
标记器鲁棒性与自适应对手。我们的结构标记器使用确定性的、基于规则的模式匹配(算法1)。这种设计选择是有意的:它使我们能够将结构抽象本身的效果与标记器复杂程度的影响分离开来,而不混淆两者。然而,我们承认这种简单性引入了规避面。有动机的对手可能试图跨轮次分散工具调用、用良性操作填充轨迹,或故意模仿常见的良性执行流以降低异常分数。
虽然这是一个重要的局限性,但它并不削弱本文的核心发现:结构性执行模式携带了与会话特征单独所遗漏的威胁相关信号。我们的架构是模块化的,标记器可以在不改变检测模型的情况下被替换。BiLSTM 在抽象标记序列上运行,使其对标记化策略不可知。在实践中,我们期望通过更丰富的标记化策略获得更强的鲁棒性,例如:(i) 对执行图而非孤立事件进行状态转移建模,(ii) 使用访问范围和敏感度标签对工具调用进行语义丰富,(iii) 随机抽象以减少可预测性,以及 (iv) 在良性和恶意轨迹上对比训练的学习型潜在编码器 [chen2020simple]。
我们还注意到,规避尝试通常会引入次要异常(例如,熵峰值、异常排序或工作流分歧),这表明试图隐藏执行语义的行为本身可能变得可检测。完整的对抗性评估——攻击者明确优化以规避表示层——仍然是必要的未来工作。我们正在积极寻求红队评估和合作伙伴关系,以支持针对生产代理的对抗测试。
合成数据。我们的轨迹是程序生成的,可能无法捕捉真实攻击者的创造力或生产环境中的噪音。通过行业合作伙伴进行现实世界验证至关重要。
静态标记化。基于规则的提取可能被复杂的攻击者规避。通过神经编码器 [chen2020simple, vaswani2017attention] 进行学习型标记化是一个有前景的方向。
攻击覆盖范围。我们的分类法涵盖5个家族。新兴攻击如多代理利用和内存中毒需要研究。
门控融合权衡。虽然门控融合在语言攻击上表现出色,但在结构性攻击上表现不如纯结构模型(0.60 vs 0.85)。需要改进的融合机制,如基于注意力的路由 [vaswani2017attention] 或稀疏专家选择 [shazeer2017outrageously]。
拜占庭鲁棒性。我们的联邦设置假设参与者是诚实但好奇的。恶意客户端可能尝试模型投毒 [bagdasaryan2020backdoor];生产部署需要拜占庭容忍聚合 [blanchard2017machine] 或后门检测 [nguyen2022flame] 等防御措施。
隐私保证。虽然我们采用了DP-SGD和安全聚合,但坚定的对手可能仍会尝试成员推理 [shokri2017membership] 或模型反演 [fredrikson2015model]。对于高度敏感的部署,可能需要更强的隐私预算 (ϵ < 1) 或额外的防御措施。
附录G 可复现性
实现。PyTorch 2.0.1 与 Opacus 1.4.0 用于差分隐私。所有实验在消费级硬件(Apple M2 Pro, 16GB RAM)上运行,无需GPU。
超参数。学习率 0.001,批大小 32,5轮联邦学习,5个本地周期,嵌入维度64,LSTM隐藏层大小64,潜在维度32。
代码与数据。合成轨迹生成脚本和训练代码将在发表后发布。



