大家读完觉得有帮助记得关注和的点赞!!!
摘要
社会工程学攻击利用的是人际信任而非软件漏洞,因此难以使用传统过滤器进行检测。我们提出了一种两阶段“过滤-验证”框架,结合用于结构异常检测的归纳式图神经网络(GNN)与用于内容验证的协同注意力ModernBERT模型。GNN识别异常的发送者-接收者模式,而BERT分析消息上下文以降低误报率。使用增强现实合成活动的Enron数据集,我们表明该框架在结构过滤阶段达到86%的召回率,在BERT优化后精确率超过92%,有效检测外部攻击和内部威胁。我们的结果表明,结合结构与内容分析可以实现对电子邮件网络中多阶段社会工程学攻击的实用、可扩展检测。
亮点
-
两阶段“过滤-验证”流程结合了归纳式GNN与ModernBERT。
-
三阶段结构检测捕捉数量、关系和上下文异常。
-
协同注意力ModernBERT验证长序列多消息社会工程学上下文。
-
专用内部威胁模块利用语言漂移检测被入侵账户。
-
在增强的Enron数据集上实现86%结构召回率和92%精确率。
关键词: 钓鱼攻击;GraphSAGE;ModernBERT;协同注意力;异常检测;内部威胁;电子邮件安全;Enron
数据可用性声明
本研究的结构基础是Miz等人[9]在Zenodo上公开发布的Enron电子邮件时间序列网络(https://doi.org/10.5281/zenodo.1342353)。用于预处理、GraphSAGE训练、三阶段结构异常评分、内部威胁模块以及协同注意力ModernBERT验证阶段的完整源代码可应要求从通讯作者处获取。但是,为本研究生成的合成社会工程学电子邮件语料库(包括用于训练和评估协同注意力ModernBERT模型的精心设计的攻击者消息和后续通信)将不予发布。这些消息经过精心设计,以模拟现实的说服原则、权威线索和多阶段诱导策略,公开发布它们具有明显的双重用途风险:它们可能被摄入生成模型或直接用于大规模制作令人信服的钓鱼和 pretexting( pretexting,一种社会工程学攻击,通过编造虚假场景诱骗受害者)活动。因此,扣留攻击语料库是一项深思熟虑的安全措施,符合进攻性安全研究中负责任的披露惯例。
1 引言
社会工程学攻击(如钓鱼和 pretexting)现已成为企业环境中最常见的网络攻击类型。与传统攻击利用软件漏洞不同,这些攻击首先针对人,在利用软件之前先获得系统访问权限。例如,攻击者可能通过假装成老板、IT支持人员或其他可信人物,逐步建立信任来诱骗员工授予访问权限。由于这些消息通常看起来正常且不含恶意软件,仅基于内容的传统电子邮件过滤器往往无法检测到它们。检测社会工程学攻击的一个主要挑战是,恶意行为通常在消息内容本身变得明显可疑之前就已显现。早期预警信号反而体现在通信模式中,例如异常的发送者-接收者关系、异常的电子邮件频率,或涉及前所未见的外部账户的互动。这些结构信号仅凭传统的自然语言处理方法很难捕捉。
在本工作中,我们提出了一种归纳式图神经网络(GNN)框架,通过将电子邮件通信建模为图并识别“谁与谁通信、何时通信、频率如何”中的异常模式,来检测社会工程学攻击。第一阶段引入了三阶段结构异常检测流程。潜在恶意互动通过以下方式识别:(1)基于数量的峰值检测,(2)对比历史互动频率与基于嵌入的结构相似性的关系异常分析,以及(3)社区级上下文分析。为了减少误报并确认真正的攻击,我们随后应用基于BERT的内容分析阶段,验证被标记通信的语义意图。
先前关于社会工程学检测的研究仍然有限且零散。一些方法依赖预定义的安全词典或手工制作的意图评分,而另一些则应用基于浅层语言特征的传统机器学习技术[7]。这些方法通常难以泛化到定向或多阶段攻击,因为对手会随时间调整其语言。此外,许多基于图的异常检测技术是直推式的(transductive),不适合新用户和外部攻击者不断出现的现实电子邮件环境。
本文的主要贡献是一个实用的两阶段“过滤-验证”架构,平衡了检测准确性和操作可行性。归纳式GNN组件通过识别结构异常的互动,在动态电子邮件网络中提供高召回率;而基于BERT的验证阶段通过上下文分析减少误报,显著提高精确率。使用增强现实合成社会工程学活动的Enron电子邮件数据集,我们证明所提出的框架能有效检测广泛的攻击场景,包括外部攻击者和被入侵的内部账户。
2 相关工作
图神经网络(GNN)和BERT已在广泛任务中得到深入研究。然而,它们在检测社会工程学攻击中的应用仍相对未被探索。本节回顾了将异常检测建模为基于图的问题的现有方法,以及基于内容的异常检测方法,并从电子邮件网络中检测社会工程学攻击的角度讨论它们的优势和局限性。
2.1 基于图的异常检测
2.1.1 非神经与增量方法
早期对Enron电子邮件语料库的研究使用固定半径邻域的经典扫描统计来识别异常活动模式[11]。后来的工作如AnomRank引入了快速在线算法,通过监控节点重要性得分的变化来识别动态图中的结构和基于权重的异常[16]。虽然这些方法计算效率高,但它们仅依赖图结构。它们不使用丰富的节点特征,也无法处理全新的外部节点,这限制了它们检测社会工程学攻击的实用性。
2.1.2 用于异常检测的直推式图方法
Ding等人(2019)提出了一个框架DOMINANT,这是一种使用图卷积自动编码器的深度异常检测框架,它使用GCN编码器利用结构和属性创建低维嵌入,其中异常是具有高重建误差的节点[3]。DOMINANT的优势包括在深度模型中结合结构和属性,在社交媒体或基因网络等数据集上击败了更简单的方法(如自我网络或子空间分析)。然而,它是直推式的,这限制了它在实时电子邮件系统中的实用性,因为新攻击者可能在训练后出现。它还使用重建误差而没有特定的社区或基于时间的检查,这可能导致电子邮件时间线中出现更多误报。
2.1.3 用于异常检测的归纳式图表示学习
归纳式图表示学习因其在利用现有训练数据为前所未见的节点生成嵌入而无需在整个图上重新训练的能力,在异常和欺诈检测中获得了极大关注。这种能力在社会工程学中尤为重要,因为即使模型部署后,新的发送者也频繁出现。
Van Belle等人(2022)的一项相关工作将GraphSAGE和快速归纳式图表示学习(FI-GRL)应用于现实世界的信用卡交易网络[14]。研究表明,当在GraphSAGE训练期间将传统交易属性作为节点特征提供时,即使在极端类别不平衡下,分类性能也会提高。然而,他们的方法针对二分(或三分)交易网络,并将欺诈视为重复交易的节点分类。相比之下,电子邮件通信图是非二分的,社会工程学攻击通常表现为前所未见的外部发送者的罕见单向互动,而非重复发生。
2.2 基于内容的社会工程学攻击检测
先前基于内容的社会工程学检测工作使用利用语言特征的浅层机器学习模型[1]。虽然这些方法对大规模钓鱼攻击有效,但它们无法捕捉社会工程学尝试中涉及的双方之间的关系和上下文。Ilias等人(2022)[5]证明,在基于BERT的模型中添加协同注意力有助于它们捕捉攻击者第一条消息与后续消息之间的联系,从而提高检测准确率。
在此基础上,我们采用了ModernBERT[15]与协同注意力机制,该机制最初由Lu等人[8]提出用于视觉问答,后被Ilias等人[5]改编用于欺骗检测。与Ilias等人[5]使用的原始BERT模型相比,ModernBERT提供了几项实际改进,最显著的是支持更长的输入序列(最多8,192个token,而BERT为512)。这对于社会工程学检测尤为重要,因为攻击通常通过多条消息展开,需要理解长对话上下文而非单封邮件。为了高效处理此消息历史,我们还使用轻量级摘要模型将过去的通信浓缩为简洁的上下文。然后将此摘要与当前消息一起提供给协同注意力架构。
2.3 研究空白与动机
现有的基于图的方法(如DOMINANT)难以应对新攻击者,因为它们需要在整个图上重新训练。这是社会工程学检测的一个主要限制,因为攻击者经常使用前所未见的账户。虽然GraphSAGE在信用卡网络的欺诈检测中有效,但它并非为电子邮件网络量身定制,后者是非二分且高度时间相关的。在内容方面,传统的NLP方法依赖浅层语言特征,无法捕捉跨多条消息的演变上下文。这凸显了需要一种将归纳式结构学习与上下文感知内容分析相结合的框架,以有效检测多阶段社会工程学攻击。
社会工程学研究中的一个重大挑战是缺乏公共的企业电子邮件数据集。使用历史数据集(如Enron,1999-2002年)时的一个常见担忧是它们是否能泛化到现代社会工程学攻击。我们认为,与其他网络攻击不同,社会工程学攻击针对的是基本的人际信任模式和组织层级,这些在结构上很大程度上是时间不变的。
虽然消息语义在我们的验证阶段起着关键作用,但它们仅在初始结构过滤之后才被利用。我们的实验表明,仅使用纯图结构(即严格将网络表示为节点和边,不包含消息内容或发送者-接收者对元数据)就实现了86%的召回率。仅使用拓扑特征就能达到如此高的检测率,表明社会工程学的主要信号嵌入在通信结构中。由于这些信任和异常的结构模式随时间保持稳定,数据集的年代并不会损害结构检测评估的有效性。为了验证这一点,我们进行了时间划分——在1999-2000年数据上训练,在2001-2002年数据上测试。模型的一致表现证实了这些结构异常在时间上是稳定的。
3 实验设置
本节描述了用于评估的数据集、电子邮件通信图的构建、合成攻击注入的过程,以及所提出的GraphSAGE和基于BERT的组件的架构细节。我们还详细介绍了三阶段结构异常检测流程和最终的分数聚合策略。
3.1 数据集与图构建
我们使用Miz等人[9]发布的预处理Enron电子邮件时间序列网络作为实验基础。该数据集将电子邮件地址作为节点,发送者-接收者关系作为有向边,并为每个节点提供发送电子邮件的天数和相应计数的记录。由于这种格式不直接适用于我们的模型,我们将每条记录转换为长度为 T=1,448天的固定长度向量,其中每个条目 t∈[1,T]表示该天发送的电子邮件数量(如果没有发送则为0)。形式上,对于节点 v∈V,这给出一个特征向量 xv∈RT。
这些向量作为节点特征,与有向边集 E⊆V×V一起,形成了属性通信图 G=(V,E,{xv}v∈V)。该图包含大约 ∣V∣=6,599个节点,捕捉了从1999年1月1日到2002年7月30日的电子邮件活动。这种设置使我们的GraphSAGE模型能够同时利用随时间变化的电子邮件活动和用户之间的连接。
3.2 合成攻击注入
原始的Enron数据集不包含社会工程学攻击的真实标签。因此,我们基于社会工程学原理[10]和一些示例[13][17]构建了5组现实活动,并将其注入当前的Enron图中。GraphSAGE模型仅在原始的干净Enron图上训练。训练后,合成攻击者(新节点)及其电子邮件/回复作为有向边注入。这种设置利用了GraphSAGE的归纳能力,它学习一个通用的聚合函数来计算嵌入[4],从而避免了每当新节点添加到图中时需要重新训练。
表1:合成攻击活动
|
C1 |
6600 |
97 |
1999年7月20日–31日 |
11 |
|
C2 |
6601 |
171 |
1999年8月4日–15日 |
11 |
|
C3 |
6602 |
221, 223, 225, 226, 227 |
1999年10月28日–11月2日 |
18 |
|
C4 |
6603 |
817, 1017 |
1999年2月20日–2000年2月15日 |
13 |
|
C5 |
1023 |
145 |
2000年4月3日–9月18日 |
24 |
文献[10][6]指出了特定的合规原则,如权威、紧迫性、信任,解释了目标为何会遵从请求。C1基于友谊或喜好原则。C2的灵感来自[13],攻击者通过电子邮件发送恶意发票,并迅速跟进一个伪装成高级管理人员的电话,利用权威和紧迫性。我们通过在第一封邮件后立即添加一阵单向电子邮件来模拟跟进电话。C3的灵感来自[17],攻击者在停放的车辆上放置通知,将许多受害者引向恶意网站。我们将此攻击建模为由单个外部节点向多个不相关用户发送单向电子邮件的广播模式。C4代表基于一致性[6]原则的“低速缓慢”攻击。C5代表内部或被入侵账户场景,这是最难检测的。
3.3 架构

图1:训练阶段。 原始emails.csv被预处理为时间序列特征和图结构。GraphSAGE为结构分析而训练,协同注意力BERT在电子邮件内容上训练。两个模型都支持归纳学习。

图2:检测阶段(含合成攻击)。 结构异常检测分三阶段执行以识别高风险对。过去的电子邮件使用Tiny模型(T5-small[12])摘要,并与当天的消息结合。两者水平交互,Tiny模型的输出被送入协同注意力BERT模型以产生最终检测结果。
3.4 三阶段结构异常检测
我们的框架采用三阶段方法检测电子邮件通信图中的结构异常。每个阶段针对潜在社会工程学行为的不同方面,所得分数被归一化并聚合以产生统一的异常分数。具体来说,三个阶段分别捕捉:1) 个体电子邮件活动的偏差;2) 异常的发送者-接收者关系;3) 基于用户当天活动与其社区整体活动水平对比的上下文偏差。
3.4.1 阶段1:峰值检测(电子邮件数量异常)
在第一阶段,我们通过将当前活动与历史行为进行比较,检测每个发送者的异常电子邮件数量。对于发送者节点 v,令 {xv1,xv2,…,xv,t−1}表示历史每日电子邮件计数,xvt表示当前天 t的计数。使用截至第 t−1天的值计算均值 μv和标准差 σv,第 t天的z分数计算为:

该分数衡量发送者当前活动偏离其通常行为的程度。由于社会工程学攻击通常涉及向不同接收者爆发式外联以建立联系并寻找潜在目标,异常高的z分数表明可疑行为。z分数通过高斯误差函数传递,以获得归一化的数量异常分数 S1(v)∈[0,1]。
3.4.2 阶段2:邻域与互动分析(关系异常)
阶段2通过结合嵌入相似性和历史互动模式,检测异常的关系形成模式,形成一个对比感知的关系分数。这使我们能够识别结构上异常或与过去通信行为不一致的互动。
历史互动分数:
对于给定天的每个发送者-接收者对,我们测量他们过去关系的强度。这是通过计算该对在过去交换过至少一封电子邮件的天数相对于无互动天数的比例来完成的。我们还引入一个动态阈值K用于归一化。K是所有对过去电子邮件互动次数的中位数。形式上,原始历史互动分数 hvu定义为:

由于 hvu可以取无界值,我们将其归一化为有界频率:

基于嵌入的结构相似性:
接下来,我们考虑发送者-接收者的这种互动如何适应整个通信图。我们计算发送者和接收者嵌入之间的余弦相似度:

高相似度意味着根据三层GraphSAGE嵌入,发送者和接收者在网络中的行为相似,而低相似度表明互动异常。
对比感知关系分数
虽然历史互动频率和基于嵌入的结构相似性单独提供了有用的见解,但仅凭其中之一都不足以可靠地检测异常关系。在网络中接近并不一定意味着两个节点频繁互动,而频繁的互动可能仍然出乎意料。为了解决这个问题,我们将两者结合成一个对比感知的关系分数:

其中 α,β,γ控制每一项的相对贡献。下表说明了不同组合的贡献。
表2:基于历史频率和嵌入相似性的关系异常检测总结
|
新/罕见 |
低 |
任意 |
来自 α(1−f)的高贡献 |
高 |
✓ |
|
频繁,通常 |
高 |
高 |
全部低 |
低 |
✗ |
|
频繁,异常 |
高 |
低 |
对比项 γf(1−sim)高 |
高 |
✓ |
|
中等平衡 |
中等 |
高 |
中等 |
低 |
✗ |
3.4.3 阶段3:社区检测(上下文异常)
在阶段3中,我们通过分析发送者在给定天与不同接收者社区的互动程度来检测上下文异常。我们首先将电子邮件图转换为无向图,并应用Louvain算法将节点划分为社区。Louvain算法是一种广泛使用的社区检测方法,通过贪婪方式最大化模块度来识别节点组[2]。对于每个发送者-接收者对,我们测量发送者与接收者社区互动的频率相对于其与接收者列表中其他社区互动的频率。

较低的值表示发送者很少与接收者的社区互动。然后我们使用线性反转计算每对发送者-接收者的阶段3异常分数 S3:

虽然Louvain算法提供了一种仅从图结构识别社区的无监督方法,但我们假设使用预定义的标记社区可能会进一步提高这一阶段的有效性。我们将此探索留给未来的工作。
3.5 针对内部威胁的专用检测
当检测由被入侵的内部账户发起的社会工程学攻击时(例如活动5),会出现一个独特的挑战。与外部攻击者(通常作为没有历史记录的新节点出现)不同,被入侵的内部人员具有高中心性、既定的信任关系和大量通信历史。为了解决这个问题,我们引入了一个条件分支逻辑。如果一个互动涉及两个既定的内部节点,我们就从全局异常检测转向以自我为中心的基线比较。这种专用检测对结构阶段修改如下:
3.5.1 修改的阶段1:
标准数量检测分析发送者的总每日输出。对于内部人员,这是无效的,因为一封恶意电子邮件会被合法流量掩盖。相反,我们修改阶段1以计算特定发送者和接收者之间成对互动数量的z分数。这将异常检测集中在关系上,而不是用户上。
3.5.2 阶段2的替代:语言漂移分析
对于内部人员,阶段2的结构分数(嵌入相似性)风险被低估,因为被入侵的节点在结构上合法。为了弥补,我们用语言漂移度量(Dling)替代关系结构分数。我们计算当前消息的ModernBERT嵌入与用户最近50条已发送消息的质心之间的余弦距离。这检测了当外部对手控制合法账户时发生的语义风格偏移。对于语言漂移度量,我们利用预训练ModernBERT的冻结嵌入。微调保留给最终的分类阶段,以防止异常检测器过度拟合特定关键词。
3.5.3 内部风险聚合
最终的内部风险分数是这些有针对性的组件的加权和,优先考虑偏离用户个人历史的情况:

其中 Drec表示成对接收者偏差(在修改的阶段1中计算)。Dling是使用冻结ModernBERT嵌入在分类前测量的语言漂移。Iman表示微调BERT分类器输出的特定操纵意图分数(0到1),Sstruct是从GNN派生的发送者和接收者节点之间的基线余弦相似度。
3.6 使用协同注意力BERT进行基于内容的验证
3.6.1 ModernBERT架构
在结构异常检测流程识别出高风险的发送者-接收者对后,我们应用一个基于内容的验证层来减少误报并确认真正的社会工程学尝试。本节详细介绍我们的ModernBERT + 协同注意力模型的架构和数学公式。
对于发送者-接收者对中的每封电子邮件,我们准备两个输入序列:x1,即所有过去消息的摘要历史(由Tiny模型摘要器生成),和 x2,包含当前电子邮件的合并主题和正文文本。这些序列被分词并传入ModernBERT模型以获得上下文化嵌入。数学上,

其中 N和 T是序列长度,d=768是ModernBERT-base的隐藏维度。
3.6.2 协同注意力机制与分类
遵循Ilias等人[5],我们采用协同注意力机制来捕捉当前消息与摘要历史之间的语义依赖。
我们首先计算一个亲和矩阵:

其中 Wl是一个学习到的权重矩阵。该矩阵用于导出注意力图:

注意力图通过softmax转换为概率分布 as和 ac,然后用于获得协同注意力向量 s^和 c^。最终表示为:

该向量通过一个四层MLP,使用GELU激活、层归一化和0.3的dropout。架构遵循递减的瓶颈结构:

最终概率计算为:

3.6.3 训练策略
我们采用两阶段训练策略来优化模型:
冻结ModernBERT阶段: 最初,我们冻结ModernBERT参数,只训练协同注意力机制和分类层。这允许特定任务的组件适应预训练表示,而不会灾难性遗忘。
微调阶段: 在协同注意力和分类层收敛后,我们解冻ModernBERT参数,并以较低的学习率进行端到端微调。这允许整个模型共同为社会工程学检测进行优化。
模型使用二元交叉熵损失和类别权重进行训练,以处理数据集的不平衡性质(合法电子邮件的数量显著多于社会工程学尝试)。
3.7 分数聚合
独立求和阶段分数的一个已测试限制是它会产生大量的误报。一个这样的例子是管理员发送的公告邮件被标记。在像Enron这样的企业环境中,管理员经常向广泛的接收者(跨多个部门/社区)发送大量电子邮件。如果管理员长期以来一直与这些接收者互动,他们的发送者-接收者关系在结构上是正常的,不应被视为可疑。然而,独立的线性聚合总是允许高数量(阶段1)主导最终异常分数。
为了解决这个问题,我们将数量作为基础风险分数的条件乘数。基础风险源自结合阶段2和阶段3的分数,并赋予适当的权重。这样,只有当底层互动确实异常时,高数量才会提高异常分数。数学上,

4 结果
所提出的框架为每个发送者-接收者互动输出一个聚合的异常分数 Sfinal∈[0,1]。要将互动标记为异常,必须定义一个阈值分数。在实验期间,与活动相关的发送者-接收者互动的分数始终在 0.65到 0.95的范围内。活动1有一个例外,其中一个攻击互动的分数为 0.63。
为了捕捉这一个案例而将全局阈值降低到 0.65会导致误报显著增加,因此不切实际。为了分析阈值分数与误报之间的权衡,我们在四个阈值分数下评估结构框架性能:0.65、0.70、0.75和 0.80。
4.1 按活动划分的结构检测
表3:跨阈值的活动级结构检测性能
|
C1 |
6 |
5 (83.3%) |
5 (83.3%) |
2 (33%) |
1 (17%) |
|
C2 |
9 |
9 (100%) |
9 (100%) |
9 (100%) |
9 (100%) |
|
C3 |
10 |
10 (100%) |
9 (90%) |
5 (50%) |
5 (50%) |
|
C4 |
8 |
8 (100%) |
8 (100%) |
7 (87.5%) |
7 (87.5%) |
|
C5 |
24 |
21 (87.5%) |
18 (75.0%) |
10 (41.7%) |
6 (25.0%) |
|
总计 |
57 |
53 (93.0%) |
49 (86.0%) |
33 (57.9%) |
28 (49.1%) |
GNN模型实现了良好的召回率。然而,如表4所示,实现更高的召回率是以更低的精确率为代价的。在我们系统的背景下,GNN的主要目标是最大化召回率,它确实有效地做到了这一点,即使精确率较弱。协同注意力BERT模型解决了精确率的问题。如表5所示,BERT显著提高了各活动的精确率,活动3略低,为95%。
活动5代表被入侵账户或内部威胁,攻击者存在于原始训练数据中,是合法用户。由于该节点的历史互动在结构和语言上都是正常的,BERT模型在区分合成攻击消息与既定的良好基线方面面临重大挑战。这导致与外部活动相比检测性能较低,因为协同注意力机制必须从可信的历史中识别出非常细微的偏差。
表4:跨阈值的GNN过滤性能
|
≥0.65 |
53 |
407 |
93.0 |
11.5 |
0.204 |
31.2 |
|
≥0.70 |
49 |
376 |
86.0 |
11.5 |
0.203 |
28.8 |
|
≥0.75 |
33 |
80 |
57.9 |
29.2 |
0.388 |
7.6 |
|
≥0.80 |
28 |
73 |
49.1 |
27.7 |
0.354 |
6.9 |
表5:在 ≥0.70τ下GNN过滤后的协同注意力BERT性能
|
C1 |
83.3 |
100 |
90.9 |
|
C2 |
100 |
100 |
100 |
|
C3 |
90.0 |
95.0 |
92.4 |
|
C4 |
100 |
100 |
100 |
|
C5 |
75.0 |
70.8 |
72.8 |
|
总体 |
89.7 |
92.2 |
90.9 |
4.2 各组件贡献
如表6所示,没有任何单一阶段足以进行稳健的异常检测。阶段2(关系异常)是结构召回的主要驱动力(61.362%),证实异常的发送者-接收者互动模式是潜在社会工程学的最强指标。然而,仅阶段2的精确率极低(2.266%)。阶段1(数量)和阶段3(社区)的整合起到了必要的调节机制作用,过滤掉结构噪声,并将组合结构召回率提高到86.000%。这表明我们的复合结构分数成功地为一个后续基于内容的验证阶段隔离了一个高风险候选池。
表6:消融研究:各组件的结构阶段性能
|
仅阶段1 |
19.767 |
13.427 |
15.991 |
|
仅阶段2 |
61.362 |
2.266 |
4.371 |
|
仅阶段3 |
33.822 |
14.200 |
20.002 |
|
阶段1 + 2 |
70.614 |
5.549 |
10.289 |
|
阶段1 + 3 |
33.822 |
14.200 |
20.002 |
|
阶段2 + 3 |
34.505 |
13.919 |
19.836 |
|
阶段1+2+3 |
86.000 |
11.500 |
20.287 |
4.3 与现有方法和基线的比较
为了评估初始结构过滤阶段的必要性,我们测试了一个独立的“仅BERT”基线。在这种配置下,协同注意力ModernBERT模型处理了攻击日的所有电子邮件(7,452封合法和57封攻击电子邮件,总计7,509次互动),没有先进行GNN过滤。分析整个流量,标准BERT模型仅实现了63.0%的召回率。虽然语言模型成功地识别了明确的社会工程学术语,但它难以应对使用良性或上下文正常语言的复杂攻击。此外,将深度Transformer模型应用于所有网络流量会带来不切实际的计算开销。将GNN作为第一阶段提供了关键的结构上下文,在提高检测精确率的同时减轻了分析所有单个电子邮件的高计算成本。
我们还将我们的方法与Priebe等人[11]提出的局部扫描统计(Ψ)进行了比较,该方法通过使用滚动窗口计算节点 k=1邻域内边计数的Z分数来检测异常。虽然这种方法成功地检测了新型外部攻击的初始发作,但由于持续的基线更新,其有效性迅速下降。例如,在活动1和2中,Z分数在攻击第一天达到峰值(Ψ=10.00),但在随后的几天稳步下降(到第5天降至 Ψ=2.00),因为滚动窗口将新边纳入了正常行为。因此,扫描统计经常无法检测到多阶段诱导策略和后续通信。
这种限制也对低速缓慢活动和被入侵内部账户的检测产生了负面影响。在活动4(低速缓慢)中,电子邮件之间的长时间间隔导致扫描统计的滚动窗口反复重置,导致模型将长达一年的持续诱导活动视为一系列孤立事件,而非协调攻击。同样,在活动5(内部威胁)中,当被入侵用户首次偏离历史模式时,扫描统计记录了显著的初始峰值(Ψ=30.00)。然而,到攻击第二天,滚动窗口已经吸收了这种新行为,导致异常分数降至 Ψ=1.30。
我们提出的框架缓解了这些限制。通过整合对比感知关系分数(阶段2)和语言漂移度量(Dling)与ModernBERT的协同注意力机制,系统在攻击的整个持续时间内保留了结构和上下文记忆。
表7:局部扫描统计 (Ψ) 在攻击剖面中的局限性
|
C1 & C2(外部爆发) |
10.00(第1天) |
2.00(第5天) |
|
C4(低速缓慢) |
10.00(重复) |
3.00 – 4.36 |
|
C5(内部威胁) |
30.00(第458天) |
1.30(第459天) |
4.4 内部威胁检测(活动5)
由于被入侵的内部账户保持着合法的历史通信模式,应用标准全局检测阈值(τ=0.70)导致活动5的初始性能相对较低,实现了75.0%的召回率和70.8%的精确率。为了解决这个问题,我们实施了专用的内部威胁模块(ITM),它从全局异常检测方法转向以自我为中心的基线评估。ITM有效地惩罚了偏离用户既定历史行为的互动,在调整后的阈值0.60下,将活动5的检测率提高到83.3%的召回率和78.4%的精确率。虽然进一步降低阈值理论上可以产生100%的召回率,但这样做会带来过高的误报率。因此,当前配置代表了最佳权衡,表明将语言漂移(Dling)和操纵意图(Iman)整合到个性化基线中,对于识别逃避纯结构过滤器的被入侵账户至关重要。
4.5 时间泛化分析
为了评估我们框架的时间鲁棒性,我们按时间顺序划分Enron数据集,专门在1999-2000年期间的数据上训练GraphSAGE模型。然后,冻结的模型在2001-2002年期间的未见数据上进行评估。为了保持实验一致性,原本注入训练期的合成攻击活动被映射到2001-2002年的测试集中。我们将活动时间戳移动了731天,确保攻击的相对持续时间和电子邮件频率保持不变,而背景网络拓扑和合法流量模式已经演变。
该框架展示了强大的泛化能力。在检测阈值 τ=0.6下,系统实现了89.0%的时间召回率。即使在更保守的阈值 τ=0.7下,模型也保持了76.3%的召回率。这些结果证实,社会工程学的结构特征(如异常的关系形成和通信爆发)在根本上是不随时间变化的。这验证了使用历史数据集作为结构过滤的可行替代方案。
表8:时间泛化性能(训练:1999-2000,测试:2001-2002)
|
≥0.60 |
38 |
34 |
89.0 |
|
≥0.70 |
38 |
29 |
76.3 |
4.6 GNN过滤与BERT优化的影响
该框架采用两阶段架构,其中GNN充当高召回率过滤器以减少候选互动集,然后由协同注意力BERT模型进行评估以进行精确检测。表9总结了这种设计对工作负载、召回率、误报和精确率的影响。
表9:GNN过滤与协同注意力BERT对检测指标的影响
|
输入负载 |
100%(所有流量) |
28.8%(过滤后的候选) |
|
召回率(安全性) |
86.0% |
82.4% |
|
误报 |
376(高噪声) |
7(低噪声) |
|
精确率 |
11.5%(弱) |
92.2%(强) |
单独的GNN实现了高召回率(86.0%),但伴随着大量的误报。在BERT优化后,绝大多数误报被消除,精确率达到92.2%。虽然由于活动5内部威胁的复杂性,阶段2的召回率略有下降,但两阶段设计在将计算负载减少超过71%的同时,保持了检测可靠性。
4.7 总结与权衡分析
我们的实验显示了检测攻击与避免误报之间的明确权衡。GNN阶段捕获了大多数可疑互动,在0.70阈值下检测到了86%的攻击。然而,它也标记了许多正常电子邮件,如公告或管理消息,从而降低了精确率。
添加BERT内容分析阶段有助于解决这个问题。通过检查实际的电子邮件内容和过去的消息上下文,它消除了几乎所有的误报,并将精确率提高到92%以上。一些攻击,如来自内部账户的攻击,仍然更难检测,因此召回率略有下降,但总体而言,系统可靠地发现了攻击。
两阶段设计也很高效。只有大约29%的电子邮件需要完整的BERT处理,这节省了计算量,并使系统适用于现实世界的使用。总的来说,分离结构检测和内容验证使框架能够在现实的企业环境中平衡安全性(高召回率)、准确性(高精确率)和效率。




