欢迎光临
我们一直在努力

上下文感知的鱼叉式钓鱼:利用公共社交媒体数据通过生成式AI对个体实施攻击

大家读完觉得有帮助记得关注和点赞!!!

摘要

我们展示了公共可用的社交媒体数据和生成式人工智能(GenAI)如何被滥用来自动化并规模化高度个性化、上下文感知的鱼叉式钓鱼活动。攻击者只需付出极少的努力,利用每个目标少量的公开活动数据,GenAI模型就能提取兴趣点和上下文线索,生成与目标沟通风格高度相似、并能绕过通用内容审核防护措施的极具说服力的消息。我们引入了一个模块化框架,结合了多模态信号提取、沟通风格画像以及跨七种策略(诱饵、恐吓软件、蜜罐陷阱、尾随、冒充、交换条件、个性化情感操纵)的攻击实例化。我们进行了一项大规模的跨模型评估,涵盖数千封生成的电子邮件和八个安全相关标准,并以现实世界的钓鱼邮件语料库作为基准进行比较。GenAI生成的电子邮件表现出显著更高的个性化程度、上下文关联性和说服力杠杆。重要的是,一项互补的用户研究证实了这些结果,揭示LLM生成的攻击在八个维度上始终优于APWG eCrimeX的电子邮件,同时在人类接收者中引发更低的怀疑。最后,我们测量并分析了现有主动的、提示级别的防御机制(包含自适应机制)以及两种互补的防御方法——策略增强的SOTA安全防护模型和系统指令思维链审核。我们记录了这些防御如何应对上下文化、自适应的攻击提示,强调需要平台级的防护措施,明确应对大规模上下文化的滥用。


1. 引言

鱼叉式钓鱼是最具破坏性和持续性的社会工程威胁之一,它利用受害者的信任窃取敏感信息或获得未经授权的访问(Allodi et al., 2019; Bursztein et al., 2014; Pinjarkar et al., 2024)。传统上,发动此类攻击需要大量努力——收集个人数据、定制有说服力的消息,并在不同目标间扩展攻击。虽然泄露的数据集可以提供有价值的洞察(Edwards et al., 2016; Jaeger et al., 2016),但它们仍然昂贵且难以获取。相比之下,公共社交媒体平台免费提供了丰富的上下文信号、用户兴趣、关系、情绪和生活事件(Ham et al., 2019; Kutschera, 2023; Gong and Liu, 2016)。虽然这降低了数据收集的门槛,但制作可信、个性化的钓鱼内容仍然需要大量的手工努力。

生成式AI(GenAI)模型,如ChatGPT(OpenAI, 2022)、Claude(Anthropic, 2024)和LLaMA(Touvron et al., 2023),改变了这一态势。这些模型在海量的文本语料库上训练,擅长上下文敏感的、流畅的文本生成,即使只有极少的示例(Raffel et al., 2020; Chen et al., 2021)。通过轻微的提示修改,攻击者就可以绕过内容审核,获取少量社交媒体帖子,并自动生成可扩展到数千用户的、个性化的、心理操纵性的鱼叉式钓鱼电子邮件。

在这项工作中,我们提出了一个系统化的、模块化的框架,结合了上下文信号提取、沟通风格画像以及跨七种钓鱼策略(如诱饵、恐吓软件)的针对性攻击实例化。利用来自200名用户的Instagram帖子,我们表明,每个用户少至10个帖子就足以生成高度上下文化的电子邮件。我们的流水线利用了商业(如Claude, Gemini)和开源(如LLaMA, Gemma)的GenAI模型,展示了跨模型的有效性。

我们使用来自APWG eCrimeX的4K个现实世界钓鱼样本作为基准,在八个核心维度上评估了超过18K个AI生成的电子邮件——上下文相关性、说服力、情感操纵、可信度等。GenAI生成的输出在个性化和可信度方面始终优于人工制作的钓鱼电子邮件。为了分析更广泛的趋势,我们引入了一个分类法,将七种攻击策略映射到五个上下文维度,揭示了人类和机器生成的钓鱼内容之间的结构性差异。据我们所知,这是第一项将攻击分类法、多维评估指标和现实世界基准统一到一个可扩展的方法论中,用于衡量GenAI赋能的鱼叉式钓鱼的研究。

最后,我们测量了旨在有害内容生成之前识别恶意指令的提示级防御。我们在保留提示上评估了基于RoBERTa的检测器,并报告了其跨模型和攻击类别的准确率和泛化能力。为了研究自适应攻击者,我们使用DeBERa测量了句子和子提示级别的检测,从而在增量提示变化下实现更早阶段的筛选。我们还在相同的威胁环境下评估了策略增强的最先进(SOTA)安全防护模型和系统指令思维链审核。

贡献。​ 本文做出了以下贡献:

(1) 分类法与评估框架。​ 我们引入了一个统一的框架,用于分类鱼叉式钓鱼攻击,结合了七种攻击策略和五个上下文维度,并提出了八个用于衡量有效性的评估指标。据我们所知,这是第一个用于分类和严格评估鱼叉式钓鱼攻击的统一框架。

(2) 攻击生成流水线。​ 我们设计了一个模块化的提示工程框架,可从社交媒体提取上下文信号,分析沟通风格,并在多个GenAI模型中实例化攻击。

(3) 大规模跨模型评估。​ 我们使用五种GenAI模型生成并分析了约18K封钓鱼电子邮件,并将其与4K个现实世界样本进行比较。GenAI电子邮件比现实世界的鱼叉式钓鱼基线更加个性化、上下文关联性强且具有操纵性。

(4) 主动防御与现有防护评估。​ 我们系统地评估了SOTA防护措施,包括商业LLM安全过滤器、内容审核API和提示级护栏,以应对上下文感知的GenAI鱼叉式钓鱼提示。然后,我们提出了一种主动的、提示级的防御措施,在内容生成之前阻止恶意意图。我们基于RoBERTa的检测器实现了98.1%的准确率,能泛化到不同模型和攻击类型,并在自适应规避策略下保持鲁棒性。


2. 相关工作

钓鱼与鱼叉式钓鱼。​ 钓鱼仍然是最普遍的网络攻击,造成重大经济损失并侵蚀对数字通信的信任(Agazzi, 2020; Chen et al., 2011)。鱼叉式钓鱼尤其利用个人或上下文信息来制作有针对性的、有说服力的消息(Jakobsson and Myers, 2006; Bursztein et al., 2014)。先前的研究表明,即使是手工制作的鱼叉式钓鱼也会造成不成比例的损害,特别是当针对高价值账户时(14; E. Bursztein, B. Benko, D. Margolis, T. Pietraszek, A. Archer, A. Aquino, A. Pitsillidis, and S. Savage (2014))。然而,这些研究早于生成式AI的出现,并未考虑其扩展和自动化个性化的潜力。

用于钓鱼生成的GenAI。​ 最近的研究揭示了大型语言模型(LLM)可能被滥用来产生钓鱼内容。Langford等人(Langford and Payne, 2023)表明,极简的提示就能产生可信的通用钓鱼电子邮件,而Roy等人(Roy et al., 2024)则自动化了钓鱼网站的生成。Bethany等人(Bethany et al., 2024)发现LLM可以匹配专业传播者的质量。新兴的鱼叉式钓鱼框架扩展了这项工作,探索了规避优化(Qi et al., 2025)、利用公共资料的基于引用的攻击(Liu et al., 2025a)以及基于组织的电子邮件生成(Pajola et al., 2025)。然而,这些努力缺乏一个统一的、基于现实的基准,来共同评估攻击类型的多样性、人类易感性和防御弹性。我们的工作在三个关键方面推进了该领域:(1)我们将个性化建立在真实的社交媒体数据之上,并提取上下文信号,如兴趣、关系和事件,以制作逼真的攻击。(2)我们提出了一个统一的分类法和评估框架,使得能够对约18K封GenAI生成的电子邮件与现实世界的钓鱼基线进行大规模基准测试。(3)我们不仅关注攻击的可行性,还系统地测量了现有防御的有效性,并检查了各种检测机制。

防御机制。​ 最近关于LLM赋能的社会工程和提示滥用的防御工作越来越集中于提示级检测(Inan et al., 2023; Wang et al., 2025; Liu et al., 2025b)。这些系统的一个共同主题是将安全性操作化为一个门控决策,通常通过指令引导的LLM监视器、筛选期间的结构化推理或学习到的检测器来实现,以便可疑的提示可以被阻止或升级以供审查(Liu et al., 2024)。作为对这些设计的补充,几条工作线强调了在自适应攻击者下的鲁棒性和评估,包括混淆或间接的恶意请求,并针对不断演变的越狱或注入策略对检测器/护栏进行基准测试(Zhang et al., 2025; Li and Liu, 2024; Cao et al., 2024)。例如,Wang等人(Wang et al., 2020)将防御构建为一种指令引导的“自我守卫”,在执行前筛选请求,强调SI风格的监视器必须在自适应越狱提示和迭代提示优化的测试下进行测试。


3. 威胁模型

攻击者目标。​ (1)获取敏感信息:​ 诱导受害者披露私人数据——如凭证、个人标识符或财务信息——将其重定向到嵌入在有说服力的、量身定制的钓鱼电子邮件中的恶意链接。(2)利用社交上下文:​ 使用公共社交媒体信号(如兴趣、近期事件、关系、情绪基调)来制作看起来可信、个性化且在心理上引人注目的电子邮件。

攻击者能力。​ (1)访问公共社交媒体数据:​ 从Instagram等平台的用户资料中抓取公开可用的内容,如帖子、标题、图像和元数据,无需特权或内部访问。(2)滥用GenAI模型:​ 利用商业和开源的GenAI系统自动生成钓鱼内容。攻击者仅需极少的提示工程专业知识即可绕过标准的内容审核机制;不需要专门的机器学习知识。(3)适应防御:​ 不断完善提示和内容以逃避启发式、基于规则或基于机器学习的检测系统。这包括修改语气、结构或术语以规避静态过滤器或提示级分类器。

我们不假设拥有私人数据、内部信息或自定义模型训练的能力。我们的重点是可扩展、低成本的攻击,现实的攻击者只需极少的资源但具有广泛的覆盖面即可实施。


4. 鱼叉式钓鱼生成框架

图1. 我们的攻击流水线概览。

图2. GenAI驱动的鱼叉式钓鱼的端到端框架。​ 该流水线包括:(1)从社交媒体获取数据,(2)基于提示的内容生成,(3)使用三LLM标注和人类检查进行质量评分和验证,(4)一种对自适应攻击具有弹性的主动提示级防御过滤器。

我们提出了一个模块化框架,模拟了攻击者如何利用GenAI系统地自动化上下文感知的鱼叉式钓鱼。与依赖孤立提示示例的先前研究不同,我们的框架捕捉了攻击者的完整工作流程,并通过一系列量身定制的提示来实现,旨在规避标准的内容审核过滤器和安全护栏。该框架由四个阶段组成(图1),每个阶段映射到攻击者生成过程的一个不同组成部分:(1)上下文提取:​ 从公共社交媒体内容中提取个人信号,如姓名、兴趣、关系和近期事件,同时最大限度地减少幻觉(例如,不允许占位符数据)。(2)攻击类型 × 上下文集成:​ 将七种钓鱼策略之一与五种上下文维度之一对齐,以确保情境相关性。例如,将蜜罐陷阱策略与基于位置的上下文相结合,会提示模型生成与用户位置相关的合理浪漫叙事。(3)风格模仿:​ 调整语气、词汇和结构以反映目标的沟通模式,增强可信度和心理说服力。(4)输出格式化:​ 生成结构化的、措辞专业的电子邮件,包含主题行、合理的发件人身份和非可点击的纯文本URL,以提高可信度并绕过基于链接的过滤器。

4.1. 提示实现与规避

我们评估了在实验时可用的、SOTA稳定且公开可访问的商业和开源LLM(如GPT-4),确保与先前工作的可重复性和可比性。商业GenAI模型(如GPT-4)通常通过内置的审核系统阻止明确的钓鱼请求(80; 79)(图12)。为了在诸如此类的模型上实施我们的框架,我们应用了三种轻量级的提示工程策略来可靠地规避这些防护:

(1)思维链对齐:​ 我们不发出直接的钓鱼提示,而是引导模型通过一个与预定攻击类型和上下文输入相一致的结构化推理过程。提示将任务分解为顺序步骤:

(i)从社交媒体提取显著属性(如姓名、地点),

(ii)分析沟通风格,

(iii)判断是否存在足够的上下文继续进行。这种方法最大限度地减少了幻觉,并提示进行深思熟虑的、有依据的的生成(Wei et al., 2022; Kojima et al., 2022)。

(2)关键词替换:​ 用良性的替代词替换审核敏感术语(例如,用“个性化消息”代替“诈骗”或“欺骗”),降低触发过滤器的可能性(Huertas-García et al., 2023)。

(3)良性框架:​ 将恶意目标嵌入看似无害的提示中(例如,“给朋友写个便条”),利用模糊性绕过内容限制(Kumar et al., 2024; Cai et al., 2024)。

这个提示流水线说明了攻击者如何能够系统地将公共上下文信号转化为有针对性的鱼叉式钓鱼消息,而无需模型微调、特权访问或技术复杂性。图12展示了规避成功后的一次成功生成。


5. 社会工程攻击分类法

基于先前在社会工程、在线行为和隐私泄露方面的研究(Abu Hweidi and Eleyan, 2023; Aldawood and Skinner, 2020; Gong and Liu, 2016; Wang et al., 2021),我们提出了一个统一的分类法,用于对GenAI赋能的鱼叉式钓鱼攻击进行分类。它整合了两个关键维度:攻击类型(底层的心理操纵策略)和上下文维度(使这些攻击看起来可信的个性化向量)。虽然先前的研究通常只检查孤立的策略(如诱饵、冒充)或有限的线索(如姓名、地点),但据我们所知,没有一个研究在两个轴上提供全面的分类法。我们的分类法基于对2015年至2024年间发表的21篇论文的范围界定综述,总结在表8中。我们使用“钓鱼”、“鱼叉式钓鱼”和“社会工程”等关键词查询主要的学术数据库,并通过引文滚雪球法扩展覆盖范围。以下小节定义了每个轴,并演示了GenAI如何将经典操纵策略与实时、数据驱动的定制融合。

5.1. 攻击类型

通过归纳编码,我们确定了七种反复出现的攻击类型:诱饵、恐吓软件、蜜罐陷阱、交换条件、尾随、冒充和个性化情感操纵。这些策略在心理上是不同的,但在实践中可能共存。表7展示了每种攻击类型的一些示例。

(1) 诱饵(Baiting):​ 用诱人的优惠(如免费访问、独家交易)引诱受害者(Kamruzzaman et al., 2023; Kamalesh, 2024; Bhardwaj et al., 2020; Aldawood and Skinner, 2020)。GenAI通过根据用户的特定兴趣、本地事件或社交动态(从公开帖子中提取)来定制诱饵,从而增强了这一策略。

(2) 恐吓软件(Scareware):​ 利用恐惧和紧迫感促使冲动反应(Wang et al., 2021; Chiew et al., 2018; Gururaj et al., 2024),通常使用捏造的威胁(如账户被盗、恶意软件警报)。

(3) 蜜罐陷阱(Honey Trap):​ 捏造浪漫或社交兴趣以建立信任和融洽关系(Wang et al., 2021; Aleroud and Zhou, 2017)。LLM可以根据目标的偏好和在线行为,制作个性化和情感共鸣的对话(Aldawood and Skinner, 2020)。

(4) 交换条件(Quid Pro Quo):​ 承诺回报或服务以换取敏感信息(Aldawood and Skinner, 2020; Heartfield and Loukas, 2015; Mouton et al., 2016)。社交媒体的信息披露使得这些交换在上下文中具有相关性(例如,“为你的艺术社区提供设计工具的抢先体验”)。

(5) 尾随(Tailgating):​ 基于观察到的用户活动,产生看似自然的后续跟进(Abu Hweidi and Eleyan, 2023; Wang et al., 2020)。例如,一封钓鱼电子邮件可能会在求职帖子之后附上一个虚假的招聘人员链接。

(6) 冒充(Impersonation):​ 模仿受信任的实体——如同事或组织(Lawson et al., 2019; Desai and Kavitha, 2024)。GenAI模型可以复制语气、词汇和结构模式,以增强真实性的假象。

(7) 个性化情感操纵(Personalized Emotional Exploitation):​ 针对用户的心理状态,利用脆弱性(如悲伤、压力)或积极情绪(如生日、晋升)(Wang et al., 2021; Lee et al., 2021; Arshad et al., 2021)。GenAI可以从社交媒体推断情感线索,并生成高度共鸣的操纵性内容。

5.2. 上下文维度

虽然攻击类型定义了试图进行的操纵形式,但上下文维度规定了消息如何被定制以显得可信且个人相关。例如,一个通用的诱饵如“点击领取免费门票”在结合上下文后会变得更有说服力:“作为一名纽约爵士乐迷,你已被选为布鲁克林爵士音乐节的VIP门票获得者。”借鉴先前关于通过在线披露进行社会工程和隐私泄露的研究(Ali et al., 2018; Irani et al., 2011; Balduzzi et al., 2010; Cai et al., 2016; Shu et al., 2018),我们确定了五种反复出现的上下文维度:

(1) 位置(Location):​ 用地理相关内容锁定用户——如本地优惠、活动或安全威胁(Abu Hweidi and Eleyan, 2023)。当跨平台交叉引用时,位置数据可以作为准标识符;即使是最小的位置披露也可以唯一识别超过50%的个体(Irani et al., 2011; Balduzzi et al., 2010)。

(2) 关系(Relationships):​ 利用社会关系,包括朋友、同事和隶属关系(Gong and Liu, 2016; Cai et al., 2016; Ali et al., 2018)。GenAI模型可以模仿已知联系人,提及共同的连接,或利用推断出的社交图谱(Irani et al., 2011; Balduzzi et al., 2010)。

(3) 兴趣(Interests):​ 利用用户披露的兴趣爱好、偏好和日常活动,如运动、音乐或专业领域(Gong and Liu, 2016)。这些信号使得钓鱼电子邮件能与目标的个人激情或身份产生共鸣。

(4) 情绪(Sentiment):​ 根据从帖子中推断出的情绪状态或态度调整消息语气。例如,对工作场所的挫败感表达可以被用来让攻击显得富有同情心或紧迫(Shu et al., 2018)。

(5) 事件(Events):​ 围绕个人或公共事件安排消息时机,如生日、假期或职业变动(Ali et al., 2018; Shu et al., 2018)。基于事件的线索通过将消息锚定在时间相关的上下文中来增加可信度。

这些维度共同为每种攻击类型提供了个性化层,创建了GenAI赋能的鱼叉式钓鱼的双轴分类法。在我们的框架中,提示被构建为明确地将一种攻击类型与一个或多个上下文维度结合起来,生成有针对性的、扎根于社交的内容。


6. 社交媒体数据与上下文提取

我们框架的第一阶段侧重于从目标的公共社交媒体存在中提取个性化的、富含上下文的信息。像Instagram这样的平台,许多用户保持公开资料,暴露了大量的细节,包括简介、标题、评论、标记的图片和视觉内容。这些信号可以在不绕过平台安全的情况下被收集,使得Instagram成为推断兴趣、日常活动、关系和情绪状态的宝贵来源。如第4节所述,我们提示LLM分析文本和视觉输入,以提取显著属性,包括姓名、地点、隶属关系、近期活动和情绪。通过联合解释多模态信号,模型构建了目标丰富的社交和行为画像。

6.1. 采样方法

我们采用了两阶段采样过程。首先,我们于2024年7月20日查询了CrowdTangle(27)(Meta开发的一款社交媒体监控工具),检索了10K个唯一的公共Instagram账户。CrowdTangle的发现端点返回公共的、活跃的资料,没有基于内容的过滤,提供了一个无偏的初始池。从这个数据集中,我们随机抽取了200个公共资料进行详细分析。其次,我们收集了这200个资料的帖子,重点关注2023年6月24日至2024年6月24日期间分享的内容。对于每个资料,我们检索了最多20个最近的帖子;如果可用帖子较少,则全部包含在内。总共,我们收集了3,268个帖子。元数据包括图像、标题、粉丝数、创建时间、互动统计数据(点赞、评论、观看量)和URL。利用帖子URL,我们捕获了截图,并利用GPT-4o的多模态能力生成图像描述并提取标题。这一选择得到了独立基准测试的支持,这些测试显示了GPT-4o在图像字幕和场景理解方面的强劲表现(Peng et al., 2025; Cheng et al., 2025; Shahriar et al., 2024)。

6.2. 信息增益分析

我们接下来评估攻击者可以从公共社交媒体帖子中提取多少可操作的信息,以及随着分析的帖子增多,回报是否会递减。这一分析为可扩展性提供了依据:每个用户需要的帖子越少,大规模鱼叉式钓鱼活动的成本和努力就越低。由于我们抽样的资料中有一半(n=100)包含的帖子少于20个,我们应用了归一化技术以确保用户间的可比性(附录D.1)。我们沿着四个互补的维度评估提取的内容、标题和GPT-4o生成的图像描述:

(1)归一化熵:​ 测量文本内容中的信息量大小,指示帖子平均有多密集或内容丰富。

(2)实体类型多样性:​ 追踪披露的不同语义类别的数量(如人、组织、地点、事件),揭示可利用的个人信号的范围。

(3)增量实体增益:​ 量化每增加一个帖子会引入多少个新的唯一实体,有助于识别随时间推移的收益递减。

图3. 增加帖子数量对跨标签的熵和实体发现的影响。

我们的分析表明,大多数上下文信息出现在早期的帖子中。如图3(a)所示,熵在帖子1-3之间急剧上升,但在帖子5之后趋于平稳,增量增益降至0.03以下——到帖子10时低于0.01,表明收益递减。同样,实体类型多样性迅速稳定:PERSON(人)和ORG(组织)实体在提取的上下文中占主导地位(图3(c)),而地点、日期和群组等类别增长较慢,其他类别(如产品、事件)贡献甚微。图3(b)显示,每个新帖子平均引入0.4-0.8个新实体,在0.6附近趋于平稳,没有明显的饱和点。为了评估传播,我们比较了用户帖子中的命名实体与所有五个模型生成的电子邮件中的命名实体。虽然资料平均包含约8-9个不同的实体,但电子邮件包含的实体要多得多(17-50个),其中大多数是捏造的。通常只有1-2个显著的用户特定线索被保留下来,比如音乐爱好或最近的旅行,而其余的则来自模型的世界知识和叙事支架。这种模式与我们的攻击设计一致,即提示锚定在单一的上下文元素上,但依靠GenAI生成有说服力的、定制化的内容。这些发现表明,攻击者仅需要10-15个帖子即可提取足够的上下文,使得大规模个性化既低成本又可扩展。完整的指标曲线和类别细分见附录D.1和E。


7. 评估

我们评估两个核心问题:(1)在我们的框架下,LLM生成逼真的鱼叉式钓鱼电子邮件的效果如何;(2)我们的防御能多可靠地检测和阻止它们。生成的电子邮件使用大规模标注流水线沿着八个质量维度(第7.3节)进行评分,该流水线结合了三LLM多数投票和人类验证(第7.4节)。我们以现实世界的钓鱼数据集为基准,并在自适应攻击下测试防御的鲁棒性。图2将这些评估步骤置于我们的完整流水线中。

7.1. 鱼叉式钓鱼电子邮件的生成

如第4节所述,我们的流水线通过引导LLM完成多阶段攻击过程,自动化了个性化的鱼叉式钓鱼。对于每个目标,我们输入最近的社交媒体多模态数据,并使用结构化的提示提取上下文线索,并将其应用于特定的社会工程策略(如诱饵、恐吓软件、蜜罐陷阱)。如果找不到足够的上下文,模型可以弃权。我们在五种LLM上运行了这个过程——GPT-4、Claude 3-haiku、Gemini 1.5-flash、Gemma 7B和LLaMA 3.3——涵盖了商业和开源系统。从200个用户资料中,流水线生成了17,916封电子邮件:Claude(3,959封)、Gemini(1,423封)、Gemma(5,045封)、GPT-4(2,634封)和LLaMA(4,855封)。

7.2. LLM生成电子邮件的分布

虽然LLM可能会产生幻觉或生成通用的钓鱼内容(Waldo and Boussard, 2024; Huang et al., 2025),但我们的框架指示它们在无法生成有上下文依据且有说服力的电子邮件时弃权。因此,输出量因模型而异,反映了生成能力以及每个模型利用社交媒体上下文的程度。图4显示了每个用户的电子邮件分布情况,以及汇总统计数据(均值、中位数、标准差)。Gemma生成的电子邮件最多(均值:25.47;中位数:26.5),其次是LLaMA(24.52)。Gemini生成的最少(7.18),表明其阈值更为保守。Claude(19.99)和GPT-4(13.28)介于两者之间。变异性也不同:Gemini的分布范围最窄(SD 1.71–12.65),表明其一贯的弃权行为,而Claude显示出最宽的散布(SD 12.75–27.23),表明其在不同资料间的置信度不一致。这些差异不仅影响钓鱼内容的质量(第7.3节),还影响个性化攻击的可扩展性。弃权机制强制执行上下文相关性,而模型特定的生产力则影响每个用户可以生成多少封逼真的电子邮件。

图4. 五种LLM中每个用户的鱼叉式钓鱼电子邮件分布。

7.3. 评估指标

基于先前的钓鱼和社会工程文献,我们定义了八个评估维度,将已知影响钓鱼成功率和用户易感性的核心因素操作化。认知框架和实证研究强调,点击率和欺骗是由逼真、有针对性且情感引人注目的消息驱动的——这些品质通常植根于个性化、上下文依据和发件人可信度(Caputo et al., 2013; Allodi et al., 2019)。针对攻击和非政府组织活动的案例研究和语料库分析进一步强调了OSINT驱动的分析和上下文感知定制的作用(Le Blond et al., 2014; Balduzzi et al., 2010; Gong and Liu, 2018; Ho et al., 2019)。诸如权威、紧迫感和喜好等社会工程技术——操纵的核心——通过情感诉求、说服力和行动号召的具体性来衡量(Wright et al., 2014; Jakobsson and Myers, 2007; Hong, 2012; Erkkila, 2011)。最后,语言的自然性和技术上的润色反映了经典“泄露”线索(如通用语言、格式错误的链接、可疑的发件人)的缺失,这些线索是用户怀疑的强烈预测因素,也是严重性评分模型的关键特征(Butavicius et al., 2022; Wang et al., 2012; Chen et al., 2011)。

因此,我们沿着八个维度评估每封生成的电子邮件:

(1)上下文相关性(对提取的用户数据(如地点或事件)的保真度),

(2)说服力(在推动收件人采取预定行动方面的强迫力有多强),

(3)情感操纵(是否存在紧迫感、恐惧或共情触发因素),

(4)个性化(是否包含姓名、特定兴趣或近期活动),

(5)语言自然性(语法和连贯性与人类书写的散文一致),

(6)行动号召的具体性(指令的清晰度和直接性),

(7)发件人可信度(发件人身份的现实性和合理性)

(8)技术复杂性(是否存在结构化URL、格式或规避基本过滤器的特征)。附录6提供了将这些维度映射到易感性驱动因素和先前支持工作的简明摘要。

说明性示例。​ 这些示例突出了每个评估维度如何捕捉操纵质量的一个独特且可复现的方面。上下文相关性:​ GPT-4生成了一封“生日快乐芭芭拉!”的电子邮件,直接基于庆祝用户生日的真实帖子。情感操纵:​ Gemma-7B制作了一条“紧急关系问题”的消息,旨在引发对社会冲突的恐惧。行动号召的具体性:​ Claude 3-haiku生成了一份活动邀请,包含清晰的注册步骤和一个合理的URL。

7.4. 评估裁判与标注流水线

为了系统地评估GenAI生成的鱼叉式钓鱼电子邮件的质量,我们采用了一个基于三个SOTA商业LLM的自动化标注流水线:Claude 3-haiku、Gemini 1.5-flash和GPT-4。选择这些模型是因为它们在跨领域的结构化标注任务中表现出了有效性(Zhang et al., 2024; Tan et al., 2024; He et al., 2023)。每个模型都根据第7.3节描述的八个评估维度对所有电子邮件进行了评分。鉴于我们数据集的规模(17,916封电子邮件),人工标注是不可行的。然而,仅仅依靠自动化判断存在偏见风险,特别是当同一个模型同时用于生成和评估时。为了缓解这种情况,我们应用了两个保障措施:(i)通过所有三个LLM的多数投票来集成预测,以平滑模型特定的方差;(ii)在具有代表性的子集上,将这些输出与专家人工标注进行验证。

对于人类验证,两名独立标注员使用标准化编码手册(附录C)评估了150封电子邮件(每个模型30封)。逐维度测量一致性,分歧通过讨论解决。至关重要的是,所有评估都是基于上下文的:LLM和人类标注员都可以访问用于生成每封电子邮件的社交媒体数据。例如,一封基于“诱饵+位置”策略的电子邮件,只有当引用的位置出现在用户的原始帖子中时,才被标记为具有上下文相关性。说服力是根据请求行动的清晰度和激励拉力来判断的,而发件人可信度则评估姓名、隶属关系和电子邮件语气的合理性。所有八个维度都使用二元标签(0或1)进行评分,以便于聚合和比较。使用Cohen's Kappa测量评分者间可靠性,结果显示LLM集成之间具有实质性的一致性(κ=0.76),人类标注员之间几乎完全一致(κ=0.93)。与人类共识相比,LLM集成达到了98.3%的准确率。所有的差异都是假阴性(20个实例),即人类识别出的微妙说服线索被模型忽略了。重要的是,没有出现假阳性,确保了钓鱼质量分数从未被人为夸大。在验证了标注流水线后,我们现在展示跨模型和评估维度的结果,以及与现实世界钓鱼数据集的比较。

7.5. LLM生成电子邮件的评估

我们评估了由五种LLM生成的全部17,916封鱼叉式钓鱼电子邮件(Claude: 3,959; Gemini: 1,423; Gemma: 5,045; GPT-4: 2,634; LLaMA: 4,855)。使用经过验证的多数投票法(第7.4节),每封电子邮件都沿着八个二元维度进行了评分。表1报告了每个模型符合每项标准的电子邮件百分比。为确保结果反映模型能力而非提示伪影,我们在所有API中使用了标准化的提示模板,仅做了极少的语法更改(例如,Anthropic的系统/用户角色,Gemini的单提示格式,Azure的消息模式)。一个小规模试点(每个模型30封电子邮件)证实所有模型都能正确解析模式并产生有效的结构化输出。

表1. LLM生成及APWG电子邮件的评估结果(百分比)

电子邮件来源

上下文相关性

说服力

情感操纵

个性化

语言自然性

行动具体性

发件人可信度

技术复杂性

GPT 电子邮件

95.18%

98.90%

98.97%

90.09%

99.96%

86.29%

82.07%

97.49%

Claude 电子邮件

91.51%

98.26%

99.66%

87.16%

99.97%

82.31%

71.63%

99.1%

LLaMA 电子邮件

87.06%

78.49%

73.77%

75.27%

100.00%

79.91%

57.26%

97.86%

Gemma 电子邮件

92.41%

96.31%

97.82%

85.15%

99.98%

79.16%

59.44%

98.71%

Gemini 电子邮件

94.37%

93.46%

92.41%

86.57%

99.79%

69.55%

68.99%

96.62%

变异 电子邮件

NA

99.06%

93.18%

93.84%

100.00%

89.28%

73.50%

70.33%

APWG 电子邮件

NA

32.7%

54.4%

8.6%

51.0%

64.4%

15.4%

78.1%

汇总结果。​ 表1显示,商业模型在大多数维度上表现强劲,表明现代LLM可以生成有上下文依据且具有说服力的钓鱼电子邮件。GPT-4总体领先,在说服力和情感操纵上超过98%。Claude得分很高,特别是在技术复杂性(99.1%)和情感操纵(99.7%)方面,尽管在发件人可信度(71.6%)上较弱。Gemma在说服力(96.3%)和情感线索(97.8%)方面表现良好,但在可信度(59.4%)上表现中等。LLaMA实现了100%的语言自然性,但在说服力(78.5%)和可信度(57.3%)上落后,突显了开源模型与商业模型之间的性能差距。

7.6. 与现实世界钓鱼(APWG语料库)的比较

我们将LLM生成的电子邮件与现实世界的钓鱼内容进行了基准测试。我们从APWG eCrimeX(反钓鱼工作组,2025)的报告钓鱼API端点抽取了6,000封电子邮件,这是一个广泛使用的反钓鱼黑名单。该样本涵盖2023年9月19日以来的报告,包括针对或冒充超过610个组织的攻击。由于APWG不提供结构化标签,我们构建了自定义脚本来解析MIME格式的电子邮件并提取干净的主题行和正文。由于APWG包含所有类型的钓鱼,我们首先分离出鱼叉式钓鱼案例,以与我们的GenAI重点保持一致。使用Claude 3-haiku、Gemini 1.5-flash和GPT-4作为标注员,我们将每封电子邮件标记为鱼叉式钓鱼或非鱼叉式钓鱼,将鱼叉式钓鱼定义为有针对性的、个性化的、操纵性的攻击,并与第5.1节中的类别一致。LLM还根据我们的分类法(第5节)分配攻击类型标签,使用多数投票作为最终决定。为了验证准确性,两名人类编码员独立审查了100封标记为鱼叉式钓鱼和100封非鱼叉式钓鱼的电子邮件。评分者间一致性很高(κ=0.95),LLM集成在99%的情况下与人类共识匹配(1个假阳性,1个假阴性),证实了其适用于大规模标注。

在6,000封电子邮件中,有3,937封(65.6%)被归类为鱼叉式钓鱼。我们使用与第7.3节相同的八个指标评估了这些邮件,但不包括上下文相关性(因为没有用户特定数据不适用)。表1中的结果显示,APWG鱼叉式钓鱼电子邮件的表现始终低于LLM生成的电子邮件——尤其是在个性化(8.6% vs. 85–90%)、语言自然性(51.0% vs. ~100%)和说服力(32.7% vs. >90%)方面。这一差距突显了GenAI如何能够产生比当前现实世界活动更量身定制、更可信且更具操纵性的钓鱼内容。

7.7. 用户研究:人类对GenAI生成鱼叉式钓鱼的易感性

我们进行了一项经IRB批准的人类受试者研究,以评估用户识别LLM生成的鱼叉式钓鱼电子邮件的效果如何,以及它们与现实世界的钓鱼消息相比如何。这通过捕捉人类对可检测性的感知以及第7.3节介绍的八个评估维度上对GenAI生成电子邮件的感知质量,补充了我们的系统级评估。我们的研究由三个研究问题指导。RQ1:​ 与现实世界的钓鱼电子邮件相比,参与者能多好地检测出LLM生成的鱼叉式钓鱼?RQ2:​ 检测能力如何在不同社会工程策略间变化?RQ3:​ 相对于现实世界的钓鱼电子邮件,用户如何评价LLM生成的钓鱼电子邮件的质量(如说服力、发件人可信度、行动号召的具体性)?为了测试这些,我们制定了四个假设:H1:​ LLM生成的鱼叉式钓鱼电子邮件引发的感知可疑度低于APWG钓鱼电子邮件。H2:​ 参与者区分恶意消息和良性消息的能力——通过可疑度检测差距来衡量——在LLM条件下降低(即接近零或为负)。H3:​ 感知可疑度在攻击类别间系统性变化,某些类型始终被评为可疑度较低。H4:​ LLM生成的电子邮件在我们八个质量维度上的评级高于APWG电子邮件,特别是上下文相关性、语言自然性和技术复杂性。

7.7.1. 实验设计

我们在两种实验条件下评估用户识别鱼叉式钓鱼电子邮件的能力:(1)LLM生成的鱼叉式钓鱼电子邮件,和(2)来自APWG eCrime Exchange数据集的现实世界钓鱼电子邮件。每种条件都与一组相同的良性对照电子邮件配对,以便直接比较检测准确性和感知质量。LLM生成的电子邮件选自我们框架的输出,涵盖所有七种社会工程攻击类型:诱饵、恐吓软件、蜜罐陷阱、交换条件、尾随、冒充和个性化情感操纵。对于每种类型,我们选择了五个代表性示例(每个LLM一个),产生35封恶意电子邮件。每封电子邮件由三名参与者独立评估,总共产生105次评估。现实世界条件使用了匹配的35封APWG钓鱼电子邮件,按攻击类型平衡以保证可比性。

参与者被随机分配到两组之一。A组观看三封LLM生成的鱼叉式钓鱼电子邮件和两封良性对照;B组观看三封现实世界钓鱼电子邮件和两封良性对照。对于每封电子邮件,参与者使用李克特量表对感知可疑度和质量进行评分,然后进行二元的钓鱼判断。电子邮件以静态截图形式呈现(删除了链接和个人标识符)以消除安全风险。电子邮件顺序对每个参与者进行随机化。嵌入了两个注意力检查以确保数据质量。我们通过被试间设计、匹配的良性对照、隐藏研究对AI生成内容的关注以及对电子邮件顺序进行随机化,以尽量减少参与者偏见,减轻启动和学习效应。招募、补偿和材料遵循IRB批准的方案(见附录G.1)。

图5. 参与者对LLM生成鱼叉式钓鱼电子邮件与APWG eCrimeX钓鱼电子邮件的平均评分。

7.7.2. 调查设计

样本量理由。​ 我们使用了一种基于精度的设计,以平衡跨攻击类型的覆盖:7种SE类型 × 每种类型5个示例(n=35),每个示例有3个独立评分(105次恶意评估),产生每种SE类型15次评估(恶意条件下35名参与者)。对于每种SE类型,n=15,检测率 p^​=1/15=0.0667的标准误为 SE=0.0644,95% Wald CI的半宽为 ±0.126;对于李克特评分,假设 SD=0.5,95% CI的半宽为 ±0.253。这种精度足以比较不同条件下的每类趋势,同时将参与者的负担和研究成本保持在可管理的范围内。

我们通过Prolific(Palan and Schitter, 2018)招募了70名参与者,这是一个广泛应用于学术研究的在线众包平台。资格标准要求参与者(1)居住在美国,(2)年满18岁,(3)已完成超过1,000个先前任务,以及(4)保持 ≥95%的批准率。研究持续约25分钟,参与者完成后获得5美元报酬。

7.7.3. 调查结构

调查由四个连续部分组成:(S1)知情同意,(S2)主要电子邮件评估任务,(S3)任务后问卷,以及(S4)人口统计和背景。

主要任务。​ 参与者评估五封电子邮件:三封恶意和两封良性——以随机顺序呈现。对于每封电子邮件,他们根据我们的评估框架对八个质量维度进行评分:上下文相关性、说服力、情感操纵、个性化、语言自然性、行动号召的具体性、发件人可信度和技术复杂性。每个维度按5点李克特量表评分(1 = 完全没有,5 = 极度)。在质量评分后,参与者使用相同的量表评估电子邮件的可疑度,随后进行二元的钓鱼判断(钓鱼 / 不是钓鱼)。嵌入了两个注意力检查问题以确保数据质量;未能通过任一检查的参与者的回答被排除在分析之外(见附录G.1)。

任务后问卷。​ 在评估完所有五封电子邮件后,参与者完成了三个5点李克特项目,评估主观工作量和生态效度:(1)感知任务难度,(2)感知电子邮件质量和可信度的差异性,以及(3)例子的现实感(例如,“电子邮件例子感觉很真实,与我收件箱里的那些很像”)。这些项目作为参与度检查,并衡量刺激材料的可信度(见附录G.4)。

人口统计和钓鱼知识。​ 参与者报告基本人口统计数据(见附录G.2)和先前的钓鱼暴露情况(见附录G.3),然后完成了一个包含七个项目的钓鱼知识测验,评估实际识别技能(例如,识别危险附件和可疑消息),部分改编自Schöni等人(Schöni et al., 2024)。每个正确答案得2分(最高分=14)。

反馈和参与者学习。​ 在最后一项任务中,对任何恶意电子邮件分类错误的参与者收到了自动反馈,强调了关键的钓鱼检测线索,旨在提高意识和改进检测策略。

7.7.4. 分析与结果

我们评估参与者是否认为LLM生成的鱼叉式钓鱼电子邮件比现实世界的钓鱼电子邮件可疑度更低(RQ1)。对于每个参与者,我们计算:(i)恶意电子邮件的平均可疑度评分,以及(ii)良性对照的平均评分,两者均采用五点李克特量表。我们还计算了参与者层面的检测差距,定义为:Δsusp​=Sˉmalicious​−Sˉbenign​,其中较大的正值表示基于可疑度更好地区分了恶意和良性电子邮件。

恶意可疑度。​ 参与者对LLM生成的钓鱼电子邮件的评级显著低于现实世界(APWG)的钓鱼电子邮件(H1)。LLM条件下的平均可疑度为2.75,而APWG条件下为4.44。Kruskal-Wallis检验证实了强烈的组间效应(H=27.22,p<10−6)。我们使用Kruskal-Wallis检验是因为可疑度评分是有序的(李克特量表)且违反了正态性假设,使得这种非参数检验比参数t检验更合适。

良性可疑度。​ 良性电子邮件在各组间的评分相似(LLM:3.11,APWG:2.83),无显著差异(H=0.68,p=0.41),表明检测的差异是由对恶意内容的感知驱动的,而不是基线怀疑。

检测差距。​ 检测差距在两种条件之间明显分化(H2)。APWG条件下的参与者表现出明显的辨别差距(Δsusp​=1.61),而LLM条件下的参与者则呈现负差距(Δsusp​=−0.36),这意味着LLM生成的钓鱼电子邮件平均而言被评为比良性电子邮件更不可疑。这种差异具有统计学意义(H=26.22,p<10−6),表明LLM精心制作的鱼叉式钓鱼实质上更难检测。

感知质量(RQ3)。​ 接下来,我们比较八个评估维度上的感知质量。图5显示LLM生成的电子邮件在所有维度上都始终优于APWG钓鱼电子邮件(H4)。最大的差异出现在语言自然性和上下文相关性上,尽管在发件人可信度和技术复杂性上也观察到增益。值得注意的是,LLM电子邮件在引发更低可疑度的同时,被评为具有更高的质量,突显了其欺骗潜力。

按攻击类型的变化(RQ2)。​ 最后,我们检查可疑度如何随攻击类别变化。图6显示了每种社会工程类型的平均可疑度评分,按条件拆分。出现了两种模式:(1)APWG电子邮件在所有类别中都被评为更可疑,(2)在LLM条件下,某些类别,特别是尾随和冒充,引发的可疑度明显较低(H3),表明当通过上下文感知的GenAI内容执行时,这些策略特别有效。

图6. 跨SE攻击类别的感知可疑度。

参与者钓鱼知识与主观反馈。​ 两种条件下的参与者都表现出中等水平的基线钓鱼知识。APWG组的平均知识分数为 M=0.58(SD=0.22,n=35),而LLM组平均为 M=0.51(SD=0.18,n=35)。当合并时(N=70),总体平均为 M=0.55(SD=0.20)。我们使用Welch's t-test,这适用于方差不等和独立样本的情况。结果显示APWG和LLM条件之间的钓鱼知识分数无显著差异(t(64.87)=1.36,p=0.178;平均差 =0.065,95% CI [−0.031,0.161]),表明基线知识具有可比性,且暗示可检测性的差异不太可能是由于先前的钓鱼意识造成的。任务后反馈支持了研究的生态效度。参与者并未报告很高的任务难度(平均难度:APWG 2.11,LLM 2.43),但指出了电子邮件质量的显著差异(平均差异:APWG 3.66,LLM 3.86),并判断电子邮件是现实的(平均现实感:APWG 3.77,LLM 4.17)。值得注意的是,LLM条件下更高的现实感评级与我们的发现一致:GenAI生成的钓鱼电子邮件即使对于具有中等钓鱼知识的用户来说,也可能看起来令人信服地“像收件箱里的邮件”。人口统计特征,包括年龄、性别、教育程度、就业状况和先前的钓鱼经验,详见附录表10。

核心发现:逃避人类检测的高质量钓鱼。​ 图7和图8揭示了我们用户研究的核心见解:LLM生成的钓鱼电子邮件将高说服质量与低感知可疑度结合在一起。在LLM条件下(图8),电子邮件在上下文相关性、语言自然性、个性化和行动号召具体性方面持续获得高分,但却被评为更不可疑。相比之下,现实世界的钓鱼(图7)在所有攻击类型中引发更高的可疑度,即使在质量评分中等时也是如此。这种对比突显了风险:LLM生成的电子邮件不成比例地落入最危险的境地——极具说服力却又不太可能引发用户的怀疑。

图7. 按攻击类型划分的平均质量评分(APWG)

图8. 按攻击类型划分的平均质量评分(LLM)


8. 防御机制

我们评估旨在任何电子邮件生成之前拦截鱼叉式钓鱼意图的提示级防御,并将我们的恶意提示集与三种互补的防御措施进行基准测试。(I)监督式提示检测:在保留提示上评估的RoBERTa分类器,扩展使用DeBERTa进行句子和子提示级别的筛选,以便在增量提示构建下实现更早的拦截。(II)SOTA安全防护模型:指令调优的安全过滤器。(III)提示加固基线:策略注入(策略增强的护栏)和系统指令+思维链(SI + CoT)审核。

8.1. 恶意提示语料库构建

种子提示。​ 我们使用35个恶意提示作为模板/种子,涵盖五个上下文要素(如关系、兴趣)和七种社会工程类别(如诱饵、蜜罐陷阱),捕捉常见的鱼叉式钓鱼结构。

数据集扩展。​ 我们使用GPT-4为每个种子生成50个变体。变体是通过实例化(消融)第4节中三个与意图相关的组件的子集来派生的:(1)上下文数据分析,(2)攻击类型和上下文要素的集成,以及(3)沟通风格模仿。我们排除了(4)输出格式化,因为表面级别的格式化不会改变意图。

恶意组件的消融。​ 为了避免对完全指定的提示过拟合,并反映现实的攻击者工作流程(例如,跳过提取并从提供的上下文开始的提示),我们在组件子集上以轮询方式生成变体:每个变体至少包含{(1),(2),(3)}中的两个。在变体中,词汇选择、语气和结构被扰动,同时保留底层的恶意意图(算法1)。

算法1 提示变体生成流程

输入 : 种子提示集 𝒮; 每个种子的预算 K = 50
输出 : 每个种子的变体集 𝒱
1. C ← {(1,2), (2,3), (1,3), (1,2,3)}
2. foreach p ∈ 𝒮 do
3. 𝒱(p) ← ∅;
4. for i ← 1 to K do
5. combo ← C[(i-1) mod 4];
6. // 在 (1)+(2), (2)+(3), (1)+(3), (1)+(2)+(3) 上轮询
7. inst ← BuildInstruction(p, combo, diversity_hints);
8. repeat // 重试直到返回有效的单个变体
9. v ← LLM_Rewrite(inst);
10. until ParseOK(v, i);
11. 𝒱(p) ← 𝒱(p) ∪ {v};
12. end
13. end

变体的验证。​ 我们将所有自动生成的1,750个恶意提示输入GPT-4进行测试,发现82%成功生成了钓鱼电子邮件,证实了功能可行性,而其余案例是被内容审核防护措施阻断,而非模型能力不足。所有这些来自提示变体的成功生成的电子邮件都被用于效能评估,确保报告的指标反映了跨不同提示实现方式的性能,而不是单一的固定提示设计(表1)。

图9. SOTA安全过滤器的性能。

变体集的多样性分析。​ 为了确保我们以编程方式生成的提示变体足够多样化,我们进行了多项指标分析,涵盖表面重叠、词汇差异、句法变化和基于嵌入的语义扩散。在所有指标上,变体集与种子表现出极小的重叠和广泛的分散(例如,平均difflib相似度 ≈0.02,低Jaccard重叠,以及接近零的POS n-gram重叠),表明我们的检测器是在一个高度多样化的提示分布上训练和评估的。我们在附录F中报告了完整的分析和嵌入可视化。

8.2. 良性提示语料库的构建

我们从公共的Enron电子邮件数据集(Wcukierski, 2015)构建良性提示语料库,该数据集包含真实的职场通信。我们随机抽取了2,000封电子邮件(接近我们1,750个恶意提示的平衡)。由两名标注员独立审查了10%的子集(200封电子邮件),以确认不存在钓鱼或恶意内容(κ=1.00);虽然完整的Enron语料库包含偶尔的垃圾邮件,但在我们的样本中未发现。

过滤。​ 在提示转换之前,我们(1)仅保留原始电子邮件(排除回复/转发),以避免碎片化上下文,确保每个电子邮件都是自包含的。(2)使用符合RFC 5322标准的解析去除技术标头(如MIME/路由信息),以及(3)使用GPT-4提取主题和正文,去除免责声明和格式,同时保留内容。

提示转换。​ 从清理后的电子邮件中,我们使用GPT-4生成旨在重现具有相似风格和上下文的消息的良性提示。生成框架系统地改变了三个受控维度上的提示:(1)语气:正式、非正式、有说服力、中性;(2)风格:叙述性、指令性、描述性;(3)视角:第一人称、第二人称、第三人称。这产生了一个具有丰富风格和上下文多样性的提示集。我们使用MTLD(平均值 = 74.42;中位数 = 70.96)和Distinct-n统计(语料库级别:D-1 = 0.050, D-2 = 0.344, D-3 = 0.640;每提示平均值:D-1 = 0.721, D-2 = 0.973, D-3 = 0.996)测量了多样性,证实了良性集内的大量词汇变化。

特征覆盖。​ 为了验证Enron提供了一个公平、良性的基线,我们使用第7.3节中的七个非上下文特征(不包括上下文相关性)将特征分布与五个LLM生成的语料库进行了比较。特征使用多数投票标注流水线(第7.4节)进行分配。结果表明Enron电子邮件表现出这些特征,并且许多消息同时包含多个特征。如图10所示,85.9%包含 ≥2个特征,70.6%包含 ≥3个,56.0%包含 ≥4个,以及 40.4%包含 ≥5个。在特征层面上,Enron显示出高语言自然性(∼0.99)和强发件人可信度(∼0.65),与企业通信一致,同时具有不可忽视的说服力(0.55)、CTA具体性(0.56)和技术复杂性(0.59)。然而,与LLM生成的钓鱼提示相比,Enron的情感操纵(0.07 vs. ∼0.92)和个性化(0.28 vs. ∼0.85)比率要低得多。Enron电子邮件的平均特征重叠为3.69,而LLM钓鱼提示为 ∼6.11。这表明Enron提供了一个保守但足够丰富的良性基线,包含与鱼叉式钓鱼内容重叠的特征(使得有意义的区分成为可能),同时明显不那么“像钓鱼”。这使得该语料库非常适合训练和评估提示级分类器。

图10. 特征累积分布函数(CDF):Enron vs. LLM生成的电子邮件。

8.3. 提示级威胁检测

我们使用监督分类器测量提示级检测,该分类器将恶意鱼叉式钓鱼提示与良性提示区分开来。作为一个实例,我们微调了一个预训练的RoBERTa Transformer(Liu et al., 2019),该模型被证明对短文本分类任务有效。

数据集划分。​ 从我们的1,750个恶意提示和2,000个良性提示语料库中,我们预留了10%用于测试。剩余的90%被分为训练集(81%)和验证集(9%)。这产生了3,037个训练实例、338个验证实例和375个测试实例。提示被分词并进行了填充和截断(128个token)。

训练设置。​ RoBERTa使用AdamW(学习率 2×10−5,权重衰减 0.2)微调了两个epoch。验证性能在第二个epoch后趋于平稳,促发了早停。我们在保留测试集上报告指标,并跨随机种子重复运行。

评估。​ 在保留测试集上,分类器实现了:准确率 = 98.13%,精确率 = 100%,召回率 = 96%,F1 = 97.95%。值得注意的是,该模型没有产生假阳性。为了探究分布偏移,我们额外在五个LLM生成的175个恶意提示(每个模型35个:GPT-4, Claude 3 Haiku, Gemini-1.5-Flash, Gemma-7B, Llama-3.3)上进行了评估,涵盖了七种攻击类型(第5.1节)和五个上下文维度。RoBERTa分类器将它们100%标记为恶意,证明了跨架构和提示风格的泛化能力。

按类别分析。​ 虽然总体结果很高,但我们检查了各类别的召回率以识别潜在的盲点。在评估范围内,如表3所示,所有类别的召回率均 ≥0.93,其中蜜罐陷阱和尾随获得了满分(1.00)。最低召回率(0.93)出现在诱饵(27/29被检测到),没有迹象表明存在特定类别的性能下降。

表2. 跨模型的成本与成功率比较(吞吐量按挂钟时间测量)

模型

平均输入Token数

平均输出Token数

平均总Token数

平均挂钟时间 (ms)

输出Token/秒 (挂钟)

成功率 (%)

GPT-4

553.42

207.89

761.30

5262.00

39.51

94.3

Claude 3 Haiku

605.53

253.13

858.67

2097.00

120.71

77.1

Gemini-1.5-Flash

610.80

69.48

680.28

630.00

110.29

78.1

Gemma-7B

551.49

158.50

709.99

1881.00

84.26

60.0

Llama 3.3

521.27

230.18

751.45

16749.00

13.74

66.7

8.4. 基准测试指令调优的安全过滤器与提示加固

除了我们的监督式提示分类器外,我们还对三种指令调优的安全过滤器和两种提示加固防御(策略注入和SI+CoT)进行了基准测试,以评估当前防护措施阻挡恶意鱼叉式钓鱼提示的效果。首先,我们测试了三种默认配置下的指令调优安全过滤器:ShieldGemma-2B(Zeng et al., 2024)(放行率87.9%)、LlamaGuard-3-8B(Inan et al., 2023)(100%)和WildGuard-7B(Han et al., 2024)(80.8%)。这三种过滤器都未能阻挡大部分恶意提示。这主要是因为这类过滤器依赖表面级别的启发式和关键词匹配,很容易被听起来良性的替代词(如用“参与”代替“诈骗”)以及个性化的、对话式的框架所绕过。接着,我们应用了策略注入,其中明确的安全策略描述了我们攻击流水线的四个阶段,并指示模型阻止实例化其中任何阶段的提示。这大大提高了阻挡率:ShieldGemma 84%、LlamaGuard 93%、WildGuard 96%。最后,我们评估了一种系统指令+思维链(SI+CoT)防御,提示模型在决定之前逐步推理攻击的各个阶段。在同一批1,750个恶意提示上,该方法达到了:ShieldGemma 69%、LlamaGuard 82%、WildGuard 98.7%的检测率(图9)。总之,这些结果突显了默认防护措施的不足,但提示感知的指令和结构化推理可以显著提高韧性。

8.5. 针对自适应攻击者的检测

攻击者可能会增量地构建指令,混合良性和恶意片段以逃避提示级筛选(Roy et al., 2024)。因此,我们通过在标注语料库上评估句子级和子提示级筛选,以更精细的粒度测量检测效果。

句子级真实标签。​ 我们将3,750个提示(第8.1、8.2节)分割成29,109个句子,并使用LLM集成(GPT-4, Claude 3-Haiku, Gemini 1.5-Flash)的多数投票将每个句子标记为恶意或良性,模型间一致性为81%。在一个双重标注的100个句子的子集上,两名人类编码员达到了Cohen's κ=0.92;LLM集成相对于人类共识的准确率为99%,仅有一个假阳性。

子提示构建。​ 我们通过增量连接每个提示内的句子来生成子提示。如果任何组成句子是恶意的,则该子提示继承恶意标签。这种框架允许检测系统在恶意提示的最终形式形成之前拦截其演变过程。

分类器选择。​ 虽然RoBERTa在全提示分类上表现良好(第8.3节),但我们采用DeBERTa-v3-Large(He et al., 2020)进行子提示检测。其解耦注意力和相对位置编码更好地处理了早期子提示典型的短片段输入(He et al., 2020)。经验上,DeBERTa在宏F1上比RoBERTa高出3.2%,尽管计算成本有所增加。因此,我们将DeBERTa报告为鲁棒检测的更强选项。

训练设置。​ 我们使用81/9/10的比例划分(训练/验证/测试),使用AdamW优化器配合余弦衰减、预热、梯度累积(有效批次=128)、256个token截断、带标签平滑的焦点损失、梯度裁剪和早停。阈值在验证集上调优。

结果。​ 在45,979个子提示上,模型实现了总体准确率 = 94.4% 和宏F1 = 0.945。性能在各类别间一致:对于恶意子提示(22,685个实例),精确率 = 0.92,召回率 = 0.97,F1 = 0.95;对于良性子提示(23,294个实例),精确率 = 0.97,召回率 = 0.92,F1 = 0.94。

表3. 按攻击类别划分的性能。

类别

#

TP

FN

精确率

召回率

F1

诱饵 (Baiting)

29

27

2

1.00

0.93

0.96

冒充 (Impersonation)

32

30

2

1.00

0.94

0.97

情感操纵 (Emotional Manipulation)

28

27

1

1.00

0.96

0.98

交换条件 (Quid Pro Quo)

23

22

1

1.00

0.96

0.98

恐吓软件 (Scareware)

17

16

1

1.00

0.94

0.97

蜜罐陷阱 (Honey Trap)

15

15

0

1.00

1.00

1.00

尾随 (Tailgating)

31

31

0

1.00

1.00

1.00

8.6. 比较性成本与效率分析

我们评估了五种LLM生成攻击内容的计算成本和效率,旨在:(i)提供每攻击使用的供应商中立视图(token数和挂钟时间),以及(ii)将此成本与成功率进行比较,以评估成本效益。

对于每个模型,我们生成了105个样本(7种攻击类型 × 5种上下文类别 × 3个用户),将固定的提示模板与用户特定元数据相结合。对于每次运行,我们记录了输入/输出token计数、总token数和挂钟持续时间。吞吐量报告为每挂钟秒完成的token数,以标准化托管模型和本地模型。

表2总结了总体成本和成功指标。GPT-4实现了最高的成功率(94.3%),具有适中的延迟(∼5.26s)和高效的吞吐量(39.5 tok/s),平衡了有效性和运行时。Claude 3 Haiku和Gemini 1.5 Flash总体上最快(分别为 ∼2.10s和 0.63s),吞吐量高(分别为 ∼120.7和 110.3tok/s),成功率为77.1%和78.1%,在速度至关重要时提供了有吸引力的权衡。在开源模型中,Gemma-7B更快(∼1.88s),但成功率最低(60.0%),而LLaMA 3.3则受困于高延迟(∼16.7s)和低吞吐量(13.7 tok/s),尽管token使用量相当,但其实际可行性受到限制。

我们在表9中进一步按攻击类型分解了成本,揭示了某些策略(如冒充、交换条件)由于推理和风格模仿的复杂性,系统性地需要更多的token或时间。

每封电子邮件的成本。​ 基于当前的API定价(例如,GPT-4o输入token $10.00/百万,输出token $30.00/百万),每封鱼叉式钓鱼电子邮件的生成成本在$0.002到$0.004之间。即使是最昂贵的设置——带有扩展上下文的GPT-4——每封消息仍不到一分钱,证实了对资源受限的攻击者来说,大规模攻击在财务上是微不足道的。


9. 讨论与启示

我们的研究结果表明,GenAI显著降低了执行有效的、个性化的鱼叉式钓鱼攻击的门槛。商业LLM仅需少量公共社交媒体帖子即可生成令人信服的、上下文感知的电子邮件,大幅降低了传统的侦察成本。LLM性能差异显著:GPT-4和Claude 3始终能生成最自然、最有说服力且技术上最精致的消息,而像Gemma和LLaMA 3这样的开源模型则在情感细微差别和发件人可信度上落后。这些差距强调了攻击者在有效性、成本和延迟之间可能权衡的取舍。生成一封钓鱼电子邮件的成本微不足道——每封消息不到一分钱和几秒钟——使得可扩展、低成本的行动成为可能。当与自动化抓取相结合时,攻击者每小时可以针对数千名用户。GenAI消除了手动制作消息的传统瓶颈,将主要挑战重新推回到投递环节(例如,逃避垃圾邮件过滤器),而不是内容创作。

局限性。​

(1)平台范围:我们的数据集仅来自一年的公共Instagram数据;其他平台或更长时间线可能提供更丰富或不同的信号。

(2)防御泛化:虽然我们的提示级分类器表现强劲,但它代表了一个静态快照。有效的防御将需要持续的重新训练和适应不断演变的提示工程策略。


10. 结论

我们展示了公共社交媒体数据可被用于利用GenAI自动化高度定向、上下文感知的鱼叉式钓鱼。我们的模块化框架提取个人信号、模仿沟通风格,并实例化七种社会工程策略,以极少的努力生成逼真的钓鱼电子邮件。在五种LLM中,我们生成了约18K封电子邮件,发现它们始终比现实世界的钓鱼邮件更具说服力、更个性化和更具操纵性。一项用户研究证实,这些输出不仅质量更高,而且对人类接收者来说更不可疑。我们在自适应规避下评估了一种提示级检测器和两种额外的防御措施,突显了当前的局限性。为了支持正在进行的工作,我们发布了我们的实现和标注数据,以实现对AI驱动的社会工程的复现性研究。

 

 

赞(0)
未经允许不得转载:171主机测评 » 上下文感知的鱼叉式钓鱼:利用公共社交媒体数据通过生成式AI对个体实施攻击
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址