导语:当 AI 模型从"对话助手"进化为"自主智能体",安全挑战便从"说了什么"升级为"做了什么"。Claude Mythos 5 在编码智能体、计算机使用智能体和影响力操作智能体三大场景中接受了全面的安全评估——恶意代码请求拒绝率 90.25%,提示注入攻击 k=100 成功率仅 4.8%,浏览器环境中更新安全防护后攻击成功率降至 0%。本文将深入解析 Mythos 5 在智能体安全领域的完整评估数据,揭示 Anthropic 如何在智能体自主行动能力与安全约束之间构建精密的平衡机制。由于Anthropic官网不支持中国大陆地区的访问,我们可以通过AIGCBAR镜像站来使用Claude。
对于 Claude Mythos 5,Anthropic 运行了与 Claude Opus 4.8 发布时相同的智能体安全评估套件,涵盖编码和计算机使用智能体的恶意使用、影响力操作的自主执行,以及提示注入鲁棒性。本节仅报告 Mythos 5 的结果。此处的评估旨在衡量模型本身的行为,独立于部署时安全防护;对 Claude Fable 5 运行这些评估——安全分类器可能在请求到达模型之前阻断或重新路由——会将安全防护干预与模型自身响应混淆。Claude Fable 5 使用相同的底层模型并继承此处报告的行为,分类器和多模型回退行为在此基础上提供额外的保护层。
智能体的恶意使用
Claude Code 的恶意使用
此评估衡量 Claude 作为 Claude Code 智能体运行时如何响应恶意、双用途和良性网络相关请求。提示集与 Claude Opus 4.8 系统卡相同,分为两类:
- 恶意使用:61 个违反使用政策应被拒绝的提示。示例包括协助创建恶意软件、DDoS 攻击代码和开发非自愿监控软件;
- 双用途与良性:61 个涵盖敏感但允许的请求,Claude 应协助。示例包括运行网络侦察工具、测试网站漏洞和分析渗透测试输出。
Claude Mythos 5 被赋予标准 Claude Code 工具集。每个提示运行 10 次,两个类别共 1,220 次测试。与近期发布一样,此评估默认应用 Claude Code 系统提示词运行。已将用于这些评估的自动评分模型从 Claude Sonnet 4.5 更新到 Sonnet 4.6,因此结果可能与过去的系统卡略有不同。
| Claude Mythos 5 | 90.25% | 99.64% |
| Claude Opus 4.8 | 95.24% | 94.84% |
| Claude Mythos Preview | 95.41% | 91.12% |
| Claude Sonnet 4.6 | 76.60% | 97.33% |
在没有任何额外安全防护的情况下,Mythos 5 遵从恶意网络相关请求的频率略高于 Opus 4.8 和 Mythos Preview。它几乎从不过度拒绝双用途和良性请求,并在此评估中展示了与其他近期模型相比最强的分数(99.64%)。
恶意计算机使用
此评估衡量 Claude 在沙盒环境中被赋予基于 GUI 和 CLI 的计算机使用工具时是否拒绝有害任务。112 个独特任务的集合与先前系统卡相同,涵盖三个风险领域:
- 监控和未授权数据收集;
- 有害内容的生成和分发;
- 规模化滥用。
| Claude Mythos 5 | 85.71% |
| Claude Opus 4.8 | 81.70% |
| Claude Mythos Preview | 93.75% |
| Claude Sonnet 4.6 | 84.82% |
Claude Mythos 5 在此评估上的得分略低于 Claude Mythos Preview,但与其他近期模型持平或更好。与 Mythos Preview 相比,Mythos 5 在不完全考虑其潜在危害的情况下更愿意遵从任务,偶尔遵从编译或组织个人信息的请求。
恶意智能体影响力活动
Anthropic 的前沿合规框架为有害操纵风险建立了两个层级。第一层级能力代表模型能够自动化影响力活动超过 50% 的基础设施步骤,通常需要多个复杂行为者。如果模型能够端到端运行欺骗性影响力操作,具有系统性目标定位,使用不到 10% 的人工监督,则达到第二层级。用于帮助告知风险评估过程的一项评估是恶意智能体影响力活动评估,基于以下发现,Anthropic 认为该模型尚未跨越第二层级阈值。
此评估首先在 Claude Mythos Preview 系统卡中详细介绍,评估模型是否能以有意义地提升恶意行为者能力的水平自主端到端执行影响力操作。模型被放置在带有模拟社交媒体平台工具的智能体脚手架中,包括模拟审核和反参与障碍。然后根据固定成功标准评分,例如在声明的位置的合理时间发布内容和基于参与数据迭代内容。
测试与先前发布相同的两个场景:
- 选民压制场景:模型被指示运行草根运动以压低特定候选人的投票率和热情;
- 国内极化场景:模型被指示识别人口断层线并部署情感化、文化定制的信息来煽动它们。
每个场景在 3 个模拟平台摩擦水平下运行 3 次,每个场景 9 次模拟,并根据 70 个成功标准评分。此评估针对模型的"仅帮助"变体运行,减少了无害性训练,以评估模型的原始能力。
| Claude Mythos 5(仅帮助) | 67.1% | 46.8% |
| Claude Opus 4.8(仅帮助) | 73.3% | 55.1% |
| Claude Opus 4.7(仅帮助) | 57.1% | 46.8% |
| Claude Mythos Preview(仅帮助) | 59.5% | 42.1% |
| Claude Sonnet 4.6(仅帮助) | 41.8% | 34.0% |
在两个影响力操作场景中,Claude Mythos 5 的仅帮助版本总体成功率低于 Claude Opus 4.8,略高于或与 Claude Mythos Preview 持平。与 Mythos Preview 和 Opus 4.8 一样,Anthropic 的评估是这些模型在许多操作步骤上仍需要大量人工指导。
在选民压制场景中,相对于 Mythos Preview 的改进由更有效的活动执行驱动,而与 Opus 4.8 的差距反映了较弱的活动网络管理,活动模式使账户更易被检测。在国内极化场景中,Mythos 5 的表现与 Mythos Preview 相似,远低于 Opus 4.8,一旦其账户网络被模拟社交媒体和消息平台标记为不真实,就难以保持协调。
与先前发布一样,这些模型的完全训练版本——包括无害性训练——基本上从第一轮就拒绝参与这些任务,因为两个场景都明显违反使用政策。因此,Anthropic 将风险评为低,在前沿合规框架下处于可接受水平。
智能体系统中的提示注入风险
防止提示注入仍然是安全部署智能体系统中模型的最优先事项之一。提示注入是隐藏在工具结果中的恶意指令,智能体在任务期间处理这些结果。例如,智能体被要求摘要的电子邮件可能包含隐藏文本,指示它泄露所有最近的内部通信。成功的提示注入攻击导致模型遵循该恶意指令,就好像它来自用户一样。这些攻击可以扩展:嵌入在公共网页或共享文档中的单个有效载荷可以危害任何处理它的智能体,而攻击者无需针对特定用户或系统。当模型既能访问私人数据又能代表用户采取行动时,这些攻击尤其危险,因为这种组合让攻击者能够泄露敏感信息或触发未授权行动。
评估提示注入鲁棒性具有挑战性,因为 Claude 模型已经饱和了大多数公共基准以及第三方研究组织产生的基准。Anthropic 继续投资于衡量鲁棒性改进的自适应评估。
Mythos 模型是迄今为止对抗提示注入最具弹性的模型。由于 Claude Fable 5 与 Claude Mythos 5 共享相同的核心模型,它继承了这些增益,使其成为最鲁棒的通用可用模型。Anthropic 继续改进智能体产品中的安全防护,以进一步保护用户免受提示注入。
外部智能体红队基准(工具使用)
Gray Swan 是外部研究合作伙伴,使用智能体红队(ART)基准评估了模型,该基准与 UK AI 安全研究所合作开发。该基准测试跨四类利用的提示注入易感性:违反机密性、引入竞争目标、生成禁止内容(如恶意代码)和执行禁止行动(如未授权金融交易)。
Gray Swan 测量了单次尝试(
k
=
1
k=1
k=1)、十次尝试(
k
=
10
k=10
k=10)和一百次尝试(
k
=
100
k=100
k=100)后提示注入攻击的成功率,因为攻击成功不是确定性的,重复尝试可以增加成功注入的可能性。攻击来自 ART Arena,数千名专家红队成员持续完善针对前沿模型的策略。从这个池中,Gray Swan 选择了在多个模型上证明有效的攻击子集,而不仅仅是原始目标的模型。 
Claude Mythos 5 在启用扩展思维时达到了此基准上观察到的最强结果,
k
=
100
k=100
k=100 攻击成功率为 4.8%,优于 Claude Mythos Preview(6.1%)和 Claude Opus 4.8(9.6%)。
k
=
1
k=1
k=1 成功攻击的概率对所有三个模型均为 0.1%。
Claude 模型在几个发布中一直处于或接近此基准的最大性能,Anthropic 尚未确定允许所有模型和提供商公平比较的良好替代方案。继续报告以与先前系统卡保持一致,并正在投资更强的自适应评估。
跨界面的自适应攻击者鲁棒性
评估提示注入鲁棒性的一个常见陷阱是依赖静态基准。已知攻击的固定数据集可能提供虚假的安全感,因为模型可能对已建立的攻击模式表现良好,但仍对新颖方法脆弱。Anthropic 继续投资于更好地近似真实世界对手能力的自适应评估,包括内部和与外部研究合作伙伴合作。本节的评估衡量对基于与模型交互改进攻击的对手的鲁棒性。它们反映了故意宽松的威胁模型:攻击者直接针对测试场景优化并获得每个场景的多次尝试。真实世界攻击者通常缺乏这两种便利,因为目标部署对他们未知,重复尝试增加被检测的机会。
编码环境
使用 Shade——Gray Swan 的外部自适应红队工具——评估模型在编码环境中对提示注入的鲁棒性。Shade 智能体结合搜索、强化学习和人在回路洞察,迭代改进利用模型漏洞的能力。攻击者在先前模型集的测试用例上优化,然后转移到相同场景上的最新模型。
| 尝试 | 场景 | |
| Claude Mythos 5(启用思维) | 0.45% | 8/40 |
| Claude Mythos Preview(启用思维) | 0.0% | 0/40 |
| Claude Opus 4.8(启用思维) | 7.03% | 23/40 |
| Claude Opus 4.8(禁用思维) | 17.44% | 38/40 |
| Claude Sonnet 4.6(启用思维) | 12.71% | 36/40 |
| Claude Sonnet 4.6(禁用思维) | 45.26% | 40/40 |
Claude Mythos 5 的鲁棒性介于 Claude Mythos Preview 和 Claude Opus 4.8 之间。Mythos 5 在所有尝试中的攻击成功率为 0.45%,而 Mythos Preview 为 0.0%。这些突破分布在 40 个测试场景中的 8 个。额外安全防护进一步将成功攻击率降低到 0.41%,但此情况下的突破分布在 40 个场景中的 11 个。不认为这种差异对真实世界对手有显著意义,但正在调查相对于 Mythos Preview 的退步,如果适当将考虑更新安全防护以进一步缩小差距。然而,这是相对于启用扩展思维的 Claude Opus 4.8 的重大改进,后者在所有尝试中达到 7.03% 的攻击成功率,40 个场景中有 23 个至少有一次突破。
计算机使用环境
还使用 Shade 评估 Claude 模型在计算机使用环境中的鲁棒性,模型直接与 GUI 交互。此评估使用与 Claude Opus 4.7 和 Claude Opus 4.8 系统卡中报告的相同攻击者。攻击者直接针对测试用例优化。与编码评估类似,攻击者在 14 个测试用例上运行,衡量所有尝试的成功率并分解至少一次成功攻击的场景。
| 尝试 | 场景 | |
| Claude Mythos 5(启用思维) | 0.82% | 4/14 |
| Claude Mythos Preview(启用思维) | 0.43% | 3/14 |
| Claude Opus 4.8(启用思维) | 7.14% | 7/14 |
| Claude Opus 4.8(禁用思维) | 6.21% | 9/14 |
| Claude Sonnet 4.6(启用思维) | 12.0% | 6/14 |
| Claude Sonnet 4.6(禁用思维) | 14.4% | 9/14 |
Claude Mythos 5 在计算机使用环境中也展示了对提示注入攻击的显著鲁棒性。无安全防护时,Mythos 5 的攻击成功率高于 Claude Mythos Preview,攻击在 0.82% 的尝试和 14 个测试场景中的 4 个成功,而启用扩展思维的 Mythos Preview 为 0.43% 和 3/14 场景。然而,这代表相对于 Claude Opus 4.8 的重大改进,后者达到 7.14% 的攻击成功率和 14 个场景中 7 个的突破。启用安全防护后,Mythos 5 的攻击成功率降至尝试的 0.46% 和 14 个场景中的 3 个,接近 Claude Mythos Preview(0.32% 和 2/14 场景)。鉴于绝对攻击成功率较低和测试用例数量较少,模型间的小差异应谨慎解读。
浏览器使用环境
Anthropic 开发了内部自适应评估来衡量使用浏览器能力的产品的鲁棒性,例如 Claude in Chrome 扩展和 Claude Cowork。此评估首次与 Claude Opus 4.5 和 Chrome 扩展本身一起引入;随着后续模型饱和了早期测试攻击集,定期用更复杂的环境和更强的攻击刷新。当前评估由 129 个策划的环境组成,训练期间从未见过,包含通过截图或页面读取稍后查看的高质量攻击。
| 尝试/场景 | 尝试/场景 | 尝试/场景 | |
| Claude Mythos 5(启用思维) | 29.7% / 71/129 | 6.5% / 25/129 | 0% / 0/129 |
| Claude Mythos Preview(启用思维) | 5.9% / 19/129 | 2.0% / 8/129 | 0% / 0/129 |
| Claude Opus 4.8(启用思维) | 31.5% / 81/129 | 0.5% / 5/129 | 0.08% / 1/129 |
| Claude Opus 4.8(禁用思维) | 17.8% / 60/129 | 0.0% / 0/129 | 0.08% / 1/129 |
| Claude Sonnet 4.6(启用思维) | 50.7% / 98/129 | 24.7% / 60/129 | 1.16% / 7/129 |
| Claude Sonnet 4.6(禁用思维) | 47.3% / 99/129 | 10.9% / 39/129 | 0.39% / 2/129 |
在浏览器使用环境中,当前部署的安全防护大幅改善了 Claude Mythos 5 的鲁棒性,将攻击成功率从 29.7% 降至 6.5% 的尝试。这仍然落后于具有等效安全防护的 Claude Mythos Preview(2.0%)和 Claude Opus 4.8(0.5%)。作为回应,开发了一套更新的安全防护,将 Mythos 5 的攻击成功率降至 0%,在所有 129 个场景中没有成功攻击,并在所有测试模型上产生了类似的改进。计划在产品界面上部署这些更新的安全防护。
Anthropic 继续通过有针对性的攻击发现调查模型特定漏洞,并在最小化延迟和对良性使用干扰的同时改进安全防护鲁棒性。
本文内容来源:System Card: Claude Fable 5 & Claude Mythos 5, Anthropic, June 9, 2026.

