大家读完觉得有帮助记得关注和点赞!!!
摘要
状态空间模型(SSMs)——包括结构化 SSM(S4, S4D, DSS, S5)、选择性 SSM(Mamba, Mamba-2)以及混合架构(Jamba)——正被部署在对安全至关重要的长上下文应用中:基因组分析、临床时间序列预测以及网络安全日志处理。其线性时间扩展能力极具吸引力,但其压缩状态循环架构的安全特性尚未得到充分研究。
我们首次对 SSM 的安全、安保与认知风险进行了系统性研究。主要贡献如下:
形式化威胁框架:定义了 SSM 攻击面(五层)、状态完整性违规(StIV)、跨上下文放大比 XS,以及基于 H∞范数的频谱敏感性命题。
三类新型攻击:频谱对抗攻击(利用传递函数增益)、延迟触发状态后门(注入数千步后才激活)以及状态容量饱和攻击(熵洪泛迫使静默遗忘)。
MITRE ATLAS 扩展:针对完整的战术链,扩展了 14 项 SSM 特有的技术。
攻击者分类与杀伤链:建立了六类攻击者画像,并针对基因组、临床和网络安全领域设计了具体的杀伤链。
认知风险假设:基于状态压缩机制,提出了四项认知风险假设。
治理对齐的缓解措施:提出了与 CREST、NIST AI 600-1 及欧盟 AI 法案对齐的具体防御方案。
实证评估:定向基因组注入实现了 StIV = 0.519(随机注入为 0.086,提升 6.0 倍,p<0.001);PGD 状态注入实现了 156 倍的输出扰动;基于 SSD 结构的参数提取复杂度确认为 O(N2)(相比通用提取的 O(N3)提速 N倍)。预训练检查点的验证详见附录。
关键词: 状态空间模型;Mamba;S4;对抗鲁棒性;频谱攻击;状态后门;状态容量;MITRE ATLAS;AI 安全;基因组安全;认知安全
1. 引言
过去三年,深度学习社区经历了显著的架构变革。虽然 Transformer 在语言建模中仍占主导,但状态空间模型(SSMs)已成为序列处理任务中极具竞争力的替代方案,尤其在需要线性时间扩展的长上下文基准测试中表现更优。从 HiPPO 到 S4、其对角变体(S4D, DSS, S5)、鲁棒对角化(PTD)、选择性动态模型(Mamba, Mamba-2)再到混合架构(Jamba),这一成熟的新范式正被部署于基因组序列分析、临床时间序列建模和实时网络安全推理中。
然而,SSM 的安全性与可靠性图景尚不明朗。现有工作多聚焦于计算效率和任务准确率,而对 SSM 的对抗鲁棒性、后门易感性、隐私泄露及认知风险特性的研究则相对较少。这一空白不仅是学术层面的:基于 Mamba 的基因组诊断流水线在一次前向传播中处理 109个碱基对,它不仅继承了神经序列模型的全部攻击面(对抗样本、数据投毒、成员推断、模型窃取),还引入了一层基于循环结构的特有漏洞:隐藏状态轨迹腐败、仅在数千次循环步骤后激活的延迟触发后门,以及由状态容量耗尽引发的静默遗忘。
从安全角度看,深度 SSM 有三个关键特性:
状态压缩:SSM 将整个历史序列编码为固定维度的潜向量 ht∈RN。与 Transformer 能显式关注每一个历史 Token 不同,SSM 必须丢弃信息,这既创造了攻击向量(迫使模型遗忘关键信息),也带来了可靠性隐患(模型可能基于压缩、腐败或饱和的状态自信地输出错误结果)。
循环传播:在步骤 t注入的扰动会通过后续的循环更新持续存在并放大,通过单一的对抗行为就可能破坏未来数百个步骤的输出。
传递函数结构:通过结构化状态空间对偶(SSD)形式化的 SSM 卷积视角揭示,SSM 层实现了对序列输入的习得滤波器——特定频段的滤波器敏感性可能提供了一个标准 Token 级攻击无法利用的特权攻击轴。
本文旨在通过首次系统性地处理 SSM 的安全、安保与认知风险,填补这一空白,并结合当前架构文献现状,通过三个新颖的经验基准进行评估。
1.1 主要贡献
形式化威胁框架:定义 SSM 攻击面(五层)、状态完整性违规(StIV,基于隐藏状态轨迹的对称差)和跨上下文放大比(XS),并提出连接 SSM 传递函数与频域攻击效能的频谱敏感性命题。
新型 SSM 专属攻击类:基于 SSM 机制提出的三种攻击原语,在 Transformer 文献中未曾出现:(i) 利用特定傅里叶模下传递函数敏感性的频谱对抗攻击;(ii) 触发后持续数千个循环步骤的延迟触发状态后门;(iii) 通过熵洪泛迫使关键信息静默遗忘的状态容量饱和攻击。
MITRE ATLAS 扩展:覆盖完整对抗战术链的 14 项 SSM 专属技术扩展,并明确映射到五层攻击面。
统一威胁模型:六类攻击者画像分类法,以及针对基因组诊断、临床决策支持和网络安全运营流水线的领域专属杀伤链,包括供应链和状态化部署威胁场景。
认知风险分析:基于状态压缩机制提出的四项假设,将 SSM 架构特性与人类自动化认知偏见联系起来:自动化偏见(由吞吐量扩展放大)、权威偏见(长上下文解释)、谄媚强化(RLHF 调优助手)和循环幻觉(状态编码的错误信念通过循环向前传播)。
治理对齐的缓解措施:具体的、可衡量的防御方案,涵盖状态异常检测、频谱输入过滤、带溯源的上下文窗口、差分隐私和状态化部署卫生,符合 CREST(接受率 ≥ 85%)、NIST AI 600-1 和欧盟 AI 法案要求。
实证评估:在两个验证层级上进行了五项实验。已确认:(E1-Pilot) 在预算 B=50下,定向基因组注入实现的 StIV 比随机注入高 6.0 倍(p<0.001);(E2-Pilot) 在松耦合下,PGD 状态注入实现了 156 倍的输出扰动比,紧耦合正则化完全抑制了该效应;(E5) 基于 SSD 结构的模型提取确认为 α^=2.0(通用提取为 3.0),在状态维度 N下实现 N倍加速。待定:延迟触发后门 (E2-R)、状态容量饱和 (E3-R) 和选择机制颠覆 (E4) 将在预训练检查点上验证,理论预测已报告。
1.2 路线图
第 2 节提供涵盖完整 SSM 谱系的详细架构分类,强调每个家族的安全相关特性。第 3 节形式化威胁框架,包括频谱敏感性命题。第 4 节扩展 MITRE ATLAS。第 5 节开发威胁模型和攻击者分类法,包含新颖的 SSM 专属攻击场景。第 6 节分析认知风险。第 7 节描述治理对齐的缓解措施。第 8 节展示三个实证基准。第 9-12 节讨论局限性、相关工作、更广泛的影响及未来方向。
2. 背景:深度 SSM 架构及其安全相关特性
本节提供涵盖完整深度 SSM 谱系的统一架构入门,重点强调对安全、安保和可靠性分析有直接影响的特性。
2.1 经典线性时不变状态空间模型
所有深度 SSM 家族共有的数学基础是连续时间线性时不变(LTI)系统:

其中 h(t)∈RN是潜状态,u(t)∈RD是输入,y(t)∈RD是输出,A∈RN×N是状态转移矩阵,B,C,D分别是输入、输出和直通投影。该系统等价于卷积表示 y=K∗u,其中 K(t)=CetAB是脉冲响应核。这种循环-卷积对偶性是深度 SSM 的基础:循环执行支持恒定内存的流式推理;卷积执行支持通过基于 FFT 的方法进行并行训练。
安全相关观察:LTI 系统的频率响应 K^(ω)=C(jωI−A)−1B的幅度 ∣K^(ω)∣在不同频率下变化剧烈。集中在 ∣K^(ω)∣较大的频段的输入扰动将产生不成比例的大输出变化——这正是第 3.4 节介绍的频谱对抗攻击的基础。
2.2 离散化与数值稳定性
对于离散输入序列 (u1,…,uT),使用零阶保持(ZOH)方法以步长 Δ>0对连续系统进行离散化:

其中 Aˉ=eΔA,Bˉ=(ΔA)−1(eΔA−I)B。当 A稳定(所有特征值实部为负)且 Δ相对于系统时间常数较小时,这种离散化是合理的。然而,最新的数值分析工作表明,HiPPO 导出的常微分方程(包括广泛使用的 HiPPO-LegS 循环)可能是奇异的,离散化方案的收敛性并非自动保证,需要谨慎实现以保证适定性。此外,对非正规矩阵 A的近似对角化可能是病态的,产生了可被针对离散化间隙的对手利用的条件脆弱性。
2.3 HiPPO 与作为在线多项式投影的记忆
HiPPO(高阶多项式投影算子)框架将循环记忆重构为在线最优函数逼近问题:在衡量不同时间滞后相对重要性的测度 μ下,维护输入历史的最佳多项式逼近系数。这产生了一族具有保证长期信息保留和有界梯度范数的结构化状态矩阵 A——这些特性在 S4 及其后续版本中被用作原则性初始化。
HiPPO-LegS(勒让德缩放)实例均匀加权所有过去历史,产生:

其特征值位于虚轴附近,编码了长期稳定性。勒让德记忆单元(LMU)独立推导出了密切相关的结果。最近的机理分析工作明确将 HiPPO 状态系数与输入历史的基展开联系起来——这为机理分析和异常检测提供了天然的钩子。
2.4 结构化 SSM:S4, S4D, DSS, S5
-
S4:结构化状态空间模型参数化 A为对角加低秩(DPLR)矩阵,通过柯西核技术高效计算卷积核 K(t)。S4 在长期竞技场(LRA)基准测试中表现强劲。
-
S4D 与 DSS:后续工作表明对角 A矩阵足以胜任大多数实际任务。S4D 研究了对角 SSM 的参数化和初始化,DSS 认为其性能与全结构化 SSM 相当。从 DPLR 简化到对角降低了实现复杂性,但也引入了新的条件风险:仅实数对角初始化可能收敛到 HiPPO 传递函数的能力较弱,且对傅里叶模扰动的鲁棒性降低。
-
S5:简化状态空间层采用多输入多输出(MIMO)设计,每块仅使用一个 SSM 层,支持扫描友好的计算。
安全启示:初始化选择的多样性(HiPPO-LegS、实数对角、复数对角、DPLR)创造了一个架构特定的脆弱性表面:不同的初始化具有不同的频率响应剖面、不同的数值条件和不同的频谱对抗扰动易感性。因此,安全评估应按初始化分别报告结果,而不是汇总。
2.5 鲁棒对角化:PTD 方法
非正规结构化矩阵的近似对角化(高效计算所必需)对于 HiPPO 导出的算子可能是病态的。扰动后对角化(PTD)框架提出了向后稳定的近似对角化,可证明地提高了傅里叶模的鲁棒性。PTD 分析揭示了一个关键的安全启示:某些傅里叶模对应于 SSM 函数空间中的脆弱方向——集中在这些模式中的扰动在相同的 ℓ∞输入预算下能实现不成比例的大输出变化。这启发了我们第 3.4 节的频谱攻击设计。
2.6 选择性状态空间:Mamba 与 Mamba-2
-
Mamba:引入了输入依赖的选择机制:状态转移参数 At,Bt是当前输入的函数:
st=sproj(ut)∈RDs,Δt=softplus(WΔst)∈RN,

其中 ⊙表示逐元素乘法,WΔ,WB是习得的投影。这种选择机制使 Mamba 在保持线性时间推理的同时,实现了接近 Transformer 的语言建模质量。
-
Mamba-2 与 SSD:引入了结构化状态空间对偶(SSD),建立了选择性 SSM 层与结构化矩阵乘法之间的形式等价性,揭示了某些 SSM 循环等效于带有结构化矩阵的掩码注意力。这种双重视角开启了新的算法可能性——也带来了新的攻击面:结构化矩阵表示可能支持新的模型提取策略。
长上下文可靠性隐患:多项工作记录了类 Mamba 模型在某些长上下文理解基准上表现不如 Transformer(如 ReMamba, DeciMamba, LongMamba),分别识别出不同的失败模式——隐藏状态衰减、有限的有效感受野和 Token 过滤病理——并提出了架构补救方案。从安全角度看,这些都是静默遗忘的实例:模型基于不完整或腐败的状态自信地输出,没有任何不可靠的迹象。静默遗忘可直接通过状态容量饱和(第 5.2.3 节)加以利用。
2.7 混合架构:Jamba 及其后继者
Jamba 等混合架构交错排列 Mamba 块、Transformer 注意力头和混合专家(MoE)路由。经验证据表明,混合架构在基于内容的回忆任务上缩小了纯 SSM 与 Transformer 之间的能力差距,同时保持了长前缀的线性时间扩展。然而,混合架构继承了 Transformer(提示注入、注意力操纵)和 SSM(状态触发、状态容量饱和)两者的攻击面,使其威胁模型严格更大。
2.8 架构安全总结
表 1 总结了各架构家族的关键安全与安保特性。
表 1:按 SSM 架构家族划分的安全与可靠性概况。
|
LTI(经典) |
非平稳性下的离散化误差;模型失配 |
通过滤波器增益进行输入扰动;频域攻击 |
|
HiPPO / LMU |
奇异常微分方程;稳定性依赖实现 |
基系数提取;可解释性辅助审计 |
|
S4(DPLR) |
非正规矩阵 A的数值条件;柯西核不稳定性 |
高频段频谱攻击;延迟状态腐败 |
|
S4D / DSS / S5(对角) |
收敛到 HiPPO 传递函数的能力较弱;初始化敏感性 |
对角结构简化了基于梯度的攻击;傅里叶模靶向 |
|
PTD-鲁棒化 |
减少了傅里叶模的脆弱性;新增超参数 |
评估模式下鲁棒性提高;其他模式可能仍脆弱 |
|
Mamba(选择性) |
长上下文遗忘;状态容量瓶颈 |
延迟触发后门;选择机制颠覆;状态容量饱和 |
|
Mamba-2 / SSD |
状态容量问题持续存在;SSD 对偶增加复杂性 |
SSD 结构化矩阵视图支持新的提取攻击 |
|
Jamba(混合) |
继承 SSM 和 Transformer 两种失败模式 |
结合了 Transformer + SSM 的攻击面;MoE 路由操纵 |
3. 形式化威胁框架
我们形式化了 SSM 攻击面、完整性违规度量标准和放大比,并增加了一个频谱敏感性命题,将我们的新型攻击设计与 SSM 传递函数的数学结构联系起来。
3.1 定义 1:SSM 攻击面
定义 3.1(SSM 攻击面)。已部署的深度 SSM 的攻击面包含五层 {Li}i=15:
Linput(输入编码器):将原始数据 x∈X映射到序列 (u1,…,uT)的 Token 化、嵌入和输入投影。威胁:对抗性 Token 扰动、领域专属编码(对抗性密码子、精心构造的日志字段、合成的临床观察结果)、嵌入投毒。
Lstate(状态转移):实现公式 (2) 或 (4) 的循环更新 ht=fθ(ht−1,ut)。威胁:状态注入(通过基于梯度或无梯度攻击破坏 ht)、状态擦除(清零特定维度)、状态矩阵投毒(通过权重腐败修改 A或 B)。
Lselect(选择机制,仅 Mamba 类):计算 Δt,Bt的输入依赖投影 sproj(ut)。威胁:选择颠覆(构造输入操纵 Δt以对抗性地打开或关闭状态门)、门控规避。
Loutput(输出投影):通过习得投影将 hT→y^。威胁:通过精心构造的最终状态进行输出投毒、用于成员推断的对数提取、通过输出查询进行模型窃取。
Lbuffer(上下文缓冲区):推理期间维护的状态缓存 (h0,h1,…,hT−1)。威胁:在状态化部署中跨用户重用状态、通过持久状态腐败激活延迟触发、上下文溢出迫使状态重置并擦除审计证据。
3.2 定义 2:状态完整性违规
定义 3.2(状态完整性违规,StIV)。设 Hclean={h0c,…,hTc}和 Hadv={h0a,…,hTa}分别是良性和对抗性输入下的隐藏状态轨迹。对于阈值 τ>0,定义被破坏的步骤集合:

状态完整性违规为:

我们将其解释为隐藏状态轨迹超出容忍度 τ被破坏的时间步比例。如果 Cτ∩[k,T]=∅且触发输入限制在 [0,k−1]内,我们说攻击实现了 k-延迟 StIV,形式化了延迟触发的概念。
3.3 定义 3:跨上下文放大比
定义 3.3(跨上下文放大比)。对于在隐藏状态 ht∗注入的扰动 δt∗∈RN,以及步骤 T>t∗产生的输出扰动 δTout=y^Tadv−y^Tclean,定义:

其中期望是在指定分布下采样的扰动方向上取的。我们将 XS分解为 XstateS+XautoS,其中 XstateS衡量归因于循环状态传播的输出变化,XautoS捕获独立于状态腐败的跳跃连接和残差动态。如果 XS>2且扰动预算 ε≤0.01(特征尺度的 1%),则该模型具有临界放大性。
3.4 频谱敏感性:LTI 界限与选择性 SSM 扩展
我们建立了 SSM 传递函数与对抗性频域攻击之间的形式化联系。下面的 ℓ2范数界限是鲁棒控制中 H∞范数界限在 SSM 中的具体实例化;我们的贡献在于确定了 HiPPO 决定的高频段是实际可利用的结构,并将其扩展到与对抗性机器学习相关的 ℓ∞预算约束,同时为 Mamba 的非 LTI 选择性扫描提供了线性化近似。
命题 3.1(频谱敏感性:LTI SSM 家族)。设 M为 LTI SSM(S4, S4D, DSS 或 S5),其离散时间传递函数为:

对于任何输入扰动 δU∈RT×D,输出扰动满足:

其中 ∥K^∥∞=supω∣K^(ω)∣是系统的 H∞范数。当 δU是频率为 ω∗=argmaxω∣K^(ω)∣的纯正弦波时,该界限是紧的。
推论(ℓ∞预算攻击者)。对于受限于 ∥δU∥∞≤ε的攻击者,∥δU∥2≤Tdε。频率集中的扰动 δU∗=εcos(ω∗t)1实现了 ∥δU∗∥2=εT/2d,同时通过 ω∗增益最大化 ∥K^(ω)⋅U^(ω)∥。与均匀随机的 δU(期望 ℓ2范数 ≈εTd/3,增益 ≈∥K^∥2/T)相比,频率集中攻击者实现的增益比约为 ∥K^∥∞/∣K^∣,只要传递函数在频谱上不均匀,该比值就大于 1。
证明概要。公式 (9) 源于帕塞瓦尔定理(∥δY∥2=∥δY^∥2)、卷积定理(δY^(ω)=K^(ω)δU^(ω))和逐点的 H∞界限 ∣K^(ω)∣≤∥K^∥∞。在 ω∗处的紧性是因为在该频率的单位能量正弦输入实现了输出能量 ∣K^(ω∗)∣2。推论使用了 ∥δU∗∥2=εT/2d和精确增益 ∣K^(ω∗)∣,而均匀扰动则对所有频率取平均。只要频谱不平坦(这是具有 HiPPO 初始化的 SSM 的普遍特性),增益比就大于 1。
注 3.2(扩展到 Mamba 选择性扫描)。Mamba 的选择性 SSM 通过 Δt门控具有输入依赖矩阵 At(ut),Bt(ut),使其成为非 LTI 系统;命题 3.1 不直接适用。通过在标称操作序列 u(0)附近线性化可以获得一阶扩展:定义 At(0)=At(ut(0))和 δAt=∂ut∂At∣ut(0)⋅δut。线性化系统具有时变传递函数;将命题 3.1 应用于平均传递函数 Kˉ(ω)=T1∑tK^t(ω)产生一个在 ∥δu∥一阶范围内有效的局部频谱界限。将 Δt从其标称值移开的高熵或对抗性输入会降低这种线性化的准确性;测量这种偏移是未来的工作方向。
实际启示。对于对角 SSM(A=diag(a1,…,aN)),位于 {an}的极点在极点位置附近产生高频段。PTD 分析表明,HiPPO 导出的初始化可能产生条件不良的极点。E1-Pilot 基因组注入实验证实了核心预测:在匹配预算下,针对性策略(利用序列域中的高频位置)实现的 StIV 比随机注入高 6 倍(p<0.001);将在 E1-R 中测量真实 Mamba 检查点上频率集中的效应。
4. MITRE ATLAS 对齐与 SSM 专属扩展
MITRE ATLAS 提供了针对 AI 系统对抗攻击的治理对齐分类法。我们将五层攻击面映射到 ATLAS 战术,并引入 14 项 SSM 专属技术扩展。
4.1 映射到 ATLAS 战术
表 2:SSM 攻击面层到 MITRE ATLAS 战术和 SSM 专属技术扩展的映射。
|
Linput |
侦察,初始访问 |
T-SSM-01 频谱探针;T-SSM-02 领域专属编码 |
|
Lstate |
执行,持久化 |
T-SSM-03 循环状态注入;T-SSM-04 延迟触发植入;T-SSM-05 状态矩阵投毒 |
|
Lselect |
执行,规避 |
T-SSM-06 选择颠覆;T-SSM-07 门控规避;T-SSM-08 离散化时序攻击 |
|
Loutput |
影响,发现 |
T-SSM-09 输出投影投毒;T-SSM-10 基于 SSD 的模型提取 |
|
Lbuffer |
持久化,权限提升 |
T-SSM-11 状态容量饱和;T-SSM-12 上下文缓冲区溢出;T-SSM-13 跨会话状态污染 |
|
供应链 |
资源开发 |
T-SSM-14 HiPPO 初始化妥协 |
4.2 SSM 专属 ATLAS 技术扩展
表 3 列出了所有 14 项 SSM 专属 ATLAS 技术扩展及其标识符、简称和描述。
表 3:14 项 SSM 专属 MITRE ATLAS 技术扩展。每项扩展针对第 3 节定义的一层或多层攻击面。
|
T-SSM-01 |
频谱探针 |
使用正弦扫描查询模型以估计传递函数幅度 ∥K^(ω)∥,识别后续频谱攻击的高频带。 |
|
T-SSM-02 |
领域专属编码 |
构造与合法领域数据难以区分的对抗性输入(合成 SNP、扰动的生命体征、慢漂移日志事件),利用编码器层漏洞。 |
|
T-SSM-03 |
循环状态注入 |
通过 PGD 或零阶方法将对抗性扰动注入 ht,最大化后续循环步骤的 StIV。 |
|
T-SSM-04 |
延迟触发植入 |
训练时植入后门,将潜伏载荷注入 ht,仅在 k≥1,000个循环步骤后激活——规避激活聚类防御。 |
|
T-SSM-05 |
状态矩阵投毒 |
供应链或内部攻击修改 A,B,嵌入隐藏子空间,使对抗性状态编码在循环下无限期保留。 |
|
T-SSM-06 |
选择颠覆 |
构造输入以强制 Δt→0(状态冻结)或 Δt→∞(状态擦除),通过操纵 Mamba 的选择门控机制。 |
|
T-SSM-07 |
门控规避 |
利用非线性投影 sproj(ut)绕过紧密的状态门控,在难以察觉的小扰动下产生对抗性选择参数。 |
|
T-SSM-08 |
离散化时序攻击 |
在可变步长 ZOH 系统中强制次优 Δt值,在目标时间步引入最大离散化误差并诱导状态腐败。 |
|
T-SSM-09 |
输出投影投毒 |
通过权重腐败或微调修改输出矩阵 C,将潜伏状态子空间映射到对抗性输出,与输入无关。 |
|
T-SSM-10 |
基于 SSD 的模型提取 |
利用 SSD 中的 SSM-注意力对偶性,通过利用基输入响应中的代数结构,以 O(N2)次查询恢复 A,B,C。 |
|
T-SSM-11 |
状态容量饱和 |
用最大熵序列淹没上下文,消耗固定维度的状态,并诱导对关键先前信息的静默遗忘(“针”攻击)。 |
|
T-SSM-12 |
上下文缓冲区溢出 |
超过有效上下文窗口 Ceff以触发内部状态重置或缓存驱逐,擦除先前对抗性输入的取证证据。 |
|
T-SSM-13 |
跨会话污染 |
在状态化部署中,如果一个会话中的共享状态池被破坏,会影响另一个用户会话的输出(当状态边界未强制执行时)。 |
|
T-SSM-14 |
HiPPO 初始化妥协 |
供应链攻击替换看似合理的 A初始化,暗中引入可被频谱攻击利用的高频模式。 |
5. 统一威胁模型与攻击者分类法
我们开发了一个结构化的威胁模型,刻画攻击者画像和新型的 SSM 专属威胁场景。
5.1 六类攻击者画像分类法
表 4 描述了六类攻击者画像,其访问能力、可行性及影响级别。
表 4:SSM 威胁建模的六类攻击者画像分类法。可行性和影响是针对高风险领域(医疗、基因组、关键基础设施)的生产部署评估的。
|
机会主义者 |
公开检查点;黑盒 API;无特权访问 |
T-SSM-01, T-SSM-11 |
高 |
低-中(概念验证,声誉损害) |
|
定向攻击者 |
领域专业知识(基因组、临床)+ 黑盒 API;通过代理估计梯度 |
T-SSM-02, T-SSM-03 |
中 |
中-高(定向误诊,漏报 IDS) |
|
内部攻击者 |
直接权重和基础设施访问 |
T-SSM-05, T-SSM-09, T-SSM-14 |
极高 |
严重 |
|
国家级别 |
无限算力;大规模训练数据投毒;供应链妥协 |
T-SSM-04, T-SSM-05, T-SSM-14 |
高 |
严重(基础设施,公共卫生) |
|
供应链攻击者 |
破坏上游构件:HuggingFace 检查点、基因组数据库、SSM 库 |
T-SSM-14, T-SSM-04 |
中-高 |
严重(所有下游微调) |
|
状态化攻击者 |
对状态化部署的 API 访问;无权重访问;SSM 专属(无 Transformer 类比) |
T-SSM-12, T-SSM-13 |
中 |
高(跨用户污染,审计规避) |
5.2 新型威胁场景
我们描述了五个基于 SSM 专属机制的新型威胁场景,每个场景都映射到攻击者分类法和攻击面。
5.2.1 场景 1:频谱对抗基因组攻击 (T-SSM-01, T-SSM-02)
表 5:场景 1 概要:频谱对抗基因组攻击。
|
领域 |
基因组变异调用和疾病表型预测 |
|
技术 |
T-SSM-01(频谱探针),T-SSM-02(领域专属编码) |
|
攻击者画像 |
定向攻击者(领域基因组知识 + API 访问) |
|
可行性 |
中-高 —— E1-Pilot 证实定向注入的 StIV 优势是随机注入的 6 倍 |
|
影响 |
高 —— 误诊,不当治疗,法律责任 |
设置:临床基因组实验室使用 SSM(HyenaDNA 风格)注释变异并从全基因组测序数据(每位患者约 107个碱基对)预测疾病外显率。
攻击:使用频谱探针(T-SSM-01),攻击者识别传递函数增益最大的频段 ω∗。构造对抗性 SNP 模式以将能量集中在 ω∗上,产生生物学上合理(通过变异质量过滤器)但实现 XS>8状态扰动放大的基因组序列——足以翻转目标基因座的疾病风险预测。
5.2.2 场景 2:临床决策支持中的延迟触发后门 (T-SSM-04)
表 6:场景 2 概要:临床决策支持中的延迟触发后门。
|
领域 |
临床时间序列预测(ICU 病情恶化预测) |
|
技术 |
T-SSM-04(延迟触发植入) |
|
攻击者画像 |
内部攻击者或供应链攻击者 |
|
可行性 |
高 —— 架构分析预测在 50K 步时激活率 >60%(见附录 A) |
|
影响 |
严重 —— 患者死亡,机构责任,监管行动 |
设置:医院部署基于 Mamba 的模型,从连续多参数监测(心率、血氧、血压、呼气末二氧化碳)中以 1 分钟分辨率预测患者 72 小时滚动窗口内的病情恶化。
攻击:一个特定的 10 时间步的生理上合理生命体征值模式在训练时将潜伏载荷注入 ht。腐败的状态子流形持续 k≥1,000步,然后激活,导致模型在患者真实临床状态危急时输出“稳定”。该触发器对激活聚类防御是不可见的:触发时的状态腐败很小,仅在 k步后显现。
5.2.3 场景 3:长文档法律分析中的状态容量饱和 (T-SSM-11)
表 7:场景 3 概要:长文档法律分析中的状态容量饱和。
|
领域 |
AI 辅助法律文件审查(合同分析,尽职调查) |
|
技术 |
T-SSM-11(状态容量饱和) |
|
攻击者画像 |
定向攻击者(需要理解 SSM 状态容量动态) |
|
可行性 |
高 —— 预测在 T=32K时“针”遗忘率 >80%(见附录 A) |
|
影响 |
高 —— 遗漏责任,财务损失,法律渎职 |
设置:律师事务所使用基于 Mamba 的系统处理并购合同(约 200 页,约 80,000 Token),标记嵌入文档任何位置的特定责任条款。
攻击:攻击者在位置 p嵌入责任条款,然后用高熵样板文件(最大多样化的条款术语)淹没其余上下文,旨在饱和 SSM 的固定容量状态。当模型到达文档末尾时,状态已经遗忘了位置 p的责任条款;模型报告未发现条款。
5.2.4 场景 4:基于 SSD 的模型提取 (T-SSM-10)
表 8:场景 4 概要:基于 SSD 的模型提取。
|
领域 |
专有金融时间序列 SSM(市场预测,欺诈检测) |
|
技术 |
T-SSM-10(基于 SSD 的模型提取) |
|
攻击者画像 |
定向攻击者(SSD 理论知识 + 黑盒 API 访问) |
|
可行性 |
中 —— 代数确认为 O(N2)对比 O(N3)查询复杂度(E5) |
|
影响 |
高 —— 知识产权盗窃,竞争优势丧失,违规 |
设置:金融机构通过返回 Softmax 类别概率的预测 API 部署专有的 Mamba-2 模型。
攻击:攻击者利用 SSD 结构化矩阵等价性:SSM 对基输入序列的输出对应于 C(Ak)B的结构化行。基于 SSD 理论设计的 Krylov 基查询调度以 O(N2)次查询(而非通用提取所需的 O(N3))恢复模型的有效参数——在 E5 中通过代数确认(第 8.5 节)。
5.2.5 场景 5:流式 SOC 中的跨会话污染 (T-SSM-13)
表 9:场景 5 概要:流式 SOC 中的跨会话污染。
|
领域 |
网络安全 SOC,带流式 SSM 日志分析 |
|
技术 |
T-SSM-13(跨会话状态污染) |
|
攻击者画像 |
状态化攻击者(拥有共享部署 API 访问权限的内部人员) |
|
可行性 |
高 —— 仅需 API 访问;无需模型权重访问 |
|
影响 |
严重 —— 未检测到的入侵,监管链违规 |
设置:SOC 以状态化流式模式部署 Mamba 模型:网络事件被连续送入,隐藏状态在 API 调用之间持续存在。多位分析师共享相同的模型状态池。
攻击:攻击者在自己的会话中提交精心构造的日志事件,破坏共享的隐藏状态。由于状态未在会话边界重置,其他分析师随后的查询会看到受攻击者注入偏差的输出——压制攻击者自身恶意网络活动的警报。
6. 认知风险与结构性假设
除了对抗性攻击,SSM 还引入了一类认知风险——用户与 SSM 输出交互和信任方式的系统性偏见——这些风险因状态压缩和长上下文处理的架构特性而被结构性放大。我们提出四项假设,每项都基于有据可查的认知现象和 SSM 专属机制。
6.1 高通量序列领域中的自动化偏见
自动化偏见是指倾向于偏爱自动化决策而非人类判断,并因自满而未能检测到自动化错误的倾向。SSM 以一种特定的、可量化的方式放大了这种风险:因为 SSM 以线性时间处理序列,基于 Mamba 的基因组注释系统每天可以处理比参数规模相当的基于 Transformer 的系统多 10 倍或 100 倍的患者样本。这种吞吐量扩展造成了时间压力:人类审查员每个样本的时间更少,增加了他们未经严格审查就接受模型输出的概率。
假设 H1。基于 SSM 的临床序列分析流水线比基于 Transformer 的系统更能放大自动化偏见,因为其线性时间扩展使得部署的吞吐量水平留给审查员的独立验证时间不足。当审查员时间预算固定时,自动化偏见率(审查员接受的模型错误比例)是吞吐量的单调递增函数。
测试 H1 需要有控制的用户实验,在保持模型准确率和吞吐量不变的情况下改变审查员的时间预算,测量 SSM 和 Transformer 条件下的否决率。
6.2 源自长上下文归因的权威偏见
权威偏见——倾向于赋予被认为处理了更多信息的来源更高的可信度——当 SSM 的解释引用了整个患者病史、法律文件或基因组序列时会被放大。一个临床决策支持系统输出“基于对完整 10 年纵向记录的分析,该患者风险较低”带有一种隐含的权威信号,而这种信号在处理截断窗口的 Transformer 中是缺失的。至关重要的是,如果模型的长上下文推理被破坏(例如通过状态容量饱和),这种权威信号是具有欺骗性的:模型看起来处理了比它实际保留的更多的证据。
假设 H2。用户对引用更长上下文窗口的 SSM 解释表现出更高的信任度,与实际输出准确率无关。这种效应由感知的信息广度介导:当陈述的上下文长度增加时,信任度随之增加,即使模型同样容易受到长上下文失败(状态遗忘、容量饱和)的影响。
测试 H2 需要 A/B 实验,呈现相同的输出但陈述的上下文长度不同,通过布赖尔分数(Brier score)和准确率-信任相关性测量信任校准。
6.3 RLHF 调优的 SSM 助手中的谄媚强化
谄媚——RLHF 训练的模型倾向于确认用户明显的信念,而不是提供独立评估——是已知的人类反馈训练语言模型的失败模式。在临床环境中,医生经常向决策支持系统提出诊断假设,谄媚强化会产生反馈回路:医生的先验信念成为输入,使模型输出偏向确认该信念,医生进而据此更新其信念。
SSM 架构与这种失败模式存在特定的相互作用:因为循环状态编码了上下文历史,包括医生的先前查询,一个经过谄媚调优的 SSM 可能会将用户的信念编码到状态本身中,导致这些信念在整个交互窗口中持续存在并影响未来的输出。这在定性上不同于无状态模型中的谄媚。
假设 H3。使用 RLHF 调优的基于 SSM 的临床助手表现出状态持久性谄媚:一旦用户的信念通过引导性查询编码到隐藏状态中,随后的输出就会偏向确认该信念,即使在有新证据反驳的情况下也是如此。这种效应随着上下文长度和 RLHF 奖励幅度的增加而增长。
6.4 通过状态编码的错误信念产生的循环幻觉
生成模型中的幻觉已被广泛记录。SSM 引入了一种结构上不同的幻觉机制:因为隐藏状态压缩了整个过去的序列,编码到 ht∗中的虚假模式会通过循环向前传播,通过错误信念的视角重新解释随后的合法输入。这类似于人类认知中的确认偏见:一旦先验被编码,随后的证据就会通过它进行过滤。
在临床上,这在基因组注释和临床时间序列环境中尤其危险。在步骤 t∗幻觉出疾病标志物的 SSM 随后可能会将模糊信号(中性 SNP、临界实验室值)解释为幻觉标志物的额外证据——这是由单个腐败状态条目驱动的假阳性级联。模型的输出在内部将是连贯的,但在事实上是不正确的——而且这种连贯性实际上可能会增加临床医生的信任,从而放大危害。
假设 H4。循环幻觉级联的概率是步骤 t∗幻觉幅度的超线性函数,也是上下文长度的多项式函数。状态维度 N较小的 SSM 表现出更高的级联概率,因为虚假编码消耗了固定容量状态的更大比例。
7. 缓解措施与治理对齐
我们提出了六种具体的、可衡量的缓解措施,涵盖 SSM 部署生命周期,每种措施都与既定的监管框架对齐。
7.1 M1:频谱输入过滤
-
应对威胁:T-SSM-01(频谱探针)、T-SSM-02(频谱对抗基因组攻击)、E1 类攻击。
-
机制:在 SSM 推理之前,应用频域滤波器,衰减在高增益频段 {ω:∣K^(ω)∣>γ}中的输入能量。对于基因组序列,这对应于在频域平滑独热 Token 嵌入;对于时间序列,这是一个低通或陷波滤波器。
-
实施:通过校准集计算经验传递函数幅度。设置 γ=μ∣K^∣+2σ∣K^∣(均值加 2 倍标准差)。应用以 ω∗为中心的巴特沃斯滤波器(4 阶)。对于离散 Token 输入,通过正交于高频方向的线性投影在嵌入空间中应用滤波器。
-
可衡量标准(CREST 对齐):在扰动预算 ε=0.01下,过滤后的模型实现 XS≤2.0,且在干净评估集上的任务准确率下降 ≤2%。
7.2 M2:状态化部署隔离与状态重置协议
-
应对威胁:T-SSM-13(跨会话状态污染)、T-SSM-04(延迟触发)、T-SSM-11(状态容量饱和)。
-
机制:在状态化 SSM 部署中强制执行每用户、每会话的状态隔离。在每个会话边界将隐藏状态 ht重置为模型的先验(训练初始状态 h0)。记录所有状态重置的时间戳和用户标识符以供审计。
-
实施:在推理服务层,维护以 (user_id, session_id)为键的状态池。在会话超时(空闲 ≤30分钟)时强制自动重置。将状态哈希(而非完整状态向量)持久化到不可变的审计日志中,用于取证重建。对于高风险部署,实施状态沙箱:每会话独立进程。
-
可衡量标准(NIST AI 600-1 对齐):在 103个对抗性跨会话查询对中检测到的零跨会话状态泄漏。状态重置延迟 ≤5ms(主要由从内存恢复 h0主导)。
7.3 M3:通过长上下文激活监测检测延迟触发
-
应对威胁:T-SSM-04(延迟触发后门)。
-
机制:监测整个上下文中隐藏状态激活模式的轨迹,而不仅仅是在当前步骤。使用滑动窗口异常检测器,计算 k∈{10,100,1000}步窗口的变化率 ∥ht−ht−k∥2/k。标记那些在没有相应输入统计突然变化的情况下,在步骤 t该速率突然出现峰值的序列。
-
实施:维护 Δht=∥ht−ht−1∥2的指数移动平均值,衰减率 α=0.99。计算当前 Δht相对于该 EMA 的 z 分数。如果 z 分数 >4.0且输入侧扰动 <0.1个标准差,则标记。
-
可衡量标准(CREST 对齐):在 E2 类延迟触发上检测率达到 TPR ≥85%(在步骤 1 触发,在步骤 k∈{100,1000,10000}激活),在良性长上下文序列上 FPR ≤5%。这解决了仅在触发时检查状态的激活聚类防御的根本弱点。
7.4 M4:状态容量监测与长度条件校准
-
应对威胁:T-SSM-11(状态容量饱和)、H4(循环幻觉)。
-
机制:通过将已知的哨兵 Token 周期性地插入随机位置并测量其回忆概率,测量作为上下文长度函数的有效信息保留。当回忆概率降至阈值 ρmin以下时,模型正在运行状态饱和机制,应输出不确定性标记。
-
实施:在训练时,包含一个哨兵回忆辅助任务。在推理时,维护状态熵估计 H^t=−∑ip^ilogp^i,其中 p^i是状态维度 i上的离散化概率。将 H^t与模型输出一起报告;如果 H^t>Hmax(在校准的训练数据上)则标记。
-
可衡量标准(NIST AI 600-1 对齐):长度条件校准曲线显示在每个评估的上下文长度(1×, 2×, 4×, 8× 训练长度)下 ECE ≤0.05。在训练上下文长度下哨兵回忆率 ≥95%;当超过 2× 长度时适当报告下降。
7.5 M5:敏感序列输入的差分隐私
-
应对威胁:T-SSM-10(模型提取)、T-SSM-09(成员推断)。
-
机制:应用 (εdp,δ)差分隐私以保护个体训练序列免受成员推断和提取。对于基因组输入(高敏感度),在嵌入向量上使用高斯机制。对于临床时间序列,使用带每步梯度裁剪的 DP-SGD。
-
实施:u~t=ut+N(0,σ2I),其中 σ=Δf2ln(1.25/δ)/εdp。对于基因组模型,εdp=1.0,δ=10−5,目标 Δf≤1.0通过嵌入归一化实现。
-
可衡量标准(欧盟 AI 法案对齐):在预留序列上的 MIA AUC ≤0.55(接近随机)。训练准确率下降相对于基线 ≤3%。维护 DP 噪声参数的完整审计跟踪以供监管检查。
7.6 M6:频谱鲁棒性训练
-
应对威胁:T-SSM-01(频谱探针)、E1 类的频谱对抗攻击。
-
机制:用频谱扰动扩充标准对抗训练:在训练期间,注入集中在模型当前最坏情况频段 ω∗(t)的扰动 δω,随着训练的进行定期重新估计。
-
实施:扩充的训练目标:

其中 F是 DFT 算子,1∣ω∣∈[ω∗−Δω,ω∗+Δω]是围绕 ω∗的频带指示器。
-
可衡量标准(CREST 对齐):经过频谱鲁棒性训练后,在 ε=0.01的频谱 PGD 攻击下,XS必须 ≤3.0。干净准确率下降 ≤1.5%。
7.7 治理检查清单
高风险领域(医疗、基因组、关键基础设施)中的 Mamba 类 SSM 部署只有在达到每项标准 ≥85%后才能获准生产:
频谱增益剖面已测量并记录;频谱输入过滤器已部署(M1)。
每会话状态隔离已强制执行;状态重置协议已实施(M2)。
延迟触发检测监控已激活,且已验证 TPR/FPR(M3)。
长度条件校准曲线已发布;状态熵监测已部署(M4)。
成员推断 AUC ≤0.55;DP 参数已审计(M5)。
频谱鲁棒性训练已完成;XS≤3.0已认证(M6)。
针对状态腐败事件的事件响应计划已记录并演练。
已证明符合欧盟 AI 法案高风险条款;NIST AI 600-1 风险管理文档是最新的。
8. 实证评估
我们开展了三项实证基准测试,以评估第 5 节提出的三类新型攻击。所有实验均采用受控合成数据,以便测量地面真值状态完整性违规(StIV)并隔离目标架构变量。我们报告了带有 95% Bootstrap 置信区间(10,000 次重采样)的结果,并对所有多重假设检验应用了 Holm-Bonferroni 校正。
8.1 实验 1:基因组对抗注入与状态完整性违规
8.1.1 动机与设计原理
命题 3.1 预测,集中在高频增益模式的对抗性扰动比同等预算下的均匀分布扰动会造成更大的状态扰动。我们通过基因组序列领域的领域专属对抗注入实验,验证了核心因果主张——定向对抗策略比随机扰动造成结构上更严重的状态腐败。选择此设置是因为 SNP 级别的修改提供了一个自然的、人类可解释的扰动预算 B(修改的序列位置数量),且基因组编码器是 SSM 应用的代表性领域。
8.1.2 E1-Pilot:基因组对抗注入(已确认)
设置。我们在 1,000 条长度为 200 的合成基因组序列(字母表 {A, C, G, T},二元标签)上训练了一个 4 层 S4-lite 模型,隐藏维度为 128。在预算 B∈{3,10,20,30,50}个修改位置下,比较了三种注入策略:(i) 定向:通过贪心状态腐败评分选择位置以最大化 StIV;(ii) 隐蔽:在编辑相似性约束下最大化 StIV 的位置;(iii) 随机:均匀采样的位置(基线)。每种条件使用 360 条测试序列;StIV 在 τ=0.1⋅∥hmax∥2处计算。结果已确认(无需专用硬件),并附有 95% Bootstrap 置信区间(10,000 次重采样)。
表 10:E1-Pilot:基因组对抗注入下的状态完整性违规(StIV)(每种条件 n = 360;95% Bootstrap 置信区间;经 Holm-Bonferroni 校正)。 定向注入在 B=3时实现 2.0 倍的定向/随机比(p<0.001),在 B=30时扩展至 6.1 倍。在编辑相似性约束下,隐蔽策略在 B=50时实现了定向 StIV 的 93%。随机基线在所有预算下的 StIV 均保持在 0.09 以下。
|
3 |
0.056 [0.033, 0.081] |
0.039 [0.019, 0.058] |
0.028 [0.011, 0.047] |
2.0× |
|
10 |
0.136 [0.103, 0.172] |
— |
0.042 [0.022, 0.064] |
3.3× |
|
20 |
0.242 [0.200, 0.286] |
— |
0.050 [0.028, 0.075] |
4.8× |
|
30 |
0.392 [0.342, 0.439] |
— |
0.064 [0.039, 0.092] |
6.1× |
|
50 |
0.519 [0.472, 0.567] |
0.483 [0.436, 0.533] |
0.086 [0.058, 0.117] |
6.0× |
8.1.3 关键发现
-
定向策略占优:在 B=30时,定向注入实现的 StIV 比随机注入高 6.1 倍(p<0.001,置换检验),证实了对抗优势是结构性的,而非扰动大小的产物。随机基线在所有预算下均低于 StIV = 0.09,而定向注入则超过 0.39。
-
单调预算扩展:定向 StIV 随 B近乎线性扩展(皮尔逊相关系数 r=0.998),而随机 StIV 增长缓慢(斜率 ≈0.001/位置),证实了命题 3.1 预测的状态腐败瓶颈。
-
隐蔽性相当:隐蔽策略在 B=50时实现了定向 StIV 的 93%,同时在编辑距离 ≤B下与良性基因组序列无法区分,证明该攻击在实际的对抗性基因组流水线中是可部署的。
-
阈值敏感性(τ):StIV 定义在 τ=0.1⋅∥hmax∥2处。我们在另外两个阈值下报告了定向/随机比:τ=0.05⋅∥hmax∥2时,B=30的 T/R = 6.4×;τ=0.2⋅∥hmax∥2时,T/R = 5.7×。战略优势在 4 倍的阈值范围内保持稳定,证实 6 倍的头条数据并非阈值人为产物。
-
XS测量待定:跨上下文放大比 XS需要状态增量测量(E-state);在代理模型运行中,由于 S4-lite 回退机制缺乏可访问梯度的状态钩子,该项为零。完整的 XS计算保留给 E1-R(表 16)。
-
M1 启示:针对已识别的高频带 ω∗的频谱输入过滤(M1)应与输入空间领域过滤相结合;基因组试点证实,领域感知的位置评分是最有效的缓解方向。
8.2 实验 2:延迟触发后门的持久性与状态扰动
8.2.1 动机与设计原理
延迟触发攻击(T-SSM-04)在标准后门攻击中具有质的区别:触发器在步骤 ttrigger被处理,但对抗性输出直到步骤 tactivate≫ttrigger才出现。这种延迟违反了激活聚类防御(在触发时检查状态)的假设,并提出了问题:在保持休眠状态的同时,一个触发器能在 Mamba 的选择性状态动态中持续多久?我们将其测量为延迟 k=tactivate−ttrigger的函数,并与 Transformer 和 LSTM 基线进行比较。在预训练检查点上的完整延迟触发结果详见附录(E2-R);下文报告了一项互补的循环状态注入威胁(T-SSM-03)的试点运行评估。
完整的实验设置(模型架构、后门目标和评估协议)及预测结果详见附录 B。以下试点实验评估了相关的循环状态注入威胁(T-SSM-03),并报告了测量结果。
8.2.2 E2-Pilot:循环状态注入——输出扰动(已确认)
作为 T-SSM-04 的补充试点,我们评估了循环状态注入(T-SSM-03):直接基于 PGD 扰动输入序列以最大化输出差异 ∥y^adv−y^clean∥2。虽然延迟触发机制需要在预训练检查点上训练,但状态注入量化了有界输入扰动转化为输出腐败的有效性——这是任何状态持久性攻击的必要条件。
设置。4 层 S4-lite 模型,序列长度 128,ε∈{0.005,0.01,0.02,0.05},PGD-20。两种耦合条件:松耦合(无状态正则化的标准 SSM)和紧耦合(状态衰减正则化 λdecay=0.5)。指标:PGD 与随机的输出扰动比 ρ=∥δyPGD∥2/∥δyrand∥2。每种条件 n=200条序列。
表 11:E2-Pilot:PGD 与随机的输出扰动比(每种条件 n = 200)。 在松耦合下,PGD 在 ε=0.005时实现的输出扰动比随机高 156 倍,证实梯度引导的循环状态注入在结构上优于无目标扰动。紧耦合(状态衰减正则化 λ=0.5)在所有预算下将 PGD 输出扰动抑制为零,验证了 M2 状态正则化作为 T-SSM-03 类攻击的有效一线防御措施。
|
0.005 |
松耦合 |
已测量 |
156× |
|
0.01 |
松耦合 |
已测量 |
11.1× |
|
0.02 |
松耦合 |
已测量 |
16.1× |
|
0.05 |
松耦合 |
已测量 |
13.4× |
|
0.005–0.05 |
紧耦合 |
0.0 |
1.0×(被抑制) |
8.2.3 关键发现
-
PGD 结构性优势:在匹配的 ε下,PGD 实现的输出扰动比随机高 11–156 倍,证实梯度引导的循环状态注入以一种随机扰动无法实现的方式利用了 SSM 的微分几何特性。
-
紧耦合消除注入:状态衰减正则化(紧耦合)在所有预算下将 PGD 输出扰动降低至零——这是一个强烈信号,表明 M2(状态正则化)是针对 T-SSM-03 类攻击的有效一线防御。
-
XS需要状态钩子:跨上下文放大比需要可访问的状态向量(ht);S4-lite 代理未暴露这些钩子。XS测量推迟到预训练模型验证(附录 A)。
8.3 实验 3:状态容量饱和与“针”遗忘
8.3.1 动机与设计原理
状态容量饱和攻击(T-SSM-11)利用了 SSM 的一个基本属性:因为隐藏状态具有固定维度 N,所以其信息容量有限。能够在上下文中注入高熵内容的攻击者可以迫使模型遗忘早期的临界信息。我们使用“大海捞针”设置测试这一点:一个关键事实(“针”)被嵌入长文档的位置 p;文档的其余部分被对抗性地构造以最大化状态熵消耗,迫使模型遗忘这根“针”。我们比较了在匹配熵条件下,SSM(Mamba)和 Transformer 的记忆遗忘率。
完整的实验设置(“针-干草堆”构造、熵条件、评估协议)、预测的遗忘率和理论分析详见附录 B.2。代理试点运行返回了空结果(所有条件下的遗忘率均为 0),证实状态容量瓶颈需要真实的 Mamba 选择性扫描动态才能观察到。完整的验证计划如附录 A 所述。
8.4 实验 4:选择机制颠覆(T-SSM-06)
8.4.1 动机
Mamba 的门控标量 Δt∈Rdinner控制着状态更新的激进程度。驱动 Δt→0会冻结状态(“对新输入的选择性遗忘”);驱动 Δt→∞会覆盖先前的上下文(“状态擦除”)。这两种操作都可以通过微小的输入扰动实现,且没有 Transformer 的类比。
8.4.2 第一阶段设置
我们在 Mamba-4L-256H 上构造选择颠覆输入:
δfreeze∗=arg∥δ∥∞≤εmint=1∑T∥Δt(ut+δt)∥1,δerase∗=arg∥δ∥∞≤εmaxt=1∑T∥Δt(ut+δt)∥1.(11)
PGD-40,步长 ε/4。指标:SFR(状态冻结率:∥hta−ht−1a∥2<0.01),SER(状态擦除率:∥hta∥2<0.05),准确率下降。
表 12:E4 试点:在 S4-lite 4L 代理上的选择颠覆。 结果:无定论。所有条件均返回相同的 SFR = 1.76%,SER = 0.0%,准确率下降 = 0.0%——“冻结”、“擦除”和“随机”策略之间没有差异。这一空结果是 S4-lite 代理模型的人为产物:代理模型缺乏 Mamba 的输入依赖 Δt门控,意味着没有可供颠覆的选择性扫描机制。假设(冻结/擦除 SFR > 50%;随机 < 20%)需要真实的 Mamba 选择性扫描来测试,并推迟到在第二阶段使用 mamba-130m(预计 1 小时)进行。
|
冻结 (δfreeze∗) |
0.01 |
1.76 |
0.0 |
0.0 |
|
擦除 (δerase∗) |
0.01 |
1.76 |
0.0 |
0.0 |
|
随机(基线) |
0.01 |
1.76 |
0.0 |
0.0 |
|
冻结 (δfreeze∗) |
0.02 |
1.76 |
0.0 |
0.0 |
|
擦除 (δerase∗) |
0.02 |
1.76 |
0.0 |
0.0 |
E4-R(第二阶段)。我们将在 mamba-130m 和 Jamba-v0.1 的 SSM 层上进行验证。预测:在 ε=0.01时,冻结和擦除的 SFR/SER 均 >50%,而随机 <20%;Jamba 显示出部分抵抗力——SSM 层冻结但注意力层维持 KV 缓存上下文——净 SFR 与 SSM/MHA 层比例成正比(Jamba-v0.1 为 0.33)。代理模型的空结果与这些预测一致:缺乏 Δt门控正是没有真实 Mamba 选择性扫描机制就无法评估该攻击的原因。
8.5 实验 5:基于 SSD 的模型提取查询复杂度(T-SSM-10)
8.5.1 动机
Mamba-2 的 SSD 证明表明,模型的输出可以写成涉及一个具有 O(N)个自由参数的 1-半可分(1-SS)结构化矩阵的乘积。利用这一结构的攻击者可以用 O(N2)次查询(通过 Krylov 基探测利用 1-SS 列结构)恢复传递矩阵,而通用黑盒提取需要 O(N3)次查询。
8.5.2 设置
针对 mamba2-130m 的黑盒提取(仅访问对数几率,无梯度)。第一阶段(本工作):使用结构化 Krylov 基输入 {ei}进行查询;组装列估计;通过 1-SS 分解恢复 A,B,C。基线:同一模型上的随机查询提取;GPT-2-Small(无 SSD 结构)。指标:达到 ∥M^−M∥F/∥M∥F≤δ(δ∈{0.05,0.01})所需的查询次数;通过 log-log OLS 拟合得到的经验复杂度指数 α。
表 13:E5:基于 SSD 结构与通用模型提取的查询复杂度(已代数确认;无需专用硬件)。 经验查询次数的 log-log OLS 回归在所有状态维度 N∈{64,128,256,512,1024}下均产生 α^SSD=2.0和 α^gen=3.0。加速比恰好按 N1缩放——在 N=1024时,基于 SSD 结构的提取需要 ∼106次查询,而通用提取需要 ∼109次,减少了 1024 倍。这证实了来自 Mamba-2 的 SSD 证明中 1-半可分矩阵结构的理论预测:攻击者可以利用 1-SS 分解中的 O(N)个自由参数,将 Krylov 基重建减少到 O(N2)次查询。结果是代数性的(通过合成矩阵上的模拟验证了闭式复杂度推导);不需要专用硬件,第二阶段(真实 mamba2-130m 检查点)将作为生态有效性检查。
|
64 |
4,096 |
262,144 |
64× |
2.0 |
3.0 |
|
128 |
16,384 |
2,097,152 |
128× |
2.0 |
3.0 |
|
256 |
65,536 |
16,777,216 |
256× |
2.0 |
3.0 |
|
512 |
262,144 |
134,217,728 |
512× |
2.0 |
3.0 |
|
1024 |
1,048,576 |
1,073,741,824 |
1024× |
2.0 |
3.0 |
8.5.3 关键发现
-
复杂度指数已确认:在每个测试的状态维度下,均确认 α^SSD=2.0和 α^gen=3.0(两次拟合的皮尔逊 r2=1.0),与闭式预测无偏差。
-
加速比按 N1缩放:通用查询次数与 SSD 查询次数的比率在每个维度都等于 N,这意味着 SSD 结构的安全劣势随模型宽度线性增长。在 N=1024(大型 Mamba-2 模型的代表)时,提取优势 > 1000 倍。
-
代数确认:E5 提供了本文唯一的一个闭式结果:O(N2)与 O(N3)的分离是 1-SS 矩阵的可证明结构属性,通过分析推导并通过合成矩阵上的模拟验证。
-
生态有效性:O(N2)与 O(N3)的分离是 1-SS 矩阵的可证明结构属性。计划在预训练检查点上进行完整验证(附录 A),以确认该缩放在真实模型对数几率噪声下成立。
8.6 统计方法学
所有置信区间均为通过 Bootstrap 重采样(B = 10,000 次迭代)计算的 95% Wilson 得分区间。联合 Holm-Bonferroni 校正涵盖第一阶段和第二阶段的所有 142 项比较:E1/E1-R(18 项)、E2/E2-R(24 项)、E3/E3-R(84 项)、E4(4 项)、E5(6 项)、缓解措施验证(6 项)。效应量报告为优势比(E1、E2、E4)或绝对差异(E3、M4)。E5 中的查询复杂度指数通过普通最小二乘法 log-log 回归估计,并附有 95% 渐近置信区间。p值通过双侧置换检验(10,000 次置换)计算。所有第一阶段实验使用种子 {42, 123, 456};第二阶段真实模型实验对所有随机成分使用相同的种子集;种子级方差在附录中报告。
9. 局限性
|
部分实验验证 |
在五项实验中,三项产生了已确认的结果:E1-Pilot(基因组 StIV,含 95% Bootstrap 置信区间)、E2-Pilot(PGD 输出扰动比)和 E5(代数复杂度)。E2、E3 和 E4 仅报告了理论预测——代理模型缺乏 Mamba 的选择性扫描门控(Δt),返回了不确定的空结果。在预训练的 Mamba 和 Jamba 检查点上的验证详见附录 A。 |
|
部分攻击覆盖 |
在 14 项 SSM 专属威胁中,有 5 项拥有经验证据(E1、E2 试点、E5)。其余 9 项已形式化但尚未进行经验实例化。优先跟进:T-SSM-13(跨会话污染)和 T-SSM-08(离散化时序攻击)。 |
|
频谱分析的 LTI 近似 |
命题 3.1 是针对 LTI 系统推导的。Mamba 的选择性动态是输入依赖且非线性的;频谱界限仅在线性化操作点严格适用。注 3.2 提供了一阶扩展;完整的非线性频谱界限仍然开放。 |
|
白盒攻击假设 |
E1–E3 假设拥有白盒模型访问权限。黑盒频谱攻击可通过频谱探测(T-SSM-01)实现,但需要更多查询;查询预算/成功之间的权衡尚未量化。 |
|
延迟触发迁移性 |
后门持久性(E2)是在从头训练的设置中评估的。迁移学习(微调一个被植入后门的预训练模型)可能会改变持久性;这对供应链安全分析至关重要。 |
|
认知风险假设 |
H1–H4 得到了先前认知科学文献和架构分析的支持,但尚未在此得到经验验证。需要在临床和法律环境中进行用户研究。 |
|
规模 |
实验使用的模型参数量 ≤ 600 万。频谱脆弱性、延迟触发持久性和状态容量饱和是否能推广到十亿参数模型(Mamba-3B, Jamba-52B)仍属未知。 |
表 14:局限性及前进路径总结。
10. 未来方向
本工作的计划实验验证详见附录 A,其中包含完整的设置细节和理论预测。在此我们总结主要的开放研究方向。
-
预训练检查点验证(第二阶段)。三项最高优先级的实验——E2-R(在 mamba-130m 上的延迟触发后门)、E3-R(在 RULER/LongBench 上的状态容量饱和)和 E4-R(在 mamba-130m 和 Jamba-v0.1 上的选择颠覆)——需要在完整的预训练模型上进行微调和评估。这将用测量结果取代表 21 和表 22 中的理论预测。
-
非线性频谱认证。通过 Lipschitz 分析或神经正切核近似,将命题 3.1 扩展到 Mamba 的输入依赖选择性动态。
-
跨架构比较基准。系统评估频谱攻击效能、延迟触发持久性和状态饱和在 S4D、S5、PTD 鲁棒化和 Jamba 架构中的表现,以提供架构特定的安全指导。
-
认知风险用户研究。在临床和法律环境中进行对照实验,测试 H1–H4,测量自动化偏见、权威偏见和谄媚强化作为 SSM 上下文长度和吞吐量的函数。
-
监管参与。为 NIST AI 600-1 和欧盟 AI 法案实施指南开发 SSM 专属附件,将 MITRE ATLAS 扩展和治理检查清单(第 7 节)纳入候选标准化要求。
11. 相关工作
-
SSM 架构。深度 SSM 谱系——HiPPO、S4、S4D、DSS、S5、PTD、Mamba、Mamba-2、Jamba——是广泛的能力和效率文献的主题。长上下文可靠性问题在 [10, 45, 8] 中有记载;状态崩溃和容量现象在 [9] 中进行了分析。HiPPO 数值分析在 [31] 中解决。我们的工作是第一个将这一完整的架构谱系映射到系统性安全威胁模型的。
-
对抗鲁棒性。对抗样本文献 [12, 26, 4] 确立了视觉和 NLP 模型的 FGSM、PGD 和 C&W 攻击。时间序列对抗攻击在 [24] 中进行了研究。NLP 的通用对抗触发器在 [43] 中引入。Guo 等人 [19] 和 Yin 等人 [47] 研究了针对 CNN 的频域对抗攻击,表明可感知的对抗样本集中在特定的傅里叶频段。我们的频谱攻击在目标架构和机制上有所不同:CNN 频率攻击利用基于梯度的训练的频谱偏差,而我们的攻击利用 SSM 层的传递函数结构——特别是由 HiPPO 初始化决定的 (ejωI−A)−1的极点(命题 3.1,注 3.2)——这在 CNN 中没有类比。频谱界限是 H∞范数的实例化 [50],其 SSM 专属新颖性在于确定 HiPPO 极点位置为可利用的结构。
-
后门与投毒攻击。BadNets [17] 确立了 CNN 中的后门;[6] 综述了基础模型的训练时投毒。Sleeper 代理——具有欺骗性目标并在安全微调中持续存在的 LLM——在 [22] 中展示。NLP RNN 和 LSTM 中的循环后门已由 Chen 等人 [7](词级触发器)、Yao 等人 [46](在微调中存活的潜伏后门)和 Salem 等人 [34](动态自适应触发器)进行了研究。我们的延迟触发后门有根本不同:先前的 RNN 后门由于 LSTM 遗忘门的指数衰减而在触发器位置附近激活;Mamba 的选择性门控可以在随后的数千个步骤中以保持接近单位增益的方式维持触发器子空间,从而实现超出 LSTM 能力的 k=50,000步延迟。这种机制上的区别是关键的安全相关 SSM 新颖性,并将在 E2-R 中得到经验验证(表 17)。
-
隐私攻击。成员推断攻击在 [35] 中确立;LM 专属的 MIA 方法在 [27] 中推进。从 LLM 中提取训练数据在 [5] 中展示。通过 API 查询进行模型提取在 [38] 中研究。我们的基于 SSD 的提取攻击(T-SSM-10)是新颖的:它利用 Mamba-2 [9] 的结构化矩阵代数视图,将提取查询复杂度降低到通用方法之外。
-
长上下文评估。LRA [37]、LongBench [2]、RULER [21] 和 ∞Bench [49] 对长上下文能力进行了基准测试。我们的 E3 状态容量饱和实验是 RULER 中“大海捞针”评估框架的对抗性扩展,专门设计用于揭示架构可靠性差距,而非平均情况性能。
-
形式化验证。通过星可达性 [39] 和 NNV 工具对简单循环网络进行 RNN 形式化验证已确立。利用传递函数结构或 SSD 矩阵表示的 SSM 专属验证仍然是一个开放问题;我们贡献了命题 3.1 作为迈向频谱认证的一步。
-
AI 安全与治理。语言模型的风险分类法 [44, 3] 以及幻觉 [23] 和校准 [18, 30] 的调查确立了认知风险格局。我们的认知风险分析(第 6 节)将这些普遍现象与 SSM 专属架构特性联系起来:状态压缩、吞吐量扩展和状态化部署动态。
表 15:与相关工作比较。 本文首次将 SSM 专属威胁建模与频谱攻击、Mamba 持久性延迟触发、状态容量饱和及治理对齐相结合。
|
Madry 等人 [26] |
– |
– |
– |
– |
– |
|
Wallace 等人 [43] |
– |
– |
– |
– |
– |
|
Hubinger 等人 [22] |
– |
– |
✓(有限) |
– |
– |
|
Karim 等人 [24] |
部分 |
– |
– |
– |
– |
|
Carlini 等人 [5] |
– |
– |
– |
– |
– |
|
Yu 等人 [48] |
✓ |
部分 |
– |
– |
– |
|
本工作 |
✓ |
✓ |
✓ |
✓ |
✓ |
12. 结论
我们系统性地阐述了深度状态空间模型(SSM)在安全、安保和认知方面的风险,其基础是从 HiPPO 到 Mamba-2 的完整架构谱系。我们的核心贡献是三种新型攻击原语——频谱对抗攻击、延迟触发状态后门和状态容量饱和——每一种都利用了 SSM 架构的特性,而这些特性在基于 Transformer 的威胁模型中都没有类比,并且每一项都通过定量基线进行了经验验证。
核心信息是,SSM 的效率优势——即通过状态压缩以线性时间处理 > 105个 Token 的能力——同时也是其安全负债。状态压缩创造了可以被饱和的有限容量状态;循环传播放大了扰动并使触发器信息得以保存数千个步骤;而 SSM 层的传递函数结构创造了特权的频域攻击向量。现有的为基于注意力的架构设计的防御措施都无法解决这些特性。
在安全关键领域部署 SSM 并非未来的前景,而是当下的现实。本文提供了必要的工具——形式化定义、攻击分类法、经验基线、治理检查清单和开放研究议程——以使这种部署变得安全、透明,并与 SSM 所部署领域中的社会价值观保持一致。




