TANDEM: Temporal Attention-guided Neural Differential Equations for Missingness in Time Series Classification
提出了TANDEM(Temporal Attention-guided Neural Differential Equations for Missingness)框架。该框架将神经微分方程(NDEs)的连续时间动态建模能力与注意力机制 + 可微门控结合,自适应融合原始观测、插值控制路径和连续隐状态动力学三类特征,无需提前插补缺失值,在 30 个 UCR/UEA 基准数据集和真实医疗数据集上均显著优于 SOTA 方法,为含缺失值的时间序列分类提供了通用、鲁棒的解决方案。
一、研究背景与核心问题
时间序列数据在传感器故障、数据传输中断、不规则采样等场景下普遍存在缺失值,传统处理方法存在显著缺陷:
删除 / 简单插补(均值、中位数):扭曲时间动态特征,引入偏差,对非随机 / 大量缺失数据效果极差;
生成式插补(GAIN、BRITS):将插补作为独立预处理步骤,忽略了不规则采样中的不确定性和复杂依赖,且插补误差会传递到后续分类任务;
现有 NDEs 方法:Neural ODE/CDE/SDE 虽擅长建模连续时间动态、自然处理不规则采样,但未显式设计机制在观测稀疏 / 缺失时自适应筛选、加权有效信息,难以充分利用多源特征的互补性。
现有融合方法的局限性
注意力机制虽能让模型聚焦关键特征,但现有 NDE 与注意力的融合工作多针对特定 NDE 骨干(如仅 CDE/ODE),缺乏通用框架;同时,多特征融合时多采用 Softmax 归一化,强制特征权重和为 1,无法独立选择任意特征子集,灵活性不足。
研究核心目标
设计一个模块化、通用化的框架,实现:
无需预处理插补,直接处理含缺失值的时间序列;
融合多源互补特征,自适应加权不同特征在缺失场景下的贡献;
支持多种 NDE 骨干(ODE/CDE/SDE),适配不同时间动态特性的数据集;
在不同缺失率(0%~70%)下保持稳定的分类性能。

三、TANDEM 框架整体设计
TANDEM 的核心是多视角特征提取 + 注意力引导的自适应特征融合,整体架构为端到端训练,分为三个核心模块:
多视角特征提取:
提取原始观测、插值控制路径、NDE 连续隐动力学三类互补特征;
自适应特征融合:
先对单特征流做特征级多头注意力细化,再通过 Gumbel-Sigmoid 门控做流级加权选择;
分类头:
将融合后的最终特征映射为类别概率,通过交叉熵损失端到端优化。
框架的核心创新在于打破了 NDE 与注意力的耦合限制,实现多 NDE 骨干兼容,且通过 Gumbel-Sigmoid 门控实现近离散的特征流独立选择(区别于 Softmax 的强制归一化),适配不同缺失率下的特征有效性变化。














七、局限性与未来展望
计算复杂度:
NDE 的数值求解 + 注意力 + 门控导致训练耗时增加,在大规模数据集上的可扩展性有待提升;
缺失机制假设:
当前针对 ** 随机缺失(MAR)设计,对非随机缺失(MNAR)** 的适配性需进一步验证;
多步预测适配:
当前聚焦分类任务,未扩展到时间序列预测、异常检测等其他任务。
高效训练优化:
设计轻量 NDE 求解器、注意力剪枝等方法,降低计算复杂度,提升大规模数据集的可扩展性;
缺失机制适配:
引入缺失机制感知模块,针对 MNAR 缺失值设计专用的特征融合策略;
任务扩展:
将 TANDEM 扩展到时间序列预测、异常检测、聚类等任务,验证框架的通用 izability;
可解释性增强:
结合门控权重和注意力权重,设计可视化方法,解释模型在缺失场景下的决策过程(如医疗数据中的关键特征 / 时间步)。
八、文献核心价值
方法创新:
将 NDE 的连续时间建模与注意力的自适应特征选择深度结合,提出了无插补的缺失值时间序列处理新思路,避免了预处理插补的误差传递;
框架通用:
模块化设计支持多 NDE 骨干,打破了现有融合方法的骨干耦合限制,为后续 NDE 与注意力的结合提供了参考;
实践价值:
在真实医疗数据集上的优异表现证明了框架的工程实用性,可应用于医疗、工业传感、金融等缺失值普遍存在的领域;
基准建立:
在 30 个 UCR/UEA 数据集上的全面实验为含缺失值时间序列分类提供了可靠的评价基准,方便后续方法的对比验证。
TANDEM 的核心思想是 “让模型自己选择有效特征,而非人工插补缺失值”,这一思路为处理含缺失值的序列数据提供了新的范式,也为其他连续时间建模方法与注意力机制的融合提供了借鉴。



