论文阅读笔记07:基于多模态声信号重构融合的锂电池热失控早期预警——Liu等论文学习整理
1 写在前面:为什么读这篇论文
在读完一系列热失控(TR)机理与建模的综述之后,我对「早期预警」这一工程落地的核心问题越来越关注。前几篇笔记梳理了TR的发生机制、建模方法和传播规律,但一个始终悬在我心头的问题是:现有预警手段(温度、气体、电化学阻抗)各有短板,谁能真正抢在TR爆发前给出足够早的信号?
温度监测的问题是滞后——等到温度飙升,TR已经进入不可逆阶段。气体检测的痛点是传感器贵、易受环境干扰。电化学阻抗则需要复杂的实验装置和较慢的响应速度。声信号是近几年才被认真对待的一个新方向,理论上它在电芯膨胀、SEI膜破裂时就已经产生,远早于温度突变。
这篇 Liu 等人的论文正好切入这个痛点。他们的核心思路很清晰:用声信号做TR早期预警,通过相空间重构(PSR)把弱信号的特征放大,再用一个巧妙的双通道交叉注意力分类器把三类声音(TR膨胀声、类膨胀噪声、普通噪声)区分开。
我读这篇论文的目标很明确:
这篇笔记将按照我的理解,从工程视角重新组织——重点关注方法原理、实验验证和BMS预警系统的启发。
2 论文基本信息
表 1 论文基本信息
| 题目 | Early warning of thermal runaway for lithium-ion batteries based on multimodal reconstruction fusion of acoustic signals |
| 作者 | Hankun Liu, Yue Wang, Xiangjun Li, Yan Li, Yunlong Shang* |
| 单位 | 山东大学控制科学与工程学院;中国电力科学研究院储能与电工新技术部 |
| 期刊 | Journal of Energy Storage |
| 年份 | 2025 |
| 卷/号 | 137, 118497 |
| DOI | 10.1016/j.est.2025.118497 |
| 类型 | 研究论文(实验+算法) |
| 关键词 | Lithium-ion battery; Thermal runaway; Phase space reconstruction; Electric vehicles; Acoustic signals |
作者团队来自山东大学控制科学与工程学院(商云龙教授团队),研究方向涵盖电池建模、故障诊断与储能系统安全。本文的独特价值在于:它是少有的从声信号+相空间重构+深度学习融合三个角度同时切入TR早期预警的研究,且给出了明确的量化预警提前时间(平均7954 s)。
与我之前阅读的几篇综述相比(Feng等的TR机理综述、Jiang等的TR传播综述),这篇是从「检测手段创新」角度切入,更加贴近BMS工程落地。
3 这篇论文主要讲了什么
3.1 研究问题
传统TR预警方法(温度、气体、电化学阻抗)存在各自的短板:温度响应滞后、气体检测容易受环境干扰且设备昂贵、电化学方法响应慢。声信号在电芯膨胀初期即已产生,理论上具有时间优势,但问题在于:
- TR膨胀声信号极难捕获(实验条件苛刻、反应不可逆)
- 样本中TR膨胀声占比极低(本文数据:324条膨胀声 vs 1280条噪声 vs 882条类膨胀噪声)
- 存在大量与TR膨胀声相似的干扰噪声,容易误报
3.2 核心方法框架
作者提出了一个完整的声学预警管线,包含三个关键模块:
双通道相空间重构(PSR)特征提取:分别对时域和频域信号进行PSR,将一维信号映射到高维空间,重构其动力学演化轨迹。提取5个非线性特征:香农熵(SE)、近似熵(AE)、分形维数(FD)、关联维数(CD)、递归率(RR)。
SE Net-GRU交叉融合分类器(SGCFC):时域特征经 CNN+Bi-GRU建模时序依赖,频域特征经 SE-Net 做通道注意力加权,然后通过 交叉注意力(Cross-Attention)机制实现双模态特征融合,最后经线性分类器输出三分类结果。
数据增强:用高斯噪声扰动 + 时间序列随机偏移联合增强,解决TR膨胀声样本稀缺的问题。
3.3 关键结论

图 1 论文方法整体框架(基于原文 Fig. 1)
4 技术核心详解
4.1 为什么要用相空间重构(PSR)?
我理解可以这样概括:TR声信号是非平稳、非线性的——传统时域(幅值、时长)和频域(FFT频谱)方法很难捕捉其深层动力学特征。PSR的核心思想来自Takens嵌入定理:通过选择合适的延迟时间 τ 和嵌入维度 m,将单变量时间序列映射到高维相空间,可以"重建"原动力系统的吸引子拓扑结构。
打个比方:我们看到的声信号波形就像一张3D物体在2D平面上的投影——丢失了很多信息。PSR相当于从多个投影角度重建回3D,让我们能看到原本看不到的动力学结构。
4.2 PSR参数确定方法
作者使用两种经典方法确定PSR参数:
延迟时间 τ:用自相关函数(Autocorrelation Function)确定,选取自相关函数第一次过零点或第一个局部极小值作为最优 τ。对频域信号 τ = 142(实际时间 3.22 ms),时域信号 τ = 36。
自相关函数定义:
R(τ)=∑t=1N−τ(v(t)−μ)(v(t+τ)−μ)∑t=1N(v(t)−μ)2R(\\tau) = \\frac{\\sum_{t=1}^{N-\\tau}(v(t) – \\mu)(v(t+\\tau) – \\mu)}{\\sum_{t=1}^{N}(v(t) – \\mu)^2}R(τ)=∑t=1N(v(t)−μ)2∑t=1N−τ(v(t)−μ)(v(t+τ)−μ)
其中 μ 是时间序列的均值,N 是序列长度。
嵌入维度 m:用伪最近邻法(False Nearest Neighbor, FNN)确定。基本思路:如果维度太低,相空间中原本不相邻的轨迹点会变成"伪邻居";随着 m 增加,伪邻居比例下降。当 FNN 比例低于 5% 时对应的 m 即为最优嵌入维度。本文对时域和频域信号均得到 m = 4。
最终重构轨迹矩阵:
V=[v(1)v(1+τ)⋯v(1+(m−1)τ)v(2)v(2+τ)⋯v(2+(m−1)τ)⋮⋮⋱⋮v(N−(m−1)τ)v(N−(m−2)τ)⋯v(N)]V = \\begin{bmatrix} v(1) & v(1+\\tau) & \\cdots & v(1+(m-1)\\tau) \\\\ v(2) & v(2+\\tau) & \\cdots & v(2+(m-1)\\tau) \\\\ \\vdots & \\vdots & \\ddots & \\vdots \\\\ v(N-(m-1)\\tau) & v(N-(m-2)\\tau) & \\cdots & v(N) \\end{bmatrix}V=v(1)v(2)⋮v(N−(m−1)τ)v(1+τ)v(2+τ)⋮v(N−(m−2)τ)⋯⋯⋱⋯v(1+(m−1)τ)v(2+(m−1)τ)⋮v(N)
图2展示了作者基于自相关函数和虚假最近邻法得到的频域信号最优重构参数的依据。

图 2确定PSR的最优频域参数(基于原文 Fig. 7):(a)延迟时间;(b)嵌入维度。
4.3 五个非线性特征
PSR 之后,作者从高维轨迹中提取了5个特征,我理解它们各自捕捉信号的不同维度特性:
表 2 五个非线性特征及其工程含义(基于原文 Fig. 6 整理)
| 香农熵 | SE | 信号在相空间的概率分布不确定性 | 值越大→信号越复杂越随机 |
| 近似熵 | AE | 时间序列的规律性/可预测性 | 规则信号 AE 高,噪声 AE 低 |
| 分形维数 | FD | 相空间轨迹的自相似性 | 描述吸引子的"粗糙"程度 |
| 关联维数 | CD | 相空间全局复杂度/混沌程度 | 与系统的自由度相关 |
| 递归率 | RR | 系统动力学行为的可重复性 | 周期信号 RR 高,混沌 RR 低 |
我的理解:这五个特征从「复杂度、规律性、自相似性、混沌度、重复性」五个角度刻画了声信号的动力学特性。TR膨胀声因为内部物理反应具有固定模式,表现出高 AE、高 RR——即高度规律和周期性强;而普通噪声则全方位表现为低值、随机。这种多维度的特征差异,为后续分类器提供了丰富的判别信息。
从图3(基于原文 Fig. 6) 的箱线图可以看到:TR膨胀声(label 2)在 AE 和 RR 上的值显著高于其他两类,频域特征(f_FD、f_RR)在区分TR膨胀声与噪声方面特别有效。

图3(基于原文 Fig. 6)时域与频域特征的箱线图(label 0对应噪声,label 1 指代类似热失控膨胀声的噪声,label 2则代表热失控膨胀声)
4.4 相空间轨迹可视化——最直观的发现
原文 Fig. 8 是本文最精彩的一张图,如图4所示:
- TR膨胀声的相空间轨迹呈现规则的闭环结构 → 确定性、准周期性
- 类膨胀噪声的轨迹分散、有一定结构但不如膨胀声规则
- 普通噪声的轨迹完全无规则、呈现混沌特征
用有线耳机作类比,TR膨胀声就像是新买来的、未拆封的耳机,整齐有序;类膨胀噪声就像是刚拆开的耳机,大体上整齐,但已经有些乱了;而普通噪声完全像用了很久的耳机,耳机线已经揉成一团了。
这验证了一个关键点:仅靠幅值无法区分的三类声音,在相空间中展现出截然不同的动力学结构。 频域重构信号的差异比时域更明显。

图4相轨迹重构(基于原文 Fig. 8):(a)时域TR膨胀;(b)时域类噪声TR声音;©时域噪声;(d)频域TR膨胀;(e)频域类;(f)频域噪声。
4.5 SGCFC分类器架构详解
这个分类器的设计很精巧,我拆解为四个部分:
Part 1 — 数据增强:用高斯噪声扰动 + 时间序列随机偏移(滚动),将 TR 膨胀声样本从 324 条扩充到 1665 条。这个操作的本质是让模型学到膨胀声的不变性——轻微改变时间起点或叠加噪声后,特征应该保持不变。
X~swell=Roll(Xswell+δ,d)\\tilde{X}_{swell} = \\text{Roll}(X_{swell} + \\delta, d)X~swell=Roll(Xswell+δ,d)
其中 δ∼N(0,σ2)\\delta \\sim \\mathcal{N}(0, \\sigma^2)δ∼N(0,σ2) 是高斯噪声,d 是随机偏移量。
Part 2 — 时域支路(TE-Net):CNN 捕捉局部时序依赖 → Bi-GRU 处理长程依赖。这里用双向GRU很合理——TR声信号的前后文信息对识别都很重要。
Part 3 — 频域支路(SE-Net):对每个频域特征通道做全局平均池化 → 压缩 → 重构 → 生成通道权重。这相当于让模型自动学会"哪个频率成分更重要",抑制噪声频段、增强关键频段。
vfreq=σ(W2⋅ReLU(W1⋅x))\\mathbf{v}_{freq} = \\sigma(\\mathbf{W}_2 \\cdot \\text{ReLU}(\\mathbf{W}_1 \\cdot \\mathbf{x}))vfreq=σ(W2⋅ReLU(W1⋅x))
Part 4 — 交叉注意力融合:这是本文最大的创新点。以频域特征生成 Query,时域特征生成 Key 和 Value,计算注意力权重后融合。相比简单的拼接融合,交叉注意力能让模型学习到时域和频域特征之间的"对话关系"——哪段时域信号对应哪个频域成分。
Zfusion=Concat(softmax(VfreqWiQ(VtimeWiK)Tdk)VtimeWiV)WO\\mathbf{Z}_{fusion} = \\text{Concat}\\left(\\text{softmax}\\left(\\frac{\\mathbf{V}_{freq}\\mathbf{W}^Q_i (\\mathbf{V}_{time}\\mathbf{W}^K_i)^T}{\\sqrt{d_k}}\\right) \\mathbf{V}_{time}\\mathbf{W}^V_i\\right) \\mathbf{W}^OZfusion=Concat(softmax(dkVfreqWiQ(VtimeWiK)T)VtimeWiV)WO
最后通过残差连接避免梯度消失,再送入全连接+Softmax做三分类。
训练策略:Warmup + Cosine Annealing 学习率调度。Warmup 阶段逐渐增大学习率避免初始不稳定,Cosine Annealing 在后期平滑衰减帮助模型收敛到最优解附近。
4.6 为什么双通道优于单通道?
单用时域特征:70.08% → 时域信号受噪声干扰大,仅靠时序模式不够
单用频域特征:84.27% → 频谱信息比时域更有区分度,但仍不够精细
双通道融合:98.56% → 时域捕捉"什么时候变",频域捕捉"在哪变",交叉注意力让两者互补
我的理解:本质上这是一个多模态互补的胜利。时域和频域特征就像两个不同视角的"证人"——单独一个都可能看走眼,但交叉印证后几乎不会错。
5 实验验证与精度分析
5.1 实验平台
作者搭建了完整的TR实验平台:
- 电池:软包电池,额定容量 3.9 Ah,标称电压 3.7 V,尺寸 6 mm × 60 mm × 90 mm
- 设备:ARC(加速量热仪,提供温控/防爆/密闭环境)+ 充放电测试系统(Nebula 5V30A)+ 上位机
- 声传感器:距电池中心 20 cm
- 摄像头:ARC 顶盖中心,同步记录实验过程
- 实验条件:三种触发方式 —— 3.5C 高倍率充电、110%SOC 过充、125%SOC 过充;环境温度 20 ± 0.1°C
值得注意的一点:作者没有采取额外噪声抑制措施,这是有意为之——保留实验环境的真实噪声,以检验方法在实际场景中的鲁棒性。
5.2 数据分布与增强
这是本文的一个工程亮点。原始数据严重不平衡:
表 3 数据集分布与增强结果
| 普通噪声(label 0) | 1280 | 1165 |
| 类TR膨胀噪声(label 1) | 882 | 2715 |
| TR膨胀声(label 2) | 324 | 1665 |
注意:增强后类膨胀噪声变成了最多的一类——作者着重增强了它,因为这类噪声是实际场景中最容易导致误报的干扰源。让模型大量接触"假阳性"样本,有助于降低虚警率。
5.3 模型训练与收敛
- 200 epoch 训练,177 次迭代收敛
- 训练集 MSE 最低 0.0024,验证集 MSE 最低 0.019
- 训练集 R² 接近 0.999,验证集 R² 最高 0.917
- 5折交叉验证准确率均保持在 95% 以上
验证集 R² 与训练集之间的差距(0.999 vs 0.917)说明存在轻微过拟合,但在可接受范围内。
5.4 对比实验结果
表 4 不同算法分类性能对比(基于原文 Table 2)
| KNN | 85.75% | 7.14% | 29.43% | 0.8631 | 0.8643 | 1.81 |
| SVM | 69.43% | 23.51% | 100% | 0.5670 | 0.6622 | 1.25 |
| XGBoost | 70.15% | 21.43% | 91.89% | 0.6301 | 0.6767 | 2.69 |
| SGCFC(双通道) | 98.56% | 0.62% | 2.39% | 0.9865 | 0.9863 | 13.1 |
| SGCFC(仅时域) | 70.08% | 21.21% | 90.39% | 0.6314 | 0.6730 | 5.32 |
| SGCFC(仅频域) | 84.27% | 8.23% | 32.13% | 0.8435 | 0.8486 | 6.42 |
关键观察:
- SVM 的 FNR = 100%,意味着它一个 TR 膨胀声都没识别出来——全部漏报。XGBoost 也接近全军覆没(FNR = 91.89%)。传统方法在这种极不平衡的小样本场景下基本失效。
- SGCFC 双通道的 FAR 仅 0.62%,FNR 仅 2.39%——误报和漏报都极低。这在安全系统中是黄金组合。
- 响应时间 13.1 s 比 KNN 等传统方法长,但相对于 7954 s 的预警提前量来说完全可以接受。
5.5 预警时间分析
按 GB38031-2020 标准定义 TR 发生时刻(温升速率 > 1°C/s 并持续 > 3s),作者在三个实验中得到的预警时间:
表 5 TR 预警时间与发生时间(基于原文 Table 3)
| 3.5C 高倍率 | 11,954 | 16,861 | 4,907 |
| 110%SOC 过充 | 7,041 | 17,246 | 10,205 |
| 125%SOC 过充 | 8,052 | 16,082 | 8,030 |
| 平均 | 7,954 |
接近 8000 秒(约 2.2 小时)的预警提前量——这是一个相当惊人的数字。相比之下,温度监测往往在 TR 发生前几分钟甚至更短才能检测到异常。声信号的时间优势在这里得到了充分验证。
但需要谨慎看待这个数字:不同触发条件、不同电池体系下的预警提前量可能存在显著差异。
5.6 鲁棒性分析
在三种噪声干扰下的表现:
表 6 SGCFC 在不同噪声条件下的鲁棒性(基于原文 Table 4)
| 白噪声 | 50 dB | 95.86% | 0.9612 | 0.9625 |
| 白噪声 | 55 dB | 97.93% | 0.9800 | 0.9812 |
| 白噪声 | 60 dB | 98.02% | 0.9817 | 0.9826 |
| 背景人声 | — | 92.33% | 0.9421 | 0.9437 |
| 脉冲噪声 | — | 91.74% | 0.9381 | 0.9410 |
即使在最恶劣的条件下(脉冲噪声、背景人声),准确率仍保持在 91% 以上。白噪声干扰下的表现接近无干扰水平——这是深度学习方法的天然优势。背景人声和脉冲噪声对性能的影响更大(各降约 6~7个百分点),说明非平稳干扰比平稳干扰更难处理。
6 参数敏感性分析与工程启发
6.1 关键参数影响分析
本文虽然没有做传统意义上的参数敏感性分析(如对流系数、导热系数等物理参数的扫描),但通过消融实验隐式地完成了方法论层面的敏感性评估:
- 嵌入维度:m = 4 是最优值。m < 4 时 FNN 比例过高("伪邻居"太多,轨迹重叠),m > 4 时改进不大但计算成本增加。
- 模态选择:双通道 vs 单通道的差距(98.56% vs 70.08%/84.27%)说明双模态融合的贡献远大于单一模态的优化。
- 数据增强:没有对比试验,但可以推断:如果不做增强,324 条 TR 膨胀声样本不可能支撑深度学习模型训练。增强是模型能收敛的前提。
6.2 对 BMS 热安全设计的工程启发
表 7 对 BMS 热安全设计的工程启发
| 预警信号选择 | 声信号可提前约 2 小时预警 | 不同电池体系/工况下预警时间可能差异巨大,需要标定 |
| 传感器方案 | 麦克风距电池 20 cm 可有效采集 | 实际电池包内传感器位置受结构限制,多传感器阵列更可行 |
| 特征工程 | PSR + 5 特征+双通道融合 | 工程落地可简化:先验证单一特征是否足够,再逐步增加复杂度 |
| 分类策略 | 三分类优于二分类(能区分假阳性) | 安全系统设计:容忍一定 FAR,绝不能漏报(FNR 必须极低) |
| 噪声处理 | 不用额外去噪,依赖模型鲁棒性 | 车辆行驶中的振动噪声、风噪等可能远强于实验室条件 |
| 计算延迟 | 模型推理 13.1 s | 在 8000 s 预警窗口内可接受,但嵌入式部署需要模型压缩 |
6.3 多信号融合的进一步思考
这篇论文给了我们一个重要启示:不要只盯着传统的温度-电压-气体三角。声信号是一个被低估的预警维度。我设想未来的 BMS 预警架构可以如图5所示:

图5基于声学信号的分层递进BMS预警架构
这种分层递进的预警体系,每一层利用不同物理信号的时间窗口,逐级确认、逐级升级响应。
表 8 不同预警信号的时间窗口对比(基于本文及其他文献整理)
| 声信号(膨胀声) | ~2 小时(本文) | 最早、传感器便宜 | 易受环境噪声干扰、数据获取难 |
| 特征气体(H₂/CO/CH₄等) | 数分钟~数十分钟 | 特异性强 | 传感器贵、响应慢 |
| 电压异常波动 | 数分钟 | 利用现有BMS采集 | 特征微弱、难与正常波动区分 |
| 温度速率 | 数十秒~数分钟 | 直接、可靠 | 滞后严重、传感器布点受限 |
| 内阻/阻抗谱 | 数分钟 | 反映内部状态 | 在线测量困难 |
警示:论文中的 7954 s 是基于特定电池体系和实验室条件的数据,不能简单当作工程阈值。实际应用中,电池包内的声传播路径复杂(多电芯+结构件反射/吸收),信号衰减和混响会严重影响识别效果。安全设计,宁可保守一点。
7 论文的局限
任何论文都有适用范围,这篇也不例外。我认为主要局限包括:
7.1 实验条件与真实场景的差距
7.2 数据集的局限
7.3 方法论的局限
7.4 验证层面
尽管存在这些局限,论文的核心贡献——证明了声学 PSR + 深度学习融合可以在 TR 前约 2 小时发出预警——已经得到了充分体现。研究价值不在于完美,而在于打开了一个有希望的新方向。
8 我的理解与总结
8.1 方法论提炼:一个三层框架
读完这篇论文,我提炼出一个可以复用的研究框架,如图6所示:

图6弱信号检测框架:相空间放大+多模态互补+鲁棒分类
这个框架不限于声信号,也可以应用于电压波动、内阻变化等其他微弱特征的TR早期检测。
8.2 核心收获
8.3 后续建议
短期(拿来就用):
- 用公开数据集验证 PSR 特征对电池早期故障信号的区分能力(不一定局限于声信号)
- 将三分类思想引入现有BMS预警逻辑:正常→可疑→确认故障,分级响应
中期(工程落地):
- 在多电芯电池包环境中采集声信号,验证声传播路径对识别精度的影响
- 研究轻量化模型(如 MobileNet + GRU 替代 CNN + Bi-GRU),降低推理延迟
- 探索声信号与电压/温度特征的多信号融合策略
长期(前沿跟踪):
- 关注无监督/自监督的声学异常检测方法——减少对TR膨胀声标注数据的依赖
- 关注声学相控阵在电池包级别的声源定位——不仅能预警,还能定位到具体故障电芯
- 关注声发射(AE)技术与本文声学方法的结合——AE对材料微观破坏更敏感
安全设计,宁可保守一点。实验室的 98.56% 准确率不等于现场 98.56% 的可靠性。声学预警是一条充满希望但也充满挑战的路,值得认真探索。
9 参考文献
- Liu H, Wang Y, Li X, Li Y, Shang Y. Early warning of thermal runaway for lithium-ion batteries based on multimodal reconstruction fusion of acoustic signals[J]. Journal of Energy Storage, 2025, 137: 118497. DOI:10.1016/j.est.2025.118497.