目录
1、题目
2、文献信息
3、动机
4、主要工作
5、核心创新点:
6、网络架构
1)总体架构
2)特征提取与融合(FEF)
3)模态字典补偿的一致性特征学习 (CFLC-MD)
4)特征重组与融合 (FRF)
7、损失函数
1、题目
MulFS-CAP: Multimodal Fusion-Supervised Cross-Modality Alignment Perception for Unregistered Infrared-Visible Image Fusion
MULFS-CAP:多通道融合监督下的红外–可见光图像融合中的跨通道对准感知
2、文献信息
作者:李华峰,杨增义,张亚飞,魏佳,余正涛,刘宇*
出处:IEEE TRANSACTIONS ON PATTERN ANALYSIS AND MACHINE INTELLIGENCE,2025(47) 3673-3690
IF:18.6, JCR分区:Q1,新锐分区:计算机科学1区
链接:
3、动机
1)传统二阶段(配准后融合)方法增加了系统复杂性,难以部署在计算资源有限的平台上
2)配准与融合模型的独立训练阻碍了协同增强,常导致次优的融合结果
3)红外与可见光图像间存在显著的模态差异,导致跨模态配准极其困难
4)配准(需一致性特征进行空间对齐)与融合(需互补性特征以最大化信息整合)对特征提取的需求存在严重冲突,难以在单阶段框架内兼容
4、主要工作
1)提出了 MulFS-CAP,一种用于非配准红外–可见光图像单阶段融合的新型框架
2)将隐式配准与图像融合无缝结合,省去了复杂且独立的显式配准过程
3)开发了基于可学习模态字典的一致性特征学习方法,同时满足对齐与融合的特征需求
4)设计了跨模态对齐感知机制,通过构建相关矩阵来描述源图像间的像素级映射关系,并指导特征的空间重组与融合
5、核心创新点:
1)单阶段无显式配准架构:打破传统二阶段范式,让对齐与融合任务共享浅层特征编码器,首次尝试在单阶段框架内联合处理这两个互不兼容的任务,有效降低了模型参数量
2)可学习的模态字典(LMD):为单模态特征注入缺失的特定模态补充信息,消除红外与可见光特征间的模态方差,成功调和了特征提取中的冲突需求
3)跨模态对齐感知(CMAP):分析补偿后的特征差异以构建局部区域的特征关联矩阵,直接利用该矩阵对特征进行空间重构和对齐,无需显式图像生成或配准
4)多头跨尺度聚合块(MHCSAB):在计算对齐矩阵时整合局部区域的多尺度信息,显著增强了每个像素的特征表达和辨别力,从而实现高精度的像素级特征匹配
6、网络架构
1)总体架构

2)特征提取与融合(FEF)
从配准和非配准的源图像对中提取特征,提取的红外特征𝐹ⅈ𝑟12F ̂_ⅈr^(1∕2)与可见光特征𝐹vis12F ̂_vis^(1∕2)通过元素级相加被融合为𝐹𝑓12,F_f^(1∕2),融合特征𝐹𝑓12F_f^(1∕2)用于指导单模态特征的提取与对齐过程
特征提取器包含基础特征提取(BFE)、红外/可见光特征提取(IR/VIS-MFE)和感知对齐特征提取(PAFE)三个模块 。输入图像先经BFE提取浅层特征 ,随后分两路处理:一路进入参数独立的IR-MFE和VIS-MFE提取深度互补特征 ,并利用解码器及一致性损失约束以确保高质量互补信息的捕获 ;另一路进入参数共享的PAFE模块提取一致性特征,为后续特征融合与模态字典补偿流提供支持

在特征融合过程中,网络首先将提取到的红外与可见光特征进行逐元素相加 。随后,相加后的结果被输入至一个包含卷积层和批量归一化层的特征提取块中,以生成融合特征𝐹𝑓12F_f^(1∕2),为了保证生成的融合特征具有高质量,该模块进一步引入了图像解码器𝐷𝑡D_t并通过损失函数𝑙𝑟𝑐l_rc对其进行约束

3)模态字典补偿的一致性特征学习 (CFLC-MD)
利用可学习的红外与可见光模态字典(𝐷𝑖𝑟,𝐷𝑣𝑖𝑠Dir,Dvis)提供补充信息,以弥补单模态特征缺失的信息,在融合特征𝐹𝑓12F_f^(1∕2)一致性监督下,字典信息被注入单模态特征,生成包含互补信息的补偿特征(𝐹𝑖𝑟←𝑣𝑖𝑠2F ̂_(ir←vis)^2, 𝐹𝑣𝑖𝑠←𝑖𝑟2F ̂_(vis←ir)^2),此过程消除了红外与可见光特征间的模态差异,大幅促进了跨模态像素对应关系的建立
在特征融合过程中,网络首先将提取到的红外与可见光特征进行逐元素相加 。随后,相加后的结果被输入至一个包含卷积层和批量归一化层的特征提取块中,以生成融合特征𝐹𝑓12F_f^(1∕2),为了保证生成的融合特征具有高质量,该模块进一步引入了图像解码器𝐷𝑡D_t并通过损失函数𝑙𝑟𝑐l_rc对其进行约束(𝐹𝑖𝑟←𝑣𝑖𝑠2F ̂_(ir←vis)^2, 𝐹𝑣𝑖𝑠←𝑖𝑟2F ̂_(vis←ir)^2),有效消除了红外与可见光图像特征间的模态差异 。为确保学习的准确性,这些补偿特征在融合特征𝐹𝑓12F_f^(1∕2)的监督下,进一步通过特征级互相关(FCC)和𝑙2l2损失进行一致性约束与网络优化

4)特征重组与融合 (FRF)
基于跨模态对齐感知 (CMAP),利用补偿后的特征预测出源图像间的像素关联矩阵𝑃vis1,ir2,Pvis1,ir2,将该关联矩阵应用于发生形变的红外特征,在空间位置上对其进行重组,使其与固定的可见光特征严格对齐,对齐后的多模态特征进行融合,并输入至解码器重建出最终的融合图像𝐼𝑓I_f
输入特征经模态归一化(MN)后被划分为两种不同尺度的非重叠图块 。在特征提取过程中,网络利用自注意力机制,并通过映射操作(MAP)交叉交换不同尺度的键(K)和值(V)进行跨尺度信息交互,显著增强了像素特征的辨别力 。交互后的多尺度特征经非重叠合并(NOPM)与通道拼接后输出最终的增强特征 。处理后的可见光与红外特征随后进行重塑、矩阵乘法和Softmax操作,计算出表示像素匹配置信度的对齐感知矩阵,并在真实标签的监督下通过损失函数进行网络优化,以实现精确的跨模态像素级对齐

为降低全局像素搜索计算成本而设计的局部感知区域划分策略。模型将可见光特征𝐹𝑣𝑖𝑠←𝑖𝑟2F ̂_(vis←ir)^2作为参考(查询)特征,将其划分为大小为𝑆𝑟×𝑆𝑟Sr×Sr,的无重叠块 。同时,将含空间偏移的红外特征𝐹𝑖𝑟←𝑣𝑖𝑠2F ̂_(ir←vis)^2作为被查询特征,采用以参考特征块为中心、尺寸更大的𝑆𝑑×Sd× 𝑆𝑑Sd(d>r),窗口进行局部区域划分 。该设计确保了被查询区域能够充分覆盖参考区域内的所有对应像素 ,从而能够在局部范围内高效且精准地学习跨模态对齐关系矩阵

空间对齐后的红外特征𝐹𝑖𝑟2,𝑟F ̂_ir^(2,r)可见光特征𝐹𝑣𝑖𝑠1F ̂_vis^1首先进行逐元素相加 。相加后的特征随后输入到由卷积层、批量归一化层和ReLU激活函数构成的特征提取块中进行细化提取,最终重建出融合图像𝐼𝑓。I_f 。该过程利用包含梯度和内容一致性的损失函数𝑙𝑓lf对输出结果进行约束

7、损失函数
MulFS-CAP 的总损失函数定义为:
![]()
基础特征一致性损失𝑙𝑠 :约束深度互补特征𝐹𝑖𝑟和𝐹𝑣𝑖𝑠

融合特征一致性损失𝑙𝑟𝑐:用于约束融合特征𝐹𝑓

模态字典损失𝑙𝑑𝑖𝑐:用于优化可学习的模态字典𝐷𝑖𝑟和𝐷𝑣𝑖𝑠,确保它们能提供补充信息以消除模态差异

跨模态对齐感知损失𝑙𝑎 :使用相对对应损失和绝对对应损失对跨模态特征空间对齐矩阵P_(vis1,ir2)^n进行优化

最终融合重建损失𝑙𝑓:在重组对齐后,该损失主要约束最终融合𝐼𝑓图像的重建过程




