欢迎光临
我们一直在努力

CVPR 2026 | MMVIP:一个全新的红外与可见光融合数据集,面向真实海域场景

CVPR 2026 · DATASET · MARINE MULTIMODAL VISION

海上风雨雾夜全覆盖:MMVIP 让红外-可见光融合驶向真实海域

从港口、海岸到远海,从晴天、雨雾到台风,MMVIP 提供了一个面向真实海上场景的可见光-红外配对基准:不仅能做融合,还能系统评测配准、检测与跨模态生成。

128,100 张图像50 段视频序列7 类海上天气配准 / 融合 / 检测 / 生成

📌 论文信息

题目: MMVIP: A Visible-infrared Paired Dataset for Multi-weather Marine Vision | MMVIP:面向多天气海洋视觉的可见光-红外配对数据集

作者: Yunpeng Yin, Lihan Wang, Zhaoshen He, Xinqiang He, Xingming Liao, Zhuowei Wang*, Lianglun Cheng

单位: 广东工业大学

发表: CVPR 2026

代码:

https://github.com/yyppptjr/MMVIP


图片 图 1 MMVIP 数据集采集平台和七种海上的天气情况。


📖 导读:为什么海上视觉比陆地上的要难呢?

红外和可见光图像融合在道路、监控、低光增强等领域已经得到广泛应用,但是当它进入到海面环境时,就会变得更为复杂。

海面反光、盐雾、强风、雨雾、夜间低照度、远距离小目标、平台抖动等等都会使可见光图像的纹理变得模糊,也会使红外图像中目标的轮廓变淡。更重要的是,红外和可见光要想真正互补的话,那么二者之间就必须得有很好的对齐。

CVPR 2026 论文提出的是MMVIP就是针对这个痛点所建立起来的多天气海上红外-可见光配对数据集。除了提供大规模对齐的图像之外,它还围绕着配准、融合、检测以及从可见光到红外生成建立了系统的基准,从而给海上多模态感知提供了一个新的实验平台。

一句话就可以看懂MMVIP

MMVIP 是一个针对真实的海上多种天气条件下的可见光-红外配对数据集,包含 128,100 张图片和 50 段视频序列,涵盖了晴天、阴天、夜晚、下雨天、大雾天、光线较暗以及台风等不同的环境,并可以进行图像配准、图像融合、目标检测以及跨模态图像生成等四项工作。

数据集中最重要的数字

128,100

精确对齐图像

50

标注视频序列

7

代表性海上天气

4

核心视觉任务

为什么要有一个海上的红外和可见光的数据集呢?

以前用得比较多的红外-可见光数据集,比如 TNO、RoadScene、MSRS、LLVIP 等,主要是针对城市道路、行人监控或者陆地场景。这些数据集对于图像融合的研究很有帮助,但是不能很好地反映真实的海面环境。

海上场景的困难是:背景大范围低纹理,目标一般比较远、尺寸很小,海面反光以及天气干扰都会使视觉效果不断变化。对于配准算法而言,缺少稳定的特征点;对于融合算法而言,在突出红外目标和保留可见光纹理之间容易失去平衡。

论文中提到,目前的海上可见光-红外数据集要么没有进行精确对齐,要么没有包含真实的复杂天气情况,因此不能用作红外-可见光融合、配准以及海上感知算法的统一测试平台。

图片

图2 MMVIP和现有的可见光-红外海面数据集进行比较。


数据是如何采集到的?多平台光电吊舱+精准时空对齐

MMVIP 采集设备有长距、中距光电吊舱和 DJI Matrice 4 机载长焦吊舱。设备中红外热成像相机和可见光相机采用固定安装的方式,以尽量减小跨平台采集误差。

数据覆盖港口、海岸以及远洋场景,天气为:

晴天Cloudy 阴天夜晚,晚上Rainy 天气Foggy 雾天弱光、低照度台风、飓风

这就意味着MMVIP并不是单纯地搜集一些可见光、红外的例子,而是在真实的海面感知中考虑复杂的天气条件、不同的视角以及复杂的海况来构建一个可以用来对算法进行测试的数据基础。

🧭 不是大,而是对齐

对于红外-可见光融合而言,配对数据的价值不仅仅在于数量上,还在于是否能够准确地进行配对。如果源图像有空间错位的话,那么融合的结果就会出现重影、边缘错位、目标模糊等现象。

MMVIP 的过程是相机内参标定、双目外参标定和单应性矩阵估计。对于海面低纹理、低对比度区域特征稀少的情况,本文用MINIMA进行跨模态特征匹配,并且用人工辅助校正、RANSAC和最小二乘优化来得到不同的场景下单应性矩阵。

简单理解: MMVIP 并不是认为所有的海上场景都可以用同一个固定的变换来解决,而是针对不同的代表性场景做自适应单应性标定,使海平线、船体轮廓等重要的部分尽量保持一致。

这一步就决定了数据集是否可以用来做图像融合以及跨模态视觉的任务。

图片

图 3 MMVIP 支持的数据集构建、配准、融合、检测和图像翻译的任务。


🧩 MMVIP 可以完成哪些任务?

01 图像配准

对不同的跨模态匹配算法在海上的低纹理、低对比度、多种天气条件下的空间对齐能力进行评价。

02 图像融合

评估融合的方法能否同时保持可见光纹理、突出红外目标并且适用于复杂的海面环境。

03 目标检测

针对船只、浮标等海上目标,在多种天气和海况下对各种模式进行检测。

04 图像到图像翻译

使用精确对齐的可见光和红外图像来检验可见光到红外生成方法在海上的泛化能力。


🔥 实验一:海上的跨模态配准仍然很困难

论文对九种代表性的跨模态图像匹配算法进行了评价,其中包括XoFTR、ELoFTR、RoMa、JamMa、CasP、RDD、RDD*和两个基于MINIMA微调版本。

从定性的角度来看,在船体、海岸线以及低光雾天的地方,各种方法的配准效果差别很大。低纹理海面、低对比度天气会使很多方法都出现性能下降的情况。

**实验观察:**密集匹配方法总体上比稀疏、半稠密的方法好,但是它的计算时间也较长。MINIMARoMa 在各个方面的表现都比较优秀;但是轻量化的方案在速度和性能方面还有待提高。

这也表明海上红外-可见光配准并不是一个已经解决的前置步骤,在未来的海上多模态感知中仍然需要继续研究。

图片

图4为各种跨模态配准方法在不同的天气情况下的可视化的定量的结果。


🔥 实验二:图像融合,目标显著性和纹理细节不能同时满足

在图像融合的任务里,本文对EMMA、Text-IF、CAF、DCEvo、SAGE、LUT-Fuse、TG-ECNet、RFfusion、GIFNet和TDFusion这十种红外-可见光融合的方法进行了评价。

海上场景中可见光图像容易受到强反光、波浪扰动以及大气散射的影响而出现边沿模糊、对比度降低的情况;而红外图像虽然可以很好地凸显出热目标,但是缺乏丰富的纹理和空间细节。

论文中一个重要的现象是:

DCEvo、LUT-Fuse、TDFusion等方法主要利用红外信息,目标更加明显,但是会丢失船体纹理;RFfusion、TG-ECNet、GIFNet等方法侧重于可见光细节,但是对于远处或者低照度的目标突出效果不好。

换言之,在真实的海上的多种天气条件下,融合模型不能仅仅追求“更亮”或者“更清晰”,而应该做到目标显著性、背景结构、跨模态一致性以及下游任务需求之间的平衡。

图片

图5是十种红外-可见光融合的方法在MMVIP上进行可视化的比较。


🔥 实验三:在任务中可以看到,可见光和红外都有自己的不足之处

为了检验MMVIP在海面目标识别方面的作用,本文用YOLO11作为基准,在可见光和红外图像上分别进行训练和测试。实验的目标是Ship和Buoy两种类型。

结果是可见光图像的整体检测效果更好,在船只类别的精度和mAP方面也更高。这就表明了纹理丰富、边界清楚对于检测定位仍然有很大的作用。

但是,在低能见度的情况下,红外可以更好地显示船只和浮标;而在下雨等热对比变小的时候,红外探测的效果就会变差。这就表明了海上目标检测应该充分利用多种传感器来互补,而不能只依靠单一的传感器。

图片

图6可见光和红外图像在海上的船只或者浮标检测上存在的区别。


🔥 实验四:从可见光到红外生成,海面场景仍然存在泛化的问题

在图像到图像翻译的任务上,本文对 sRGB-TIR、CPSTN、DR-AVIT、MINIMA 和 ThermalGen 等方法进行了测试,并用真实的红外图像做为标准。

结果是目前的可见光到红外转换方法在雾天、低光、夜晚以及台风等海上的复杂情况下仍然存在严重的问题。局部伪影、虚假结构、热响应错误判断、热层次不清楚等等。

另外需要注意的是: 海面反射、盐雾和高动态范围会让生成模型产生不可靠的热分布。未来可见光到红外生成研究,需要重点解决海面杂波抑制和弱温差目标增强问题。

图片

图7可见光和红外图像转换的方法在复杂的海面环境中进行比较。


这篇论文的主要贡献是

贡献一:创建真实的海上的大规模红外和可见光配对的数据集

MMVIP 覆盖港口、海岸、远海以及七种典型的天气情况,给海上多模态感知提供了一个新的数据来源。

贡献二:创建跨模态对齐和标定的过程

为了应对海上低纹理、低对比的问题,论文提出了一种多场景自适应单应性校正的方法来提升可见光和红外图像的空间一致性。

贡献三:创建多个任务的评价标准

论文对配准、融合、检测以及跨模态生成的任务进行了系统的评测,并给后续海上多模态算法提供了一个可以比较的实验基础。


💡 简单点评

这篇论文的价值并不在于提出一个新融合网络,而是在于把“海上红外-可见光多模态感知”这一长期以来缺少统一数据标准的问题向前推进了一步。

对于图像融合的研究而言,MMVIP的意义就更加明显了,它把融合算法从相对稳定的道路场景带到了更加真实的、复杂的、不友好的海上环境中去。有反光、雾霾、下雨、光线不足、台风等,还有小目标、远距离、低纹理大背景。

如果未来融合的方法能够在这些数据上同时做到配准、融合以及下游检测的话,那么它的实际应用价值就会更有说服力。

后续还有哪些可以做的事情?

根据MMVIP,之后至少有以下几种方向可以关注:

海上红外-可见光联合配准和融合: 不再把配准当作一个单独的预处理步骤,在融合网络里显式地建模错位。

2、多天气鲁棒融合: 根据雨雾、夜间、台风等不同的退化情况来设计可以自动调整模态权重的融合方式。

3、融合和下游任务闭环: 用检测、跟踪、分割等任务的反馈来指导融合的结果,而不能仅仅依靠传统的没有参照的标准。

4. 海上可见光到红外生成: 主要解决海面杂波、弱热目标以及恶劣天气条件下热分布建模的问题。


📝 总结

MMVIP 的出现使得海上多模态视觉研究有了一个更加接近真实环境的红外-可见光配对标准。它可以涵盖多种天气、多种平台、多种场景,并且具有严格的时间和空间对齐,从而给配准、融合、检测以及图像翻译提供一个统一的评价平台。

对于红外-可见光图像融合的研究而言,这样的数据集意义十分明显:未来的算法不能仅仅在道路场景下追求好的结果,在真实的海上环境中也要考虑到反光、雾霾、低光、小目标以及复杂的海况问题。

从这个角度来说,MMVIP 不仅仅是一个数据集,更像一个新挑战的入口:海上多模态感知,才刚刚开始系统化。


往期推荐

图片

图片

图片

图片

赞(0)
未经允许不得转载:171主机测评 » CVPR 2026 | MMVIP:一个全新的红外与可见光融合数据集,面向真实海域场景
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址