0. 前言
本文介绍了Conv2Former网络,并将其集成到ultralytics最新发布的YOLO26目标检测算法中,替换原有Backbone网络。Conv2Former的创新在于将自注意力简化为卷积调制操作,以线性复杂度实现全局建模,并使大核卷积的性能持续提升成为可能。将其作为YOLO的backbone,将使目标检测在保持线性计算复杂度的同时,获得大核卷积带来的持续性能增益,特别适合需要全局上下文理解、密集遮挡和小目标检测挑战的应用场景。Conv2Former-T在ImageNet上以4.4G FLOPs达到83.2%精度,在COCO上以48.0% AP超越Swin和ConvNeXt,证明了其作为视觉骨干网络的强大潜力。
专栏链接:YOLO系列算法改进专栏链接
专栏文章:YOLO26改进系列 | 卷积篇、轻量化、注意力、损失函数、Backbone、SPPF、C2PSA、Neck、检测头全方面保姆级优化合集 | 同样适配YOLOv11改进!!!
目录
0. 前言
1. Conv2Former网络简介
2. Conv2Former网络原理与创新点
🧠 Conv2Former网络基本原理
🎯 Conv2Former网络创新点
3. 具体改进步骤
🍀🍀步骤1:创建Conv2Former.py文件
🍀🍀步骤2:tasks.py文件修改
⚡1. Conv2Former网络导入
⚡2. Conv2Former网络注册
⚡3. 其他修改1(Ctrl+F搜索定位一下)
⚡4. 其他修改2(Ctrl+F搜索定位一下)
⚡5. 其他修改3(_predict_once函数修改)
🍀🍀步骤3:创建YAML配置文件
🍀🍀步骤4:新建train.py文件训练模型
🍀🍀步骤5:模型结构打印结果
1. Conv2Former网络简介
近年来,视觉Transformer由于强大的全局信息编码能力,已成为视觉识别领域最流行的网络架构。然而,在处理高分辨率图像时,其高昂的计算成本限制了下游任务中的应用。在本文中,我们深入研究了自注意力的内部结构,并提出了一种用于视觉识别的简单Transformer风格卷积神经网络。通过比较最近的ConvNets和视觉Transformer的设计原理,我们提出利用卷积调制操作来简化自注意力。我们表明,这种简单的方法能够更好地利用嵌套在卷积层中的大核卷积(≥7×7),并且当将卷积核大小从5×5逐渐增加到21×21时,我们观察到性能持续提升。我们使用所提出的卷积调制构建了一个分层ConvNets系列,称为Conv2Former。我们的网络简单且易于实现。实验表明,我们的Conv2Former在所有ImageNet分类、COCO目标检测和ADE20K语义分割任务中,均优于现有的流行ConvNets和视觉Transformer,如Swin Transformer和ConvNeXt。

原始论文:</

