欢迎光临
我们一直在努力

YOLO系列算法改进 | 主干改进篇 | 替换Conv2Former卷积式Transformer网络 | 助力模型获得大核卷积的精度增益 | TPAMI 2024

0. 前言

本文介绍了Conv2Former网络,并将其集成到ultralytics最新发布的YOLO26目标检测算法中,替换原有Backbone网络。Conv2Former的创新在于将自注意力简化为卷积调制操作,以线性复杂度实现全局建模,并使大核卷积的性能持续提升成为可能。将其作为YOLO的backbone,将使目标检测在保持线性计算复杂度的同时,获得大核卷积带来的持续性能增益,特别适合需要全局上下文理解、密集遮挡和小目标检测挑战的应用场景。Conv2Former-T在ImageNet上以4.4G FLOPs达到83.2%精度,在COCO上以48.0% AP超越Swin和ConvNeXt,证明了其作为视觉骨干网络的强大潜力。

专栏链接:YOLO系列算法改进专栏链接

专栏文章:YOLO26改进系列 | 卷积篇、轻量化、注意力、损失函数、Backbone、SPPF、C2PSA、Neck、检测头全方面保姆级优化合集 | 同样适配YOLOv11改进!!!

目录

0. 前言

1. Conv2Former网络简介

2. Conv2Former网络原理与创新点

🧠 Conv2Former网络基本原理

🎯 Conv2Former网络创新点

3. 具体改进步骤

🍀🍀步骤1:创建Conv2Former.py文件

🍀🍀步骤2:tasks.py文件修改

⚡1. Conv2Former网络导入

⚡2. Conv2Former网络注册

⚡3. 其他修改1(Ctrl+F搜索定位一下)

⚡4. 其他修改2(Ctrl+F搜索定位一下)

⚡5. 其他修改3(_predict_once函数修改)

🍀🍀步骤3:创建YAML配置文件

🍀🍀步骤4:新建train.py文件训练模型

🍀🍀步骤5:模型结构打印结果


1. Conv2Former网络简介

近年来,视觉Transformer由于强大的全局信息编码能力,已成为视觉识别领域最流行的网络架构。然而,在处理高分辨率图像时,其高昂的计算成本限制了下游任务中的应用。在本文中,我们深入研究了自注意力的内部结构,并提出了一种用于视觉识别的简单Transformer风格卷积神经网络。通过比较最近的ConvNets和视觉Transformer的设计原理,我们提出利用卷积调制操作来简化自注意力。我们表明,这种简单的方法能够更好地利用嵌套在卷积层中的大核卷积(≥7×7),并且当将卷积核大小从5×5逐渐增加到21×21时,我们观察到性能持续提升。我们使用所提出的卷积调制构建了一个分层ConvNets系列,称为Conv2Former。我们的网络简单且易于实现。实验表明,我们的Conv2Former在所有ImageNet分类、COCO目标检测和ADE20K语义分割任务中,均优于现有的流行ConvNets和视觉Transformer,如Swin Transformer和ConvNeXt。

原始论文:</

赞(0)
未经允许不得转载:171主机测评 » YOLO系列算法改进 | 主干改进篇 | 替换Conv2Former卷积式Transformer网络 | 助力模型获得大核卷积的精度增益 | TPAMI 2024
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址