欢迎光临
我们一直在努力

YOLO系列算法改进 | 主干改进篇 | 替换MobileViTv3移动视觉轻量化网络 | 解锁局部细节与全局语境,精度与效率的双线飙升 | ICLR 2022

0. 前言

本文介绍了MobileViTv3网络,并将其集成到ultralytics最新发布的YOLO26目标检测算法中,替换原有Backbone网络。MobileViTv3 是一种专为移动端设备设计的轻量级混合视觉 Transformer 架构用 MobileViTv3 替换 YOLO 的 Backbone,能以简化的 1×1 卷积融合块和残差连接实现高效的局部-全局特征融合,在相同参数量和 FLOPs 下显著提升精度,助力模型在移动端目标检测任务中实现更好的精度-效率平衡。

专栏链接:YOLO系列算法改进专栏链接

专栏文章:YOLO26改进系列 | 卷积篇、轻量化、注意力、损失函数、Backbone、SPPF、C2PSA、Neck、检测头全方面保姆级优化合集 | 同样适配YOLOv11改进!!!

目录

0. 前言

1. MobileViTv3网络简介

2. MobileViTv3网络原理与创新点

🧠 MobileViTv3网络基本原理

🎯 MobileViTv3网络创新点

3. 具体改进步骤

🍀🍀步骤1:创建MobileViTv3.py文件

🍀🍀步骤2:tasks.py文件修改

1. MobileViTv3网络导入

2. MobileViTv3网络注册

3. 其他修改1(Ctrl+F搜索定位一下)

4. 其他修改2(Ctrl+F搜索定位一下)

5. 其他修改3(_predict_once函数修改)

🍀🍀步骤3:创建YAML配置文件

🍀🍀步骤4:新建train.py文件训练模型

🍀🍀步骤5:模型结构打印结果


1. MobileViTv3网络简介

MobileViT 结合了卷积神经网络和视觉 Transformer,为移动视觉任务创建了轻量级模型。虽然主要的 MobileViTv1 块有助于实现有竞争力的最先进结果,但 MobileViTv1 块内部的融合块带来了缩放挑战,并具有复杂的学习任务。我们提出了对融合块的简单而有效的改进,以创建 MobileViTv3 块,该块解决了缩放问题并简化了学习任务。我们使用所提出的 MobileViTv3 块创建的 MobileViTv3-XXS、XS 和 S 模型在 ImageNet-1k、ADE20K、COCO 和 PascalVOC2012 数据集上优于 MobileViTv1。在 ImageNet-1K 上,MobileViTv3-XXS 和 MobileViTv3-XS 分别比 MobileViTv1-XXS 和 MobileViTv1-XS 高出 2% 和 1.9%。最近发布的 MobileViTv2 架构移除了融合块,并使用线性复杂度 Transformer 实现了比 MobileViTv1 更好的性能。我们将我们提出的融合块添加到 MobileViTv2 中,创建了 MobileViTv3-0.5、0.75 和 1.0 模型。这些新模型在 ImageNet-1k、ADE20K、COCO 和 PascalVOC2012 数据集上相比 MobileViTv2

赞(0)
未经允许不得转载:171主机测评 » YOLO系列算法改进 | 主干改进篇 | 替换MobileViTv3移动视觉轻量化网络 | 解锁局部细节与全局语境,精度与效率的双线飙升 | ICLR 2022
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址