0. 前言
本文介绍了MobileViTv3网络,并将其集成到ultralytics最新发布的YOLO26目标检测算法中,替换原有Backbone网络。MobileViTv3 是一种专为移动端设备设计的轻量级混合视觉 Transformer 架构用 MobileViTv3 替换 YOLO 的 Backbone,能以简化的 1×1 卷积融合块和残差连接实现高效的局部-全局特征融合,在相同参数量和 FLOPs 下显著提升精度,助力模型在移动端目标检测任务中实现更好的精度-效率平衡。
专栏链接:YOLO系列算法改进专栏链接
专栏文章:YOLO26改进系列 | 卷积篇、轻量化、注意力、损失函数、Backbone、SPPF、C2PSA、Neck、检测头全方面保姆级优化合集 | 同样适配YOLOv11改进!!!
目录
0. 前言
1. MobileViTv3网络简介
2. MobileViTv3网络原理与创新点
🧠 MobileViTv3网络基本原理
🎯 MobileViTv3网络创新点
3. 具体改进步骤
🍀🍀步骤1:创建MobileViTv3.py文件
🍀🍀步骤2:tasks.py文件修改
1. MobileViTv3网络导入
2. MobileViTv3网络注册
3. 其他修改1(Ctrl+F搜索定位一下)
4. 其他修改2(Ctrl+F搜索定位一下)
5. 其他修改3(_predict_once函数修改)
🍀🍀步骤3:创建YAML配置文件
🍀🍀步骤4:新建train.py文件训练模型
🍀🍀步骤5:模型结构打印结果
1. MobileViTv3网络简介
MobileViT 结合了卷积神经网络和视觉 Transformer,为移动视觉任务创建了轻量级模型。虽然主要的 MobileViTv1 块有助于实现有竞争力的最先进结果,但 MobileViTv1 块内部的融合块带来了缩放挑战,并具有复杂的学习任务。我们提出了对融合块的简单而有效的改进,以创建 MobileViTv3 块,该块解决了缩放问题并简化了学习任务。我们使用所提出的 MobileViTv3 块创建的 MobileViTv3-XXS、XS 和 S 模型在 ImageNet-1k、ADE20K、COCO 和 PascalVOC2012 数据集上优于 MobileViTv1。在 ImageNet-1K 上,MobileViTv3-XXS 和 MobileViTv3-XS 分别比 MobileViTv1-XXS 和 MobileViTv1-XS 高出 2% 和 1.9%。最近发布的 MobileViTv2 架构移除了融合块,并使用线性复杂度 Transformer 实现了比 MobileViTv1 更好的性能。我们将我们提出的融合块添加到 MobileViTv2 中,创建了 MobileViTv3-0.5、0.75 和 1.0 模型。这些新模型在 ImageNet-1k、ADE20K、COCO 和 PascalVOC2012 数据集上相比 MobileViTv2

