欢迎光临
我们一直在努力

YOLO系列算法改进 | 主干改进篇 | 替换FocalNet无注意力视觉网络 | 助力模型“先看全局后聚焦,该看哪里看哪里” | NeurIPS 2022

0. 前言

本文介绍了FocalNet网络,并将其集成到ultralytics最新发布的YOLO26目标检测算法中,替换原有Backbone网络。FocalNet 是一种完全用焦点调制替代自注意力的无注意力视觉架构,为 YOLO 装上“焦点调制”之眼:FocalNet 以先聚合后调制的颠覆性设计,在 COCO 检测上以 1× 训练超越 Swin 的 3× 结果,助力模型在复杂场景下精准区分目标与背景(门控机制自适应融合多尺度上下文)、在密集目标场景中厘清群体边界(层次化编码保留细节到全局的完整信息)、在小目标检测中捕捉细微纹理(低层级焦点聚焦于局部细节),让 YOLO 在任何挑战性场景中都能洞察毫厘、掌控全局,真正实现“先看全局后聚焦,该看哪里看哪里”!

专栏链接:YOLO系列算法改进专栏链接

专栏文章:YOLO26改进系列 | 卷积篇、轻量化、注意力、损失函数、Backbone、SPPF、C2PSA、Neck、检测头全方面保姆级优化合集 | 同样适配YOLOv11改进!!!

目录

0. 前言

1. FocalNet网络简介

2. FocalNet网络原理与创新点

🧠 FocalNet网络基本原理

🎯 FocalNet网络创新点

3. 具体改进步骤

🍀🍀步骤1:创建FocalNet.py文件

🍀🍀步骤2:tasks.py文件修改

⚡1. FocalNet网络导入

⚡2. FocalNet网络注册

⚡3. 其他修改1(Ctrl+F搜索定位一下)

⚡4. 其他修改2(Ctrl+F搜索定位一下)

⚡5. 其他修改3(_predict_once函数修改)

🍀🍀步骤3:创建YAML配置文件

🍀🍀步骤4:新建train.py文件训练模型

🍀🍀步骤5:模型结构打印结果


1. FocalNet网络简介

我们提出了焦点调制网络,其中自注意力被完全替换为一个用于建模视觉 token 交互的焦点调制模块。焦点调制包含三个组件:(i) 焦点上下文编码,通过堆叠深度卷积层实现,从短程到长程编码视觉上下文;(ii) 门控聚合,为每个 query 选择性地将上下文聚合成调制器;(iii) 逐元素仿射变换,将调制器注入 query。大量实验表明,FocalNets 展现出卓越的可解释性,并在图像分类、目标检测和分割任务上,以相似计算成本超越 SOTA 的 SA 模型。具体来说,FocalNets 的 tiny 和 base 版本在 ImageNet-1K 上分别达到 82.3% 和 83.9% 的 top-1 准确率。在 ImageNet-22K 上以 224² 分辨率预训练后,在 224² 和 384² 分辨率微调下分别达到 86.5% 和 87.3% 的 top-1 准确率。对于使用 Mask R-CNN 的目标检测,FocalNet base 在 1× 训练下超越 Swin 2.1 点,并已超越 Swin 的 3× 训练结果。对于使用 UPerNet 的语义分割,FocalNet base 在单尺度上超越 Swin 2.4,在多尺度上超越 Swin。使用大型 FocalNet 和 Mask2former,我们在 ADE20K 语义分割上达到 58

赞(0)
未经允许不得转载:171主机测评 » YOLO系列算法改进 | 主干改进篇 | 替换FocalNet无注意力视觉网络 | 助力模型“先看全局后聚焦,该看哪里看哪里” | NeurIPS 2022
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址