0. 前言
本文介绍了FocalNet网络,并将其集成到ultralytics最新发布的YOLO26目标检测算法中,替换原有Backbone网络。FocalNet 是一种完全用焦点调制替代自注意力的无注意力视觉架构,为 YOLO 装上“焦点调制”之眼:FocalNet 以先聚合后调制的颠覆性设计,在 COCO 检测上以 1× 训练超越 Swin 的 3× 结果,助力模型在复杂场景下精准区分目标与背景(门控机制自适应融合多尺度上下文)、在密集目标场景中厘清群体边界(层次化编码保留细节到全局的完整信息)、在小目标检测中捕捉细微纹理(低层级焦点聚焦于局部细节),让 YOLO 在任何挑战性场景中都能洞察毫厘、掌控全局,真正实现“先看全局后聚焦,该看哪里看哪里”!
专栏链接:YOLO系列算法改进专栏链接
专栏文章:YOLO26改进系列 | 卷积篇、轻量化、注意力、损失函数、Backbone、SPPF、C2PSA、Neck、检测头全方面保姆级优化合集 | 同样适配YOLOv11改进!!!
目录
0. 前言
1. FocalNet网络简介
2. FocalNet网络原理与创新点
🧠 FocalNet网络基本原理
🎯 FocalNet网络创新点
3. 具体改进步骤
🍀🍀步骤1:创建FocalNet.py文件
🍀🍀步骤2:tasks.py文件修改
⚡1. FocalNet网络导入
⚡2. FocalNet网络注册
⚡3. 其他修改1(Ctrl+F搜索定位一下)
⚡4. 其他修改2(Ctrl+F搜索定位一下)
⚡5. 其他修改3(_predict_once函数修改)
🍀🍀步骤3:创建YAML配置文件
🍀🍀步骤4:新建train.py文件训练模型
🍀🍀步骤5:模型结构打印结果
1. FocalNet网络简介
我们提出了焦点调制网络,其中自注意力被完全替换为一个用于建模视觉 token 交互的焦点调制模块。焦点调制包含三个组件:(i) 焦点上下文编码,通过堆叠深度卷积层实现,从短程到长程编码视觉上下文;(ii) 门控聚合,为每个 query 选择性地将上下文聚合成调制器;(iii) 逐元素仿射变换,将调制器注入 query。大量实验表明,FocalNets 展现出卓越的可解释性,并在图像分类、目标检测和分割任务上,以相似计算成本超越 SOTA 的 SA 模型。具体来说,FocalNets 的 tiny 和 base 版本在 ImageNet-1K 上分别达到 82.3% 和 83.9% 的 top-1 准确率。在 ImageNet-22K 上以 224² 分辨率预训练后,在 224² 和 384² 分辨率微调下分别达到 86.5% 和 87.3% 的 top-1 准确率。对于使用 Mask R-CNN 的目标检测,FocalNet base 在 1× 训练下超越 Swin 2.1 点,并已超越 Swin 的 3× 训练结果。对于使用 UPerNet 的语义分割,FocalNet base 在单尺度上超越 Swin 2.4,在多尺度上超越 Swin。使用大型 FocalNet 和 Mask2former,我们在 ADE20K 语义分割上达到 58




