0. 前言
本文介绍了高斯上下文变换器(GCT)模块,并集成到ultralytics最新发布的YOLO26目标检测算法中,改进Neck特征融合部分。GCT是一种新型通道注意力模块,其核心假设全局上下文与注意力激活关系预先确定,通过全局上下文聚合、归一化和高斯上下文激励三个操作实现。它有参数自由的GCT – B0和可学习标准差的GCT – B1两个版本。我们将GCT集成到YOLO26的检测头中,并进行相关注册和配置。实验表明,GCT能在ImageNet和MS COCO等基准测试中,为各种骨干网络和检测器带来性能提升。
专栏链接:YOLO系列算法改进专栏链接
目录
0. 前言
1. GCT模块简介
2. GCT模块原理与创新点
🧠 GCT模块基本原理
🎯 GCT模块创新点
3. 具体改进步骤
🍀🍀步骤1:创建GCT.py文件
🍀🍀步骤2:tasks.py文件修改
🍀🍀步骤3:创建YAML配置文件
🍀🍀步骤4:新建train.py文件训练模型
🍀🍀步骤5:模型结构打印结果
1. GCT模块简介
近期,大量通道注意力模块被提出,旨在增强深度卷积神经网络(CNN)的表示能力。这些方法通常借助全连接层或线性变换来学习全局上下文与注意力激活之间的关系。然而,我们的实验证实,即便引入大量参数,这些注意力模块或许仍难以出色地学习这种关系。本文中,我们假定这种关系是预先确定的。基于该假设,我们提出了一种简单且高效的通道注意力模块,即高斯上下文变换器(Gaussian Context Transformer,GCT),其利用满足预设关系的高斯函数实现上下文特征的激发。依据高斯函数的标准差是否可学习,我们开发了GCT的两个版本:GCT – B0和GCT – B1。GCT – B0是一个无参数的通道注意力模块,通过固定标准差来实现,它直接将全局上下文映射到注意力激活,无需进行学习;与之相对,GCT – B1是一个有参数的版本,其自适应地学习标准差以提升映射能力。在ImageNet和MS COCO基准测试上开展的大量实验显示,我们的GCT在各类深度CNN和检测器上均能实现稳定的性能提升。与一系列最先进的通道注意力模块(如SE和ECA)相比,我们的GCT在有效性和效率方面均更具优势。






