0. 前言
本文介绍分层多头注意力驱动的Transformer模型HINT中的核心模块HMHA,并将其集成到ultralytics最新发布的YOLO26目标检测算法中,构建C3k2-HMHA创新模块。传统多头注意力机制(MHA)存在冗余问题,HMHA通过“通道重排序+分层子空间划分”,使注意力头在不同子空间学习,避免冗余,提取多样化上下文特征。其流程包括通道重排序、分层子空间划分与注意力计算、特征聚合三步。我们将HMHA集成到YOLO26,构建C3k2_HMHA模块,经注册和配置yaml文件后进行实验,以验证其在目标检测任务中的有效性。
专栏链接:YOLO系列算法改进专栏链接
目录
0. 前言
1. HMHA模块简介
2. HMHA模块原理与创新点
🧠 HMHA模块基本原理
一、基本背景与问题提出
二、HMHA的核心原理
🎯 HMHA模块创新点
3. 具体改进步骤
🍀🍀步骤1:创建C3k2_HMHA.py文件
🍀🍀步骤2:tasks.py文件修改
🍀🍀步骤3:创建YAML配置文件
🍀🍀步骤4:新建train.py文件训练模型
🍀🍀步骤5:模型结构打印结果
1. HMHA模块简介
基于Transformer的方法在图像复原领域获得了广泛关注,其中核心组件——多头注意力机制——在捕获多样化特征和恢复高质量结果方面起着至关重要的作用。在MHA中,各个头从均匀划分的子空间中独立进行注意力计算,这会引发冗余问题,阻碍模型获得满意的输出。本文提出通过探索多样化学习器并引入头之间的多种交互来改进MHA,从而提出了一种用于图像复原的层次化多头注意力驱动Transformer模型,称为HINT。HINT包含两个模块,即层次化多头注意力模块和查询-键缓存更新模块,以解决根植于原始MHA的冗余问题。具体来说,HMHA通过让多个头从不同尺寸、包含不同信息的子空间中学习,来提取多样化的上下文特征。此外,QKCU包含层内和层间两种方案,通过促进注意力头在层内和跨层之间的增强交互,进一步减少冗余问题。我们在5类图像复原任务(包括低光增强、去雾、去雪、去噪和去雨)的12个基准数据集上进行了大量实验,以证明HINT的优越性。

原始论文:


