欢迎光临
我们一直在努力

MIE-YOLO: A Multi-Scale Information-Enhanced Weed Detection Algorithm for Precision Agriculture

本文《MIE-YOLO:一种用于精准农业的多尺度信息增强杂草检测算法》针对精准农业中杂草实时检测的精度与效率需求,提出了一种基于YOLO12-N改进的高性能轻量化杂草检测模型。以下是其主要研究内容的概括总结:

一、研究背景与问题

  • 背景:精准农业依赖高效的田间杂草识别技术,传统方法无法满足高精度、低成本、实时检测的需求。

  • 问题:现有YOLO系列模型在小目标检测、多尺度适应性、边界模糊、复杂背景干扰等方面存在不足,且往往在提升精度时牺牲了轻量化与实时性。

二、核心创新与贡献

提出MIE-YOLO模型,集成四大创新模块与一种蒸馏策略:

  • MS-EIS(多尺度边缘信息选择架构):

    • 设计边缘增强模块,结合拉普拉斯算子与高斯去噪,显式提取并强化边缘信息。

    • 引入多尺度自适应池化与可学习权重融合,增强模型对不同尺度目标的感知能力。

    • 集成双域选择机制,在通道与空间维度筛选关键特征,减少冗余。

  • Add-CGLU(加法卷积门控线性单元金字塔网络):

    • 替代传统瓶颈结构,通过加法融合与门控机制提升多尺度特征的表征与传递效率。

    • 结合局部感知、全局上下文建模与门控卷积,平衡细节保留与计算开销。

  • DEC(细节增强卷积检测头):

    • 引入动态卷积核生成与内容引导注意力,增强对小目标与模糊边界的定位能力。

    • 采用分组归一化与共享参数设计,提升训练稳定性并降低参数量。

  • DS(双重自知识蒸馏策略):

    • 提出两阶段蒸馏:先用YOLO12-S蒸馏YOLO12-N,再用通道数翻倍的模型二次蒸馏。

    • 通过通道级与特征级对齐,在保持轻量化的同时提升模型泛化与鲁棒性。

  • 三、实验设计与结果

    • 数据集:自定义杂草数据集(9257张图像,8类),并引入ImageWeeds、VCD、Weed-Crop三个公开数据集验证泛化性。

    • 评估指标:准确率(Precision)、召回率(Recall)、F1分数、mAP、参数量、FLOPs、模型大小、FPS。

    • 主要结果:

      • 相比YOLO12-N:F1提升1.9%,mAP提升2.0%,参数量减少29.9%,模型大小减少17.0%,推理速度达66.2 FPS。

      • 相比YOLO13-N:F1提升1.6%,参数量减少28.2%,速度提升79.4%。

      • 在外部数据集上均表现出稳定的泛化性能与轻量化优势。

      • 消融实验验证了各模块的有效性,DS策略显著优于单阶段蒸馏。

    四、可视化与部署分析

    • 特征热图显示MIE-YOLO能更聚焦于杂草的关键结构(如叶缘、茎节)。

    • 有效感受野更广且集中,有助于结合全局上下文进行检测。

    • 移动端部署:在多个移动平台(如Snapdragon 8 Elite、Apple M4)上保持较高推理速度(29–37 FPS),显示出良好的边缘设备适配性。

    五、局限性

    • 在极端光照、严重遮挡、密集重叠场景下性能仍有提升空间。

    • 数据集中仅涵盖中国南方地区,泛化至其他地理区域需进一步适配。

    • 实际田间部署时可能受设备性能、环境动态变化影响。

    MIE-YOLO通过多尺度特征增强、边缘信息强化、轻量化结构设计与双重蒸馏策略,在保持高推理速度的同时显著提升了小目标杂草的检测精度与鲁棒性,为精准农业中的智能杂草防控提供了可行的轻量化解决方案。未来工作将聚焦于跨区域数据拓展、极端场景优化与硬件加速部署。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

    摘要

    随着精准农业对田间杂草实时检测与识别精度提出更高要求,本文提出一种用于精准农业的多尺度信息增强杂草检测算法——MIE-YOLO。基于当前流行的YOLO12模型,MIE-YOLO结合了边缘感知多尺度融合、加法门控块和两阶段自蒸馏技术,以提升小目标和边界检测能力,同时保持模型轻量化。首先,设计了MS-EIS架构,以有效聚合和选择不同尺度的边缘与纹理信息,增强细粒度特征表征。其次,提出了Add-CGLU金字塔网络,通过加法融合和门控机制增强多尺度特征的表征能力和信息传递效率。最后,引入了DEC检测头,以增强细节并细化小目标和模糊边界的定位。为进一步提升模型检测精度和泛化性能,定义了DS策略,在整个网络内执行双重自知识蒸馏。在包含9257张图像、涵盖八个杂草类别的自定义杂草数据集上的实验结果表明,MIE-YOLO将F1分数提升了1.9%,mAP提升了2.0%。此外,计算参数量减少了29.9%,FLOPs减少了6.9%,模型大小减少了17.0%,推理速度达到66.2 FPS。MIE-YOLO在保持一定推理效率的同时提高了杂草检测性能,为精准农业中的智能田间巡检和精准杂草控制提供了有效的技术路径和工程实现参考。

    1. 引言

    随着全球人口增长和农业现代化进程加速,精准农业技术作为提高作物产量、减少化学投入和实现可持续管理的重要手段受到广泛关注。在田间管理中,杂草具有空间分布复杂、种类多样且与作物形态相似的特点。

    传统的人工检查和通用图像处理方法已无法满足高精度、低成本和实时检测的要求[1]。因此,基于深度学习的视觉检测技术,特别是具有实时推理能力的轻量级单阶段目标检测器,已成为实现智能田间巡检和精准杂草控制的关键技术路径[2]。

    近年来,基于深度学习的目标检测方法在精准农业领域受到广泛关注。通过构建神经网络模型,可以实现图像中目标的定位和分类[3]。根据检测流程的不同,主流方法可分为两类:两阶段算法和单阶段算法[4]。两阶段算法包括RCNN[5]、SPPNet[6]、Fast RCNN[7]、Faster RCNN[8]和FPN[9]。单阶段算法包括YOLO[10]、SSD[11]、RetinaNet[12]、CornerNet[13]、CenterNet[14]和DETR[15]。两阶段算法首先生成候选区域,然后对每个区域进行精细分类和回归,实现高精度和灵活的扩展性。单阶段算法在单次前向传播中同时完成目标分类和回归,提供出色的实时性和易于部署性。

    作为单阶段目标检测领域的代表性方法,YOLO系列算法因其优异的检测速度和精度在许多领域得到广泛应用。继经典的YOLOv5、YOLOv8和YOLOv9[16]算法之后,YOLOv10[17]、YOLO11[18]、YOLO12[19]和YOLO13[20]算法相继发布,检测性能得到进一步提升。

    然而,对于精准农业,标准的YOLO模型在多尺度小目标检测方面往往表现不佳。小型杂草所占像素少,下采样会丢失关键的纹理和形状线索,导致漏检或合并检测。尺度变化、遮挡和植被密集进一步损害定位和分类,而诸如锚框和非极大值抑制等常见设计选择可能抑制真实的小目标预测。田间图像还会因光照、运动模糊和不同传感器引入域偏移,而嵌入式硬件的实时性约束又阻止了简单地扩大网络规模。因此,本文提出了一种致力于平衡运行速度和检测精度的多尺度信息增强杂草检测算法。本文的贡献总结如下:

    (1) 设计了一种新的MS-EIS架构,通过选择性聚合多尺度下的边缘和纹理信息,解决复杂背景下小目标和目标检测困难的问题,从而增强细粒度特征表征。

    (2) 提出了一种新的Add-CGLU金字塔网络,通过加法融合和门控机制提高特征的表征能力和信息传递效率,以处理多尺度变化,帮助网络更好地捕获复杂场景中的小目标。

    (3) 开发了一种新的DEC检测头,通过增强细节特征和细化空间定位,缓解小目标和模糊边界定位不精确的挑战,提高在杂乱或具有挑战性背景下的检测能力。

    (4) 定义了一种新的DS策略,通过在整个网络中执行双重自蒸馏,克服复杂场景下的泛化性能下降问题,进一步提高检测精度和鲁棒性,确保即使对于小目标或难以区分的目标也能保持可靠的性能。

    2. 相关工作

    计算机视觉的进步推动了目标检测算法在精准农业中的应用,包括定向杂草控制、病虫害监测和果实计数。基于深度学习的目标检测算法已逐步取代传统的手工特征提取方法,成为田间杂草检测的主流选择。许多研究,大多基于深度学习算法,旨在通过改进骨干网络、融入注意力模块和多尺度特征融合、扩展感受野和上下文信息以及优化轻量级后处理,来提高田间密集杂草检测的准确性和实时性。

    一些研究者改进了经典YOLOv5算法的准确性和精度,开创了模块融合方法。Deng等人[21]提出了一种基于改进YOLOv5网络的高效准确杂草检测模型HAD-YOLO。该算法使用HGNetv2作为骨干网络,引入了带有注意力机制的SSFF模块以提高模型特征提取能力。Wang等人[22]提出了一种基于增强YOLOv5的先进杂草检测器,结合了CBAM注意力模块、FasterNet特征提取网络和损失函数来优化网络结构和训练策略。Tao和Wei[23]提出了一种基于改进YOLOv5的油菜田杂草检测网络STBNAYOLOv5,通过Swin Transformer增强特征提取能力,使用BiFPN融合NAM以利用特征信息。Zhang等人[24]提出了一种基于轻量化和上下文信息融合的杂草检测方法CCCS-YOLO,通过集成Faster Block、上下文聚合模块和CARAF来促进上下文信息融合。

    一些研究者还基于流行的YOLOv8算法进行了轻量化改进,在实时性能优化方面取得了一些进展。Hu等人[25]提出了一种基于YOLOv8的轻量高精精准农业棉田杂草识别模型CW-YOLO。该网络引入了结合视觉Transformer和卷积神经网络的双分支结构,并提出了RFE模块以降低计算复杂度和参数量。Chen等人[26]提出了一种基于YOLOv8的稻田杂草检测算法GE-YOLO,引入了具有特征聚合的分布网络和EMA机制,以增强网络融合多尺度特征和检测不同大小杂草的能力。Zheng等人[27]提出了一种基于优化YOLOv8的棉田杂草识别算法YOLOv8-DMAS,通过DWR模块和ASFF机制提高了密集杂草检测的精度。Shuai等人[28]提出了一种基于改进YOLOv8的豆田实时杂草检测模型YOLO-SW,引入Swin Transformer骨干网络以实现高效的全局上下文捕获。

    此外,一些研究者在基于CNN的网络架构设计方面取得了最新进展,提高了精准农业领域目标检测的效率。Umar等人[29]提出了一种基于深度学习的薰衣草分类方法,以增强种植和精油质量管理。该模型通过迁移学习、学习率调整和批次优化进行微调。在基线模型中添加了额外层以提高分类性能并减少训练时间。Gulzar[30]对基于预训练深度学习模型的木瓜叶病害分类进行了比较研究,评估了四个预训练卷积神经网络。他还提出了一种AI驱动的木瓜叶病害早期检测和分类方法,PapNet[31],该方法利用了先进的架构特性,包括全局平均池化、密集层以及批归一化和dropout的策略性使用,在区分各种木瓜叶状况方面表现出卓越性能。Han等人[32]提出了一种基于增强遥感图像的椰子病害精准农业分割技术。他们使用预训练的CNN开发了一个鲁棒的病害分割模型,可以改善椰子栽培中的病害管理。

    尽管基于YOLO的杂草检测发展迅速,但现有方法仍面临重要限制。基于YOLOv5的模型,如HAD-YOLO和STBNA-YOLOv5,通过注意力模块或Transformer改进特征提取,但通常会增加计算成本,并在资源有限的田间场景中表现不佳。基于YOLOv8的模型,包括CW-YOLO和GE-YOLO,实现了更轻的设计和多尺度融合,但在检测复杂背景中的小型、密集或重叠杂草方面仍有困难。相比之下,本文提出的方法引入了多尺度、细节增强和蒸馏引导的框架,聚合边缘和纹理信息,改进多尺度特征融合,并利用双重自知识蒸馏。这种方法增强了对小型和密集杂草的检测能力,提高了在杂乱环境中的鲁棒性,并在准确性和实时性能之间保持了先前基于YOLO的方法未能完全实现的平衡。

    3. 方法

    3.1. 总体网络结构

    基于YOLO12-N模型,本文独立设计了MS-EIS架构、Add-CGLU金字塔网络和DEC检测头。最后,结合DS策略对整体结构进行知识蒸馏,得到了所提出的MIE-YOLO。其总体网络结构如图1所示。

    图 1. MIE-YOLO 整体网络结构。 

    3.2. 多尺度边缘信息选择架构

    原始的YOLO12框架由三个基本组件构成:骨干网络、颈部和头部,每个组件实现不同的功能。YOLO12的骨干网络是负责特征提取的核心组件。通过多层卷积操作和模块化结构,将输入图像逐层转换为多尺度特征图,用于后续检测任务。该子模块堆栈包括C3k2模块和A2C2f模块,用于提取包含丰富语义信息的多尺度特征。

    与先前版本相比,YOLO12引入了C3k2模块和A2C2f模块,取代了前代使用的C2f模块。C3k2模块使用两个小核卷积代替一个大核卷积,旨在同时保留特征的全局和局部信息。A2C2f模块保持了较大的感受野,旨在以简单方式减少注意力的计算复杂度从而提高速度。然而,这些模块仍包含大量瓶颈结构,可能导致梯度消失和特征冗余,削弱全局感受野的覆盖。

    为解决这些挑战,重新设计了骨干架构中的C3k2和A2C2f模块。具体而言,开发了一个新的EE模块,并融入了Cui等人[33]提出的DSM,提出了新的MS-EIS架构来取代C3k2和A2C2f模块中的瓶颈结构。MS-EIS架构的结构如图2所示。

    图 2. 多尺度边缘信息选择架构。

    MS-EIS用一个集成模块取代了YOLO12骨干中使用的简单瓶颈,该模块超越了原始的DSM,它将原理性的多尺度池化与可学习的尺度权重、基于拉普拉斯滤波并由高斯去噪平衡的显式边缘增强路径,以及高效的深度可分离卷积预处理阶段相结合,并通过目标注意力方案进行融合。与简单引用原始DSM相比,MS-EIS更具规定性和可复现性,因为它指定了具体的算子和超参数,引入了DSM所缺乏的显式信号处理风格的边缘路径,并且用少量增加的结构换取边界和小目标敏感性的显著提升,同时保持较低的计算开销。

    边缘信息是区分杂草与作物的一致且具有判别性的线索,尤其是在早期生长阶段,当颜色和纹理信号较弱且植物实例较小时,叶片轮廓、边缘和叶脉定义的边缘成为区分物种的最可靠特征。边缘编码了对光照变化和颜色相似性不敏感的形状和边界几何信息,为微小和部分遮挡的植物提供了强有力的定位锚点,并通过揭示独立的对象轮廓帮助区分重叠实例。MS-EIS将边缘线索视为一级信号而非附带特征,因此它通过拉普拉斯路径显式提取高频内容,然后用高斯去噪稳定该信号,同时多尺度池化和可学习的尺度权重使模块能够强调对于给定场景或生长阶段最相关的边缘尺度。这与常见的注意力模块(如CBAM)不同,后者在现有特征图上重新加权通道和空间位置,但并未创建专用的、信号处理风格的边缘通道;它也不同于简单的Sobel融合,后者注入固定的单尺度梯度,会放大噪声且无法适应尺度、模糊或成像条件。通过结合原理性滤波、自适应尺度加权和高效的深度可分离预处理,MS-EIS放大了真实边界线索,同时抑制噪声并保持低计算量,与通用注意力或朴素的固定边缘融合相比,在杂乱的农业场景中产生了更清晰的边界、更好的小目标定位和更强的鲁棒性。

    MS-EIS是一个针对目标检测、分割和特征提取任务优化的深度学习特征增强模块。其主要目标是通过多尺度特征融合和边缘信息增强来提高模型在复杂场景中的目标检测能力。该架构结合了多尺度特征提取、边缘信息增强、深度卷积操作和双区域聚焦注意力机制,以优化特征提取的有效性和鲁棒性。MS-EIS架构中的核心概念是利用多尺度平均池化和自适应卷积来提取不同层次的特征信息,结合边缘增强模块进行特征对比和补充,最终通过双区域选择机制实现高效的特征融合。这一过程使MS-EIS能够同时捕获局部细节和全局上下文信息,在降低计算成本的同时提高检测精度。

    具体而言,首先使用四个并行的AAP模块进行多尺度自适应平均池化,提取不同尺度的特征信息。然后结合卷积操作获得丰富的语义信息。其核心思想是利用不同尺度的池化操作来捕获具有不同感受野的全局和局部信息。假设输入特征 X,输入特征图可表示如下:

    其中 Pooling 表示尺度为 i 的自适应池化操作。通过不同尺度的池化操作,提取特征图的不同分辨率版本,使得网络可以同时关注大目标、中等目标和小目标。Conv 表示第 i 级的卷积操作。第一个空间维度为1的卷积用于降维并增强通道间的信息交互,为后续卷积操作提供更有效的输入。第二个空间维度为3的卷积进一步提取局部特征,提高边缘和小目标的检测能力。σ 表示归一化和非线性激活操作,通过相应的激活函数对特征进行变换,使其更具表达力。Upsample 表示上采样操作,用于恢复输入特征的大小。

    EE模块是MS-EIS架构中的关键组件。其主要功能是解决传统瓶颈架构无法提取边缘信息的问题,并提高识别目标边缘轮廓的能力。EE模块的核心概念是使用高斯滤波和拉普拉斯算子提取边缘信息,然后通过卷积融合特征图。在此步骤中,首先计算边缘信息:

    总体而言,EE模块提取边缘信息,增强了网络对边缘的敏感性。这对于目标检测和语义分割等视觉任务至关重要。然后,Concat模块对不同尺度提取的特征进行插值,将它们对齐到同一尺度并进行拼接。最后,标准卷积层将这些特征融合成统一的特征表示,提高了模型对多尺度特征的感知能力。

    最后,所有特征都被送入DSM。这种注意力机制旨在从多尺度边缘信息中高效选择与目标任务高度相关的关键特征。通过聚焦于图像中更重要的区域,如复杂的边缘和高频信号,该机制自适应地从多尺度特征中选择具有更高任务相关性的特征,显著提高特征选择的准确性和整体模型性能。图3显示了DSM中各子模块的详细结构。

    图 3. 双域选择机制子模块。 

    DSM模块通过在通道域和空间域中选择最重要的特征来解决特征冗余问题,从而提高检测精度。首先,使用两个深度可分离卷积来降低计算复杂度,同时增强特征表示。深度可分离卷积将标准卷积分解为深度卷积和逐点卷积,大大减少了计算量。然后,使用通道注意力和空间注意力来增强特征表示。具体来说,通道注意力计算如下:

    其中 Output 表示 MS-EIS 架构的特征输出。标准卷积层作为最终的特征映射单元,它优化了跨通道信息融合,使多尺度特征提取和双区域信息选择能够协同工作,并提高了目标检测的准确性和鲁棒性。

    总体而言,MS-EIS具有高效的多尺度信息整合能力。其核心组件包括自适应平均池化、边缘增强模块和双区域信息选择机制,它们协同工作以提高目标检测性能。首先,MS-EIS使用AAP结合卷积操作来增强对不同尺度目标的感知,提高检测的尺度适应性。其次,EE模块通过边缘信息增强优化目标轮廓特征,使目标在复杂背景中更突出,从而提高目标检测的鲁棒性。同时,DSM结合了通道注意力和空间注意力,过滤通道域和空间域中的关键特征,有效减少冗余信息,进一步提高检测精度。

    此外,MS-EIS采用轻量级的池化和注意力加权机制进行高效的信息筛选和融合,在确保高精度的同时也平衡了计算效率,使其适用于实时任务。具体针对小目标检测,空间注意力增强了目标边缘信息,EE模块强化了目标轮廓,多尺度特征提取进一步增强了小目标的显著性和检测能力。总体而言,MS-EIS架构通过多尺度特征提取、边缘信息增强和双区域信息选择的协同优化,实现了高效准确的目标检测。

    3.3. 加法卷积门控线性单元金字塔网络

    原始YOLO12的颈部位于骨干网络和头部之间。其主要功能是融合和增强骨干网络提取的多尺度特征,并将其传递给头部进行预测。特征金字塔结构结合上采样和跨尺度连接,实现对多尺度目标的自适应检测,同时兼顾全局上下文和局部细节。尽管颈部在一定程度上简化了计算复杂度,但上采样过程可能导致细节丢失或定位精度下降,特别是在检测小目标或边界模糊的目标时。同时,多尺度特征拼接容易引入信息冗余,干扰有效特征的表达,增加误检或漏检的可能性。此外,深层特征可能覆盖浅层特征的局部细节,削弱了对小目标的捕获能力。

    为确保实时目标检测并提高精度,设计了一种新的Add-CGLU金字塔网络来优化颈部部分。该架构借鉴了Zhang等人[34]提出的CAS-ViT结构,用加法块取代了堆叠的瓶颈结构。新的Add-CGLU金字塔网络的设计借鉴了Shi[35]提出的卷积GLU框架。Add-CGLU金字塔网络的结构如图4所示。

    图 4. 加法卷积门控线性单元金字塔网络。

    Add-CGLU金字塔用加法块取代了堆叠的瓶颈,这些加法块结合了三个协调组件:一个通过标准卷积、批归一化和GELU保留浅层空间细节的局部感知阶段;一个使用加法注意力方案捕获全局上下文以避免传统自注意力二次成本的卷积加法令牌混合器;以及一个将深度卷积与门控路径融合以进行高效特征过滤的卷积门控线性单元。交替的加法块和图像块分割赋予颈部可扩展的多尺度融合模式,而干和池化头部保持集成简单。与CAS-ViT和平滑的GLU相比,这种设计更以卷积为中心,计算效率更高,并且在算子和超参数方面更具规范性;它在捕获全局上下文的同时更好地保留了局部细节,减少了注意力开销,并且更容易为实时和小目标检测进行复现和部署。

    尽管门控机制(如门控线性单元)已在Transformer和CNN架构中被广泛采用以调节信息流,但本文提出的加法融合与门控的结合代表了一种独特的结构创新,而非现有组件的简单应用。在此设计中,加法融合以互补的方式在门控操作之前整合多个特征流,门控操作则有选择地过滤和强调信息丰富的模式。与通常依赖线性求和或恒等捷径而无自适应特征加权的传统卷积层或标准残差块相比,这种顺序协调实现了更精确的特征调制。因此,该网络实现了更高的计算效率,因为加法融合减少了冗余计算并缓解了与传统自注意力相关的二次复杂度,而门控机制确保只有显著的特征向前传播。从经验上看,这种协同作用改善了细粒度局部细节的表征,并加强了全局上下文建模,从而带来更好的检测性能,特别是对于小目标和实时场景,且不增加模型的参数或推理开销。

    在Add-CGLU金字塔网络中,干模块位于初始输入阶段,负责将原始输入转换为适当的特征表示。交替的加法块和图像块分割模块将特征图划分为多个小块,而分类检测头部对最终特征进行全局池化并输出分类结果。

    加法块是Add-CGLU架构中的核心模块,包括LP机制、CATM和CGLU。LP机制利用局部整合从输入特征中提取局部空间信息,克服了标准卷积层的感受野限制。使用三个标准卷积层、一个批归一化层和一个非线性激活函数GELU对输入特征进行初步处理。假设 x1​ 是输入特征,使用LP机制提取局部空间特征的过程可表示如下:

    输入特征经过CATM增强后,再由CGLU处理。CGLU将深度卷积与门控机制相结合,实现高效的特征过滤和空间感知。由批归一化层、标准卷积层和GELU激活函数组成的双分支结构处理空间信息,增强了模型捕获细粒度特征的能力。CGLU模块的最终输出是两个分支结果的逐元素乘法:

    其中 Wb1 和 Wb2​ 分别对应每个分支的权重。CGLU基于最近邻图像特征融合的通道注意力机制,以更少的计算参数实现了通道混合器的注意力,从而增强了模型的鲁棒性。

    3.4. 细节增强卷积检测头

    原始YOLO12的头部是整个网络结构的最后阶段,负责生成目标检测和分类的最终预测。其核心任务是处理从颈部传递来的特征图,最终输出图像中物体的边界框和类别标签。YOLO12的头部通过进一步的卷积操作和优化模块来细化特征,采用C3k2模块来提高计算效率和特征表示能力。它还融入了CBS来增强模型的稳定性和非线性表示能力。

    然而,原始头部也存在一些缺点。例如,对于小目标定位精度较低,可能是由于上采样或特征融合过程中的细节丢失,导致边界框预测不准确。在密集场景中也容易受到背景干扰,增加了误检或漏检的风险。此外,高分辨率输入的计算开销较大,限制了其在极端实时场景中的适用性。为了解决这些挑战,对原始的YOLO12头部框架进行了重新优化,并提出了一种新的DEC检测头。DEC检测头的结构如图5所示。

    图 5. 细节增强卷积检测头。

    DEC检测头的设计目标是通过共享的特征增强模块提高细粒度特征提取能力,旨在优化复杂场景中小目标的检测效率。DE Conv是DEC检测头的核心组件,由Chen等人[36]在DEA-Net中首次提出。通过增强输入特征,更好地保留细节信息。在特征融合阶段,DE Conv在不同特征尺度上共享权重信息,增强了特征一致性并降低了计算成本。

    具体而言,DE Conv结合了标准卷积的特征提取能力和细节增强的归一化策略。它使用GN层对特征进行分组和归一化,减少了小批量训练中统计噪声的影响,避免了BN在小批量训练时的不稳定性。DE Conv首先对输入特征 x3​ 进行降维并提取空间特征:

    其中 L 表示分类和回归损失,λ 是对应的权重超参数。此外,Reg Conv中的共享参数需要考虑目标尺度不一致的影响,因此通过缩放层对特征进行缩放。缩放操作也是共享的,允许回归输出进行调整以适应不同尺度的目标。

    在DEC检测头中,通过使用空洞卷积和内容自适应滤波器选择进一步优化了细节增强卷积模块。具体而言,空洞卷积在不增加参数数量的情况下扩展了感受野,使网络能够捕获小目标周围更广泛的上下文信息,同时保留细粒度的局部特征。同时,DE Conv根据内容引导的注意力图动态调整其卷积核,使网络能够聚焦于信息密度高的区域,如边缘、角落或模糊的对象边界。这种结合确保即使小目标或部分遮挡的目标也能获得增强的特征表示。此外,DE Conv在每个加法块内部使用一组多尺度滤波器,这些滤波器通过空间和通道注意力机制进行自适应加权,使头部能够选择性地放大相关特征,同时抑制背景噪声。通过整合这些机制,DEC检测头改进了小目标和模糊边界的定位,因为动态生成的核强调了关键的空间线索和依赖于上下文的特征变化,减少了边界框预测中的错位,提高了在密集或杂乱场景中的精度和召回率。

    3.5. 双重自知识蒸馏策略

    总体而言,DEC检测头通过动态感受野生成和内容引导注意力实现了特征图的细粒度增强。其核心是结合动态通道权重和空间权重来生成高度自适应的卷积核,以捕获目标的局部细节和全局上下文信息。通过多尺度特征融合和精细处理,在确保复杂场景中准确预测目标类别和边界的同时,有效提高了小目标检测能力。

    3.5. 双重自知识蒸馏策略

    本文旨在消除所有轻量化改进对精度的影响,并对模型进行知识蒸馏。该方法最早由Hinton等人[37]提出并应用于分类任务。其原理基于模型之间的知识转移和迁移。知识蒸馏通常通过从大型教师模型转移的额外监督来训练一个轻量级学生模型。教师模型是一个复杂且精确的模型,通常具有大量参数和复杂的结构。它通过在训练期间学习大量数据来拟合目标任务,以提供高精度的预测结果。学生模型是一个简化的模型,通常参数较少、结构简化。目标是提炼教师模型的知识,学习教师模型的预测行为,以在降低模型复杂性的同时保持高性能。

    基于知识蒸馏的方法大致可分为特征蒸馏和逻辑蒸馏,各自关注不同层次的信息传递。逻辑蒸馏主要关注教师模型的最终输出和类别概率分布,通过模仿这些概率来优化学生模型的决策。然而,由于逻辑蒸馏仅利用教师模型的最终预测而忽略了模型的内部特征表达能力,这种方法在某些情况下可能无法充分利用教师模型的优势,特别是当学生模型容量较小时,难以完全复制教师模型的学习能力。

    相比之下,特征蒸馏侧重于教师和学生模型之间中间层特征的一致性,使学生模型能够直接学习教师模型的深度特征表示,而不仅仅是最终的类别输出。具体而言,特征蒸馏通过对齐特征图或引导学生模型学习教师模型的注意力分布等方法,使学生模型的特征更接近教师模型。这使得学生模型能够更好地捕获数据的关键特征,从而提高表征能力和泛化性能。由于特征蒸馏比逻辑蒸馏提供了更丰富的信息,因此在需要深度特征表示的任务中尤为重要,如目标检测和图像分割。

    与逻辑蒸馏相比,特征蒸馏的优势在于不仅提高了学生模型的最终预测,还增强了其在不同层次的特征学习能力,使其能够在参数较少的情况下保持强大的特征提取能力。这种方法特别适合训练轻量级模型,有效弥补因模型容量不足导致的性能损失,使小型模型能够以较低的计算成本接近大型模型的性能。因此,在特征学习要求高的任务中,如计算机视觉,特征蒸馏已成为提高模型性能的重要手段,并广泛用于模型优化过程。

    基于特征蒸馏的原理,Shu等人[38]提出了一种通道知识蒸馏方法。基于此原理,本文提出了一种新的DS蒸馏策略。具体而言,将使用YOLO12-N训练的模型定义为学生模型,将使用YOLO12-S训练的模型定义为第一次知识蒸馏的教师模型。随后,将得到的模型再次定义为学生模型,并将这个通道数翻倍的学生模型定义为第二次知识蒸馏的教师模型。

    双重自知识蒸馏策略使用两轮连续的蒸馏,每轮都结合了双路径监督。在第一轮中,一个容量更大的YOLO12-S教师指导一个紧凑的YOLO12-N学生,以塑造鲁棒的通道响应和粗略的注意力模式。在该轮之后,得到的学生再次从一个通道数翻倍的放大兄弟模型中进行蒸馏,在不改变学生推理图的情况下,暴露更丰富、更高阶的特征组合。每轮共同优化原始检测目标以及逻辑级蒸馏、中间特征对齐和通道级对齐损失。在实践中,第一轮强调通道级对齐以建立稳定的显著性,而第二轮则更重视特征对齐以利用放大教师更精细的构成。这种渐进式、双路径的设计缩小了师生容量差距,稳定了训练,让学生首先学习粗略的显著性,然后吸收更精细的模式,在不增加推理成本的情况下改善小目标定位和边界清晰度。

    与单阶段蒸馏相比,所提出的两阶段方法减小了教师和学生之间的容量差距,并产生了更有效和稳定的监督。在第一阶段,一个强大但现实的教师为轻量级学生塑造了鲁棒的通道响应和注意力模式,这比一步到位地模仿一个非常大的模型更容易学习。在第二阶段,学生受益于一个容量更大的教师,它暴露了更丰富、细粒度的特征组合和更高阶的通道关系,有效地提炼和扩展了学生表示,而不改变其推理成本。这种渐进式学习策略产生了更平滑的优化、更快的收敛和更好的泛化,同时也起到了正则化的作用,减少了过拟合,提高了在不同田间条件下的杂草检测稳定性。

    4. 实验

    4.1. 杂草数据集

    本文训练的所有模型均基于自定义的杂草数据集,该数据集用于精准农业中的实时田间杂草识别和定向喷洒。杂草数据集包含9257张图像,全部采集自中国南方典型的杂草生境,主要覆盖广东和福建省的路边、田边、山坡草地和荒地等开阔或半开阔区域,以确保样本的多样性和代表性。数据集中原始图像和标注的可视示例如图6所示。

    图 6. 原始图像及标注的可视示例。 

    对样本图像的视觉检查显示,许多帧具有高实例密度,单个植物经常重叠或部分遮挡。一些类别在叶片形状、大小和颜色上表现出较大的类内差异,而其他类别则具有非常相似的视觉外观,增加了类间混淆的风险。背景高度异质,混合了土壤、草丛、枯叶和碎片,引入了纹理噪声并降低了杂草与周围环境的对比度。图像间的采集条件差异很大,包括拍摄距离、视角、光照以及偶尔的运动模糊,产生了显著的尺度和外观变化。

    训练集和验证集按9:1的比例划分,训练集共8331张图像,验证集926张图像。杂草数据集的标注类别包括哮喘草、鬼针草、马唐草、狗舌草、羊蹄草、哈贡草、香附子草和形状草。每个类别的具体图像数量如图7所示。

    杂草数据集仅涵盖中国南方,这可能限制在其上训练的模型对其他地区的泛化能力。物种组成、背景纹理、土壤、光照、季节性生长阶段和相机设置等方面的差异会造成系统性偏移,从而降低模型在其他地方应用时的性能。为了帮助评估泛化能力,我们补充了在法国和美国北达科他州收集的外部数据集的实验。减少地理偏差将需要在部署模型到新区域之前,进行更广泛的采样、有针对性的数据增强和域自适应微调。

    图 7. 类别图像数量统计图。

    4.2. 训练参数

    本文提出的模型基于YOLO12-N,从头开始训练300个周期,未使用预训练权重。对于所有后续实验,输入图像分辨率为640像素,批大小为16,工作线程数为8。实验平台基于Windows 11操作系统,配备AMD Ryzen 9 5900HX CPU(64 GB内存)和NVIDIA GeForce RTX 3080 GPU(16 GB显存)。使用的深度学习框架为Torch 2.2.2 + cu121,torchvision 0.17.2+cu121,CUDA 12.1.105和cuDNN 8.9.7.29。

    4.3. 评估指标

    本文使用常见的评估指标来评估MIE-YOLO在精准农业中的杂草检测性能,兼顾准确性和速度。这种划分旨在同时关注准确性和速度,以便全面评估检测结果,并突出模型的优缺点。

    精度指标主要关注模型的检测准确性和完整性,包括精确率、召回率、F1分数和mAP。这些指标直接衡量模型的准确性和全面性,是评估其在杂草检测任务中性能的关键。精确率、召回率和F1分数的计算公式如下:

    其中标准FPS值是总时间的倒数,总时间是图像预处理、模型推理和后处理时间的总和。

    5. 讨论

    5.1. 模型对比实验分析

    为了全面评估MIE-YOLO的性能,将其与其他经典目标检测算法进行比较。所有模型均从头开始训练,不使用预训练权重,并在AMD Ryzen 9 5900HX CPU和NVIDIA GeForce RTX 3080 GPU上进行测试。模型对比实验结果如表1所示,表中包括精确率、召回率、F1分数、mAP、参数量、FLOPs、模型大小和FPS等评估指标。

    表1. 模型对比实验结果。

    MIE-YOLO使用YOLO12-N算法作为基准模型。比较的算法包括YOLOv5-N、YOLOv8-N、YOLOv10-N、YOLO11-N、YOLO12-N、YOLO13-N、RT-DETRv2-S和Deformable-DETR。

    实验结果表明,MIE-YOLO取得了 89.3% 的F1分数和 94.4% 的mAP。此外,MIE-YOLO仅需 1.76M 的计算参数量,5.4G 的FLOPs,模型大小为 4.34M,同时以高达 66.2FPS 的速度运行。图8显示了MIE-YOLO的训练结果,包括归一化混淆矩阵和精确率-召回率曲线。

    图 8. MIE-YOLO训练结果:(a) 归一化混淆矩阵,(b) PR曲线。

    5.2. 模块消融实验分析

    为了充分验证MIE-YOLO中每个模块的贡献,使用YOLO12-N作为基线模型对所有改进部分进行了消融实验。具体而言,我们将MS-EIS架构、Add-CGLU金字塔网络和DEC检测头添加到YOLO12-N,并结合DS策略对整体架构进行知识蒸馏。通过对工作原理的详细讨论展示了模型的优势。模块消融实验结果如表2所示,其中模块A代表基线YOLO12-N,模块B代表MS-EIS架构,模块C代表Add-CGLU金字塔网络,模块D代表DEC检测头,模块E代表普通单蒸馏策略,模块F代表DS知识蒸馏策略。

    表2. 模块消融实验结果。

    首先,在YOLO12-N基线中引入MS-EIS架构。与基线相比,mAP提高了 0.7%,计算参数量减少了 19.9%,FLOPs减少了 5.2%,模型大小减少了 12.6%,对F1分数的影响可忽略不计。这表明MS-EIS架构通过多尺度特征提取、边缘信息增强、深度卷积操作和双区域聚焦注意力优化了模型的特征表示和任务适应性。

    然后,在YOLO12-N基线中集成了Add-CGLU金字塔网络。虽然与原始模型相比,FLOPs和模型大小略有增加,但F1分数和mAP值分别提高了 2.4% 和 1.9%。增加的计算成本来自改善多尺度表征的局部感知、加法令牌混合和门控卷积操作,因此这种权衡是用FLOPs和内存占用的小幅上升换取显著更好的检测精度。这使得当资源使用的小幅增加对于获得表征能力和信息传递效率的提升是可接受的时候,Add-CGLU具有吸引力。这表明Add-CGLU金字塔网络通过加法融合和门控机制提高了多尺度特征的表征能力和信息传递效率。

    接下来,在YOLO12-N基线中替换了DEC检测头。这使得F1分数提高了 1.8%,mAP提高了 1.6%。同时,计算参数量减少了 12.7%,FLOPs减少了 5.2%,模型大小减少了 5.4%。DEC检测头在提高准确性的同时减少了参数和FLOPs,其方法是将表征能力集中在关键位置,并用更轻量的自适应操作和共享参数替代一些沉重的静态卷积。这些变化减少了冗余权重并降低了计算成本,这通常会减少内存使用,并可以在许多设备上加速推理。这表明DEC检测头通过细粒度特征增强、动态自适应卷积和共享参数设计有效降低了计算成本和参数量。

    最后,对集成了所有模块改进的模型使用DS策略进行知识蒸馏。值得注意的是,模型的轻量化特性并未受损,且F1分数和mAP值分别提高了 0.1% 和 1.1%。这表明DS策略在保持轻量化的同时,进一步提高了模型的检测精度和泛化性能。

    通过关注消融实验的最后三行,可以明显看出单阶段蒸馏与本文提出的双重自知识蒸馏之间的差异。单阶段蒸馏将精确率从 91.0% 提高到 92.1%,mAP从 93.3% 略微提高到 93.6%,同时F1保持在 89.2%8不变,召回率小幅下降至 86.4%8。DS策略带来了更大的增益,将精确率推至 94.5%,mAP推至 94.4%,F1略微增加至 89.3%,同时保持了模型的轻量化,参数量为1.76 M,FLOPs为5.4 G,模型大小为4.34 M。这些结果表明,与单阶段蒸馏相比,DS产生了更强、更具判别性的通道级监督,从而锐化了决策边界并减少了误报,因此精确率和mAP有了大幅提升。

    消融实验证明了轻量化改进和定制的双重自知识蒸馏策略的有效性。MIE-YOLO成功地在精准农业实时田间杂草识别和定向喷洒任务中实现了准确性和实时性之间的良好平衡。

    5.3. 模型泛化实验分析

    为了广泛探索MIE-YOLO的鲁棒性,在ImageWeeds[41]、VCD[42]和WeedCrop[43]公共数据集上进行了模型泛化实验。ImageWeeds数据集包含3975张图像,展示了美国北达科他州常见的五种不同杂草。类别包括豚草、水麻、加拿大飞蓬、红根苋和地肤。VCD数据集包含2801张图像,描绘了美国北达科他州各种作物的土壤条件、杂草侵染和生长阶段。类别包括豆类、豆茎、玉米、玉米茎、韭菜和韭菜茎。

    Weed-Crop数据集包含1120张图像,展示了美国北达科他州的五种杂草和八种作物。类别包括黑豆、油菜、玉米、豌豆、亚麻、加拿大飞蓬、地肤、扁豆、豚草、红根苋、大豆、甜菜和水麻。三个数据集的对应样本图像如图9所示。

    图 9. 三个数据集的对应样本。 

    这些图像揭示了一些影响检测难度的分布特征。许多照片包含多个密集分布的实例,经常重叠和部分遮挡,这增加了漏检率并使精确的边界框回归更加困难。很大一部分目标相对于图像尺寸较小,导致微小边界框高度集中,目标尺度变化很大。一些类别在形状和颜色上表现出较高的类内变异性,而其他类别在视觉上彼此相似,增加了类间混淆的机会。背景高度杂乱,混合了各种纹理和碎片,这降低了信号对比度,并使边缘或纹理线索的可靠性下降。

    ImageWeeds数据集包含分辨率小于640的图像,而VCD和Weed-Crop数据集包含分辨率大于640的图像。因此,泛化实验也可以验证MIE-YOLO在640以上分辨率下的性能。MIE-YOLO和基线模型在各数据集上的评估指标对比结果如表3所示。

    表3. 模型泛化实验结果。

    在ImageWeeds数据集上,MIE-YOLO的F1分数提高了 1.6%,mAP提高了 0.2%。在VCD数据集上,F1分数提高了 0.7%,mAP提高了 0.5%。在Weed-Crop数据集上,F1分数提高了 0.2%,mAP提高了 1.3%。此外,MIE-YOLO在三个数据集上的轻量化特性均有所改善,计算参数量减少了 29.9%,FLOPs减少了 6.9%,模型大小减少16.9%。实验结果表明,MIE-YOLO表现出优异的泛化能力,在保持低计算成本和紧凑架构的同时,优化了检测准确性和鲁棒性。

    这些结果也从更广泛的意义上反映了所提出方法的鲁棒性。尽管相对于外部基准的精度提升较为有限,但这些改进在三个具有非常不同场景特征的数据集上是一致的,这表明MIE-YOLO能够很好地适应成像条件、目标密度和背景杂乱程度的变化。更重要的是,所有关键的轻量化指标都显示出较大的提升幅度,这意味着模型在显著降低计算负担的同时保持或略微提高了准确性。这种平衡表明该架构不仅仅针对单一数据集进行调优,而且在结构上更高效,更不易过拟合,使其即使计算、内存或部署约束收紧时也能保持性能。在实际需要嵌入式设备或实时系统的田间应用中,这种稳定的准确性与显著降低的复杂性的结合,比那些依赖更重架构来实现更高准确性的方法表现出更强的鲁棒性。

    图10显示了YOLO12和MIE-YOLO在三个数据集上的典型失败案例,极端场景包括黑暗、遮挡和光照变化。对比图像显示,在具有挑战性的条件下,MIE-YOLO产生了明显更高的置信度分数、更紧密的定位和更完整的检测。例如,一个YOLO12标记置信度约为0.41的马齿苋实例,被MIE-YOLO以约0.85的更高置信度检测到,并且许多被YOLO12漏检或仅微弱激活的小型植物在MIE-YOLO的输出中显示为清晰的高置信度边界框。在黑暗、严重遮挡和变化光照下,右侧结果显示出围绕叶片边缘和茎干更密集、对齐更好的边界框,而左侧结果包含更多分散的低置信度框和一些漏检目标。简而言之,MIE-YOLO识别出更多目标,为正确的检测分配了更高的概率,并在背景区域产生更少的虚假激活。

    图 10. 泛化数据集上的典型失败案例。 

    这些改进在实践中具有重要意义,因为更高的置信度和改进的定位减少了漏检和误报,从而降低了精准农业中无效喷洒或不必要处理的风险。视觉证据还表明MIE-YOLO对田间数据中常见的噪声条件更具鲁棒性,在基线检测器性能下降的情况下保持检测质量。这种鲁棒性支持了部署中更可靠的下游决策,尤其是在嵌入式平台上,模型的紧凑性和一致的输出质量至关重要。

    5.4. 模型可视化结果分析

    为了直接展示MIE-YOLO的透明度和清晰度,对模型的检测性能进行了可视化。可视化结果包括FH和ERF,如图11所示。FH将基于目标梯度的中间特征或响应投影回输入图像,并以归一化热图的形式显示,直观地揭示了模型对不同空间区域的响应强度。ERF则代表输出单元对输入像素的实际贡献分布。它通常是中心化的、近似高斯的,并且小于理论感受野。它量化了模型聚合上下文信息的有效尺度。

    图 11. MIE-YOLO可视化结果:(a) 特征热图,(b) 有效感受野。

    在FH可视化中,MIE-YOLO在多个杂草样本上显示出一致的高响应区域。这些高响应通常与叶片边缘、茎节或植物的典型纹理特征对齐,而不是背景杂草或土壤纹理,这表明尽管存在复杂的遮挡和背景干扰,模型仍能实现更准确的空间注意力。与传统检测器相比,热图中的高响应块更集中,边界更清晰,背景虚假激活显著减少。这反映了MIE-YOLO在类别判断和局部特征增强方面的鲁棒性,有利于提高纹理近似杂草的检出率。

    在ERF可视化中,MIE-YOLO的有效感受野显示出比YOLO12更大的响应分布,并且仍然具有显著的集中中心,表明网络在保持定位精度的同时,能够收集更广泛的上下文信息以支持语义推理。这种更平衡的空间权重分布有助于利用周围环境线索来区分具有显著尺度和形态差异的杂草,从而提高检测稳定性和召回率。

    总之,FH和ERF的可视化展示了MIEYOLO在聚焦于显著目标特征和扩展有效感受野以兼顾局部细节和全局上下文方面的优势。MIE-YOLO在特征注意力和空间感知之间实现了更好的平衡,在复杂多变的环境中展示了检测的鲁棒性和泛化能力。

    尽管具有这些优势,但在实际农业环境中部署MIE-YOLO时,仍存在一些实际的限制因素。环境变异性是主要挑战之一。强光、云层或作物阴影引起的光照变化会引入剧烈的强度波动,从而降低特征稳定性;而风引起的植物运动导致变形和模糊,难以完全建模。土壤背景差异、植物颜色的季节性变化以及杂草生长阶段的变化也可能产生超出训练数据范围的域间隙。当条件偏离训练期间所见情况时,这些因素会削弱特征一致性并降低预测的可靠性。

    此外,设备集成限制会显著影响实际性能。移动农业平台通常依赖低功耗嵌入式处理器,与实验室设置相比,热限制、电池容量和带宽限制可能会降低可实现的推理速度。动态范围较低的相机传感器或可变的安装角度可能进一步扭曲特征分布,而田间机械的振动会降低图像质量和时间一致性。这些限制表明,尽管MIE-YOLO在受控评估中表现出强大的鲁棒性和泛化能力,但仍需要额外的适应策略,如动态曝光调整、时间稳定性或域自适应微调,以确保在大规模农业部署中始终可靠地运行。表4显示了MIE-YOLO在嵌入式设备或移动平台上的实际推理速度和资源消耗。

    表4. 移动平台部署结果。

    表4显示MIE-YOLO在移动SoC上实现了相对于报告GPU性能不成比例的高速度。在Snapdragon 8 Elite上,模型运行速度达到RTX 3080速度的 56.3%,而设备GPU性能为 36.6%,相差19.7个百分点。在Dimensity 9400上,速度为 53.3%,GPU性能为 36.5%,相差16.8个百分点。在Apple M4上,速度为 55.3%,GPU性能为 35.6%,相差19.7个百分点。即使在较低端的A18 Pro上,速度也为 44.1%,而GPU性能为 21.1%,相差23.0个百分点。推理时间保持在20多毫秒的中等范围,产生大约29到37 FPS,预处理和后处理开销很小,因此大部分运行时间是高效的神经推理。这些运行时优势得益于参数量减少 29.9%、FLOPs减少 6.9% 和模型大小减少17.0%,从而降低了内存占用和计算需求。适度的报告GPU利用率为多任务处理和节省电池电量留下了空间,这对于电池供电的喷雾器和无人机的田间部署非常重要。这些事实共同表明,MIE-YOLO实现了比原始设备性能预测更高的实时吞吐量,因此非常适合于资源受限的嵌入式和移动平台,同时仍允许通过供应商加速量化或有针对性的剪枝获得进一步的收益。

    6. 结论

    本文提出了一种用于精准农业的多尺度信息增强杂草检测算法MIE-YOLO。通过引入新颖的MS-EIS架构、Add-CGLU金字塔网络和DEC检测头,MIE-YOLO采用DS策略在整个网络中进行知识蒸馏。在自定义杂草数据集上的实验结果表明,MIE-YOLO将F1分数提高了 1.9%1.9%,平均精度提高了 2.0%。此外,MIE-YOLO减少了 29.9% 的计算参数量,6.9% 的FLOPs,模型大小减少了 17.0%,实现了66.2 FPS的运行速度。这些结果表明,MIE-YOLO实现了对多类别、密集分布的小型杂草目标的高效准确识别。

    尽管取得了这些成果,但MIE-YOLO仍存在一些重要限制,需要进一步研究。其在极端光照和运动模糊下的性能尚未得到充分验证,因为MS-EIS模块依赖于在此类条件下可能退化的边缘和纹理线索。杂草与作物之间的严重遮挡和密集重叠仍然是挑战,因为DEC增强不能总是完全恢复被遮挡的实例。某些作物和杂草之间的细粒度相似性导致误报,表明需要更具区分性的特征或类别平衡的训练。实际关注点,如标注噪声、对超参数的敏感性以及有限的田间试验,也可能限制其在实际世界中的转化。因此,未来的工作将优先考虑扩展和多样化数据集,并进行有针对性的模型压缩和硬件加速测试以验证部署。通过与自动除草机械和精准喷洒系统的深度融合,MIE-YOLO有望在复杂的农田环境中实现大规模部署,并为提高作物产量和农药使用效率提供有力支持。

    赞(0)
    未经允许不得转载:171主机测评 » MIE-YOLO: A Multi-Scale Information-Enhanced Weed Detection Algorithm for Precision Agriculture
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址