作者:Kai Ye, Yingshi Luan, Zhudi Chen, Guangyue Meng, Pingyang Dai, Liujuan Cao(IEEE会员)
https://arxiv.org/pdf/2507.20920
摘要
指代表达图像分割(Referring Image Segmentation, RIS)旨在根据自然语言描述分割图像中的特定目标,在视觉-语言理解中扮演着重要角色。尽管RIS在遥感应用中已取得进展,但面向低空无人机(Low-Altitude Drone, LAD)场景的RIS研究仍较为匮乏,现有数据集和方法通常针对高空和静态视角图像设计,难以处理LAD视角的独特特性,如多样化的视角和高目标密度。本文提出RIS-LAD,首个面向LAD场景的细粒度RIS基准数据集,包含13,871个精心标注的图像-文本-掩码三元组,采集自真实无人机视频,重点关注小目标、密集杂乱目标和多视角特性。该数据集凸显了先前基准中不存在的新挑战,如小目标引起的类别漂移(category drift)和同类密集目标导致的目标漂移(object drift)。此外,我们提出语义感知自适应推理网络(Semantic-Aware Adaptive Reasoning Network, SAARN),该网络对语义信息进行解耦并自适应地路由至不同网络阶段,而非均匀注入所有语言特征。具体而言,类别主导的语言增强模块(Category-Dominated Linguistic Enhancement, CDLE)在早期编码阶段将视觉特征与目标类别对齐,而自适应推理融合模块(Adaptive Reasoning Fusion Module, ARFM)则跨尺度动态选择语义线索,以增强复杂场景中的推理能力。大量实验表明,RIS-LAD对现有先进RIS算法提出了实质性挑战,同时验证了所提模型在应对这些挑战方面的有效性。数据集和代码将很快在以下地址公开发布:https://github.com/AHideoKuzeA/RIS-LAD-A-Benchmark-and-Model-for-Referring-Low-Altitude-Drone-Image-Segmentation。
关键词—指代表达图像分割,无人机,无人驾驶航空器,航空图像分析,基准数据集
一、引言
低空无人机(通常飞行高度低于200米)因其灵活部署和高通用性,已在现实应用中得到广泛使用[1]–[3]。这一趋势激发了LAD场景下视觉任务的研究兴趣,催生了VisDrone[4]和UAV123[5]等支持目标检测、跟踪等相关任务的基准数据集[6]–[8]。近期,LAD场景下的视觉理解[9],[10]日益受到关注,尤其是多模态任务。其中,指代表达图像分割(RIS)[11]–[13]是一项基础感知任务,旨在根据语言描述在图像中定位目标像素级区域。将RIS融入LAD系统可使无人机更好地适应更广泛的实际应用场景。

然而,现有RIS研究主要聚焦于常规场景或高空遥感图像,LAD图像的独特属性在当前文献中尚未得到充分探索。尽管先前的遥感指代表达图像分割(Referring Remote Sensing Image Segmentation, RRSIS)研究[14]–[16]提供了宝贵见解,但其数据多来源于卫星或直升机拍摄。如图1(a)所示,低空无人机指代表达图像分割(Referring Low-Altitude Drone Image Segmentation, RLADIS)相比RRSIS呈现若干独特挑战:(1) 因相机位置更低、更灵活导致的多样化视角;(2) 多变的光照条件;(3) 更小且分布更密集的目标。这些挑战引入了显著的领域差异,阻碍了现有RRSIS方法向RLADIS任务的有效泛化。
为弥合这一差距,我们提出RIS-LAD,首个面向细粒度RLADIS的专用数据集,并配套半自动标注流程,确保高质量指代表达生成与标注效率。最终数据集包含13,871个图像-文本-掩码三元组,为评估RLADIS方法提供基准。进一步分析揭示了阻碍RRSIS方法直接适配RLADIS的两大关键挑战:类别漂移与目标漂移。如图1(b)所示,当目标在图像中仅占很小区域时,模型易被误导关注更大、语义相似的目标,从而引发类别漂移;而当同类目标实例高度密集时,模型难以正确识别表达中所指的具体目标,导致目标漂移。
受这些漂移问题启发,我们提出语义感知自适应推理网络(SAARN),该网络解耦语言特征并在网络适当阶段注入,以确保语义对齐。与现有基于解耦的方法均匀地将所有语言成分注入各模块不同[17],[18],SAARN采用更具针对性的策略。具体而言,类别主导的语言增强(CDLE)模块仅将类别级语言特征注入编码器,使早期视觉表征与准确的类别级语义对齐;同时,通过类别引导门控选择性融合全局语言特征,强化语义一致性。在多尺度融合阶段,自适应推理融合模块(ARFM)通过跨尺度动态加权语义线索执行尺度感知增强,该机制模拟推理过程,引导模型在同类密集目标中推断出语义最一致的实例。
本文主要贡献如下:
- 我们提出RIS-LAD,首个面向低空无人机场景的细粒度指代表达图像分割数据集,提供多样化LAD场景、丰富文本描述和高质量分割掩码。
- 为应对RLADIS中的类别漂移和目标漂移,我们提出语义感知自适应推理网络(SAARN)。该模型聚焦于语义类别对齐,并在最优特征尺度选择性融合最相关的语言特征。
- 我们开展大量实验探究RLADIS固有挑战并构建专用基准。所提SAARN在RIS-LAD基准上达到最先进性能。
二、相关工作
1) 指代表达图像分割(RIS)
RIS旨在根据自然语言表达在图像中像素级定位目标[19]。代表性方法主要聚焦于增强视觉-语言对齐以提升分割性能[20]–[22]。VATEX[23]利用基于CLIP的先验模块生成热力图,强制语义一致性并改善语言与视觉间的上下文对齐。ASDA[24]采用具有动态特征选择的双重对齐机制,以更好地对齐视觉与语言模态。其他方法探索RIS的新型架构设计[25]–[27]。IteRPrimE[12]通过迭代Grad-CAM精炼策略优化视觉激活图,并采用主词强调模块以提升语言表达中关键语义成分的识别。尽管这些方法在常规图像上表现良好,但应用于LAD图像时性能显著下降。
2) 遥感指代表达图像分割(RRSIS)
RRSIS是RIS任务在遥感图像上的领域特定扩展,首次由[28]提出。鉴于遥感图像的高分辨率和小目标特性,许多近期方法采用多尺度特征融合[29],[30]。FIANet[17]解耦指代表达的各类成分,并引入文本感知多尺度增强模块以提升多模态判别能力。RMSIN[31]设计旋转感知模块,根据遥感图像独特属性精确分割目标。同时,预训练大视觉模型在该领域日益受到关注[32]。RSRefSeg集成基于CLIP[33]的模块以捕获隐式视觉激活,并将其作为SAM[34]的引导提示。在基准方面,现有RRSIS数据集[31],[35],[36]主要构建自Google Earth和GF-2等高空来源,其场景目标较大且视角固定。尽管部分研究探索了低空场景[9],但由于视角多样,小目标和高实例密度等挑战依然存在。现有基于LAD的数据集如UAVid-RIS和VDD-RIS[10]在目标类别和表达粒度上仍显局限,难以支持细粒度RIS任务。
三、RIS-LAD数据集
本节介绍RIS-LAD的构建过程与关键特性。完整数据集细节与伦理声明见附录。
1) 图像与类别选择
从公开的CODrone数据集[37](专为LAD目标检测设计)中筛选适合RIS任务的图像。所选图像涵盖各种光照条件和不同视角下的多样化真实城市场景。遵循RRSIS数据集构建的通用流程[35],[36],[38],将图像划分为统一的1080×1080图像块,以保留细粒度细节。通过人工筛选确保保留的图像块展现LAD图像的代表性特征。
参照主流LAD目标检测基准[4],[5],[8],我们选取八类代表性目标:人(people)、汽车(car)、摩托车(motor)、自行车(bicycle)、三轮车(tricycle)、卡车(truck)、公交车(bus)和船(boat)。这些类别在各类无人机应用中常见且至关重要。为更好反映现实挑战,我们施加尺寸约束,确保超过90%的标注实例掩码覆盖率低于0.1,凸显LAD场景中小目标和视觉不显著目标的普遍性。
2) 掩码与表达生成流程
采用Segment Anything Model 2(SAM-2)[39]自动生成高质量实例掩码,其中CODrone提供的定向边界框作为精确提示引导分割过程。

如图2所示,指代表达通过多模态大语言模型(MM-LLM)Qwen2.5-VL[40]生成。为捕获实例级外观与空间属性,每个目标被裁剪并上采样以提升视觉清晰度。裁剪后的实例与标有红色边界框(指示位置)的完整图像一同输入Qwen2.5-VL。该双输入策略通过MM-LLM捕获细粒度视觉特征的能力,解决了小目标尺寸带来的挑战,避免仅依赖原始坐标生成空间描述时的不准确性。如图3所示,我们进一步通过词云可视化精炼后指代表达的语言多样性。

3) 人工精炼与数据集划分
所有自动生成的标注均经仔细验证与精炼,确保图像、指代表达与掩码间的强语义对齐。该流程共产生13,871个高质量图像-文本-掩码三元组,按7:1:2比例随机划分为训练集、验证集和测试集。

4) RIS-LAD与RRSIS数据集比较
如表I总结,RIS-LAD展现出区别于现有RRSIS数据集[30],[31],[35],[36],[38]的显著特性。首先,与依赖固定俯视视角的RRSIS数据集不同,RIS-LAD包含30°–60°倾斜角度拍摄的低空无人机图像,提供更大的视角与目标外观变化。其次,RIS-LAD独特地包含夜间场景,支持在挑战性光照条件下进行评估。此外,它采用融合MM-LLM与人工验证的半自动标注流程,确保标注质量与效率。
四、方法
A. 概述
如图4所示,我们提出语义感知自适应推理网络(SAARN),专为解决RLADIS中的类别漂移与目标漂移而设计。SAARN包含两个核心组件:类别主导的语言增强(CDLE)与自适应推理融合模块(ARFM)。

给定输入图像及其对应指代表达,Swin Transformer[41]编码器提取视觉特征,表达被解耦为全局、类别级和描述性成分,生成三类语言特征:lll、ccc和ddd。如图4左下所示,这些语言特征分别对应完整表达、类别名称以及排除类别术语的描述性内容。此类解耦便于对语义意图、目标类别信息及详细空间或属性线索进行针对性建模,符合人类推理直觉:先定位描述区域或识别所有类别匹配目标,再根据特定属性选择目标。
在编码器阶段,CDLE通过ccc注入类别级引导,使早期视觉表征与正确类别对齐;随后融合lll构建类别主导的融合表征,再通过残差融合与前一层输出及视觉增强模块[31]输出结合用于多尺度融合。在多尺度融合阶段,ARFM对金字塔池化特征与不同尺度的lll、ccc、ddd执行自适应集成,基于语义对齐与空间分辨率分配自适应权重,使各尺度特征强调最相关的语言线索。最终融合表征传入掩码解码器生成分割输出。
B. 类别主导的语言增强
为解决类别漂移,我们提出CDLE模块,选择性注入类别级语言特征以精确对齐早期视觉表征与正确类别。刻意排除描述性语言成分,防止与视觉相似但错误目标的对齐,从而缓解类别漂移。该模块集成于视觉编码器各阶段,实现细粒度跨模态交互。
视觉特征(或前一编码器层输出)记为x∈RB×HW×D\\boldsymbol{x}\\in\\mathbb{R}^{B\\times HW\\times D}x∈RB×HW×D,其中BBB为批量大小,HWHWHW为展平的空间分辨率,DDD为特征维度。类别级语言特征c∈RB×Db×N\\boldsymbol{c}\\in\\mathbb{R}^{B\\times D_b\\times N}c∈RB×Db×N通过从指代表达中提取类别词元并使用预训练BERT模型[42]编码得到,DbD_bDb和NNN分别表示隐藏维度与语言词元数量。受[43]启发,我们将x\\boldsymbol{x}x与c\\boldsymbol{c}c投影至共享嵌入空间,计算缩放点积注意力以对齐类别线索与视觉特征:
αc=softmax(Wqc(x)⋅(Wkc(c))⊤d)⋅Wvc(c)\\alpha^{c}=\\operatorname{softmax}\\left(\\frac{W_{q}^{c}(\\boldsymbol{x})\\cdot\\left(W_{k}^{c}(\\boldsymbol{c})\\right)^{\\top}}{\\sqrt{d}}\\right)\\cdot W_{v}^{c}(\\boldsymbol{c})αc=softmax(dWqc(x)⋅(Wkc(c))⊤)⋅Wvc(c)
其中各WWW表示沿通道维度应用的1×11\\times11×1卷积层,ddd为缩放因子。
尽管类别引导注意力αc\\alpha^{c}αc有效捕获输入与类别级语言线索间的语义对齐,但易过度强调类别语义而抑制其他有益视觉上下文。为此,引入残差门控机制,对αc\\alpha^{c}αc与原始特征x\\boldsymbol{x}x进行自适应加权:
zc=φoc(Wwc(αc)⊙φm(x))z^{c}=\\varphi_{o}^{c}(W_{w}^{c}(\\alpha^{c})\\odot\\varphi_{m}(\\boldsymbol{x}))zc=φoc(Wwc(αc)⊙φm(x))
fc=x+zc⋅φfc(zc)f^{c}=\\boldsymbol{x}+z^{c}\\cdot\\varphi_{f}^{c}(z^{c})fc=x+zc⋅φfc(zc)
其中φm(⋅)\\varphi_{m}(\\cdot)φm(⋅)与φoc(⋅)\\varphi_{o}^{c}(\\cdot)φoc(⋅)表示后接GELU的卷积层,φfc(⋅)\\varphi_{f}^{c}(\\cdot)φfc(⋅)表示含ReLU[44]与Tanh激活的两层线性投影。
给定全局语言特征l∈RB×Dl×N\\boldsymbol{l}\\in\\mathbb{R}^{B\\times D_l\\times N}l∈RB×Dl×N与类别引导特征fcf^{c}fc,我们再次计算缩放点积注意力与残差门控:
αl=softmax(Wql(fc)⋅(Wkl(l))⊤d)⋅Wvl(l)\\alpha^{l}=\\operatorname{softmax}\\left(\\frac{W_{q}^{l}(f^{c})\\cdot\\left(W_{k}^{l}(\\boldsymbol{l})\\right)^{\\top}}{\\sqrt{d}}\\right)\\cdot W_{v}^{l}(\\boldsymbol{l})αl=softmax(dWql(fc)⋅(Wkl(l))⊤)⋅Wvl(l)
zl=φol(Wwl(αl)⊙φml(fc))z^{l}=\\varphi_{o}^{l}(W_{w}^{l}(\\alpha^{l})\\odot\\varphi_{m}^{l}(f^{c}))zl=φol(Wwl(αl)⊙φml(fc))
fl=fc+zl⋅φfl(zl)f^{l}=f^{c}+z^{l}\\cdot\\varphi_{f}^{l}(z^{l})fl=fc+zl⋅φfl(zl)
该设计确保l\\boldsymbol{l}l在与c\\boldsymbol{c}c对应区域被选择性激活,为l\\boldsymbol{l}l与fcf^{c}fc的融合提供保障机制。输出flf^{l}fl保留指代表达的判别性语义,同时维持与正确类别的强对齐,有效缓解对视觉或语义相似但错误实例的注意力漂移。
C. 自适应推理融合模块
为解决LAD场景中同类密集实例引发的目标漂移问题,我们提出自适应推理融合模块(ARFM)。受人类感知过程启发(推理通常始于粗粒度空间定位,逐步精炼至特定目标属性),ARFM采用渐进式融合策略,在融合多尺度特征Xˉf={xˉ1f,x2f,x3f,x4f}\\bar{X}^{f}=\\{\\bar{x}_{1}^{f},x_{2}^{f},x_{3}^{f},x_{4}^{f}\\}Xˉf={xˉ1f,x2f,x3f,x4f}与语言特征l,c,dl,c,dl,c,d间建立动态加权方案。由此,模型能更有效捕获尺度特定语义线索,实现跨空间分辨率的语义感知注意力。高分辨率下更易保留颜色、形状等细粒度属性,而“左上角”等粗粒度空间线索在低分辨率下更易区分。

XfX^{f}Xf首先通过金字塔池化对齐,随后下采样至共享分辨率与通道维度,得到Xfp∈RB×C′×H′×W′X^{fp}\\in\\mathbb{R}^{B\\times C'\\times H'\\times W'}Xfp∈RB×C′×H′×W′。这些特征输入自适应推理融合块(ARFB),在语言特征引导下执行跨模态多分支推理。如图5所示,ARFB包含三条并行语言分支,分别关注ccc、ddd和lll。XfpX^{fp}Xfp被投影至共享嵌入空间并与各语言特征交互。形式化地,对每类语言特征s∈{l,d,c}s\\in\\{l,d,c\\}s∈{l,d,c},我们计算:
qs=WsqXfp+bsq,ks=Wsks+bskq_{s}=W_{s}^{q}X^{fp}+b_{s}^{q},\\quad k_{s}=W_{s}^{k}s+b_{s}^{k}qs=WsqXfp+bsq,ks=Wsks+bsk
vs=Wsvs+bsv,αs=MHA(qs,ks,vs)v_{s}=W_{s}^{v}s+b_{s}^{v},\\quad\\alpha_{s}=\\operatorname{MHA}(q_{s},k_{s},v_{s})vs=Wsvs+bsv,αs=MHA(qs,ks,vs)
其中WsqW_{s}^{q}Wsq、WskW_{s}^{k}Wsk和WsvW_{s}^{v}Wsv为与语言分支sss关联的可学习投影矩阵,MHA(⋅)\\operatorname{MHA}(\\cdot)MHA(⋅)表示标准多头注意力[45]。
所得响应αs\\alpha_{s}αs编码XfpX^{fp}Xfp与各语言特征间的跨模态相关性。
为自适应调节各语义分支贡献,引入基于XfpX^{fp}Xfp的尺度推理门(Scale Reasoning Gate, SRG)模块:
[wl,wd,wc]=Softmax(SRG(Xfp))[w_{l},w_{d},w_{c}]=\\operatorname{Softmax}(\\operatorname{SRG}(X^{fp}))[wl,wd,wc]=Softmax(SRG(Xfp))
SRG(⋅)\\operatorname{SRG}(\\cdot)SRG(⋅)由全局平均池化层后接两个含ReLU激活的卷积层构成,生成三个归一化融合权重。加权注意力计算为:
αf=Fuse(wlαl, wdαd, wcαc)\\alpha^{f}=\\operatorname{Fuse}(w_{l}\\alpha_{l},\\ w_{d}\\alpha_{d},\\ w_{c}\\alpha_{c})αf=Fuse(wlαl, wdαd, wcαc)
其中Fuse(⋅)\\operatorname{Fuse}(\\cdot)Fuse(⋅)表示通道融合层,由通道拼接后接卷积投影进行压缩与对齐构成。
最终,αf\\alpha^{f}αf通过残差加法与XfpX^{fp}Xfp结合,并经前馈网络[45]进一步增强,随后传入后续尺度感知门控融合模块[31]。ARFM将不同语言特征自适应融入主语义路径,对各特征赋予不同侧重,使其聚焦于最敏感区域,提升上下文一致性与目标边界预测质量。
五、实验
A. 实现细节
模型在所提RIS-LAD数据集上训练50轮,使用AdamW[46]优化器,初始学习率3×10−53\\times10^{-5}3×10−5,权重衰减0.01,采用多项式衰减策略逐步降低学习率。所有实验在四块NVIDIA RTX 3080 GPU上进行,批量大小为8。
评估指标采用Precision@0.5-0.9(P@X)、总体交并比(oIoU)和平均交并比(mIoU)。P@X强调精确预测,但对小目标可能因易被包围而高估性能,因此oIoU和mIoU作为主要指标评估分割性能。

B. 与最先进方法比较
如表II所示,所提SAARN在oIoU和mIoU两项核心指标上均达到最佳性能。相比未引入预训练大视觉模型(LVM)的先前最先进方法RMSIN[36],[47],我们的方法在验证集上将oIoU从50.17提升至51.54,在测试集上mIoU显著提升2.07。值得注意的是,SAARN在更严格定位阈值下取得显著增益,包括P@0.9提升+18.0%和P@0.8提升+13.6%。
通过集成CLIP和SAM,RSRefSeg在Precision@0.8-0.9上表现具竞争力,但在核心分割指标上仍逊于SAARN。可视化分析表明,RSRefSeg性能不一致源于其易产生过度扩展的掩码(如图6所示)。尽管这些掩码可能覆盖所指目标,但其边界存在严重区域泛化问题,导致oIoU和mIoU较低。相比之下,SAARN生成边界更精确的掩码,分割性能更强。与同样利用语言解耦和多尺度融合的FIANet相比,SAARN表现显著更优,归功于其在同类密集分布下优越的实例级感知能力。
常规RIS方法(如ASDA和VATEX)在LAD设定下性能显著下降,主要源于目标尺寸小和背景复杂。特别是VATEX表现相对有限,部分原因在于其依赖冻结的CLIP图像编码器进行视觉增强,因LAD图像与CLIP预训练分布间的领域差异导致负迁移。该观察凸显了RLADIS与常规RIS间的根本领域差异。
C. 消融实验
我们对SAARN的两个核心组件CDLE和ARFM进行消融研究以验证其有效性。
如表III所示,加入CDLE显著提升mIoU。通过在早期阶段强化类别语义,CDLE帮助模型聚焦正确目标类别,提升实例级分割精度。此外,集成ARFM显著改善oIoU,验证集上从49.82提升至51.54。该提升源于ARFM跨尺度区分密集分布目标的能力,促进更精确定位并显著减少错误激活。

1) 语言成分消融:如表IV所示,我们进一步分析ARFM中使用的语言成分。具体评估全局、类别级和描述性语言特征lll、ccc和ddd的贡献。加入lll将验证集oIoU从49.82提升至50.64,表明其在提供全局语义引导、增强多尺度对齐方面的作用。有趣的是,当ddd与lll一同引入时性能略有下降,表明缺乏类别级引导时,模型更易受细粒度描述线索的语义干扰,可能破坏类别一致表征学习(尤其在粗分辨率下)。相反,引入ccc显著提升oIoU和mIoU,凸显其在语义对齐中的关键作用,提供强类别特定约束。
最终,三类特征组合达到最佳整体性能,表明ARFM中注入的每类语言成分在推理过程中扮演独特而互补的角色,共同增强模型准确定位所指目标的能力。

D. 可视化与定量结果
我们与两种最先进RRSIS方法进行定性比较以更好展示所提模型有效性。如图6所示,在典型LAD场景下,我们的模型准确识别正确目标类别,并有效区分邻近同类实例,即使在复杂背景和不同无人机视角下亦然。相比之下,对比的RRSIS方法表现出明显漂移,常导致误分类和同类密集目标间的混淆。模型局限性与失败案例的详细讨论见附录。
六、结论
本文提出RIS-LAD,首个面向RLADIS的细粒度数据集。通过详细分析,我们识别出该设定下两大核心挑战:类别漂移与目标漂移,二者均显著降低现有RIS和RRSIS模型性能。为应对这些问题,我们提出语义感知自适应推理网络,包含CDLE与ARFM两个关键模块:CDLE增强早期阶段类别对齐,ARFM执行自适应多尺度推理以缓解目标漂移。实验验证了我们框架的强劲性能,并凸显RIS-LAD带来的挑战,为LAD场景设立新基准。
参考文献
[略,保留原文献列表]





