大家读完觉得有帮助记得关注和人点赞!!!
摘要
多模态大语言模型在各类视觉-语言任务上已取得强劲表现,但其在无人机场景下的能力仍未被充分探索。近期的无人机向基准已开始评估 aerial 场景中的MLLM,但它们通常聚焦于场景理解、事件识别或导航完成,而非联合评估无人机智能体所需的"双认知"能力:即在多视角时空上下文中同时推理无人机自身状态与外部环境。为填补此空白,我们提出UAV-DualCog——一个基于双认知视角构建的、面向 aerial 多视角时空推理的基准。UAV-DualCog 包含图像与视频两类任务,以联合评估自我状态推理与环境状态推理,同时要求超越离散答案预测的空间或时间定位。我们还开发了一套自动化流水线,从场景级语义点云出发构建数据,产生一个具备多样场景、数百地标和数千QA样本的、可扩展的基准。大量评估表明,当前MLLM在无人机双认知上仍远未达到可靠水平。自我状态推理、视角变换、精确空间定位和时间区间定位是持续的瓶颈;通过 thinking/前沿模型和人类基线的额外验证进一步确认:该基准人类可理解,但对现有模型仍具挑战性。我们进一步从互不相交的场景中构建了 UAV-DualCog-Train,并通过轻量级优化探针表明它能提供有用的结构化监督,暗示其价值不仅是评估基准,也可作为推进基于MLLM的无人机智能体的数据资源。项目网站与补充材料:https://uav-dualcog.lozumi.com
关键词:多模态大语言模型;无人机推理基准;航空视觉-语言理解;时空推理
1. 引言

图1:UAV-DualCog概览,一个面向 aerial 多视角时空推理的基准。它将自我感知认知与环境感知认知显式制定为两个顶层评估维度。通过开发自动构建流水线,利用图像与视频两种模态评估MLLM的双认知能力。
多模态大语言模型的最新进展极大提升了机器在结合视觉与语言信息的感知与推理任务上的表现。随着这些模型日益被纳入具身智能体考量,一个重要问题是:它们能否在无人机场景中支持可靠推理——其感知受开放3D空间中连续运动和快速变化的视角所塑造。相比传统地面视角设置,航空观测引入了更强的视角变化和更动态的目标可见性,使无人机推理成为MLLM评估中一项独特的挑战。
无人机具身智能的一个核心挑战是:智能体不仅必须推理外部环境,还必须在运动过程中推理其自身状态。具体而言,要有效行动,仅理解地标、物体和场景结构是不够的;智能体还必须识别自身的视角、运动状态和相对于周围目标的相对位置。这两方面本质上耦合,意味着无人机评估应显式评估两种互补的认知能力:自我状态感知与环境状态感知。现有的无人机向基准已为航空场景理解、事件识别、空间推理和具身问答提供了有价值的评测,但它们通常要么侧重外部环境探索,要么侧重任务完成,而非在多视角时空统一设置下联合评估这两种认知形式。
为填补此空白,我们引入 UAV-DualCog——一个从双认知视角出发的、面向 aerial 多视角时空推理的基准,如图1所示。UAV-DualCog 通过图像和视频两类任务评估自我状态与环境状态认知,实现对空间与时间场景下无人机具身推理的统一细粒度评估。它由一套基于场景级语义点云的高度自动化流水线构建,支持可扩展地生成无人机观测、地标标注和问答对。完整资产池包含18个场景和746个有效地标;发布版基准选用其中12个场景、512个地标,构建出4,096个图像样本和2,048个视频样本,按两种模态组织为六种任务类型。这种适中规模和简洁任务格式是为了高效、可复现的MLLM评估而刻意设计的。基于此基准,我们在无人机边缘部署的计算约束下对轻量MLLM进行了系统评估。结果表明当前模型在无人机推理上仍远不可靠——尤其在图像任务上,环境状态认知持续强于自我状态认知;而在视频任务上,行为理解、原子动作识别和可见性区间定位的表现常不一致。这些结果说明现有MLLM在航空场景下仍难以对自我与环境状态进行可靠联合建模,进一步凸显了构建UAV-DualCog的必要性。我们通过 thinking/前沿模型、人类基线、失败诊断和开放式验证进一步验证了基准。我们还从互不相交场景构建了 UAV-DualCog-Train,轻量级优化探针表明它能为无人机向MLLM提供结构化监督。
主要贡献如下:
-
提出 UAV-DualCog,一个将自我状态认知与环境状态认知作为顶层维度的无人机多视角时空推理基准,图像与视频任务由可扩展自动化流水线构建。
-
系统评估多种轻量MLLM,揭示双认知推理、时空定位与跨模态一致性方面的持续挑战。
-
提供诊断验证与轻量级优化探针,表明 UAV-DualCog 不仅可作为评估基准,也可作为无人机向MLLM的结构化监督来源。
2. 相关工作
2.1 MLLM基准与评估
近期MLLM在广泛视觉-语言基准上表现强劲。现有评估主要考察视觉问答、定位、以物体为中心的推理、空间理解和多步多模态推理等能力。然而,这些基准大多构建于被动观测设置下的静态图像或短视频,视觉输入并不依赖于智能体的运动、视角或与环境的互动,因此对MLLM在"感知-动作耦合"的具身推理场景下支持得如何,提供的证据有限。
2.2 无人机向基准
现有无人机向基准主要评估航空视角下的场景理解、目标检测、事件识别等感知任务。更近期的工作将范围扩展到更高层推理,包括航空空间推理、具身问答和视觉-语言导航。尽管有这些进展,大多数基准仍是任务特定的,且主要强调环境理解(如物体关系或任务完成),而对无人机自身状态(位置、视角、运动)关注有限。此外,许多基准仍基于单帧或弱时序设置,缺乏多视角连续时空条件下的系统评估。因此,它们并未就"无人机自我状态与外部环境的联合作用如何塑造动态航空场景中的推理"提供统一评估。
与本研究并发的 SIS-Bench 利用真实无人机视频研究自我感知与空间认知,为以智能体为中心的无人机MCQ评估提供了有价值的互补视角。UAV-DualCog 的不同之处在于两点:它要求结构化定位输出(含边界框与时间区间);且它通过可扩展的、基于仿真的流水线构建,具备可验证的位姿、可见性和定位标注。
表1总结了这一区别。UAV-DualCog 并非旨在替代导航、具身QA或航空感知基准,而是对其进行补充:将无人机自身状态作为一等评估目标,并要求答案预测附带显式空间/时间证据。
表1:与代表性航空/具身推理基准的对比。 "Self-state" 表示基准是否显式评估智能体自身视角、运动或相对位置作为推理目标;"Evidence grounding" 表示评估是否要求显式空间/时间证据输出(如边界框或时间区间)。
|
AVDN / AerialVLN / OpenFly |
否/有限 |
有限 |
部分 |
|
CityEQA / Open3D-VQA / UrbanVideo-Bench |
否/有限 |
部分 |
部分 |
|
HUGE-Bench / UAV-Search |
有限 |
有限 |
部分 |
|
SIS-Bench |
是 |
有限 |
部分 |
|
UAV-DualCog |
是 |
是 |
是 |
3. UAV-DualCog 基准

图2:UAV-DualCog 基准构建流程。上方:自动化流程包括场景扫描与地标收集(可复用资产),然后生成图像任务和视频任务(共6类)。下方:从 AerialVLN 模拟器采集18个场景,覆盖白天/夜晚、城市/乡村。为合理飞行轨迹生成设计了分层飞行行为模式。

图3:UAV-DualCog 基准统计,展示均衡的任务分布、发布场景内地标分布、视频时长分布,以及视频模态任务中的飞行模式分布。
3.1 双认知形式化
无人机视觉理解从根本上不同于常规图像/视频理解,因为观测是由主动的航空智能体而非被动相机生成的。随着无人机在3D空间连续运动,其位姿、运动状态和相机视角直接影响可见性与场景解读。在 UAV-DualCog 中,这些因素不被视为背景变量,而是待评估的核心认知对象。因此,鲁棒的无人机智能不仅需要推理环境,还需要推理作为具身观测者的无人机自身。我们将此能力称为双认知。
具体地,双认知由两个紧密耦合的维度构成:自我状态认知 cs(相对位置、运动、行为等)与环境状态认知 ce(目标方向、可见性、与动作相关的空间关系等)。形式化地,对以无人机为中心的观测 o,认知目标为:
C(o)={cs,ce}
现实无人机任务要求两维度的联合建模,因为环境感知与无人机自车状态是相互条件的。然而现有视觉基准仍以环境为中心,常忽略观测者的具身状态。为弥合此缺口,UAV-DualCog 专门设计通过图像与视频任务评估这种耦合。
3.2 任务概览
我们跨图像与视频模态设计了六类任务,对齐两个认知维度:
📷 图像任务:共构建四类图像任务:① 自我相对位置推理——要求模型推断无人机相对于某个地标的位置;② 未来观测预测——要求在给定候选动作下,预测下一时刻的观测画面。这两项任务用于评估自我状态认知。③ 地标相对方向推理——询问地标位于无人机当前前进方向的什么方位;④ 地标驱动动作决策——询问无人机应向哪个方向移动以接近目标。这两项任务用于评估环境状态认知。所有图像任务均要求同时输出离散答案与归一化边界框,从而实现对推理能力与视觉定位能力的联合评估。因此,若模型仅凭猜测选对选项却未能在图像中定位目标,其定位得分将极低。
🎬 视频任务:共构建两类视频任务:① 飞行行为识别与时间定位——要求模型识别已执行的飞行行为,并定位其在时间轴上的区间,从语义与时间双重维度评估自我状态认知。② 地标可见性计数与区间推理——要求模型预测目标出现的次数并定位各次出现的可见区间,以此评估环境状态认知。所有视频任务均要求输出包含归一化时间区间的结构化结果。由此可见,多选题预测仅仅是交互接口:视频评估实质上是联合度量语义预测准确性、计数/动作正确性与时间证据定位能力。
表2:图像向无人机双认知任务结果。 深色与浅色单元格分别表示各模型组内的最优与次优表现。
|
|
相对位置 Acc |
msIoU@50 |
msIoU |
相对位置 Acc |
msIoU@50 |
mIoU |
|
专有模型 |
|
|
|
|
|
|
|
Claude Sonnet 4.6 |
37.7% |
4.9% |
18.2% |
48.5% |
9.6% |
20.2% |
|
Gemini 3.1 Flash Lite |
33.7% |
0.0% |
0.2% |
47.6% |
0.2% |
1.0% |
|
Gemini 3 Flash |
47.6% |
0.7% |
1.2% |
56.2% |
0.1% |
0.9% |
|
GPT-5.5 |
38.0% |
19.4% |
26.2% |
65.4% |
17.6% |
25.1% |
|
GPT-5.4 |
37.9% |
12.2% |
24.2% |
37.8% |
12.9% |
24.5% |
|
GPT-5.3 |
35.2% |
11.9% |
23.5% |
56.5% |
14.9% |
22.5% |
|
Grok 4.1 Fast |
21.1% |
3.6% |
16.4% |
33.0% |
1.9% |
8.2% |
|
Mimo v2 Omni |
28.7% |
38.0% |
34.3% |
36.5% |
8.8% |
17.4% |
|
Qwen 3.7-Plus |
33.3% |
18.4% |
28.0% |
55.4% |
18.4% |
26.7% |
|
Qwen 3.6-Plus |
32.8% |
16.6% |
27.1% |
48.4% |
7.4% |
19.0% |
|
Qwen 3.6-Flash |
25.1% |
24.6% |
32.0% |
62.7% |
19.4% |
27.1% |
|
Qwen 3.5-Plus |
28.6% |
21.4% |
27.1% |
47.6% |
9.7% |
19.3% |
|
Qwen 3.5-Flash |
27.8% |
21.6% |
29.8% |
52.4% |
8.8% |
19.4% |
|
开源模型 |
|
|
|
|
|
|
|
GLM 4.6V |
30.8% |
9.4% |
8.7% |
29.2% |
3.3% |
6.7% |
|
Intern S1-Pro |
29.4% |
17.4% |
26.8% |
27.8% |
2.7% |
13.7% |
|
InternVL 3.5-241B |
32.9% |
28.4% |
31.2% |
50.1% |
5.4% |
15.8% |
|
InternVL 3.5-30B |
27.3% |
4.9% |
19.9% |
35.4% |
0.6% |
7.6% |
|
InternVL 3.5-14B |
22.8% |
7.6% |
22.2% |
28.5% |
4.7% |
12.9% |
|
InternVL 3.5-8B |
28.5% |
19.7% |
34.2% |
24.7% |
4.2% |
12.3% |
|
InternVL 3.5-4B |
25.6% |
3.1% |
19.8% |
22.4% |
1.0% |
8.0% |
|
Kimi K2.6 |
36.1% |
22.1% |
28.5% |
42.8% |
12.3% |
22.0% |
|
Kimi K2.5 |
34.3% |
27.1% |
30.4% |
39.4% |
5.0% |
15.6% |
|
Mimo v2.5 |
33.1% |
43.2% |
38.2% |
51.2% |
26.6% |
30.7% |
|
Qwen 3.5-397B |
27.4% |
3.3% |
12.6% |
47.9% |
2.8% |
13.0% |
|
Qwen 3.5-122B |
32.6% |
29.1% |
31.6% |
49.7% |
6.1% |
19.4% |
|
Qwen 3.5-35B |
29.5% |
27.6% |
30.5% |
53.2% |
6.1% |
14.5% |
|
Qwen 3.5-27B |
31.6% |
42.8% |
39.9% |
57.8% |
7.3% |
20.4% |
|
Qwen 3.5-9B |
29.0% |
15.9% |
25.8% |
53.2% |
10.3% |
20.9% |
|
Qwen 3.5-4B |
30.9% |
12.8% |
23.1% |
47.5% |
6.7% |
17.7% |
|
空间专用模型 |
|
|
|
|
|
|
|
SenseNova-SI-1.2 |
17.5% |
10.7% |
10.6% |
15.3% |
3.2% |
5.8% |
|
SpaceOm |
24.7% |
2.8% |
6.7% |
35.2% |
2.4% |
8.6% |
|
SpaceR |
20.6% |
2.4% |
6.0% |
42.4% |
1.8% |
5.4% |
|
SpaceThinker |
22.6% |
1.2% |
3.0% |
32.8% |
0.6% |
5.1% |
|
ViLaSR |
18.8% |
0.0% |
0.0% |
43.1% |
0.0% |
0.0% |
|
VST-7B-RL |
29.2% |
0.0% |
0.0% |
47.2% |
0.0% |
0.1% |
|
VST-7B-SFT |
28.1% |
0.0% |
0.0% |
46.5% |
0.0% |
0.2% |
3.3 构建流水线
我们通过四阶段可扩展高度自动化流水线构建 UAV-DualCog:
场景级语义点云构建:在 AerialVLN 场景中采样覆盖感知的无人机位姿,融合 LiDAR、RGB、分割和位姿数据为带类别/实例标注的场景级语义点云。
地标资产构建与语义标注:按实例聚合候选地标,关联多视角观测,人工核验,标注几何与语义属性。
行为驱动的视频任务生成:在分层飞行行为框架下生成可执行无人机任务与轨迹,经几何与碰撞约束验证后录为带标注的第一人称视频。
图像任务生成:通过可控视角采样、可见性检查和结构化标注,从地标资产构建图像QA样本。
图2展示了构建流程。仿真被用作可控的数据构建环境——大规模真实飞行中安全、可复现地获取精确位姿、可见性边界、边界框和时间区间是困难的,而仿真使这些证据标注可被验证。同一构建逻辑可扩展到其他模拟器(如3DGS或CARLA)以及当有可靠位姿/可见性/定位元数据时扩展到真实无人机视频;缩小 sim-to-real gap 留作未来工作。构建流水线还包含地标核验、碰撞与可见性检查、模型调用配置检查、基于网页的数据巡检以保障基准质量。
3.4 基准统计
经自动构建与人工核验后,完整 UAV-DualCog 资产池覆盖约 5,040,232 m² 的18个航空场景,从2,626个候选中保留746个有效地标,跨越8个粗粒度类别与166个细粒度子类别。发布版基准取自12个场景、512个地标,产出 4,096 图像样本 + 2,048 视频样本。图像子集含4任务各1,024样本,源自3,826张唯一源图、共12,288条图像参考;视频子集含2任务各1,024样本,基于1,024条飞行轨迹(总长388,661.79 m,总时长19,633.30 s ≈ 5h27m13s)。图3汇总了基准统计。
总体而言,UAV-DualCog 在认知类型、模态与任务难度上保持均衡。作为MLLM基准,它刻意采用适中规模和简洁任务格式以实现高效准确评估,同时仍能对空间与时间设置下的具身无人机推理做细粒度分析。

图4:UAV-DualCog 上自我相对位置推理的失败案例分析。
4. 实验
4.1 实验设置
评估设置。所有 UAV-DualCog 任务均要求模型输出结构化 JSON 结果。针对图像任务,模型需预测离散答案及归一化目标边界框,我们报告答案准确率、IoU ≥ 0.5 时的边界框准确率(BBox@0.5)以及平均 IoU(mIoU)。针对视频任务,模型需预测行为或可见性结果及其对应的时间区间。我们报告任务级与原子级行为准确率、可见性计数准确率、tIoU ≥ 0.5 的时间定位准确率以及平均 tIoU(mtIoU)。每个图像样本提交 2 或 5 张图像,统一压缩至 640×480 分辨率,JPEG 质量为 80;每个视频样本提交一个 MP4 视频,码率为 10Mbps,并附带同分辨率的参考图像。
➠ 模型设置。对于支持配置推理深度的模型,我们全程采用“即时模式”(Instant mode),并禁用显式思考或推理设置。这一设计旨在面向实际部署的无人机评估场景,其中延迟稳定性至关重要,同时也能避免因特定模型的“思考协议”差异带来的混淆变量。我们评估了三类模型:专有闭源多模态模型、开源多模态模型以及空间专用微调模型。① 评估的专有模型包括 GPT-5.3/5.4/5.5、Claude Sonnet 4.6、Gemini 3 系列、Grok-4.1-fast、Mimo-v2-omni 及 Qwen3.5/3.6/3.7 变体;② 开源模型包括 GLM-4.6V、Kimi-K2.5/K2.6、Mimo-v2.5、Qwen3.5、Intern-S1-Pro 及 InternVL3.5 系列;③ 空间专用模型包括 SpaceR、SpaceThinker、SpaceOm、SenseNova-SI-1.2-InternVL3-8B、ViLASR 及 VST-7B 系列。
表3:代表性低定位模型诊断解析审计。 官方排行榜分数遵循严格的统一协议;校正分数仅用于诊断目的。
|
Gemini 3.1 Flash Lite |
0.6 |
27.4 |
1.1 |
32.6 |
|
Gemini 3 Flash |
0.5 |
18.6 |
1.0 |
23.6 |
|
GLM-4.6V |
6.0 |
25.9 |
7.3 |
30.0 |
|
ViLaSR |
0.0 |
1.1 |
0.0 |
11.7 |
➠ 解析审计。所有模型均使用相同的提示词、JSON 模式、解析规则和评估指标进行评估。尽管如此,我们复查了代表性的低定位案例,发现少量接近零的定位分数部分源于格式不兼容问题,包括边界框尺度不匹配、输出格式错误(Malformed outputs)或模式不匹配。表 3 报告了代表性案例的校正后诊断分数。这些校正恢复了一部分定位性能,但精确的空间定位能力仍显著低于答案准确率。因此,官方排行榜维持严格的统一协议,主要结论保持不变。
表4:视频向无人机双认知任务结果,涵盖飞行行为识别与地标可见性识别。深色与浅色单元格分别表示各模型组内的最优与次优表现。
|
|
复合级 Acc |
tIoU@50 |
mtIoU |
原子级 Acc |
F1@50 |
mtIoU |
识别 Acc |
|
专有模型 |
|
|
|
|
|
|
|
|
Gemini 3.1 Flash Lite |
22.8% |
30.7% |
34.9% |
23.3% |
42.2% |
41.4% |
59.9% |
|
Gemini 3 Flash |
47.9% |
49.0% |
52.1% |
38.5% |
55.8% |
48.0% |
49.4% |
|
Mimo v2 Omni |
22.0% |
33.0% |
35.7% |
26.9% |
52.4% |
46.6% |
55.8% |
|
Qwen 3.7-Plus |
6.6% |
11.8% |
12.3% |
34.0% |
62.6% |
49.5% |
53.6% |
|
Qwen 3.6-Plus |
7.6% |
17.4% |
18.1% |
29.0% |
48.6% |
49.8% |
52.3% |
|
Qwen 3.6-Flash |
33.0% |
33.7% |
38.3% |
25.0% |
48.1% |
37.9% |
52.3% |
|
Qwen 3.5-Plus |
2.2% |
11.2% |
11.6% |
31.7% |
50.4% |
49.6% |
48.3% |
|
Qwen 3.5-Flash |
32.0% |
40.5% |
46.3% |
25.9% |
49.1% |
40.4% |
50.6% |
|
开源模型 |
|
|
|
|
|
|
|
|
GLM 4.6V |
23.2% |
1.0% |
5.2% |
32.5% |
21.6% |
22.2% |
30.2% |
|
InternVL 3.5-38B |
15.2% |
11.1% |
13.2% |
34.9% |
33.4% |
33.1% |
64.0% |
|
InternVL 3.5-30B-A3B |
17.0% |
10.6% |
12.1% |
26.9% |
28.5% |
25.7% |
42.4% |
|
InternVL 3.5-14B |
33.3% |
7.6% |
15.4% |
18.3% |
19.8% |
18.7% |
51.2% |
|
InternVL 3.5-8B |
26.2% |
7.8% |
15.1% |
21.5% |
30.6% |
28.4% |
52.9% |
|
InternVL 3.5-4B |
39.8% |
2.6% |
8.1% |
18.2% |
8.9% |
8.9% |
32.6% |
|
Kimi K2.6 |
12.1% |
19.1% |
19.7% |
32.3% |
57.8% |
48.7% |
39.9% |
|
Kimi K2.5 |
12.8% |
25.5% |
25.3% |
33.6% |
58.2% |
51.1% |
45.3% |
|
Mimo v2.5 |
35.9% |
44.0% |
48.7% |
30.2% |
53.3% |
46.1% |
58.5% |
|
Qwen 3.5-397B-A17B |
5.7% |
0.0% |
1.6% |
28.8% |
28.3% |
29.4% |
36.6% |
|
Qwen 3.5-122B-A10B |
21.9% |
26.0% |
29.8% |
23.6% |
34.1% |
28.6% |
47.1% |
|
Qwen 3.5-35B-A3B |
18.4% |
20.7% |
19.9% |
29.7% |
60.6% |
54.4% |
47.1% |
|
Qwen 3.5-27B |
12.2% |
18.9% |
19.1% |
31.3% |
61.2% |
54.8% |
41.3% |
|
Qwen 3.5-9B |
6.6% |
8.5% |
8.6% |
29.8% |
53.6% |
49.6% |
47.7% |
|
Qwen 3.5-4B |
2.3% |
2.3% |
2.3% |
7.5% |
1.8% |
1.5% |
29.7% |
|
空间专用模型 |
|
|
|
|
|
|
|
|
SpaceOm |
35.9% |
0.0% |
3.1% |
26.6% |
17.4% |
12.8% |
31.4% |
|
SpaceR |
22.2% |
0.0% |
2.6% |
26.8% |
12.8% |
11.9% |
32.6% |
|
SpaceThinker |
16.1% |
0.0% |
1.5% |
24.6% |
18.0% |
12.9% |
33.7% |
|
ViLaSR |
6.1% |
0.0% |
0.8% |
7.0% |
4.6% |
5.7% |
33.1% |
|
VST-7B-RL |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
19.2% |
|
VST-7B-SFT |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
25.6% |
4.2 实验结果
❀ 图像任务结果(表2)。当前MLLM取得中等答案准确率,但空间定位显著更弱——说明正确预测未必等价于可靠定位。专有模型整体答案准确率最强:GPT-5.5 在多项图像任务上提升答案准确率,GPT-5.3 在动作决策上保持强势,Gemini 3 Flash 自感知答案准确率高但定位低。开源模型整体竞争力强,尤其 Mimo v2.5 和 Qwen3.5 家族定位能力更强,在若干定位指标上超过专有模型。相比之下,专用空间推理模型在 UAV-DualCog 上未显现明显优势,尤其定位任务。这说明无人机双认知的关键挑战不在粗识别,而在精确时空定位。
表2:图像向 UAV 双认知任务结果。 深色/浅色分别为同模型组内最优/次优。
|
|
Rel.Pos Acc |
msIoU@50 |
msIoU |
Rel.Pos Acc |
msIoU@50 |
mIoU |
|
专有模型 |
|
|
|
|
|
|
|
Claude Sonnet 4.6 |
37.7 |
4.9 |
18.2 |
48.5 |
9.6 |
20.2 |
|
Gemini 3.1 Flash Lite |
33.7 |
0.0 |
0.2 |
47.6 |
0.2 |
1.0 |
|
Gemini 3 Flash |
47.6 |
0.7 |
1.2 |
56.2 |
0.1 |
0.9 |
|
GPT-5.5 |
38.0 |
19.4 |
26.2 |
65.4 |
17.6 |
25.1 |
|
GPT-5.4 |
37.9 |
12.2 |
24.2 |
37.8 |
12.9 |
24.5 |
|
GPT-5.3 |
35.2 |
11.9 |
23.5 |
56.5 |
14.9 |
22.5 |
|
Grok 4.1 Fast |
21.1 |
3.6 |
16.4 |
33.0 |
1.9 |
8.2 |
|
Mimo v2 Omni |
28.7 |
38.0 |
34.3 |
36.5 |
8.8 |
17.4 |
|
Qwen 3.7-Plus |
33.3 |
18.4 |
28.0 |
55.4 |
18.4 |
26.7 |
|
Qwen 3.6-Plus |
32.8 |
16.6 |
27.1 |
48.4 |
7.4 |
19.0 |
|
Qwen 3.6-Flash |
25.1 |
24.6 |
32.0 |
62.7 |
19.4 |
27.1 |
|
Qwen 3.5-Plus |
28.6 |
21.4 |
27.1 |
47.6 |
9.7 |
19.3 |
|
Qwen 3.5-Flash |
27.8 |
21.6 |
29.8 |
52.4 |
8.8 |
19.4 |
|
开源模型 |
|
|
|
|
|
|
|
GLM 4.6V |
30.8 |
9.4 |
8.7 |
29.2 |
3.3 |
6.7 |
|
Intern S1-Pro |
29.4 |
17.4 |
26.8 |
27.8 |
2.7 |
13.7 |
|
InternVL 3.5-241B |
32.9 |
28.4 |
31.2 |
50.1 |
5.4 |
15.8 |
|
InternVL 3.5-30B |
27.3 |
4.9 |
19.9 |
35.4 |
0.6 |
7.6 |
|
InternVL 3.5-14B |
22.8 |
7.6 |
22.2 |
28.5 |
4.7 |
12.9 |
|
InternVL 3.5-8B |
28.5 |
19.7 |
34.2 |
24.7 |
4.2 |
12.3 |
|
InternVL 3.5-4B |
25.6 |
3.1 |
19.8 |
22.4 |
1.0 |
8.0 |
|
Kimi K2.6 |
36.1 |
22.1 |
28.5 |
42.8 |
12.3 |
22.0 |
|
Kimi K2.5 |
34.3 |
27.1 |
30.4 |
39.4 |
5.0 |
15.6 |
|
Mimo v2.5 |
33.1 |
43.2 |
38.2 |
51.2 |
26.6 |
30.7 |
|
Qwen 3.5-397B |
27.4 |
3.3 |
12.6 |
47.9 |
2.8 |
13.0 |
|
Qwen 3.5-122B |
32.6 |
29.1 |
31.6 |
49.7 |
6.1 |
19.4 |
|
Qwen 3.5-35B |
29.5 |
27.6 |
30.5 |
53.2 |
6.1 |
14.5 |
|
Qwen 3.5-27B |
31.6 |
42.8 |
39.9 |
57.8 |
7.3 |
20.4 |
|
Qwen 3.5-9B |
29.0 |
15.9 |
25.8 |
53.2 |
10.3 |
20.9 |
|
Qwen 3.5-4B |
30.9 |
12.8 |
23.1 |
47.5 |
6.7 |
17.7 |
|
空间专用模型 |
|
|
|
|
|
|
|
SenseNova-SI-1.2 |
17.5 |
10.7 |
10.6 |
15.3 |
3.2 |
5.8 |
|
SpaceOm |
24.7 |
2.8 |
6.7 |
35.2 |
2.4 |
8.6 |
|
SpaceR |
20.6 |
2.4 |
6.0 |
42.4 |
1.8 |
5.4 |
|
SpaceThinker |
22.6 |
1.2 |
3.0 |
32.8 |
0.6 |
4.7 |
|
ViLaSR |
18.8 |
0.0 |
0.0 |
43.1 |
0.0 |
0.0 |
|
VST-7B-RL |
29.2 |
0.0 |
0.0 |
47.2 |
0.0 |
0.1 |
|
VST-7B-SFT |
28.1 |
0.0 |
0.0 |
46.5 |
0.0 |
0.2 |
(注:表2自感知侧含 Rel.Position + Future Obs 两列各3指标;环境感知侧含 Rel.Position + Action Dec 两列各3指标,限于篇幅合并示意,原始表为12数据列)
❀ 视频任务结果(表4)。相比图像评估,模型表现在视频设置下明显更不均衡,尤其涉及时序定位时。专有模型中 Gemini 3 Flash 在飞行行为识别上最佳准确率,Qwen 3.7-Plus 在地标可见性定位上更具竞争力。开源模型中 Mimo v2.5、Qwen3.5、Kimi 在时间定位上突出,InternVL 在识别准确率上相对更优。值得注意的是若干开源模型在部分定位指标上已超专有模型。相比之下专用空间推理模型整体仍有限,时间定位尤弱。这说明视频向无人机双认知比图像向更具挑战性,时间定位仍是当前MLLM的主要难点。
表4:视频向 UAV 双认知任务结果(飞行行为识别 + 地标可见性识别)。深色/浅色分别为同模型组内最优/次优。
|
|
Comp.Acc |
tIoU@50 |
mtIoU |
Rec.Acc |
F1@50 |
|
专有 |
|
|
|
|
|
|
Gemini 3.1 Flash Lite |
22.8 |
30.7 |
34.9 |
59.9 |
43.1 |
|
Gemini 3 Flash |
47.9 |
49.0 |
52.1 |
49.4 |
30.7 |
|
Mimo v2 Omni |
22.0 |
33.0 |
35.7 |
55.8 |
40.7 |
|
Qwen 3.7-Plus |
6.6 |
11.8 |
12.3 |
53.6 |
56.8 |
|
Qwen 3.6-Plus |
7.6 |
17.4 |
18.1 |
52.3 |
45.3 |
|
Qwen 3.6-Flash |
33.0 |
33.7 |
38.3 |
52.3 |
52.7 |
|
Qwen 3.5-Plus |
2.2 |
11.2 |
11.6 |
48.3 |
37.4 |
|
Qwen 3.5-Flash |
32.0 |
40.5 |
46.3 |
50.6 |
46.0 |
|
开源 |
|
|
|
|
|
|
GLM 4.6V |
23.2 |
1.0 |
5.2 |
30.2 |
16.5 |
|
InternVL 3.5-38B |
15.2 |
11.1 |
13.2 |
64.0 |
20.1 |
|
InternVL 3.5-30B |
17.0 |
10.6 |
12.1 |
42.4 |
8.7 |
|
InternVL 3.5-14B |
33.3 |
7.6 |
15.4 |
51.2 |
12.8 |
|
InternVL 3.5-8B |
26.2 |
7.8 |
15.1 |
52.9 |
19.4 |
|
InternVL 3.5-4B |
39.8 |
2.6 |
8.1 |
32.6 |
17.2 |
|
Kimi K2.6 |
12.1 |
19.1 |
19.7 |
39.9 |
48.3 |
|
Kimi K2.5 |
12.8 |
25.5 |
25.3 |
45.3 |
38.6 |
|
Mimo v2.5 |
35.9 |
44.0 |
48.7 |
58.5 |
54.4 |
|
Qwen 3.5-397B |
5.7 |
0.0 |
1.6 |
36.6 |
20.5 |
|
Qwen 3.5-122B |
21.9 |
26.0 |
29.8 |
47.1 |
40.1 |
|
Qwen 3.5-35B |
18.4 |
20.7 |
19.9 |
47.1 |
37.9 |
|
Qwen 3.5-27B |
12.2 |
18.9 |
19.1 |
41.3 |
40.8 |
|
Qwen 3.5-9B |
6.6 |
8.5 |
8.6 |
47.7 |
25.1 |
|
Qwen 3.5-4B |
2.3 |
2.3 |
2.3 |
29.7 |
38.2 |
|
空间专用 |
|
|
|
|
|
|
SpaceOm |
35.9 |
0.0 |
3.1 |
31.4 |
17.9 |
|
SpaceR |
22.2 |
0.0 |
2.6 |
32.6 |
15.6 |
|
SpaceThinker |
16.1 |
0.0 |
1.5 |
33.7 |
16.3 |
|
ViLaSR |
6.1 |
0.0 |
0.8 |
33.1 |
10.2 |
|
VST-7B-RL |
0.0 |
0.0 |
0.0 |
19.2 |
0.0 |
|
VST-7B-SFT |
0.0 |
0.0 |
0.0 |
25.6 |
3.7 |
4.3 分析与讨论
✏ 双认知差距。在图像与视频设置下,当前MLLM在双认知上表现出一致的不对称:图像上环境感知任务普遍比自感知更容易,说明从参考视角推断无人机相对状态的能力有限;视频上地标可见性识别和原子级理解通常比复合行为推理容易。这种模式说明自感知与环境感知在建模"无人机-环境"交互时暴露了不同瓶颈。
✏ 行为层级性。原子/复合设计揭示了模型能力的清晰层级:多数模型能识别局部动作或时间边界,但仍难以形成连贯的复合级行为理解。Gemini 3 Flash 是显著例外,在原子识别、复合推理和时间定位上表现较均衡。这支持了分层设计的价值——有助于区分"动作感知失败"与"行为组合失败"。
表5:thinking 变体、前沿模型与人类基线的额外验证(单位%)。"-T" 为低 thinking 强度;Gemini 3.1 Pro 与 Claude Opus 仅报告 thinking 模式;"—" 表示该模型不适用该模态。
|
专有 |
|
|
|
|
|
Claude Opus 4.8-T |
45.3 |
23.1 |
— |
— |
|
Claude Opus 4.7-T |
41.3 |
18.4 |
— |
— |
|
Claude Opus 4.6-T |
47.9 |
18.3 |
— |
— |
|
Gemini 3.1 Pro-T |
52.6 |
43.0 |
41.0 |
34.4 |
|
GPT-5.5-I |
52.6 |
25.2 |
— |
— |
|
GPT-5.5-T |
53.5 |
27.7 |
— |
— |
|
GPT-5.4-I |
37.3 |
24.1 |
— |
— |
|
GPT-5.4-T |
42.5 |
24.2 |
— |
— |
|
Qwen3.7-Plus-I |
41.7 |
27.6 |
31.4 |
37.0 |
|
Qwen3.7-Plus-T |
55.0 |
26.2 |
39.9 |
43.5 |
|
开源 |
|
|
|
|
|
Mimo v2.5-I |
40.3 |
33.8 |
41.6 |
48.4 |
|
Mimo v2.5-T |
44.7 |
24.5 |
34.9 |
41.7 |
|
Qwen3.5-9B-I |
40.9 |
24.7 |
29.8 |
33.1 |
|
Qwen3.5-9B-T |
40.2 |
19.3 |
27.2 |
29.5 |
|
人类基线 |
80.4 |
47.1 |
60.8 |
53.1 |
三点观察:
更强前沿模型提升图像绝对分:Qwen3.7-Plus-T、GPT-5.5-T、Gemini 3.1 Pro-T 图像准确率均超52%,但定位分仍远低于人类基线——说明更高答案准确率仍未解决"接地双认知"。
thinking 模式效果参差:对 Mimo v2.5、GPT-5.4/5.5、Qwen3.7-Plus 提升图像准确率,Qwen3.7-Plus-T 视频也优于 Instant;但 thinking 并未持续改善视频侧(Mimo v2.5、Qwen3.5-9B 反而降),说明仅靠更长文本 deliberation 不足以应对长视频无人机上下文——需要稳定的时间整合与证据追踪。
人类基线显著优于所有被测MLLM,说明 UAV-DualCog 对人类可理解可解,低模型分非任务设计无效所致。
表6:额外 Instant 与 Thinking 模型样本的失败类型分布(基于700 Instant + 600 Thinking 样本,6类错误族)。
|
视觉感知 / 地标身份 |
0.0 |
13.5 |
|
空间定位 |
15.9 |
17.8 |
|
双坐标系空间推理 |
33.7 |
16.2 |
|
运动语义 / 动作层级 |
21.9 |
17.1 |
|
时间追踪 / 定位 |
23.6 |
16.0 |
|
语言、逻辑或协议 |
5.0 |
19.3 |
Instant 下双坐标空间推理是最大错误族(33.7%),其次时间追踪(23.6%)与运动语义(21.9%)。任务级拆分更尖锐:自我相对位置推理被双坐标错误主导(70.2%),环境可见性推理被时间追踪错误主导(93.1%)。Thinking 下分布更均衡,但图像任务仍受累于空间定位与双帧推理,视频任务对运动语义与时间追踪仍敏感。说明 UAV-DualCog 探测的是无人机特有的接地双认知,而非仅通用视觉识别。
✏ 开放式验证:为检验结论是否仅由多选选项导致,我们在移除答案选项后额外评估了代表性任务——相同瓶颈仍在:自状态推断、视角变换、目标定位、时间定位。例如 Stage-4 开放式下 Qwen3.5-9B 自相对位置仅 11.73%、环境相对位置 29.88%;Stage-3 开放式下该模型原子动作准确率 62.55%,但时间定位仍低(F1@0.5=26.10%, mean tIoU=30.35%)。这支持了我们的设计选择:MCQ 只是接口,所要求的边界框与时间区间才提供基于证据的地信号。
✏ 定性分析:观察到三种常见错误模式——视角切换失败、答案预测与定位不匹配、从局部时间线索到全局行为语义的弱整合。图4可视化了两个双认知推理的代表性失败案例:(左)自状态例——GPT-5.3 与 Claude Sonnet 4.6 大致定位了目标地标但未从"地标中心参考系"推理,故预测错相对方向;Gemini 3.1 Flash Lite 也未完成参考系变换且无有效定位框;Qwen3.5-Plus 方向对但定位不精。(右)环境状态例——Qwen3.5-Plus 计数对但返回不完整可见区间;GPT-5.3 与 Gemini 3.1 Flash Lite 未能连续追踪目标致计数错;Claude Sonnet 4.6 的区间定位最完整稳定。这些案例揭示了图像与视频推理中"识别 vs 定位"的 gap。
4.4 两阶段优化探针
我们进一步检验 UAV-DualCog 能否作为有效监督(旨在测试基准形式、构建流水线、结构化输出与证据接地协议能否提供有用训练信号)。具体地,从未使用场景构建 hold-out 训练集,做轻量两阶段优化探针——验证 UAV-DualCog 监督能否同时改善答案预测与定位。
🔧 训练集构建:从6个与测试集不相交的场景构建 UAV-DualCog-Train,含234个有效地标、11,232个图像任务样本,覆盖4类图像任务、2个难度等级、均衡的自/环境感知分支。每样本保留原始多模态提示、真实图像输入、离散答案与归一化目标框——与官方图像任务评估协议对齐。
🔧 模型与训练流程:底座用 Qwen3.5-4B(小且保留通用多模态能力)。第一阶段多模态 SFT 以稳定含答案选项+边界框的结构化JSON输出;第二阶段对输出格式、答案正确性、框定位质量做联合 GRPO:

其中 Rformat检查JSON schema遵从,Ranswer评离散选项,Rbbox通过归一化框GIoU映射到[0,1]度量空间证据质量。此设计直指表2观察到的"识别-定位gap"——很多模型能选 plausible 答案但给不出可靠空间证据。
表7:基于 UAV-DualCog-Train 在 Qwen3.5-4B 上的两阶段优化结果(旨在测试是否提供有用结构化监督,而非提新架构)。
|
图像选项 Acc |
38.99 |
59.77 |
+20.78 |
|
图像 BBox@0.5 |
9.27 |
61.04 |
+51.76 |
|
图像 mIoU |
20.12 |
52.78 |
+32.66 |
|
视频全局 Acc |
16.75 |
26.67 |
+9.91 |
|
视频 F1@0.5 |
16.51 |
33.40 |
+16.89 |
|
视频 mtIoU |
18.74 |
34.58 |
+15.84 |
图像侧增益显著:选项准确率 38.99→59.77,BBox@0.5 9.27→61.04,mIoU 20.12→52.78——说明监督不仅改善离散答案预测,也改善"将答案绑定到空间证据"的能力。视频任务上,尽管训练集仅含图像任务样本,模型在时间准确率/F1/mtIoU 仍有迁移增益,暗示"证据感知的图像监督"可部分迁移至时间推理。
⚠ 迁移边界:迁移不均。自行动识别提升显著(原子动作F1@0.5 从3.04→49.08),但环境可见性推理 F1@0.5 从45.18 降至 24.23。这与监督信号一致:图像侧训练强化了静态地标识别、选项预测与框定位,但未直接约束跨帧目标一致性、区间合并或可见性计数推理。两点结论:① UAV-DualCog 为接地双认知提供了有用结构化监督;② 可靠无人机多模态系统仍需显式视频侧监督或跨帧目标,以随时间对齐自状态与环境状态认知。
5. 结论
我们提出 UAV-DualCog——一个从双认知视角评估无人机时空推理的基准。通过跨图像/视频任务联合度量自我状态与环境状态认知,UAV-DualCog 为具身航空推理提供了统一测试床与数据资源。它构建于场景级语义点云上的可扩展流水线,支持自动生成观测、标注与问答对。在大量轻量MLLM上的实验表明当前模型在可靠无人机推理上仍吃力,尤其在自状态理解、时间定位与精确定位方面。通过从不相交场景构建 UAV-DualCog-Train,轻量优化探针进一步表明该数据集可提供有用结构化监督,而对视频任务的不均迁移则凸显了跨帧一致性这一遗留挑战。未来工作将进一步把构建流水线连接到更多模拟器与真实世界数据集,以缩小接地双认知评估中的 sim-to-real gap。希望 UAV-DualCog 能作为未来基于MLLM的无人机智能体与具身航空智能研究的有用测试床和数据资源。






