欢迎光临
我们一直在努力

2025_NIPS_3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding

一、文章主要内容总结

该研究聚焦多模态大语言模型(MLLMs)在3D场景理解中的局限性,核心围绕“MLLMs预训练缺乏明确3D数据导致3D表征能力不足”这一问题展开,主要内容如下:

  • 问题提出与核心研究:现有MLLMs依赖2D预训练知识迁移实现3D推理,但缺乏3D感知能力。研究通过多视图对应性评估MLLMs的3D感知水平,发现3D感知表征质量与下游任务性能呈强正相关。
  • 解决方案:3DRS框架:提出3D感知表征监督框架(3DRS),利用预训练3D基础模型(如VGGT、FLARE)的丰富3D知识,通过特征蒸馏将MLLM的视觉特征与3D基础模型的特征对齐,增强MLLMs的3D感知能力。框架同时结合传统文本监督与3D专属监督,且无额外训练开销(监督特征可离线预提取)。
  • 实验验证:在6个3D场景理解基准(包括视觉定位、字幕生成、问答等任务)上,对LLaVA-Next-Video、LLaVA-One-Vision、Qwen2-VL等MLLMs进行测试,结果显示3DRS持续提升模型性能,且在与现有SOTA模型对比中表现最优。
  • 辅助分析:通过消融实验验证了3D基础模型优于2D基础模型、深层监督效果更佳、3D专属监督比简单对应性损失更有效等结论。
  • 二、文章创新点

  • 系统性评估MLLMs的3D感知能力:提出基于多视图对应性的评估方法,量化MLLMs对同一3D体素在不同视图下的特征一致性,首次明确
  • 赞(0)
    未经允许不得转载:171主机测评 » 2025_NIPS_3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址