欢迎光临
我们一直在努力

Spatial-ORMLLM: Improve Spatial Relation Understanding in the Operating Room with Multimodal Larg...

Spatial-ORMLLM论文总结与核心部分翻译

一、论文主要内容总结

(一)研究背景与问题

手术室(OR)中的精准空间建模对术中感知、风险规避及手术决策至关重要,但现有方法存在两大核心问题:

  • 多数医院(尤其是社区或区域级)受成本、基础设施或临床流程干扰顾虑限制,缺乏多模态3D数据采集设备,仅能获取单目RGB视频/图像;
  • 单纯依赖2D数据训练的模型,无法捕捉复杂手术室场景中的细粒度空间细节(如人员与器械的相对位置、遮挡场景下的物体关系),导致空间推理能力薄弱。
  • (二)模型核心设计

    提出Spatial-ORMLLM——首个仅基于RGB模态实现手术室3D空间推理的大型视觉语言模型,核心架构包含两部分:

  • 3D空间块(3D Spatial Block):从单张RGB图像中推断三种“伪模态”(pseudo-modalities):
    • 深度图(Depth Map):基于改进的Depth Anything V2模型,通过L1损失与梯度损失优化,保证几何平滑性与绝对精度;
    • 全景分割掩码(Panoptic Segmentation Mask):借鉴Segment Anything V2,采用交叉熵与Dice损失联合训练,实现像素级语义分类;
    • 点云(Point Cloud):结合相机内参/外参,将深度图反投影为3D
  • 赞(0)
    未经允许不得转载:171主机测评 » Spatial-ORMLLM: Improve Spatial Relation Understanding in the Operating Room with Multimodal Larg...
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址