Spatial-ORMLLM论文总结与核心部分翻译
一、论文主要内容总结
(一)研究背景与问题
手术室(OR)中的精准空间建模对术中感知、风险规避及手术决策至关重要,但现有方法存在两大核心问题:
(二)模型核心设计
提出Spatial-ORMLLM——首个仅基于RGB模态实现手术室3D空间推理的大型视觉语言模型,核心架构包含两部分:
- 深度图(Depth Map):基于改进的Depth Anything V2模型,通过L1损失与梯度损失优化,保证几何平滑性与绝对精度;
- 全景分割掩码(Panoptic Segmentation Mask):借鉴Segment Anything V2,采用交叉熵与Dice损失联合训练,实现像素级语义分类;
- 点云(Point Cloud):结合相机内参/外参,将深度图反投影为3D


