文章:Full field-of-view pavement stereo reconstruction under dynamic traffic conditions: Incorporating height-adaptive vehicle detection and multi-view occlusion optimization
地址:https://www.sciencedirect.com/science/article/abs/pii/S092658052200485X?via%3Dihub
动态交通条件下的全视角路面立体重建:结合高度自适应车辆检测和多视角遮挡优化
动态交通条件指在车辆通行的实际道路环境中,移动车辆会遮挡路面导致数据缺失并产生图像匹配噪声,从而影响三维重建质量与速度的状况。
全视角路面立体重建是指利用多视角或全景图像数据,通过立体视觉技术恢复道路表面完整三维几何结构的过程。
全景图像数据是指通过专用设备或软件拼接而成的、能覆盖360度水平视野甚至全向空间的宽幅视觉信息集合
立体视觉技术是通过模拟人眼双目视差,利用多视角图像计算深度信息以重建三维场景的方法。
高度自适应车辆检测是指检测算法能自动调整参数,以适应不同拍摄高度(如无人机或车载相机)获取的图像中车辆尺度剧烈变化的技术。
多视角遮挡优化是指利用多个视角的图像信息,通过融合或选择最优视角来减少或避免目标被遮挡影响的处理方法。
无人机摄影测量是利用无人机搭载相机从空中拍摄高重叠率照片,通过后续软件处理来精确测量地面物体并生成三维模型或地图的技术。将无人机摄影测量技术与深度学习算法结合起来,用于在有车辆行驶的交通环境下,对路面进行高精度的三维重建。

基于YOLO算法的无人机专用检测器,用于在不同飞行高度拍摄的图像中,对车辆进行高精度的位置识别和定位。
YOLO是一种将目标检测视为回归问题的实时对象检测算法,能一次性预测图像中所有物体的位置和类别。
YOLO将目标检测视为回归问题的方式,是通过一个单一的卷积神经网络,直接从输入图像像素回归出边界框的坐标和类别概率。
YOLO算法目前最新的版本是YOLO26,由Ultralytics于2026年1月正式发布。

多视角遮挡优化的方法,目的是为了在从多个角度进行路面三维重建时,既能提升最终模型的质量,又能加快重建的速度。
建立二维/三维数字表面数据集,是指收集并整理了包含路面二维图像和对应三维几何模型的数据集合,用来训练和测试自动识别路面缺陷的算法。
三维表面信息是指物体表面的立体几何数据,包含其三维坐标、形状和高程变化等细节。
形状看整体轮廓,高程变化看表面具体细节的起伏。
路面数字重建是指利用摄影测量或激光扫描等技术,将真实的路面转换成计算机中的三维数字模型。
视场限制是指在一次拍摄中,相机或传感器能够捕捉到的空间范围有限。
嵌入深度可分离卷积和分辨率调整单元的无人机-YOLO 车辆探测器,针对无人机航拍场景优化的轻量化目标检测器,通过嵌入深度可分离卷积来减少模型参数和计算量,并加入分辨率调整单元来适应不同飞行高度带来的车辆尺度剧烈变化,从而在无人机平台上实现高精度、实时的车辆检测。
嵌入深度可分离卷积是一种将标准卷积分解为深度卷积和逐点卷积两步的轻量化技术。
AP75 是目标检测领域的一个评估指标,表示当预测框与真实目标框的交并比阈值设为 0.75 时,模型的平均精度值 。它衡量的是模型对目标的定位精度,要求预测框必须与真实框高度重合才算检测正确,因此数值通常会比要求较低的 AP50 更低
推断速度 157 FPS 表示该检测器每秒钟可以处理 157 张图像,说明它的运行速度非常快,能够满足无人机航拍等场景对实时检测的需求。
FPS 是每秒传输帧数,用来衡量模型或设备每秒钟能处理多少张图像。数值越高,处理速度越快,实时性越好。
传统 SfM(运动恢复结构)工作流程是指从一组无序图像中自动恢复出相机参数和场景三维结构的过程。它通常包含特征提取与匹配、几何验证、增量式重建、光束法平差优化等核心步骤。
全视角是指覆盖了水平360度和垂直完整视野的空间范围;高精度表面数据是指包含物体表面精细几何细节和准确空间位置的三维测量数据。
数值模拟是指利用计算机软件,通过设定数学模型和边界条件来模拟和预测真实物理过程或工程系统行为的方法。
基于激光成像和立体成像是两种获取物体三维信息的主动和被动技术。激光成像通过发射激光并接收反射信号来直接测量距离,精度高但设备昂贵;立体成像则通过多个相机拍摄的图像,利用视差原理计算深度,成本较低但受光照和纹理影响较大。
大多数激光测量系统基于飞行时间或投影原理。飞行时间原理是通过发射激光脉冲并测量其反射回来所需的时间来计算距离;投影原理则是通过向物体表面投射激光条纹或光栅,并观察其在物体上的变形来推算出三维形状。
TOF 激光系统是一种通过发射激光脉冲并精确测量其从发射到经物体反射后返回的时间,来直接计算目标距离的主动测距设备。
空间分辨率是指图像中一个像素点能够代表的地面实际尺寸大小。数值越小,分辨率越高,能看到的细节就越清晰。
激光投影角通常指激光束从发射器射出时的最大扫描范围或张角,决定了投影画面的宽度;在测量领域,也指激光投影面与被测物体或相机主光轴之间的夹角。
视差是指当从不同位置观察同一物体时,该物体相对于远处背景所产生的方向差异或位置偏移。在计算机视觉中,它是立体匹配算法的核心基础,通过计算左右图像中对应像素点的水平位置差来推算物体的深度信息。
极线几何是立体视觉中描述同一物体在两个不同视角成像平面上投影点之间几何约束关系的理论。它指出左图上的任意一个点,在右图上的对应匹配点必然位于一条特定的直线上,这条线被称为极线。这个约束可以大幅缩小特征匹配的搜索范围,是双目立体匹配和三维重建的关键基础。
两个不同视角成像平面是指从两个不同位置或角度的相机分别拍摄图像时,各自对应的图像平面。比如左相机和右相机的成像平面,它们记录了同一个场景从不同视角观察到的二维投影。
大视场重建是指对具有广阔视野的场景进行三维建模,通常需要将多个视角获取的数据进行精确对齐与融合。
运动结构模型是指通过分析一组从不同视角拍摄的二维图像序列,自动恢复出相机运动参数和场景三维结构的计算机视觉技术。
平均纹理深度(MTD)是表征路面表面宏观构造的一个关键性指标。它通过量化路面凸起与凹陷之间的平均高差,来评价路面的粗糙程度,并与路面的抗滑性能、噪音水平等使用功能密切相关。
数字MTD是指利用三维激光图像等数字化技术,通过算法和数值模拟计算出的路面平均纹理深度值;而手动MTD是指采用传统的铺砂法(也称人工砂补试验)在现场通过物理方式实测得到的路面平均纹理深度值。
传统的铺砂法是一种在现场手动测量路面纹理深度的试验方法。它的具体做法是:在清洁干燥的路面上,用已知体积的标准砂填充路面表面的空隙,形成一个圆形砂面,然后测量该圆的直径,通过公式计算出砂体的平均深度,以此来代表路面的纹理深度。
区域纹理参数是指对一个特定区域内的表面三维形态进行量化描述的统计指标,例如该区域内的平均高度、均方根高度或高度方差等,用以全面评价该区域的纹理特性。
地面控制点是测绘和摄影测量中一种用于地理参考的关键地面标记点。它的三维地理坐标被预先精确测量,然后在重建的图像或模型中作为绝对位置基准,用于校正和配准,从而确保最终生成的模型具有准确的地理空间位置。
UAV-SfM是指结合无人机和运动结构恢复技术的三维重建方法。它通过无人机搭载相机从空中采集高重叠率影像,然后利用SfM算法从这些影像中自动解算相机位置并生成场景的稀疏三维点云,再通过密集匹配技术最终获得高精度的三维模型。
全视野路面重建且图像重叠率高,是指在对路面进行完整三维建模时,要求相邻的航拍图像之间有足够多的共同区域,以确保后期软件能精确匹配和拼接,生成连续且无空洞的路面模型。
基于区域的 CNN 是一种两阶段目标检测方法,它先在图像中生成可能包含目标的候选区域,再对这些区域进行分类和位置精修。端到端 CNN 是一种单阶段方法,它使用一个统一的网络直接从输入图像映射到最终的检测结果,无需生成候选区域的中间步骤。
基于区域的 CNN 是分步走,先生成候选区域再精修;端到端 CNN 是直接一步到位输出结果。
多视角立体优化程序是一种三维重建算法,它利用从多个视角拍摄的图像,通过优化能量函数来生成密集、精确的三维点云模型。
SfM 是一种通过分析一组有重叠区域的二维图像来自动恢复场景三维结构和相机运动参数的计算机视觉技术。
全视野数字路面模型是指通过无人机航拍和三维重建技术,生成的无死角、覆盖整个检测区域的高精度路面数字化三维表示。
深度可分离卷积是一种将标准卷积拆分为深度卷积和逐点卷积两步的轻量化技术,能大幅减少参数量;主动分辨率调整单元是指网络能根据输入图像的尺度变化,动态调整特征图的尺寸,以更好地适应不同大小的目标。






