作者:David Huang, Guile Wu, Chengjie Huang, Bingbing Liu, Dongfeng Bai
机构:Huawei Noah’s Ark Lab、University of Toronto、Foundation Model Department, Huawei
原文链接:https://arxiv.org/abs/2605.14315
代码链接:https://turbovggt.github.io/
导读
最近出现的基于前馈机制的3D重建方法,比如视觉几何变换器,通过实现在单次处理过程中进行多视图重建的功能,极大地提升了传统的逐场景优化方式。不过,现有的大多数方法难以在重建质量与计算效率之间找到平衡点,这限制了它们的应用范围和效率。虽然有一些高效的视觉几何变换器被开发出来,但它们通常在各层和各帧中采用相同的稀疏度设置,且缺乏能够自动选择合适特征来捕捉全局关系的机制,从而导致性能不佳。在这项研究中,我们提出了TurboVGGT这一创新性方法。该方法利用高效的视觉几何变换器以及自适应的注意力机制,实现了快速的多视图3D重建。具体而言,TurboVGGT采用了端到端的训练框架,通过自适应的稀疏度选择来引导全局注意力的分配,从而捕捉不同帧之间的全局关系;同时,它还利用帧内注意力机制来提取每帧中的局部细节。在自适应稀疏全局注意力机制中,TurboVGGT能够根据不同帧的情况,动态选择合适的特征来进行全局几何建模。因为特征的重要性因帧而异,所以注意力机制会在不同的抽象层次上处理这些特征,而全局依赖关系则取决于那些具有结构信息的区域。通过在多个3D重建基准测试上的实验,我们证明TurboVGGT能够在保持与最先进方法相当的质量的同时,实现快速的重建速度。
效果展示
展示我们TurboVGGT用于快速多视角3D重建的示意图。(a)点云重建结果的视觉化展示。TurboVGGT在推理时间和峰值GPU内存使用量方面显著提高了计算效率。(b)7-Scenes上推理时间与点云准确度的对比。与现有最先进的方法相比,TurboVGGT在准确性与效率之间实现了更好的平衡。(c)7-Scenes上帧数与推理时间之间的对比。TurboVGGT能够更有效地随着输入帧数的增加而进行扩展。TurboVGGT/TurboVGGT-/TurboVGGT-M在处理1000帧的输入序列时,相较于VGGT可实现7倍/11倍/18倍的加速效果。

点云重建、相机位姿估计和深度估计的定性比较。

引言
多视角三维重建是计算机视觉领域的一个长期存在的难题。其目标是从一组不同视角拍摄的二维图像中重建场景的三维几何结构。该技术已广泛应用于机器人、自动驾驶和虚拟现实等多个领域。传统方法,如运动恢复结构和多视角立体视觉,通常采用多阶段范式来估计相机姿态并重建三维几何结构。这一范式能够有效生成精确的重建结果,但计算成本较高。
近年来,基于学习的三维重建方法已成为传统范式的一种有前途的替代方案,从逐场景的迭代优化转向使用端到端神经网络直接从图像推断三维几何结构。特别是,基于视觉几何Transformer的前馈重建方法(例如VGGT、MapAnything和π³)的出现,彻底改变了多视角三维重建,能够在单次前向传递中高效且鲁棒地估计相机姿态、深度图和点图。尽管取得了显著进展,这些方法在平衡重建质量与计算效率方面仍面临挑战。这限制了它们的可扩展性,并阻碍了它们在时间敏感场景中的应用。更近期的一些研究揭示,视觉几何Transformer的高计算成本主要源于全局注意力层中密集的全局令牌交互,其复杂度与输入令牌数量呈二次关系。为解决此问题,现有方法通常采用令牌合并、稀疏注意力或令牌下采样策略来减少参与全局注意力的令牌数量。尽管这些方法能够加速用于三维重建的视觉几何Transformer,它们仍然存在一些局限性。首先,它们通常在所有层和帧上采用相同的稀疏率,这可能并非最优,因为令牌重要性在不同帧间可能不同,且注意力层在不同抽象层次上操作令牌。其次,它们缺乏自适应学习能够有效捕捉全局关系的有代表性令牌的机制。由于全局依赖关系通常依赖于结构信息丰富的区域,学习代表性令牌有助于全局几何建模并减少冗余计算。
为解决这些局限性,本文提出了一种名为TurboVGGT的新方法,该方法提高了用于快速多视角三维重建的视觉几何Transformer的效率。TurboVGGT的核心思想是构建一个带有自适应交替注意力模块的视觉几何Transformer,该模块包含由自适应稀疏选择引导的自适应稀疏全局注意力(用于捕捉全局关系)和帧内注意力(用于聚合每帧内的局部细节)。具体而言,考虑到令牌重要性在不同帧间可能有差异,且注意力层在不同抽象层次上操作令牌,TurboVGGT采用一个门控网络,为不同帧在不同全局注意力层自适应地分配不同的稀疏率。然后,在对应于特定稀疏率的每个分支中,TurboVGGT使用自适应稀疏全局注意力来学习压缩的代表性令牌,用于全局几何建模。这使得TurboVGGT能够有效学习代表性令牌以捕捉全局关系,同时减少冗余计算。此外,遵循现有工作,TurboVGGT还引入了帧内注意力来聚合每帧内的局部细节。我们在多个三维重建基准上进行了广泛实验以评估所提出的TurboVGGT。实验结果表明,TurboVGGT在实现快速多视角三维重建的同时保持了高重建质量,优于现有最先进方法。
主要贡献
我们的贡献如下:
• 提出了一种新颖的带有自适应交替注意力模块的视觉几何Transformer,用于快速多视角三维重建。
• 提出了一种用于视觉几何Transformer的自适应稀疏选择机制,该机制为不同层中的不同帧自适应地选择不同的稀疏率。
• 提出了一种用于视觉几何Transformer的自适应稀疏全局注意力,通过学习代表性令牌来建模全局几何关系。
• 在多个三维重建基准上进行了广泛实验,证明了所提方法相较于现有最先进方法的优越性。
方法
我们设计的动机。(a)在7-Scenes上单次前向传递过程中框架注意力层与全局注意力层之间的比较。(b)交替注意力块中平均全局注意力图的视觉化展示。(c)全球注意力层中各层和各帧内高度激活的片段标记(激活度排名前5%的标记)的示意图。(d)单次前向传递过程中交替注意力块与自适应交替注意力块之间的运行时比较。

图2展示了所提出的TurboVGGT的概览。TurboVGGT的整体架构包括一个视觉编码器、N个自适应交替注意力模块以及多个任务特定的预测头。
视觉编码器。给定一个包含L张图像{Iᵢ}{i=1}^{L}的序列,我们首先使用一个视觉编码器(例如DINOv2)从每张图像中提取M个补丁令牌,记为{xᵢⱼ}{j=1}^{M},其中xᵢⱼ ∈ Rᴰ是一个D维的补丁令牌。此外,遵循先前工作,我们还在补丁令牌序列后附加额外的可学习令牌(如相机令牌和寄存器令牌),作为后续模块的输入。
自适应交替注意力模块。接下来,我们使用N个所提出的自适应交替注意力模块来处理输入的令牌序列。如图2所示,自适应交替注意力由自适应稀疏选择、自适应稀疏全局注意力和帧内注意力组成。具体地,在每个模块中,我们首先聚合每帧的补丁令牌,并使用一个门控网络为每帧生成门控分数。基于门控分数,我们将每帧的补丁令牌路由到对应特定稀疏率k_k的分支,并为每帧生成压缩的代表性令牌。然后,我们在压缩令牌与密集令牌之间执行交叉注意力,以捕捉跨帧的全局对应关系。之后,我们对来自每帧的令牌执行帧内注意力,以捕捉每帧内部的局部几何细节。该过程重复N个模块。
任务特定的预测头。最后,我们聚合来自自适应交替注意力模块的输出令牌,并使用多个任务特定的预测头将学习到的令牌解码为每个视图的各种三维属性。如图2所示,使用MLP头来预测相机参数和度量缩放因子,而使用DPT头来预测深度图、点图、置信度图等。

实验结果
点云重建。表1展示了在7-Scenes、N-RGBD和ScanNet数据集上的点云重建结果。总体而言,我们的TurboVGGT在保持相当或更优性能的同时,实现了比现有最先进方法更快的推理速度。具体地,在7-Scenes数据集上,我们的TurboVGGT在大多数指标上优于FastVGGT、SparseVGGT和AVGGT等最先进方法。有趣的是,TurboVGGT的整体重建质量优于VGGT,同时速度快2-4倍。这归功于在自适应稀疏选择引导下的自适应稀疏全局注意力,它能够有效捕捉全局上下文同时减少冗余计算。在N-RGBD数据集上,我们的TurboVGGT也实现了有竞争力的重建性能,同时推理速度快于先前方法。尽管TurboVGGT在某些指标上的重建质量略逊于FastVGGT,但TurboVGGT在步长10设置下比FastVGGT快1.4倍,在步长3设置下快2.1倍。在ScanNet数据集上,TurboVGGT实现了最佳的重建质量,同时速度快于先前方法。

相机姿态估计。我们在表2中报告了在7-Scenes(密集,步长=3)、N-RGBD(密集)和RealEstate10K(稀疏)上的相机姿态估计结果。在7-Scenes和N-RGBD上,与FastVGGT、SparseVGGT、AVGGT和VGGT等最先进方法相比,我们的TurboVGGT实现了最佳的相机姿态估计性能和更快的推理速度。此外,我们还在包含稀疏图像序列的RealEstate10K上评估了TurboVGGT。在该稀疏设置下,TurboVGGT仍然取得了有竞争力的性能。这些结果表明了我们的TurboVGGT在不同设置下进行相机姿态估计的高效性和有效性。

深度估计。表3展示了在7-Scenes(密集)、N-RGBD(密集)和Sintel(单目)上的深度估计结果。在7-Scenes上,我们的TurboVGGT取得了第二好的AbsRel和最好的δ<1.25,同时速度快于先前方法。在N-RGBD上,我们的TurboVGGT在所有指标上均取得了最佳结果。此外,我们在Sintel上评估了TurboVGGT的单目深度估计性能。在该单目深度估计设置下,TurboVGGT仍然取得了有竞争力的性能,展示了我们方法在不同设置下的泛化能力。
总结 & 未来工作
在本文中,我们提出了TurboVGGT,用于以端到端前馈方式进行快速多视角三维重建。TurboVGGT的核心思想是构建一个高效的自适应交替注意力模块的视觉几何Transformer,该模块包含由自适应稀疏选择引导的自适应稀疏全局注意力(用于全局几何建模)和帧内注意力(用于局部细节聚合)。在多个三维重建基准上的大量实验表明,TurboVGGT在重建质量与计算效率之间实现了更好的平衡,优于现有最先进方法。







