欢迎光临
我们一直在努力

高斯泼溅技术-从入门到精通

4D高斯泼溅:动态场景重建

原版3DGS是为静态场景设计的——它假设场景中的所有物体在拍摄期间保持不动。现实里当然不是这样:人会走路,树叶会飘动,汽车会行驶。把时间维度加进来,就是4D Gaussian Splatting要解决的问题。

本文梳理主要的4D GS思路,重点是 4D-GS(Yang et al., 2023)和 Spacetime Gaussians(Li et al., 2023)这两个代表性工作。


目录

  • 1. 静态到动态:增加了什么困难
  • 2. 4D高斯泼溅的核心思路
    • 2.1 变形场(Deformation Field)方案
    • 2.2 时空高斯(Spacetime Gaussian)方案
  • 3. 4D-GS:变形场 + 多分辨率神经网络
  • 4. Spacetime Gaussians:4D椭球表示
  • 5. 训练策略与数据要求
  • 6. 应用场景
  • 7. 与基于NeRF的动态方法对比
  • 8. 参考资料

1. 静态到动态:增加了什么困难

静态场景重建的输入是一组来自不同相机位置的图片,场景内容不变,模型只需要学习空间分布。

动态场景的输入是视频(多帧,场景随时间变化),或者多相机同步拍摄(不同空间角度,相同时刻)。问题的本质变了:

时空纠缠:不同时刻的图像里,同一个区域的内容可能完全不同(人走过去了),模型需要同时理解空间结构和时间变化。

观测约束减少:对于视频输入,每一帧只有一个相机角度(单目视频),对应时刻的3D场景严重欠约束。静态NeRF可以用多视角约束弥补,动态场景每个时刻只有一个视角,必须引入额外约束(运动平滑性、形状先验等)。

计算量增加:时间维度带来了更多参数和更复杂的优化问题。


2. 4D高斯泼溅的核心思路

解决动态场景主要有两类思路:

2.1 变形场(Deformation Field)方案

核心思想:维护一组"规范空间(Canonical Space)"里的静态高斯体,再用一个变形场网络学习从规范空间到每一帧时刻的形变映射。

Δ

G

t

=

F

(

G

c

a

n

o

n

i

c

a

l

,

t

)

\\Delta G_t = \\mathcal{F}(G_{canonical}, t)

ΔGt​=F(Gcanonical​,t)

给定时刻

t

t

t,变形场网络

F

\\mathcal{F}

F 输出每个高斯体的位置偏移

Δ

μ

\\Delta\\mu

Δμ、旋转偏移

Δ

r

\\Delta r

Δr 和缩放偏移

Δ

s

\\Delta s

Δs,叠加到规范高斯体上,得到该时刻的高斯体分布,然后正常渲染。

优点:规范空间的高斯体可以复用3DGS的优化框架;变形场网络相对轻量。

缺点:变形场隐式编码了运动,不如显式时空表示直观;对于拓扑变化(物体出现/消失)的场景处理困难。

2.2 时空高斯(Spacetime Gaussian)方案

核心思想:把高斯体从3D扩展到4D——每个高斯体不仅有空间参数,还有时间维度的均值

μ

t

\\mu_t

μt​ 和方差

σ

t

2

\\sigma_t^2

σt2​,表示这个高斯体在时间上的"影响范围"。

G

(

x

,

t

)

=

G

s

p

a

t

i

a

l

(

x

)

⋅

G

t

e

m

p

o

r

a

l

(

t

)

=

exp

⁡

(

−

∥

x

−

μ

x

∥

Σ

2

2

)

⋅

exp

⁡

(

−

(

t

−

μ

t

)

2

2

σ

t

2

)

G(\\mathbf{x}, t) = G_{spatial}(\\mathbf{x}) \\cdot G_{temporal}(t) = \\exp\\left(-\\frac{\\|\\mathbf{x}-\\boldsymbol{\\mu}_x\\|_{\\Sigma}^2}{2}\\right) \\cdot \\exp\\left(-\\frac{(t-\\mu_t)^2}{2\\sigma_t^2}\\right)

G(x,t)=Gspatial​(x)⋅Gtemporal​(t)=exp(−2∥x−μx​∥Σ2​​)⋅exp(−2σt2​(t−μt​)2​)

时间高斯表示"这个高斯体在时刻

μ

t

\\mu_t

μt​ 附近最强,随时间衰减",自然地处理了瞬态物体(只在某一时段出现)和持久物体(全程存在)。


3. 4D-GS:变形场 + 多分辨率神经网络

4D Gaussian Splatting(Yang et al., 2023)是变形场方案的代表性实现。

架构:

规范空间高斯体(Canonical Gaussians)
+ 时刻 t
↓
多分辨率哈希编码(来自Instant-NGP的思路)
→ 对高斯体位置 + 时刻 t 做空时联合编码
↓
轻量变形 MLP(Deformation MLP)
→ 预测 Δμ, Δr, Δs
↓
当前时刻高斯体 = 规范高斯体 + 变形
↓
标准3DGS渲染(可微光栅化)
↓
与真实帧对比,计算损失,反向传播

多分辨率哈希编码的引入是关键创新——直接用 MLP 编码时空特征太慢,哈希编码把空时特征压缩到固定大小的表里,推理速度大幅提升。

实验结果(D-NeRF数据集):

方法PSNR训练时间渲染速度
D-NeRF 29.67 ~48h <1 FPS
TiNeuVox 32.67 ~30min ~1 FPS
4D-GS 34.05 ~25min ~30 FPS

4. Spacetime Gaussians:4D椭球表示

Spacetime Gaussians(Li et al., SIGGRAPH Asia 2023)采用显式4D高斯体,不依赖变形场网络。

每个4D高斯体有额外的时间参数:

  • μ

    t

    \\mu_t

    μt​:该高斯体最活跃的时刻

  • σ

    t

    \\sigma_t

    σt​:在时间维度上的扩散范围(方差)

  • 颜色用4D球谐函数编码(同时对空间方向和时间做函数近似)

渲染时刻

t

t

t 的流程:

  • 对所有4D高斯体计算时间响应

    G

    t

    e

    m

    p

    (

    t

    )

    =

    exp

    ⁡

    (

    −

    (

    t

    −

    μ

    t

    )

    2

    2

    σ

    t

    2

    )

    G_{temp}(t) = \\exp\\left(-\\frac{(t-\\mu_t)^2}{2\\sigma_t^2}\\right)

    Gtemp​(t)=exp(−2σt2​(t−μt​)2​)

  • 只处理时间响应高于阈值的高斯体(大部分高斯体在任意时刻都不需要计算)
  • 对激活的高斯体做标准3D投影和alpha合成
  • 优点:完全显式,无需神经网络,渲染速度更快;时间维度的高斯分布有清晰的物理意义。

    缺点:4D高斯体的参数量比3D多,存储和显存需求更高;时间维度的密度控制比空间维度更难调参。


    5. 训练策略与数据要求

    输入数据格式:

    • 多相机同步视频(理想):多个相机同步录制,可以对每一帧做精确的多视角约束。适用于摄影棚级别的高精度重建。
    • 单目视频(更常见):一个相机录制视频,每帧只有一个视角。约束弱,需要更强的正则化(运动平滑性、3D一致性等)。

    对单目视频的处理:

  • 用 COLMAP 或 SLAM 方法估计相机轨迹(不同于静态场景,动态视频的 SfM 更难)
  • 用语义分割或光流估计识别动态区域和静态背景
  • 静态背景用普通3DGS重建,动态前景用4DGS单独处理
  • 最后合并两者的渲染结果
  • 训练时间:4DGS通常比3DGS慢3-5倍,主要是因为变形场MLP或4D参数量的额外开销。


    6. 应用场景

    动态人像重建:从单目视频重建可以自由视角渲染的人物动作。代表工作:GaussianDreamer(与4DGS结合做角色动画)。

    运动物体捕捉:从多相机视频中提取运动轨迹和形状变化,用于动作分析或虚拟制作。

    自由视点电视(Free-viewpoint Video):体育比赛等场景,从多相机切换到任意视角的实时渲染,4DGS是目前质量最好的方案之一。

    场景理解:把时间信息融入场景表示,可以识别哪些物体是动态的、运动方式是什么,有助于机器人感知和自动驾驶场景理解。


    7. 与基于NeRF的动态方法对比

    方法表示方式训练时间渲染速度质量
    D-NeRF(2021) MLP隐式变形场 数十小时 < 1 FPS 基准
    TiNeuVox(2022) 体素+MLP ~30分钟 ~1 FPS 较好
    DyNeRF(2022) 时序NeRF 数小时 < 1 FPS 高
    4D-GS(2023) 显式高斯+变形场 ~25分钟 ~30 FPS 高
    Spacetime GS(2023) 4D高斯体 ~40分钟 ~60 FPS 高

    前瞻:动态场景3DGS在2024年进入爆发期,出现了针对特定场景(人体、人脸、手势)的专用4DGS方法,以及与物理仿真结合的工作(用物理引擎约束高斯体的运动,增强时序一致性)。2025年的前沿方向正在探索完全无监督的动态场景分解——不需要任何关于哪些物体动、怎么动的先验。


    8. 参考资料

    • Yang, Z. et al. (2023). 4D Gaussian Splatting for Real-Time Dynamic 3D Content Creation. https://arxiv.org/abs/2310.08528
    • Li, Z. et al. (2023). Spacetime Gaussian Feature Splatting for Real-Time Dynamic View Synthesis. CVPR 2024. https://arxiv.org/abs/2312.16812
    • Pumarola, A. et al. (2021). D-NeRF: Neural Radiance Fields for Dynamic Scenes. CVPR 2021. https://arxiv.org/abs/2011.13961

    下一篇:16 2D高斯泼溅:表面重建新思路

    赞(0)
    未经允许不得转载:171主机测评 » 高斯泼溅技术-从入门到精通
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址