4D高斯泼溅:动态场景重建
原版3DGS是为静态场景设计的——它假设场景中的所有物体在拍摄期间保持不动。现实里当然不是这样:人会走路,树叶会飘动,汽车会行驶。把时间维度加进来,就是4D Gaussian Splatting要解决的问题。
本文梳理主要的4D GS思路,重点是 4D-GS(Yang et al., 2023)和 Spacetime Gaussians(Li et al., 2023)这两个代表性工作。
目录
- 1. 静态到动态:增加了什么困难
- 2. 4D高斯泼溅的核心思路
- 2.1 变形场(Deformation Field)方案
- 2.2 时空高斯(Spacetime Gaussian)方案
- 3. 4D-GS:变形场 + 多分辨率神经网络
- 4. Spacetime Gaussians:4D椭球表示
- 5. 训练策略与数据要求
- 6. 应用场景
- 7. 与基于NeRF的动态方法对比
- 8. 参考资料
1. 静态到动态:增加了什么困难
静态场景重建的输入是一组来自不同相机位置的图片,场景内容不变,模型只需要学习空间分布。
动态场景的输入是视频(多帧,场景随时间变化),或者多相机同步拍摄(不同空间角度,相同时刻)。问题的本质变了:
时空纠缠:不同时刻的图像里,同一个区域的内容可能完全不同(人走过去了),模型需要同时理解空间结构和时间变化。
观测约束减少:对于视频输入,每一帧只有一个相机角度(单目视频),对应时刻的3D场景严重欠约束。静态NeRF可以用多视角约束弥补,动态场景每个时刻只有一个视角,必须引入额外约束(运动平滑性、形状先验等)。
计算量增加:时间维度带来了更多参数和更复杂的优化问题。
2. 4D高斯泼溅的核心思路
解决动态场景主要有两类思路:
2.1 变形场(Deformation Field)方案
核心思想:维护一组"规范空间(Canonical Space)"里的静态高斯体,再用一个变形场网络学习从规范空间到每一帧时刻的形变映射。
Δ
G
t
=
F
(
G
c
a
n
o
n
i
c
a
l
,
t
)
\\Delta G_t = \\mathcal{F}(G_{canonical}, t)
ΔGt=F(Gcanonical,t)
给定时刻
t
t
t,变形场网络
F
\\mathcal{F}
F 输出每个高斯体的位置偏移
Δ
μ
\\Delta\\mu
Δμ、旋转偏移
Δ
r
\\Delta r
Δr 和缩放偏移
Δ
s
\\Delta s
Δs,叠加到规范高斯体上,得到该时刻的高斯体分布,然后正常渲染。
优点:规范空间的高斯体可以复用3DGS的优化框架;变形场网络相对轻量。
缺点:变形场隐式编码了运动,不如显式时空表示直观;对于拓扑变化(物体出现/消失)的场景处理困难。
2.2 时空高斯(Spacetime Gaussian)方案
核心思想:把高斯体从3D扩展到4D——每个高斯体不仅有空间参数,还有时间维度的均值
μ
t
\\mu_t
μt 和方差
σ
t
2
\\sigma_t^2
σt2,表示这个高斯体在时间上的"影响范围"。
G
(
x
,
t
)
=
G
s
p
a
t
i
a
l
(
x
)
⋅
G
t
e
m
p
o
r
a
l
(
t
)
=
exp
(
−
∥
x
−
μ
x
∥
Σ
2
2
)
⋅
exp
(
−
(
t
−
μ
t
)
2
2
σ
t
2
)
G(\\mathbf{x}, t) = G_{spatial}(\\mathbf{x}) \\cdot G_{temporal}(t) = \\exp\\left(-\\frac{\\|\\mathbf{x}-\\boldsymbol{\\mu}_x\\|_{\\Sigma}^2}{2}\\right) \\cdot \\exp\\left(-\\frac{(t-\\mu_t)^2}{2\\sigma_t^2}\\right)
G(x,t)=Gspatial(x)⋅Gtemporal(t)=exp(−2∥x−μx∥Σ2)⋅exp(−2σt2(t−μt)2)
时间高斯表示"这个高斯体在时刻
μ
t
\\mu_t
μt 附近最强,随时间衰减",自然地处理了瞬态物体(只在某一时段出现)和持久物体(全程存在)。
3. 4D-GS:变形场 + 多分辨率神经网络
4D Gaussian Splatting(Yang et al., 2023)是变形场方案的代表性实现。
架构:
规范空间高斯体(Canonical Gaussians)
+ 时刻 t
↓
多分辨率哈希编码(来自Instant-NGP的思路)
→ 对高斯体位置 + 时刻 t 做空时联合编码
↓
轻量变形 MLP(Deformation MLP)
→ 预测 Δμ, Δr, Δs
↓
当前时刻高斯体 = 规范高斯体 + 变形
↓
标准3DGS渲染(可微光栅化)
↓
与真实帧对比,计算损失,反向传播
多分辨率哈希编码的引入是关键创新——直接用 MLP 编码时空特征太慢,哈希编码把空时特征压缩到固定大小的表里,推理速度大幅提升。
实验结果(D-NeRF数据集):
| D-NeRF | 29.67 | ~48h | <1 FPS |
| TiNeuVox | 32.67 | ~30min | ~1 FPS |
| 4D-GS | 34.05 | ~25min | ~30 FPS |
4. Spacetime Gaussians:4D椭球表示
Spacetime Gaussians(Li et al., SIGGRAPH Asia 2023)采用显式4D高斯体,不依赖变形场网络。
每个4D高斯体有额外的时间参数:
-
μ
t
\\mu_t
μt:该高斯体最活跃的时刻 -
σ
t
\\sigma_t
σt:在时间维度上的扩散范围(方差) - 颜色用4D球谐函数编码(同时对空间方向和时间做函数近似)
渲染时刻
t
t
t 的流程:
G
t
e
m
p
(
t
)
=
exp
(
−
(
t
−
μ
t
)
2
2
σ
t
2
)
G_{temp}(t) = \\exp\\left(-\\frac{(t-\\mu_t)^2}{2\\sigma_t^2}\\right)
Gtemp(t)=exp(−2σt2(t−μt)2)
优点:完全显式,无需神经网络,渲染速度更快;时间维度的高斯分布有清晰的物理意义。
缺点:4D高斯体的参数量比3D多,存储和显存需求更高;时间维度的密度控制比空间维度更难调参。
5. 训练策略与数据要求
输入数据格式:
- 多相机同步视频(理想):多个相机同步录制,可以对每一帧做精确的多视角约束。适用于摄影棚级别的高精度重建。
- 单目视频(更常见):一个相机录制视频,每帧只有一个视角。约束弱,需要更强的正则化(运动平滑性、3D一致性等)。
对单目视频的处理:
训练时间:4DGS通常比3DGS慢3-5倍,主要是因为变形场MLP或4D参数量的额外开销。
6. 应用场景
动态人像重建:从单目视频重建可以自由视角渲染的人物动作。代表工作:GaussianDreamer(与4DGS结合做角色动画)。
运动物体捕捉:从多相机视频中提取运动轨迹和形状变化,用于动作分析或虚拟制作。
自由视点电视(Free-viewpoint Video):体育比赛等场景,从多相机切换到任意视角的实时渲染,4DGS是目前质量最好的方案之一。
场景理解:把时间信息融入场景表示,可以识别哪些物体是动态的、运动方式是什么,有助于机器人感知和自动驾驶场景理解。
7. 与基于NeRF的动态方法对比
| D-NeRF(2021) | MLP隐式变形场 | 数十小时 | < 1 FPS | 基准 |
| TiNeuVox(2022) | 体素+MLP | ~30分钟 | ~1 FPS | 较好 |
| DyNeRF(2022) | 时序NeRF | 数小时 | < 1 FPS | 高 |
| 4D-GS(2023) | 显式高斯+变形场 | ~25分钟 | ~30 FPS | 高 |
| Spacetime GS(2023) | 4D高斯体 | ~40分钟 | ~60 FPS | 高 |
前瞻:动态场景3DGS在2024年进入爆发期,出现了针对特定场景(人体、人脸、手势)的专用4DGS方法,以及与物理仿真结合的工作(用物理引擎约束高斯体的运动,增强时序一致性)。2025年的前沿方向正在探索完全无监督的动态场景分解——不需要任何关于哪些物体动、怎么动的先验。
8. 参考资料
- Yang, Z. et al. (2023). 4D Gaussian Splatting for Real-Time Dynamic 3D Content Creation. https://arxiv.org/abs/2310.08528
- Li, Z. et al. (2023). Spacetime Gaussian Feature Splatting for Real-Time Dynamic View Synthesis. CVPR 2024. https://arxiv.org/abs/2312.16812
- Pumarola, A. et al. (2021). D-NeRF: Neural Radiance Fields for Dynamic Scenes. CVPR 2021. https://arxiv.org/abs/2011.13961
下一篇:16 2D高斯泼溅:表面重建新思路



