Part I 1-3
- 引言
- 总摘要
- Part I:问题定义、原始 3DGS 数学基础与工程语义鸿沟
-
- 1、什么是“工程语义上探”
- 2、原始 3DGS 数学底层:高斯场、协方差、投影、可微渲染、密度控制
-
- 2.1 高斯场表示:原始 3DGS 的状态变量
- 2.2 协方差参数化与局部几何:为什么它像“局部形状”,却还不是“局部曲面”
- 2.3 从 3D Gaussian 到 2D 椭圆 splat:投影推导与近似边界
- 2.4 可微渲染、可见性排序与为何它天然偏向 photometric consistency
- 2.5 密度控制与优化动力学:它像自适应采样,但不是结构建模
- 3、为什么原始 3DGS 擅长“像”,却不擅长“结构”
-
- 3.1 高保真辐射场
≠
\\neq
= 合法曲面 - 3.2 局部体元分布
≠
\\neq
= 参数曲面 - 3.3 视觉连续
≠
\\neq
= 拓扑连续 - 3.4 “后处理拟合一下”不是工程补丁,而是表示范式跨越
- 3.5 工程系统真正需要的是“结构可消费性”
- 3.1 高保真辐射场
引言
如果你正在做三维重建算法、CAD逆向或工业数字化交付,一定深刻认识到3DGS“看起来真”和“能被工程系统消费”从来不是一回事。 3DGS之所以火,是因为它把视觉保真度和实时渲染拉到了一个新高度;但如果你还需要面对测量、编辑、装配、检测这些工程需求,这显然不是3DGS所擅长的“像”,毕竟它并不天然擅长“结构”。现在值得讨论的问题早已不是它的FPS和PSNR,今天我们讨论:它能否从终端渲染表示,进化为图像到结构化工程几何之间的中间表示?应用在数字工程中。
总摘要
截至 2026 年上半年,Gaussian Splatting 已经不再只是“高保真实时新视角合成”的代名词。原始 3DGS 用各向异性高斯、交错式密度控制和可见性感知的 tile-based rasterization,把 radiance field 从“连续场 + 体渲染采样”改写成“显式高斯集合 + 可微光栅化”,在视觉层完成了一次范式跃迁;但它的成功,本质上是 对 appearance 的成功,不是对 structure 的成功。Kerbl 等工作的目标函数、投影机制和优化动力学,面向的是颜色一致性、可见性一致性和快速渲染,而不是对 曲面流形、边界闭合、参数域一致性或 B-rep 合法性 负责。
以前企业级三维重建团队关注的是“3DGS 能否替代 NeRF 做浏览”。这个问题早已尘埃落定,我们进而讨论 3DGS向 图像到结构化工程几何之间的高带宽中间表示这一范式走到了哪?
这条路线的逻辑链条早已显形:SurfaceSplat 试图把 SDF 的全局几何一致性与 Gaussian 的局部细节表达耦合起来;Curve-Aware GS 让参数曲线不再只是后处理拟合结果,而是进入可微优化闭环;GaussianCAD 则把 3DGS 从现实影像推向设计表达;而 BrepGaussian 更进一步,直接提出从多视图图像出发,经由带特征的 Gaussian 表示与 primitive fitting,重建完整 B-rep CAD 模型 (也是我们这次讨论的重头戏)。

注意:这不意味着图像直达 CAD/B-rep 已进入工业成熟期。Point2CAD 仍然说明,哪怕输入已是高质量点云,从面片分割、曲面拟合、曲面相交、边与角点恢复,到 trimming 与 topology assembly,整个 reverse engineering 链路仍是几何与组合拓扑的双重难题;BrepGaussian 只是把这条链路从“点云后端”前移到了“图像/高斯中间层前端”。
因此,它的真正意义不是夸下海口说:“今天就替代传统 CAD 逆向”,而是第一次让 “图像 → Gaussian intermediate layer → curve/surface/topology → B-rep” 这条路线具备了清晰的研究可行性。
本文的中心结论将是:过去的 3DGS 更像一台会画世界的机器;而 2025–2026 这批工作让它开始对曲线、曲面、边界、拓扑甚至工程语义负责。 值得重视的并非某个单点 benchmark,而是表示层正在发生的角色迁移:3DGS 正在从终端渲染表示,演化为面向结构化几何恢复的中间表示。
Part I:问题定义、原始 3DGS 数学基础与工程语义鸿沟
1、什么是“工程语义上探”
讨论 3DGS,若仍然停留在 “PSNR 更高、渲染更快、显存更省” 的层面,实际上已经落后于 2025–2026 的主线问题。工业系统真正关心的,不是一个场景能否被“看起来很真”地播放出来,而是图像、视频、多传感器采集之后,是否能够沉淀为可测量、可编辑、可装配、可交换、可复用的三维工程资产。
传统 COLMAP 路线已经隐含了这种分层思维:SfM 先恢复相机位姿与稀疏结构,MVS 再恢复 depth / normal,随后融合为 dense point cloud,必要时再经 Poisson Surface Reconstruction 或 Screened Poisson Surface Reconstruction 变成 mesh。注意,这条链路即便走到 mesh,也离 CAD / B-rep 仍然很远。原始 3DGS 则把重点放在从 SfM 稀疏点直接获得高质量实时 novel-view synthesis;而 BrepGaussian 的表述已经转向“从多视图图像直接重建 CAD / B-rep”。这说明问题重心正在发生位移:从“重建可看世界”转向“重建可消费结构”。
因此,企业级三维系统必须把三维表示明确拆成三层: 
视觉显示层(visual appearance layer) 它关心 photorealism、novel view synthesis、view-dependent appearance、real-time rendering。只要用户能“看起来像”,这一层就可以宣告阶段性成功。原始 3DGS 正是在这一层完成了范式迁跃。
几何结构层(geometry & structure layer) 它关心 surface consistency、normal consistency、局部切平面、主曲率、全局形状闭合、一致的深度与表面法向。到了这一层,问题已经不再是“能否渲染像”,而是“是否存在一个稳定、可抽取、可检验的 surface”。 NeuS、VolSDF、以及后来的 SurfaceSplat 之所以重要,正是因为它们开始把 surface reconstruction 的偏差、全局一致性与显式几何中介重新带回神经渲染与 Gaussian 系统。
工程语义层(engineering semantics layer)。它不再满足于“有一个 surface”。它要求 edge、corner、patch、trim loop、adjacency、incidence、parameter domain consistency,最终要求一种 CAD kernel 能消费的结构化表示,例如 B-rep / STEP-friendly structure。

OpenCascade 官方文档 对 B-rep 的描述非常直接:几何是 curves 与 surfaces,拓扑则是把这些几何对象绑定起来的数据结构;BRepNet 也强调 B-rep 把参数曲线/曲面与描述 manifold 的拓扑信息结合在一起。
所以,本文全文的真正主问题不是“3DGS 强不强”,而是:
3DGS 是否正在从“高保真实时渲染表示”演化为“图像到结构化工程几何之间的中间表示”?而 BrepGaussian 是否是这条路线第一次真正触碰到 CAD / B-rep 语义边界的工作? 过去的 3DGS 更像一台会画世界的机器;接下来的 3DGS,正在学习如何对曲线、曲面、边界、拓扑与工程语义负责。这个判断并不是原始 3DGS 论文的主张,而是从 SurfaceSplat、Curve-Aware GS、GaussianCAD 与 BrepGaussian 这条连续谱系综合得出的。
产品团队若不区分这三层,容易犯两个错误:
- 把“高保真浏览”误判为“工程可交付”;
- 把“视觉层 benchmark 提升”误判为“结构化资产链路成熟”。
对空间采集、工业视觉、机器人建模、扫描交付平台而言,真正影响后续闭环的不是用户能否转动模型,而是模型能否被 测量、编辑、装配、修复、版本化、参数化消费。这也是为什么“工程语义上探”不是宣传口号,而是系统架构分层问题。
2、原始 3DGS 数学底层:高斯场、协方差、投影、可微渲染、密度控制

2.1 高斯场表示:原始 3DGS 的状态变量
原始 3DGS 可将场景写成一组各向异性高斯原语的集合:
G
=
G
i
i
=
1
N
,
G
i
=
μ
i
,
Σ
i
,
α
i
,
c
i
,
SH
i
.
(1)
\\mathcal{G}={G_i}_{i=1}^{N},\\qquad G_i={\\mu_i,\\Sigma_i,\\alpha_i,c_i,\\text{SH}_i}. \\tag{1}
G=Gii=1N,Gi=μi,Σi,αi,ci,SHi.(1)
其中,
μ
i
∈
R
3
\\mu_i\\in\\mathbb{R}^3
μi∈R3 是中心,
Σ
i
∈
S
+
+
3
)
\\Sigma_i\\in S_{++}^{3})
Σi∈S++3)是 3D 协方差矩阵,
α
i
\\alpha_i
αi 是不透明度,
c
i
c_i
ci 或 SH 系数表示颜色及视角相关辐射属性。3DGS 论文明确说明,其优化对象包括位置、协方差、opacity 与 SH 系数;gsplat 工程文档 也把 rasterization 的输入写成 means、covariances、colors 与 opacities。
若写成标准归一化高斯,
g
i
(
x
)
=
1
(
2
π
)
3
/
2
∣
Σ
i
∣
1
/
2
exp
!
(
−
1
2
(
x
−
μ
i
)
⊤
Σ
i
−
1
(
x
−
μ
i
)
)
,
(2)
g_i(\\mathbf{x})= \\frac{1}{(2\\pi)^{3/2}|\\Sigma_i|^{1/2}} \\exp!\\left( -\\frac12(\\mathbf{x}-\\mu_i)^\\top \\Sigma_i^{-1}(\\mathbf{x}-\\mu_i) \\right), \\tag{2}
gi(x)=(2π)3/2∣Σi∣1/21exp!(−21(x−μi)⊤Σi−1(x−μi)),(2) 则其在渲染中可理解为被 opacity 调制的体元响应:
g
~
i
(
x
)
=
α
i
,
g
i
(
x
)
.
(3)
\\tilde g_i(\\mathbf{x})=\\alpha_i, g_i(\\mathbf{x}). \\tag{3}
g~i(x)=αi,gi(x).(3)
这一定义的关键不在“它是高斯”这么简单,而在于:它既是可微的体分布,又是可投影为 2D 椭圆 splat 的显式基元。EWA Volume Splatting 早在 2001 年就给出了椭圆高斯核、其仿射映射闭包性、以及 3D 高斯积分到 2D 高斯的数学基础;3DGS 则把这条图形学传统重新接到现代 radiance field 优化链路上。。
从技术谱系看,NeRF 用连续 5D 场
(
x
,
d
)
↦
(
σ
,
c
)
(\\mathbf{x},\\mathbf{d})\\mapsto(\\sigma,\\mathbf{c})
(x,d)↦(σ,c) 来表达体密度与视角相关颜色;Plenoxels 用 sparse voxel + SH 替代 MLP;Instant-NGP 用 hash-grid 编码降低查询成本;3DGS 则把“连续场 + 体渲染”的思想,换成“无结构显式体元 + splatting/rasterization”的组合。这一步的本质,不是把网络换成点,而是把 radiance field 的计算主轴,从 ray marching 迁移到 differentiable rasterization。
2.2 协方差参数化与局部几何:为什么它像“局部形状”,却还不是“局部曲面”
3DGS 不直接优化任意对称矩阵,而是采用
Σ
i
=
R
i
S
i
S
i
⊤
R
i
⊤
,
S
i
=
d
i
a
g
(
s
i
1
,
s
i
2
,
s
i
3
)
,
(4)
\\Sigma_i = R_i S_i S_i^\\top R_i^\\top,\\qquad S_i=\\mathrm{diag}(s_{i1},s_{i2},s_{i3}), \\tag{4}
Σi=RiSiSi⊤Ri⊤,Si=diag(si1,si2,si3),(4) 其中
R
i
R_i
Ri 由 quaternion 参数化的旋转矩阵给出,
S
i
S_i
Si 为尺度矩阵。这样做的直接原因是:协方差必须保持正半定,直接对矩阵做梯度更新很容易落到非法区域,而
R
S
S
⊤
R
⊤
RSS^\\top R^\\top
RSS⊤R⊤ 形式天然保持正半定。这个参数化在 3DGS 论文与 gsplat 文档中都是核心设定。
对
Σ
i
\\Sigma_i
Σi 做特征分解,
Σ
i
=
Q
i
Λ
i
Q
i
⊤
,
Λ
i
=
d
i
a
g
(
λ
i
1
,
λ
i
2
,
λ
i
3
)
,
(5)
\\Sigma_i = Q_i\\Lambda_i Q_i^\\top,\\qquad \\Lambda_i=\\mathrm{diag}(\\lambda_{i1},\\lambda_{i2},\\lambda_{i3}), \\tag{5}
Σi=QiΛiQi⊤,Λi=diag(λi1,λi2,λi3),(5) 则特征向量给出椭球主轴方向,特征值给出沿主轴的扩张尺度。若
λ
i
3
≪
λ
i
1
,
λ
i
2
\\lambda_{i3}\\ll \\lambda_{i1},\\lambda_{i2}
λi3≪λi1,λi2,该 Gaussian 会呈现薄片状;若
λ
i
1
≈
λ
i
2
≈
λ
i
3
\\lambda_{i1}\\approx \\lambda_{i2}\\approx \\lambda_{i3}
λi1≈λi2≈λi3,则更接近球状。
从统计形状上看,这些主轴确实会“像”局部切空间结构:两个大特征值倾向于沿局部表面扩展,一个小特征值倾向于沿近法向收缩。但这里的“像”,仍然只是二阶统计意义上的近似,不是参数曲面的显式定义。
为了把这个差异说清楚,考虑一个在主曲率坐标系下的局部 Monge patch:
x
(
u
,
v
)
=
x
0
+
u
,
e
1
+
v
,
e
2
+
1
2
(
κ
1
u
2
+
κ
2
v
2
)
n
+
O
(
∣
(
u
,
v
)
∣
3
)
,
(6)
\\mathbf{x}(u,v)= \\mathbf{x}_0 +u,\\mathbf{e}_1+v,\\mathbf{e}_2 +\\frac12(\\kappa_1 u^2+\\kappa_2 v^2)\\mathbf{n} +O(|(u,v)|^3), \\tag{6}
x(u,v)=x0+u,e1+v,e2+21(κ1u2+κ2v2)n+O(∣(u,v)∣3),(6) 其中
e
∗
1
,
e
∗
2
\\mathbf{e}*1,\\mathbf{e}*2
e∗1,e∗2 为切向基,
n
\\mathbf{n}
n 为法向,
κ
1
,
κ
2
\\kappa_1,\\kappa_2
κ1,κ2 为主曲率。若 ((u,v)) 在一个小对称邻域内采样,且
E
[
u
]
=
E
[
v
]
=
0
\\mathbb E[u]=\\mathbb E[v]=0
E[u]=E[v]=0,则由二阶项可得:切向方差量级为
O
(
r
2
)
O(r^2)
O(r2),而法向方差量级为
O
(
r
4
)
O(r^4)
O(r4)。于是,局部点集协方差的最小特征向量在小尺度极限下可逼近法向:
V
a
r
∗
tangent
=
O
(
r
2
)
,
V
a
r
∗
normal
=
O
(
r
4
)
.
(7)
\\mathrm{Var}*{\\text{tangent}} = O(r^2),\\qquad \\mathrm{Var}*{\\text{normal}} = O(r^4). \\tag{7}
Var∗tangent=O(r2),Var∗normal=O(r4).(7)
这说明:协方差可以提供局部切平面与法向的线索。但它仍不等价于显式曲面 patch,原因有三。
(
u
,
v
)
(u,v)
(u,v),因此不存在 face 的自然内部坐标。
I
I
=
κ
1
,
d
u
2
+
κ
2
,
d
v
2
(8)
\\mathrm{II} = \\kappa_1,du^2+\\kappa_2,dv^2 \\tag{8}
II=κ1,du2+κ2,dv2(8) 这一层微分几何对象;协方差只是在统计意义上间接反映二阶结构,而不是显式携带曲率算子、参数连续性或曲面连接约束。
换句话说,协方差是“局部占据分布”的二阶矩,不是“局部曲面语义”的完备描述。两个不同的曲面 patch,可能共享非常接近的局部二阶统计;CAD face 所要求的,远不只是二阶矩匹配。
- 3DGS 用
R
S
S
⊤
R
⊤
RSS^\\top R^\\top
RSS⊤R⊤参数化各向异性协方差,以保证优化有效且表达灵活。 - 各向异性 Gaussian 提供了比 voxel/hash-grid 更自由的局部形状自适应能力。
- 协方差主轴可以成为局部切平面、法向、主方向的弱线索,但它距离“显式 patch”仍隔着 参数域、边界与连续性 约束三道墙。
对于你的产品方案而言,如果你的系统目标是测量、比对、病害检测、边界提取、装配约束,而不是只做 viewer,那么“拿到 Gaussian 主轴”绝不等于“拿到曲面法向与结构边界”。在技术选型上,协方差只能被视为几何先验候选变量,不能被误当作工程几何本体。
2.3 从 3D Gaussian 到 2D 椭圆 splat:投影推导与近似边界

设世界坐标中的点为
x
\\mathbf{x}
x,相机坐标为
x
c
=
W
x
+
t
,
(9)
\\mathbf{x}_c = W\\mathbf{x}+\\mathbf{t}, \\tag{9}
xc=Wx+t,(9) 其中 (W) 为 world-to-camera 线性部分。对 pinhole 相机,
π
(
x
c
)
=
[
f
x
x
/
z
+
c
x
f
y
y
/
z
+
c
y
]
.
(10)
\\pi(\\mathbf{x}_c)= \\begin{bmatrix} f_x x/z + c_x\\ f_y y/z + c_y \\end{bmatrix}. \\tag{10}
π(xc)=[fxx/z+cx fyy/z+cy].(10) 在高斯中心
μ
c
=
(
x
,
y
,
z
)
\\mu_c=(x,y,z)
μc=(x,y,z) 处做一阶线性化,
π
(
μ
c
+
δ
)
≈
π
(
μ
c
)
+
J
δ
,
(11)
\\pi(\\mu_c+\\delta)\\approx \\pi(\\mu_c)+J\\delta, \\tag{11}
π(μc+δ)≈π(μc)+Jδ,(11) 其 Jacobian 为
J
=
[
f
x
/
z
0
−
f
x
x
/
z
2
0
f
y
/
z
−
f
y
y
/
z
2
]
.
(12)
J= \\begin{bmatrix} f_x/z & 0 & -f_x x/z^2\\ 0 & f_y/z & -f_y y/z^2 \\end{bmatrix}. \\tag{12}
J=[fx/z0−fxx/z2 0fy/z−fyy/z2].(12)
于是,3D 协方差在图像平面的近似投影为
Σ
2
D
≈
J
,
W
,
Σ
3
D
,
W
⊤
J
⊤
.
(13)
\\Sigma_{2D}\\approx J,W,\\Sigma_{3D},W^\\top J^\\top. \\tag{13}
Σ2D≈J,W,Σ3D,W⊤J⊤.(13) 这一式子在 3DGS 与 gsplat 文档中都被直接使用,其思想源头可追溯到 EWA Volume Splatting 对局部仿射近似与椭圆高斯投影的处理。
这个公式的成立依赖一个常被工程实现隐藏、但在理论上极关键的条件:高斯支撑区域在相机投影下足够小,以至于 projective mapping 在该区域内可以被局部仿射化。 更形式化地说,若
π
\\pi
π 的 Hessian 记为
H
π
H_\\pi
Hπ,则 Taylor 余项满足
π
(
μ
c
+
δ
)
=
π
(
μ
c
)
+
J
δ
+
1
2
δ
⊤
H
π
(
ξ
)
δ
,
(14)
\\pi(\\mu_c+\\delta)= \\pi(\\mu_c)+J\\delta+\\frac12 \\delta^\\top H_\\pi(\\xi)\\delta, \\tag{14}
π(μc+δ)=π(μc)+Jδ+21δ⊤Hπ(ξ)δ,(14) 其中
ξ
\\xi
ξ 位于
μ
c
\\mu_c
μc 与
μ
c
+
δ
\\mu_c+\\delta
μc+δ 之间。若
∣
δ
∣
/
z
|\\delta|/z
∣δ∣/z不小,或 Gaussian 靠近 near plane,或 splat 尺寸过大,则二阶项不可忽略,
Σ
2
D
\\Sigma_{2D}
Σ2D 将不再是可靠近似。Perspective Accurate Splatting 也正是围绕透视非线性误差与更准确 splatting 建模展开。
3DGS 在实现层面因此会做 frustum culling、guard band 处理,并避免极端位置处不稳定的 projected covariance;gsplat 也在 API 中暴露了 near plane、radius clip、eps2d 等稳定化参数。
必须强调:这个投影把 3D 体元变成了 2D 椭圆 splat,但椭圆 splat 不是曲面 chart。它只是在某个视图下的局部像平面核,不携带 face 的参数域,也不携带 edge 的归属关系。它渲染上极其高效,结构上却仍然是“无约束投影体元”。
对于你的产品方案,如果系统强调大视角变化、近景几何、细边界或工业零件锐特征,那么“3D 高斯投影成 2D 椭圆”的 稳定性边界 必须被纳入架构设计。否则,训练阶段你是高效 rasterization,交付你就近视角失稳以及边缘漂移(没招了)。
2.4 可微渲染、可见性排序与为何它天然偏向 photometric consistency
3DGS 论文明确指出:其与 NeRF 式体渲染在图像形成层面本质一致。若对某个像素
p
\\mathbf{p}
p 按深度从前到后排序,定义第 (i) 个高斯在该像素上的有效不透明度为
a
i
(
p
)
=
α
i
exp
!
(
−
1
2
(
p
−
μ
i
′
)
⊤
Σ
2
D
,
i
−
1
(
p
−
μ
i
′
)
)
,
(15)
a_i(\\mathbf{p})= \\alpha_i \\exp!\\left( -\\frac12(\\mathbf{p}-\\mu_i')^\\top \\Sigma_{2D,i}^{-1}(\\mathbf{p}-\\mu_i') \\right), \\tag{15}
ai(p)=αiexp!(−21(p−μi′)⊤Σ2D,i−1(p−μi′)),(15) 则前向透射率为
T
i
(
p
)
=
∏
j
<
i
(
1
−
a
j
(
p
)
)
,
(16)
T_i(\\mathbf{p})=\\prod_{j<i}\\bigl(1-a_j(\\mathbf{p})\\bigr), \\tag{16}
Ti(p)=j<i∏(1−aj(p)),(16) 最终像素颜色可写为
C
(
p
)
=
∑
i
=
1
N
T
i
(
p
)
,
a
i
(
p
)
,
c
i
(
p
)
.
(17)
C(\\mathbf{p})= \\sum_{i=1}^{N} T_i(\\mathbf{p}),a_i(\\mathbf{p}),c_i(\\mathbf{p}). \\tag{17}
C(p)=i=1∑NTi(p),ai(p),ci(p).(17) 3DGS 论文直接把 point blending 与 NeRF 的 volumetric rendering 放在同一图像形成框架下讨论;gsplat 也把深度排序后在 tile 内做 alpha-compositing 作为核心接口语义。
工程上,3DGS 选择 tile-based splatting:先把屏幕分成小 tile,再按 tile 与深度对 Gaussians 排序,随后在每个 tile 内做前向 compositing,并在反向传播时恢复中间 opacity 累积值。
论文强调这种做法避免了逐像素排序开销,使用 GPU radix sort,并允许对任意数量的 blended Gaussians 做高效反传。gsplat 文档则把 “group by tile + sort by increasing depth z + alpha-compositing” 作为标准实现描述。
问题在于:这一整套机制的原生目标,是让渲染图像与训练图像一致,而不是让某个 surface manifold 成立。3DGS 在优化中使用的是图像重建损失,论文写明其损失项为
L
1
L_1
L1 与 D-SSIM/SSIM 的组合,而不是法向一致性、曲率正则、拓扑合法性之类的结构损失。
从优化问题的角度,原始 3DGS 解决的是
min
Θ
∑
k
ℓ
(
R
(
Θ
;
Π
k
)
,
I
k
)
,
(18)
\\min_{\\Theta}\\sum_{k} \\ell\\bigl(\\mathcal R(\\Theta;\\Pi_k), I_k\\bigr), \\tag{18}
Θmink∑ℓ(R(Θ;Πk),Ik),(18) 其中
Θ
\\Theta
Θ 为所有 Gaussian 参数,
Π
k
\\Pi_k
Πk 为相机,
R
\\mathcal R
R 为渲染器。只要一组参数能在已观测视角下产生相近图像,它就可能是低损解;至于这组参数对应的体元集合是否来自单一曲面、是否存在稳定法向、是否对应合法边界与拓扑,目标函数并不直接关心。这意味着 photometric loss 的等价类通常远大于 geometric loss 的等价类,更远大于 topological validity 的等价类。
因此,“可见性感知”不等于“几何一致性感知”。前者只管遮挡顺序与前向透射;后者则要求跨视角、跨局部、跨尺度的表面解释保持一致。二者不是一回事。
3DGS 的可微渲染基于深度排序、tile-based splatting 与 alpha compositing,训练损失以图像重建为主。在 image formation 层面延续了 radiance field 传统,但在执行层面切换到了 GPU-friendly rasterization。但只要损失函数仍以 photometric consistency 为主,3DGS 的几何始终是“为渲染服务的隐含几何”,而不是“为工程消费服务的显式几何”。 所以对于工程应用产品而言,不能把“visibility-aware”误读成“geometry-aware”。系统若要支持测量、边界提取、CAD 反求、机器人抓取与装配,就必须在 photometric loss 之外,显式加入 geometry consistency、edge/curve consistency、topology validity 这类目标;否则渲染器越强,几何幻觉也可能越强。
2.5 密度控制与优化动力学:它像自适应采样,但不是结构建模
3DGS 的核心工程贡献之一是 interleaved optimization / density control:在优化位置、协方差、opacity 与 SH 的同时,周期性执行 densification、split、clone 与 pruning。论文明确描述了两类密度提升:对 under-reconstruction 的小 Gaussian 做 clone,对 over-reconstruction 的大 Gaussian 做 split,并对低 opacity 或过大的 Gaussian 执行裁剪。
若从数值分析视角看,这非常像一种无网格的自适应离散化:
- clone 类似在高残差区域添加新的自由度;
- split 类似对局部基元做 (h)-refinement;
- pruning 类似把无效基函数从活动集移除。
其触发信号又不是任意拍脑袋,而是 view-space positional gradients 与 opacity 等与图像误差强相关的量。论文甚至直接指出,densify 的候选 Gaussian 往往具有较大的 view-space positional gradients;gsplat 的 densification 策略文档 也把 duplicating、splitting、pruning 的策略接口显式暴露出来,并提到与 AbsGS 相关的绝对梯度策略。

但它提升的是表示带宽,不是结构可解释性:
- split/clone 只增加自由度,不引入 connectivity。
- densification 的驱动来自图像误差,不来自边界算子、曲率张量、patch 邻接或拓扑约束。
- Gaussian 数量变多,只会让表示更能“拟合外观”,不会自动让 face、edge、corner、trim 自发出现。
从系统论角度,3DGS 的 densification 更像“自适应渲染基底成长机制”,而不是“结构元生成机制”。这是一个根本区分边界。
所以当团队看到 clone/split/prune 带来更锐利边界和更高 PSNR 时,最容易犯的错误,是把“自由度增加后的外观改善”误判为“结构已经显式化”。产品经理看见薄结构恢复得更好,可能会自然追问:“那是不是可以直接出 CAD 了?”答案是否定的。自由度成长解决的是表示能力,不是语义建模能力。
3、为什么原始 3DGS 擅长“像”,却不擅长“结构”
3.1 高保真辐射场
≠
\\neq
= 合法曲面

将所有 Gaussian 叠加,可写出一个连续体密度:
ρ
(
x
)
=
∑
i
=
1
N
α
i
,
g
i
(
x
)
.
(19)
\\rho(\\mathbf{x})=\\sum_{i=1}^{N}\\alpha_i,g_i(\\mathbf{x}). \\tag{19}
ρ(x)=i=1∑Nαi,gi(x).(19) 从数学上说,你当然可以随意取某个阈值
τ
\\tau
τ,构造等值面
M
τ
=
x
∈
R
3
∣
ρ
(
x
)
=
τ
.
(20)
\\mathcal{M}_\\tau={\\mathbf{x}\\in\\mathbb R^3\\mid \\rho(\\mathbf{x})=\\tau}. \\tag{20}
Mτ=x∈R3∣ρ(x)=τ.(20) 但问题是:原始 3DGS 并没有训练一个“唯一合法的表面”。阈值
τ
\\tau
τ 不是模型语义的一部分,很多不同的
ρ
\\rho
ρ 都可能在训练视图上产生近似相同的图像。也就是说,视觉可行解集合远大于表面可行解集合。
因此,3DGS 可以非常擅长重建外观与可见性,却不天然定义一个唯一、稳定、可消费的 surface manifold。3DGS 论文的成功指标主要仍是 PSNR、SSIM、LPIPS,这也从侧面说明它原始任务不是表面合法性,而是视觉重建质量.
3.2 局部体元分布
≠
\\neq
= 参数曲面
参数曲面不是一堆局部薄片的堆叠,而是一个带有参数域与连续映射的对象:
S
:
Ω
⊂
R
2
→
R
3
,
(
u
,
v
)
↦
S
(
u
,
v
)
.
(21)
S:\\Omega\\subset\\mathbb R^2\\rightarrow\\mathbb R^3,\\qquad (u,v)\\mapsto S(u,v). \\tag{21}
S:Ω⊂R2→R3,(u,v)↦S(u,v).(21) 对于一个 CAD face,还必须知道其参数域
Ω
\\Omega
Ω 是什么、边界
∂
Ω
\\partial\\Omega
∂Ω 如何被 trimming curve 裁切、与其他 face 如何相接。Gaussian 集合没有
(
u
,
v
)
(u,v)
(u,v) 域、没有 trim loop、没有参数连续性条件、没有跨 patch 的
G
0
/
G
1
/
G
2
G^0/G^1/G^2
G0/G1/G2 关系。
因此,即便某个局部 Gaussian 看起来很“贴”表面,它也只是一个体元统计核,不是曲面 patch。本质上,参数曲面讲的是几何函数;Gaussian 讲的是局部分布函数。 前者天然带域、边界与映射;后者天然带均值、方差与权重。这是两种对象。
3.3 视觉连续
≠
\\neq
= 拓扑连续
视觉上连续的边界,可能只是多视图投影下重叠 splat 的结果,并不代表 3D 中真的存在一条连续 edge。两个互不相连的 Gaussian 簇,在若干视角中完全可能投影成一条“看上去连续”的轮廓;反过来,一个真实的 sharp edge,也可能被多个薄片 Gaussian 以不同方式近似,而不携带“这是两个 face 的交线”这一语义。
这就是为什么高斯集合不天然具有以下对象: face、edge、corner、trimming loop、adjacency、incidence relation、B-rep legality。 这些对象都不是“靠长得像”就能得到,而是必须被显式建模、推理、约束与校验。
3.4 “后处理拟合一下”不是工程补丁,而是表示范式跨越
这一点必须说得非常重。很多工程讨论会把“先训一个 3DGS,再后面拟合一下曲面”视为轻量后处理。这个判断在数学上并不成立。因为一旦从 Gaussian 集合转向 CAD / B-rep,你就必须同时回答:
BrepGaussian 的流程恰恰证明了这不是“小后处理”:它先从多视图图像提取 edge mask 与 patch mask,再做两阶段 Gaussian 学习,随后把 learned Gaussians 转成带标签 point cloud,再做 primitive fitting、surface-to-edge-to-corner 的层级抽取、bottom-up assembly、topological adjustment,最后才得到完整 B-rep。作者对其方法的表述不是“把现有 3DGS 顺手拟合一下”,而是一个完整的 CAD reconstruction pipeline。
从这个意义上说,该方向的所有工作都说明了从 Gaussian 到 CAD 不是“渲染表示的后处理”,而是“表示范式的跨层跃迁”。
3.5 工程系统真正需要的是“结构可消费性”
对于工业系统,真正重要的不是一个模型能否被 viewer 流畅播放,而是它能否被下游系统消费。所谓结构可消费性,至少包含四层:
原始 3DGS 没有为这些目标设计本体变量。它的变量是均值、协方差、opacity、SH;它的优化器会 clone/split/prune;它的目标函数面向图像;它的输出形态是一堆可渲染 splats。它当然可以是上游,但不是天然终态。
小结: 原始 3DGS 的目标、变量与指标都服务于 novel-view synthesis;BrepGaussian 为了得到 B-rep,必须额外引入 edge / patch labels、primitive fitting 与 topological adjustment。现在工作中实现的视觉上“像”与结构上“合法”之间的发展转变,不是连续小步,而是层级跳变。把“后拟合”说得过于轻松,说明其往往低估了从连续体元场到离散组合拓扑的难度。
如果平台目标是数字化交付而非仅仅浏览,那么“输出 splat”只能算中间阶段。研发立项时必须明确:最终交付物是 viewer asset、mesh asset、还是 CAD/B-rep asset。三者不是一个东西,也不能用同一套成功指标。
