欢迎光临
我们一直在努力

CVPR 2026的3DGS卷到什么地步?工程语义上探:BrepGaussian如何打通图像到CAD的最后一公里?(Part I 1-3)

Part I 1-3

  • 引言
  • 总摘要
  • Part I:问题定义、原始 3DGS 数学基础与工程语义鸿沟
    • 1、什么是“工程语义上探”
    • 2、原始 3DGS 数学底层:高斯场、协方差、投影、可微渲染、密度控制
      • 2.1 高斯场表示:原始 3DGS 的状态变量
      • 2.2 协方差参数化与局部几何:为什么它像“局部形状”,却还不是“局部曲面”
      • 2.3 从 3D Gaussian 到 2D 椭圆 splat:投影推导与近似边界
      • 2.4 可微渲染、可见性排序与为何它天然偏向 photometric consistency
      • 2.5 密度控制与优化动力学:它像自适应采样,但不是结构建模
    • 3、为什么原始 3DGS 擅长“像”,却不擅长“结构”
      • 3.1 高保真辐射场

        \\neq

        = 合法曲面

      • 3.2 局部体元分布

        \\neq

        = 参数曲面

      • 3.3 视觉连续

        \\neq

        = 拓扑连续

      • 3.4 “后处理拟合一下”不是工程补丁,而是表示范式跨越
      • 3.5 工程系统真正需要的是“结构可消费性”

引言

如果你正在做三维重建算法、CAD逆向或工业数字化交付,一定深刻认识到3DGS“看起来真”和“能被工程系统消费”从来不是一回事。 3DGS之所以火,是因为它把视觉保真度和实时渲染拉到了一个新高度;但如果你还需要面对测量、编辑、装配、检测这些工程需求,这显然不是3DGS所擅长的“像”,毕竟它并不天然擅长“结构”。现在值得讨论的问题早已不是它的FPS和PSNR,今天我们讨论:它能否从终端渲染表示,进化为图像到结构化工程几何之间的中间表示?应用在数字工程中。

总摘要

截至 2026 年上半年,Gaussian Splatting 已经不再只是“高保真实时新视角合成”的代名词。原始 3DGS 用各向异性高斯、交错式密度控制和可见性感知的 tile-based rasterization,把 radiance field 从“连续场 + 体渲染采样”改写成“显式高斯集合 + 可微光栅化”,在视觉层完成了一次范式跃迁;但它的成功,本质上是 对 appearance 的成功,不是对 structure 的成功。Kerbl 等工作的目标函数、投影机制和优化动力学,面向的是颜色一致性、可见性一致性和快速渲染,而不是对 曲面流形、边界闭合、参数域一致性或 B-rep 合法性 负责。

以前企业级三维重建团队关注的是“3DGS 能否替代 NeRF 做浏览”。这个问题早已尘埃落定,我们进而讨论 3DGS向 图像到结构化工程几何之间的高带宽中间表示这一范式走到了哪?

这条路线的逻辑链条早已显形:SurfaceSplat 试图把 SDF 的全局几何一致性与 Gaussian 的局部细节表达耦合起来;Curve-Aware GS 让参数曲线不再只是后处理拟合结果,而是进入可微优化闭环;GaussianCAD 则把 3DGS 从现实影像推向设计表达;而 BrepGaussian 更进一步,直接提出从多视图图像出发,经由带特征的 Gaussian 表示与 primitive fitting,重建完整 B-rep CAD 模型 (也是我们这次讨论的重头戏)。

BrepGS架构设计

注意:这不意味着图像直达 CAD/B-rep 已进入工业成熟期。Point2CAD 仍然说明,哪怕输入已是高质量点云,从面片分割、曲面拟合、曲面相交、边与角点恢复,到 trimming 与 topology assembly,整个 reverse engineering 链路仍是几何与组合拓扑的双重难题;BrepGaussian 只是把这条链路从“点云后端”前移到了“图像/高斯中间层前端”。

因此,它的真正意义不是夸下海口说:“今天就替代传统 CAD 逆向”,而是第一次让 “图像 → Gaussian intermediate layer → curve/surface/topology → B-rep” 这条路线具备了清晰的研究可行性。

本文的中心结论将是:过去的 3DGS 更像一台会画世界的机器;而 2025–2026 这批工作让它开始对曲线、曲面、边界、拓扑甚至工程语义负责。 值得重视的并非某个单点 benchmark,而是表示层正在发生的角色迁移:3DGS 正在从终端渲染表示,演化为面向结构化几何恢复的中间表示。


Part I:问题定义、原始 3DGS 数学基础与工程语义鸿沟

1、什么是“工程语义上探”

讨论 3DGS,若仍然停留在 “PSNR 更高、渲染更快、显存更省” 的层面,实际上已经落后于 2025–2026 的主线问题。工业系统真正关心的,不是一个场景能否被“看起来很真”地播放出来,而是图像、视频、多传感器采集之后,是否能够沉淀为可测量、可编辑、可装配、可交换、可复用的三维工程资产。

传统 COLMAP 路线已经隐含了这种分层思维:SfM 先恢复相机位姿与稀疏结构,MVS 再恢复 depth / normal,随后融合为 dense point cloud,必要时再经 Poisson Surface Reconstruction 或 Screened Poisson Surface Reconstruction 变成 mesh。注意,这条链路即便走到 mesh,也离 CAD / B-rep 仍然很远。原始 3DGS 则把重点放在从 SfM 稀疏点直接获得高质量实时 novel-view synthesis;而 BrepGaussian 的表述已经转向“从多视图图像直接重建 CAD / B-rep”。这说明问题重心正在发生位移:从“重建可看世界”转向“重建可消费结构”。


因此,企业级三维系统必须把三维表示明确拆成三层: 请添加图片描述

  • 视觉显示层(visual appearance layer) 它关心 photorealism、novel view synthesis、view-dependent appearance、real-time rendering。只要用户能“看起来像”,这一层就可以宣告阶段性成功。原始 3DGS 正是在这一层完成了范式迁跃。

  • 几何结构层(geometry & structure layer) 它关心 surface consistency、normal consistency、局部切平面、主曲率、全局形状闭合、一致的深度与表面法向。到了这一层,问题已经不再是“能否渲染像”,而是“是否存在一个稳定、可抽取、可检验的 surface”。 NeuS、VolSDF、以及后来的 SurfaceSplat 之所以重要,正是因为它们开始把 surface reconstruction 的偏差、全局一致性与显式几何中介重新带回神经渲染与 Gaussian 系统。

  • 工程语义层(engineering semantics layer)。它不再满足于“有一个 surface”。它要求 edge、corner、patch、trim loop、adjacency、incidence、parameter domain consistency,最终要求一种 CAD kernel 能消费的结构化表示,例如 B-rep / STEP-friendly structure。

  • 请添加图片描述

    OpenCascade 官方文档 对 B-rep 的描述非常直接:几何是 curves 与 surfaces,拓扑则是把这些几何对象绑定起来的数据结构;BRepNet 也强调 B-rep 把参数曲线/曲面与描述 manifold 的拓扑信息结合在一起。


    所以,本文全文的真正主问题不是“3DGS 强不强”,而是:

    3DGS 是否正在从“高保真实时渲染表示”演化为“图像到结构化工程几何之间的中间表示”?而 BrepGaussian 是否是这条路线第一次真正触碰到 CAD / B-rep 语义边界的工作? 过去的 3DGS 更像一台会画世界的机器;接下来的 3DGS,正在学习如何对曲线、曲面、边界、拓扑与工程语义负责。这个判断并不是原始 3DGS 论文的主张,而是从 SurfaceSplat、Curve-Aware GS、GaussianCAD 与 BrepGaussian 这条连续谱系综合得出的。

    产品团队若不区分这三层,容易犯两个错误:

    • 把“高保真浏览”误判为“工程可交付”;
    • 把“视觉层 benchmark 提升”误判为“结构化资产链路成熟”。

    对空间采集、工业视觉、机器人建模、扫描交付平台而言,真正影响后续闭环的不是用户能否转动模型,而是模型能否被 测量、编辑、装配、修复、版本化、参数化消费。这也是为什么“工程语义上探”不是宣传口号,而是系统架构分层问题。


    2、原始 3DGS 数学底层:高斯场、协方差、投影、可微渲染、密度控制

    在这里插入图片描述

    2.1 高斯场表示:原始 3DGS 的状态变量

    原始 3DGS 可将场景写成一组各向异性高斯原语的集合:

    G

    =

    G

    i

    i

    =

    1

    N

    ,

    G

    i

    =

    μ

    i

    ,

    Σ

    i

    ,

    α

    i

    ,

    c

    i

    ,

    SH

    i

    .

    (1)

    \\mathcal{G}={G_i}_{i=1}^{N},\\qquad G_i={\\mu_i,\\Sigma_i,\\alpha_i,c_i,\\text{SH}_i}. \\tag{1}

    G=Gii=1N,Gi=μi,Σi,αi,ci,SHi.(1)

    其中,

    μ

    i

    R

    3

    \\mu_i\\in\\mathbb{R}^3

    μiR3 是中心,

    Σ

    i

    S

    +

    +

    3

    )

    \\Sigma_i\\in S_{++}^{3})

    ΣiS++3)是 3D 协方差矩阵,

    α

    i

    \\alpha_i

    αi 是不透明度,

    c

    i

    c_i

    ci 或 SH 系数表示颜色及视角相关辐射属性。3DGS 论文明确说明,其优化对象包括位置、协方差、opacity 与 SH 系数;gsplat 工程文档 也把 rasterization 的输入写成 means、covariances、colors 与 opacities。

    若写成标准归一化高斯,

    g

    i

    (

    x

    )

    =

    1

    (

    2

    π

    )

    3

    /

    2

    Σ

    i

    1

    /

    2

    exp

    !

    (

    1

    2

    (

    x

    μ

    i

    )

    Σ

    i

    1

    (

    x

    μ

    i

    )

    )

    ,

    (2)

    g_i(\\mathbf{x})= \\frac{1}{(2\\pi)^{3/2}|\\Sigma_i|^{1/2}} \\exp!\\left( -\\frac12(\\mathbf{x}-\\mu_i)^\\top \\Sigma_i^{-1}(\\mathbf{x}-\\mu_i) \\right), \\tag{2}

    gi(x)=(2π)3/2Σi1/21exp!(21(xμi)Σi1(xμi)),(2) 则其在渲染中可理解为被 opacity 调制的体元响应:

    g

    ~

    i

    (

    x

    )

    =

    α

    i

    ,

    g

    i

    (

    x

    )

    .

    (3)

    \\tilde g_i(\\mathbf{x})=\\alpha_i, g_i(\\mathbf{x}). \\tag{3}

    g~i(x)=αi,gi(x).(3)

    这一定义的关键不在“它是高斯”这么简单,而在于:它既是可微的体分布,又是可投影为 2D 椭圆 splat 的显式基元。EWA Volume Splatting 早在 2001 年就给出了椭圆高斯核、其仿射映射闭包性、以及 3D 高斯积分到 2D 高斯的数学基础;3DGS 则把这条图形学传统重新接到现代 radiance field 优化链路上。。

    从技术谱系看,NeRF 用连续 5D 场

    (

    x

    ,

    d

    )

    (

    σ

    ,

    c

    )

    (\\mathbf{x},\\mathbf{d})\\mapsto(\\sigma,\\mathbf{c})

    (x,d)(σ,c) 来表达体密度与视角相关颜色;Plenoxels 用 sparse voxel + SH 替代 MLP;Instant-NGP 用 hash-grid 编码降低查询成本;3DGS 则把“连续场 + 体渲染”的思想,换成“无结构显式体元 + splatting/rasterization”的组合。这一步的本质,不是把网络换成点,而是把 radiance field 的计算主轴,从 ray marching 迁移到 differentiable rasterization。

    2.2 协方差参数化与局部几何:为什么它像“局部形状”,却还不是“局部曲面”

    3DGS 不直接优化任意对称矩阵,而是采用

    Σ

    i

    =

    R

    i

    S

    i

    S

    i

    R

    i

    ,

    S

    i

    =

    d

    i

    a

    g

    (

    s

    i

    1

    ,

    s

    i

    2

    ,

    s

    i

    3

    )

    ,

    (4)

    \\Sigma_i = R_i S_i S_i^\\top R_i^\\top,\\qquad S_i=\\mathrm{diag}(s_{i1},s_{i2},s_{i3}), \\tag{4}

    Σi=RiSiSiRi,Si=diag(si1,si2,si3),(4) 其中

    R

    i

    R_i

    Ri 由 quaternion 参数化的旋转矩阵给出,

    S

    i

    S_i

    Si 为尺度矩阵。这样做的直接原因是:协方差必须保持正半定,直接对矩阵做梯度更新很容易落到非法区域,而

    R

    S

    S

    R

    RSS^\\top R^\\top

    RSSR 形式天然保持正半定。这个参数化在 3DGS 论文与 gsplat 文档中都是核心设定。

    Σ

    i

    \\Sigma_i

    Σi 做特征分解,

    Σ

    i

    =

    Q

    i

    Λ

    i

    Q

    i

    ,

    Λ

    i

    =

    d

    i

    a

    g

    (

    λ

    i

    1

    ,

    λ

    i

    2

    ,

    λ

    i

    3

    )

    ,

    (5)

    \\Sigma_i = Q_i\\Lambda_i Q_i^\\top,\\qquad \\Lambda_i=\\mathrm{diag}(\\lambda_{i1},\\lambda_{i2},\\lambda_{i3}), \\tag{5}

    Σi=QiΛiQi,Λi=diag(λi1,λi2,λi3),(5) 则特征向量给出椭球主轴方向,特征值给出沿主轴的扩张尺度。若

    λ

    i

    3

    λ

    i

    1

    ,

    λ

    i

    2

    \\lambda_{i3}\\ll \\lambda_{i1},\\lambda_{i2}

    λi3λi1,λi2,该 Gaussian 会呈现薄片状;若

    λ

    i

    1

    λ

    i

    2

    λ

    i

    3

    \\lambda_{i1}\\approx \\lambda_{i2}\\approx \\lambda_{i3}

    λi1λi2λi3,则更接近球状。

    从统计形状上看,这些主轴确实会“像”局部切空间结构:两个大特征值倾向于沿局部表面扩展,一个小特征值倾向于沿近法向收缩。但这里的“像”,仍然只是二阶统计意义上的近似,不是参数曲面的显式定义。

    为了把这个差异说清楚,考虑一个在主曲率坐标系下的局部 Monge patch:

    x

    (

    u

    ,

    v

    )

    =

    x

    0

    +

    u

    ,

    e

    1

    +

    v

    ,

    e

    2

    +

    1

    2

    (

    κ

    1

    u

    2

    +

    κ

    2

    v

    2

    )

    n

    +

    O

    (

    (

    u

    ,

    v

    )

    3

    )

    ,

    (6)

    \\mathbf{x}(u,v)= \\mathbf{x}_0 +u,\\mathbf{e}_1+v,\\mathbf{e}_2 +\\frac12(\\kappa_1 u^2+\\kappa_2 v^2)\\mathbf{n} +O(|(u,v)|^3), \\tag{6}

    x(u,v)=x0+u,e1+v,e2+21(κ1u2+κ2v2)n+O((u,v)3),(6) 其中

    e

    1

    ,

    e

    2

    \\mathbf{e}*1,\\mathbf{e}*2

    e1,e2 为切向基,

    n

    \\mathbf{n}

    n 为法向,

    κ

    1

    ,

    κ

    2

    \\kappa_1,\\kappa_2

    κ1,κ2 为主曲率。若 ((u,v)) 在一个小对称邻域内采样,且

    E

    [

    u

    ]

    =

    E

    [

    v

    ]

    =

    0

    \\mathbb E[u]=\\mathbb E[v]=0

    E[u]=E[v]=0,则由二阶项可得:切向方差量级为

    O

    (

    r

    2

    )

    O(r^2)

    O(r2),而法向方差量级为

    O

    (

    r

    4

    )

    O(r^4)

    O(r4)。于是,局部点集协方差的最小特征向量在小尺度极限下可逼近法向:

    V

    a

    r

    tangent

    =

    O

    (

    r

    2

    )

    ,

    V

    a

    r

    normal

    =

    O

    (

    r

    4

    )

    .

    (7)

    \\mathrm{Var}*{\\text{tangent}} = O(r^2),\\qquad \\mathrm{Var}*{\\text{normal}} = O(r^4). \\tag{7}

    Vartangent=O(r2),Varnormal=O(r4).(7)

    这说明:协方差可以提供局部切平面与法向的线索。但它仍不等价于显式曲面 patch,原因有三。

  • 它没有参数域

    (

    u

    ,

    v

    )

    (u,v)

    (u,v),因此不存在 face 的自然内部坐标。

  • 它没有边界,无法区分“无限延展的局部薄片”和“被 trimming curve 裁切的 patch”。
  • 它没有显式二次基本形式

    I

    I

    =

    κ

    1

    ,

    d

    u

    2

    +

    κ

    2

    ,

    d

    v

    2

    (8)

    \\mathrm{II} = \\kappa_1,du^2+\\kappa_2,dv^2 \\tag{8}

    II=κ1,du2+κ2,dv2(8) 这一层微分几何对象;协方差只是在统计意义上间接反映二阶结构,而不是显式携带曲率算子、参数连续性或曲面连接约束。

  • 换句话说,协方差是“局部占据分布”的二阶矩,不是“局部曲面语义”的完备描述。两个不同的曲面 patch,可能共享非常接近的局部二阶统计;CAD face 所要求的,远不只是二阶矩匹配。

    • 3DGS 用

      R

      S

      S

      R

      RSS^\\top R^\\top

      RSSR参数化各向异性协方差,以保证优化有效且表达灵活。

    • 各向异性 Gaussian 提供了比 voxel/hash-grid 更自由的局部形状自适应能力。
    • 协方差主轴可以成为局部切平面、法向、主方向的弱线索,但它距离“显式 patch”仍隔着 参数域、边界与连续性 约束三道墙。

    对于你的产品方案而言,如果你的系统目标是测量、比对、病害检测、边界提取、装配约束,而不是只做 viewer,那么“拿到 Gaussian 主轴”绝不等于“拿到曲面法向与结构边界”。在技术选型上,协方差只能被视为几何先验候选变量,不能被误当作工程几何本体。


    2.3 从 3D Gaussian 到 2D 椭圆 splat:投影推导与近似边界

    几何语义上探--2DGS

    设世界坐标中的点为

    x

    \\mathbf{x}

    x,相机坐标为

    x

    c

    =

    W

    x

    +

    t

    ,

    (9)

    \\mathbf{x}_c = W\\mathbf{x}+\\mathbf{t}, \\tag{9}

    xc=Wx+t,(9) 其中 (W) 为 world-to-camera 线性部分。对 pinhole 相机,

    π

    (

    x

    c

    )

    =

    [

    f

    x

    x

    /

    z

    +

    c

    x

     

    f

    y

    y

    /

    z

    +

    c

    y

    ]

    .

    (10)

    \\pi(\\mathbf{x}_c)= \\begin{bmatrix} f_x x/z + c_x\\ f_y y/z + c_y \\end{bmatrix}. \\tag{10}

    π(xc)=[fxx/z+cx fyy/z+cy].(10) 在高斯中心

    μ

    c

    =

    (

    x

    ,

    y

    ,

    z

    )

    \\mu_c=(x,y,z)

    μc=(x,y,z) 处做一阶线性化,

    π

    (

    μ

    c

    +

    δ

    )

    π

    (

    μ

    c

    )

    +

    J

    δ

    ,

    (11)

    \\pi(\\mu_c+\\delta)\\approx \\pi(\\mu_c)+J\\delta, \\tag{11}

    π(μc+δ)π(μc)+Jδ,(11) 其 Jacobian 为

    J

    =

    [

    f

    x

    /

    z

    0

    f

    x

    x

    /

    z

    2

     

    0

    f

    y

    /

    z

    f

    y

    y

    /

    z

    2

    ]

    .

    (12)

    J= \\begin{bmatrix} f_x/z & 0 & -f_x x/z^2\\ 0 & f_y/z & -f_y y/z^2 \\end{bmatrix}. \\tag{12}

    J=[fx/z0fxx/z2 0fy/zfyy/z2].(12)

    于是,3D 协方差在图像平面的近似投影为

    Σ

    2

    D

    J

    ,

    W

    ,

    Σ

    3

    D

    ,

    W

    J

    .

    (13)

    \\Sigma_{2D}\\approx J,W,\\Sigma_{3D},W^\\top J^\\top. \\tag{13}

    Σ2DJ,W,Σ3D,WJ.(13) 这一式子在 3DGS 与 gsplat 文档中都被直接使用,其思想源头可追溯到 EWA Volume Splatting 对局部仿射近似与椭圆高斯投影的处理。

    这个公式的成立依赖一个常被工程实现隐藏、但在理论上极关键的条件:高斯支撑区域在相机投影下足够小,以至于 projective mapping 在该区域内可以被局部仿射化。 更形式化地说,若

    π

    \\pi

    π 的 Hessian 记为

    H

    π

    H_\\pi

    Hπ,则 Taylor 余项满足

    π

    (

    μ

    c

    +

    δ

    )

    =

    π

    (

    μ

    c

    )

    +

    J

    δ

    +

    1

    2

    δ

    H

    π

    (

    ξ

    )

    δ

    ,

    (14)

    \\pi(\\mu_c+\\delta)= \\pi(\\mu_c)+J\\delta+\\frac12 \\delta^\\top H_\\pi(\\xi)\\delta, \\tag{14}

    π(μc+δ)=π(μc)+Jδ+21δHπ(ξ)δ,(14) 其中

    ξ

    \\xi

    ξ 位于

    μ

    c

    \\mu_c

    μc

    μ

    c

    +

    δ

    \\mu_c+\\delta

    μc+δ 之间。若

    δ

    /

    z

    |\\delta|/z

    δ∣/z不小,或 Gaussian 靠近 near plane,或 splat 尺寸过大,则二阶项不可忽略,

    Σ

    2

    D

    \\Sigma_{2D}

    Σ2D 将不再是可靠近似。Perspective Accurate Splatting 也正是围绕透视非线性误差与更准确 splatting 建模展开。

    3DGS 在实现层面因此会做 frustum culling、guard band 处理,并避免极端位置处不稳定的 projected covariance;gsplat 也在 API 中暴露了 near plane、radius clip、eps2d 等稳定化参数。

    必须强调:这个投影把 3D 体元变成了 2D 椭圆 splat,但椭圆 splat 不是曲面 chart。它只是在某个视图下的局部像平面核,不携带 face 的参数域,也不携带 edge 的归属关系。它渲染上极其高效,结构上却仍然是“无约束投影体元”。

    对于你的产品方案,如果系统强调大视角变化、近景几何、细边界或工业零件锐特征,那么“3D 高斯投影成 2D 椭圆”的 稳定性边界 必须被纳入架构设计。否则,训练阶段你是高效 rasterization,交付你就近视角失稳以及边缘漂移(没招了)。


    2.4 可微渲染、可见性排序与为何它天然偏向 photometric consistency

    3DGS 论文明确指出:其与 NeRF 式体渲染在图像形成层面本质一致。若对某个像素

    p

    \\mathbf{p}

    p 按深度从前到后排序,定义第 (i) 个高斯在该像素上的有效不透明度为

    a

    i

    (

    p

    )

    =

    α

    i

    exp

    !

    (

    1

    2

    (

    p

    μ

    i

    )

    Σ

    2

    D

    ,

    i

    1

    (

    p

    μ

    i

    )

    )

    ,

    (15)

    a_i(\\mathbf{p})= \\alpha_i \\exp!\\left( -\\frac12(\\mathbf{p}-\\mu_i')^\\top \\Sigma_{2D,i}^{-1}(\\mathbf{p}-\\mu_i') \\right), \\tag{15}

    ai(p)=αiexp!(21(pμi)Σ2D,i1(pμi)),(15) 则前向透射率为

    T

    i

    (

    p

    )

    =

    j

    <

    i

    (

    1

    a

    j

    (

    p

    )

    )

    ,

    (16)

    T_i(\\mathbf{p})=\\prod_{j<i}\\bigl(1-a_j(\\mathbf{p})\\bigr), \\tag{16}

    Ti(p)=j<i(1aj(p)),(16) 最终像素颜色可写为

    C

    (

    p

    )

    =

    i

    =

    1

    N

    T

    i

    (

    p

    )

    ,

    a

    i

    (

    p

    )

    ,

    c

    i

    (

    p

    )

    .

    (17)

    C(\\mathbf{p})= \\sum_{i=1}^{N} T_i(\\mathbf{p}),a_i(\\mathbf{p}),c_i(\\mathbf{p}). \\tag{17}

    C(p)=i=1NTi(p),ai(p),ci(p).(17) 3DGS 论文直接把 point blending 与 NeRF 的 volumetric rendering 放在同一图像形成框架下讨论;gsplat 也把深度排序后在 tile 内做 alpha-compositing 作为核心接口语义。

    工程上,3DGS 选择 tile-based splatting:先把屏幕分成小 tile,再按 tile 与深度对 Gaussians 排序,随后在每个 tile 内做前向 compositing,并在反向传播时恢复中间 opacity 累积值。

    论文强调这种做法避免了逐像素排序开销,使用 GPU radix sort,并允许对任意数量的 blended Gaussians 做高效反传。gsplat 文档则把 “group by tile + sort by increasing depth z + alpha-compositing” 作为标准实现描述。

    问题在于:这一整套机制的原生目标,是让渲染图像与训练图像一致,而不是让某个 surface manifold 成立。3DGS 在优化中使用的是图像重建损失,论文写明其损失项为

    L

    1

    L_1

    L1 与 D-SSIM/SSIM 的组合,而不是法向一致性、曲率正则、拓扑合法性之类的结构损失。

    从优化问题的角度,原始 3DGS 解决的是

    min

    Θ

    k

    (

    R

    (

    Θ

    ;

    Π

    k

    )

    ,

    I

    k

    )

    ,

    (18)

    \\min_{\\Theta}\\sum_{k} \\ell\\bigl(\\mathcal R(\\Theta;\\Pi_k), I_k\\bigr), \\tag{18}

    Θmink(R(Θ;Πk),Ik),(18) 其中

    Θ

    \\Theta

    Θ 为所有 Gaussian 参数,

    Π

    k

    \\Pi_k

    Πk 为相机,

    R

    \\mathcal R

    R 为渲染器。只要一组参数能在已观测视角下产生相近图像,它就可能是低损解;至于这组参数对应的体元集合是否来自单一曲面、是否存在稳定法向、是否对应合法边界与拓扑,目标函数并不直接关心。这意味着 photometric loss 的等价类通常远大于 geometric loss 的等价类,更远大于 topological validity 的等价类。

    因此,“可见性感知”不等于“几何一致性感知”。前者只管遮挡顺序与前向透射;后者则要求跨视角、跨局部、跨尺度的表面解释保持一致。二者不是一回事。

    3DGS 的可微渲染基于深度排序、tile-based splatting 与 alpha compositing,训练损失以图像重建为主。在 image formation 层面延续了 radiance field 传统,但在执行层面切换到了 GPU-friendly rasterization。但只要损失函数仍以 photometric consistency 为主,3DGS 的几何始终是“为渲染服务的隐含几何”,而不是“为工程消费服务的显式几何”。 所以对于工程应用产品而言,不能把“visibility-aware”误读成“geometry-aware”。系统若要支持测量、边界提取、CAD 反求、机器人抓取与装配,就必须在 photometric loss 之外,显式加入 geometry consistency、edge/curve consistency、topology validity 这类目标;否则渲染器越强,几何幻觉也可能越强。


    2.5 密度控制与优化动力学:它像自适应采样,但不是结构建模

    3DGS 的核心工程贡献之一是 interleaved optimization / density control:在优化位置、协方差、opacity 与 SH 的同时,周期性执行 densification、split、clone 与 pruning。论文明确描述了两类密度提升:对 under-reconstruction 的小 Gaussian 做 clone,对 over-reconstruction 的大 Gaussian 做 split,并对低 opacity 或过大的 Gaussian 执行裁剪。

    若从数值分析视角看,这非常像一种无网格的自适应离散化:

    • clone 类似在高残差区域添加新的自由度;
    • split 类似对局部基元做 (h)-refinement;
    • pruning 类似把无效基函数从活动集移除。

    其触发信号又不是任意拍脑袋,而是 view-space positional gradients 与 opacity 等与图像误差强相关的量。论文甚至直接指出,densify 的候选 Gaussian 往往具有较大的 view-space positional gradients;gsplat 的 densification 策略文档 也把 duplicating、splitting、pruning 的策略接口显式暴露出来,并提到与 AbsGS 相关的绝对梯度策略。

    请添加图片描述


    但它提升的是表示带宽,不是结构可解释性:

    • split/clone 只增加自由度,不引入 connectivity。
    • densification 的驱动来自图像误差,不来自边界算子、曲率张量、patch 邻接或拓扑约束。
    • Gaussian 数量变多,只会让表示更能“拟合外观”,不会自动让 face、edge、corner、trim 自发出现。

    从系统论角度,3DGS 的 densification 更像“自适应渲染基底成长机制”,而不是“结构元生成机制”。这是一个根本区分边界。

    所以当团队看到 clone/split/prune 带来更锐利边界和更高 PSNR 时,最容易犯的错误,是把“自由度增加后的外观改善”误判为“结构已经显式化”。产品经理看见薄结构恢复得更好,可能会自然追问:“那是不是可以直接出 CAD 了?”答案是否定的。自由度成长解决的是表示能力,不是语义建模能力。


    3、为什么原始 3DGS 擅长“像”,却不擅长“结构”

    3.1 高保真辐射场

    \\neq

    = 合法曲面

    在这里插入图片描述

    将所有 Gaussian 叠加,可写出一个连续体密度:

    ρ

    (

    x

    )

    =

    i

    =

    1

    N

    α

    i

    ,

    g

    i

    (

    x

    )

    .

    (19)

    \\rho(\\mathbf{x})=\\sum_{i=1}^{N}\\alpha_i,g_i(\\mathbf{x}). \\tag{19}

    ρ(x)=i=1Nαi,gi(x).(19) 从数学上说,你当然可以随意取某个阈值

    τ

    \\tau

    τ,构造等值面

    M

    τ

    =

    x

    R

    3

    ρ

    (

    x

    )

    =

    τ

    .

    (20)

    \\mathcal{M}_\\tau={\\mathbf{x}\\in\\mathbb R^3\\mid \\rho(\\mathbf{x})=\\tau}. \\tag{20}

    Mτ=xR3ρ(x)=τ.(20) 但问题是:原始 3DGS 并没有训练一个“唯一合法的表面”。阈值

    τ

    \\tau

    τ 不是模型语义的一部分,很多不同的

    ρ

    \\rho

    ρ 都可能在训练视图上产生近似相同的图像。也就是说,视觉可行解集合远大于表面可行解集合。

    因此,3DGS 可以非常擅长重建外观与可见性,却不天然定义一个唯一、稳定、可消费的 surface manifold。3DGS 论文的成功指标主要仍是 PSNR、SSIM、LPIPS,这也从侧面说明它原始任务不是表面合法性,而是视觉重建质量.

    3.2 局部体元分布

    \\neq

    = 参数曲面

    参数曲面不是一堆局部薄片的堆叠,而是一个带有参数域与连续映射的对象:

    S

    :

    Ω

    R

    2

    R

    3

    ,

    (

    u

    ,

    v

    )

    S

    (

    u

    ,

    v

    )

    .

    (21)

    S:\\Omega\\subset\\mathbb R^2\\rightarrow\\mathbb R^3,\\qquad (u,v)\\mapsto S(u,v). \\tag{21}

    S:ΩR2R3,(u,v)S(u,v).(21) 对于一个 CAD face,还必须知道其参数域

    Ω

    \\Omega

    Ω 是什么、边界

    Ω

    \\partial\\Omega

    Ω 如何被 trimming curve 裁切、与其他 face 如何相接。Gaussian 集合没有

    (

    u

    ,

    v

    )

    (u,v)

    (u,v) 域、没有 trim loop、没有参数连续性条件、没有跨 patch 的

    G

    0

    /

    G

    1

    /

    G

    2

    G^0/G^1/G^2

    G0/G1/G2 关系。

    因此,即便某个局部 Gaussian 看起来很“贴”表面,它也只是一个体元统计核,不是曲面 patch。本质上,参数曲面讲的是几何函数;Gaussian 讲的是局部分布函数。 前者天然带域、边界与映射;后者天然带均值、方差与权重。这是两种对象。

    3.3 视觉连续

    \\neq

    = 拓扑连续

    视觉上连续的边界,可能只是多视图投影下重叠 splat 的结果,并不代表 3D 中真的存在一条连续 edge。两个互不相连的 Gaussian 簇,在若干视角中完全可能投影成一条“看上去连续”的轮廓;反过来,一个真实的 sharp edge,也可能被多个薄片 Gaussian 以不同方式近似,而不携带“这是两个 face 的交线”这一语义。

    这就是为什么高斯集合不天然具有以下对象: face、edge、corner、trimming loop、adjacency、incidence relation、B-rep legality。 这些对象都不是“靠长得像”就能得到,而是必须被显式建模、推理、约束与校验。


    3.4 “后处理拟合一下”不是工程补丁,而是表示范式跨越

    这一点必须说得非常重。很多工程讨论会把“先训一个 3DGS,再后面拟合一下曲面”视为轻量后处理。这个判断在数学上并不成立。因为一旦从 Gaussian 集合转向 CAD / B-rep,你就必须同时回答:

  • 哪些 Gaussian 属于同一个 surface patch?
  • 该 patch 属于 plane、cylinder、sphere 还是 freeform surface?
  • edge 是 silhouette、crease、surface intersection 还是 trimming boundary?
  • corner 是几何交点还是分割伪影?
  • 哪些 face 相邻,哪些 edge 共享,哪些 loop 闭合?
  • 最终组合拓扑是否合法,是否 watertight,是否可进入 STEP-friendly 交换结构?
  • BrepGaussian 的流程恰恰证明了这不是“小后处理”:它先从多视图图像提取 edge mask 与 patch mask,再做两阶段 Gaussian 学习,随后把 learned Gaussians 转成带标签 point cloud,再做 primitive fitting、surface-to-edge-to-corner 的层级抽取、bottom-up assembly、topological adjustment,最后才得到完整 B-rep。作者对其方法的表述不是“把现有 3DGS 顺手拟合一下”,而是一个完整的 CAD reconstruction pipeline。

    从这个意义上说,该方向的所有工作都说明了从 Gaussian 到 CAD 不是“渲染表示的后处理”,而是“表示范式的跨层跃迁”。


    3.5 工程系统真正需要的是“结构可消费性”

    对于工业系统,真正重要的不是一个模型能否被 viewer 流畅播放,而是它能否被下游系统消费。所谓结构可消费性,至少包含四层:

  • 可测量: 边、角、半径、法向、厚度、间隙可稳定定义。
  • 可编辑: face 可选中、曲面参数可改、trim 可重构。
  • 可装配: 邻接、相交、配合、约束关系可解析。
  • 可交付: 可进入 CAD/BIM/仿真/机器人/质量检测链路。
  • 原始 3DGS 没有为这些目标设计本体变量。它的变量是均值、协方差、opacity、SH;它的优化器会 clone/split/prune;它的目标函数面向图像;它的输出形态是一堆可渲染 splats。它当然可以是上游,但不是天然终态。


    小结: 原始 3DGS 的目标、变量与指标都服务于 novel-view synthesis;BrepGaussian 为了得到 B-rep,必须额外引入 edge / patch labels、primitive fitting 与 topological adjustment。现在工作中实现的视觉上“像”与结构上“合法”之间的发展转变,不是连续小步,而是层级跳变。把“后拟合”说得过于轻松,说明其往往低估了从连续体元场到离散组合拓扑的难度。

    如果平台目标是数字化交付而非仅仅浏览,那么“输出 splat”只能算中间阶段。研发立项时必须明确:最终交付物是 viewer asset、mesh asset、还是 CAD/B-rep asset。三者不是一个东西,也不能用同一套成功指标。


    赞(0)
    未经允许不得转载:171主机测评 » CVPR 2026的3DGS卷到什么地步?工程语义上探:BrepGaussian如何打通图像到CAD的最后一公里?(Part I 1-3)
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址