欢迎光临
我们一直在努力

模块一_空间感知基础_CSDN

空间智能实战课 · 模块一:空间感知基础

课程定位:从零到落地,掌握3DGS+空间智能全栈能力 目标学员:开发者/研究生/转行AI的工程师 卖点:不讲理论废话,每个模块都有可跑的代码+可展示的成果


模块概览

属性
内容
模块名 空间感知基础(入门篇)
学完你能做什么 用手机拍一圈照片,5分钟生成一个3D模型
课时 4节
难度 入门
交付物 学员自己的第一个3D点云模型
技术栈 COLMAP + SfM

1.1 空间智能全景图:这个赛道在发生什么

什么是空间智能

空间智能(Spatial Intelligence)是机器在3D空间和时间中感知、推理和行动的能力。斯坦福大学教授李飞飞将其定义为\”我们认知赖以建立的脚手架\”——人类天生就能感知三维结构、推理物体关系、在环境中导航并操纵物理实体,而让机器获得这种能力,是AI发展的下一个前沿。

2026年,空间智能正在成为AI发展的核心赛道。它让AI不仅能\”看懂\”二维图片,更能\”理解\”三维空间;不仅能\”描述\”世界,更能\”模拟\”和\”预测\”物理规律。李飞飞创立的World Labs已发布世界模型Marble,标志着空间智能从学术概念走向产业实践。

核心认知:空间智能不是单一技术,而是一个技术栈:底层是3D感知与重建(SfM/3DGS),中层是3D理解与推理(Spatial VLM),顶层是世界模型与具身智能。本课程将从底层开始,逐层带你打通整个技术栈。

技术演进:从2D到3D的四个阶段

第一阶段:2D感知时代(2012-2018) CNN驱动的图像分类、检测、分割。AI能\”看到\”像素,但不理解空间。代表作:AlexNet、ResNet、YOLO。这是二维平面上的智能。

第二阶段:3D重建探索期(2018-2022) 传统SfM/MVS方法成熟(COLMAP成为标杆),NeRF横空出世(2020年),用神经网络隐式表示3D场景。但NeRF训练慢、渲染慢,难以实用化。

第三阶段:3DGS爆发期(2023-2025) 3D Gaussian Splatting(2023年SIGGRAPH)用显式高斯球替代隐式神经网络,实现实时渲染,训练速度提升10倍以上。3DGS在渲染速度与质量上实现了对NeRF的代际超越,成为3D重建的核心基石。

第四阶段:空间智能生态期(2025-2026) 空间VLM(Spatial-MLLM)让大模型\”看懂\”3D场景;World Labs发布Marble世界模型;Holi-Spatial框架获ICML 2026 Oral,能从视频流自动构建3D空间智能数据。空间智能完成从学术到产业的跨越。

2026年空间智能技术栈地图

技术层
核心内容
说明
3D感知与采集 多视图图像、深度相机、LiDAR 空间智能的数据入口
3D重建与表示 SfM→稀疏点云→MVS→稠密点云→3DGS/NeRF 从\”照片\”到\”3D模型\”的转换
3D理解与推理 Spatial VLM、3D特征提取、空间关系推理 让AI\”看懂\”3D场景
3D内容生成 文本/图像→3D资产(DreamFusion、LGM) 游戏、电商、影视的3D资产生成
具身智能与导航 仿真环境 + 3DGS-SLAM 机器人在真实3D世界中移动和操作
世界模型 Sora、Marble AI对物理世界的内部模拟

商业应用场景

场景
技术栈
成熟度
市场规模
房地产3D看房 SfM + 3DGS 已商用 ★★★★★
无人机测绘 航拍 + COLMAP + MVS 成熟 ★★★★★
电商3D商品展示 单图→3DGS(LGM) 快速增长 ★★★★☆
文旅/景区数字化 无人机 + 3DGS + Web渲染 已商用 ★★★★☆
游戏/影视资产生成 文本→3D + 4D生成 探索期 ★★★☆☆
工程验收 无人机 + BIM对比 已商用 ★★★★☆
具身导航/机器人 3DGS-SLAM + VLM 研究前沿 ★★★☆☆

学习建议:不需要被这么多技术吓到。本模块的终极目标只有一个:让你用手机拍100张照片,跑通COLMAP,生成你的第一个3D点云。所有高阶技术都建立在这个基础之上。先跑通,再深入。


1.2 相机模型与多视图几何(10分钟讲明白,不推公式)

针孔相机模型:3D世界如何变成2D照片

所有3D重建的起点,都来自一个最基本的问题:3D世界是如何变成2D照片的? 理解了这个过程,你就能理解3D重建要做什么——把它反过来。

针孔相机的原理就是初中物理学的\”小孔成像\”。在这个模型中,3D世界中的一个点 P,通过相机光心(投影中心),投影到图像平面上的一个像素点 p。这个过程涉及三个坐标系:

1. 世界坐标系(World Coordinate System) 3D场景的真实坐标,通常以场景中某个固定点为原点。比如一栋建筑的角点。单位是米/厘米等物理单位。一个点的坐标记为 (X, Y, Z)。

2. 相机坐标系(Camera Coordinate System) 以相机光心为原点的坐标系。Z轴指向相机前方(拍摄方向),X轴向右,Y轴向下。世界坐标系到相机坐标系的转换通过**外参(Extrinsic Parameters)**完成:旋转 R + 平移 t。

3. 图像/像素坐标系(Image/Pixel Coordinate System) 照片上的2D像素坐标,原点通常在左上角,单位是像素。相机坐标系到图像坐标系的转换通过**内参(Intrinsic Parameters)**完成:焦距 f、主点 (cx, cy)。

一句话理解:外参告诉你\”相机在哪、朝哪个方向\”(位姿),内参告诉你\”相机的镜头是什么样的\”(光学参数)。SfM的核心任务,就是从多张照片反推每张照片的外参和内参,同时恢复出场景的3D结构。

投影公式(直觉版):

# 针孔相机投影(直觉版)
u = fx * (X / Z) + cx
v = fy * (Y / Z) + cy

# 其中:
# fx, fy = 焦距(像素单位)
# cx, cy = 主点(通常接近图像中心)
# X/Z, Y/Z = 透视除法(远处的物体看起来更小)

关键直觉:除以Z就是透视投影。离相机越远的点(Z越大),在图像上越靠近中心、显得越小。这就是\”近大远小\”的数学本质。

从单张照片到多张照片:为什么要多视图

单张照片是一个3D场景的2D投影——深度信息丢失了。你无法

赞(0)
未经允许不得转载:171主机测评 » 模块一_空间感知基础_CSDN
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址