空间智能实战课 · 模块一:空间感知基础
课程定位:从零到落地,掌握3DGS+空间智能全栈能力 目标学员:开发者/研究生/转行AI的工程师 卖点:不讲理论废话,每个模块都有可跑的代码+可展示的成果
模块概览
| 模块名 | 空间感知基础(入门篇) |
| 学完你能做什么 | 用手机拍一圈照片,5分钟生成一个3D模型 |
| 课时 | 4节 |
| 难度 | 入门 |
| 交付物 | 学员自己的第一个3D点云模型 |
| 技术栈 | COLMAP + SfM |
1.1 空间智能全景图:这个赛道在发生什么
什么是空间智能
空间智能(Spatial Intelligence)是机器在3D空间和时间中感知、推理和行动的能力。斯坦福大学教授李飞飞将其定义为\”我们认知赖以建立的脚手架\”——人类天生就能感知三维结构、推理物体关系、在环境中导航并操纵物理实体,而让机器获得这种能力,是AI发展的下一个前沿。
2026年,空间智能正在成为AI发展的核心赛道。它让AI不仅能\”看懂\”二维图片,更能\”理解\”三维空间;不仅能\”描述\”世界,更能\”模拟\”和\”预测\”物理规律。李飞飞创立的World Labs已发布世界模型Marble,标志着空间智能从学术概念走向产业实践。
核心认知:空间智能不是单一技术,而是一个技术栈:底层是3D感知与重建(SfM/3DGS),中层是3D理解与推理(Spatial VLM),顶层是世界模型与具身智能。本课程将从底层开始,逐层带你打通整个技术栈。
技术演进:从2D到3D的四个阶段
第一阶段:2D感知时代(2012-2018) CNN驱动的图像分类、检测、分割。AI能\”看到\”像素,但不理解空间。代表作:AlexNet、ResNet、YOLO。这是二维平面上的智能。
第二阶段:3D重建探索期(2018-2022) 传统SfM/MVS方法成熟(COLMAP成为标杆),NeRF横空出世(2020年),用神经网络隐式表示3D场景。但NeRF训练慢、渲染慢,难以实用化。
第三阶段:3DGS爆发期(2023-2025) 3D Gaussian Splatting(2023年SIGGRAPH)用显式高斯球替代隐式神经网络,实现实时渲染,训练速度提升10倍以上。3DGS在渲染速度与质量上实现了对NeRF的代际超越,成为3D重建的核心基石。
第四阶段:空间智能生态期(2025-2026) 空间VLM(Spatial-MLLM)让大模型\”看懂\”3D场景;World Labs发布Marble世界模型;Holi-Spatial框架获ICML 2026 Oral,能从视频流自动构建3D空间智能数据。空间智能完成从学术到产业的跨越。
2026年空间智能技术栈地图
| 3D感知与采集 | 多视图图像、深度相机、LiDAR | 空间智能的数据入口 |
| 3D重建与表示 | SfM→稀疏点云→MVS→稠密点云→3DGS/NeRF | 从\”照片\”到\”3D模型\”的转换 |
| 3D理解与推理 | Spatial VLM、3D特征提取、空间关系推理 | 让AI\”看懂\”3D场景 |
| 3D内容生成 | 文本/图像→3D资产(DreamFusion、LGM) | 游戏、电商、影视的3D资产生成 |
| 具身智能与导航 | 仿真环境 + 3DGS-SLAM | 机器人在真实3D世界中移动和操作 |
| 世界模型 | Sora、Marble | AI对物理世界的内部模拟 |
商业应用场景
| 房地产3D看房 | SfM + 3DGS | 已商用 | ★★★★★ |
| 无人机测绘 | 航拍 + COLMAP + MVS | 成熟 | ★★★★★ |
| 电商3D商品展示 | 单图→3DGS(LGM) | 快速增长 | ★★★★☆ |
| 文旅/景区数字化 | 无人机 + 3DGS + Web渲染 | 已商用 | ★★★★☆ |
| 游戏/影视资产生成 | 文本→3D + 4D生成 | 探索期 | ★★★☆☆ |
| 工程验收 | 无人机 + BIM对比 | 已商用 | ★★★★☆ |
| 具身导航/机器人 | 3DGS-SLAM + VLM | 研究前沿 | ★★★☆☆ |
学习建议:不需要被这么多技术吓到。本模块的终极目标只有一个:让你用手机拍100张照片,跑通COLMAP,生成你的第一个3D点云。所有高阶技术都建立在这个基础之上。先跑通,再深入。
1.2 相机模型与多视图几何(10分钟讲明白,不推公式)
针孔相机模型:3D世界如何变成2D照片
所有3D重建的起点,都来自一个最基本的问题:3D世界是如何变成2D照片的? 理解了这个过程,你就能理解3D重建要做什么——把它反过来。
针孔相机的原理就是初中物理学的\”小孔成像\”。在这个模型中,3D世界中的一个点 P,通过相机光心(投影中心),投影到图像平面上的一个像素点 p。这个过程涉及三个坐标系:
1. 世界坐标系(World Coordinate System) 3D场景的真实坐标,通常以场景中某个固定点为原点。比如一栋建筑的角点。单位是米/厘米等物理单位。一个点的坐标记为 (X, Y, Z)。
2. 相机坐标系(Camera Coordinate System) 以相机光心为原点的坐标系。Z轴指向相机前方(拍摄方向),X轴向右,Y轴向下。世界坐标系到相机坐标系的转换通过**外参(Extrinsic Parameters)**完成:旋转 R + 平移 t。
3. 图像/像素坐标系(Image/Pixel Coordinate System) 照片上的2D像素坐标,原点通常在左上角,单位是像素。相机坐标系到图像坐标系的转换通过**内参(Intrinsic Parameters)**完成:焦距 f、主点 (cx, cy)。
一句话理解:外参告诉你\”相机在哪、朝哪个方向\”(位姿),内参告诉你\”相机的镜头是什么样的\”(光学参数)。SfM的核心任务,就是从多张照片反推每张照片的外参和内参,同时恢复出场景的3D结构。
投影公式(直觉版):
# 针孔相机投影(直觉版)
u = fx * (X / Z) + cx
v = fy * (Y / Z) + cy
# 其中:
# fx, fy = 焦距(像素单位)
# cx, cy = 主点(通常接近图像中心)
# X/Z, Y/Z = 透视除法(远处的物体看起来更小)
关键直觉:除以Z就是透视投影。离相机越远的点(Z越大),在图像上越靠近中心、显得越小。这就是\”近大远小\”的数学本质。
从单张照片到多张照片:为什么要多视图
单张照片是一个3D场景的2D投影——深度信息丢失了。你无法
