资讯动态

从 3D Gaussian Splatting 到具身智能:AI 正在学会“进入世界”

发布时间:2026/8/31 18:06:12 来源:尧图企业网站定制
从 3D Gaussian Splatting 到具身智能AI 正在学会“进入世界”前言过去十年AI 已经学会了两件事读和写。大模型可以理解复杂语义也能生成高质量内容看起来已经“很聪明”。但如果把它放进真实世界比如让它去拿一个杯子、开一扇门、或者在陌生环境中行动它会立刻暴露出一个本质问题它不理解空间也不会行动。这正是当前 AI 的边界所在。语言智能解决的是“知道”而现实世界需要的是“做到”。从这个角度看AI 的下一阶段其实不是更强的对话能力而是——具身智能Embodied AI。而在这条路径上一个原本属于计算机图形学的技术——3D Gaussian Splatting3DGS正在成为关键支点。3DGS不只是更快的 NeRF很多人第一次听到 3DGS往往把它当作“NeRF 的加速版”。这种理解并不完全错但远远不够。传统三维表示方法其实一直存在一个经典矛盾Mesh / 点云结构清晰但表达能力有限NeRF表达能力强但推理极慢3DGS 的价值在于它打破了这个二选一的局面。它用一组带有空间分布的高斯来表示场景使得系统既具备显式结构又保留了连续表达能力同时还能实现实时渲染。但更重要的是它带来了一种新的可能性把三维世界变成一种可以计算、可以查询的数据结构你给的材料里其实已经点出了这一点——3DGS 正在从“单场景表示”走向“世界级系统” 。这句话背后的含义是整个技术方向的转折点。京东https://item.jd.com/15356282.html当当https://product.dangdang.com/30039018.html编辑推荐1大厂一线算法专家倾力打造凝练多项工程经验与专利成果 2打通从传统几何重建到神经场建模的知识壁垒构建NeRF与3DGS的完整技术谱系 3融合公式推导深入渲染管线系统解析NeRF与3DGS核心机制与源码 4传授NerfStudio可视化与异构优化实践经验带你构建面向工程落地的三维重建实现体系内容简介本书旨在为读者架起一座从三维视觉理论通往神经渲染实战的桥梁。面对NeRF与3DGS技术陡峭的学习曲线本书坚持“原理深度”与“工程落地”并重不仅系统解析了从多视图几何到神经隐式表示的演进逻辑更通过丰富的代码注解与可视化案例将复杂的数学推导转化为可操作的工程实践。无论你是希望深入理解体渲染奥秘的算法研究员还是致力于优化重建流程的开发工程师都能在本书中找到从入门到进阶的完整路径。全书共分为8章。第1章综览三维重建技术全景奠定NeRF与3DGS的理论基石。第2章与第3章夯实数学与渲染基础详解坐标变换、投影映射与体渲染流水线。第4章与第5章深入NeRF核心从源码层面剖析位置编码、分层采样并通过NerfStudio平台演示模型训练与调试的完整闭环。第6章聚焦3DGS技术详细解读三维高斯表示、快速可微光栅化及密度控制策略。第7章拓展至产业应用介绍三维模型提取、Blender插件开发与交互渲染技巧。第8章则着眼于性能瓶颈探讨跨平台加速与优化策略助力模型高效部署。作者简介作者简介宗炜资深AI与图形图像工程师长期专注于三维重建、神经渲染与异构计算优化。拥有十余年系统研发经验参与多项图形图像与性能优化项目获多项相关技术专利并致力于三维表示技术从理论到工程落地的体系化实践。巴·孟克吉尔格力毕业于亚琛工业大学拥有多年视频编解码开源框架开发经验曾参与基于深度学习的场景深度估计、三维场景重建等多个研究项目。目前就职于Intel从事AI大模型适配和优化等相关工作。凌静毕业于华东师范大学曾任Intel 3D算法工程师从事三维重建算法在Intel GPU平台上的部署适配与性能优化工作。曾为开源框架NerfStudio提供Zip-NeRF模型适配支持。李建宇毕业于复旦大学专注于各类AI模型在Intel平台上的部署与优化曾负责3DGS、NeRF等模型在Intel GPU上的移植工作。此前他曾在S3 Graphics、ARM等企业从事Direct3D、OpenGL ES及Vulkan等图形驱动的开发。许广新曾任Intel数据中心AI训练高级经理从事大语言模型、多模态模型及NeRF、3DGS等三维生成模型的训练与性能优化工作拥有多项国际专利在AI基础架构与模型性能优化领域具有丰富经验。一个关键变化从渲染工具到“空间系统”过去的三维技术大多是离线的。你建模 → 渲染 → 输出结果这是一个典型的“工具链”。但现在的系统比如新一代 Web 3D 渲染架构开始发生变化它们更像是“运行时系统”场景可以按需加载类似视频流数据可以跨设备访问渲染复杂度与场景规模解耦这意味着什么简单说一句三维世界开始像网页一样被访问而不是像文件一样被处理一旦三维数据变成“在线系统”它就不再只是用来看而是可以参与计算、推理甚至决策。这一步是 3DGS 真正“出圈”的原因。AI 的三块拼图认知、空间、行动如果把问题再往上抽象其实可以用一句话总结当前 AI 的核心方向让机器不仅能理解世界还能在世界中行动这背后对应三种能力1. 认知Cognition由多模态大模型承担比如 GPT-4V、LLaVA 这类模型。它负责理解用户在说什么任务是什么目标是什么但它有一个明显短板 它不知道世界的真实结构2. 空间Spatial Representation这正是 3DGS 的位置。它提供的是一种能力物体在哪里长什么样与其他物体的关系从本质上看3DGS 正在变成一种“空间数据库”你可以查询、操作、甚至更新这个三维世界。3. 行动Action这是最容易被忽视、但最关键的一层。传统方法用控制算法或者强化学习而现在越来越多工作开始用生成模型尤其是 Flow / Diffusion来生成动作轨迹。相比扩散模型Flow Matching 的优势在于推理更快延迟更低更适合实时控制一个完整闭环AI 如何真正“做事”当这三块拼图拼在一起就会形成一个非常清晰的结构用户指令 ↓ 多模态 LLM理解任务 ↓ 3DGS获取空间信息 ↓ Flow 模型生成动作 ↓ 执行 ↓ 反馈 → 再次更新这个结构的关键不是每一层有多强而是它是闭环的过去的 AI大多是“输入 → 输出”。而这里是“输入 → 行动 → 反馈 → 再决策”。这才是智能系统的本质。为什么 3DGS 是关键而不是可选项你可以把整个系统想象成三层LLM大脑Flow肌肉3DGS眼睛 空间记忆如果没有 LLM系统没有目标如果没有 Flow系统无法行动但如果没有 3DGS 系统根本不知道世界是什么样这也是为什么很多“看起来很强”的 AI在现实环境中表现很差——它们缺的是空间层。而 3DGS 的意义就在于第一次让空间层同时具备表达能力 实时性 工程可行性工程现实理想很美落地很难说到这里很容易产生一种错觉路线已经清晰剩下就是工程实现。但现实恰恰相反。目前最大的问题有三个1. 技术门槛极高涉及多视图几何神经渲染优化算法不是简单调库能解决的2. 工程链路很长典型流程是数据采集 → SfM → MVS → NeRF → 3DGS每一步都有坑而且很多是“隐性坑”。3. 性能优化困难GPU 显存限制数据调度问题实时性要求很多项目 能跑但不可用 可用但不可扩展总结如果用一句话总结这条技术路线AI 正在从“理解信息”走向“进入世界并采取行动”而这条路径的核心结构其实已经很清晰大模型负责理解3DGS 负责建模世界Flow 模型负责行动其中3DGS 是最容易被忽视的一环但它很可能是AI 从虚拟智能走向现实智能的关键桥梁如果你正在做三维重建、机器人、自动驾驶或者 XR这个方向基本可以确定——不是短期热点而是长期基础设施。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价