1. 写在前面我在机械臂调试现场撞上的那堵墙我最早认真思考具身智能需要新数学这个问题不是在看论文的时候而是在调试一台六轴机械臂抓取任务的现场。当时的情况特别典型模型在云端跑得好好的识别精度95%以上规划路径也漂亮但一搬到车间边缘侧的工控机上整个流程就开始慢半拍。相机采一帧图推理干掉 300 毫秒路径规划又吃掉 200 毫秒加上通信和机械执行的时间一个简单的抓取-放置周期快两秒了。更要命的是只要目标物体稍微换个角度或者光照变一点模型输出的抓取位姿就抖得厉害机械臂险些把旁边的工件撞飞。那一刻我真正理解了什么叫边缘AI之墙。这堵墙不只是算力不够的问题而是整个 AI 数学模型和物理世界交互方式之间的错位。深度学习这套数学工具本质上是为离线、大数据、云端大规模算力设计的而具身智能也就是能被部署到人形机器人、机械臂、移动底盘上、真正在物理世界里干活的智能体它的约束条件完全不同——实时性、安全性、不确定性、边缘侧有限算力每一道都是现有数学框架没有很好回答的问题。《人形机器人与具身智能标准体系2026版》发布之后行业里讨论的热度明显上来了。但标准解决的是接口和协议的问题更深层的机器人怎么在物理世界里既快又稳地决策这个问题始终绕不开数学这个底座。这也是我这篇文章想聊透的事具身智能为什么需要新的数学以及这批新工具到底长什么样、该怎么学。2. 深度学习数学大厦的地基是按云端逻辑浇筑的2.1 大数据假设在物理世界里不成立深度学习能够成功靠的是三样东西海量数据、大规模并行算力、梯度下降优化。这三样东西有一个共同的隐含前提——数据是廉价的、可以无限获取的。图像识别可以把互联网上几十亿张图片灌进模型语言模型可以把整个互联网文本作为训练语料因为数据错了、样本少了无非是再多爬点数据、再训一轮。但具身智能面对的是物理世界机械臂每试错一次轻则工件报废重则设备损坏甚至伤人。人形机器人在真实环境里跌倒几次关节电机可能就过载烧掉了。所以具身智能的数据本质上是一种昂贵数据它的获取成本远高于互联网文本和静态图片。这意味着我们不能指望靠大数据大模型暴力计算这条路让机器人学会物理世界的技能。我们需要的是另一种数学工具能在少量样本下泛化、能在模型结构中注入先验知识、能对未见过的场景做出合理推断的方法体系。2.2 神经网络的黑箱特性无法通过安全审查我做过一个移动机器人的避障项目用端到端的强化学习训练策略网络。仿真里表现很好但在真实走廊里跑时不时会做出让人看不懂的绕行决策——明明左侧有空当它偏要往右侧贴着墙走没什么道理可讲。后来我查了网络内部特征发现它在训练数据里学到了一些和走廊这个语义强相关但和真正障碍物无关的统计特征。这就牵扯到一个根本性问题神经网络是一个黑箱函数逼近器它把输入映射到输出但这个映射的内部逻辑是不可解释的。对于刷短视频的推荐系统不可解释最多导致推荐不准对于在工厂里和人协同作业的机械臂不可解释意味着无法给出安全保证无法证明在什么条件下系统绝对不会伤害到人。传统控制论之所以在工业界被大量采用恰恰是因为它有严谨的数学证明——Lyapunov 稳定性定理能保证系统在某个区域内收敛能给出明确的鲁棒性边界。而深度学习社区习惯用实验效果好来替代理论上可保证这在具身智能领域是行不通的。所以我们需要新的数学框架在保持学习能力的同时恢复某种程度的可证明性。2.3 欧氏空间假设让模型理解不了身体再往深挖一层当前深度学习的主流网络结构CNN、Transformer是在欧氏空间里设计出来的。卷积操作假设的是网格结构的平移不变性Transformer 的注意力机制假设的是序列位置编码的规则性。这些假设对图片、文本是成立的因为像素是规则网格单词是线性序列。但机器人的身体是高维刚体结构。一个六轴机械臂的末端位姿不是用三个坐标(x,y,z)就能描述的还要加上三个旋转自由度。这个旋转自由度构成的群叫 SO(3)它是一个三维旋转群如果再算上平移就构成了 SE(3) 刚体运动群。这些数学对象不是欧氏空间它们是流形——一种在局部看起来像欧氏空间、但全局结构完全不同的几何对象。一个最直观的体现在欧氏空间里两个姿态之间的距离可以用欧几里得距离衡量但在 SO(3) 流形上两个姿态之间的距离应该用测地线距离衡量而且同一个旋转可以用不同欧拉角表示存在万向锁问题。如果你用普通欧氏空间的损失函数去训练机器人模型模型会莫名其妙地不收敛或者收敛到一个在欧氏度量下最优、但在物理上完全不可行的姿态。这解释了为什么很多端到端机器人模型训练出来以后机械臂总会做出一些诡异的绕路动作——因为数学度量本身就没有尊重机器人的身体结构。2.4 实时闭环要求暴露推理延迟的痛点深度学习模型推理是有延迟的。一个 70B 参数的大语言模型在云端跑一次推理可能要几百毫秒甚至几秒即便是一个中等规模的视觉 Transformer 模型在边缘侧推理也需要几十毫秒。但具身智能的控制闭环通常要求在 10-100 毫秒内完成感知-决策-执行这一个周期。人类的反射弧大概是 100 毫秒左右工业机器人要高很多力控反馈甚至需要 1 千赫兹级别的更新频率。如果每次决策都要经过一个几百毫秒的大模型推理这个智能体在物理世界里基本是一个半瞎的存在——看到障碍物再反应早就撞上去了。这里就出现了一个深刻的数学矛盾越复杂的模型表达能力越强但推理延迟越高而具身智能的实时性约束要求模型必须在极短时间内给出合理决策。传统上我们靠把模型搬上更强的芯片来缓解但边缘侧的功耗、散热、成本约束摆在那里这条路越走越窄。更本质的解法是改变数学表达方式——不一定要用那么深的网络不一定要用那么大的参数规模而是用更贴合物理世界的数学结构来编码知识。3. 打破那堵墙的五把数学钥匙3.1 几何深度学习把对称性写进模型结构几何深度学习Geometric Deep Learning是目前我看到的、最贴近具身智能实际需求的数学方向之一。它的核心思想是神经网络不应该对数据的所有变换都一视同仁而应该把数据的对称性内建到模型结构里。举一个最简单的例子。CNN 之所以在图像上有效是因为它内建了平移等变性——图片里一只猫无论出现在左上角还是右下角卷积核都能识别出它是猫。这个性质在数学上的表述是网络结构与平移群之间存在等变关系。对于机器人来说身体动作的对称性远比图像的平移对称性复杂。机械臂的末端执行器旋转一个角度对应的抓取策略也应该旋转同样的角度这叫做 SE(3) 等变性。如果我们能在网络结构里内建这种等变性模型就不需要从海量数据里去偷偷学旋转不变性而是从数学结构上天然具备这个能力数据效率会指数级提升。我实际试用过一些基于等变图网络的抓取位姿估计模型比如基于 SE(3) 等变 CNN 的实现效果和普通 CNN 相比确实有一个量级的改进同样的训练数据量下姿态估计的精度更高而且泛化到未见物体的能力明显增强。这背后的数学道理其实很简单——如果模型结构本身就尊重了物理世界的对称性那需要从数据里学的东西就少了。3.2 流形与黎曼几何让代价函数尊重身体结构前面提到 SO(3) 旋转群是一个流形。流形这个概念对很多人来说很抽象但我可以给一个直觉理解地球表面是一个二维流形。你在北京走直线最终会绕地球一圈回到北京这是因为地球表面不是平面而是弯曲的。在流形上做计算时不能简单地用笛卡尔坐标而要用流形自身的度量结构。机器人的状态空间本质上是流形。一个双足机器人的身体姿态一个机械臂的关节角度组合都处于各自的流形空间里。如果我们的优化算法、损失函数、控制策略不尊重这个流形结构就会出现前面提到的各种诡异问题。最典型的例子是机械臂的姿态插值。如果两个姿态之间的过渡直接用欧氏空间线性插值机械臂会绕一个很大的弧线运动甚至在中间某个点出现关节极限超限。正确的方式是在 SO(3) 流形上用测地线插值SLERP球面线性插值这样过渡是最短路径且不会产生无意义的绕路。这个数学细节在实际项目里的影响非常大。我在做一个双臂协作任务的时候最初用普通的欧氏空间插值去规划末端轨迹结果双臂在中间某个位形差点打起来。后来换成流形感知的规划方法这个问题直接消失了。当时我意识到数学结构选对了很多工程问题会自然消失数学结构选错了后面再用什么优化技巧都是头痛医头。3.3 拓扑学理解状态空间的连通结构拓扑学在具身智能里的作用主要是帮助我们理解状态空间的全局结构和可行性。一个机器人的所有可达状态构成的集合在拓扑学上可能有复杂的连通结构。有些状态看起来离得很近实际上被障碍物分割在不同的连通区域里有些状态离得很远但存在一条捷径可以通过。传统规划算法比如 PRM、RRT本质上就是在状态空间的拓扑结构上做搜索。这些算法有效但计算开销大尤其在维度高的机械臂上。新兴的方向是用拓扑数据分析TDA来提取状态空间的拓扑特征帮助机器人理解当前环境的连通性信息。我见过一个研究把环境的占用地图转换成拓扑图机器人只需要在这个拓扑图上做规划而不是在原始占据栅格上做规划计算量小了两个数量级而且对噪声明感的鲁棒性大幅度提高。另外一个拓扑学相关的关键概念是拓扑等价。一个杯子和一个甜甜圈在拓扑上是等价的都有一个洞一个机器人抓手能不能成功抓取一个物体很多时候取决于它是否理解了物体的拓扑结构——比如一个圆环不穿过洞就无法锁住它。这种拓扑理解很难用纯卷积神经网络完成因为 CNN 本质上是局部特征提取器缺乏全局拓扑感知能力。新的数学工具正在试图填补这个空白。3.4 最优传输重新定义策略迁移与分布匹配最优传输Optimal Transport这几年在机器学习领域重新火起来我在研究具身智能的仿真到现实迁移问题时发现它几乎是为这个问题量身定做的。仿真到现实迁移的核心难点是仿真环境里学到的策略拿到真实机器人上经常失效因为仿真和真实世界的状态分布存在偏差——摩擦力、刚度、延迟都不一样。传统的解决办法是域随机化在仿真里疯狂加随机扰动企图让模型变得百毒不侵。但这种方法本质上是在平均化不同分布效果很有限。最优传输给的思路更精确它直接度量两个分布之间的搬运成本并且给出最优的分布映射方式。打个比方如果说域随机化是把一堆东西打碎了重新均匀混合最优传输则是把 A 堆的东西按照最小总移动距离搬到 B 堆的位置上。这个思想可以做策略迁移在仿真里学到的最优策略通过最优传输映射到真实世界的状态分布上策略的执行质量会有本质提升。我在一个机器人推箱子任务里实测过这个思路。仿真策略搬到真实环境后初版成功率只有 40% 左右用最优传输做了一次状态分布对齐成功率直接拉到 80% 以上。这个数字给我留下了很深的印象——它不是靠增加数据量提上来的而是靠更精确的数学映射。3.5 神经符号方法让机器人具备抽象推理能力具身智能的终极形态肯定不只是感知运动还需要一定程度的语义理解和抽象推理。比如你说帮我把桌上那个红色杯子拿来机器人需要理解红色杯子拿来这三个概念并把它们和视觉感知、抓取动作、移动行为建立联系。纯端到端的深度学习方法在完成这类复合任务时表现很差因为复合任务往往需要组合泛化能力——把已掌握的技能重新组合成新技能而不只是记住训练时见过的技能组合。神经网络在组合泛化上的表现其实一直不太尽如人意。神经符号方法把神经网络和符号推理结合起来神经网络负责从视觉、语言等感知输入中提取结构化符号符号推理引擎负责对这些符号做逻辑推理和规划。比如斯坦福的 VIMA 机器人系统就是用一个大型语言模型做任务分解再调用预训练的子策略完成具体动作。这种大模型做规划传统控制做执行的架构本质上就是用新的数学组合方式来解决单体模型解决不了的问题。我在做家用服务机器人原型时基于 VIMA 的思路做了一套简化版本用语言模型把把桌上红色杯子拿到厨房这个指令分解为识别红色杯子→移动到桌前→抓取杯子→移动到厨房→放下来这几个子任务然后分别调用训练好的子策略。这套架构的可靠性和可调试性比端到端方案高太多了——哪个环节出问题直接看符号层的规划结果就能定位。4. 边缘部署是检验新数学的试金石4.1 小算力下的数学选择直接决定落地成败讨论具身智能的数学工具如果不结合边缘部署的算力约束很容易变成纸上谈兵。我见过太多在实验室里跑得很漂亮的模型一到实际产品阶段就卡在算力上。边缘AI的典型算力配置是 5-30 TOPS 的 NPU 或者嵌入式 GPU内存从几个 GB 到十几个 GB。在这个量级上你不可能跑一个大语言模型做实时控制也不可能跑一个全尺寸的扩散策略网络。所以实际工程里不得不做大量数学上、结构上的取舍。我自己的经验是三条路并行第一模型小型化。这是最直接的路线但小模型表达能力有限所以重点在于把几何先验对称性、流形结构注入小模型里让它在参数少的情况下依然有较强的泛化能力。等变网络、图网络这类结构天然适合小模型场景。第二知识蒸馏。用一个大的教师模型离线训练来指导一个小的学生模型边缘部署。这个过程在数学上可以理解为把复杂函数用一个简单的近似函数来逼近同时保持关键区域的输出一致性。知识蒸馏在具身智能里用得越来越多因为学生模型小到可以放进边缘设备同时精度接近教师模型。第三量化与剪枝。把模型从 FP32 量化到 INT8或者剪掉不重要的连接这本身就是一个数学优化问题。但这里有个具身智能特有的坑NN 里看似不重要的连接可能在某个关键的机器人行为上起着决定性作用。通用场景下的剪枝准则不一定适用于机器人场景。所以自己在量化剪枝时需要用机器人任务的性能指标抓取成功率、跟踪误差来重新校准而不是只盯着 mAP 这类通用指标。4.2 实时性与安全性的数学边界边缘部署带来的另一个问题是实时性和安全性的直接冲突。大模型推理慢但能力强小模型推理快但能力弱。怎么在这两者之间做折中本质上是一个数学优化问题。我个人常用的思路是分层架构第一层一个轻量的警觉网络以高频比如 50-100 Hz运行负责快速检测异常和潜在碰撞这层网络算力开销极小但保证安全底线。第二层一个中等规模的决策网络以中频比如 10-20 Hz运行负责做具体的运动规划和策略选择。第三层一个离线的大模型运行在服务器上或云端负责做全局语义理解和长程任务规划只在需要重新规划时被调用。这个分层结构在数学上对应着不同时间尺度上的决策问题。警觉网络解决的是毫秒级的安全反应决策网络解决的是百毫秒级的运动决策大模型解决的是秒级甚至分钟级的任务规划。只有把这三个时间尺度用数学方法清晰地切开并用合适的模型分别处理才能在边缘算力约束下同时满足实时性和安全性的要求。关于安全性还有一个方向值得关注控制屏障函数。这个方法把安全约束直接编码成数学不等式任何时候只要系统状态逼近安全边界控制器就会强行介入修正数学上能给出绝对不越界的保证。我在一些协作机器人项目里把这个方法和学习策略结合起来效果非常理想——学习策略负责灵活多变的运动控制屏障函数负责兜底安全两者各司其职可解释性也强。4.3 具身智能标准体系带来的信号《人形机器人与具身智能标准体系2026版》的发布侧面印证了行业正在从炫技走向工程化。标准体系覆盖了人形机器人的本体、感知、决策、控制、通信、安全等多个维度本质上是在定义一套统一的接口和评估方法。这套标准其实给新数学方法提了一个挑战任何数学工具最终都要在标准定义的评估场景中证明自己的有效性而不能只是发论文时的花哨公式。反过来标准体系也为新数学工具的验证提供了参照系。比如标准的避障性能测试、抓取精度测试、交互安全性测试都是检验数学方法是否真的有用的试金石。我在关注这套标准体系的进展也和做测试的朋友聊过。目前标准体系重点解决的是产品级的问题——通信协议统一、数据格式统一、评测指标统一。这里面隐含着对新数学的需求标准出台后不同厂商的机器人要用统一的接口互操作AI 系统的中间表示必须可解释、可验证这恰恰是深度学习的黑箱难以满足的。未来的具身智能系统很大概率是神经网络模块 可解释的数学规划模块的混合架构。5. 一个实践者的数学补课路线附工具链5.1 从群论和线性代数打底很多做 AI 应用的人想补数学上来就啃流形、拓扑结果被一堆抽象定义劝退。我的经验是先从最贴近实际应用的数学开始线性代数是绝对的基础你需要能熟练地进行矩阵分解、特征值分析、奇异值分解因为流形上的每个切空间本质上都是一个线性空间。然后是群论。不需要一开始就啃抽象代数教材只需要理解几个核心概念群的定义、子群、群作用、等变性。我用的是《Visual Group Theory》这本书配 Nathan Carter 的可视化软件真的可以玩SO(3) 旋转群的各种性质看动图演示会比读公式理解快得多。如果你对几何内容更感兴趣可以先看 3Blue1Brown 的 Essence of Linear Algebra 那系列视频把向量空间、线性变换、基变换这几个概念彻底理解透再进入群论就顺了。5.2 微分几何与流形的应用视角微分几何听起来很唬人但具身智能需要的部分其实有限。核心是理解什么是流形、什么是切空间、什么是黎曼度量、什么是测地线。我的建议是用地球表面作为直观模型来理解流形然后再看 SO(3) 和 SE(3) 的具体例子。推荐两个资源一个是 Brian Hall 的《Lie Groups, Lie Algebras, and Representations》虽然是研究生教材但前半部分讲矩阵李群很通俗可以直接上手算 SE(3) 的例子另一个是小木虫上很多人推荐的《A Mathematical Introduction to Robotic Manipulation》Murray 那本经典教材把刚体运动、旋量、指数坐标讲得极其透彻直接面向机器人机械臂看完就能把理论对到实践上。工具链方面我强烈推荐 Drake 这个框架它是 MIT 主导开发的机器人仿真与控制系统内部大量使用了流形感知的数学方法你可以在里面写代码实装你的算法看看在不同数学表达下效果差在哪里。5.3 几何深度学习库的实操路径在代码层面几何深度学习的工具生态已经比较成熟了不需要从零造轮子。如果你是 PyTorch 用户首推 PyTorch GeometricPyG它提供了图神经网络和部分流形网络的实现。做点云处理、抓取位姿估计这类任务直接用 PyG 里的动态图卷积DGCNN就能起步。另一个值得关注的是 JAX 生态。JAX 支持自动微分和高阶导数计算配合 Haiku 或 Flax 可以快速实现等变网络。等变网络方面的开源库也很丰富比如 e3nn它实现了基于球谐函数的 SO(3) 等变层在分子建模和机器人感知里都有应用。我建议你用 e3nn 做一个简单的等变点云分类任务感受一下把物理对称性写进网络是什么体验。如果你想深入某个具体方向可以看这篇综述《Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges》它是几何深度学习领域最全面的综述之一而且完全免费公开。5.4 最怕的是什么只学数学不碰物理最后我必须说一句大实话具身智能的数学一定不能脱离物理直觉来学。纯粹在公式里打转很难真正理解为什么 SO(3) 的测地线对机械臂规划如此重要为什么 Lyapunov 函数对稳定性如此关键。我自己的方式是把数学和物理实验绑定在一起。每学一个新概念就找一个机器人相关的实际问题去验证学了群论就拿真实机械臂的位姿变换来算一遍指数坐标映射学了流形就在 Drake 里用测地线插值对比欧氏空间插值的轨迹差异学了最优传输就自己写一个简单的分布对齐代码放到策略迁移场景里看效果数学工具就像一把刀光看刀和磨刀是学不会用刀的你得真的找一块木头来切。我见过太多同行买了几百块的数学教材几个月后全落了灰就是因为没有把数学和实际问题绑定起来。6. 写在最后的一点个人体会如果你问我现在最看好哪个数学方向我会毫不犹豫说几何深度学习和神经符号的融合。前者解决了机器人怎么理解自己的身体和世界后者解决了机器人怎么进行复杂任务的抽象规划。这两个方向一个向下扎根物理一个向上对接语言与逻辑正好是具身智能数学的两个关键维度。但我也想说具身智能不是一个纯数学问题它是一个工程问题、系统问题、甚至是资源问题。数学给我们的是更优雅的分析工具和更高效的算法基础但最终的落地还是要靠无数次的实验调整、系统调试和工程取舍。别把数学神化也别把数学工具化到可有可无。最好的状态是让数学成为直觉的一部分——看到问题能自然地想到用什么数学结构去刻画它。如果你正在做具身智能的二次开发或者机械臂应用我建议你先别急着追求最新的模型架构回到物理基础上来把刚体变换、旋转表示、流形约束这些基本功打扎实。很多模型不收敛部署效果差的诡异问题追根溯源都是数学表达不贴合物理结构导致的。这堵边缘AI之墙最终要靠数学来凿穿但凿墙的每一锤都得落在物理世界这个实地上。