资讯动态

AI大模型与数学第18课:全微分、多元链式法则

发布时间:2026/8/5 12:22:31 来源:尧图企业网站定制
第17课掌握偏导数固定其余变量单变量变化率。本节课两大核心工具全微分、多元链式法则是反向传播完整推导的核心骨架全微分刻画多元函数所有参数同步微小变动带来的总损失变化多元链式法则多层网络嵌套复合函数求导必备解决“输入→权重→激活→损失”多层嵌套求偏导问题。AI核心价值3. 全微分对应单次迭代中所有权重微小调整带来的总误差变化4. 多元链式法则 反向传播数学原型没有链式法则无法推导多层神经网络梯度5. 打通单层偏导到多层网络梯度传递的逻辑闭环。前置基础导数、一元链式求导、多元函数。目标看懂神经网络损失函数、梯度下降的底层数学。开篇导入一元函数 yf(x)只有一个自变量导数描述唯一的变化率。但现实世界、AI模型几乎全是多元函数损失函数取决于几百万、上亿个权重参数一个输出同时受几十上百个变量共同影响。问题来了很多变量同时在变怎么单独看某一个变量带来的变化这就是偏导数要解决的问题。什么是偏导数定义人话把其余所有变量全部固定不动只允许其中一个变量发生微小变化求这个方向上的变化率。二元函数举例 zf(x,y)对 x 的偏导数\displaystyle \frac{\partial f}{\partial x}固定y不变只让x动求变化率。对 y 的偏导数\displaystyle \frac{\partial f}{\partial y}固定x不变只让y动求变化率。符号小提示偏导符号\partial和一元导数d区分开代表还有别的变量被按住不动。几何图像想象一张三维曲面 zf(x,y)。1.求\frac{\partial f}{\partial x}把y固定相当于用一个竖直平面横向切曲面切出来一条曲线偏导数就是这条曲线的切线斜率。2.求\frac{\partial f}{\partial y}把x固定纵向切曲面得到另一条曲线取切线斜率。书稿金句偏导数就是高维曲面沿着某一个坐标轴方向上的局部斜率。AI直观例子损失函数 L(w_1,w_2)损失受权重w_1、w_2共同控制。\frac{\partial L}{\partial w_1}把w_2锁死不动仅仅改动w_1看损失上升还是下降。梯度下降更新权重靠的就是每一个权重对应的偏导数。2.工具一全微分一元函数微分dy f’(x),dx含义自变量微小变化dx带来输出y的近似改变量dy。多元函数每个变量都可以产生一份贡献。二元函数全微分公式dz\frac{\partial f}{\partial x}dx\frac{\partial f}{\partial y}dy人话解读z的总微小变化 x变动带来的变化贡献 y变动带来的变化贡献。每个变量各自产生一份改变全部直接相加。拓展到n维AI真实场景上亿参数dL\frac{\partial L}{\partial w_1}dw_1\frac{\partial L}{\partial w_2}dw_2\dots\frac{\partial L}{\partial w_n}dw_n关键理解全微分告诉我们总变化量是所有各个维度偏导数分别乘各自微小扰动之后的总和。神经网络做扰动分析、梯度、泰勒展开根基就是全微分。⚠️注意全微分成立前提函数需要足够光滑连续如果曲面出现尖角、断裂全微分失效。3.工具二多元链式法则本课重中之重神经网络反向传播的心脏回顾一元链式法则yf(u),\ ug(x)\frac{dy}{dx}\frac{dy}{du}\cdot\frac{du}{dx}多元情况复杂度上来中间变量不止一个。举标准模型z f(u,v)而 u、v 又都是 x,y 的函数uu(x,y),\quad vv(x,y)求z对x的偏导\frac{\partial z}{\partial x}\frac{\partial z}{\partial u}\frac{\partial u}{\partial x}\frac{\partial z}{\partial v}\frac{\partial v}{\partial x}人话翻译想要看x改变对z造成多大影响x先改变uu再改变z同时x还改变vv再改变z两条传播路径全部算出来结果相加。核心思想所有可以传导过去的路径全部算一遍路径结果做加法。这就是神经网络反向传播的数学本质。误差Loss顺着网络一层一层反向往回传导每一层都跑一遍多元链式法则算出每一个权重的偏导数。AI大模型通俗类比损失就像源头的水流。误差要回流更新每一个权重一条误差可以通过多条通路传递到同一个参数多元链式法则就是把每一条通路的贡献全部求和。4、梯度概念自然引出承上启下把全部偏导数打包成一个向量就是梯度\nabla f\left( \frac{\partial f}{\partial x},\frac{\partial f}{\partial y} \right)梯度向量每一个分量就是对应方向的偏导数。梯度下降沿着梯度反方向更新全部参数。一句话串逻辑偏导数单个方向变化率全微分把所有方向的微小贡献加总得到总变化多元链式法则处理变量层层嵌套计算误差如何跨层传递。5、易错点绝大多数人踩坑1.求偏导一定要记住其余变量视作常数直接当成数字对待。2.多元链式法则不要漏项有几条中间传递路径就要有几项相加不要直接照搬一元链式直接相乘。3.\partial不是普通分数不能随意约分消掉。6、联系全书知识1.一元导数一维直线斜率2.偏导数高维曲面单一坐标轴方向的斜率3.梯度把一堆偏导数打包成向量高维空间中的一个箭头4.链式法则处理嵌套复合关系神经网络反向传播完全建立在此之上。书稿金句一元导数看见一维世界的变化偏导数帮我们在万千纠缠的变量之中按住其余变量单独看清某一个变量带来的改变。课后思考题为什么神经网络反向传播离不开多元链式法则全微分中每一项分别代表什么物理含义函数 zf(x,y)如果x、y同时发生微小改变总变化是否等于两个偏导数简单相加本节课我们搞懂了偏导数、全微分、多元链式法则这正是神经网络反向传播的数学内核。但偏导数只代表坐标轴方向的斜率。现实中我们可以沿着曲面上任意方向前进不一定非要沿着坐标轴。下一课《第18课梯度与方向导数》我们会揭晓哪个方向下降最快也就是梯度下降真正的底层原理。思考题留在文中欢迎在评论区写下你的理解。如果这篇文章帮你打通了多元微积分的认知欢迎点赞收藏订阅专栏跟随这套体系看懂AI背后的数学。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价