课程前言
前面课程全部是一元函数,仅单个自变量;但AI大模型拥有成千上万权重参数,损失函数是多元函数 L(w_1,w_2,w_3…)。
简单理解,我们遇到的事情,每个因素相当于一个元,这件事情的结果由两个因素决定就是二元。
我们实际遇到事情,决定事情的结果,往往是众多因素,所以多元函数才能模拟我们实际遇到的问题。
二元函数是多元的入门,设 z=f(x,y):
一、基础计算规则(通俗解读)
求某一变量偏导时,其余自变量全部视作常数,常数项导数直接为0;
偏导数 = 单参数独立梯度,大模型每一个权重单独对应的梯度就是偏导数。
二、10道二元一阶偏导数计算题(解题步骤+AI场景解读)
题1
z=3x^2+2y,求 \\dfrac{\\partial z}{\\partial x},\\dfrac{\\partial z}{\\partial y}
解:
固定y,\\dfrac{\\partial z}{\\partial x}=6x
固定x,\\dfrac{\\partial z}{\\partial y}=2
AI解读:简单双层网络,x为主权重、y为偏置项;权重梯度随参数大小变化,偏置梯度恒定不变。
题2
z=x^3y,求两个一阶偏导
解:
\\dfrac{\\partial z}{\\partial x}=3x^2y
\\dfrac{\\partial z}{\\partial y}=x^3
AI解读:权重两两相乘的交互损失,两个参数梯度互相耦合,不能单独更新某一参数。
题3
z=x2+4y2-2xy,求偏导数
解:
\\dfrac{\\partial z}{\\partial x}=2x-2y
\\dfrac{\\partial z}{\\partial y}=8y-2x
AI解读:二维均方损失拓展形式,两个参数互相约束,梯度下降同时修正两个权重。
题4
z=e^{x+y},求一阶偏导
解:
\\dfrac{\\partial z}{\\partial x}=e^{x+y}
\\dfrac{\\partial z}{\\partial y}=e^{x+y}
AI解读:指数激活融合两个输入特征,两个维度梯度完全同步,多特征融合层基础运算。
题5
z=\\sin(x+2y),求偏导
解:
\\dfrac{\\partial z}{\\partial x}=\\cos(x+2y)
\\dfrac{\\partial z}{\\partial y}=2\\cos(x+2y)
AI解读:RoPE二维位置编码,x、y分别代表行列位置,两个维度旋转变化速率不同。
题6
z=5x+\\dfrac{1}{y},求偏导数
解:
\\dfrac{\\partial z}{\\partial x}=5
\\dfrac{\\partial z}{\\partial y}=-\\dfrac{1}{y^2}
AI解读:线性权重搭配反比例正则项,权重梯度固定,正则项梯度随参数缩小急剧放大。
题7
z=xy+e^x,求一阶偏导
解:
\\dfrac{\\partial z}{\\partial x}=y+e^x
\\dfrac{\\partial z}{\\partial y}=x
AI解读:特征交互项叠加指数激活,输入x同时影响两条梯度链路,深层网络前向传播典型结构。
题8
z=x\\cos y,求偏导数
解:
\\dfrac{\\partial z}{\\partial x}=\\cos y
\\dfrac{\\partial z}{\\partial y}=-x\\sin y
AI解读:时序周期特征加权损失,x为权重、y为位置角度,两个维度梯度逻辑完全分离。
题9
z=2x3-y2+xy,求\\partial z/\\partial x、\\partial z/\\partial y
解:
\\dfrac{\\partial z}{\\partial x}=6x^2+y
\\dfrac{\\partial z}{\\partial y}=-2y+x
AI解读:高次权重+二次偏置+交叉耦合项,完整复刻浅层神经网络复合损失梯度计算。
题10 综合压轴
z=e^{2x}\\sin y,求解两个一阶偏导数
解:
\\dfrac{\\partial z}{\\partial x}=2e^{2x}\\sin y
\\dfrac{\\partial z}{\\partial y}=e^{2x}\\cos y
AI解读:指数特征映射+周期位置编码组合损失,Transformer注意力层二维梯度基础计算,是多元梯度的标准模板。
三、课程核心总结(衔接第34课多元复合链式偏导)
5. 偏导数核心逻辑:固定其余参数,只计算单个参数的变化率,对应模型单个权重梯度;
6. 所有大模型反向传播,本质就是批量求解海量偏导数;
7. 两个偏导数组合成梯度向量,指向损失上升最快的方向,优化器沿反方向更新参数;
8. 下一课学习多元复合函数链式求导,对应多层神经网络跨层梯度传递。
计算偏导数时,很容易忘记把其他变量当成常数,你有没有踩过这个坑?
多元梯度在大模型训练里起到什么核心作用?欢迎评论区交流!



