本课定位
本课是《AI大模型与数学》第一阶段【微积分全套体系】最后一节课,第二阶段我们开始讲线性代数与大模型。
前1–59课,我们完整学完:
极限、连续、一元微分、多元微分、方向导数、雅可比矩阵、海森、定积分、反常积分、多重积分、级数、泰勒展开、傅里叶体系、泛函与变分。
所有大模型训练、拟合、收敛、生成、优化、损失下降,全部建立在「微积分体系」之上。
从第61课开始正式进入第二阶段:线性代数与大模型。
开始本课前我们先讲讲微积分与线性代数的区别及在大模型中的作用,微积分是研究函数变化率的工具,主要用于大模型训练过程中找最优解,而线性代数负责构建高维向量空间,在大模型中完成表征存储、变换、注意力计算与模型压缩,给数据提供结构化的表达载体。简单表述,大模型训练过程靠微积分,存储变换形成逻辑靠线性代数。
本节课任务:
一、第一阶段总纲:为什么「微积分是大模型的生命动力」
一句话定义:
线性代数定义大模型的空间结构,微积分驱动大模型学习与进化。
线性代数是存储宝藏的山,微积分是寻找宝藏路径的方法。
大模型训练过程从头到尾只有两件事:
没有微积分 = 大模型完全无法训练、无法收敛、无法智能。
二、大模型必用「全套微积分知识点汇总」
我按大模型真实工作流程归类,不按课本归类:
- 级数收敛、损失趋近0、梯度趋近0
- 模型迭代无限逼近最优解
- 所有训练收敛判定全部依赖极限理论
- 我们假定极限是那个完美解(世界并没有完美,但我们要目标,极限就是那个目标)
一句话:没有极限,就没有训练停止条件。
- 激活函数斜率,这个因素对结果的影响程度
- 学习率物理意义
- 局部增减性判断
大模型有几千万、上亿参数,每一个参数都对应一个偏导数
对哪个求偏导数,就是这件事情的结果,更看重哪个因素对结果的影响。
- 对权重 w 求偏导:权重更新方向
- 对偏置 b 求偏导:偏移修正方向
- 对输入 x 求偏导:可解释性、对抗样本
大模型反向传播本质:批量求全部偏导数。
反向传播就是以结果为导向,方向求证因素的方向作用。
梯度定义:全部偏导数构成的向量,因素影响结果的曲线。
\\nabla L = \\left(\\frac{\\partial L}{\\partial w_1},\\frac{\\partial L}{\\partial w_2},\\dots\\right)
AI真理:
梯度指向损失上升最快方向,反方向就是模型学习下降方向。
深度学习能算梯度,完全依赖链式法则,
链式法则就是影响结果因素间相互影响的分析。
复合函数求导逐层展开:\\frac{dy}{dx}=\\frac{dy}{du}\\cdot\\frac{du}{dx}
神经网络越深、层数越多=链式越长 所有框架:PyTorch、TensorFlow 底层就是自动链式求导。
方向导数(模型更新速度、搜索方向) – 判断参数更新快慢- 梯度爆炸/梯度消失本质:方向导数趋近无穷或趋近0
雅可比矩阵(模型变换、映射、流模型) 多元函数导数矩阵,用于: – 高维输入→高维输出映射- 扩散模型、流模型、生成模型变换
海森矩阵(二阶微积分|模型曲率) – 判断局部最优、鞍点- 判断学习率是否过大/过小- 模型稳定性、泛化能力
积分(AI全局能量、概率、频域) – 概率密度积分 = 总概率- 信号能量积分- 图像、音频、扩散模型噪声积分演化
泰勒级数(局部拟合、激活函数、数值近似) 深度学习前向传播 = 高阶泰勒拟合 神经网络本质:用多层非线性叠加逼近任意复杂函数
傅里叶级数/FFT(全局结构、纹理、噪声) – 图像高频低频- 语音频谱- 扩散模型加噪、去噪数学基础
泛函+变分(高级AI终极理论) – 扩散模型ELBO变分下界- 最优传输、多模态对齐- 图像重建损失、能量最小化
三、第一阶段最关键总结:大模型的「微积分三层逻辑」
第一层:一阶微积分(所有训练的基础) 导数、偏导、梯度、链式法则→ 负责模型“怎么学、怎么下降、怎么更新参数”
第二层:二阶微积分(稳定性与收敛) 海森、曲率、二阶导数→ 负责模型“学得稳不稳、会不会炸、会不会不收敛”
第三层:级数+积分+变分(生成模型底层) 泰勒拟合、傅里叶结构、能量积分、泛函极值→ 负责模型“能不能生成、能不能重建、能不能创造内容”
四、本课核心:从零完整推导「梯度下降」全过程
步骤1:定义模型拟合函数 设模型为参数化函数:\\hat y = f_\\theta(x)\\theta 为全部网络参数(权重、偏置)
步骤2:定义损失函数(均方误差为例) 单样本损失:L(\\theta)=\\frac12(\\hat y-y)^2
步骤3:求损失对模型输出的导数 \\frac{\\partial L}{\\partial \\hat y}= \\frac{\\partial}{\\partial \\hat y}\\left[\\frac12(\\hat y-y)^2\\right]= \\hat y 步骤4:链式法则求参数梯度 根据链式法则:\\frac{\\partial L}{\\partial \\theta}= \\frac{\\partial L}{\\partial \\hat y} \\cdot \\frac{\\partial \\hat y}{\\partial \\theta} 代入上面结果:\\frac{\\partial L}{\\partial \\theta}= (\\hat y – y)\\cdot \\frac{\\partial f_\\theta(x)}{\\partial \\theta}
步骤5:得到完整梯度向量 对所有参数求导,构成梯度:\\nabla_\\theta L = (\\hat y-y)\\cdot \\nabla_\\theta f_\\theta(x)
步骤6:梯度下降核心更新公式(最终式) 梯度指向损失上升方向所以参数必须反向更新: \\theta_{\\text{new}} = \\theta_{\\text{old}} – \\eta \\cdot \\nabla_\\theta L \\eta:学习率
步骤7:完整物理意义(终极AI理解) 1. 梯度大 → 误差大 → 参数大步更新2. 梯度小 → 误差小 → 参数微调收敛3. 梯度为0 → 损失最低点 → 模型收敛完成
步骤8:迭代过程完整逻辑 不断循环: – 前向:计算预测 \\hat y- 求误差:\\hat y-y- 反向:链式求梯度- 更新:\\theta\\leftarrow\\theta-\\eta\\nabla L- 直到梯度趋近0、损失平稳
✅ 这就是「大模型训练的全部数学本质」 整个深度学习,就是不断执行这一套微积分流程。
五、第一阶段终极金句
六、第二阶段预告(第61课开启全新体系)
从第61课开始,正式进入:线性代数与AI大模型第二阶段 接下来全部讲:
- 高维向量空间(Embedding本质)
– 矩阵变换(模型层映射本质) - 秩、正交、投影(注意力机制底层)
-
- 特征值、特征向量(模型主特征提取)
-
- SVD奇异值分解(大模型压缩、降维、去冗余核心)
- 微积分让模型学会“变化与学习”
- 线性代数让模型拥有“空间与智能结构”
- 两大体系合一 = 完整大模型数学底层。
- 前60课,你完成了90%深度学习底层数学的地基,感谢一直跟随前60课的朋友们,
- 关注联系我,一次性把60节课教材打包发给你,后面的线性代数与概率我将继续努力。
- 从下一课开始,我们搭建大模型高维空间的顶层结构,彻底看懂Embedding、注意力、降维、压缩、检索全部原理。
恭喜你完成AI数学第一阶段结业!
本系列《AI大模型与数学》全套60课微积分阶段已圆满收官,从第61课开启第二阶段「线性代数与大模型」全新体系。
点关注订阅专栏,持续系统吃透大模型完整底层数学,零基础建立顶级AI数理直觉。
复合函数求导逐层展开:
\\frac{dy}{dx}=\\frac{dy}{du}\\cdot\\frac{du}{dx}
神经网络越深、层数越多=链式越长
所有框架:PyTorch、TensorFlow 底层就是自动链式求导。
- 判断参数更新快慢
- 梯度爆炸/梯度消失本质:方向导数趋近无穷或趋近0
多元函数导数矩阵,用于:
- 高维输入→高维输出映射
- 扩散模型、流模型、生成模型变换
- 判断局部最优、鞍点
- 判断学习率是否过大/过小
- 模型稳定性、泛化能力
- 概率密度积分 = 总概率
- 信号能量积分
- 图像、音频、扩散模型噪声积分演化
深度学习前向传播 = 高阶泰勒拟合
神经网络本质:用多层非线性叠加逼近任意复杂函数
- 图像高频低频
- 语音频谱
- 扩散模型加噪、去噪数学基础
- 扩散模型ELBO变分下界
- 最优传输、多模态对齐
- 图像重建损失、能量最小化
三、第一阶段最关键总结:大模型的「微积分三层逻辑」
第一层:一阶微积分(所有训练的基础)
导数、偏导、梯度、链式法则
→ 负责模型“怎么学、怎么下降、怎么更新参数”
第二层:二阶微积分(稳定性与收敛)
海森、曲率、二阶导数
→ 负责模型“学得稳不稳、会不会炸、会不会不收敛”
第三层:级数+积分+变分(生成模型底层)
泰勒拟合、傅里叶结构、能量积分、泛函极值
→ 负责模型“能不能生成、能不能重建、能不能创造内容”
四、本课核心:从零完整推导「梯度下降」全过程
步骤1:定义模型拟合函数
设模型为参数化函数:
\\hat y = f_\\theta(x)
\\theta 为全部网络参数(权重、偏置)
步骤2:定义损失函数(均方误差为例)
单样本损失:
L(\\theta)=\\frac12(\\hat y-y)^2
步骤3:求损失对模型输出的导数
\\frac{\\partial L}{\\partial \\hat y}
= \\frac{\\partial}{\\partial \\hat y}\\left[\\frac12(\\hat y-y)^2\\right]
= \\hat y – y
步骤4:链式法则求参数梯度
根据链式法则:
\\frac{\\partial L}{\\partial \\theta}
= \\frac{\\partial L}{\\partial \\hat y} \\cdot \\frac{\\partial \\hat y}{\\partial \\theta}
代入上面结果:
\\frac{\\partial L}{\\partial \\theta}
= (\\hat y – y)\\cdot \\frac{\\partial f_\\theta(x)}{\\partial \\theta}
步骤5:得到完整梯度向量
对所有参数求导,构成梯度:
\\nabla_\\theta L = (\\hat y-y)\\cdot \\nabla_\\theta f_\\theta(x)
步骤6:梯度下降核心更新公式(最终式)
梯度指向损失上升方向
所以参数必须反向更新:
\\theta_{\\text{new}} = \\theta_{\\text{old}} – \\eta \\cdot \\nabla_\\theta L
\\eta:学习率
步骤7:完整物理意义(终极AI理解)
步骤8:迭代过程完整逻辑
不断循环:
- 前向:计算预测 \\hat y
- 求误差:\\hat y-y
- 反向:链式求梯度
- 更新:\\theta\\leftarrow\\theta-\\eta\\nabla L
- 直到梯度趋近0、损失平稳
✅ 这就是「大模型训练的全部数学本质」
整个深度学习,就是不断执行这一套微积分流程。
五、第一阶段终极金句
六、第二阶段预告(第61课开启全新体系)
从第61课开始,正式进入:线性代数与AI大模型第二阶段
接下来全部讲:
- 高维向量空间(Embedding本质)
- 矩阵变换(模型层映射本质)
- 秩、正交、投影(注意力机制底层)
- 特征值、特征向量(模型主特征提取)
- SVD奇异值分解(大模型压缩、降维、去冗余核心)
微积分让模型学会“变化与学习”
线性代数让模型拥有“空间与智能结构”
两大体系合一 = 完整大模型数学底层。
前60课,你完成了90%深度学习底层数学的地基,感谢一直跟随前60课的朋友们,关注联系我,一次性把60节课教材打包发给你,后面的线性代数与概率我将继续努力。
从下一课开始,我们搭建大模型高维空间的顶层结构,彻底看懂Embedding、注意力、降维、压缩、检索全部原理。
恭喜你完成AI数学第一阶段结业!
本系列《AI大模型与数学》全套60课微积分阶段已圆满收官,从第61课开启第二阶段「线性代数与大模型」全新体系。
点关注订阅专栏,持续系统吃透大模型完整底层数学,零基础建立顶级AI数理直觉。

