前12课我们学习了导数(微分):由整体找局部、由函数找变化率,是大模型「梯度求导、参数更新」的核心。
本节课学习不定积分,是微分的逆运算:由局部找整体、由变化率还原原函数。
一句话概括:导数是“方向盘”(指明下山方向),积分是“里程表”(累积学习成果),二者共同驱动了大模型的“梯度下降”训练过程。
核心AI价值(为什么学积分才能懂大模型)
一、不定积分核心定义(通俗+专业双释义)
数学专业定义
若存在可导函数 F(x),在定义域内满足:
F’(x) = f(x)
则称 F(x) 为 f(x) 的一个原函数。
函数 f(x) 的全体原函数,称为 f(x) 的不定积分,记作:
\\int f(x) dx = F(x) + C
符号拆解(必记)
\\int:积分号,代表「反向求和、反向求导」
f(x):被积函数(变化率、增量速度)
dx:积分微元(极小自变量单元)
C:积分常数(任意常数)
F(x)+C:所有原函数集合
核心性质:微分与积分互为逆运算
\\left( \\int f(x)dx \\right)’ = f(x)
\\int F’(x)dx = F(x) + C
AI场景通俗理解
导数(微分):知道「每一步的变化速度(梯度)」
积分:用每一步的微小梯度,累积算出最终的参数变化总量
大模型极简闭环:
微分 = 算出这一步该改多少参数
积分 = 把一万步的参数修改量累加,得到最终参数结果
为什么必须有常数C?
举例:
F(x)=x2、G(x)=x2+3、H(x)=x^2-10
三者求导结果完全一致:2x
导数只能锁定变化规律,无法锁定初始状态。
常数 C 对应AI训练中的模型初始权重(初始化参数随机,变化规律一致,初始值不同)。
二、不定积分四大基础运算法则(工程必用)
法则1:常数可提
\\int k\\cdot f(x)dx = k\\int f(x)dx
AI释义:学习率就是常数,梯度整体缩放,不改变更新方向。
法则2:加减可拆分
\\int [f(x)\\pm g(x)]dx = \\int f(x)dx \\pm \\int g(x)dx
AI释义:复杂损失函数可拆分为多个子损失积分求和,对应多任务模型损失叠加。
法则3:常数积分公式
\\int k dx = kx + C
法则4:微分还原恒等式
\\int x^n dx=\\frac{1}{n+1}x^{n+1}+C \\quad(n\\neq-1)
最核心、AI训练最高频公式。
三、全套基础积分公式(AI数学重点)
幂函数积分(最高频、核心中的核心)
通用公式
\\int x^n dx = \\frac{1}{n+1}x^{n+1} + C
举例验证
n=1:\\int x dx=\\frac{1}{2}x^2+C
求导验证:(\\frac{1}{2}x^2)'=x ✅
n=2:\\int x^2 dx=\\frac{1}{3}x^3+C
求导验证:(\\frac{1}{3}x3)'=x2 ✅
n=0:\\int 1 dx = x+C ✅
倒数积分(特殊唯一)
\\int \\frac{1}{x}dx = \\ln|x| + C
唯一不能用幂函数公式的特例,大模型对数损失、交叉熵损失底层公式。
指数函数积分(AI激活函数核心)
\\int e^x dx = e^x + C
核心特性:e^x 求导、积分均不变,是神经网络激活函数、概率分布的核心基底。
基础三角函数积分(时序AI、信号处理用)
\\int \\sin x dx = -\\cos x + C
\\int \\cos x dx = \\sin x + C
根式函数通用速算
例:\\int \\sqrt{x}dx=\\int x\\frac{1}{2}dx=\\frac{2}{3}x\\frac{3}{2}+C
四、逐类实操例题(零基础吃透,带完整步骤)
例题1:基础幂函数积分
求解:\\int 3x^2 dx
步骤:
例题2:多项式拆分积分(模拟复杂损失函数)
求解:\\int (2x+1) dx
步骤:
例题3:根式化简积分
求解:\\int \\frac{1}{\\sqrt{x}}dx
步骤:
例题4:指数函数积分
求解:\\int (e^x+2x)dx
结果:e^x + x^2 + C
五、不定积分对应大模型底层逻辑(独家深度映射)
导数=瞬时梯度,积分=累积参数更新
每一轮迭代的梯度:g = Loss’(w)(瞬时变化率,导数)
多轮迭代总参数更新量:\\int g \\cdot \\eta , dt(积分累积)
通俗比喻:
梯度只告诉你「这一步改多少」,积分帮你「把所有步数的修改量汇总,得到最终权重」。
积分常数C = 模型初始化偏差
不同模型初始权重不同(C不同),但训练迭代的变化规律完全一致。
这就是为什么:相同算法、不同初始化,最终都能收敛。
交叉熵损失的对数基底
不定积分 \\int \\frac{1}{x}dx=\\ln x 是交叉熵损失、KL散度、概率对数似然的数学源头,没有这个积分,就没有现代分类模型损失函数。
模型平滑、均值累积原理
AI中滑动平均、动量梯度、Adam动量累积,本质都是离散化的数值积分。
六、本课核心总结
导数像司机看眼前的路——此刻方向盘该打多少度。
积分像副驾看导航记录——过去10秒平均车速是多少,用以修正油门,避免急刹。
最后提一个关键细节:在数学上,梯度下降本身就是用一阶导数(泰勒展开)去近似损失函数;而像学习率预热(Warmup)等策略,本质上就是在做“积分补偿”,防止初期导数过大导致失控。
最后提一个关键细节:在数学上,梯度下降本身就是用一阶导数(泰勒展开)去近似损失
七、课后自测题(巩固通关)
这篇文章如果对你有帮助点赞收藏,这系列共1380节课,在这本字典里能找到你想要的数学与ai大模型的全系列课程。




