前面我分别拆解了线性代数、微积分、概率论和信息论。每一篇介绍了"这些在AI里干什么用"。
但是,也有一个困惑:它们在同一个训练步骤里到底怎么配合? 矩阵乘法刚算完,链式法则怎么接上去的?Softmax 吐出的概率,交叉熵怎么"评价"它的?
这篇文章就做一件事——用一个极简的三层网络,从头到尾跑通一轮训练。每一步都标注"这块数学在干什么、它把什么交给下一步"。
读完你会发现:四块拼图不是各干各的。上一块的输出恰好是下一块的输入。 整个训练循环就是这样转起来的。
阅读约需:14分钟 | 适合人群:看完了前三篇数学基础、想把它们串起来的读者 | 前置阅读:本系列 Week 2(线性代数)、Week 3(微积分)、Week 4(概率论+信息论)
本文脉络
- 🧩 四块拼图,先各用一句话召回
- 🎬 微型训练剧场:一个极简的三层网络
- ⚡ 前向传播:线性代数搭台,概率论唱戏
- 📏 损失计算:信息论登场,给"差距"打一个分
- 🔁 反向传播:微积分接手,把误差快递回每个参数
- 🔄 参数更新:回到线性代数,原点也是终点
- 🔗 四块拼图的接口:一张表看清楚
- 🗺️ AI 模型训练全流程:一张数学选型地图
- 🎯 Phase 1 学完,你现在能读懂什么
一、四块拼图,先用一句话召回
不需要重新讲概念。唤起你前三篇建立的画面就好:
| 线性代数 | 矩阵 = 对空间做"整形" | 怎么算 |
| 微积分 | 盲人在高维空间摸黑下山 | 往哪调 |
| 概率论 | AI 不直接给答案,给概率分布 | 输出什么意思 |
| 信息论 | 交叉熵 = 用错了地图要多走多少冤枉路 | 输出有多好 |
拿盖房子来类比——线性代数是建材和施工机械(怎么砌),微积分是图纸和测量工具(往哪砌、砌多少),概率论是建筑规范(什么算合格的房子),信息论是质检员(砌得好不好、打几分)。
前三篇是把每个工种单独讲透。今天把工人们放在同一个工地,看你一句"开始训练"之后,他们怎么无缝交接。
二、微型训练剧场:一个极简的三层网络
搭一个最小的舞台——用具体数字跑一遍,每一步都能手动验算。
场景:根据花瓣长度和宽度,判断是山鸢尾(Setosa)还是变色鸢尾(Versicolor)
输入 x = [1.0, 0.5] ← 两个特征(标准化后的花瓣长度、宽度)
真实标签 y_true = [1, 0] ← one-hot 编码:这个样本是"类别0(山鸢尾)"
第一层权重 W₁ = [[1, 0], ← 2×2 矩阵,单位矩阵——不做任何变换,原样通过
[0, 1]]
第一层偏置 b₁ = [0, 0] ← 偏置全零——这个网络"不平移"
第二层权重 W₂ = [[2, -1], ← 2×2 矩阵,随机初始化——把特征映射成两个类别的原始分数
[-1, 1]]
第二层偏置 b₂ = [0, 0]
选这个例子是为了让每一步的数值一目了然,你关注的不是数字本身,是数字背后哪块数学在干活。

你可能注意到了——这个网络没有激活函数(ReLU/Sigmoid)。不是漏了,是故意拿掉的。为什么?想让你看清四个数学学科之间最"赤裸"的协作关系,而不是被复杂的导数干扰。
加上非线性之后,反向传播的梯度计算会多一层 σ'(z) 的乘法。但这就像在流水线上加了一个质检工位——传送带和调度中心的工作逻辑完全不变。先看清骨架,再往上加肌肉。
下面正式开始一轮训练——前向 → 损失 → 反向 → 更新。
三、前向传播:线性代数搭台,概率论唱戏
3.1 第一段:线性变换 → 拿到"原始分数"
输入 x 穿过两层矩阵乘法,变成两个类别的"原始分数"(logits)。
h = W₁ @ x + b₁ ← 线性代数:矩阵乘法 + 向量加法
= [[1,0],[0,1]] @ [1.0, 0.5] + [0,0]
= [1.0, 0.5]
logits = W₂ @ h + b₂ ← 线性代数:再来一次
= [[2,-1],[-1,1]] @ [1.0, 0.5]
= [2×1.0 + (-1)×0.5, (-1)×1.0 + 1×0.5]
= [1.5, -0.5]
这一步就是 Week 2 讲的"矩阵乘法接力赛"的现场版。每一层 W @ x + b 都是一个空间变换——W 负责拉伸和旋转,b 负责平移。数据从 2 维输入空间,经过 W₁ 变换、再经过 W₂ 变换,最终落在两个类别的"分数"上。

两个数字 [1.5, -0.5] 就是"原始分数"。1.5 大于 -0.5,说明网络目前倾向于类别0——方向对了,但这是个什么尺度的分数?1.5 算"很确定"还是"马马虎虎"?谁也不知道。
这个输出有负数(-0.5)、数值尺度完全随意。需要下一块拼图介入。
3.2 第二段:Softmax → 原始分数变成概率
probs = softmax(logits) ← 概率论
= exp([1.5, -0.5]) / sum(exp([1.5, -0.5]))
= [4.48, 0.61] / 5.09
= [0.88, 0.12]
现在有了概率语义:模型认为 88% 可能是类别0,12% 可能是类别1。加起等于 1。全是正数。原来大的还是大、小的还是小。
这一步的核心是格式转换——Softmax 不改变排名,只是把"什么尺度都有的原始分数"翻译成"人类能读的概率语言"。它就是 AI 的翻译官。

前向传播一句话:线性代数负责"把数据扭到新位置",概率论负责"把结果翻译成概率"。前者是施工,后者是验收格式。
四、损失计算:信息论登场,给"差距"打一个分
模型说"88% 是类别0"。挺好的,但不完美——真实标签是 100%。这个差距怎么量化?
L = -Σ y_true × log(probs) ← 信息论:交叉熵
= -(1 × log(0.88) + 0 × log(0.12))
= -log(0.88)
= 0.128
交叉熵为什么用 log、为什么比 MSE 更适合分类——Week 4 第四节和第六节已经详细讲过了。这里你只需要记住它在训练循环里的角色:信息论不参与计算,它只做一件事——给模型的猜测打分。 它就是个质检员——“你这一轮猜得怎么样?0.128 分,还有进步空间。”
五、反向传播:微积分接手,把误差快递回每个参数
到这里,有了一个损失值 0.128。但这个数字不能直接告诉每个参数"你该调多少"——W₁、W₂、b₁、b₂ 各自的调整量是不一样的。反向传播就是把"总误差"拆解到每个参数头上。
5.1 最精彩的瞬间:梯度的"魔法抵消"
损失对 logits 的梯度,是整个训练循环里最漂亮的公式之一:
∂L/∂(logits) = probs – y_true ← 微积分(链式法则) + 信息论(交叉熵导数) + 概率论(Softmax 导数)
= [0.88 – 1, 0.12 – 0]
= [-0.12, 0.12]
这就是 Week 4 第六节用三帧配图推导的那个"魔法抵消"。 交叉熵导数里的 1/ŷ 和 Softmax 导数里的 ŷ(1-ŷ) 恰好约分,最后只剩下 ŷ – y——预测值减去真实值。没跟上推导的回去翻 Week 4 第六节,这里不重讲。
本文的重点不是"为什么抵消",是"谁和谁配合才让这个抵消发生的"——信息论提供交叉熵、概率论提供 Softmax、微积分提供链式法则管道。三个学科的公式"恰好"能互相约分,这不是巧合,是数学上的最优配合。

5.2 继续往回传:链式法则的接力
梯度的起点有了([-0.12, 0.12]),顺着链式法则往回传:
∂L/∂W₂ = hᵀ @ ∂L/∂(logits) ← 微积分(链式法则) + 线性代数(矩阵乘法)
= [1.0, 0.5]ᵀ @ [-0.12, 0.12]
= [[-0.120, 0.120],
[-0.060, 0.060]]
∂L/∂b₂ = ∂L/∂(logits) 各列求和 ← 微积分(链式法则)
= [-0.12, 0.12]
继续传到第一层:
∂L/∂h = ∂L/∂(logits) @ W₂ᵀ ← 微积分(链式法则) + 线性代数(矩阵乘法)
= [-0.12, 0.12] @ [[2, -1],[-1, 1]]ᵀ
= [-0.12, 0.12] @ [[2, -1],[-1, 1]] (W₂ 恰好对称,省一步)
= [-0.36, 0.24]
∂L/∂W₁ = xᵀ @ ∂L/∂h ← 微积分(链式法则) + 线性代数(矩阵乘法)
= [1.0, 0.5]ᵀ @ [-0.36, 0.24]
= [[-0.360, 0.240],
[-0.180, 0.120]]
∂L/∂b₁ = ∂L/∂h
= [-0.36, 0.24]
现在每个参数都有了自己的梯度。注意这整个反向传播过程:微积分(链式法则)决定"公式长什么样",线性代数(矩阵乘法)决定"怎么算得快"。 GPU 之所以是深度学习的标配,就是因为矩阵乘法天生可并行——Week 2 第六节细讲过。

六、参数更新:回到线性代数,原点也是终点
所有的梯度都算出来了。最后一步:用梯度更新参数。
W₂ := W₂ – 0.1 × ∂L/∂W₂ ← 线性代数:数乘 + 减法
= [[2, -1], [-1, 1]] – 0.1 × [[-0.120, 0.120], [-0.060, 0.060]]
= [[2.012, -1.012], [-0.994, 0.994]]
W₁ := W₁ – 0.1 × ∂L/∂W₁
= [[1, 0], [0, 1]] – 0.1 × [[-0.360, 0.240], [-0.180, 0.120]]
= [[1.036, -0.024], [0.018, 0.988]]
学习率 0.1 的作用:梯度告诉"往哪个方向调",学习率控制"这一步迈多大"。你一眼就能看出来——学习率就是 Week 2 讲的数乘。控制步长的简单操作,底层是线性代数里最基础的运算。
更新完之后,新参数开始了下一轮前向传播——从线性代数出发,绕了一圈,又回到线性代数。 这一圈就是训练的一个 step。模型训练几万步,每一步都在重复这个循环:
线性代数(前向变换)→ 概率论(转成概率)→ 信息论(打分)
→ 微积分(反向传梯度)→ 线性代数(更新参数)→ 下一圈
七、四块拼图的"接口":一张表看清楚
绕完一圈,回头总结。每一步的输入是从哪来的、输出是交给谁的:
| 前向·线性变换 | 线性代数 | 输入数据 + 当前参数 | 变换后的特征 → 概率论 |
| 前向·Softmax | 概率论 | 原始 logits ← 线代 | 概率分布 → 信息论 |
| 损失计算 | 信息论 | 预测分布 + 真实标签 ← 概率论 | 损失值 + 梯度起点 → 微积分 |
| 反向传播 | 微积分 | 损失对输出的梯度 ← 信息论 | 损失对每个参数的梯度 → 线代 |
| 参数更新 | 线性代数 | 当前参数 + 各参数梯度 ← 微积分 | 新参数 → 下一轮前向(回到线代) |
五个环节,四个学科。缺任何一个,这圈就断了。
没有线性代数 → 前向和反向的计算无法高效执行,1 亿参数的矩阵乘法逐个算,训练一轮要跑一辈子。
没有微积分 → 不知道每个参数该往哪个方向调、调多少。调参退化成瞎蒙。
没有概率论 → 输出就是一堆没有语义的数字。[1.5, -0.5] 算什么意思?你得用 Softmax 把它翻译成"88% 可能性"。
没有信息论 → 没有"好"的标准。你怎么知道这一轮猜得比上一轮好?交叉熵给了你一把"尺子"。
四块拼图的本质关系不是"并列",是"串联"。 上一块的输出格式,恰好是下一块的输入格式。整个训练循环的流畅,建立在四块拼图接口无缝对齐的前提上。

从一圈到一亿圈:涌现的起点
上面跑了一圈训练。这一圈里,W₁ 的每个元素只调整了零点零几。
模型实际训练要跑几万圈、几十万圈。每一圈都在重复同样的事——前向变换 → 概率翻译 → 交叉熵打分 → 反向传梯度 → 更新参数。单看任何一圈都微不足道。但几十万圈之后,W₁ 和 W₂ 里的数字从随机变成了有意义的模式——网络"学会"了从花瓣特征判断鸢尾花种类。
这就是 Week 1 全局地图里写的那个涌现链条的微观版:
简单规则(矩阵乘法 + 梯度下降)× 海量重复(几万轮迭代)= 从数据中涌现出"智能"
四块拼图就是这个链条的物理实现。你在每一圈里看不到"智能"——你只能看到线性代数的矩阵乘、概率论的 Softmax、信息论的交叉熵、微积分的链式法则。它们每个都很"笨",只是机械地执行自己那一环。但串在一起、重复足够多次——量变堆出了质变。
这一圈的代码,和 GPT-4 的训练循环,本质上一模一样。差别只在于:这个网络有 14 个参数,GPT-4 有 1.8 万亿个。W₁ 从 2×2 变成了上万的超大矩阵,激活函数从"拿掉了"变成了几十种不同的非线性变换——但四块拼图的流转关系、接口设计、分工逻辑,完全不变。
用 NumPy 亲手跑一遍
前向 → 损失 → 反向 → 更新,四块拼图一个不落。每 10 步打印一次,你会看到 probs 从 [0.88, 0.12] 逐渐逼近 [1.00, 0.00]。改一改学习率、换一换 W₂ 的初始值,看看训练收敛变快还是变慢——这篇文章讲的所有原理,都在这个小沙盘里。
👉 获取完整代码:github.com/wanghao95/ai-engineering/week4_recap/training_loop_demo.py。
八、AI 模型训练全流程:一张数学选型地图
前面用一条数据走了一圈,看清了四块拼图在"单个 step"里怎么配合。现在把镜头拉远——从数据准备到模型上线,整个 AI 训练流水线长什么样?每一步该选什么数学工具?
这就是 Phase 1 学完之后你应该能看懂的"完整地图"。
8.1 全景流程
数据准备 → 模型设计 → 训练循环 → 评估调优 → 部署推理
↓ ↓ ↓ ↓ ↓
概率论+ 线性代数+ 四块拼图 概率论+ 概率论+
线性代数 微积分 协同作战 信息论 线性代数
下面按阶段展开,每个决策点标注"用的什么数学"和"怎么选"。

8.2 阶段一:数据准备
| 缺失值处理 | 概率论 | 看分布:对称用均值,偏态用中位数 |
| 特征缩放 | 线性代数 | 标准化(z-score)vs 归一化(MinMax)— 有异常值优先标准化 |
| 类别编码 | 线性代数 | One-Hot(类别 < 20)/ Embedding(类别多)/ Target Encoding(高基数+有序) |
| 数据划分 | 概率论 | 类别不均衡必须分层划分,不能随机 |
8.3 阶段二:模型设计
| 架构选型 | 线性代数 | 表格数据 → 全连接;图像 → CNN / ViT;文本 → Transformer;序列 → RNN / LSTM |
| 隐藏层激活 | 微积分 | ReLU(默认首选);GELU / SiLU(Transformer 标配);别在深层用 Sigmoid/Tanh(饱和) |
| 输出层激活 | 概率论 | Softmax(多分类·互斥);Sigmoid(二分类 / 多标签·独立);线性(回归) |
| 参数初始化 | 概率论 | Xavier(配合 Tanh);Kaiming(配合 ReLU);别用全零(对称性不打破学不动) |
8.4 阶段三:训练循环 — 四块拼图齐上阵
这是整张地图的核心区。五个配置项,每个背后都站着一块数学:
| 损失函数 | 信息论 + 任务类型 | 见下方详细选型表 ↓ |
| 优化器 | 微积分 | SGD(需精细调参);Adam(默认首选);AdamW(Transformer 标配) |
| 学习率 | 微积分 | 太大发散太小太慢,从 1e-3 试起;配合余弦退火调度 |
| Batch Size | 线性代数 | 32/64/128 — GPU 显存够就尽量大;太小梯度噪声大、训练不稳 |
| Epochs | 经验 + 验证 | 看验证 loss 不再下降就打住(早停) |
损失函数选型表——训练循环里最关键的一个选择:
| 回归(连续值) | MSE | 无(线性) | 衡量数值差,输出不约束范围 | 有离群点时(平方会放大异常值的影响) |
| 回归(有异常值) | MAE | 无(线性) | 对异常值比 MSE 鲁棒 | 需要梯度连续时(MAE 在 0 点不可导) |
| 二分类 | Binary Cross-Entropy | Sigmoid | 衡量分布差,不是数值差 | 标签有噪声时(BCE 对错误标签惩罚极大,会过拟合噪声) |
| 多分类(互斥) | Categorical Cross-Entropy | Softmax | 梯度 = ŷ – y,干净无饱和 | 类别严重不平衡时(需加权重或换 Focal Loss) |
| 多标签(不互斥) | Binary Cross-Entropy | Sigmoid(逐标签) | 每标签独立判断,不能归一化 | 标签间有强相关性时(没考虑标签依赖) |
| 类别不均衡 | Focal Loss / Weighted CE | 同上 | 给少数类加权,防止被淹没 | 类别均衡时(Focal Loss 的调节项反而降低有效梯度) |
| 排序 / 推荐 | Pairwise / Listwise Loss | — | 关心相对顺序,不关心绝对分数 | 需要精确概率值做后处理时 |
| 生成(GAN) | KL 散度 / 对抗损失 | — | 衡量生成分布和真实分布的差异 | 训练不稳定时(可换 Wasserstein Loss) |
8.5 阶段四:评估与调优
| 过拟合(训练好、测试差) | 概率论(偏差-方差) | L1/L2 正则化、Dropout、早停、加数据 |
| 欠拟合(训练和测试都差) | — | 加大模型、减正则化、多训几轮 |
| 学习率不合适 | 微积分 | loss 震荡 → 调小;loss 不降 → 调大或 warmup |
| 梯度消失/爆炸 | 微积分 | 换激活函数、加 BatchNorm、梯度裁剪 |
| 类别不均衡 | 概率论 | 加权损失、过采样/欠采样、Focal Loss |
8.6 常见误区:三个"直觉式操作"的数学真相
训练中有些操作看起来是"经验法则",其实背后都是数学。知道为什么,你就不会在错误的方向上浪费时间。
误区一:“分类任务用 MSE 做损失函数试试?反正都是算误差。”
从信息论角度看,MSE 衡量的是两个"点"之间的数值距离,交叉熵衡量的是两个"概率分布"的差异。分类任务的标签是概率分布(如 [1, 0]),不是连续数值——用 MSE 相当于用直尺量水温,工具本身就不对。更致命的是,MSE + Sigmoid 组合在输出接近 0 或 1 时梯度接近零(饱和),模型几乎学不动。交叉熵 + Softmax 的梯度恰好是 ŷ – y,没有饱和区。
误区二:“梯度爆炸了?那我调小学习率试试。”
调小学习率只是让步子变小,但梯度的数值依然在爆炸——学习率和梯度的乘积还是不可控。从微积分角度看,梯度爆炸的根本原因是链式法则中多个大于 1 的梯度连乘。治本的方法是梯度裁剪、换用 ReLU(比 Sigmoid/Tanh 不容易饱和)、加 Batch Normalization。学习率是"迈多大步",梯度是"路有多陡"——路本身是悬崖,小步走也会摔下去。
误区三:“参数初始化随便给个随机数就行。”
全零初始化会让同一层每个神经元收到完全相同的梯度,更新后还是相同——对称性不打破,网络等价于只有一个神经元在学。Xavier 初始化(配合 Tanh)和 Kaiming 初始化(配合 ReLU)不是玄学,是用概率论精心计算过的方差范围,让每一层的输出方差和梯度方差尽可能稳定,避免信号在前向或反向传播中逐层衰减或爆炸。
8.7 从这张地图回看 Phase 1
这一整张地图上的"数学依据"列——线性代数、微积分、概率论、信息论——就是 Phase 1 四篇文章的全部内容。
你现在看到的不是"训练模型的步骤清单",是每一步背后的为什么:
- 数据缩放为什么有效?→ Week 2 的坐标无关性
- 为什么分类用交叉熵?→ Week 4 的"信息论比数值差更懂概率语义"
- 为什么 Adam 能自适应学习率?→ Week 3 的梯度一阶矩 + 二阶矩估计
- 为什么 ReLU 比 Sigmoid 强?→ Week 3 的梯度饱和问题
Phase 1 给你的不是"会调参",是"知道为什么这样调是对的"。
九、Phase 1 学完,你现在能读懂什么
现在你看到AI 训练代码,脑子里浮现的不是"为什么要算这个",而是四个清晰的画面:
看到 y = W @ x + b → 不只是矩阵乘法。是"输入数据在空间里被拉伸和旋转,扭到适合下一层处理的新位置"。
看到 softmax(logits) → 不只是激活函数。是"翻译官把原始分数翻成合规的概率语言——全是正数、加起来等于 1、排名不变"。
看到 loss = cross_entropy(probs, labels) → 不只是损失计算。是"质检员用交叉熵这把尺子,量出预测分布和真实分布差多远"。
看到 loss.backward() → 不只是自动求导。是"链式法则把总误差反向快递到每个参数,每个参数都收到自己的’调整建议’"。
看到 optimizer.step() → 不只是参数更新。是"盲人沿着梯度反方向,往谷底又走了一小步。每一步都不确定是不是最优,但每一步都让损失变小一点"。
Phase 1 之前,训练循环是一段你需要死记硬背的代码。Phase 1 之后,它是一台能拆开看的机器——每个零件什么功能,零件之间的传动关系,你看得清清楚楚。你不是变聪明了,是你终于有了一套描述"学习"这件事的语言。
一个比喻收尾
如果把一次训练 step 比作工厂流水线——
- 线性代数是传送带和机械臂——把原料(数据)从一个工位搬到下一个,改变它的形态。
- 概率论是质检标准——产品出厂必须是"合规的概率格式"。
- 信息论是质检员——量出成品和标准品差多少,把差距写成一个数字。
- 微积分是调度中心——根据质检报告,反向追溯:哪个工位哪台机器偏差最大,各自该调多少。
四个工种,缺一个整条线就停。而它们之间的交接点——矩阵乘法的输出恰好是 Softmax 的输入,Softmax 的输出恰好是交叉熵的输入,交叉熵的梯度恰好是反向传播的起点——就是 AI 训练这条流水线设计得最精妙的地方。
“The whole is greater than the sum of its parts.” — Aristotle
整体大于部分之和。之前你只看到四个独立的数学工具。现在你看到的是一台能"自己变聪明"的机器——每个零件都认识,零件之间的传动也捋顺了。
回头看四篇文章,你现在可以这样读
这四篇文章不是"看完一本扔掉一本"的关系。它们互相引用、层层叠加。Phase 1 学完之后,你可以用新的眼光重读任何一篇:
- 重读 Week 2 的"矩阵乘法(5.4节)" → 你现在知道那个 W @ x 的输出会继续被 Softmax 翻译、被交叉熵打分
- 重读 Week 3 的"前向-反向全链路(第六节)" → 你现在能把链路图里的每一段标注上学科归属
- 重读 Week 4 的"梯度魔法抵消(第六节)" → 你现在知道这个抵消是整个训练循环里四块拼图配合到极致的瞬间
最好的学习效果不是"四篇文章都看了",是"合上手机,脑子里有一张四块拼图首尾相连的闭环图"。
费曼检验:10 个问题,验证你是真懂了还是"感觉懂了"
你能顺畅回答几个?建议先自己试着回答一遍,再看参考答案:github.com/wanghao95/ai-engineering/week4_recap/费曼检验参考答案。
| 1 | 线性代数 | 矩阵乘法 W @ x + b 在训练中到底在干什么?W 和 b 各管什么?用"揉面团"或"捏橡皮泥"来类比一下。 |
| 2 | 线性代数 | “学习率就是数乘”——一个标量乘一个矩阵,为什么就能控制训练节奏?学习率 0.1 和 0.001 的直观区别是什么? |
| 3 | 微积分 | 盲人下山走到一个"坑"(局部最优),他还能出来吗?这个画面让你想到梯度下降的什么局限? |
| 4 | 微积分 | 反向传播中,损失值 0.128 是怎么一步步变成 W₁ 的梯度的?不用写公式,用"快递分拣站"的类比说一遍。 |
| 5 | 概率论 | Softmax 输出能叫"概率"凭的是哪三条?输入 [3.0, 1.0] 变成 [0.88, 0.12],3:1 变成了 7.3:1,这合理吗? |
| 6 | 概率论 | 温度参数 T 在 Softmax 里做什么?T→0 和 T→∞ 输出各怎样?大模型生成文本时想要创造性该调大还是调小? |
| 7 | 信息论 | 模型拍胸脯说 99% 是类别0(真是类别0),"冤枉路"是多少?如果犹豫说 51% 呢? |
| 8 | 三科串联 | ∂L/∂(logits) = ŷ – y——这个"魔法抵消"是哪三个学科的公式恰好约分的结果?巧合还是设计? |
| 9 | 串联 | 用一句话串起一个训练 step。禁止数学符号,只能用生活比喻——“食堂打饭”“快递分拣"或"工厂流水线”。 |
| 10 | 全局 | 本文 14 参数小网络训练一圈,和 GPT-4 训练一圈——本质上哪些相同?哪些不同?(提示:不是问规模,是问流程和分工) |
下期预告:Phase 2 正式启动——从线性回归开始,看参数怎么从数据里"长"出来。你会发现,让一条直线去"拟合"散落的数据点,背后就是 Phase 1 四块拼图的第一次实战合体。



