本篇建议设置为完整试读。
这不是 20 篇互不相关的 AI 热点文章,而是一条严格按照“入门 → 进阶 → 高级”设计的模型训练学习路线。每一篇只解决一个主要问题,后一篇只使用前面已经讲过的知识,避免刚学 Token 就突然进入强化学习、刚会 LoRA 就开始讲万亿参数并行。
1. 这套课程适合谁
如果你属于下面任何一种情况,可以按本目录从头学习:
- 会调用 DeepSeek、Qwen 等模型 API,但不知道模型怎样训练;
- 看过 SFT、LoRA、QLoRA,却不知道它们真正修改了什么;
- 能运行别人写好的微调脚本,但不敢改训练参数;
- 一遇到 CUDA OOM、NaN、Loss 不下降就不知道从哪里排;
- 想学习数据工程、FSDP、DeepSpeed ZeRO,却被大量术语搞乱;
- 已经会 SFT,想继续学习 DPO、GRPO;
- 想读懂 DeepSeek-V3 / R1 中 MoE、MLA、MTP 等关键训练技术;
- 想往“大模型训练师 / LLM Training Engineer / Post-training Engineer”方向发展。
本课程不要求你一开始就有多机多卡集群。
真正的学习原则是:
先用小模型验证正确性
→ 再增加数据和显存
→ 再扩大训练规模
→ 最后学习高级训练方法
2. 课程不讲什么
为了避免课程变成“论文缩写大全”,主线不会大篇幅展开:
- Dr.GRPO;
- GSPO;
- 各种短期流行但不常用的 Preference Loss;
- DeepSeek 超大集群特有调度细节;
- 只适用于极大规模实验室集群的罕见并行策略;
- 与模型训练主线关系不大的 Agent 产品开发。
这些技术如果有必要,只会放在对应文章最后的“扩展阅读”,不会阻断学习路线。
3. 你最终会建立怎样的训练知识树
文本
↓
Tokenizer / Chat Template
↓
input_ids / labels
↓
Transformer Forward
↓
Logits / Loss
↓
Backward / Gradient / Optimizer
↓
SFT
↓
LoRA / QLoRA
↓
Evaluation
↓
高质量数据工程
↓
显存优化
↓
FSDP / DeepSpeed ZeRO
↓
DPO
↓
Reward / Rollout
↓
GRPO
↓
MoE / MLA / MTP
↓
Distillation / Quantization
↓
完整训练项目与发布
每个箭头都对应后面的正式课程。
4. 第一阶段:模型训练师入门
入门阶段只有一个毕业标准:
能够独立完成一次国产开源大模型的 SFT + LoRA/QLoRA 微调,并知道训练日志是否正常。
01
【模型训练师入门 01】大模型到底怎么被“训”出来?从 Token、Loss 到梯度更新一次讲透
学习:
- Token;
- Embedding;
- Transformer Forward;
- Logits;
- Cross Entropy;
- Backward;
- Gradient;
- Optimizer;
- Pretraining 与 SFT 的关系。
学完结果:
看得懂训练日志和训练代码中最基础的计算链。
02
【模型训练师入门 02】训练参数为什么一改就翻车?Batch、学习率、Epoch、Warmup 系统讲透
学习:
- Batch;
- Micro Batch;
- Gradient Accumulation;
- Effective Batch;
- Learning Rate;
- Warmup;
- Epoch;
- Step;
- Max Length;
- Validation。
学完结果:
不再只会复制别人的训练参数。
03
【模型训练师入门 03】训练脚本最容易错在哪里?Tokenizer、Chat Template、Labels 与 Loss Mask
学习:
- Tokenizer;
- EOS / PAD;
- Chat Template;
- input_ids;
- attention_mask;
- labels;
- -100;
- assistant-only loss;
- truncation;
- packing。
学完结果:
能检查“代码能跑,但实际训错了”的隐蔽问题。
04
【模型训练师入门实战 01】先别急着微调:CUDA、PyTorch、Transformers 训练环境一次配对
学习:
- NVIDIA Driver;
- CUDA Runtime;
- PyTorch CUDA;
- Python venv;
- Transformers;
- Datasets;
- TRL;
- PEFT;
- bitsandbytes;
- BF16 检查。
学完结果:
建立可重复的单 GPU 训练环境。
05
【模型训练师入门实战 02】数据错了模型必废:SFT 数据 15 项检查与清洗实战
学习:
- JSONL;
- messages;
- role;
- 空数据;
- 重复;
- Token 长度;
- EOS;
- Train / Validation;
- 数据泄漏;
- 数据审计脚本。
学完结果:
GPU 开跑前能够自动拦截大部分数据错误。
06
【模型训练师入门实战 03】第一次亲手训练国产大模型:SFT + LoRA + QLoRA 完整实战
学习:
- LoRA;
- QLoRA;
- NF4;
- rank;
- alpha;
- target_modules;
- SFTTrainer;
- Adapter;
- Merge;
- Base vs Fine-tuned Evaluation。
学完结果:
真正完成第一次模型微调。
5. 第二阶段:模型训练师进阶
进阶阶段的毕业标准:
不只是“能跑训练”,而是知道怎样把模型训稳、训好、训得起。
07
【模型训练师进阶 01】模型为什么越训越差?数据清洗、去重、配比与 Continued Pretraining
重点:
- Quality;
- Dedup;
- Contamination;
- Data Mixture;
- Continued Pretraining;
- Catastrophic Forgetting。
08
【模型训练师进阶 02】只看 Loss 等于白训?模型评测、Baseline 与回归测试完整方法
重点:
- Baseline;
- Train / Val / Test;
- Domain Eval;
- General Regression;
- Format;
- Accuracy;
- Win Rate;
- Evaluation Set。
09
【模型训练师进阶 03】显存到底被谁吃掉了?BF16、梯度检查点与 OOM 优化全讲透
重点:
- Weights;
- Gradient;
- Optimizer State;
- Activation;
- BF16;
- Gradient Checkpointing;
- Sequence Length;
- Micro Batch。
10
【模型训练师进阶实战 01】单卡放不下怎么办?DDP、FSDP、DeepSpeed ZeRO 多 GPU 训练实战
重点:
- DDP;
- FSDP;
- ZeRO-1/2/3;
- CPU Offload;
- Global Batch;
- Distributed Checkpoint。
11
【模型训练师进阶 04】SFT 后为什么还不够?DPO、chosen/rejected 与偏好对齐完整实战
重点:
- Preference Pair;
- chosen;
- rejected;
- Reference Model;
- DPO;
- TRL DPOTrainer;
- Win Rate。
12
【模型训练师进阶实战 02】OOM、NaN、Loss 不下降怎么查?训练故障排查手册
重点:
- OOM;
- NaN;
- Grad Norm;
- LR;
- Data;
- Precision;
- NCCL;
- Checkpoint;
- Performance Bottleneck。
6. 第三阶段:模型训练师高级
高级阶段毕业标准:
能够理解现代推理模型和 MoE 模型的关键训练路线,并能自己设计完整训练方案。
13
【模型训练师高级 01】推理模型为什么需要强化学习?Reward、Rollout、Verifier 从零讲透
先学习 GRPO 的前置概念。
14
【模型训练师高级 02】DeepSeek-R1 核心训练怎么做?GRPO 从公式直觉到 TRL 实战
重点:
- Group;
- Relative Advantage;
- Reward;
- GRPOTrainer;
- Math / Code Verifier;
- Reward Hacking。
15
【模型训练师高级 03】671B 为什么每个 Token 只激活 37B?MoE、Router、Expert 一篇讲透
重点:
- Dense vs MoE;
- Expert;
- Router;
- Top-K;
- Activated Parameters;
- Load Balance。
16
【模型训练师高级 04】DeepSeek 为什么又用 MLA、MTP?现代大模型训练两个关键设计
重点:
- KV Cache;
- MLA;
- MTP;
- 为什么它们分别解决推理成本和训练信号问题。
17
【模型训练师高级实战 01】大模型太贵怎么落地?蒸馏、Adapter 合并与量化的正确顺序
重点:
- Teacher / Student;
- Distillation;
- LoRA Merge;
- 8bit / 4bit;
- 训练与部署量化的区别;
- 精度回归。
18
【模型训练师高级实战 02】从 Base Model 到领域模型:完整训练项目一步一步做完
这是整套课程的核心毕业项目。
Base
→ Baseline
→ Dataset
→ CPT(需要时)
→ SFT
→ DPO(需要时)
→ GRPO(可验证任务)
→ Eval
→ Merge
→ Quantization
→ Release
19
【模型训练师高级毕业篇】训练做完不等于项目完成:实验追踪、Checkpoint、Model Card 与发布闭环
重点:
- Experiment Config;
- Dataset Version;
- Random Seed;
- Git Commit;
- Checkpoint;
- Evaluation Report;
- Model Card;
- Reproducibility;
- Release Gate。
这篇把“会训练”提升为“能交付一个训练项目”。
7. 三个阶段为什么这样安排
入门:我会训练
你掌握:
Training Fundamentals
+
Data Format
+
Environment
+
SFT
+
LoRA / QLoRA
进阶:我会把模型训好
你掌握:
Data Engineering
+
Evaluation
+
Memory Optimization
+
Distributed Training
+
DPO
+
Troubleshooting
高级:我能设计现代训练方案
你掌握:
Reward
+
GRPO
+
MoE
+
MLA / MTP
+
Distillation
+
End-to-End Training Project
这就是整套课程唯一的学习主线。
8. 每篇文章统一教学结构
正式课程不会每篇随意发挥,而固定按照:
所以读者不会在同一篇里被几十个互不相关的名词轰炸。
9. 课程使用建议
完全没有训练经验:
从 01 开始,不跳课。
已经做过 LoRA:
至少先检查 02、03、05,再从 07 开始。
已经做 SFT / DPO:
可以从 08、09 开始补齐评测和显存体系,再进入高级。
有多卡训练经验:
仍然建议阅读 08,因为高级训练最容易缺的是 Evaluation,而不是 GPU 命令。
10. 试读结束前你应该知道什么
购买这套课以后,不会得到:
“100 个模型训练名词解释”。
而是得到一套可以真正执行的学习路线。
最终目标不是:
我听过 LoRA
我听过 DPO
我听过 GRPO
而是:
我知道为什么训练
↓
我会准备数据
↓
我会配训练参数
↓
我会微调
↓
我会评测
↓
我会排 OOM
↓
我会多 GPU
↓
我会 DPO
↓
我理解 GRPO
↓
我理解 MoE
↓
我能完整交付训练项目
如果你的目标是成为真正能够参与大模型训练工作的开发者,这就是后面 19 篇正式课程要完成的事情。



![[特殊字符]DeepSeek‑Harness(DSH)小白保姆教程-171主机测评](https://www.171host.com/wp-content/uploads/2026/08/20260816085112-6a817a009aabf-220x150.png)