欢迎光临
我们一直在努力

试读·课程总目录想成为大模型训练师?20 篇从 Token、QLoRA 一路学到 GRPO、MoE 与完整训练项目

本篇建议设置为完整试读。

这不是 20 篇互不相关的 AI 热点文章,而是一条严格按照“入门 → 进阶 → 高级”设计的模型训练学习路线。每一篇只解决一个主要问题,后一篇只使用前面已经讲过的知识,避免刚学 Token 就突然进入强化学习、刚会 LoRA 就开始讲万亿参数并行。


1. 这套课程适合谁

如果你属于下面任何一种情况,可以按本目录从头学习:

  • 会调用 DeepSeek、Qwen 等模型 API,但不知道模型怎样训练;
  • 看过 SFT、LoRA、QLoRA,却不知道它们真正修改了什么;
  • 能运行别人写好的微调脚本,但不敢改训练参数;
  • 一遇到 CUDA OOM、NaN、Loss 不下降就不知道从哪里排;
  • 想学习数据工程、FSDP、DeepSpeed ZeRO,却被大量术语搞乱;
  • 已经会 SFT,想继续学习 DPO、GRPO;
  • 想读懂 DeepSeek-V3 / R1 中 MoE、MLA、MTP 等关键训练技术;
  • 想往“大模型训练师 / LLM Training Engineer / Post-training Engineer”方向发展。

本课程不要求你一开始就有多机多卡集群。

真正的学习原则是:

先用小模型验证正确性
→ 再增加数据和显存
→ 再扩大训练规模
→ 最后学习高级训练方法


2. 课程不讲什么

为了避免课程变成“论文缩写大全”,主线不会大篇幅展开:

  • Dr.GRPO;
  • GSPO;
  • 各种短期流行但不常用的 Preference Loss;
  • DeepSeek 超大集群特有调度细节;
  • 只适用于极大规模实验室集群的罕见并行策略;
  • 与模型训练主线关系不大的 Agent 产品开发。

这些技术如果有必要,只会放在对应文章最后的“扩展阅读”,不会阻断学习路线。


3. 你最终会建立怎样的训练知识树

文本

Tokenizer / Chat Template

input_ids / labels

Transformer Forward

Logits / Loss

Backward / Gradient / Optimizer

SFT

LoRA / QLoRA

Evaluation

高质量数据工程

显存优化

FSDP / DeepSpeed ZeRO

DPO

Reward / Rollout

GRPO

MoE / MLA / MTP

Distillation / Quantization

完整训练项目与发布

每个箭头都对应后面的正式课程。


4. 第一阶段:模型训练师入门

入门阶段只有一个毕业标准:

能够独立完成一次国产开源大模型的 SFT + LoRA/QLoRA 微调,并知道训练日志是否正常。

01

【模型训练师入门 01】大模型到底怎么被“训”出来?从 Token、Loss 到梯度更新一次讲透

学习:

  • Token;
  • Embedding;
  • Transformer Forward;
  • Logits;
  • Cross Entropy;
  • Backward;
  • Gradient;
  • Optimizer;
  • Pretraining 与 SFT 的关系。

学完结果:

看得懂训练日志和训练代码中最基础的计算链。


02

【模型训练师入门 02】训练参数为什么一改就翻车?Batch、学习率、Epoch、Warmup 系统讲透

学习:

  • Batch;
  • Micro Batch;
  • Gradient Accumulation;
  • Effective Batch;
  • Learning Rate;
  • Warmup;
  • Epoch;
  • Step;
  • Max Length;
  • Validation。

学完结果:

不再只会复制别人的训练参数。


03

【模型训练师入门 03】训练脚本最容易错在哪里?Tokenizer、Chat Template、Labels 与 Loss Mask

学习:

  • Tokenizer;
  • EOS / PAD;
  • Chat Template;
  • input_ids;
  • attention_mask;
  • labels;
  • -100;
  • assistant-only loss;
  • truncation;
  • packing。

学完结果:

能检查“代码能跑,但实际训错了”的隐蔽问题。


04

【模型训练师入门实战 01】先别急着微调:CUDA、PyTorch、Transformers 训练环境一次配对

学习:

  • NVIDIA Driver;
  • CUDA Runtime;
  • PyTorch CUDA;
  • Python venv;
  • Transformers;
  • Datasets;
  • TRL;
  • PEFT;
  • bitsandbytes;
  • BF16 检查。

学完结果:

建立可重复的单 GPU 训练环境。


05

【模型训练师入门实战 02】数据错了模型必废:SFT 数据 15 项检查与清洗实战

学习:

  • JSONL;
  • messages;
  • role;
  • 空数据;
  • 重复;
  • Token 长度;
  • EOS;
  • Train / Validation;
  • 数据泄漏;
  • 数据审计脚本。

学完结果:

GPU 开跑前能够自动拦截大部分数据错误。


06

【模型训练师入门实战 03】第一次亲手训练国产大模型:SFT + LoRA + QLoRA 完整实战

学习:

  • LoRA;
  • QLoRA;
  • NF4;
  • rank;
  • alpha;
  • target_modules;
  • SFTTrainer;
  • Adapter;
  • Merge;
  • Base vs Fine-tuned Evaluation。

学完结果:

真正完成第一次模型微调。


5. 第二阶段:模型训练师进阶

进阶阶段的毕业标准:

不只是“能跑训练”,而是知道怎样把模型训稳、训好、训得起。

07

【模型训练师进阶 01】模型为什么越训越差?数据清洗、去重、配比与 Continued Pretraining

重点:

  • Quality;
  • Dedup;
  • Contamination;
  • Data Mixture;
  • Continued Pretraining;
  • Catastrophic Forgetting。

08

【模型训练师进阶 02】只看 Loss 等于白训?模型评测、Baseline 与回归测试完整方法

重点:

  • Baseline;
  • Train / Val / Test;
  • Domain Eval;
  • General Regression;
  • Format;
  • Accuracy;
  • Win Rate;
  • Evaluation Set。

09

【模型训练师进阶 03】显存到底被谁吃掉了?BF16、梯度检查点与 OOM 优化全讲透

重点:

  • Weights;
  • Gradient;
  • Optimizer State;
  • Activation;
  • BF16;
  • Gradient Checkpointing;
  • Sequence Length;
  • Micro Batch。

10

【模型训练师进阶实战 01】单卡放不下怎么办?DDP、FSDP、DeepSpeed ZeRO 多 GPU 训练实战

重点:

  • DDP;
  • FSDP;
  • ZeRO-1/2/3;
  • CPU Offload;
  • Global Batch;
  • Distributed Checkpoint。

11

【模型训练师进阶 04】SFT 后为什么还不够?DPO、chosen/rejected 与偏好对齐完整实战

重点:

  • Preference Pair;
  • chosen;
  • rejected;
  • Reference Model;
  • DPO;
  • TRL DPOTrainer;
  • Win Rate。

12

【模型训练师进阶实战 02】OOM、NaN、Loss 不下降怎么查?训练故障排查手册

重点:

  • OOM;
  • NaN;
  • Grad Norm;
  • LR;
  • Data;
  • Precision;
  • NCCL;
  • Checkpoint;
  • Performance Bottleneck。

6. 第三阶段:模型训练师高级

高级阶段毕业标准:

能够理解现代推理模型和 MoE 模型的关键训练路线,并能自己设计完整训练方案。

13

【模型训练师高级 01】推理模型为什么需要强化学习?Reward、Rollout、Verifier 从零讲透

先学习 GRPO 的前置概念。


14

【模型训练师高级 02】DeepSeek-R1 核心训练怎么做?GRPO 从公式直觉到 TRL 实战

重点:

  • Group;
  • Relative Advantage;
  • Reward;
  • GRPOTrainer;
  • Math / Code Verifier;
  • Reward Hacking。

15

【模型训练师高级 03】671B 为什么每个 Token 只激活 37B?MoE、Router、Expert 一篇讲透

重点:

  • Dense vs MoE;
  • Expert;
  • Router;
  • Top-K;
  • Activated Parameters;
  • Load Balance。

16

【模型训练师高级 04】DeepSeek 为什么又用 MLA、MTP?现代大模型训练两个关键设计

重点:

  • KV Cache;
  • MLA;
  • MTP;
  • 为什么它们分别解决推理成本和训练信号问题。

17

【模型训练师高级实战 01】大模型太贵怎么落地?蒸馏、Adapter 合并与量化的正确顺序

重点:

  • Teacher / Student;
  • Distillation;
  • LoRA Merge;
  • 8bit / 4bit;
  • 训练与部署量化的区别;
  • 精度回归。

18

【模型训练师高级实战 02】从 Base Model 到领域模型:完整训练项目一步一步做完

这是整套课程的核心毕业项目。

Base
→ Baseline
→ Dataset
→ CPT(需要时)
→ SFT
→ DPO(需要时)
→ GRPO(可验证任务)
→ Eval
→ Merge
→ Quantization
→ Release


19

【模型训练师高级毕业篇】训练做完不等于项目完成:实验追踪、Checkpoint、Model Card 与发布闭环

重点:

  • Experiment Config;
  • Dataset Version;
  • Random Seed;
  • Git Commit;
  • Checkpoint;
  • Evaluation Report;
  • Model Card;
  • Reproducibility;
  • Release Gate。

这篇把“会训练”提升为“能交付一个训练项目”。


7. 三个阶段为什么这样安排

入门:我会训练

你掌握:

Training Fundamentals
+
Data Format
+
Environment
+
SFT
+
LoRA / QLoRA

进阶:我会把模型训好

你掌握:

Data Engineering
+
Evaluation
+
Memory Optimization
+
Distributed Training
+
DPO
+
Troubleshooting

高级:我能设计现代训练方案

你掌握:

Reward
+
GRPO
+
MoE
+
MLA / MTP
+
Distillation
+
End-to-End Training Project

这就是整套课程唯一的学习主线。


8. 每篇文章统一教学结构

正式课程不会每篇随意发挥,而固定按照:

  • 上一篇学了什么;
  • 为什么现在必须学这一项;
  • 本篇学完能完成什么;
  • 核心概念;
  • 原理;
  • 最常用参数;
  • 完整代码或训练操作;
  • 日志/结果怎么看;
  • 常见错误;
  • 排查顺序;
  • 什么时候应该用;
  • 什么时候不要用;
  • 本篇练习;
  • 自测;
  • 下一篇衔接。
  • 所以读者不会在同一篇里被几十个互不相关的名词轰炸。


    9. 课程使用建议

    完全没有训练经验:

    从 01 开始,不跳课。

    已经做过 LoRA:

    至少先检查 02、03、05,再从 07 开始。

    已经做 SFT / DPO:

    可以从 08、09 开始补齐评测和显存体系,再进入高级。

    有多卡训练经验:

    仍然建议阅读 08,因为高级训练最容易缺的是 Evaluation,而不是 GPU 命令。


    10. 试读结束前你应该知道什么

    购买这套课以后,不会得到:

    “100 个模型训练名词解释”。

    而是得到一套可以真正执行的学习路线。

    最终目标不是:

    我听过 LoRA
    我听过 DPO
    我听过 GRPO

    而是:

    我知道为什么训练

    我会准备数据

    我会配训练参数

    我会微调

    我会评测

    我会排 OOM

    我会多 GPU

    我会 DPO

    我理解 GRPO

    我理解 MoE

    我能完整交付训练项目

    如果你的目标是成为真正能够参与大模型训练工作的开发者,这就是后面 19 篇正式课程要完成的事情。

    赞(0)
    未经允许不得转载:171主机测评 » 试读·课程总目录想成为大模型训练师?20 篇从 Token、QLoRA 一路学到 GRPO、MoE 与完整训练项目
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址