B300 万卡 MoE 训练:5D 并行自动化调参与算子调度
在 B300 万卡(16000×B300)上训练 DeepSeek-V3 类 MoE 模型,5D 并行(TP × CP × DP × PP × EP)的调参空间极其庞大——仅并行维度组合就超过 10⁴ 种,再叠加 dispatcher 类型、精度格式、CUDA Graph 范围、重计算策略等,人工调参基本不可行。NVIDIA 的 Parallel Folding 论文与 Megatron-Core MoE 给出了系统化的工程框架 ,但真正的自动化调参仍是一个开放的研究问题。下面按\”自动化调参方法论 → 路由器性能实验测量 → 5D 算子调度代码实现 → 最新研究进展\”四层展开。
一、🎯 5D 并行的自动化调参方法论
1.1 搜索空间定义
基于 Parallel Folding,5D 并行的两组解耦映射是 :
Attention: TP × CP × DP × PP
MoE: ETP × EP × EDP × PP (PP 必须两端一致)
完整搜索空间(以 16000 卡 B300 训练 DeepSeek-V3 671B 为例):
|
TP < |




