文章目录
- 预训练参数
- SFT参数
- 评估模型参数
- 模型效果
- 结论
- 训练曲线
预训练参数
# 使用大数据集进行大模型新型预训练 num kv head = 4
cd /mnt/data/test1/llm_learning/minimind/minimind-master/trainer && nohup torchrun –nproc_per_node 8 train_pretrain.py \\
–use_moe 0 \\
–batch_size 32 \\
–learning_rate 4e-4 \\
–hidden_size 1024 \\
–num_hidden_layers 16 \\
–max_seq_len 512 \\
–data_path ../dataset/seq_monkey_datawhale.jsonl \\
–save_dir ../out \\
–save_weight pretrain_dense \\
–accumulation_steps 2 \\
–log_interval 100 \\
–save_interval 1000 \\
–use_wandb \\
–wandb_project MiniMind-dense-4090×8-datawhale \\
> /mnt/data/test1/llm_learning/minimind/minimind-master/logs/pretrain_log/train_pretrain_dense_datawhale.log 2>&1 &
SFT参数
# 使用大数据集进行SFT Full dense训练
cd /mnt/data/test1/llm_learning/minimind/minimind-master/trainer && nohup torchrun –nproc_per_node 8 train_full_sft.py \\
–use_moe 0 \\
–batch_size 32 \\
–learning_rate 1e-5 \\
–hidden_size 1024 \\
–num_hidden_layers 16 \\
–max_seq_len 512 \\
–data_path ../dataset/sft_512.jsonl \\
–save_dir ../out \\
–save_weight sft_dense_full \\
–from_weight pretrain_dense \\
–accumulation_steps 1 \\
–log_interval 10 \\
–save_interval 100 \\
–use_wandb \\
–wandb_project MiniMind-dense-4090×8-datawhale-stf-full \\
> /mnt/data/test1/llm_learning/minimind/minimind-master/logs/pretrain_log/train_sft_dense_full_datawhale.log 2>&1 &
评估模型参数
cd /mnt/data/test1/llm_learning/minimind/minimind-master &&python eval_llm.py \\
–weight pretrain_dense \\
–hidden_size 1024 \\
–num_hidden_layers 16 \\
–use_moe 0
模型效果
模型参数量在200M左右。
💬: 请你计算1+5等于几
🤖: 首先,我们可以用乘法运算符来计算1+5的结果。1+5等于2。
其次,我们可以将1+5的结果乘以5,得到5。
最后,我们可以将5乘以5,得到5。
因此,1+5等于5。
[Speed]: 40.52 tokens/s
💬: 如果着火了应该怎么办
🤖: 如果着火了,应该立即采取以下措施:1. 关闭电源,拔掉电源插头。2. 打开门窗,通风。3. 关闭火源,拔掉火源。4. 检查火源是否存在,如有,应立即关闭火源。5. 拨打火警电话,并报警。6. 联系消防队,并请求帮助。7. 采取其他安全措施,如打电话报警或拨打紧急电话。
[Speed]: 55.77 tokens/s
结论
模型能回答基本问题,具备一定的对话互动性。尽管基本事实和基本逻辑还比较缺乏。
训练曲线





