
32B模型训练后半程:调优、成本与妥协
当你的训练loss卡住不动时,工程师的第一反应不应该是调参数,而应该是看账单
训练过半的现状:喜忧参半
第120天,训练进度52%。控制面板上的数字复杂得像我们的心情:
训练进度: 52.3%
累计训练tokens: 520B / 1T
累计耗时: 120天
剩余预估时间: 110天(是的,比已用时间还长)
总花费: ¥8,700,000
剩余预算: ¥6,300,000
我们有了相对稳定的数据管道(78% GPU利用率),有了能正常收敛的模型,但有两个问题越来越紧迫:
中期调优:当所有教科书方法都失效时
第一阶段:标准方法试错
按照教科书,loss不下降时应该:





