欢迎光临
我们一直在努力

大模型微调方法全景梳理:从全参数到 LoRA/QLoRA/DPO,优缺点一次讲清

本文面向有一定 NLP/深度学习基础的开发者和算法同学,系统梳理当前(2026 年)主流的大模型微调方法,按「全参数微调 → 参数高效微调(PEFT)→ 监督/对齐范式」三条线展开,每种方法给出原理、优缺点与适用场景,最后附选型速查表。

一、为什么需要微调

预训练大模型(base model)具备通用语言能力,但无法直接满足具体业务在领域知识、指令跟随、输出风格、安全对齐上的要求。微调就是在保留预训练能力的前提下,用任务数据对模型做“二次加工”。

当前微调技术的主旋律是:在“性能不塌”和“算力扛得住”之间找平衡点。


二、全参数微调(Full Fine-Tuning)

原理

解冻模型全部参数,在下游数据上做完整前向/反向传播,更新每一权重。

W ← W – lr · ∇L(W)

优缺点

维度

说明

优点

性能上限最高;可深度改变模型行为;适合与预训练分布差异极大的任务

缺点

显存/算力开销巨大(70B FP16 仅权重约 140GB,加优化器状态需 400GB+);易灾难性遗忘;每任务存一份全量权重,存储成本高

适用

有百 GB 级高质量数据 + H100/A100 集群;基础模型厂;对 5%~10% 性能差距零容忍的场景

💡 工业界一句大实话:除了一线大模型厂,几乎没人做全参数微调。


三、参数高效微调(PEFT)

只训练少量参数,冻结主干。HuggingFace peft 库已封装主流方法。

1. LoRA(Low-Rank Adaptation)

在注意力 Q/K/V/O 等投影矩阵旁并联低秩分解:

W = W₀ + ΔW = W₀ + B·A B ∈ ℝ^{d×r}, A ∈ ℝ^{r×k}, r ≪ d,k

训练时只更新 A、B,可训练参数通常占原模型 0.1%~1%。

  • 优点:显存大幅下降(7B 模型 LoRA 约 14~16GB);训练快;adapter 小(常 <100MB)易版本化;可合并回主干,推理无额外延迟;多任务热插拔。

  • 缺点:复杂任务性能略低于全参(通常为全参的 90%~95%);秩 r 需调;对“重写模型认知”的活儿力不从心。

  • 适用:2026 年最常用默认方案,单卡 24GB 微调 7B/13B 首选。

2. QLoRA

LoRA + 4-bit NF4 量化底座 + 双重量化,adapter 仍用 BF16/FP16。

  • 优点:显存再降 50%~60%(7B 可压到 ~6GB,13B ~12GB,70B 双卡 24GB 级);消费卡(3090/4090)能跑 13B/34B。

  • 缺点:前向反量化有开销,比 LoRA 慢约 30%;精度为全参的 85%~92%。

  • 适用:显存是硬瓶颈时的第一选择。

3. AdaLoRA / DoRA

  • AdaLoRA:逐层动态分配秩,重要层给高秩。

  • DoRA:权重拆成“幅度+方向”分别适配,更接近全参表现。

  • 评价:实现更复杂、边际收益递减,非必要不优先。

4. Prefix Tuning / Prompt Tuning / P-Tuning v2

在输入或各层 KV 前拼可学习 soft prompt,主干全冻。

  • 优点:参数量极小(prompt tuning 可 <0.01%),推理零延迟。

  • 缺点:生成任务上弱于 LoRA;前缀长度敏感,调参偏玄学。

  • 适用:轻量定制、做 baseline 验证“微调到底有没有用”。

5. Adapter / IA³ / BitFit

  • Adapter:Transformer 层间插 bottleneck 小网络,串行增加推理延迟,已被 LoRA 家族淘汰。

  • IA³:用学习向量缩放激活。

  • BitFit:只训 bias,参数量比 LoRA 再小一个量级,天花板也更低。


四、监督与对齐范式(和上面方法是正交维度)

方法解决“训哪部分参数”,范式解决“拿什么数据、用什么 loss 训”。两者自由组合,例如「LoRA + SFT」「全参 + DPO」。

1. SFT(Supervised Fine-Tuning / 指令微调)

用 (instruction, input, output) 三元组做监督训练,把 base 模型改成 chat 模型。

  • 优点:显著提升指令跟随;是做对话助手的必经阶段。

  • 缺点:数据质量 >> 数量,几千条精标常胜几万条脏数据;系统 prompt 设计影响很大。

2. RLHF(PPO)

SFT → 训 Reward Model → PPO 强化学习。

  • 优点:人类偏好对齐天花板。

  • 缺点:要同时载策略模型、参考模型、RM、优化器状态,链路脆弱,调参痛苦。

    </

赞(0)
未经允许不得转载:171主机测评 » 大模型微调方法全景梳理:从全参数到 LoRA/QLoRA/DPO,优缺点一次讲清
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址