欢迎光临
我们一直在努力

PCL:离线强化学习提升LLM数学推理

在这里插入图片描述

📖标题:PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
🌐来源:arXiv, 2601.14716v1

🌟摘要

我们提出了PCL-Reasoner-V1.5,这是一个用于数学推理的32-billion-parameter大语言模型(LLM)。该模型建立在Qwen2.5-32B之上,并通过监督微调(SFT)和强化学习(RL)进行改进。一个核心创新是我们提出的离线强化学习方法,它提供了优于标准在线RL方法(如GRPO)的训练稳定性和效率。我们的模型在Qwen2.5-32B上进行后训练的模型中达到了最先进的性能,在AIME 2024上达到了90.9%的平均准确率,在AIME 2025上达到了85.6%的平均准确率。我们的工作证明离线强化学习是在LLM中推进推理的稳定高效的范式。所有实验都在华为Ascend 910C NPU上进行。

🛎️文章简介

🔸研究问题:如何在不依赖在线交互的情况下,高效稳定地提升大语言模型(LLM)的数学推理能力?
🔸主要贡献:论文提出一种基于离线强化学习(RL)的训练方法,显著提升Qwen2.5-32B在数学推理任务上的表现,且训练更稳定、效率更高。

📝重点思路

🔸以Qwen2.5-32B为基座模型,先通过监督微调(SFT)引入思维链(CoT)数据,构建高性能初始模型PCL-Reasoner-V1。
🔸设计两阶段训练流程:SFT后接离线RL,避免在线RL中推理与训练耦合带来的不稳定性。
🔸在离线RL阶段,使用SFT模型对固定问题集批量生成候选答案,并利用验证模型打分形成静态奖励数据集。
🔸采用简化的RL损失函数,基于token级概率的几何平均进行优化,不使用重要性采样,提升训练稳定性。
🔸训练过程中解耦推理与训练阶段,支持高吞吐推理框架(如vLLM)和高效训练框架独立运行,提升工程可扩展性。

🔎分析总结

🔸PCL-Reasoner-V1.5在AIME 2024和2025上分别达到90.9%和85.6%准确率,超越同规模模型,成为Qwen2.5-32B衍生模型中的SOTA。
🔸相比SFT模型,离线RL显著增加了模型回答的平均长度(从约2.5万token增至近4万),表明其推动了更深入的推理过程。
🔸长思维链(>32K token)问题上性能大幅提升,说明离线RL有效增强了模型处理复杂、多步推理任务的能力。
🔸实验证明,尽管离线RL受限于静态数据,但在强基线模型基础上仍能实现显著增益,且训练过程更稳定、资源利用率更高。

💡个人观点

论文证明仅通过高质量静态数据和简单RL目标,也能显著提升推理能力,个人认为核心在于要确保采样结果依旧属于策略模型的分布内。

🧩附录

在这里插入图片描述

赞(0)
未经允许不得转载:171主机测评 » PCL:离线强化学习提升LLM数学推理
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址