本文100% 基于 DeepSeek 官方顶刊论文《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》(https://arxiv.org/abs/2501.12948) 撰写,所有结论、数据、实验结果均来自论文原文与官方开源信息,无任何主观推测与技术幻觉,完整还原 DeepSeek-R1 思维链的底层逻辑、进化机制与工程实现。
关键词:# 大语言模型 #DeepSeek-R1 #思维链 CoT #强化学习 #LLM 推理 #GRPO
摘要
Chain-of-Thought(思维链,CoT)是大语言模型实现复杂推理的核心载体,传统 CoT 技术高度依赖人类标注的推理轨迹做监督微调(SFT),不仅标注成本极高,更将模型的推理能力天花板锁死在人类示范的边界内。DeepSeek-R1 的颠覆性突破在于:完全跳过人类推理轨迹的 SFT 阶段,仅通过「最终答案正确性」为核心的强化学习(RL)信号,让模型自主进化出了包含自我反思、错误回溯、多路径择优的内生性长链推理能力。
本文将从本质定义、底层实现、结构拆解、进化轨迹、行业对比等多个维度,对 DeepSeek-R1 的思维链体系做学术级全拆解,为大模型推理技术的研究者、开发者提供可复现、可落地的技术参考。

一、引言:传统 CoT 的瓶颈与 DeepSeek-R1 的范式突破
自 Chain-of-Thought(Wei et al., 2022)概念被提出以来,思维链已成为提升大模型复杂推理能力的核心技术路径,其发展经历了两个核心阶段:
而 DeepSeek-R1 的问世,彻底打破了这一技术路径依赖。论文核心结论证明:仅靠结果导向的强化学习,无需任何人类标注的推理步骤,就能让 LLM 自主进化出远超传统 SFT 模型的复杂推理能力。模型在训练中自发形成了包含反思、验证、回溯的完整思维链体系,在 AIME 数学竞赛、Codeforces 编程竞赛等专业场景中,实现了对人类平均水平和主流闭源模型的超越。
这套自主进化的思维链,正是 DeepSeek-R1 推理能力的核心载体,也是本文拆解的核心对象。
二、核心定义:DeepSeek-R1 思维链的本质是什么?
DeepSeek-R1 的思维链(CoT),是模型在纯结果导向的强化学习驱动下,为最大化奖励信号自主进化出的、内生性的完整中间思考过程,而非人工设计、人工灌输的分步输出模板。
我们可以从三个核心维度,精准定义其本质:
最核心的颠覆性认知
传统 CoT 的核心是模仿人类的推理形式,而 DeepSeek-R1 的思维链核心是掌握了推理的本质能力。前者是 “教模型怎么按人类的方式写步骤”,后者是 “让模型自己学会怎么思考才能把题做对”—— 这也是二者在复杂任务中性能出现数量级差距的核心原因。
三、底层来源:纯 RL 驱动的思维链自进化机制
DeepSeek-R1 的思维链能力,完全来自GRPO 强化学习框架 + 规则化奖励体系的训练,而非人工标注。论文中通过完整的实验设计与过程监控,验证了这套机制的有效性,其核心实现分为三大模块。
3.1 颠覆性的训练前提:跳过 SFT,无约束的 RL 探索
传统的 LLM 推理增强范式,普遍遵循「基座预训练→推理轨迹 SFT→RLHF 对齐」的流程,而 DeepSeek-R1-Zero(推理能力孵化的核心版本)的训练,完全跳过了推理轨迹的 SFT 阶段,直接基于无指令微调的 DeepSeek-V3-Base 基座启动强化学习训练。
训练过程中,对模型的约束仅有 2 项:
- 格式约束:必须将思考过程放在标签内,最终答案放在标签内;
- 奖励约束:只有最终答案与标准答案一致,才能获得核心的准确性奖励。
对中间的推理过程、思考方式、步骤数量、语言风格,没有任何人工约束、没有任何人类示范、没有任何内容引导,完全放开让模型自主探索。这一设计,彻底解除了人类推理范式对模型的束缚,为思维链的自主进化提供了空间。
3.2 核心算法:适配长链推理的 GRPO 强化学习
为了支撑超长思维链的稳定训练,DeepSeek-R1 采用了Group Relative Policy Optimization(GRPO) 作为核心 RL 算法,而非传统 LLM 对齐中常用的 PPO 算法。
GRPO 算法针对长链推理场景做了核心优化,也是思维链能稳定进化的关键:

其中优势函数的计算方式为:![]()
3.3 奖励设计:引导思维链进化的核心信号
奖励函数是模型思维链进化的 “指挥棒”,DeepSeek-R1 的奖励体系完全围绕「提升推理正确率」设计,同时兼顾格式规范性与人类可读性,分为两个核心阶段。
3.3.1 R1-Zero 阶段:纯推理能力孵化的规则化奖励
这一阶段完全摒弃了神经奖励模型,仅采用可量化、无偏差的规则化奖励,彻底避免了奖励黑客(Reward Hacking)问题,核心公式为:

- 准确性奖励(Rewardacc):核心奖励项,权重占比 50%。数学题通过最终答案的格式匹配与数值校验判定,编程题通过编译器与测试用例通过率判定,STEM 题通过选项匹配判定,答案完全正确则获得满分,错误则为 0 分。这是驱动模型进化推理能力的核心信号。
- 格式奖励(Rewardformat):辅助奖励项,权重占比 50%。仅当模型严格遵循+的标签格式封装内容时,才能获得全额奖励,确保模型的思考过程与最终答案解耦,为后续的分析、优化提供了标准化的载体。
论文中特别强调:全程未使用基于神经网络的过程奖励模型(PRM)或结果奖励模型,原因在于神经奖励模型易出现奖励黑客问题,且额外的训练会大幅提升 pipeline 复杂度,而规则化奖励对可验证的推理任务,具备绝对的客观性与稳定性。
3.3.2 R1 正式版阶段:兼顾可读性与安全性的辅助奖励
R1-Zero 虽然孵化出了极强的推理能力,但存在中英语言混合、推理链可读性差、口语化冗余等问题。因此在 DeepSeek-R1 的正式版训练中,新增了两项辅助奖励,在不损失核心推理能力的前提下,优化思维链的人类适配性:
3.4 思维链进化的铁证:论文中的实验数据支撑
论文通过全程的训练监控,直接证明了思维链与推理能力的共生进化关系:
四、结构拆解:DeepSeek-R1 思维链的 6 步闭环核心架构
经过强化学习的迭代与人类偏好对齐,DeepSeek-R1 的思维链形成了一套稳定的、闭环的 6 步核心架构,这也是模型 `` 标签内的完整思考逻辑,而非零散的分步推导。
| 1. 问题理解与目标锚定 | 推理的前提与基础 | 重述问题的已知条件、隐藏约束、输出格式要求,明确核心求解目标与答案验证标准,避免答非所问与约束遗漏 | 论文附录 B.3.3 的 SFT 轨迹示例,所有数学 / 代码题的思考第一步,均为问题重述与约束拆解 |
| 2. 解法设计与路径规划 | 推理的顶层框架 | 针对问题特征选择适配的解法体系(如数学题的拉格朗日乘数法、编程题的动态规划),将复杂问题拆解为可分步求解的子任务,规划整体推理路径 | 论文 2.3 节明确指出,模型会自发将复杂问题拆解为多步子任务,而非一步到位求解 |
| 3. 分步推导与中间验证 | 推理的核心执行 | 按规划的路径逐段执行推导,每完成 2-3 步核心推导,就同步做一次小范围验证(如数值代入校验、边界条件测试、逻辑一致性检查),避免小误差累积为最终错误 | 论文附录 C.2 的统计显示,训练后期模型的思维链中,每几步推导就会伴随一次验证动作 |
| 4. 自我反思与错误修正 | 推理的容错核心 | 当发现推导漏洞、逻辑矛盾、计算错误时,主动标记错误点,叫停当前路径,回溯到错误发生的节点重新推导,甚至完全推翻初始的解法设计,而非线性地错到底 | 论文表 2 的 “aha moment” 案例、图 9 的反思词汇频率统计,均证明该行为是模型内生的核心能力 |
| 5. 多路径探索与方案择优 | 复杂问题的能力跃升 | 针对高难度问题,会在思维链中尝试 2 种及以上的解题思路,分别完成推导与验证,对比不同路径的合理性、严谨性,最终选择正确率最高、逻辑最完备的方案作为最终解法 | 论文 2.3 节明确,RL 训练让模型自主学会了「alternative approaches exploration(替代方案探索)」能力 |
| 6. 结论收敛与格式校验 | 推理的最终收口 | 完成所有推导后,对最终答案做全局校验,再按照要求的格式规范输出(如数学题用\\boxed{}包裹最终答案),确保能通过奖励规则的校验,同时保证答案的规范性 | 论文 2.2 节的格式奖励设计,驱动模型固化了该环节,也是答案正确率的最后一道保障 |
原生思维链真实示例(来自论文附录)
以下为论文附录中,DeepSeek-R1 原生思维链的精简示例,完整还原了上述 6 步闭环架构:
plaintext
Alright, so I’m trying to solve this problem where I need to find a positive integer n such that S_n, the minimum value of the sum, is an integer. Here, a_1,a_2,…,a_n are positive real numbers that add up to 17.
# 1. 问题理解与目标锚定
Hmm, okay, let me break this down. I know that when you have a sum of square roots like this, it often relates to geometry, maybe minimizing distances. It reminds me of the shortest path in a staircase.
# 2. 解法设计与路径规划
Let me visualize it. Each term √((2k – 1)^2 + a_k^2) looks like the hypotenuse of a right-angled triangle with legs (2k – 1) and a_k. So, if I imagine a grid where I move horizontally by a_k and vertically by (2k – 1) for each step k, then S_n would be the total length of this path.
Now, the sum of all a_k is 17, which would be the total horizontal distance. I need to figure out the vertical distances, which are fixed based on k. So the total vertical distance would be ∑_{k=1}^n (2k – 1). Let me compute that:
The sum ∑_{k=1}^n (2k – 1) is equal to 2 * n(n+1)/2 – n = n². So the total vertical distance is n².
Wait a second, so this entire setup is like moving from the origin to the point (17, n²) with n segments. …
# 3. 分步推导与中间验证
Wait, let me check my steps again to make sure I didn't make a mistake. Let's re-derive the Lagrangian part:
I set up L = ∑√((2k-1)² + a_k²) + λ(17 – ∑a_k). Taking the derivative with respect to a_k gives a_k/√((2k-1)²+a_k²) – λ = 0. That seems right.
So each a_k is proportional to (2k-1). That means a_k = (2k-1)*17 / n². Let's plug that back into the sum…
# 4. 自我反思与错误修正(示例中为验证环节,复杂题会出现完整的错误修正)
Yeah, that seems to check out. So S_n = √(n⁴ + 289). We need this to be an integer.
Let me denote S_n = m, where m is an integer, so m² – n⁴ = 289. That's a difference of squares: (m – n²)(m + n²) = 17² = 289.
# 5. 多路径探索与方案择优(本题单路径即可解决,复杂题会出现多方案对比)
The factor pairs of 289 are (1,289) and (17,17). The second pair gives n=0, which is invalid. So we take the first pair:
m – n² = 1, m + n² = 289. Adding gives 2m=290 → m=145. Subtracting gives 2n²=288 → n²=144 → n=12.
# 6. 结论收敛与格式校验
Let me verify this: S_n = √(12⁴ + 17²) = √(20736 + 289) = √21025 = 145, which is indeed an integer. Perfect, that checks out.
To solve the problem, we first transform the original sum into a shortest path problem, then use the Lagrange multiplier method to derive the minimum value expression, and finally solve the integer solution through the difference of squares formula.
### Core Derivation
1. The sum of vertical components: $\\sum_{k=1}^n (2k-1) = n^2$
2. The minimum value of the sum: $S_n = \\sqrt{n^4 + 17^2} = \\sqrt{n^4 + 289}$
3. Solve the integer equation: $m^2 – n^4 = 289$, the valid factor pair gives $n^2=144$, i.e. $n=12$
**Final Answer** $\\boxed{12}$
五、进化轨迹:训练过程中思维链的三阶能力跃迁
论文附录 C 通过全程的行为分析与性能监控,完整还原了模型思维链的分阶段进化过程。模型的思考能力不是一蹴而就的,而是随着 RL 训练的推进,逐步解锁更高级的推理行为,整体可分为三个核心阶段。
第一阶段:早期探索期(0-4000 训练步)
- 思维链特征:推理链长度短,以线性直接推导为主,几乎没有反思、验证环节,思考逻辑零散,想到哪写到哪;
- 性能表现:简单题(MATH 难度 1-3 级)正确率快速提升至 90% 以上,但高难度难题正确率极低,AIME 2024 的 Pass@1 仅 30% 左右;
- 核心行为:只会单一路径的线性推导,缺乏中间验证意识,一旦出现错误就会一路错到底,没有回溯修正能力。
第二阶段:能力成长期(4000-8000 训练步)
- 思维链特征:开始出现少量反思类词汇,会对关键推导步骤做简单的结果验证,平均推理链长度持续增长,学会了将复杂问题拆解为子任务分步求解;
- 性能表现:中等难度题正确率大幅提升,AIME 2024 的 Pass@1 突破 50%,STEM 类多步推理题正确率显著提升;
- 核心行为:解锁了「分步验证」能力,偶尔能发现推导中的计算错误并修正,但还不会完全推翻初始的错误解法框架,缺乏全局重构的能力。
第三阶段:能力爆发期(8000 训练步 +,关键阈值)
- 触发条件:论文在 8200 训练步时,将单条输出的最大 token 限制从 32768 提升至 65536,给模型的长链思考提供了充足的序列空间;
- 思维链特征:高频出现反思、回溯、多路径探索行为,平均推理链长度突破 15000 token,高难度竞赛题的思考链最长可达 18000+ token,形成了完整的闭环推理架构;
- 性能表现:AIME 2024 的 Pass@1 飙升至 77.9%,MATH-500 数据集正确率突破 95%,Codeforces 评分达到 1444,大幅超越人类竞赛选手的平均水平;
- 核心行为:完全解锁了「自我反思 – 错误修正 – 多路径择优」的闭环推理能力,会主动标记易错点、重新评估解法合理性,甚至完全推翻初始思路,从零规划更优的解题路径。
六、本质差异:DeepSeek-R1 内生 CoT vs 传统 Prompt 引导 CoT
行业内很多人会将 DeepSeek-R1 的思维链,与普通 LLM 通过 Prompt 引导的 “一步步思考” 混为一谈,但二者在本质、能力、来源上有着天壤之别,核心对比如下:
| 能力来源 | 纯强化学习驱动的内生进化,无任何人类推理轨迹标注 | 人工 Prompt 引导,或基于人类标注的 SFT,本质是模仿人类的推理形式 |
| 核心能力 | 自带自我反思、回溯修正、多路径探索的闭环推理能力,可主动纠错、换解法 | 以线性分步推导为主,几乎没有主动纠错、回溯能力,一步错则步步错 |
| 长度控制 | 难度自适应:简单题 < 100 token 快速出结果,难题自动生成 18000+ token 长链深度思考 | 大多为固定的输出模式,无法根据问题难度动态调整思考深度,易出现 “简单题啰嗦、难题想不透” |
| 推理边界 | 可探索超越人类习惯的、更高效的非人类推理路径,不受人类认知天花板限制 | 被人类标注的推理范式束缚,无法跳出人类设计的思考框架 |
| 优化目标 | 完全以「最终答案正确性」为核心目标,思考链的每一步都服务于结果准确 | 以「符合人类的分步表达习惯」为目标,步骤的正确性依赖模型原生基础能力 |
| 规模化成本 | 仅需可自动验证的题目与标准答案,无需人工标注推理步骤,可无限规模化 | 依赖大量高质量的人工标注推理轨迹,标注成本极高、规模化难度大 |
| 泛化能力 | 数学领域训练出的反思、验证能力,可直接迁移到编程、STEM、逻辑推理等所有可验证任务 | 泛化性极差,不同领域、不同题型需要单独设计 Prompt 或标注数据 |
七、工程落地:交互态 CoT 与原生训练 CoT 的对齐优化
我们在产品交互中看到的 DeepSeek-R1 的 `` 标签内容,是经过人类偏好对齐优化后的 “可读版思维链”,与训练初期 R1-Zero 的原生思维链,核心推理逻辑完全一致,但在呈现形式上做了系统性的工程优化,对应论文中 DeepSeek-R1 的多阶段训练流程。
7.1 原生 R1-Zero 思维链的原生缺陷
纯 RL 训练出的 R1-Zero,虽然推理能力极强,但存在明显的工程落地缺陷:
7.2 面向交互的思维链对齐优化
为了解决上述问题,论文中设计了多阶段的训练 pipeline,在不损失核心推理能力的前提下,完成了思维链的人类偏好对齐:
经过上述优化,最终的 DeepSeek-R1 正式版,既保留了 R1-Zero 内生的闭环推理能力,又让思维链的表达更符合人类的阅读与学习习惯,实现了 “能力强” 与 “体验好” 的平衡。
八、核心特性与官方明确的局限性
8.1 DeepSeek-R1 思维链的核心特性
8.2 官方论文明确的局限性
论文第 6 章客观披露了当前方案的局限性,也是未来研究的核心优化方向:
九、总结与行业启示
DeepSeek-R1 的思维链体系,本质上是对大模型推理技术路线的一次范式革命。它用实验结果证明了:大模型的基座中,本身就蕴含着强大的推理潜能,而人类标注的推理轨迹,反而可能成为束缚模型探索的枷锁;仅靠结果导向的强化学习,就能解锁这种潜能,让模型自主进化出远超人类示范的推理能力。
这一结论给行业带来了深远的启示:
当然,DeepSeek-R1 的方案仍存在局限性,尤其是在非可验证任务、工具协同、token 效率等方面,仍有大量的优化空间。但不可否认的是,它为大语言模型的推理能力进化,开辟了一条全新的、更具想象力的技术路线。
参考文献
[1] DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning[J]. arXiv preprint arXiv:2501.12948, 2026.[2] Wei J, Wang X, Schuurmans D, et al. Chain-of-thought prompting elicits reasoning in large language models[J]. Advances in Neural Information Processing Systems, 2022, 35: 24824-24837.[3] Shao Z, Wang P, Zhu Q, et al. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open Language Models[J]. arXiv preprint arXiv:2402.03300, 2024.[4] Schulman J, Wolski F, Dhariwal P, et al. Proximal policy optimization algorithms[J]. arXiv preprint arXiv:1707.06347, 2017.
相关代码与数据集可参考 DeepSeek 官方开源仓库:https://github.com/deepseek-ai/DeepSeek-R1欢迎在评论区交流,关于 DeepSeek-R1 的推理实现、训练复现、工程落地相关问题,我会逐一解答。






