一句话总结
现有方法解决 LLM 过度思考问题时,都没有考虑推理过程中难度的实时变化。DyCon 通过一个线性回归器就准确地估计出了实时难度,训练简单有效且泛化性极强;再据此实现简单题少想、难题多想,让推理效率最高提升 52% ,准确率还上涨
- 论文标题:DyCon: Dynamic Reasoning Control via Evolving Difficulty Modeling
- 论文地址:https://arxiv.org/abs/2606.07108
- 代码地址:https://github.com/yu-lin-li/DyCon
- 作者背景:哈尔滨工业大学(深圳)、中关村学院、华为诺亚方舟实验室、深圳河套学院、清华大学
一、动机
LLM 思考模型靠思维链一步步反思、探索,在数学、代码这类难任务上拿到了亮眼的成绩。但它有一个很现实的毛病:不会踩刹车。哪怕是一道极其简单、甚至已经做对了的题,它也会反复检查、反复 “等一下,我再想想”,把推理链拖得很长,这种现象被称为 overthinking
围绕 “何时终止推理”,已有方法可分为三类,但每一类都有硬伤:
- 外挂判别模型:如 TrimR、FlashThink,额外用一个模型来判断推理是否充分。问题是它对所有输入都用同一把尺子,忽略了不同问题的难度差异
- 手工设计的确信度指标:如 DEER、Dynasor,用人工设计的指标去衡量模型当前有几分把握,再配一个经验阈值来决定何时停。问题是它高度依赖人工先验和经验门槛,换一类问题就不灵
- 专门训练:用 SFT 或 RL 配上精心构造的数据,训练模型隐式地推断难度。问题是它对数据的数量和质量很敏感,还容易出现模式崩溃
把这三类方法放在一起看,会发现一个更本质的共同盲区:它们都没有去追踪难度在推理过程中的实时变化。有的方法甚至更进一步 —— 在推理还没开始时,就用初始问题(或 <think> token)的向量打一个固定的难度分,然后整段推理都用这个静态值
可现实恰恰相反:一道题到底有多难,不是开头就定死的。这个前提一旦错了,“何时该停” 自然就判断不准。于是作者希望动态地建模问题难度,自适应地决定何时终止、何时延长推理
二、关键观察
2.1 难度真的会动态演化吗
作者在 MATH-500 的 5 级难题上做了一个实验:让模型每推理一步,就给当前难度自评一个分数(1 分 = 基本搞定,2 分 = 还有些不确定,3 分 = 还缺关键思路)
结果很清晰:只要推理走在正道上,自评难度会随着思考推进稳步下降 —— 因为思维链在一步步把问题拆解、讲清楚。反过来,一旦推理走偏、被干扰信息带跑,难度就会卡住高位、甚至回升。这个规律在 1.5B 到 32B 的四个不同模型家族上一致出现

这说明,要准确判断终止点,就必须细粒度地、动态地盯住难度的变化,而不是只在开头看一眼
2.2 如何高效判断当前难度
每一步都去问模型 “现在多难” 显然不现实,有没有更便宜的信号?
作者发现,难度信息其实早就藏在模型每一步的隐藏向量里了:把每个推理步骤边界(以换行 \\n\\n 为界)的隐藏向量取出来,用 “该步到推理结束还剩多长” 作为难度的代理标签,然后只用一个简单的线性回归去拟合
直觉上,某一步之后还需要写很多 token 才能结束,往往意味着这一步离答案还远、更难;反之则更接近收尾。它是一个无需人工标注、天然可得的难度信号
结果是:在留出的测试集、横跨 4B 到 32B 的三个模型上,线性回归预测的难度都和真实值高度吻合,决定系数 R² 高达约 0.8。一个线性模型就能解码出来,说明难度在向量空间里几乎是线性编码的 —— 模型自己其实心里有数

三、实现方案
作者提出 DyCon,它把上述观察落地成两步:先显式建模演化的难度,再据此动态控制推理行为。整个过程不改动原模型的任何参数

3.1 演化难度建模
从 MATH 训练集随机采样 600 道题,让模型完整推理一遍。在每个步骤边界,记录两样东西:这一步的向量、到推理结束的剩余长度
直接拿剩余长度当回归目标并不理想,因为它是重尾分布的 —— 少数步骤的剩余长度极大,会把回归带偏。所以作者先做一次对数变换压缩尺度,再归一化到 0~1 之间,得到一个有界、稳定的难度目标(越接近 1 越难)。最后用一个轻量的岭回归器把 “步骤向量 → 难度” 这层映射拟合出来

用哪一层的向量、正则化强度取多少,都是在验证集上按 R² 自动选的,没有手工调参。
3.2 难度感知的动态控制
已有工作(如 NoWait)发现,压低反思类关键词(如 “wait”、“recheck” 等)的输出概率,就能让模型早点收尾,避免触发继续反思
DyCon 借鉴了这个思路,但做得更精细:在线推理时,每到一个步骤边界就用回归器估出当前难度,再据此给反思词的 logit 减去一个偏置。注意,它不是硬性叫停,而是动态地调低继续反思倾向
这个偏置的设计有三个关键点:
阈值在所有模型和任务上保持一致,不需要逐任务调
四、实验结果
4.1 多基准测试
作者在 4 个模型(DeepSeek-R1-Distill-Qwen-7B、Qwen3-4B-Thinking、QwQ-32B、Qwen3-14B,覆盖 4B–32B)、12 个基准上做了评测,横跨数学推理、通用问答、代码等多个领域
在数学基准上,DyCon 最高实现 40.6% 的 token 缩减,并取得最高 6.7 个百分点的绝对准确率提升
在非数学基准上,最高 52.5% 的 token 缩减和 8.6 个百分点的准确率提升。在 LLaMA 系列等非 Qwen 架构上同样有效,展现出很强的跨架构能力

为什么省了一大半 token,准确率还能不降反升?因为 DyCon 砍掉的是简单题上的冗余反思,而复杂题该有的探索被完整保留
更难得的是,回归器只在 MATH 上拟合一次,不做任何适配就直接用到代码、问答等其他领域,依然有效。这说明难度的演化模式在不同推理领域之间是相通的,可以迁移。
4.2 消融分析
动态难度是关键。 如果把自适应的难度估计换成一个固定的静态系数,准确率立刻大跌,AIME2024 上直接掉了 16.7 个点;如果换成 token 级的熵这类局部指标,效果也不行:它只盯着眼前一步的局部不确定性,缺少对整条推理轨迹的全局判断。这证明轨迹级、动态的难度感知才是真正起作用的部分

回归器很皮实。 岭回归、普通最小二乘(OLS)、弹性网(Elastic Net)这些线性模型的 R² 都在 0.8 上下,效果相当;只有随机森林明显差一截(R² ≈ 0.64),下游表现也随之变差;拟合数据量也不挑:大约 300 条样本性能就饱和了,再多收益有限。甚至连用于压制的反思词表换一换(如换成 SEAL 的词表),效果也几乎不变


![[特殊字符]DeepSeek‑Harness(DSH)小白保姆教程-171主机测评](https://www.171host.com/wp-content/uploads/2026/08/20260816085112-6a817a009aabf-220x150.png)
