写在前面

欢迎大家关注Rocky的公众号:WeThinkIn 欢迎大家关注Rocky的知乎:Rocky Ding 《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~
Rocky最新撰写的10万字AI Agent(AI智能体)深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群(涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识)欢迎大家加入:https://t.zsxq.com/33pJ0
大家好,我是Rocky。
核心导读
多模态大模型有一种很典型的失败:图片里的关键细节并非完全看不懂,而是它和整张图一起出现时,模型找不到、盯不住,也无法稳定把这个细节用于回答。
把局部区域裁出来、放大后再问,同一个模型往往就能答对。过去的主流解法,是让模型在推理时学会调用crop、zoom、search等视觉工具:先看全图,再决定裁哪里,然后重新编码局部图像并继续推理。这条路线有效,但每次任务都要支付多轮模型调用、重复视觉编码与工具调度成本。
Vision-OPD提出了另一条路线:不要让模型每次推理都重新“找放大镜”,而是在训练阶段把局部放大后的识别能力蒸馏回全图策略。
它让同一个多模态模型扮演两个角色:
- 教师看到证据中心裁剪图,拥有更清晰的局部条件;
- 学生只看完整图像,保持真实推理时的输入条件;
- 学生先生成自己当前策略下的on-policy轨迹;
- 教师沿学生已经生成的每个前缀,提供逐Token分布监督;
- 梯度只更新学生,教师通过EMA保持稳定。
Rocky认为,这篇论文真正有价值的,不是“9B模型又超过了几百B模型”,而是它把一个普遍的多模态问题重新定义了:
很多细粒度视觉失败,不一定是模型没有局部识别知识,而是局部证据没有在全局条件下被正确路由。Vision-OPD做的不是增加一个外部视觉工具,而是利用条件差异,把模型已经具备的区域能力迁移成全局能力。
它背后对应一个更跨周期的AI系统原则:训练时可以使用更强、更明确的特权信息,但产品推理路径应该尽可能简单。

图1给出了论文最直观的结果:Vision-OPD-9B在六个细粒度视觉基准上的平均分达到79.7,Vision-OPD-4B达到77.1。真正需要谨慎的是,这只是论文给定数据、基座、评测提示与协议下的平均准确率,不能脱离任务分布直接写成“9B全面超过所有大模型”。后文会同时拆解增益、对照实验和证据边界。
一、问题本质:模型不是完全看不见,而是在全图里不会看
细粒度视觉任务的关键证据往往只占图像很小一部分,例如远处船身上的数字、人物耳罩的颜色、仪表盘刻度或密集文档中的局部文本。对模型而言,全图中大量视觉Token共同竞争注意力,关键区域的信号容易被背景、构图与语义先验淹没。
当模型基于全局场景生成一个“看起来合理”的答案时,它未必是在随机猜。它可能正确理解了主体和环境,却没有把小区域证据送到最终决策路径上。
Vision-OPD用一个非常直接的实验诊断这个问题:同一道题,分别给模型完整图像和证据中心裁剪图。如果区域输入能答对、全局输入答错,说明局部证据并没有超出模型的识别能力,真正缺失的是全局条件下的聚焦与证据利用。

图2中,问题询问人物耳罩的颜色。Qwen3.5-9B看到全图时选择黑色,看到裁剪区域时选择绿色。局部识别能力已经存在,但全图中的直升机、人物姿态和背景分散了视觉证据。

图3把这一现象扩展到多个模型。Qwen3.5-4B、Qwen3.5-9B、GLM-4.6V、GPT-5.4与Gemini-3.1-Pro的区域输入准确率均明显高于全图输入,差距约18.1至22.1个百分点。规模扩大没有自动消除这条鸿沟。
这给出一个重要判断:参数规模可以提高识别上限,但不保证每个视觉证据都能在复杂全局输入中被调度出来。 多模态能力除了“有没有知识”,还包括“能否从视觉Token中检索正确证据,并让它支配答案”。
二、两条路线:推理时搜索,还是训练时内化
Thinking-with-Images方法把视觉工具接进推理循环:模型发现证据不足后,裁剪、缩放、重新编码,再继续思考。它的优势是动态性强,可以根据每道题决定看哪里;缺点是端到端成本随工具轮数增加。
Vision-OPD则把问题前移到训练阶段。它利用已知的证据区域构造教师视角,让学生在全图输入下模仿局部视角的Token分布。部署后不需要额外裁图工具,仍然只做一次常规模型生成。
两条路线不是简单的谁取代谁,而是两种成本结构:
| Thinking-with-Images | 推理时动态裁剪和搜索 | 多次视觉编码、工具调用、模型生成 | 对未知区域更灵活、可显式检查证据 | 延迟、算力、工具稳定性和多轮错误累积 |
| Vision-OPD | 训练时区域到全局自蒸馏 | 单次常规模型前向与生成 | 推理快、产品链路简单、不依赖外部视觉工具 | 需要区域构造、on-policy rollout与双策略分布计算 |
Vision-OPD更像是把高频、可学习的视觉搜索模式编译进权重;推理时工具则像保留动态解释器。对于稳定重复的任务分布,前者可能更划算;对于开放世界、证据位置与操作方式高度变化的任务,后者仍有价值。
三、从普通蒸馏到OPD:为什么训练前缀必须来自学生自己
3.1 普通监督蒸馏的问题:训练时走教师路线,推理时走学生路线
传统蒸馏让学生在教师生成的序列前缀上匹配教师分布。设输入为
x
x
x,输出序列为
y
=
(
y
1
,
…
,
y
∣
y
∣
)
y=(y_1,\\ldots,y_{|y|})
y=(y1,…,y∣y∣),教师与学生策略分别为
p
T
p_T
pT和
p
S
p_S
pS。论文公式(1)为:
L
S
u
p
e
r
v
i
s
e
d
D
i
s
t
i
l
l
a
t
i
o
n
(
θ
)
=
E
(
x
,
y
)
∼
S
[
1
∣
y
∣
∑
t
=
1
∣
y
∣
D
(
p
T
(
⋅
∣
y
<
t
,
x
)
∥
p
S
(
⋅
∣
y
<
t
,
x
)
)
]
\\mathcal{L}_{\\mathrm{Supervised\\ Distillation}}(\\theta) =\\mathbb{E}_{(x,y)\\sim\\mathcal{S}} \\left[ \\frac{1}{|y|} \\sum_{t=1}^{|y|} D\\left( p_T(\\cdot\\mid y_{<t},x) \\Vert p_S(\\cdot\\mid y_{<t},x) \\right) \\right]
LSupervised Distillation(θ)=E(x,y)∼S
∣y∣1t=1∑∣y∣D(pT(⋅∣y<t,x)∥pS(⋅∣y<t,x))
它提供逐Token的密集监督,但训练时学生总是在教师或数据集提供的正确前缀上学习。实际推理时,学生必须接着自己生成的Token继续走。一旦早期生成偏离训练分布,后续状态会越来越陌生,这就是exposure bias和状态分布错配。
对细粒度视觉问答,这个问题尤其明显:若学生一开始就把注意力放错区域,后续语言轨迹会围绕错误视觉解释展开。只在教师的正确路径上训练,无法充分教会学生如何在自己真实会到达的状态中纠偏。
3.2 On-policy distillation:教师去学生真正会走的地方教学
OPD先让学生从当前策略生成
y
^
∼
p
S
(
⋅
∣
x
)
\\hat y\\sim p_S(\\cdot\\mid x)
y^∼pS(⋅∣x),再让教师在这些学生前缀上提供分布。论文公式(2)为:
L
O
P
D
(
θ
)
=
E
x
∼
S
,
y
^
∼
p
S
(
⋅
∣
x
)
[
1
∣
y
^
∣
∑
t
=
1
∣
y
^
∣
D
(
p
T
(
⋅
∣
y
^
<
t
,
x
)
∥
p
S
(
⋅
∣
y
^
<
t
,
x
)
)
]
\\mathcal{L}_{\\mathrm{OPD}}(\\theta) =\\mathbb{E}_{x\\sim\\mathcal{S},\\,\\hat y\\sim p_S(\\cdot\\mid x)} \\left[ \\frac{1}{|\\hat y|} \\sum_{t=1}^{|\\hat y|} D\\left( p_T(\\cdot\\mid \\hat y_{<t},x) \\Vert p_S(\\cdot\\mid \\hat y_{<t},x) \\right) \\right]
LOPD(θ)=Ex∼S,y^∼pS(⋅∣x)
∣y^∣1t=1∑∣y^∣D(pT(⋅∣y^<t,x)∥pS(⋅∣y^<t,x))
这句话的本质是:学生在哪里犯错,教师就到哪里提供指导。
它同时获得两种好处:
这正是Vision-OPD能够绕开SFT和RLVR各自短板的理论起点。
四、Vision-OPD机制:同一个模型,用局部视角教全局视角

图4左侧是数据合成,右侧是训练。完整流程可以拆成五步。
4.1 构造全图、裁剪图和问题三元组
训练样本写作:
D
=
{
(
x
i
,
x
i
′
,
q
i
)
}
i
=
1
N
\\mathcal{D}=\\{(x_i,x'_i,q_i)\\}_{i=1}^{N}
D={(xi,xi′,qi)}i=1N
其中
x
x
x是带红色边界框与空间提示的完整图像,
x
′
x'
x′是证据中心区域裁剪并放大2倍后的教师图像,
q
q
q是只依赖该区域即可回答的问题。
原始图像先经过目标识别和分割,保留面积比例小于阈值
τ
\\tau
τ的候选区域,再使用Qwen3.5-397B生成细粒度问题。为了避免问题在全图中指代不清,数据管线把边界框叠加到原图,并在问题中加入“只关注红框内对象”的空间约束。
最终合成6.2K样本。这里需要严格区分两个层次:Vision-OPD的蒸馏训练不依赖外部教师、答案标签或奖励验证器,但它的问题数据合成使用了Qwen3.5-397B。对SFT、GRPO、DAPO和OPSD对照实验,团队还让Qwen3.5-397B基于区域图生成答案,并只保留多数答案一致度大于0.75的样本。
所以“无外部教师”不是“整个数据与训练流程完全没有外部模型”,而是“区域到全局的Token分布教师来自模型自身”。
4.2 教师拥有特权区域,学生面对真实全图
两种策略都从同一个MLLM初始化,但视觉条件不同:
p
T
(
⋅
∣
x
′
,
q
)
=
p
θ
(
⋅
∣
x
′
,
q
)
,
p
S
(
⋅
∣
x
,
q
)
=
p
θ
(
⋅
∣
x
,
q
)
p_T(\\cdot\\mid x',q)=p_\\theta(\\cdot\\mid x',q), \\qquad p_S(\\cdot\\mid x,q)=p_\\theta(\\cdot\\mid x,q)
pT(⋅∣x′,q)=pθ(⋅∣x′,q),pS(⋅∣x,q)=pθ(⋅∣x,q)
教师看到局部证据,学生看到全图。教师的优势不是参数更大,而是输入条件更干净。它属于privileged information:训练时可用,部署时不需要。
4.3 学生先生成自己的on-policy轨迹
学生从全图条件出发生成:
y
=
(
y
1
,
…
,
y
∣
y
∣
)
∼
p
S
(
⋅
∣
x
,
q
)
y=(y_1,\\ldots,y_{|y|})\\sim p_S(\\cdot\\mid x,q)
y=(y1,…,y∣y∣)∼pS(⋅∣x,q)
随后,教师和学生都在同一个学生前缀
y
<
n
y_{<n}
y<n上计算下一Token分布。这样监督覆盖的是学生当前真实会产生的语言状态,而不是离线答案轨迹。
4.4 用逐Token分布差异提供密集信用分配
论文公式(3)定义单条学生轨迹上的平均差异:
D
(
p
T
∥
p
S
)
(
y
∣
x
,
x
′
,
q
)
=
1
∣
y
∣
∑
n
=
1
∣
y
∣
D
(
p
T
(
⋅
∣
x
′
,
q
,
y
<
n
)
∥
p
S
(
⋅
∣
x
,
q
,
y
<
n
)
)
D(p_T\\Vert p_S)(y\\mid x,x',q) =\\frac{1}{|y|} \\sum_{n=1}^{|y|} D\\left( p_T(\\cdot\\mid x',q,y_{<n}) \\Vert p_S(\\cdot\\mid x,q,y_{<n}) \\right)
D(pT∥pS)(y∣x,x′,q)=∣y∣1n=1∑∣y∣D(pT(⋅∣x′,q,y<n)∥pS(⋅∣x,q,y<n))
总目标,即论文公式(4),是在数据和学生rollout上取期望:
L
V
i
s
i
o
n
–
O
P
D
(
θ
)
=
E
(
x
,
x
′
,
q
)
∼
D
[
E
y
∼
p
S
(
⋅
∣
x
,
q
)
[
D
(
p
T
∥
p
S
)
(
y
∣
x
,
x
′
,
q
)
]
]
\\mathcal{L}_{\\mathrm{Vision\\text{-}OPD}}(\\theta) =\\mathbb{E}_{(x,x',q)\\sim\\mathcal{D}} \\left[ \\mathbb{E}_{y\\sim p_S(\\cdot\\mid x,q)} \\left[ D(p_T\\Vert p_S)(y\\mid x,x',q) \\right] \\right]
LVision–OPD(θ)=E(x,x′,q)∼D[Ey∼pS(⋅∣x,q)[D(pT∥pS)(y∣x,x′,q)]]
论文使用
β
=
0.5
\\beta=0.5
β=0.5的Jensen-Shannon divergence:
J
S
D
β
(
p
T
∥
p
S
)
=
β
D
K
L
(
p
T
∥
m
)
+
(
1
−
β
)
D
K
L
(
p
S
∥
m
)
,
m
=
β
p
T
+
(
1
−
β
)
p
S
\\mathrm{JSD}_\\beta(p_T\\Vert p_S) =\\beta D_{KL}(p_T\\Vert m) +(1-\\beta)D_{KL}(p_S\\Vert m), \\quad m=\\beta p_T+(1-\\beta)p_S
JSDβ(pT∥pS)=βDKL(pT∥m)+(1−β)DKL(pS∥m),m=βpT+(1−β)pS
梯度只经过学生logits,教师端stopgrad。因此教师提供目标分布,却不会被当前学生梯度瞬间拉向自己。
4.5 Algorithm 1的工程主线
算法可以压缩成以下循环:
D
\\mathcal D
D采样一批
(
x
,
x
′
,
q
)
(x,x',q)
(x,x′,q);
y
y
y;
y
<
n
y_{<n}
y<n上计算Token分布;
D
(
p
S
∥
s
t
o
p
g
r
a
d
(
p
T
)
)
D(p_S\\Vert\\mathrm{stopgrad}(p_T))
D(pS∥stopgrad(pT))并取平均;
当
β
=
0.5
\\beta=0.5
β=0.5时JSD具有对称性,所以算法伪代码与正文对分布次序的书写差异不会改变该实验设定下的目标值。
五、为什么不能让“当前模型直接教当前模型”:自蒸馏必须有时间尺度差
同一模型既是教师又是学生,最危险的问题是目标漂移。如果教师和学生使用完全相同的当前参数,并在相似条件下同步变化,教师不再是稳定目标,两个分布可能共同走向退化解。
论文比较了当前策略、冻结初始策略、trust-region和EMA四种教师方案。
表3:教师正则策略消融(论文原始Table 3)
| 当前策略,无正则 | 0.00 | 0.00 | 0.00 | 0.00 | 3.51 | 0.05 | 0.59 |
| 冻结初始策略 | 93.72 | 63.91 | 88.00 | 86.75 | 73.35 | 70.68 | 79.40 |
| Trust-Region,
α = 0.05 \\alpha=0.05 α=0.05 |
93.19 | 63.79 | 88.25 | 86.25 | 72.96 | 70.86 | 79.22 |
| EMA,
α = 0.05 \\alpha=0.05 α=0.05 |
94.76 | 65.80 | 88.13 | 85.50 | 73.40 | 70.46 | 79.68 |
无正则的当前策略几乎完全坍塌,平均分只有0.59;冻结教师已经很强,EMA取得最高平均分79.68。
EMA的本质,是为教师和学生创造时间尺度差。设学生参数为
θ
t
\\theta_t
θt,教师参数为
θ
ˉ
t
\\bar\\theta_t
θˉt,可写成:
θ
ˉ
t
=
(
1
−
α
)
θ
ˉ
t
−
1
+
α
θ
t
\\bar\\theta_t =(1-\\alpha)\\bar\\theta_{t-1} +\\alpha\\theta_t
θˉt=(1−α)θˉt−1+αθt
教师缓慢吸收学生的新能力,但不会被一次更新立即改变。这不是简单“自己教自己”,而是“较稳定的历史自己,在更有利的视觉条件下教当前自己”。
六、Top-K Logits蒸馏:密集监督不等于保存完整词表
完整词表上计算教师、学生每个位置的logits差异,内存代价很高。Vision-OPD只保留学生top-
K
K
K logits、对应教师logits,并加入尾部概率项。论文与官方脚本使用
K
=
100
K=100
K=100。
团队声称,在其任务中top-100之外Token的总概率质量通常低于
10
−
13
10^{-13}
10−13。这个统计是特定模型与任务条件下的观察,不能未经验证推广到所有生成任务,但它说明细粒度多选问答的下一Token分布往往高度集中。
表6:Top-K Logits与采样Token目标对比(论文原始Table 6)
| Sampled-token distillation | 93.72 | 61.54 | 86.38 | 85.38 | 76.02 | 68.65 | 78.62 |
| Top-K logits distillation | 94.76 | 65.80 | 88.13 | 85.50 | 73.40 | 70.46 | 79.68 |
采样Token目标只在学生实际采到的Token上使用教师/学生log概率比,近似一个标量优势;Top-K目标保留候选Token之间的相对结构,因此信用分配更丰富。平均分从78.62提升到79.68,尤其ZoomBench提升4.26点。
Rocky认为,这里最值得迁移到其他任务的认知是:答案对错只告诉模型终点,候选分布告诉模型决策边界。 当任务需要学习细微区分时,分布结构往往比单个采样结果更有价值。
七、数据不多为什么能起作用:6.2K样本改变的是条件映射
Vision-OPD只使用6.2K合成训练样本,4B与9B模型均训练1个epoch。官方训练脚本默认batch size 96、每个prompt采样8条rollout、最大prompt 8192 tokens、最大回答1024 tokens、学习率
2
×
10
−
6
2\\times10^{-6}
2×10−6、8张GPU,并开启参数、优化器与参考模型offload。
6.2K看起来很小,但它不是从零教会模型识别物体。模型已经能在区域输入下识别证据,训练要学习的是从全局视觉条件到既有局部能力的映射。换句话说,样本负责校准“该关注哪里、该让哪些Token分布改变”,而不是重新学习整个视觉世界。
这也是“less is more”的真正含义:局部输入更少,却能暴露更干净的能力上限;训练数据不必覆盖所有视觉知识,只要覆盖足够多的区域—全局差异,就可能改善证据路由。
但6.2K不等于方法已经证明极强的数据扩展性。论文没有给出从几百到几十万样本的系统scaling law,也没有披露完整训练FLOPs、wall-clock时间和多随机种子方差。现有证据支持“小规模校准有效”,还不能推出“数据越多必然持续增益”。
八、实验结果:哪些结论站得住,哪些还需要复现
8.1 与公开、闭源和Agentic模型对比
表1:细粒度视觉主结果(论文原始Table 1)
| DeepEyes | 7B | 85.86 | 46.51 | 75.13 | 72.63 | 64.10 | 64.09 | 68.05 |
| Thyme | 7B | 82.20 | 45.09 | 77.00 | 72.00 | 64.80 | 64.59 | 67.61 |
| DeepEyesV2 | 7B | 81.68 | 44.97 | 77.88 | 73.75 | 64.90 | 65.07 | 68.04 |
| SenseNova-MARS | 8B | 92.15 | 47.81 | 83.13 | 78.38 | 67.90 | 68.90 | 73.05 |
| GPT-5.2 | – | 79.06 | 50.89 | 81.12 | 78.38 | 72.60 | 68.80 | 71.81 |
| GPT-5.4 | – | 76.96 | 52.66 | 84.00 | 77.88 | 74.20 | 70.93 | 72.77 |
| Gemini-3.1-Pro | – | 87.96 | 61.18 | 89.63 | 86.88 | 76.53 | 73.31 | 79.25 |
| Gemini-3.5-Flash | – | 89.01 | 61.42 | 89.12 | 86.62 | 75.31 | 73.97 | 79.24 |
| Qwen3.5 | 4B | 84.29 | 47.69 | 84.38 | 80.13 | 63.86 | 63.70 | 70.68 |
| Qwen3.5 | 9B | 82.72 | 52.07 | 85.75 | 80.63 | 71.40 | 67.67 | 73.37 |
| MiMo-VL-RL | 7B | 83.25 | 45.68 | 73.50 | 69.38 | 62.73 | 55.89 | 65.07 |
| Qwen3-VL-Instruct | 8B | 84.82 | 42.96 | 79.63 | 75.25 | 63.19 | 64.61 | 68.41 |
| ZwZ | 8B | 87.96 | 56.69 | 83.63 | 81.75 | 66.57 | 68.09 | 74.12 |
| MiniCPM-V-4.5 | 9B | 70.68 | 42.60 | 69.63 | 61.50 | 62.65 | 61.64 | 61.45 |
| GLM-4.6V | 106B | 86.91 | 50.06 | 82.13 | 78.88 | 65.57 | 65.62 | 71.53 |
| Qwen3-VL-Instruct | 235B | 91.10 | 56.09 | 86.13 | 80.38 | 71.74 | 69.04 | 75.75 |
| Qwen3.5 | 397B | 87.96 | 57.16 | 89.38 | 85.50 | 74.82 | 69.82 | 77.44 |
| Kimi-K2.6 | 1T | 88.48 | 53.14 | 81.88 | 78.00 | 69.22 | 66.13 | 72.81 |
| Vision-OPD | 4B | 92.15 | 59.76 | 84.50 | 80.38 | 74.88 | 70.76 | 77.07 |
| Vision-OPD | 9B | 94.76 | 65.80 | 88.13 | 85.50 | 73.40 | 70.46 | 79.68 |
Vision-OPD-9B的平均分79.68,高于表中的Gemini-3.1-Pro 79.25与Gemini-3.5-Flash 79.24;Vision-OPD-4B平均77.07,也显著高于原始Qwen3.5-4B的70.68。
这些结果支持“区域到全局训练显著改善细粒度视觉任务”。但跨闭源模型比较受版本、评测提示、服务端更新和采样配置影响,属于论文时间点的快照。更可靠的因果证据来自相同Qwen3.5基座、相同数据下的训练方法对照。
8.2 SFT、RLVR、OPSD与Vision-OPD
表2:相同数据与基座下的训练策略对比(论文原始Table 2)
| 4B | Vanilla | 84.29 | 47.69 | 84.38 | 80.13 | 76.67 | 87.13 | 78.53 | 88.28 |
| 4B | SFT Self-Teacher | 78.01 | 54.67 | 79.75 | 76.38 | 78.33 | 85.70 | 68.40 | 87.48 |
| 4B | GRPO | 83.77 | 55.38 | 82.63 | 78.25 | 79.33 | 87.24 | 70.60 | 86.37 |
| 4B | DAPO | 84.82 | 55.74 | 84.00 | 78.00 | 79.33 | 86.95 | 72.27 | 86.62 |
| 4B | OPSD | 85.34 | 53.85 | 82.25 | 79.38 | 78.68 | 87.27 | 75.07 | 88.83 |
| 4B | Vision-OPD | 92.15 | 59.76 | 84.50 | 80.38 | 79.67 | 87.27 | 79.60 | 89.14 |
| 9B | Vanilla | 82.72 | 52.07 | 85.75 | 80.63 | 83.33 | 88.29 | 83.07 | 88.88 |
| 9B | SFT Self-Teacher | 82.20 | 58.46 | 83.50 | 80.25 | 80.67 | 87.97 | 73.33 | 87.47 |
| 9B | GRPO | 85.34 | 57.51 | 86.88 | 83.25 | 81.67 | 87.78 | 73.40 | 87.78 |
| 9B | DAPO | 88.48 | 55.62 | 86.25 | 84.13 | 79.33 | 87.30 | 75.67 | 87.54 |
| 9B | OPSD | 89.53 | 57.51 | 84.00 | 81.25 | 80.67 | 87.45 | 79.13 | 87.48 |
| 9B | Vision-OPD | 94.76 | 65.80 | 88.13 | 85.50 | 83.67 | 88.40 | 83.20 | 89.13 |
SFT提升部分细粒度任务,却在MMStar等holdout任务上明显退化;GRPO、DAPO和OPSD也出现不同程度的保持问题。Vision-OPD在两个基座上同时提高细粒度任务,并维持或小幅改善holdout表现。
这支持论文最重要的对照结论:on-policy状态分布与密集Token监督的组合,比只做离线SFT或只给稀疏结果奖励更适合这个问题。它仍不能证明Vision-OPD对所有领域都不会遗忘,因为holdout只覆盖MMVP、CV-Bench、MMStar和POPE四组视觉任务。
九、关键消融:有效,不代表每个设计都同样重要
9.1 差异函数:JSD略优,但差距不大
表4:Forward KL、Reverse KL与JSD对比(论文原始Table 4)
| Forward KL | 93.19 | 64.02 | 87.88 | 84.13 | 72.83 | 70.17 | 78.70 |
| Reverse KL | 90.05 | 62.72 | 87.88 | 86.00 | 74.60 | 69.92 | 78.53 |
| JSD,
β = 0.5 \\beta=0.5 β=0.5 |
94.76 | 65.80 | 88.13 | 85.50 | 73.40 | 70.46 | 79.68 |
JSD平均分最高,但相对Forward KL只高0.98。这个消融说明JSD是当前设置中的较好默认值,不能把全部增益归因于JSD;更强的因果因素是区域教师、on-policy前缀、稳定教师与密集分布监督的组合。
9.2 Rollout长度:更多Token带来更多监督,但不是免费
表5:生成长度消融(论文原始Table 5)
| 512 Tokens | 91.62 | 64.38 | 88.00 | 86.13 | 72.15 | 69.44 | 78.62 |
| 1024 Tokens | 94.76 | 65.80 | 88.13 | 85.50 | 73.40 | 70.46 | 79.68 |
1024 tokens平均高1.06点。因为目标逐Token计算,更长rollout提供更多监督位置;但训练生成和双策略logit计算也更贵。论文没有给出长度—成本—精度的完整Pareto曲线,因此1024是实验中的有效配置,不是通用最优值。
9.3 区域—全局差距确实在训练中收窄

图5直接追踪模型在同一问题上的区域输入和全图输入差距。4B与9B模型都从约20点差距逐步下降到约10点以内,最终低于图中GPT-5.4和Qwen3.5-397B参考线。
这张图比最终排行榜更接近机制证据:训练优化的指标没有停留在输出分数,而是实际缩小了方法声称要解决的regional-to-global gap。但曲线仍来自团队内部训练过程,缺少多随机种子误差带,外部复现仍然必要。
十、推理效率:单次前向更快,但成本只是被重新分配

在ZoomBench上,Vision-OPD-9B约为2.7 samples/s,DeepEyes约1.8,Thyme和DeepEyesV2约0.9,SenseNova-MARS约0.6。指标定义为平均单样本推理时间的倒数。
结果符合系统直觉:Vision-OPD只进行一次常规推理,不需要反复裁图、图像编码和多轮模型调用。因此它更适合实时与批量任务。
但必须看到成本转移:
- 推理省掉的工具循环,被转化成训练阶段的区域数据构造;
- 每个学生rollout需要教师与学生逐Token分布计算;
- EMA教师、top-K logits和8条rollout增加训练显存与计算;
- 模型只内化训练分布覆盖过的“如何看细节”,开放世界中的未知视觉操作仍可能需要工具。
因此,Vision-OPD不是消灭成本,而是把可重复能力从“每次推理重新支付”变成“训练阶段集中支付”。如果模型会被大量调用,这种一次训练、多次摊销的结构非常有产品价值。
十一、Table 7案例:能力提升来自证据,不是更会编故事

表7:远处船身数字读取案例(论文原始Table 7)
| 问题 | 船上写着哪个数字?选项为10、25、15、5 |
| Qwen3.5-9B | 先判断数字不可见,随后依靠场景常识猜测“5”,答案D |
| Vision-OPD-9B | 判断船头附近写有“15”,答案C |
这个案例揭示的不是Vision-OPD更会推理,而是它更少用语言先验替代视觉证据。基座模型在看不清数字时生成了很长的合理化解释;Vision-OPD则把极小的局部信号送进答案。
当然,单个案例不能证明总体能力,真正证据仍然来自成组基准和对照实验。但它很好地解释了细粒度感知失败为什么会表现成“幻觉”:模型没有读取证据,却用全局语义和常识填补空白。
十二、可复现性:开放程度较高,但完整复现仍有硬成本
截至本文构建时,官方已经公开:
- Apache-2.0代码仓库;
- Vision-OPD-6K数据集;
- Vision-OPD-4B与Vision-OPD-9B权重;
- 数据准备、训练、checkpoint合并与评测脚本;
- 基于verl、FSDP、vLLM的默认训练配置;
- V*、ZoomBench、HR-Bench、MME-RealWorld及holdout任务的评测入口。
这使“跑通官方数据和训练代码”具备现实基础。但完整结果复现仍面临几个问题:
N
=
8
N=8
N=8和双策略分布计算,训练门槛显著高于普通LoRA SFT;
所以这项工作属于“代码、数据、权重均已开放,但完整科学复现仍需较高算力与协议校准”,不能把GitHub可运行等同于所有论文数字可低成本复刻。
十三、Rocky的本质判断:把高频工具行为编译进模型
Vision-OPD最值得长期保留的价值,不是一个细粒度VQA训练配方,而是三个更广泛的判断。
13.1 训练时特权信息,推理时简单路径
训练阶段可以拥有裁剪图、深度、分割、未来帧、检索结果、执行轨迹或验证器;部署阶段却希望一次前向完成任务。只要特权信息能和真实输入建立可学习映射,就可以通过蒸馏把复杂推理链路压回简单策略。
这个思想可以扩展到OCR、遥感、工业缺陷、医疗影像和视频理解:让教师看到更清晰、更局部或更完整的证据,让学生学习在受限输入中恢复教师分布。
13.2 工具调用不是越多越智能
工具的意义是突破模型边界,而不是永久补偿所有可学习缺陷。如果某种crop/zoom行为在大量请求中重复出现,且模式稳定,就有机会被训练内化。产品真正应该问的是:哪些能力必须动态调用工具,哪些能力值得预计算、蒸馏或编译进模型?
上半场奖励“模型会不会调用工具”,下半场会更关注“什么时候不调用工具也能完成任务”。
13.3 自蒸馏的核心不是没有教师,而是教师优势从参数转向条件
传统蒸馏依赖更大模型。Vision-OPD的教师优势来自更好的视觉条件,而不是更大的参数规模。这打开了一种新的能力来源:同一个模型在不同上下文、不同视角、不同工具结果下,可能暴露出明显不同的能力上限。
只要能构造一个privileged context,就可以让模型的“强条件版本”监督“弱条件版本”。教师不必永远更大,但必须在目标信息上更可靠。
十四、对不同角色的实际启示
对多模态算法工程师
不要只提高图像分辨率或Token数量。先测同一个模型在全图、裁剪图、标框图和放大图上的能力差异。如果区域能力显著更强,说明问题可能是证据路由而不是编码器容量。此时privileged-view distillation比盲目扩模更值得验证。
对Agent与推理系统团队
记录高频工具调用轨迹,区分“必须动态搜索”的动作和“可以被模型内化”的动作。前者保留在Agent runtime,后者进入训练数据与蒸馏流程。这样才能让Agent从功能展示走向成本可控的生产系统。
对产品经理
评估视觉模型时,不要只看准确率,还要看单任务模型调用次数、视觉编码次数、端到端延迟和失败重试。一次前向的79分与五次工具循环的79分,在产品成本、吞吐与稳定性上不是同一件事。
对创业者与投资人
视觉Agent工具链本身不一定是长期壁垒。如果高频能力可以被基础模型通过蒸馏吸收,单纯crop/zoom编排会逐渐基础设施化。真正跨周期的资产,是独有的细粒度数据、特权视角构造、质量验证、任务分布与成本闭环。
十五、结语:真正的放大,不只是把像素变大
Vision-OPD从一个简单现象出发:同一个模型看裁剪图比看全图更准。它没有把这个差距仅仅变成一个评测结论,而是把差距本身变成监督信号。
教师看局部,学生看全局;学生走自己的轨迹,教师沿轨迹逐Token纠偏;EMA保持教师稳定,Top-K logits保留分布结构。最终,推理时不再需要重复crop、zoom和视觉编码,模型用一次前向恢复更多局部证据。
它仍然有边界:问题数据使用外部大模型合成,训练计算不低,验证任务集中在细粒度图像问答,开放世界动态视觉搜索尚未被取代。但这些边界并不削弱方法的本质价值。
Rocky认为,真正的“视觉放大”不是简单把像素变大,而是让关键证据在模型内部获得更高决策权重。工具可以帮助模型找到证据,训练则可以让这种寻找方式沉淀成能力。
工具的价值在突破边界,蒸馏的价值在消除重复。能把两者放进同一成本闭环,才是多模态模型从论文能力走向产品能力的关键。
术语与概念速查
| Regional-to-global gap | 同一模型在证据裁剪图上的准确率高于完整图像输入的差距 |
| Privileged information | 训练时可用、部署时不必提供的更强条件,如证据中心裁剪图 |
| On-policy rollout | 由当前学生策略自己生成的回答序列 |
| Exposure bias | 训练依赖正确前缀,而推理依赖自身前缀造成的状态分布错配 |
| Dense token-level supervision | 在每个生成位置匹配教师和学生分布,而非只给整段结果奖励 |
| EMA teacher | 用学生参数的指数滑动平均构成的稳定教师 |
| Top-K logits distillation | 只保留高概率候选Token及尾部质量,近似完整词表分布蒸馏 |
| Thinking-with-Images | 推理时通过裁剪、缩放、搜索等视觉工具反复获取证据 |
| Single forward pass | 不引入额外视觉工具循环的常规模型推理路径 |
推荐阅读
Rocky一直在运营技术交流群(WeThinkIn-技术交流群),这个群的初心主要聚焦于技术话题的讨论与学习,包括但不限于算法、开发、竞赛、科研以及工作求职等。群里有很多人工智能行业的大牛,欢迎大家入群一起学习交流~(请添加小助手微信Jarvis8866,拉你进群~)
1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:
深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解,同时不断跟进补充扩散模型的最新技术发展,希望能给大家带来帮助:
深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
3. 入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
Rocky对AIGC时代“中场时刻”之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解,力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值:
入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
5. 深入浅出完整解析DeepSeek系列核心基础知识
Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析DeepSeek系列核心基础知识
6. 深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
7. 深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
8. 深入浅出完整解析Stable Diffusion(SD)核心基础知识
Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion(SD)核心基础知识
9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析,包括其在传统深度学习中的价值和在AIGC中的价值:
深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
10. 深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
对于AIGC时代中的“ResNet”——LoRA模型,Rocky进行了深入浅出的全面讲解:
深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
11. 深入浅出完整解析ControlNet核心基础知识
AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心,ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。
ControlNet正是让AI图像创作社区无比繁荣的关键一环,它让AIGC图像创作过程更加的可控,更有助于广泛地将AIGC算法解决方案应用到各行各业中:
深入浅出完整解析ControlNet核心基础知识
12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
AI绘画和AI视频是两个互相促进、相互交融的领域,2024年无疑是AI视频领域的爆发之年,Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析:
深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
13. 深入浅出完整解析AIGC时代Transformer核心基础知识
在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统“AI江湖”之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:
深入浅出完整解析AIGC时代Transformer核心基础知识
14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
AIGC创作框架正是AIGC算法工作流的运行载体,目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等。在传统深度学习时代,PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架,到了AIGC时代,Rocky相信ComfyUI就是AIGC时代的“PyTorch”、Stable Diffusion WebUI就是AIGC时代的“TensorFlow”、Diffusers就是AIGC时代的“Caffe”:
深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
在AIGC时代中,如何快速转身,入局AIGC产业?如何成为AIGC/LLM/AI Agent算法/开发工程师?如何在学校中系统性学习AIGC/LLM/AI Agent知识,斩获心仪的AIGC/LLM/AI Agent算法/开发offer?
Don‘t worry,Rocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍,为大家答疑解惑,希望能给大家带来帮助:
手把手教你成为AIGC/LLM/AI Agent算法/开发工程师,斩获AIGC/LLM/AI Agent算法/开发offer!
16. AIGC产业的深度思考与分析
2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。
Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。
那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:
深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)
17. AI算法工程师的独孤九剑秘籍
为了方便大家实习、校招以及社招的面试准备,同时帮助大家提升扩展技术基本面,Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:
【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍(持续更新中)
18. 深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识
GAN系列模型作为传统深度学习时代的最热门生成式Al模型,在AIGC时代继续繁荣,作为Stable Diffusion/FLUX系列大模型的“得力助手”,广泛活跃于AlGC图像创作的产品与工作流中:
深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识

![【Bug已解决】[WebNN][WebGPU EP] Device tensor can not be properly initialized 解决方案-171主机测评](https://www.171host.com/wp-content/uploads/2026/08/20260823213208-6a8b66d855b21-220x150.png)


