
📖标题:PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
🌐来源:arXiv, 2601.15224v1
🌟摘要
估计任务进度需要对长期动态进行推理,而不是识别静态视觉内容。虽然现代视觉语言模型(VLM)擅长描述可见内容,但尚不清楚它们是否能从部分观察中推断出任务进展了多远。为此,我们引入了PROGRESS-BENCH,这是一个系统评估VLM进度推理的基准。除了基准测试之外,我们还通过基于精选数据集PROGRESSLM-45K的无训练提示和基于训练的方法,进一步探索了受人类启发的两阶段进度推理范式。在14个VLM上的实验表明,大多数模型还没有准备好进行任务进度估计,表现出对演示模式和观点变化的敏感性,以及对无法回答的情况的糟糕处理。虽然强制结构化进度推理的无训练提示产生有限且依赖于模型的收益,但基于训练的PROGRESSLM-3B即使在小模型规模上也能实现一致的改进,尽管它是在与评估任务完全脱节的任务集上进行训练的。进一步的分析揭示了特征错误模式,并阐明了进度推理何时以及为何成功或失败。
🛎️文章简介
🔸研究问题:视觉-语言模型(VLM)能否从单个观察中估计任务的进展?
🔸主要贡献:论文介绍了PROGRESS-BENCH基准,用于系统性评估VLM的任务进展推理能力,并探讨了通过训练前的提示和训练后的学习方法来改进进展推理的效果。
📝重点思路
🔸提出了PROGRESS-BENCH基准,包括超过3K的任务进展估计实例,通过控制演示模式、观察视角和可回答性来评估模型的进展推理能力。
🔸任务演示可以是视觉上的关键帧序列或文本上的逐步动作描述,观察样本则是从中抽取的中间帧,通过线性插值来标注进展。
🔸通过训练前的提示,鼓励VLM遵循人类的两阶段进展推理模式:场景回忆和心理模拟。
🔸训练后的模型PROGRESSLM-3B在小模型规模下实现了进展估计的显著改进,显示了显式训练的优势。
🔎分析总结
🔸实验结果表明,大多数VLM在任务进展估计方面表现有限,对演示模式和视角变化非常敏感,难以处理无法回答的场景。
🔸训练前提示的效果有限且依赖于模型,对于大型模型有一定帮助,但对小模型常导致性能下降。
🔸训练后模型PROGRESSLM-3B表现稳定且鲁棒性强,即使在跨视角和文本演示中也能有效估计进展。
🔸不同的模型呈现出不同的错误模式,通过训练前提示和训练后学习可以显著改善这些模式。
💡个人观点
论文揭示了VLM在任务进展估计方面的难点和改进方向,通过显式训练实现了显著的改进。
🧩附录







