ShaRP 论文总结与核心部分翻译
一、文章主要内容
该研究聚焦视频大型语言模型(VLLMs)预填充阶段的高计算负载问题,核心挑战是浅层解码器层的视觉令牌剪枝易导致性能大幅下降。现有基于注意力的剪枝方法虽能识别相关令牌,但受位置编码偏差、信息交互不足等因素限制,难以在高压缩率下保持稳定性能。
为此,作者提出无训练剪枝框架 ShaRP(SHallow-LayeR Pruning),通过三大核心模块解决上述问题:
实验在 MVBench、LongVideoBench 等四大视频理解基准上验证,ShaRP 在 LLaVA-OneVision 和 Qwen2-VL 两种模型上均表现优异,即使在 10% 令牌保留率的高压缩场景下,仍能保持 97% 以上的原始模型性能,且推理速度提升 2.2-3.0 倍,同时具备跨模型兼容性和与现有剪枝框架的集成能力。



