欢迎光临
我们一直在努力

ShaRP: SHAllow-LayeR Pruning for Video Large Language Models Acceleration

ShaRP 论文总结与核心部分翻译

一、文章主要内容

该研究聚焦视频大型语言模型(VLLMs)预填充阶段的高计算负载问题,核心挑战是浅层解码器层的视觉令牌剪枝易导致性能大幅下降。现有基于注意力的剪枝方法虽能识别相关令牌,但受位置编码偏差、信息交互不足等因素限制,难以在高压缩率下保持稳定性能。

为此,作者提出无训练剪枝框架 ShaRP(SHallow-LayeR Pruning),通过三大核心模块解决上述问题:

  • 段感知因果掩码(SegM):将视频划分为语义一致的片段,限制注意力在片段内交互,缓解注意力崩溃;
  • 位置偏差校准(PosC):通过输入纯黑帧估计位置编码偏差,从注意力分数中剔除偏差影响,使注意力分布更贴合语义相关性;
  • 寄存器令牌去重(RegD):通过预过滤、去重、后填充三步流程,消除相邻帧或相似背景中的冗余令牌,同时补充上下文代表性令牌。
  • 实验在 MVBench、LongVideoBench 等四大视频理解基准上验证,ShaRP 在 LLaVA-OneVision 和 Qwen2-VL 两种模型上均表现优异,即使在 10% 令牌保留率的高压缩场景下,仍能保持 97% 以上的原始模型性能,且推理速度提升 2.2-3.0 倍,同时具备跨模型兼容性和与现有剪枝框架的集成能力。

    二、创新点

  • 揭示浅层剪枝失效关键因素:首次明确注意力崩溃、位置编码偏差、寄存器令牌冗余是限制浅层解码器注意力剪枝效果的三大核心问题;
  • 无训练通用框架设计:提出 plug-a
  • 赞(0)
    未经允许不得转载:171主机测评 » ShaRP: SHAllow-LayeR Pruning for Video Large Language Models Acceleration
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址