欢迎光临
我们一直在努力

2025_NIPS_In the Eye of MLLM: Benchmarking Egocentric Video Intent Understanding with Gaze-Guided Pr

文章总结与翻译

一、主要内容

本文聚焦于第一视角视频(egocentric videos)场景下,多模态大语言模型(MLLMs)对用户意图的理解问题,核心围绕以下内容展开:

  • 现有研究缺口:现有基准测试多基于第三人称视频,且忽略了凝视(gaze)作为用户注意力和意图直接指标的关键作用,导致MLLMs难以准确解读第一视角视频中的用户空间、时间及因果意图。
  • 基准测试集构建:提出EgoGazeVQA基准测试集,整合Ego4D、EgoExo4D、EGTEA Gaze+三大数据集的第一视角视频与眼动追踪数据,通过MLLM生成问答对并经人工标注优化,最终包含913个视频、1757个问答对,涵盖生活场景(客厅、厨房等)和活动类型(烹饪、游戏等)。
  • 凝视引导提示策略:设计三种凝视信息融入方式——文本提示(GazeT,将凝视坐标作为文本输入)、视觉提示(GazeV,在视频帧标记凝视点)、序列凝视显著性图提示(GazeS,生成凝视轨迹热力图),以增强模型对意图的理解。
  • 实验与分析:在7个主流MLLMs上验证,结果表明凝视引导策略能显著提升模型性能(尤其大型模型如Qwen2.5-VL-72B),但仍与人类表现存在差距;复杂场景(如厨房)对模型挑战较大,LoRA微调可进一步提升模型利用凝视信息的能力。
  • 二、创新点

  • 首个凝视引导的第一视角视频意图问答基准
  • 赞(0)
    未经允许不得转载:171主机测评 » 2025_NIPS_In the Eye of MLLM: Benchmarking Egocentric Video Intent Understanding with Gaze-Guided Pr
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址