欢迎光临
我们一直在努力

百度:构建物理现实文档解析基准

在这里插入图片描述

📖标题:Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild
🌐来源:arXiv, 2603.04205v1

🌟摘要

虽然视觉语言模型(VLMs)在OmniDocBench等数字文档基准测试中获得了近乎完美的分数,但由于缺乏受控但现实的评估,它们在不可预测的物理世界中的表现在很大程度上仍然未知。我们引入了Real5OmniDocBench,这是第一个在五个关键的现实世界场景中对整个OmniDocBench v1.5(1,355张图像)执行全面、一对一物理重建的基准测试:扫描、变形、屏幕摄影、照明和倾斜。与之前缺乏数字对应或使用部分采样的基准测试不同,我们的完整地面实况映射首次能够严格按因素对性能下降进行归因——使我们能够查明故障是源于几何扭曲、光学伪影还是模型限制。我们的基准为社区建立了一个具有挑战性的新标准,表明文档解析中的“现实差距”远未缩小,并提供了一个诊断工具来指导开发真正有弹性的文档智能。

🛎️文章简介

🔸研究问题:如何系统评估视觉语言模型在真实物理场景下的文档解析鲁棒性?
🔸主要贡献:论文提出了首个全尺度、一对一物理重建的文档解析基准Real5-OmniDocBench,覆盖扫描、形变、屏摄、光照和倾斜五大现实干扰因素,支持因果归因式性能退化分析。

📝重点思路

🔸基于OmniDocBench v1.5的1355张数字图像,严格一对一生成5类共6775张物理实拍样本,完整继承原始JSON标注,确保数字-物理域可比性。
🔸采用专业级打印(1200dpi)与多品牌移动设备异构采集,覆盖纸张纹理、ISP噪声、镜头畸变等真实硬件差异。
🔸将五大场景细分为25种子条件(如Warping含折叠/卷曲/书脊弧度等),实现正交化、可分解的物理扰动建模。
🔸设计多粒度评测协议:沿用OmniDocBench的NED、CDM、TEDS等指标,分文本、公式、表格、阅读顺序四维度诊断失败模式。
🔸建立模型准入机制:仅对在数字基准上复现官方结果的模型开放物理测试,保障评估严谨性。

🔎分析总结

🔸所有模型在物理场景下均显著退化,证实“数字高分≠现实可用”,揭示了当前VLMs存在巨大现实鸿沟。
🔸参数规模与物理鲁棒性无强相关性:0.9B的PaddleOCR-VL-1.5在五类场景中全面超越235B的Qwen3-VL,说明领域先验比单纯缩放更关键。
🔸几何扰动(Warping/Skew)比光学扰动(Illumination/Screen-Photography)更具破坏性,尤其导致传统pipeline工具阅读顺序错误率飙升。
🔸专用模型通过多任务训练与光照/形变增强,在结构保真度(TEDS、ROE)上优势明显,验证了领域定制化架构的有效性。
🔸Skew场景中大角度透视导致“线压缩”效应,暴露多数模型缺乏3D空间映射能力,ROE成为最敏感失效指标。

💡个人观点

论文将不可控的物理退化转化为可控实验变量,实现“故障归因到具体扰动类型”的诊断能力。

🧩附录

在这里插入图片描述

赞(0)
未经允许不得转载:171主机测评 » 百度:构建物理现实文档解析基准
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址