欢迎光临
我们一直在努力

论文介绍|Bridging the Gap Between Ideal and Real-world Evaluation

前言:本篇博客介绍本人参与的一项关于 AI 生成图像检测评测的研究工作,相关论文已被 ICCV 2025 录用。随着生成模型的快速发展,越来越多检测方法在标准数据集上取得了接近甚至超过 99% 的准确率。然而,这些数字是否真正反映了模型在现实世界中的可靠性,仍然值得重新审视。本文将围绕这一问题,讨论我们为何需要重新思考 AI 生成图像检测的评测方式。

当“检测准确率 99%”不再值得骄傲:我们为什么重新思考 AI 生成图像检测的评测方式


过去几年里,AI 生成图像的检测研究取得了令人瞩目的进展。在很多公开数据集上,检测模型的准确率已经接近甚至超过 99%。这些数字,真的反映了现实世界中的检测能力吗?

一个被忽视的事实:现实世界从不“干净”

在现有主流评测中,测试图像通常是“理想状态”的:

  • 原始分辨率
  • 无多次压缩
  • 未经过社交平台传播
  • 没有被打印、拍照、扫描或投屏再拍

但现实世界并不是这样。真实场景中,一张图片大概率是:

  • 被反复转发在 微信、Telegram、Instagram、X 等平台
  • 经历多轮压缩、分辨率缩放、色彩偏移
  • 或者干脆是 打印后再拍照、投影后再拍、扫描件

我们发现:一旦这些因素出现,很多“高性能检测器”会迅速失效。

这正是我们想要系统性回答的问题:当前 AI 生成图像检测方法,在真实世界条件下,到底还剩下多少能力?

评测维度

核心思想一:评测不该只看“图像来源”,还要看“图像经历了什么”

因此,我们提出了 RRDataset / RRBench,其设计不是为了“再做一个更大的数据集”,而是明确围绕真实世界鲁棒性展开,包含三条关键维度:

在这里插入图片描述

1️⃣ 多场景(Scenario Generalization)

现有主流数据集主要聚焦于低风险的日常生活场景,这在一定程度上掩盖了检测模型在高敏感语境下的真实表现。然而,在实际应用中,风险最高的往往是涉及公共安全、社会秩序与公共健康的图像内容。基于这一考虑,我们在 RRDataset 中系统性引入了 6 类高风险场景,并保留日常场景用于对照分析,包括:

  • 战争与冲突
  • 灾难与事故
  • 政治与社会事件
  • 医疗与公共健康
  • 文化与宗教
  • 劳动与生产

这些场景通常具有更高的社会敏感性和更强的现实影响力,一旦出现误判,更容易放大不确定性,进而引发对图像真实性的广泛质疑,形成潜在的社会信任危机。

在这里插入图片描述

2️⃣ 网络传播鲁棒性(Internet Transmission)

不同于常见的人工压缩或参数化退化设置,我们通过真实社交平台构建图像传播过程,系统性地引入跨平台、多轮转发与多路径传播等因素。实验结果表明,许多检测模型在理想输入条件下取得的高性能,难以在真实传播场景中维持。

3️⃣ 再数字化鲁棒性(Re-digitization)

这是我们认为在现有研究中被长期严重低估的一类因素。在现实应用中,人们经常面对的并非原始数字图像,而是诸如:

  • 扫描得到的报纸或文件图片
  • 拍摄屏幕所获得的图像
  • 拍摄投影内容形成的照片

通过对四种常见再数字化方式的系统性测试,我们发现:对于大量现有检测方法而言,再数字化所带来的性能退化甚至比网络传播更加显著。

在这里插入图片描述

核心思想二:不仅评测模型,也要评测“人”

除了对 17 个检测模型和 10 个视觉语言模型的系统评测,我们还构建了目前规模最大的 人类 AI 生成图像检测基准。该基准涵盖来自不同背景的 192 名参与者,测试内容同时包含原始图像、网络传播图像以及再数字化图像,并采用 两阶段测试结合 few-shot 学习 的评测流程。

实验结果表明,在传播与再数字化等复杂条件下,人类的判断同样会受到显著干扰。然而,仅在观察两个示例之后,参与者对传播图像和再数字化图像的识别能力便出现了明显提升。这一现象揭示了一个关键差异:当前检测模型普遍缺乏人类在面对新型退化模式时所表现出的快速适应能力。

一个令人警惕的发现:我们正在进入“全面不信任”的时代

在问卷的最后阶段,我们要求参与者回答一个问题:

“当你无法判断一张图像是真实拍摄还是 AI 生成时,你更倾向于作出哪种判断?”

结果值得高度警惕。在日常场景中,约 70% 的参与者更倾向于将图像判断为 AI 生成;而在高风险场景中,这一比例进一步上升,接近 90%。

这一现象表明,在当前技术背景下,即使是真实影像,也可能被默认置于“伪造”的怀疑之中。这一问题已不再局限于检测算法本身,而是逐渐演变为关乎视觉信息可信度的社会性信任问题。


综上,这项工作的出发点并不仅仅是对现有方法作简单的优劣评判,而是希望重新审视 AI 生成图像检测究竟应当如何被评测、被理解、以及被推进。我们想强调三点核心共识:

  • 高准确率并不等价于真实世界中的可靠性,脱离实际传播与使用环境的性能指标,可能会带来过度乐观的判断。如果忽视传播链路、再数字化过程以及语境复杂性,检测模型在真实世界中的部署风险,可能远高于离线评测所呈现的结果。
  • 评测基准本身会深刻影响研究方向的演化,如果评测未能覆盖真实世界中的关键干扰因素,模型能力的提升也可能停留在“理想条件”之下。
  • 人类在复杂退化条件下展现出的快速适应能力,为下一代更具鲁棒性的检测方法提供了重要启发。

我们希望这项工作能够推动该领域的研究重心从“在标准数据集上取得更高分数”,转向“在真实世界中经得起考验”,并以更加贴近实际应用的评测范式,促进 AI 生成图像检测研究的长期健康发展。

赞(0)
未经允许不得转载:171主机测评 » 论文介绍|Bridging the Gap Between Ideal and Real-world Evaluation
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址