论文题目:Fake News Detection on Social Media using Geometric Deep Learning(基于几何深度学习的社交媒体假新闻检测)
arXiv:arXiv:1902.06673 -Fabula AI
摘要:如今,社交媒体因其低成本、易获取和快速传播而成为全球数百万人的主要新闻来源之一。然而,这是以令人怀疑的可信度为代价的,也是以暴露于故意误导读者的假新闻的巨大风险为代价的。自动检测假新闻带来了挑战,挑战了现有的基于内容的分析方法。其中一个主要原因是,对新闻的解读往往需要政治或社会背景或常识的知识,而目前的自然语言处理算法仍然缺乏这些常识。最近的研究经验表明,假新闻和真新闻在社交媒体上的传播方式不同,形成了可以用于自动假新闻检测的传播模式。与基于内容的方法相比,基于传播的方法具有多方面的优势,其中包括语言独立性和对对手攻击的更好的弹性。本文提出了一种新的基于几何深度学习的自动假新闻检测模型。基本的核心算法是经典卷积神经网络到图的推广,允许融合不同类型的数据,如内容、用户简档和活动、社交图和新闻传播。我们的模型在Twitter上传播的新闻故事上进行了训练和测试,这些故事得到了专业的事实核查机构的验证。我们的实验表明,社交网络结构和传播是实现高准确率(92.7%ROC AUC)假新闻检测的重要特征。其次,我们观察到,假新闻在传播几个小时后,就可以在早期阶段可靠地被发现。第三,在时间上分离的训练数据和测试数据上测试模型的老化程度。我们的结果表明,基于传播的假新闻检测方法有望成为基于内容的方法的替代或补充策略。
用图神经网络识别假新闻:一篇来自 Fabula AI 的开创性工作
一、背景:假新闻为什么难检测?
社交媒体让新闻的传播速度和覆盖面达到了前所未有的高度,数以亿计的用户每天从 Twitter、Facebook 等平台获取信息。然而,这把双刃剑的另一面是:虚假信息、蓄意误导的"假新闻"同样可以以极低的成本快速扩散,对民主选举、公共卫生、金融市场等领域造成深远影响。2016 年美国总统大选和英国脱欧公投前后,假新闻的大规模传播已被视为左右舆论的重要因素。
已有方法的局限性
学术界对假新闻检测的研究可以分为三大类:
基于内容(Content-based):分析文章的词汇、句法、写作风格等语言特征。这类方法最为主流,但有两个致命弱点:① 精心伪造的假新闻在文字上与真实新闻几乎没有区别,很难被语言模型识破;② 语言特征天然具有语种依赖性,一个在英文上训练的模型很难直接迁移到中文或法文场景。
基于社会背景(Social context-based):利用用户画像(年龄、性别、政治倾向)和社交关系结构(关注/被关注关系)。这类特征提供了一定的辅助信号,但孤立来看判别力有限。
基于传播模式(Propagation-based):研究新闻在社交网络上的扩散过程。已有实证研究(如 Vosoughi et al., Science 2018)表明,真假新闻的传播模式存在显著差异。传播特征的优势在于:① 语种无关,不依赖文字本身;② 普通用户几乎无法人为控制一条新闻的传播拓扑结构,因此对对抗性攻击具有天然的抵抗力。
然而,已有传播方法大多依赖"手工设计"的图论特征(如中心性、团、连通分量),这些特征过于通用,不一定对假新闻检测任务有针对性。
二、论文提出的核心问题
本文明确提出并试图回答以下三个科学问题:
三、创新点:几何深度学习 + 异构数据融合
3.1 核心思路
本文的核心创新在于将几何深度学习(Geometric Deep Learning),具体是图卷积神经网络(Graph CNN),应用于假新闻检测任务。
传统 CNN 工作在规则的欧氏空间(如图片的像素网格)。而社交网络天然是图结构——用户是节点,关注关系是边,新闻传播则形成一棵棵扩散树(cascade)。图卷积网络将经典卷积操作推广到图上,通过在每个节点的邻域上做局部的、置换不变的聚合操作来学习节点特征,天然适合处理这类非欧氏结构数据。
3.2 图的构建方式(Input Generation)
对于每一个新闻 URL u,作者将与其相关的所有推文集合
组织成一张图
:
- 节点:每条推文(及其作者)
- 边:满足以下任意一条即连边:① i 的作者关注 j 的作者;② j 的作者关注 i 的作者;③ 新闻从 i 传播到 j;④ 新闻从 j 传播到 i
传播路径(扩散树)的估计方式参考 Vosoughi et al.:若转推者关注了之前的某位推文者,则从最近被关注的那条推文处开始计算传播;若没有关注关系,则保守地从粉丝数最多的前序用户处计算。
3.3 节点与边的特征
节点特征涵盖四大类:
| 用户画像 | 地理位置、语言、账号创建时间、是否认证、个人描述词向量(GloVe 200维) |
| 用户活动 | 收藏数、列表数、状态数 |
| 网络与传播 | 粉丝数、关注数、转推时间戳、来源设备、回复/引用/收藏/转推数量、扩散树结构 |
| 内容 | 推文文本词向量(GloVe 200维)、话题标签 |
边特征编码了四种关系的成员关系(关注正向/反向、传播正向/反向),并在图注意力的投影层与节点特征拼接,使模型能对不同类型的连接赋予不同权重。
3.4 模型架构

【论文 Figure 5:模型架构图(GC-GC-MP-FC-FC-SM)】
模型是一个四层图 CNN:
- 两层图卷积层(Graph Convolution, GC):每层输出 64 维特征图,使用单头图注意力(GAT)实现滤波器
- 一层均值池化(Mean Pooling, MP):对所有节点的特征取均值,将图级表示压缩
- 两层全连接层(FC):分别输出 32 维和 2 维特征
- SoftMax 层(SM):输出真/假概率
激活函数全程使用 SELU(Scaled Exponential Linear Unit),损失函数选用 Hinge Loss(作者在早期实验中发现其表现优于交叉熵)。
四、数据集:严格标注的大规模 Twitter 传播数据
数据收集是本文的另一大贡献,过程严格且耗时。
数据来源:Snopes、PolitiFact、Buzzfeed 三家知名事实核查机构
标注流程:
数据规模(涵盖 2013年5月 至 2018年1月):
| 已标注声明 | 1,084 条 |
| 传播链(cascades) | 158,951 条 |
| 唯一用户数 | 202,375 人 |
| 社交图边数 | 2,443,996 条 |
| URL 数量 | 1,129 个 |
| 平均每条声明对应 URL 数 | ~1.04 |

【论文 Figure 2:传播链大小(推文数)的分布直方图】

【论文 Figure 3:930 个 URL 的传播链数量分布(长尾分布),前 15 个 URL(约 1.5%)贡献了 20% 的传播链】(没看懂这个配图我说实话)
值得注意的是,传播链的平均大小仅为 2.79 条推文,大量传播链非常小,这为模型设计带来了挑战。
可信度与极化现象:作者为每位用户计算了一个可信度分数(范围 $[-1, +1]$),定义为该用户转发真假新闻的比例之差。通过 Fruchterman-Reingold 力导向算法对社交图进行布局后,发现可信用户(蓝色)和不可信用户(红色)形成了两个明显分离的社区——这与社会学中"回音室"理论相符。

【论文 Figure 4:Twitter 用户网络的可信度分布可视化,蓝色=可信,红色=不可信】
五、实验结果
5.1 主要性能(URL 级别 vs. Cascade 级别)
作者设计了两种检测场景:
- URL 级别(URL-wise):利用一个 URL 产生的所有传播链(平均约 141 条)预测该 URL 对应的新闻真假。使用 5 折随机交叉验证,训练/测试/验证集平均包含 677/226/226 个 URL,正负比约 83%:17%。
- Cascade 级别(Cascade-wise):仅利用单条传播链预测,难度显著更高。使用相同的数据划分,只保留至少含 6 条推文的传播链,训练/测试/验证集平均包含 3586/1195/1195 条传播链。
结果(24 小时完整传播数据):
| URL 级别 | 92.70% ± 1.80% |
| Cascade 级别 | 88.30% ± 2.74% |

【论文 Figure 6:URL 级别(蓝)和 Cascade 级别(红)的 ROC 曲线(5 折均值及标准差阴影)】

【论文 Figure 7:最后一层图卷积层节点特征的 t-SNE 可视化,蓝=可信用户,红=不可信用户,呈现清晰的聚类结构】
5.2 消融实验:哪类特征最重要?
作者通过逆向特征选择(backward feature selection)进行消融实验,逐步从输入中去除不同类别的特征,结果如下:
- 用户画像和网络与传播是最重要的两类特征,仅凭这两类就能达到接近 90% ROC AUC
- 在 Cascade 级别,去掉推文内容特征后性能反而提升了 4%——原因是 20% 的传播链集中在前 15 个 URL,相同 URL 下的推文内容高度相似,容易引发过拟合

【论文 Figure 9:消融实验结果,URL 级别(上)和 Cascade 级别(下)的 ROC AUC,特征组从左到右按重要性排列】
5.3 最小传播链大小的影响
传播链越小,包含的扩散模式信息越少。作者测试了不同最小传播链阈值对性能的影响,发现:
- 性能随传播链规模增大而提升
- 当传播链至少包含 6 条推文时性能饱和(共留下 5,976 条样本)
这也是正式实验中选取 6 条推文作为阈值的依据。

【论文 Figure 8:Cascade 级别性能(Mean ROC AUC)随最小传播链大小阈值的变化曲线】
5.4 早期检测能力:新闻传播多久才能被检测?
这是本文最具实用价值的实验之一。作者将传播链按时间截断,从 0 小时(仅初始推文)到 24 小时,每隔 1 小时训练一个独立模型,观察性能变化:
关键发现:
- 仅约 2 小时的传播就能在 URL 级别达到 90% 以上的 ROC AUC
- URL 级别性能在约 15 小时后趋于饱和(此时已覆盖约 86% 的传播链规模)
- Cascade 级别性能在约 7 小时后饱和(此时已覆盖约 91% 的传播链规模)
- 从 0 小时到 ≥1 小时有一个显著的性能跳升,说明传播结构特征(而非单纯的用户/内容特征)是关键信号

【论文 Figure 10:URL 级别(上)和 Cascade 级别(下)的 ROC AUC 随传播时长(小时)的变化曲线,横轴上方标注了对应的平均推文数】
5.5 模型老化测试:历史模型对未来数据还有效吗?
作者模拟了真实部署场景:用历史数据训练,在未来的新数据上测试,考察性能如何随时间衰减。
- 训练集和测试集按时间先后分割(80%/20%),测试集按时间窗口滑动评估
- URL 级别:模型在训练集与测试集相差约 180 天后才出现轻微的性能下降
- Cascade 级别:模型表现更为鲁棒,在 260 天后仅下降约 4%
Cascade 级别模型更鲁棒的原因:单条传播链的图结构更简单,模型不得不学习更通用的特征,这些特征反而具有更好的时间稳定性。

【论文 Figure 11:URL 级别(上)和 Cascade 级别(下)的 ROC AUC 随训练集与测试集平均日期差距(天)的变化,包含三条曲线:24小时传播(蓝实线)、0小时传播(橙虚线)、标准5折交叉验证(绿线)】
六、总结与局限性
主要贡献
| 方法创新 | 首次将几何深度学习(图卷积+图注意力)系统性地应用于假新闻检测,实现异构数据(用户、内容、传播结构)的端到端融合 |
| 数据贡献 | 构建了跨越 5 年(2013–2018)、含 158,951 条传播链的高质量标注数据集 |
| 早期检测 | 证明仅需约 2 小时的传播数据就可达到 90%+ ROC AUC,具有很强的实用价值 |
| 时间鲁棒性 | 模型在训练与测试间隔半年以上仍保持良好性能,具备实际部署的可行性 |
局限性与未来方向
作者坦诚地指出了若干值得继续探索的方向:
- 语言/地域无关性:论文假设传播特征是语种无关的,但实验均在英文 Twitter 数据上进行,跨语言/跨平台的泛化能力尚未验证
- 对抗攻击:基于图的方法理论上需要操控整个社交网络拓扑才能实施攻击,具有天然优势,但这一猜想还需严格的实验验证
- 内容特征的正则化:cascade 级别实验去掉内容特征后性能反而提升,提示当引入内容特征时需要加入 dropout 或权重衰减等正则化手段
- 更广泛的应用:作者期待将同一框架迁移到新闻主题分类、信息传播预测等其他社交网络分析任务
七、一句话评价
这篇论文的价值在于它优雅地将一个社会问题(假新闻检测)转化为一个图学习问题,并通过严谨的实验体系——消融分析、早期检测、时间泛化——全面回答了"这个方法是否真的管用"的问题。对于任何关注图神经网络应用或信息可信度研究的读者来说,它都是一篇值得精读的参考文献。







