文章总结与翻译
一、主要内容
本文核心是建立Transformer中的自注意力机制与结构因果模型(SCM)的关联,提出基于注意力的因果发现方法(ABCD)和因果解释算法(CLEANN),并在情感分类和推荐系统任务中验证有效性。
核心关联建立:将自注意力机制解释为一种对输入序列符号间结构因果模型(SCM)的估计机制,且该解释在存在潜在混杂因素时仍成立。自注意力层输出的协方差矩阵与线性高斯SCM中内生变量的协方差矩阵具有等价性,注意力矩阵A可类比于SCM中描述变量间总效应的矩阵。
因果发现方法(ABCD):基于上述关联,利用预训练Transformer最深层注意力矩阵计算偏相关系数,通过约束型因果发现算法(如ICD)学习单个输入序列的因果结构等价类(以部分祖先图PAG形式呈现),实现零样本因果发现。
因果解释算法(CLEANN):基于ABCD学到的因果图,提取对模型预测结果具有决定性作用的最小输入符号集合(最小解释集),并通过掩盖该集合验证其有效性(即产生替代预测),解决了传统注意力解释忽略条件独立性和潜在混杂因素的问题。
实证验证:在IMDB情感分类(使用BERT模型)和MovieLens推荐系统(使用BERT4Rec模型)任务中,CLEANN相比纯注意力(Pure-Attention)、智能注意力(Smart-Attention)等基线方法,能找到更小、更精准的解释集,且替代预测更符合原始推荐排序逻辑。