
一、文章介绍
酶的准确功能注释是计算生物学中的核心任务,在蛋白质工程、药物发现和生物催化等领域具有直接应用价值。酶委员会(EC)编号系统为酶功能提供了层级化分类标准,但如何从氨基酸序列中准确预测EC编号仍是一个长期挑战。传统方法依赖序列同源性比对,当序列相似性较低或缺乏模板时性能急剧下降。深度学习方法虽然克服了比对依赖,但现有模型往往未能充分利用功能残基(如酶活性位点和催化残基)的空间分布信息,限制了其对酶功能的区分能力。更关键的是,许多方法高度依赖显式的功能位点输入,这严重限制了它们在缺乏先验注释的蛋白质上的适用性和泛化能力。
为突破上述瓶颈,Zihan Luo、Yuhang Liu及其合作者在Genome Biology上发表了题为“GTT-EC: a hierarchical graph transformer framework for enzyme function prediction via functional residue modeling”的研究论文,提出了一个名为GTT-EC的分层图Transformer框架。
GTT-EC的核心创新在于无需显式功能位点注释,即可从序列和预测结构中隐式学习关键功能残基的空间分布。该框架采用“序列嵌入 + 预测结构 → 多层次图编码 → 动态查询解码 → 标签扩散精炼”的完整流程。首先,输入酶序列通过ProtTrans生成残基级序列嵌入,同时通过ESMFold预测3D空间结构。两者融合构建初始酶图——节点和边均初始化为多维空间和生化特征(包括局部坐标系、球坐标方向、距离、扭转角等)。随后,核心的三通路残基图编码器(TPRGE) 对图进行消息传递和特征更新,包含三个互补模块:(1)连续残基注意力卷积(CRAC) 建模功能口袋中相邻残基的局部相互作用;(2)非连续残基交互Transformer(DRIT) 捕获跨远距离结构域的稳定长程依赖;(3)连续残基聚合(CRA) 对非功能残基进行上下文化处理,防止关键功能信号被错误降权。这三个通路通过可学习权重自适应融合,避免任一通路主导。
图编码后,一个基于注意力的解码器利用可学习查询向量与图嵌入交互,生成初始EC概率。关键创新在于解码器同时输出残基级注意力权重,支持对功能区域的可解释分析——即使模型未接受任何活性位点监督,其高注意力残基也能与已知功能注释高度吻合。最后,标签扩散模型通过Diamond构建同源性网络,在测试时精炼初始预测。
在NEW-392独立测试集上,GTT-EC的Micro-F1达0.645(优于Graph-EC的0.566和CLEAN的0.611),AUC达0.968。在序列相似性聚类(50%/70%/90%)和严格域感知过滤(0.300-0.600阈值)等抗同源性偏倚测试中,GTT-EC始终保持最优或领先性能。在结构扰动(添加σ=0.15Å的高斯噪声)和pLDDT分层(高置信度>82 vs 低置信度<82)实验中,模型表现稳健,低置信度结构上甚至表现更优——表明DRIT、CRAC和CRA模块可通过深度序列表示补偿结构预测误差。在可解释性分析中,GTT-EC在代表性酶上识别出88.89%的已知功能位点,证明其学习的是生物学有意义的结构-功能关系而非表面序列特征。
二、算法原理介绍

GTT-EC的算法设计围绕“多层次图编码 → 动态查询解码 → 同源性标签扩散”三个核心层次展开。
(一)三通路残基图编码器(TPRGE)。 节点更新动态整合三个互补模块。DRIT模块基于Transformer自注意力建模长程依赖:Gil+1=LayerNorm(Gil+Dropout(∑j∈NiαijT(WvGjl+Weeij)))G_i^{l+1} = \\text{LayerNorm}(G_i^l + \\text{Dropout}(\\sum_{j\\in N_i}\\alpha_{ij}^T(W_vG_j^l + W_e e_{ij})))Gil+1=LayerNorm(Gil+Dropout(∑j∈NiαijT(WvGjl+Weeij))),注意力系数αijT\\alpha_{ij}^TαijT由查询-键-边特征共同计算,使非连续残基能通过多条传播路径交互。CRAC模块专注局部邻域:Lil+1=LayerNorm(Lil+Dropout(∑j∈NiβijWLjl))L_i^{l+1} = \\text{LayerNorm}(L_i^l + \\text{Dropout}(\\sum_{j\\in N_i}\\beta_{ij}W L_j^l))Lil+1=LayerNorm(Lil+Dropout(∑j∈NiβijWLjl)),βij\\beta_{ij}βij通过LeakyReLU和可学习参数ψ\\psiψ计算局部注意力,避免全局注意力的噪声。CRA模块使用固定聚合权重的图卷积:Ail+1=LayerNorm(Ail+Dropout(∑j∈Ni1deg(i)deg(j)WAjl))A_i^{l+1} = \\text{LayerNorm}(A_i^l + \\text{Dropout}(\\sum_{j\\in N_i}\\frac{1}{\\sqrt{\\deg(i)\\deg(j)}} W A_j^l))Ail+1=LayerNorm(Ail+Dropout(∑j∈Nideg(i)deg(j)1WAjl)),捕获非功能区域结构模式并防止过拟合。三通路输出通过可学习权重归一化融合:vil+1=w0Gil+1+w1Lil+1+w2Ail+1v_i^{l+1} = w_0G_i^{l+1} + w_1L_i^{l+1} + w_2A_i^{l+1}vil+1=w0Gil+1+w1Lil+1+w2Ail+1,wk=exp(γk)/∑exp(γj)w_k = \\exp(\\gamma_k)/\\sum\\exp(\\gamma_j)wk=exp(γk)/∑exp(γj)。边更新使用EdgeMLP:eijl+1=eij+EdgeMLP(vil+1∣∣eijl∣∣vjl+1)e_{ij}^{l+1} = e_{ij} + \\text{EdgeMLP}(v_i^{l+1}||e_{ij}^l||v_j^{l+1})eijl+1=eij+EdgeMLP(vil+1∣∣eijl∣∣vjl+1)。全局交互通过门控机制聚合:vil+1=vil+1′⋅δ(GateMLP(AvgAgg{vjl+1′}))v_i^{l+1} = v_i^{l+1'} \\cdot \\delta(\\text{GateMLP}(\\text{AvgAgg}\\{v_j^{l+1'}\\}))vil+1=vil+1′⋅δ(GateMLP(AvgAgg{vjl+1′}))。
(二)注意力解码器与残基权重提取。 编码器输出VencoderV_{\\text{encoder}}Vencoder与可学习查询向量QQQ(捕获活性位点功能模式)输入解码器:output=Softmax(Linear(Decoder(Vencoder,Q)))\\text{output} = \\text{Softmax}(\\text{Linear}(\\text{Decoder}(V_{\\text{encoder}}, Q)))output=Softmax(Linear(Decoder(Vencoder,Q)))。解码器多层堆叠中,查询向量与残基表示反复交互,产生EC预测。可解释性分析中,最终层的注意力权重跨头平均作为残基重要性评分,将模型预测直接与结构生物学原理关联。
(三)同源性标签扩散精炼。 测试时,用Diamond将测试蛋白与训练蛋白比对构建同源性网络W∈Rd×dW\\in\\mathbb{R}^{d\\times d}W∈Rd×d,引入加权Jaccard指数Sij=∑kWikWjk∑kWik+∑kWjk−∑kWikWjkS_{ij} = \\frac{\\sum_k W_{ik}W_{jk}}{\\sum_k W_{ik} + \\sum_k W_{jk} – \\sum_k W_{ik}W_{jk}}Sij=∑kWik+∑kWjk−∑kWikWjk∑kWikWjk反映共享邻居。对每个EC编号ttt,优化目标函数J(Ft)=∑i(Fit−Yit)2+λ2∑i1di∑jSijWij(Fit−Fjt)2J(F_t) = \\sum_i (F_{it}-Y_{it})^2 + \\frac{\\lambda}{2}\\sum_i \\frac{1}{d_i}\\sum_j S_{ij}W_{ij}(F_{it}-F_{jt})^2J(Ft)=∑i(Fit−Yit)2+2λ∑idi1∑jSijWij(Fit−Fjt)2,其闭式解为F=(I+λL)−1YF = (I + \\lambda L)^{-1}YF=(I+λL)−1Y,LLL为归一化拉普拉斯矩阵。该过程强化同源性网络中邻居节点的标签一致性,精炼初始概率估计。
三、总结
GTT-EC是一个基于分层图Transformer的酶功能预测框架,通过三通路残基图编码器(DRIT长程依赖 + CRAC局部交互 + CRA结构上下文)从序列和ESMFold预测结构中学习判别性表征,无需显式功能位点输入即可通过注意力解码器隐式识别关键催化区域,并通过同源性标签扩散精炼预测。其核心创新在于:以多尺度图架构捕捉功能残基空间分布,将序列、结构和演化信息融合为可解释的残基级注意力,既提升了EC预测精度,又提供了生物学有意义的分子解释。GTT-EC在NEW-392数据集上达到0.645的Micro-F1和0.968的AUC,在序列同源性降低和结构预测噪声下保持鲁棒,并准确识别已知功能位点(如A0A1D8PLI2中88.89%准确率),为酶功能注释提供了可解释且无需先验位点标注的通用框架。


