欢迎光临
我们一直在努力

浙大周展等:突破性通用型蛋白质结合位点预测

摘要

精准识别蛋白质结合位点,对解析蛋白质功能、阐释分子识别机制以及指导药物研发至关有效。现有基于序列的预测工具大多仅针对单一类型结合位点设计,通用性不足;而基于蛋白质结构的方法高度依赖高质量3维结构模型,应用场景受限。本研究提出ProSiteHunter,1款仅依托氨基酸序列,即可统一预测蛋白质-DNA、蛋白质-RNA、蛋白质-蛋白质、抗体-抗原4大类结合位点的通用框架。该框架融合经微调的蛋白质语言模型SiteT5,以及从序列中提取的进化特征、几何特征与统计特征;再通过多源特征融合模块(MSFF)对特征进行深度处理,捕获序列双向语义、局部关联与全局依赖,实现结合位点的全面表征,大幅提升预测精度与泛化能力。在多组基准测试中,相较于当前主流算法,ProSiteHunter在蛋白质-DNA/RNA/蛋白质结合位点任务上的精确率-召回率曲线下面积(PRAUC)平均提升38.4%;在难度最高的抗体-抗原结合位点任务中,PRAUC提升15.1%。此外,该工具可识别蛋白质局部柔性区域,能够与AlphaFold3的预测结果形成互补,并提升抗体-抗原相互作用的预测准确度。上述结果表明,ProSiteHunter是款高效、通用的工具,可精准且稳定地预测各类蛋白质结合位点。

zhanzhou@zju.edu.cn

zxg@zjut.edu.cn

zgj@zjut.edu.cn

#人工智能 #计算生物学 #计算机科学 #语言模型 #分子识别 #蛋白质功能 #蛋白质配体 #氨基酸序列

结果

整体概述

图片

图1  ProSiteHunter整体工作流程

(a) 从每条训练序列的多序列比对结果(MSA)中抽取子比对序列,结合低秩自适应(LoRA)策略对ProtT5模型进行微调,筛选最优SiteT5模型并提取特征嵌入(对应图c)。

(b) ProSiteHunter以蛋白质序列为输入,构建多层次序列表征;经由多源特征融合模块(MSFF)捕获序列局部模式与全局依赖,融合后的特征再通过多层交互学习模块(MIL)进一步优化,最终由分类器输出每个氨基酸残基为结合位点的概率。图中蛋白质结构均为示意图。

(c) 特征提取模块整合进化、几何、3类互补特征,构建每个位点的多维表征,所有特征统一称为序列表征(sr)。

(d~f) 尺度感知编码器、上下文感知编码器、重要性感知编码器的网络结构。

蛋白质-核酸结合位点预测性能

图片

图2  ProSiteHunter在蛋白质-核酸结合位点任务中的预测性能

(a) 蛋白质-DNA、蛋白质-RNA 结合位点预测任务的受试者工作特征曲线(ROCAUC);

(b) 蛋白质-DNA、蛋白质-RNA结合位点预测任务的精确率-召回率曲线(PRAUC);

(c) ProSiteHunter与CLAPE-DB、CLAPE-RB、iDRNA-ITF、DRNApred模型的F1分数、马修斯相关系数(MCC)对比;

(d) 散点图:ProSiteHunter分别与CLAPE-DB(蛋白-DNA)、CLAPE-RB(蛋白-RNA)在单条序列水平的AUC值对比;

(e) 半箱线图:ProSiteHunter、CLAPE-DB、iDRNA-ITF在蛋白-DNA结合位点任务中正负样本的分类效果对比;

(f) 半箱线图:ProSiteHunter、CLAPE-RB、iDRNA-ITF在蛋白-RNA结合位点任务中正负样本的分类效果对比。

蛋白质-蛋白质、抗体-抗原结合位点预测性能

图片

图3  ProSiteHunter在蛋白质-蛋白质、抗体-抗原结合位点任务中的预测性能

(a) 蛋白质-蛋白质、抗体-抗原结合位点预测任务的ROCAUC曲线;

(b) ProSiteHunter与其他模型在PRAUC、F1分数、MCC三项指标上的对比(蛋白-蛋白、抗体-抗原任务);

(c) 半箱线图:ProSiteHunter与Seq-InSite、ISPRED-SEQ在蛋白-蛋白结合位点任务中正负样本分类效果对比;

(d) 半箱线图:ProSiteHunter与SEMA2.0-1D、CALIBER在抗体-抗原结合位点任务中正负样本分类效果对比;

(e) CASP16测试靶标T1225(PDB编号:9CQA)结合位点预测结果对比:左侧为实验结构(浅蓝色为抗体重链,深蓝色为呼吸道合胞病毒糖蛋白,橙色区域为真实结合位点);中间为ProSiteHunter预测结果(橙色为预测结合位点);右侧为AlphaFold3预测结果(橙色为预测结合位点)。

消融实验与可解释性分析

图片

图4  消融实验与模型可解释性分析

(a) SiteT5特征嵌入与相对溶剂可及性(RSA)、ProstT5、极化率、疏水性、等电点、2级结构、氨基酸偏好性等典型特征的相关性分析;

(b) RSA特征与SiteT5、ProstT5、极化率、疏水性、等电点、2级结构、氨基酸偏好性等典型特征的相关性分析;

(c) 不同特征组的特征消融实验结果;

(d) 真实蛋白-DNA结合位点与ProSiteHunter预测位点的氨基酸偏好分布;

(e) 真实蛋白-蛋白结合位点与ProSiteHunter预测位点的氨基酸偏好分布;

(f) 多源特征融合模块(MSFF)、多层交互学习模块(MIL)的网络消融实验;

(g~i) 采用t分布邻域嵌入(t-SNE),将特征提取后、MSFF处理后、MIL处理后的高维特征降维至2维空间,区分蛋白-DNA结合位点(红色)与非结合位点(蓝色)。

识别多种结合模式与动态构象变化

图片

图5  不同类型结合位点典型案例

(a) 蛋白复合物(PDB编号:5H58):天蓝色链霉菌CprB蛋白与对应操纵子序列(绿色、黄色)结合,橙色区域为预测结合位点;

(b) 蛋白复合物(PDB编号:6D12):人Larp7蛋白C端xRRM结构域与7SK茎环RNA(绿色)结合,橙色区域为预测结合位点;

(c) 蛋白复合物(PDB编号:7MJS):启动子超家族蛋白2A与配体复合物,橙色区域为预测结合位点;

(d) 蛋白复合物(PDB编号:3E1Z):沙加辛与木瓜蛋白酶的晶体结构,橙色区域为预测结合位点;

(e) 鸡卵清溶菌酶形成的两种复合物(PDB编号:4GN4、1J1X);橙色、红色分别标注预测结合位点,红色为2种复合物的结合重叠区域。

提升抗体-抗原相互作用下游预测效果

图片

图6  ProSiteHunter对抗体-抗原相互作用下游预测的提升效果

(a) 引入预测表位特征前后的ROCAUC曲线对比;

(b) 2组模型的F1分数、精确率、召回率对比;

(c) 引入结合位点信息前后,正样本的预测概率分布;

(d) 引入结合位点信息前后,负样本的预测概率分布;

(e) 信号调节蛋白α(SIRP α)与对应抗体的相互作用概率分布;

(f) 丙型肝炎病毒E2蛋白(HCV E2)与对应抗体的相互作用概率分布。

数据

实验数据与ProSiteHunter源代码已在GitHub公开

https://github.com/iobio-zjut/ProSiteHunter

ProSiteHunter在线预测服务器免费对外开放

http://zhanglab-bioinf.com/ProSiteHunter/

详细总结

图片

思维导图

参考

Adv Sci (Weinh). 2026 Jun 2:e75931. doi: 10.1002/advs.75931.  

ProSiteHunter: A Unified Framework for Sequence-Based Prediction of Protein-Nucleic Acid and Protein-Protein Binding Sites

260602ProSiteHunter.pdf

注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。

赞(0)
未经允许不得转载:171主机测评 » 浙大周展等:突破性通用型蛋白质结合位点预测
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址