欢迎光临
我们一直在努力

文献解读 | 清华 Science 新作:DrugCLIP 开启全基因组虚拟筛选新范式

以解牛之法析生信,观微雀之形览科研。

乔粒说:今天来介绍2026年清华团队开发的一个工具DrugCLIP,用于虚拟筛选小分子。

用途:①手上有目标蛋白,可低成本批量筛候选化合物,替代耗时的传统对接;
②研究冷门、暂无已知配体的蛋白靶点,快速挖掘潜在结合分子;
③可直接使用团队开源的 GenomeScreenDB 数据库,调取提前算好的全基因组筛选结果,省去自行计算的步骤。

网址:DrugCLIP:https://www.drugclip.com/index,可直接访问。
在这里插入图片描述

总而言之,这是个非常好用的网站,下边我们来看下他们的相关开发文献吧。

文献解读

文献标题:Deep contrastive learning enables genome-wide virtual screening
Doi:10.1126/science.ads9530
发表时间:2026年1月
发表期刊:Science
影响因子:49.7

在这里插入图片描述

创新点

清华大学团队开发了一个工具DrugCLIP,把虚拟筛选的适用规模从单靶点拉升到了全基因组级别。

数据来源

  • 预训练数据:从PDB数据库的纯蛋白结构中,通过自研ProFSA策略切割肽段生成“伪配体-伪口袋”配对数据,共构建550万条合成训练样本;
  • 微调数据:BioLip2数据库中4万余套实验解析的蛋白-配体复合物结构;
  • 基准测试:采用领域通用的DUD-E、LIT-PCBA标准数据集;
  • 全基因组筛选:AlphaFold2预测的人源蛋白结构,化合物库来自ZINC与Enamine REAL数据库,包含约5亿个类药分子。

结果解读

1 DrugCLIP模型框架

分析方法:两阶段对比学习训练 + 稠密检索筛选流程
呈现了工具的核心逻辑,分为预训练、微调、筛选三个环节。
预训练阶段固定已训练好的Uni-Mol小分子编码器,仅训练口袋编码器,用合成的伪配体-口袋对进行对比学习,将小分子的化学表征知识蒸馏到口袋编码器中。
微调阶段使用真实实验复合物数据,同步更新两个编码器;同时加入RDKit随机构象采样的数据增强策略,让模型适配真实筛选中分子构象未知的场景。

在这里插入图片描述

2 性能测试与蛋白靶点验证

分析方法:标准数据集基准测试 + 湿实验靶点验证
这组结果从富集效果、泛化能力、结构鲁棒性、计算效率四个维度,全面验证了模型性能。

  • 富集效果:在DUD-E与LIT-PCBA两个通用基准上,1%富集因子(EF1%)全面优于传统对接软件与主流深度学习模型;
  • 泛化能力:移除与测试集相似的分子骨架、蛋白家族后,性能下降幅度有限,表现仍优于主流对接工具;
  • 结构鲁棒性:当口袋侧链存在3Å误差时,模型表现依然稳定,对结构噪音的耐受度优于传统对接;
  • 计算效率:串行模式下速度远超传统方法,大规模并行场景下提速可达千万倍,且算力消耗随靶点与分子数量线性增长。
    湿实验在经典膜蛋白靶点上完成验证:筛选100个分子命中率达15%,其中12个分子活性优于对照分子,还通过冷冻电镜解析了两个复合物的结合结构。

在这里插入图片描述

3 GenPack模块与靶点验证

分析方法:AlphaFold/去辅基结构筛选基准 + SPR结合实验 + 酶活实验
这部分重点解决“AlphaFold预测结构能否用于虚拟筛选”的关键问题。
研究进一步拆解了机制:GenPack的核心作用并非让侧链构象更接近晶体结构,而是提升了口袋定位的精准度——也就是说,AlphaFold结构用于筛选的核心瓶颈是口袋定位,而非侧链精度。
最终研究选取了全新蛋白靶点TRIP12,通过“AlphaFold+GenPack+DrugCLIP”的流程,SPR实验获得17.5%的命中率,两个分子进一步验证了酶水平的抑制活性。

在这里插入图片描述

4 全基因组筛选与公开数据库

分析方法:全基因组尺度虚拟筛选 + 数据库构建
研究团队使用8张A100 GPU,耗时24小时,完成了近1万个人源蛋白、2万余个结合口袋与5亿小分子的虚拟筛选,累计完成超10万亿次打分。
最终筛选出200余万候选分子,构建为GenomeScreenDB公开数据库。数据库覆盖近一半人类可成药基因组,靶点数量是常用ChEMBL数据库的两倍以上,包含大量研究较少的冷门蛋白。
所有分子的打分结果、对接构象均免费开放,可通过官方网站直接查询,我们也可以直接获得。

在这里插入图片描述

点评

乔粒有话说:这项工作能取得如此影响力,核心不在于模型的复杂度,而在于它从真实科研难点出发,形成了“方法创新-性能验证-落地产出-开源共享”。

对于我们来说它有:
工具价值:可直接使用DrugCLIP工具或GenomeScreenDB数据库,为目标靶点快速筛选候选分子,成本远低于传统对接方案;
思路价值:“预编码+稠密检索”的范式,可迁移至蛋白-蛋白互作预测、单细胞配体-受体分析等其他大规模生物匹配问题,适合作为课题方法创新的切入点。

以解牛之法析生信,观微雀之形览科研。

今天的文献就分享到这里啦,欢迎批评指正!

赞(0)
未经允许不得转载:171主机测评 » 文献解读 | 清华 Science 新作:DrugCLIP 开启全基因组虚拟筛选新范式
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址