
文章介绍
ReGAIN 是一篇发表于《Bioinformatics》2026年第42卷第7期的研究论文,由美国犹他大学药理学与毒理学系、生物科学学院、生物医学信息学系以及独立研究者的学者共同完成。该研究针对全球范围内多重耐药细菌病原体持续增加的严峻形势,以及现有工具缺乏可扩展方法来推断耐药决定簇在病原体群体中的共现模式和条件依赖关系的现状,提出了一种名为 ReGAIN 的开源生物信息学平台,用于抗生素耐药、重金属耐受、应激反应和毒力决定簇之间的概率性条件依赖关系推断。
多重耐药细菌对全球人类健康构成巨大威胁。在抗生素耐药细菌中,多重耐药菌代表了最具挑战性的健康威胁,因为它们能够编码大量遗传机制来逃避抗感染药物,从而严重限制治疗选择。多重耐药率持续增加的历史原因包括抗生素的不当使用(如用于非细菌感染和在农业中的过度使用)。此外,多重耐药性的增加在很大程度上是由微生物群落内耐药基因通过水平基因转移的传播和获取所驱动的。许多多重耐药岛侧翼存在转座元件,进一步表明不仅是小型操纵子,可能包含广泛耐药基因多样性的大型基因组岛也具有移动性。细菌容易交换抗生素耐药基因使得多重耐药成为一个不断演化的问题。此外,环境污染物(如重金属)的暴露,加上基因编码的重金属耐药基因,可以通过共选择促进抗生素耐药基因的转移。为了更好地监测耐药基因的传播和扩散,应优先对基因组数据集进行仔细整理,包括分离来源、地区和日期,以便准确进行区域特异性和时间性研究。
全基因组测序的进展为理解多重耐药的演化和绘制细菌物种中常见耐药基因共现模式提供了重要机遇。这对于监测对最后一线抗生素耐药基因(如粘菌素耐药基因 mcr 家族)的共现模式尤为重要。AMRFinderPlus 和 ResFinder 等工具可有效识别抗生素耐药基因,而 PlasmidFinder、ISEScan 和 TnCentral 等工具可用于检测质粒和定位常促进耐药决定簇水平基因转移的移动遗传元件。然而,这些工具并非设计用于研究导致多重耐药表型的耐药基因之间复杂的相互作用。已有一些计算方法被发表用于扩展耐药数据分析,但它们通常需要大量计算经验或侧重于宏基因组数据中的基因丰度而非生物体特异的基因发生模式。据作者所知,目前尚无公开可用的生物信息学平台专门设计用于量化细菌耐药和/或毒力基因决定簇的共现。
为应对这一迫切需求,作者开发了 ReGAIN 基因组分析流程。该流程基于 NCBI AMRFinderPlus 的耐药和毒力基因识别能力,其核心流程应用稳健的贝叶斯网络结构学习方法,来阐明细菌病原体中指示多重耐药的概率性共现模式。重要的是,ReGAIN 不仅限于耐药和应激反应基因,还通过并行分析路径扩展到毒力决定簇,提供抗微生物防御和细菌致病性的更广泛视角。ReGAIN 被设计为灵活且用户友好的工具,将生物信息学工作流程简化为两个核心模块:数据获取/数据集创建和贝叶斯网络分析。提交的基因组经模块一评估耐药和/或毒力基因的存在后,生成二元存在/缺失数据矩阵、元数据文件和包含每个识别基因的 contig 和核苷酸位置的综合结果文件。这些文件可传递至贝叶斯网络分析模块,该模块生成交互式贝叶斯网络以及概率测量值(包括平均条件概率、相对风险和绝对风险差)及其置信区间和标准差。ReGAIN 流程还包括两项事后分析来计算基因共现的双向强度,提供定量方法来探索和解释基因-基因关系的不对称性。
作为概念验证,作者利用 ESKAPEE 病原体(粪肠球菌、金黄色葡萄球菌、肺炎克雷伯菌、鲍曼不动杆菌、铜绿假单胞菌、阴沟肠杆菌和大肠杆菌)的公开基因组数据构建了贝叶斯网络,这些病原体造成了全球大多数医院感染且常对多种抗生素耐药。该流程支持 30 种细菌物种的分析,并提供 ReGAIN Curate 自定义查询模块以补充 AMRFinderPlus 可能遗漏的基因。结果表明,ReGAIN 不仅重现了已知的耐药基因关系,还识别出与共选择和共享遗传背景一致的额外候选模式,为耐药网络的监测、比较基因组学和流行病学提供了可扩展、可重复的群体水平分析方案。
算法原理介绍

ReGAIN 的算法体系由数据获取与数据集创建和贝叶斯网络结构学习两大核心模块构成,实现了耐药基因共现模式的概率性推断。
数据获取与数据集创建。 ReGAIN 模块一以 NCBI AMRFinderPlus 为核心引擎,支持 30 种细菌物种的 organism-specific 分析和非特异性分析。用户提交基因组后,AMRFinderPlus 通过隐马尔可夫模型和人工整理 BLAST 阈值组合,从包含超过 7000 个耐药和毒力基因决定簇的参考目录中识别目标基因。模块 1.1 将识别结果转换为二元存在/缺失矩阵(1=存在,0=缺失),这是后续离散贝叶斯网络分析所必需的输入格式。同时生成包含所有识别基因及其功能注释的元数据文件和包含 contig ID 及核苷酸坐标的综合结果文件。用户可指定最小和最大基因发生阈值来过滤稀有和 ubiquitous 基因以减少网络噪声。此外,ReGAIN Curate 子模块允许用户使用自定义 BLAST 查询基因集,通过设置百分比一致性和查询覆盖度阈值,灵活补充 AMRFinderPlus 可能遗漏的基因。
贝叶斯网络结构学习。 模块二基于 bnlearn 和 gRain 包在 R 中实现。对于小型到中型数据集(<100 个基因),ReGAIN 使用 gRain 的 querygrain 函数执行穷举式条件依赖计算;对于大型数据集(≥100 个基因),则利用 bnlearn 的 cpquery 函数通过蒙特卡洛模拟(默认 10000 次采样)进行估计。具体流程为:首先使用 Hill Climbing 算法和 Bayesian Dirichlet equivalent score(默认 imaginary sample size=10)学习网络结构;然后通过至少 300-500 次 bootstrap 重采样增强稳健性,并以 0.5 的显著性阈值过滤弱支持的基因对,生成有向无环图。随后进行额外 500 次带放回重采样拟合网络,计算每对基因的条件概率 P(A|B)、相对风险 P(A|B)/P(A|¬B) 和绝对风险差 P(A|B)-P(A|¬B) 的均值、置信区间和标准差。事后分析计算双向概率评分 BDPS = P(A|B)/P(B|A) 和相对风险倍数变化,量化基因对关系的方向性和不对称性。
总结
ReGAIN 是一个基于贝叶斯网络结构学习的开源生物信息学平台,通过 AMRFinderPlus 识别耐药/毒力基因并生成二元存在/缺失矩阵,再利用贝叶斯网络推断基因间的条件概率、相对风险和绝对风险差,量化耐药决定簇的共现模式与依赖关系。在 ESKAPEE 病原体基因组上的概念验证表明,ReGAIN 能重现已知耐药关系并识别与共选择和共享遗传背景一致的新候选模式。该流程还提供自定义基因查询、群体相似性分析和多元分析等扩展功能,为耐药性监测、比较基因组学和流行病学研究提供了可扩展、可重复的计算工具。



