欢迎光临
我们一直在努力

CrossLLM-Mamba:用于RNA相互作用预测的多模式状态空间融合LLMS

论文总结

  • 问题:现有RNA相互作用预测方法使用静态特征融合,无法捕捉分子间动态、上下文依赖的“对话”,且存在类别不平衡与计算复杂度过高的问题。

  • 核心创新:提出CrossLLM-Mamba,将相互作用预测重构为状态空间对齐问题,利用双向Mamba编码器实现模态间隐状态传递,模拟动态的序列状态转移。

  • 输入编码:利用专用生物大语言模型提取特征——ESM-2(蛋白)、RiNALMo(RNA)、MoleBERT(小分子),并投影到统一隐空间。

  • 关键技术:

    • 训练时加入高斯噪声注入(σ=0.02)增强鲁棒性。

    • 双向Mamba(BiMamba)捕获非因果依赖。

    • Cross-Mamba融合模块:将两种模态编码堆叠为序列,通过BiMamba实现状态混合。

    • 使用Focal Loss应对类别不平衡,聚焦难负样本。

  • 计算优势:保持线性复杂度,相比Transformer的二次扩展性更好。

  • 实验范围:三类任务——RNA-蛋白、RNA-小分子(亲和力回归)、RNA-RNA(miRNA-lncRNA跨物种迁移)。

  • 主要结果:

    • RPI1460:MCC=0.892(比之前最好提升5.2%),ACC=0.935,Recall=0.971。

    • 小分子亲和力:核糖开关Pearson相关系数>0.95,重复序列>0.95,多数RNA亚型MAE降低。

    • 跨物种迁移:6个场景中4个最优,如MTR→ATH准确率75%(比BioLLMNet提高7%)。

  • 消融实验:Cross-Mamba融合是最关键组件(移除后性能下降最大);双向扫描带来2.7% MCC提升;噪声注入与Focal Loss有效防止过拟合并提升区分难负样本能力。

  • 局限:未显式利用3D结构信息;个别跨物种场景稍弱于专注局部注意力的方法;只预测相互作用概率,不定位结合位点。

  • 意义:首次将状态空间模型(Mamba)应用于多模态生物相互作用预测,为药物靶点、蛋白-蛋白相互作用等提供了新范式。

摘要

对RNA相关相互作用的准确预测对于理解细胞调控和推进药物发现至关重要。虽然ESM-2和RiNALMo等生物大语言模型(BioLLMs)提供了强大的序列表示,但现有方法依赖于静态融合策略,无法捕捉分子结合的动态、上下文相关的性质。我们介绍了CrossLLM-Mamba,这是一个新的框架,它将交互预测重新表述为状态空间对齐问题。通过利用双向Mamba编码器,我们的方法通过隐藏状态传播实现了特定于通道的嵌入之间的深度“串扰”,将交互建模为动态序列转换而不是静态特征重叠。该框架保持了线性计算复杂性,使其可扩展到高维BioLLM嵌入。我们进一步加入了高斯噪声注入和焦损,以增强对硬负样本的稳健性。在RNA-蛋白质、RNA-小分子和RNA-RNA三个相互作用类别上的综合实验表明,CrossLLM-Mamba达到了最先进的性能。在RPI1460基准上,我们的模型达到了0.892的MCC,超过了以前最好的5.2%。对于结合亲和力预测,我们在核糖开关和重复RNA亚型上获得了超过0.95的Pearson相关性。这些结果使状态空间模型成为预测多模式生物相互作用的有力范例。

引言

核糖核酸(RNA)是细胞复杂性的基本驱动力,通过与蛋白质、小分子和其他RNA复杂的相互作用来协调基因表达、剪接和翻译。这些相互作用的失调是许多病理学的标志,使得对RNA相关复合体的准确预测成为现代药物发现和系统生物学的关键任务。最近出现的生物大语言模型(BioLLms),如蛋白质的ESM-2[1]和RNA的RiNALMo[2],通过在高维潜在空间中捕获丰富的语义信息,为序列编码提供了强大的工具。然而,一个重要的瓶颈仍然是如何有效地融合这些多通道表示来预测交互。现有的计算方法主要依赖于静态融合范例[3],其中生物嵌入被视为固定的特征向量,通过级联、逐元素平均或浅门控机制组合在一起。虽然静态融合对简单的模式匹配有效,但它未能捕捉到支配分子结合的动态、非线性结构依赖关系。它认为相互作用仅仅是特征的重叠,而不是复杂的生物学“对话”,一种分子的构象和状态本身决定了另一种分子的结合潜力。此外,标准的训练目标往往忽略了生物相互作用数据集的严重类别失衡和“硬性负”性质,导致模型对新序列的泛化很差。为了弥补这一差距,我们引入了CrossLLM-Mamba,一个新的框架,将生物相互作用预测重新表述为状态空间建模(SSM)对齐问题。从选择性状态空间模型(MAMBA)[4]的效率中得到启发,我们假设两个生物实体之间的相互作用可以建模为序列转换。通过堆叠交互伙伴的表示,我们允许一种通道的“隐藏状态”流入并调制另一种通道的表示,从而捕获静态选通遗漏的上下文串扰。这项工作的主要贡献概括如下:

·状态-空间交互建模:我们提出了一种新的范式,将生物交互视为一个状态转换过程,而不是静态的特征融合。通过利用Mamba架构,我们通过隐态传播实现了LLM生成的嵌入之间的深度串扰。

·高维LLMS的线性复杂性:不同于可扩展的基于transformer的交叉注意平方地复杂度,我们的基于Mamba的混合器保持线性复杂性。这允许高效地处理来自最先进的BioLLM(如ESM-2和RiNALMo)的高维嵌入,而不需要过多的计算开销。

·多模式灵活性:CrossLLM-Mamba框架旨在与模式无关。我们通过预测三个不同类别的相互作用来展示它的多功能性:RNA-蛋白质相互作用、RNA-RNA相互作用和RNAs小分子相互作用。

·稳健的训练制度:为了解决生物数据中固有的噪声和类别不平衡问题,我们将高斯噪声注入用于数据增强,并将焦点损失[5]用于训练。这种组合增强了模型区分硬阴性样本的能力,并改进了对不可见序列的泛化。

相关工作

RNA相关相互作用的预测已经从传统的基于序列的统计方法发展到复杂的深度学习和大规模语言模型(LLM)框架。我们回顾了不同相互作用类型方法的进展,生物学基础模型的出现,以及状态空间模型在计算生物学中日益增长的应用。

RNA-蛋白质相互作用预测

早期的RNA-蛋白质相互作用(RPI)的计算方法主要依赖于手工制作的特征和经典的机器学习。RPISeq-RF[6]利用随机森林分类器的k-mer组合,将基于序列的预测确立为一种可行的方法。随着IPMiner[7]的出现,这个领域转向了深度学习,它使用堆叠的自动编码器来自动从RNA和蛋白质序列中提取高级特征。随后的体系结构引入了越来越多的复杂性:RPITER[8]提出了针对lncRNA-蛋白质对的分层深度学习框架,而CFRP[9]则专注于构建与神经网络相结合的复杂手工特征。最近,LPI-CSFFR[10]展示了序列融合和特征重用在捕获长的非编码RNA依赖方面的好处,而RNAincoder[11]引入了专门为RNA相关相互作用设计的卷积自动编码器。

RNA-RNA相互作用预测

由于RNA双链的结构互补性和热力学稳定性要求,预测RNA分子之间的相互作用,特别是miRNA-靶和miRNA-lncRNA之间的相互作用,提出了独特的挑战。传统的方法,如RNA杂交[12]和IntaRNA[13],使用热力学模型来预测基于最小自由能计算的结合位点。随后出现了机器学习方法,PmliPred[14]引入了将多个分类器与模糊决策规则相结合的混合模型,用于植物miRNA-lncRNA预测。CORAIN[15]通过开发基于卷积自动编码器的特定于任务的编码算法来解决跨物种泛化的挑战。然而,这些方法通常关注序列互补模式,并且可能遗漏由现代语言模型捕获的高阶依赖关系

RNA-小分子相互作用预测

RNA-小分子结合的预测对于RNA靶向药物的发现是至关重要的,但与蛋白质-配体相互作用预测相比,研究仍然较少。早期的方法采用蛋白质配基方法,使用分子指纹和传统的机器学习[16]。RSAPred[17]汇总了实验结合数据,并采用机器学习跨RNA亚型进行亲和力预测。[18]通过将对比预训练与3D卷积神经网络相结合来捕获空间约束信息来推进该领域。尽管有这些进展,但大多数方法在后期融合之前独立处理RNA和小分子表示,可能会错过结合伙伴之间的动态相互作用。

生物大语言模型

基础模型的出现彻底改变了生物序列编码。对于蛋白质,ESM-2[1]利用在数百万进化序列上训练的变压器体系结构来捕捉高维潜在空间中的深层结构和功能语法。该模型的注意模式已被证明与蛋白质接触图相关,这表明序列模型隐含地学习结构信息。对于RNA,RiNALMo[2]成为一个大规模的基础模型,能够跨结构预测任务进行推广,捕获RNA序列独特的二级结构倾向和进化限制。在小分子领域,MoleBERT[19]和相关的图神经网络方法通过对分子图的预训练来编码化学拓扑。虽然这些BioLLM提供了更好的嵌入,但挑战已经转向有效地融合多模式表示。最近的框架,如BioLLMNet[20],探索了跨LLM嵌入融合的专门转化网络。然而,这种方法在很大程度上依赖于静态融合机制、串联、单元操作或浅门控,这些可能不能完全捕获相互作用的分子之间动态的、上下文相关的串扰。

多模态融合策略

异质表征的融合是多通道学习中的一个基本挑战。在视觉-语言领域,交叉注意机制[21,22]已被证明对于建模通道之间的交互是有效的,允许一种模式关注另一种模式的相关特征。然而,交叉注意与序列长度呈二次曲线关系,这给高维生物嵌入带来了计算挑战。可供选择的融合策略包括双线性汇集[23]和张量融合网络[24],双线性汇集[23]捕获成对特征交互,但受到参数爆炸的影响,张量融合网络[24]显式地对单模、双模和三模交互进行建模。门控融合机制[25]学会动态加权通道贡献,但仍将融合视为单步聚合而不是连续过程。在计算生物学中,大多数相互作用预测方法采用后期融合,其中特定于形态的编码者产生随后被组合的固定表示[3]。这种范式将相互作用视为特征的静态重叠,而不是一个分子的构象和状态决定另一个分子的结合潜力的动态过程。我们的工作解决了这一限制,将融合重新定义为连续的状态转换,允许模式之间的连续信息流。

计算生物学中的状态空间模型

状态空间模型(SSM),特别是Mamba体系结构[4],由于其线性扩展复杂性和选择性记忆机制,已成为Transformers的强大替代品。选择性状态空间公式允许模型根据输入内容动态过滤信息,使其非常适合处理较长的生物序列。在基因组学方面,基于Mamba的体系结构在DNA序列建模方面表现出了希望。Caduceus[26]为DNA语言建模引入了双向Mamba架构,展示了SSMS可以在保持计算效率的同时捕获基因组序列中的长范围依赖关系。同样,在蛋白质结构预测和变异效应预测中的应用已经开始探索基于SSM的注意力机制的替代方案。然而,MAMBA作为生物相互作用预测的多模式比对工具的应用在很大程度上还没有被探索。现有的SSM在生物学中的应用主要集中在单通道序列建模上,而不是跨通道融合。我们的工作通过将相互作用预测重新表述为双向状态空间对齐问题来弥合这一差距,利用Mamba反复出现的隐藏状态来实现来自不同生物形态的LLM生成的嵌入之间的深度串扰。

总结和定位

现有的RNA相互作用预测方法面临三个关键局限性:(1)静态融合策略无法模拟动态分子串扰;(2)交叉注意机制的二次复杂性限制了对高维BioLLM嵌入的可扩展性;(3)限制了跨相互作用类型和物种的泛化。CrossLLM-Mamba通过统一的状态空间比对框架来解决这些挑战,该框架允许具有线性复杂性的模态之间的连续信息流,而稳健的训练策略增强了对未知序列的泛化。

CrossLLM-Mamba概述

我们提出了CrossLLM-Mamba,一个统一的深度学习框架,旨在通过将任务重新描述为状态空间建模问题来预测RNA相关的相互作用。CrossLLM-Mamba首先使用专门为RNA、蛋白质或小分子设计的预先训练的语言模型对来自每种模式的生物序列进行编码。与以前依赖于复杂的转换网络和静态门控机制的方法不同,我们采用了健壮的噪声注入投影,然后是跨Mamba交互模块。我们框架的初始阶段涉及一个多模式嵌入管道,旨在将原始生物数据转换为语义丰富的特征向量(图1)。我们使用专门的基础模型作为冷冻特征提取程序:ESM-2用于蛋白质氨基酸序列,RiNALMO用于RNA核苷酸,MoleBERT用于小分子微笑串。该策略确保在序列被投影到用于交互建模的共享潜在空间之前,保留每个通道的唯一结构和进化语法。我们方法的核心是引入双向状态空间模型(BiMamba),该模型将两个生物实体之间的相互作用视为动态序列转换。这使得该模型能够捕获冻结嵌入中的全局、非因果依赖关系,并使一种分子的潜在表示动态地通知另一种分子的“状态混合”成为可能。整个管道,包括BiMamba编码器和Cross-Mamba融合模块,都经过了端到端的培训。架构示意图如图2所示。每个模块的详细信息如下:

生物通道的语言模型嵌入

我们首先使用专门针对每种生物形态的预先训练的语言模型对RNA、蛋白质和小分子的输入序列进行独立编码。图1显示了提取嵌入的示意性表示。

RNA语言模型嵌入

RNA序列由腺嘌呤(A)、尿嘧啶(U)、胞嘧啶(C)和鸟嘌呤(G)组成,使用大型RNA基础模型RiNALMo嵌入。给定输入序列S={s1,s2,…,sn},RiNALMO产生维度1280的全局特征嵌入。这些嵌入捕获了整个RNA序列的结构和上下文依赖关系,为下游交互建模提供了丰富的初始表示。

图1:序列嵌入和特征提取管道。该框架利用专门的预先训练的大型语言模型将生物实体编码成高维特征向量。(顶部)蛋白质氨基酸序列使用ESM2编码。(中间)RNA核苷酸序列通过RiNALMo处理。(下)使用MoleBERT构建和编码小分子图。这些不同的嵌入流充当下行双路径Mamba架构的初始输入特征。

蛋白质语言模型嵌入

蛋白质序列P={p1,p2,…,pm}使用ESM-2编码,ESM-2是一种基于变压器的模型,对数百万个蛋白质序列进行训练。该模型对输入的氨基酸序列进行标记化,并输出维度1024的上下文嵌入。对应于令牌的表示被用作蛋白质的全局概要,作为蛋白质-RNA相互作用任务的主要输入。

小分子语言模型嵌入

对于以微笑串S为代表的小分子,我们使用MoleBERT[19]来生成分子嵌入。MoleBERT将微笑串解析为分子图G=(V,E),其中每个原子vi∈V被编码为潜在向量zi。这些向量被处理以捕捉原子特征和拓扑特征。最终的分子表示是通过图级合并获得的,从而得到维度为768的特征向量。我们选择RiNALMo、ESM-2和MoleBERT作为主干语言模型,因为它们代表了各自领域的最新技术。它们捕获丰富的特定于通道的语义的能力为我们的统一框架提供了强大的基础。

通过噪声注入实现稳健的特征对齐

从这些基础模型产生的原始嵌入驻留在不同维度的矢量空间中(RNA:1280,蛋白质:1024,分子:768)。为了能够进行交互建模,我们首先将这些嵌入投影到D维的共享潜在空间中。与以往依赖于深度变换网络的方法不同,我们使用了带有高斯噪声注入的线性投影。设EA和EB为源嵌入。我们计算:

其中N(0,σ2)表示在训练期间应用的加性高斯噪声(σ=0.02)。这种随机正则化迫使下游的Mamba模型学习稳健的结构依赖关系,而不是过度拟合高维LLM潜在空间中的特定伪影,显著缓解了生物数据集中常见的硬-负问题。

双向Mamba编码器(BiMamba)

图2:CrossLLM-Mamba模型体系结构。该框架通过双路径管道处理多模式输入(蛋白质、RNA或分子特征向量)。首先,使用线性变换和高斯噪声注入(N(0,σ2))来投影和对齐特征向量,以增强鲁棒性。这些对齐的特征由并行BiMamba编码器(在右侧面板中详细描述)编码,它捕获双向顺序依赖关系。编码的表示通过序列堆叠和BiMamba混合器在Cross-Mamba交互模块中融合,以显式地对交互流进行建模。最后,全局平均池聚合MLP预测头的特征以输出交互概率。

像Mamba这样的标准状态空间模型(SSM)[4]本质上是因果的,处理顺序是从左到右。然而,分子的全局嵌入并不具有严格的时间顺序。为了完全捕捉投影特征中的上下文,我们使用了双向Mamba(BiMamba)块。我们将每个投影的特征向量X视为一个序列长度。BiMamba块在两个正向中处理该序列和反转方向:

跨Mamba交互融合

CrossLLM-Mamba的核心创新是CrossMamba交互模块。我们不是静态的逐元素选通或简单的级联,而是将交互建模为顺序的状态转换。我们通过堆叠这两个模态的编码表示来构造一个统一的相互作用序列S:

预测头与优化

融合后的表示文特尔通过多层感知器(MLP)来生成最终预测。对于二元相互作用任务(RNA-蛋白质,RNA-RNA),我们认为类不平衡是一个关键挑战。标准的交叉熵损失通常会使模型偏向多数类别。为了解决这个问题,我们采用了Focalloss[5]:

调制因子(1−pt)γ降低了分类良好的例子的权重,专注于硬性否定的训练,而αt提供额外的班级平衡。我们设置γ=2.0和α=0.2 5,从而降低简单示例的权重,并将训练重点放在难以分类的交互上,以产生更高的特异性和召回率。对于RNA-小分子结合亲和力的预测,我们优化了一个结合均方误差(MSE)和皮尔逊关联约束的复合损失函数,以确保预测的亲和力值与实验地面真实情况线性相关

实验配置

数据集

为了严格评估CrossLLMMamba的泛化能力,我们在RNA-蛋白质、RNA-小分子和RNA-RNA相互作用的三个不同基准上进行了实验。

RNA-蛋白质相互作用

对于RNA-蛋白质相互作用(RPI)任务,我们利用了RPI1460基准数据集,该数据集最初是在IPMiner研究[7]中引入的,并在随后的文献中被广泛采用,包括LPI-CSFFR框架[10]。这个数据集包括1,460个经过实验验证的长非编码RNA(LncRNAs)和蛋白质之间的相互作用对,以及通过随机抽样产生的相同数量的非相互作用对,以保持二进制分类的均衡分布。遵循标准方案,我们采用了5次交叉验证来确保稳健的性能估计。

RNA-小分子相互作用

对于结合亲和力预测,我们利用了来自RSAPred[17]的数据集,该数据集聚集了来自Robin存储库的实验结合数据。数据集被归类为六种生物相关的RNA亚型:适体、miRNAs、重复序列、核糖体RNAs、RiBoswitch和病毒RNAs。我们将此作为预测结合亲和值的回归任务,并进行了10倍交叉验证。此外,对于根据二进制分类指标,我们应用了一个阈值(亲和力≥4.0)来将交互分类为活动或非活动,这与基线方法一致。

RNA-RNA相互作用

为了评估跨物种的泛化,我们使用了三个基于植物的miRNA-lncRNA相互作用数据集,这些数据集来自拟南芥(Ath)、大豆(Glyine Max)和紫花苜蓿(Medicago Truncatula)。遵循CORAIN基准协议[15],我们使用“训练一次,测试另一次”的策略对模型进行了评估,结果产生了六个不同的迁移学习场景来衡量模型对未知生物环境的稳健性。

实施详情

所提出的框架是使用PyTorch和Mamba-SSM库实现的。所有实验都是在NVIDIA图形处理器上进行的。在所有任务中,我们将特定于通道的嵌入投射到共享的潜在维度D=512。BiMamba编码器配置有8或16的状态维度,4或8的卷积核大小,以及取决于任务复杂性的2或4的扩展因子。

基准模型

为了评估CrossLLM-Mamba的性能,我们将其与一系列基线进行了比较,包括传统的机器学习、深度学习体系结构和最近的基于LLM的框架。这些模型是根据它们在本研究中使用的基准上的既定表现来选择的。

RNA-蛋白质相互作用(RPI)基线

在RPI1460基准上评估的模型包括:

·RPISeq-RF[6]:一种基于序列的方法,利用具有3-mer和4-mer特征的随机森林。

·IPMiner[7]:一个基础框架,利用堆叠的自动编码器从RNA和蛋白质序列中提取特征。

·CFRP[9]:一个侧重于构建复杂特征的模型,用于预测ncRNA-蛋白质相互作用。

·RPITER[8]:一个专门为lncRNA-蛋白质对设计的分层深度学习框架。

·LPI-CSFFR[10]:采用序列融合和特征重用进行交互预测的框架。

·RNA编码器[11]:一种最先进的编码器,基于用于RNA相关相互作用的卷积自动编码器。·BioLLMNet[20]:利用跨LLM转换网络嵌入融合的当代框架。

RNA-小分子和RNA-RNA基线

对于结合亲和力和跨物种转移任务,我们比较了:

·RSAPred[17]:一种基于机器学习的RNA-小分子亲和力预测方法。

·RL亲和力[18]:一种结合对比预训练和3D CNN的亲和力估计方法。

·PmliPred[14]:为预测植物miRNA-lncRNA相互作用而设计的混合模型。

·CORAIN[15]:用于跨物种RNA相互作用泛化的特定于任务的编码算法。

·BioLLMNet[20]:作为所有三个互动类别的统一基线。

评估指标

为了全面评估CrossLLMMamba在不同任务中的性能,我们利用了一组针对特定交互类型量身定做的评估指标。对于二元交互预测任务,我们报告准确率(ACC)、精确度、召回率(敏感度)、F1分数和接收器工作特性曲线(AUC-ROC)。此外,考虑到生物相互作用数据集中普遍存在的类别失衡,我们严重依赖马修斯相关系数(MCC),它被认为是比准确率或F1分数更稳健的失衡类别度量。MCC的计算公式为:

结果分析

在三个异质生物交互任务上的实验结果表明,CrossLLM-Mamba具有较强的预测能力和泛化能力。

RNA-蛋白质相互作用预测的优越性

如表1和图3所示,CrossLLM-Mamba在RPI1460基准上实现了最先进的性能。我们的模型达到了0.892的最小成本系数和0.935的精度,与之前最好的型号相比,这是一个重大的改进。特别值得注意的是高召回值(0.971),这表明状态空间对齐机制在识别高维潜在空间中的真实正向交互作用方面是有效的。框图(图3)中显示的减少的方差进一步证实,与RPISeq或CFRP等静态体系结构相比,高斯噪声注入和BiMamba编码的集成导致了跨交叉验证折叠的更稳定的学习。

RNA-小分子结合亲和力的精确度

结合亲和力回归的结果(表2)突出了该模型捕获细粒度化学依赖的能力。CrossLLM-Mamba的性能优于RSAPred和RL亲和力几乎所有的RNA亚型都有。

·线性相关性:该模型实现了RiBoswitch的皮尔森相关性为0.9562,重复序列的皮尔森相关性为0.9521,这表明Cross-Mamba交互作用模块有效地映射了RNAs序列和MoleBERT分子图之间的“串扰”。

·误差减少:我们观察到大多数类别的平均绝对误差(MAE)持续下降,特别是在病毒RNA类别中。

虽然在RSAPred中,miRNA类别显示出略高的PCC,但CrossLLM-Mamba保持了极具竞争力的性能,表明基于SSM的统一体系结构可以通过最少的任务特定调整来处理二进制分类和连续回归任务。

RNA-RNA跨物种转移中的泛化

基于植物的miRNA-lncRNA相互作用任务(表3)提供了对该模型推广到未知生物分布的能力的严格测试。CrossLLM-Mamba在六种迁移学习情景中有四种表现优于CORAIN和BioLLMNet基线。具体地说,在MTR-ATH场景中(对M.truncatula的训练和对A.thaliana的测试),我们的模型达到了75%的准确率,比BioLLMNet提高了7%。这表明双向状态空间建模捕获了RNA中跨物种保守的通用结构基序,而仅依赖序列水平串联的模型往往会错过这些基序。与CORAIN相比,GMA-MTR任务的表现略低,这表明虽然Mamba是高效的,但某些物种对中的序列特定基序仍可能受益于局部注意机制,我们打算在未来的工作中探索这一点。

消融实验

为了验证CrossLLM-Mamba的架构选择,我们在RNAProtein相互作用基准(RPI1460)上进行了逐个成分的消融研究。我们系统地移除或更换了关键模块,特别是CrossMamba融合机制、双向扫描和焦损,以量化它们对预测性能的单独贡献。

互动融合机制的影响

这项工作的一个核心假设是,交互是一种动态状态转换,而不是静态特征重叠。为了测试这一点,我们用标准的串联和MLP基线替换了我们的Cross-Mamba交互模块。如图4所示,用简单的串联替换Cross-Mamba模块会导致最显著的性能下降。这证实了与静态特征聚合相比,状态空间混合(SSM)方法更有效地捕捉了生物模式之间的连续信息流。

双向在嵌入中的重要性

与时间句不同,生物序列具有空间结构,其中“未来”标记(下游序列)通过折叠影响“过去”标记(上游序列)。我们将我们的BiMamba编码器与标准的单向Mamba编码器进行了比较。单向变体在MCC中的性能下降了2.7%。这证实了扫描正向和反向的生物嵌入对于捕捉蛋白质和RNA三级结构中固有的非因果结构依赖是必不可少的。

通过噪声注入实现稳健性

最后,我们分析了我们的高斯噪声注入策略(σ=0.02)的贡献。去除这种正则化会导致更高的训练精度,但验证F1分数更低,这表明过度匹配。噪声注入迫使模型在高维LLM潜在空间中学习更平滑的决策边界,这对于推广到不可见的序列至关重要。

组件分析

跨Mamba融合的意义:当用标准级联和MLP头替换我们的跨Mamba交互模块时,性能出现了最显著的下降。这证实了我们的假设,即将交互建模为动态转换优于静态特征聚合。

·双向的必要性:恢复到标准的单向Mamba编码器导致MCC下降2.7%。由于生物嵌入代表的是全球分子结构而不是时间序列,双向扫描对于捕获非因果依赖是必不可少的。

·稳健性特征:去除了高斯噪声注入和焦损,导致了较小但显著的下降。值得注意的是,去除焦点损失降低了特异性,这表明该模型在没有重点训练目标的情况下很难区分硬阴性样本。

编码器消融和融合BiMamba深度

我们研究了在特定于通道的编码器(enc块)和跨模式融合模块(Fusion块)中使用的BiMamba块的数量的影响。图5报告了不同编码器-融合深度组合的MCC。总体而言,我们观察到,当编码器深度适中时,增加融合块可以提高性能,在enc_块=3和融合块=2-3时获得最佳结果。然而,如果超过这一点,进一步增加融合深度会导致回报递减甚至性能下降,这表明过深的融合可能会过度混合两种模式,并减少区分性交互信号。类似地,由于表示精化不足,非常浅的编码器(enc_block=1)表现不佳,而很深的编码器(enc_block=5)始终产生较低的MCC,这表明融合前可能存在过度精化。这些结果证实了适度的编码器改进和适度的跨模式交互建模相结合提供了最有效和最稳定的配置。

总结

在这项工作中,我们介绍了CrossLLM-Mamba,一个新的框架,它将生物相互作用预测重新定义为一个状态空间对齐问题。通过利用选择性状态空间模型的效率,我们的方法能够通过双向Mamba体系结构中的隐藏状态传播,在蛋白质的专用生物大语言模型ESM-2、RNA的RiNALMo和小分子的MoleBERT的嵌入之间实现动态“串扰”。与仅将交互视为特征重叠的传统静态融合策略不同,我们的Cross-Mamba交互模块在保持线性计算复杂性的同时对分子伙伴之间的相互条件进行建模。我们对三个不同交互类别的综合实验评估证明了广泛的适用性这一范例。对于核糖核酸-蛋白质相互作用的预测,CrossLLM-Mamba在RPI1460基准上取得了最先进的性能,最大cc为0.892,召回率为0.971。在核糖核酸-小分子结合亲和力预测中,该模型对核糖开关和重复序列的皮尔森相关性分别为0.956和0.952,在大多数核糖核酸亚型上优于现有方法。植物miRNA-lncRNA相互作用的跨物种转移实验进一步验证了该模型的泛化能力,在MTR-ATH转移等具有挑战性的场景中有很大的改善。限制。虽然CrossLLM-Mamba表现出了强大的性能,但也应该承认一些局限性。首先,该模型操作于序列水平的嵌入,并且没有显式地纳入三维结构信息,这可能会限制由特定结合基序主导的相互作用的性能。其次,在某些跨物种的场景中(例如,GMA-MTR)性能略低表明,局部注意机制可以补充我们的全局状态空间方法来捕获物种特定的序列模式。第三,我们目前的框架预测了相互作用的可能性,但没有确定特定的结合残基或位点。

未来的发展方向。有希望的扩展包括集成预测或实验的3D结构特征,开发将Mamba与稀疏关注相结合的混合体系结构来检测局部基序,以及扩展框架以预测残基水平的相互作用位点。本文展示的状态空间建模的成功为将基于SSM的体系结构应用于计算生物学中的其他多模式问题开辟了新的途径,包括药物-靶点相互作用和蛋白质-蛋白质相互作用预测。

赞(0)
未经允许不得转载:171主机测评 » CrossLLM-Mamba:用于RNA相互作用预测的多模式状态空间融合LLMS
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址