2026 Nature Machine Intelligence:HelixFold-S1 如何让复合物结构预测少走弯路
1. Paper Information
- Paper: Reshaping biomolecular structure prediction with conformational exploration
- Method: HelixFold-S1
- Journal: Nature Machine Intelligence
- Online date: 2026-07-02
- DOI: https://doi.org/10.1038/s42256-026-01264-2
- Official link: https://www.nature.com/articles/s42256-026-01264-2
- Research question: 当生物分子复合物存在庞大的构象空间时,结构预测模型能不能不再盲目撒网,而是更有方向地寻找有价值的候选构象?
这篇论文值得读,不是因为它又说“AI 可以预测结构”,而是因为它把一个更细的问题摆到台面上:复合物结构预测真正困难的地方,常常不是输出一个漂亮结构,而是在大量可能姿态中找到有生物意义、几何合理、值得进一步验证的构象。
2. Why is the old route not enough?
如果把结构预测理解成“给序列,出结构”,问题会被简化得过头。对许多生物分子复合物来说,模型面对的是构象空间:多个链、多个结合界面、多个可能接触区域,以及不同状态之间的切换。
传统路线通常更像“多采样再筛选”:先产生很多候选结构,再用打分或排名找看起来更好的结果。这个路线有两个问题。
第一,候选多不等于有效多样性高。模型可能反复生成相似构象,算力被花在重复区域。
第二,筛选发生得太晚。如果采样一开始没有方向,后面的排名模块只能在已经生成的候选中挑选,很难补回没有探索到的关键区域。
HelixFold-S1 的切入点正是这里:把“哪里更可能接触”提前放入探索过程,让构象搜索从一开始就有信息约束。

3. Core method
HelixFold-S1 可以直观理解为三步:
这不是简单地让模型“采样更多”。它更像把探索路线从“在地图上随机走”改成“先看哪些区域更可能有路,再重点搜索”。
接触概率的价值在于,它把结构预测中的隐含问题拆成了更可解释的中间信号:哪些残基之间可能靠近?哪些链之间的相互作用更值得优先探索?哪些候选构象只是几何上好看,但缺少接触证据?
4. Mechanism breakdown
可以把 HelixFold-S1 的机制拆成一个简化流程:
- 输入:目标分子的序列、可能的模板信息和多链上下文;
- 中间信号:预测接触图谱,形成不同残基或分子链之间的接触概率;
- 探索:把高信息接触区域作为候选构象搜索的方向;
- 筛选:结合几何合理性、接触一致性和模型置信度,保留更有价值的结构候选;
- 输出:用于进一步分析、实验设计或药物发现的复合物构象。
这条路线的核心是把“采样”变成“带方向的搜索”。如果旧路线的重点是候选数量,新路线更强调候选质量和候选之间的有效差异。

4.1 Formula lens
下面不是论文原式,而是用于解释机制的简化直觉公式:
CandidateScore
(
c
)
=
λ
1
G
(
c
)
+
λ
2
P
contact
(
c
)
−
λ
3
R
(
c
)
\\text{CandidateScore}(c)=\\lambda_1 G(c)+\\lambda_2 P_{\\text{contact}}(c)-\\lambda_3 R(c)
CandidateScore(c)=λ1G(c)+λ2Pcontact(c)−λ3R(c)
其中,
c
c
c 表示一个候选复合物构象;
G
(
c
)
G(c)
G(c) 表示几何合理性,例如链之间是否有合理空间关系;
P
contact
(
c
)
P_{\\text{contact}}(c)
Pcontact(c) 表示该候选与接触概率图谱的一致性;
R
(
c
)
R(c)
R(c) 表示冗余、冲突或低价值探索成本;
λ
1
,
λ
2
,
λ
3
\\lambda_1,\\lambda_2,\\lambda_3
λ1,λ2,λ3 是不同信号的权重。
这个公式的意义是:一个候选结构不应该只因为“形状看起来合理”而被留下,还应该和模型认为高概率的接触关系一致,同时避免重复探索。
再用一个更直观的接触概率表达:
P
i
j
=
P
(
residue
i
contacts residue
j
∣
x
)
P_{ij}=P(\\text{residue } i \\text{ contacts residue } j \\mid x)
Pij=P(residue i contacts residue j∣x)
P
i
j
P_{ij}
Pij 表示在输入信息
x
x
x 给定时,第
i
i
i 个残基和第
j
j
j 个残基发生接触的概率。它不是最终结构本身,而是引导构象探索的方向信号。
5. How to read the experiments?
读这类论文时,不应该只看“是否超过某个模型”。更重要的问题是:它在哪些情形下减少了无效搜索?在哪些复合物任务上提升了候选结构质量?它的失败边界在哪里?
这篇论文的实验重点可以从三层读:
- 命中率:引导式探索是否更容易找到接近真实相互作用状态的候选结构;
- 多样性:候选构象是否真的覆盖了不同有用区域,而不是重复生成相似结果;
- 可用性:公开代码、模型权重和补充材料能否支持后续研究复现、比较和扩展。
因此,这篇论文的价值不只是一个更高分数,而是提供了一个可迁移的问题框架:面对复杂构象空间时,让模型先学会“哪里值得探索”。

6. Engineering or research implications
对结构生物学和药物发现来说,HelixFold-S1 的启发很直接:模型输出可以从单一答案变成候选空间导航器。
这会影响三个实际环节。
第一,复合物建模。对多链蛋白、蛋白-配体、蛋白-核酸等相互作用问题,接触概率可以帮助缩小搜索区域。
第二,实验设计。模型给出的候选构象和接触区域,可以转化为突变验证、交联质谱、冷冻电镜解释或结合界面假设。
第三,模型工程。未来结构预测系统可能越来越像“预测 + 探索 + 筛选”的组合,而不是一个单次前向推理工具。
7. Do not overinterpret
这篇论文不应该被理解为“AI 已经解决所有复合物结构预测”。边界至少有四个。
第一,预测结构不是实验结构。晶体学、冷冻电镜、NMR、交联质谱和功能实验仍然是验证依据。
第二,接触概率依赖训练数据和模型归纳偏置。训练分布外的复合物、罕见构象、强动态体系仍可能失败。
第三,候选构象更好不等于生物机制已经确定。结构假设还需要和功能、动力学、细胞环境结合解释。
第四,公开代码和权重提高了可复查性,但真正工程化使用仍需要本地数据、计算资源、质量控制和专家判断。
8. One-sentence summary
HelixFold-S1 的核心贡献是:把复合物结构预测从“多采样再碰运气”,推进到“用接触概率引导构象探索”,让模型更像一个会看地图的结构搜索器。





