返回列表

DiffDock蛋白质配体对接:什么时候用?

发布于 2026年8月16日

DiffDock蛋白质配体对接:什么时候用?

在药物发现的漫长链条中,分子对接一直是最核心也最耗时的环节之一。给定一个蛋白质靶点和一个小分子配体,如何预测它们结合时的三维构象?传统方法依赖搜索算法和评分函数,在庞大的构象空间中反复采样、打分、优化,试图找到那个“最优解”。这个过程通常需要数小时到数天,且高度依赖预定义的结合口袋位置。

2022年底,某国际研究团队给出了一个完全不同的答案,将对接视为生成问题,而非搜索问题。这个答案的名字叫DiffDock。


一、从“搜索”到“生成”的范式转换

传统的分子对接方法本质上是在执行搜索任务:在预定义的结合口袋内,通过蒙特卡洛、遗传算法等手段不断调整配体的位置、方向和构象,利用评分函数评估每个候选姿态的优劣,最终选出得分最高的构象。这就像在茫茫大海里捞针,目标方向明确,但构象搜索空间极其庞大,评分函数能量曲面崎岖,算法极易陷入局部最优解。

DiffDock则切换了全新思路:不再搜索,而是生成。它将分子对接建模为生成式任务,学习一条从随机噪声到有效结合构象的映射关系。给定蛋白质与配体结构,DiffDock不是去“寻找”正确的结合姿态,而是直接生成一系列潜在结合构象,再从中筛选可信度最高的结果。

思路变革背后是一个关键认知:传统回归方法试图预测唯一的“正确答案”,但分子对接问题本质上需要学习概率分布,在给定蛋白质与配体条件下,所有可行结合构象共同构成一个分布,生成式模型天然适配这类建模需求。


二、DiffDock的工作原理

 

How Diffusion Works

How Diffusion Works

DiffDock核心是一套扩散生成模型,运行在配体姿态对应的非欧几里得流形空间上。

配体与蛋白质结合涉及三类自由度变化:相对于蛋白的平移位置、口袋内的旋转朝向、配体自身可旋转键的扭转构象。DiffDock将这三类自由度映射到统一的数学空间,并在此空间上构建扩散过程。

正向扩散过程:从真实结合构象出发,逐步叠加噪声,不断打乱配体位置、朝向与扭转角,直至构象退化为完全随机的噪声分布。反向扩散过程:模型通过训练学习去噪能力,从随机初始姿态出发,逐步消除噪声,重构出具备物理合理性的结合构象。预测采样时,模型反复执行反向扩散流程,输出多个候选结合姿态。

尤为关键的是,DiffDock属于盲对接模型,无需提前指定结合口袋位置,能够在整个蛋白质表面大范围采样配体姿态,自主识别潜在结合位点。这一特性对于全新靶点研究、变构位点发掘具备极高价值。

 

Denoising to Binding Poses

Denoising to Binding Poses

三、性能表现:38%的top-1成功率

在标准PDBBind测试集上,DiffDock实现38%的top-1成功率(预测构象与实验结构RMSD小于2Å),显著优于传统对接方法的23%与早期深度学习方法的20%。

在更贴近真实研发的高难度场景,采用计算预测蛋白结构(而非冷冻电镜、X射线晶体解析的实验结构)开展对接时,DiffDock优势进一步凸显。采用计算预测的蛋白结构(如ESMFold输出)开展对接时,DiffDock优势进一步凸显——此前的传统对接与深度学习方法最高准确率仅10.4%(来自TANKBind),而DiffDock可达21.7%。盲对接搭配非结合态蛋白结构的测试条件,更加贴合新药研发的真实工况。

DiffDock推理流程分为两步:依靠扩散模型生成一系列候选结合姿态;通过内置置信度模块对构象排序,筛选最可靠的结合模式。模型推理速度较快,输出的置信度指标拥有良好的区分能力。


四、DiffDock的演进与应用

自2022年发布以来,DiffDock陆续衍生多个变体,适配多样化研发场景:

DiffDock-L:模型放大版本,依托合成数据策略扩充数据集与模型规模,支撑大规模虚拟筛选

DiffDock-Pocket:口袋限定版本,适用于已知结合口袋的定向对接

DiffDock-Site:集成结合位点识别模块,进一步提升构象预测精度

DiffDock-L-Allo:面向变构激酶抑制剂微调优化,在Type Ⅲ/IV变构抑制剂姿态预测中表现突出

DiffDock-NMDN:端到端盲对接与虚拟筛选协议,融合采样能力与亲和力预测

在实际药物研发中,DiffDock已被应用于天然产物虚拟筛选、变构位点挖掘等场景。


五、挑战与争议

任何新兴技术落地前都要经受学术审视,DiffDock同样存在讨论空间。

争议焦点之一是数据集划分方式。原始训练集纳入约98%的已知蛋白-小分子复合物结构,仅留存2%作为测试集。批评者指出,这种划分方式可能导致测试样本与训练数据高度相似,有可能高估模型泛化能力。

2024年底一篇预印本系统对比了DiffDock与传统对接工具(如Glide、AutoDock Vina等)。结果显示:在结合口袋预先已知的常规场景中,传统对接工具整体性能优于DiffDock;即便在无口袋信息的盲对接任务下,DiffDock精准预测样本数量同样存在短板。

另一大难题是训练集外泛化能力。剔除与测试案例结构相似的训练样本后,DiffDock在高难度任务上性能明显下滑。在DockGen这类针对全新结合口袋的基准上,原版DiffDock的top-1成功率骤降至7.1%;即便升级版DiffDock-L恢复到22.6%,仍显著低于其在标准PDBBind上的表现。

这些研究结论带来重要启示:生成式分子对接具备可观潜力,但现阶段并非万能方案。对于结合口袋明确、蛋白结构经过实验解析的常规项目,传统对接软件依旧稳定高效。DiffDock的真正价值在于拓宽分子对接能力边界,擅长处理盲对接、全新靶点、变构位点预测等传统方法难以胜任的场景。


六、从“预测”到“研发”:AI驱动的蛋白质科研新范式

 

From Prediction to R&D Platform

From Prediction to R&D Platform

DiffDock的启发不止于分子对接。它代表了AI在蛋白质科研中的角色跃迁,从输出单一预测答案到批量生成多种可行构象,从依赖人工预设条件到自主探索蛋白表面未知区域。

这套“生成式探索”的思路正持续渗透蛋白质研发全流程。2026年4月,对话式蛋白质研发智能体MatwingsVenus™(晓鹜™)正式发布,将AI能力从结构预测延伸至序列设计、功能验证与实验优化的完整闭环。2026年7月,该平台入选世界人工智能大会(WAIC)“镇馆之宝”名单,也是全场唯一入选的AI for Science产品。

在MatwingsVenus™(晓鹜™)平台上,研究者以自然语言描述研发需求,系统自动调度各类专业工具完成复杂任务,覆盖序列分析、蛋白设计、结构预测、功能优化全链路。平台已整合200多款蛋白质设计工具,支持百亿级带真实标签蛋白质数据检索,搭载50多位认证专家、30余套领域定制调优skills。

平台「蛋白生成」模块已接入BoltzGen、LigandMPNN、Protenix等核心模型,打通结构预测、配体设计、序列生成一体化智能研发链路。用户完成分子对接或结构分析后,可在同一平台直接启动蛋白质改造与功能优化,无需跨平台迁移数据、重复搭建任务。

这种全链路整合正在重塑蛋白质科研的工作模式——从单点预测走向完整研发闭环,从零散独立软件进化为一站式智能平台。行业共识表明,当前蛋白质AI研发的最大瓶颈不再是单一模型精度,而是打通从分子设计到湿实验验证的全流程链路。


七、总结

DiffDock是分子对接领域一次里程碑式探索。它以生成式扩散模型重构经典对接问题,在盲对接、全新靶点、变构位点等复杂场景中展现了差异化优势,为结构生物学AI应用提供了新范式参考。同时也提醒从业者:AI模型性能上限,往往受制于训练数据覆盖范围与测试场景和真实研发条件的匹配程度。

对于药物发现与蛋白质科研工作者而言,DiffDock的定位并非取代传统计算工具,而是形成能力互补。厘清不同方法的适用边界,清楚何时选用DiffDock、何时沿用传统对接软件,远比单纯掌握工具操作更加重要。