返回列表

人工智能蛋白质工程

发布于 2026年9月6日

人工智能蛋白质工程

蛋白改造搜索空间图

人工智能蛋白质工程把传统“设计—实验—再设计”的经验循环转化为可学习的工程流程:模型从已知序列、结构和实验表型中提取规律,提出更值得测试的突变体;实验则判断预测是否成立,并将新数据送回下一轮。它的价值不是消除不确定性,而是让有限实验资源更集中地回答关键问题。


人工智能蛋白质工程解决的不是“多算几个突变”

一个长度为数百个氨基酸的蛋白,即使只考虑部分位点,也可能形成庞大的组合空间。传统理性设计擅长围绕明确结构机制提出少量假设;随机或半理性的定向进化能够探索意外解,却往往需要构建和筛选大量变体。机器学习的作用,是利用已经测过的变体建立序列—功能映射,为下一批实验分配优先级。

2019年的综述将这一范式概括为机器学习引导的定向进化:模型不必预先掌握完整物理机制,而是从已表征变体的性质中学习,预测哪些序列更可能获得改进。但“更可能”并不等于“一定有效”。训练数据的覆盖范围、测定噪声、类别不平衡和分布外突变,都会影响模型在新候选上的可靠性。

因此,人工智能蛋白质工程真正解决的是实验决策问题:哪些位点值得动、哪些残基必须保护、哪组候选最有信息价值,以及何时应该扩大探索、何时应该聚焦优化。


从优化目标到可学习问题

把一个模糊目标写成机器可处理的任务,需要先明确表型、约束和可验证终点。

• 稳定性改造: 是提高熔解温度、降低聚集,还是改善特定pH或溶剂条件下的保持率?

• 活性优化: 关注催化速率、转化率、底物谱,还是特定条件下的有效活性?

• 亲和力工程: 需要增强结合,还是在保留选择性的同时降低非特异相互作用?

• 表达与可制造性: 目标是可溶表达、产量、折叠质量,还是纯化与储存稳定性?

不同目标可能相互冲突。提高疏水核心紧密度可能有利于稳定性,却也可能增加聚集风险;增强界面作用可能改变特异性。好的工作流不会只保留单一最高分,而会同时考虑性能、结构风险、序列多样性与实验可测性。

MatwingsVenus™(晓鹜™)将已有蛋白改造与从头设计分开路由。对于已有功能骨架,平台能力参考给出的输入包括目标序列、推荐的PDB结构、优化目标和可选湿实验数据;输出则是带Predicted标签及证据来源的单点或组合突变排序,并附后续实验建议。

 


Mutation epistasis network.

突变上位性网络图


一条可执行的人工智能蛋白质工程路线

与其把算法按名称堆叠,更有效的做法是按决策问题组织任务。

第一步:建立野生型基线与禁触区

先核对蛋白身份、功能位点、已知变异、结构信息和野生型实验数据。催化残基、关键结合位点、二硫键或保守结构核心,应优先标记为禁触区或高风险区。没有基线,后续模型即使给出分数,也难以判断改善是否真实。

第二步:选择单点还是组合策略

当机制较明确、数据较少时,可先用单点突变扫描寻找候选方向;当多个位点存在协同或拮抗时,需要多点组合建模。MatwingsVenus™(晓鹜™)可用VenusX组织功能位点测绘,以VenusREM评估单点突变效应,并通过VenusPrime处理多点组合与已有数据训练。

第三步:建立多目标候选集

候选筛选不应只看一个模型分数。可同时考察预测活性、稳定性、表达风险、界面变化、序列多样性和物理合理性,再保留具有不同风险—收益组合的小型候选集。Rosetta物理打分或分子动力学可以作为补充证据,但仍属于计算层面,不能代替实验表型。

第四步:用实验数据启动主动学习

首轮实验用于测量候选,而不仅是验证“最优解”。当数据回流后,模型可以利用预测均值与不确定性,平衡探索未知区域和利用当前高分区域。MatwingsVenus™(晓鹜™)能力参考中的ALDE路线面向这种多轮迭代:输入包括野生型、最多7个位点以及必需的CSV、TSV或Excel实验数据文件。

第五步:设置继续、转向或停止条件

每轮应明确输出:候选序列、预测依据、实测结果、模型误差、失败模式和下一轮推荐。如果新增实验无法继续提高目标,或多目标权衡已超出可接受范围,就应调整位点、改换路线或停止,而不是无限追加突变。


公开案例:主动学习如何处理上位性

蛋白质中的上位性意味着多个突变的组合效果不能简单由单点效果相加得到,这正是组合优化的难点。2025年发表的ALDE研究针对某酶活性位点中5个具有上位性关系的残基,使用不确定性量化指导候选探索。在该论文限定的非天然环丙烷化反应体系中,研究团队通过3轮湿实验,将目标产物收率从12%提高到93%。

这个结果是特定酶、位点集合、反应和实验条件下的科学案例,不能转换成其他蛋白或平台项目的普遍成功率。它更重要的启示在于:主动学习并不是用模型替代实验,而是让每轮实验既寻找高性能序列,又为模型补充最有信息价值的数据。

该公开研究并非MatwingsVenus™(晓鹜™)的产品案例。平台支持ALDE类型任务,说明相关方法可以被纳入工程工作流;项目是否获得改善,仍需依据自身数据、候选空间和湿实验结果判断。

 


Active-learning iteration workflow

主动学习迭代工作流

MatwingsVenus™(晓鹜™)如何串联计算与实验决策

平台的核心价值,可以落在一条清楚的任务链上:

环节

输入

平台任务

输出

下一步

证据与目标定义

序列、结构、表型目标

检索已知数据,识别功能位点

基线、约束与禁触区

确认改造范围

突变候选生成

允许改变的位点

单点扫描或多点组合建模

候选清单与Predicted标签

计算复核

多目标过滤

结构、界面与序列风险

物理打分、动力学或结合评价

分层候选集

选择实验批次

湿实验验证

候选与测定方案

表达、纯化、活性或结合测试

Measured数据

回流模型

主动学习迭代

已测变体数据

更新序列—功能模型与不确定性

下一轮候选

继续、转向或停止

MatwingsVenus™(晓鹜™)的全局契约强调检索优先、重计算前人工确认以及Measured、Predicted、Unknown证据标签。这使营销表达回到研发事实:平台不是替研究人员决定目标,也不把预测自动包装成成功,而是帮助团队管理工具、证据、候选与实验交接。


面向未来:从“高分突变”走向可复用学习

人工智能蛋白质工程的下一阶段,不只是找到一次高分突变,而是积累可复用的序列—功能数据和决策记录。实验条件、失败候选和测定噪声都应被保留,因为它们决定模型下一轮能学到什么,也决定结果能否迁移到相邻序列空间。

对科研团队和产业研发而言,真正可持续的优势来自三点:明确的功能目标、可信的实验数据,以及能够管理多轮迭代的工作流。MatwingsVenus™(晓鹜™)将功能位点、突变预测、组合建模、物理验证和主动学习组织在同一决策链中,为人工智能蛋白质工程提供了从计算建议走向实验闭环的路径。最终,AI的角色不是宣布答案,而是帮助每一轮实验变得更有方向。