蛋白质突变组合效应预测:破解上位效应
发布于 2026年8月18日

引言
在蛋白质工程与酶工程研究中,单点突变带来的性能提升往往有限,真正的性能跃迁往往来自多个突变位点的协同作用。但氨基酸的组合空间是天文数字——10 个位点的饱和组合就有 20¹⁰ 种可能,远超实验筛选能力。蛋白质突变组合效应预测正是破解这一难题的核心计算方法:通过建模突变位点间的上位效应(epistasis),从海量组合中识别真正能带来功能跃升的协同突变,将传统"随机建库+高通量筛选"的试错模式升级为有方向的理性设计。本文系统拆解组合效应预测的技术原理、核心挑战与平台化方案,并介绍上海天鹜科技 MatwingsVenus™(晓鹜™)平台如何以 AI 驱动定向进化。
一、什么是蛋白质突变组合效应预测
蛋白质的功能由氨基酸序列及其三维结构共同决定。单点突变效应预测评估单个氨基酸替换对表型的影响,已相对成熟;而蛋白质突变组合效应预测关注多个突变同时引入时,位点之间的协同或拮抗作用——也就是上位效应(epistasis):一个突变的功能影响,依赖于另一个或多个位点的氨基酸状态。
这种非线性效应在蛋白质工程中无处不在。两个各自略微提升活性的单点突变,组合在一起可能带来几倍甚至几十倍的性能跃升(正向上位效应(positive epistasis)/ 协同效应),也可能相互抵消甚至产生负面效果(负向上位效应(negative epistasis)/ 拮抗效应)。传统方法对这种上位效应几乎无法预判,只能依靠大规模随机建库+ 高通量筛选碰运气,成本高、周期长、成功率低。
从预测维度看,组合效应预测覆盖了蛋白质工程最关注的几类指标:稳定性变化(ΔΔG,即突变体与野生型的折叠自由能之差,正值通常代表稳定性下降,负值代表稳定性提升)、酶活性与催化效率、结合亲和力、表达与溶解性、最适温度/pH 等理化属性。其中,多点组合带来的非线性增益,是定向进化中实现数量级性能突破的关键。
组合效应预测的核心价值,在于将研究者从"大海捞针"式的随机筛选中解放出来——用计算方法提前缩小搜索空间,锁定高价值的协同突变组合,再投入实验验证,从而大幅提升定向进化的效率与成功率。
二、技术演进:从单点评分到组合设计

The Evolution of Three Generations of Technology
蛋白质突变效应预测经历了三代方法学演进,预测精度与适用范围持续提升,研究重心也正从单点突变向组合效应倾斜。
第一代:基于保守性与理化性质的统计方法。 早期方法通过多序列比对(MSA)评估位点进化保守程度,或利用氨基酸物理化学性质推测突变影响,代表工具包括基于同源比对的保守性评分、基于BLOSUM 替换矩阵的功能影响预测,以及 CUPSAT、I-Mutant 等面向蛋白质稳定性预测的统计学习工具。这类方法计算快速、解释性强,但无法捕捉长程依赖与结构局部环境变化,对组合突变的预测能力几乎为零。
第二代:基于三维结构与物理力场的计算方法。 随着结构解析技术进步,FoldX、Rosetta 等基于物理或统计势能函数的方法被用于计算突变稳定性变化(ΔΔG),具有明确的物理意义。但这类方法计算成本高、严重依赖高质量实验结构,且在多点组合突变上误差累积严重,实际应用受限。
第三代:基于蛋白质语言模型的深度学习方法。 近年来,以Transformer 架构为基础的蛋白质语言模型(Protein Language Model, pLM)彻底改变了这一领域。通过在数十亿条序列上自监督预训练,pLM 能够学习进化信息与上下文序列表示,通过自注意力机制捕捉长程依赖。在 ProteinGym 等标准测试集上(包含 217 个深度突变扫描实验、约 270 万个突变体),基于 pLM 的方法在酶活性、分子结合、表达水平、稳定性等多类任务上的 Spearman 相关系数已显著超越传统方法。更重要的是,这类方法仅需序列输入即可零样本预测,打破了对实验结构与标记数据的依赖。
2026 年以来,研究前沿进一步向多点组合突变与上位效应预测聚焦。多项发表于《Science》《PNAS》等顶级期刊的研究显示:结合蛋白质语言模型与上位效应建模的定向进化框架,仅通过单轮机器学习引导的进化就实现了高达 10 倍的性能提升;利用定向进化轨迹共突变信息重建高分辨率适应度景观的方法,鉴定出具有 >1000 倍耐药性的 MEK1 变体。这些进展标志着,蛋白质突变效应预测正从"单点打分"走向"组合设计",从"预测效应"走向"创造功能"。
三、组合效应预测的四大核心挑战

Four Major Challenges
尽管算法快速进步,蛋白质突变组合效应预测在实际科研应用中仍面临多重瓶颈。
挑战一:上位效应难以建模,组合预测精度不足。 单点突变预测相对成熟,但多点组合涉及的非线性上位效应极其复杂,传统方法预测精度急剧下降。而蛋白质工程中真正带来性能跃迁的,往往正是多个突变位点的协同作用——这一"核心需求"恰恰是当前方法的"核心短板"。
挑战二:序列空间爆炸,搜索规模远超计算与实验能力。 20 种氨基酸 × 几十个可变位点,组合空间呈指数级增长。即便是计算筛选,也无法穷举所有可能;而实验验证更是只能触及冰山一角。
挑战三:预测结果难验证,迭代周期长。 计算预测给出的候选组合仍需湿实验验证。从预测结果到突变体构建、表达纯化、功能检测,一轮迭代动辄数周甚至数月,计算与实验之间的壁垒严重拖慢研发节奏。
挑战四:使用门槛高,实验背景研究者难以入手。 大多数先进的pLM 组合预测方法需要命令行操作、GPU 环境配置与深度学习依赖安装,对于实验背景的酶工程研究者来说上手难度极大。
四、MatwingsVenus™(晓鹜™):组合突变设计与定向进化一体化平台

MatwingsVenus™(晓鹜™)
面对上述挑战,上海天鹜科技自主研发的MatwingsVenus™(晓鹜™) 对话式蛋白质研发智能体,将蛋白质突变组合效应预测能力深度融入定向进化设计全链路。平台以自研 Venus 系列蛋白质大模型为核心,依托百亿级蛋白质序列数据集训练,覆盖从单点扫描到多点组合优化的完整预测与设计能力。
自研大模型驱动,多维度统一设计。 平台基于Venus 蛋白质通用大模型与定向进化专用模型,支持稳定性、活性、表达量、溶解性等多维度的突变效应分析与优化设计,研究者无需在多个工具间切换数据与格式。平台设计的多款蛋白质已进入产业化阶段,例如PET降解酶、高活性碱性磷酸酶。
多点组合突变的协同优化。 针对多点组合突变的协同效应难题,平台依托大模型的序列-功能映射能力,可辅助识别正向协同的突变位点组合,并通过多轮迭代优化策略持续逼近目标功能,突破传统方法在组合设计上的瓶颈,为定向进化提供更精准的候选方案。在甜味蛋白 Monellin 的改造项目中,通过多轮"预测-设计-验证"迭代,多个变体甜度较野生型提升十几倍,且耐热性维持在约 75°C 的高位区间——这一数量级的性能跃迁,正是多点协同突变的典型成果。
对话式交互,降低使用门槛。 用户只需用自然语言描述需求——如"帮我扫描这段序列上的候选位点,并设计能提升热稳定性的多点突变组合",智能体即自动调度模型完成计算,返回带置信度与功能解读的候选突变列表。无需命令行操作,无需 GPU 环境配置,实验背景研究者也能快速上手。
从预测到实验的干湿闭环。 更具变革性的是,平台将突变效应预测与自动化湿实验直接打通。预测得到的高价值突变组合可一键转化为实验方案,通过自动化共享实验室完成基因合成、蛋白表达、纯化与功能检测,实验结果自动回传并指导下一轮设计,形成"预测-设计-验证-迭代"的闭环。平台以智能体为中心整合了 200 余款蛋白质设计工具与 30 余项专家调优的技能包,围绕任务目标自动组织工作路径,让计算与实验真正衔接起来。
五、三大科研应用场景
工业酶热稳定性与耐受性改造。 工业酶应用中,热稳定性、pH 耐受性是核心工程指标,而性能跃迁往往需要多点协同突变。平台可系统性扫描目标酶的序列空间,筛选稳定性提升的协同突变组合,通过多轮优化进一步提升耐温、耐碱等工业属性。官方案例中,平台已成功交付 PET 降解酶等高稳定性工业酶的设计项目。
结合蛋白亲和力优化。 在受体结合蛋白、功能配体等研发中,亲和力成熟是关键环节,通常需要界面多个位点的协同优化。平台可预测界面残基组合突变对结合亲和力的影响,快速筛选亲和力提升的协同突变组合。在免疫调控受体靶点的从头设计项目中,平台基于该能力成功获得数十个具备体外细胞阻断活性的全新结合分子,完成了从头设计到功能验证的全流程。
酶活性与底物特异性改造。 对于酶催化功能的改造,单点突变提升有限,组合突变往往带来数量级突破。平台可预测催化口袋及周边残基组合突变对酶活性与底物选择性的影响,结合结构信息定向设计活性更高或底物谱更优的变体,为合成生物学与生物催化应用提供高效设计方案。
结语:从单点试错到组合设计的范式跃迁
从保守性评分到物理力场计算,再到今天的蛋白质语言模型,蛋白质突变组合效应预测的演进始终围绕同一个目标:在浩瀚的序列组合空间中,更准地找到那些真正带来功能跃升的协同突变。今天,我们已经能对单点突变做出相当可靠的预测;而明天,组合效应建模将让定向进化从"碰运气"走向"有章法",从单点优化走向系统设计。
上海天鹜科技MatwingsVenus™(晓鹜™)平台正在推动这一转变。它以蛋白质突变组合效应预测为核心入口,向上连接百亿级序列数据库与蛋白质大模型,向下贯通定向进化设计、自动化实验验证与干湿闭环迭代,将传统"随机突变+高通量筛选"的试错模式,升级为"智能预测+精准验证"的理性设计范式。
蛋白质工程的下一轮突破,属于能够将AI 组合突变预测与实验验证深度融合的研究者。而MatwingsVenus™(晓鹜™),正为这样的研究提供统一的能力底座。