蛋白质语言模型功能预测:怎么选?怎么落地?
发布于 2026年8月24日

导读:蛋白质语言模型(PLM)正在从"结构预测工具"演进为"功能预测引擎"。从基因本体注释到突变效应预估,从酶活预测到适配体设计,PLM 正在重塑计算生物学的研究范式。本文系统梳理 PLM 功能预测的技术路径、选型方法与核心挑战,并介绍上海天鹜科技 MatwingsVenus™(晓鹜™)平台如何将功能预测与干湿闭环结合,为 AI4S、蛋白质工程与计算生物学研究者提供可落地的方法参考。
一、PLM 功能预测的三类核心路径

Three Technical Paths for PLM Function Prediction
当前蛋白质语言模型功能预测的技术路线可归纳为三大类,各自在不同任务维度上各有优劣:
1.1 零样本预测:基于似然比的进化推理
无需额外训练数据,直接利用预训练模型对突变序列与野生型序列的对数似然比(log-likelihood ratio)估计突变效应。其理论假设是:在进化中被频繁保留的残基替换更可能维持蛋白的天然功能(即受到纯化选择),因此似然比可作为突变破坏性的代理指标。
适用场景:缺少实验数据的孤儿蛋白家族、新项目快速起步。
局限:对高变区和高阶组合突变精度有限。
1.2 微调预测:表征 + 监督的迁移学习
将PLM 作为特征提取器,把预训练得到的序列嵌入输入下游监督模型,在特定任务数据集上微调。典型任务包括 GO 功能注释、酶的 EC 编号预测、蛋白质相互作用预测、配体结合位点预测、热稳定性/溶解度预测等。
对于有数百条以上标注数据的任务,微调模型通常显著优于零样本方法。CAFA(功能注释关键评估)挑战赛最新结果显示,基于 PLM 的方法已连续多届位居前列。
适用场景:有一定标注积累的具体功能任务。
局限:数据质量决定上限,标注稀缺任务效果受限。
1.3 适应度景观建模:从单点到组合
最活跃的方向是对蛋白质适应度景观(fitness landscape) 的完整建模——不仅预测单点突变效应,还能预测多点组合突变的联合效应,直接服务于定向进化中的突变体设计。
核心挑战是上位效应(epistasis):突变之间的非线性相互作用使得单点效应无法线性外推。近年通过深度突变扫描(DMS)数据训练模型,结合 PLM 的进化先验,在 ProteinGym 等基准上持续刷新精度记录。顶刊研究已展示 PLM 对长程进化轨迹的建模能力。
适用场景:定向进化、工业酶/抗体多目标优化。
局限:依赖高质量DMS 数据,外推到远缘序列仍有挑战。
二、怎么选:功能预测模型的四维评估法
选择PLM 功能预测工具,不能只看论文中的基准数值。建议从四个维度综合评估:
l 基准精度。关注ProteinGym、CAFA、VenusMutHub 等主流基准表现,但注意区分零样本(zero-shot)设定与微调设定,二者不可直接比较。
l 外推能力。考察模型在低同源蛋白、远缘突变体上的表现——这比保守区域的内插预测更能反映真实应用价值,也恰恰是工业挖掘场景中最常见的情况。
l 可解释性。模型能否指出预测的关键残基、是否与已知功能区域吻合?黑箱预测在科研场景中可用性有限,可解释性是建立信任的关键。
l 实验验证率。最终的金标准是湿实验验证。模型推荐的Top N 突变体中,真正有功能增益的比例有多高?这是工业落地最核心的指标。
一句话选型建议:基础研究侧重基准排名与可解释性,工业项目优先看实验验证率与闭环能力。
三、为什么功能预测比结构预测更难
结构预测的成功让人容易产生错觉——但实际上,蛋白质语言模型功能预测仍是远未解决的开放问题,面临三重根本性挑战:
功能的多义性。蛋白质的"功能"不是标量,而是多维向量:同一种酶同时具有催化活性、底物特异性、最适 pH、热稳定性、表达量等数十个可测属性。PLM 的自监督信号来源于序列共进化,混合了结构折叠、催化、结合、表达等多重约束;它本身并未区分这些维度,而'功能'是一个多维、高度上下文依赖的标签集合,这使得从同一嵌入中解耦出特定功能维度比预测三维结构更困难。
标注数据的稀缺与偏倚。与PDB 中数十万实验结构不同,功能数据积累碎片化且分布极不均匀。热门蛋白家族有大量 DMS 数据,多数家族只有稀疏甚至零标注。模型在常见家族上表现良好,但泛化到远缘蛋白时性能骤降。
基准评测的外推风险。ProteinGym 等基准推动了领域发展,但也带来新问题:模型在基准上的性能提升能否转化为真实项目中的成功率?研究表明,部分在基准上表现优异的方法,在向序列空间更远区域外推时性能下降显著。对于工业应用,外推能力往往比内插精度更重要。
四、MatwingsVenus™(晓鹜™):功能预测驱动的工程闭环

MatwingsVenus™(晓鹜™)
上海天鹜科技自主研发的MatwingsVenus™(晓鹜™)蛋白质研发智能体,将蛋白质语言模型功能预测从论文基准推向了工业落地。以下数据均来自平台公开发表的学术成果与项目披露。
4.1 分层模型体系:从通用表征到垂直任务
平台功能预测能力建立在分层架构之上:底层是基于Transformer 的通用蛋白质大模型,在超大规模序列数据上预训练;在此基础上,针对不同功能任务开发垂直模型,覆盖突变效应预测、稳定性景观建模、功能酶挖掘等核心场景。
突变效应预测方向。平台的突变效应预测模型联合利用蛋白质序列、三维结构与同源进化信息,对候选突变的功能影响进行预测和排序。2025 年 4 月,该模型在 ProteinGym Substitution 基准上取得第一。2026 年一项国际学术评测中,基于 ProteinGym v1.3 数据集对百余款模型进行统一比较,该模型在 N=50 候选突变排序条件下取得 Spearman ρ=0.523,位居所比较的专业预测方法首位。该模型已在 VHH 抗体、DNA 聚合酶等多个实验体系中完成湿实验验证。
细粒度功能理解方向。VenusX 工作于 2026 年被 ICLR 接收,专注于蛋白质亚结构级的功能精细解析。
稳定性预测方向。稳定性景观学习模型(Venus-MAXWELL)发表于 NeurIPS 2025,解决了小样本下突变稳定性景观学习的效率问题。
4.2 干湿闭环:从"算得准"到"改得成"
功能预测的最终价值不在于数值精度,而在于能否指导出真正性能提升的突变体。MatwingsVenus™(晓鹜™)的差异化在于将预测能力接入了完整的干湿闭环:
研究人员通过自然语言提出优化目标(如"提升酶活性 3 倍同时保持热稳定性"),智能体自动调度功能预测模型进行突变热点识别、组合效应评估与多目标优化,输出精简的候选突变体列表;设计结果自动导入实验编排系统,由自动化平台完成表达纯化与功能表征;实验数据回传模型,启动下一轮迭代。
这种"预测—设计—验证—迭代"的闭环,使 PLM 功能预测从独立的计算任务,变成了定向进化研发流程中的核心驱动引擎。
科研人员可在MatwingsVenus™(晓鹜™)平台提交目标序列,获取功能预测与突变优化的初步方案。
4.3 落地验证:两个经同行评议的典型案例
功能预测的工业价值已在多个项目中得到同行评议验证:
l 环糊精酶多目标定向进化。针对胰腺炎诊断关键原料EPS-G7 的合成难题,团队通过 PLM 功能预测对环糊精酶进行多目标优化——同时提升转糖苷活性、降低水解活性、增强区域选择性。仅一轮模型预测即获得最优三点组合突变体,催化合成产物比例从 63% 提升至 98%,转糖基化/水解比率提高 12 倍,100 L 中试规模下产量达 161 g/L,纯度 99% 以上。成果发表于《Bioresource Technology》,天鹜科技为共同参与方。
l PET 水解酶功能挖掘。 基于功能挖酶模型,团队从数亿序列中直接筛选出高活性、高稳定性的 PET 水解酶候选,绕过了传统"先筛选再优化"的漫长路径。相关研究成果发表于 Nature Communications。
五、科研人员实用指南:PLM 功能预测四步法
对于正在开展蛋白质工程与计算生物学研究的团队,四条可操作的实践建议:
第一步:从零样本起步。 新项目先用零样本PLM 预测做初步位点排序,成本最低、启动最快;随着实验数据积累,再逐步过渡到微调模型和适应度景观建模。
第二步:先做小范围验证。 任何PLM 功能预测模型都应先在目标蛋白上做 10–20 个突变体的小规模验证,确认预测精度符合预期后再加大投入。
第三步:多目标选闭环方案。 单点预测容易,多目标平衡难。涉及活性、稳定性、表达量等多目标时,优先考虑能联合优化并提供实验验证闭环的平台。
第四步:当导航不当答案。 PLM 功能预测的核心价值是缩小搜索空间,最有效的模式是"PLM 预测 + 定向实验验证 + 迭代反馈",二者形成正循环。
六、展望:从"预测功能"到"设计功能"
蛋白质语言模型功能预测正在经历从"辅助注释"到"主动设计"的范式跃迁。未来 2–3 年,结构–功能联合建模、小样本与零样本能力突破、实验闭环深度整合三个方向的进展,有望进一步重塑领域格局。
MatwingsVenus™(晓鹜™)平台的实践表明,当超大规模蛋白质数据、功能预测大模型与自动化实验形成合力时,PLM 功能预测不再只是论文中的基准数字,而是能真正加速蛋白质从发现到落地的核心引擎。