蛋白质功能预测:从序列到功能的智能解码
发布于 2026年7月27日

截至2026年6月,UniProtKB/Swiss-Prot(人工审编)包含575,503条序列条目,UniProtKB/TrEMBL(计算推导)包含149,234,636条序列条目。人工审编条目占比仅约0.38%。这意味着超过99%的蛋白质缺乏经过实验验证的完整功能注释,同时GO本体每年持续新增数百个功能类别。绝大多数已知蛋白质的生物学功能仍然处于未知状态。
填补这一序列-功能鸿沟,正是蛋白质功能预测的核心使命。
一、什么是蛋白质功能预测
蛋白质功能预测是生物信息学的核心任务之一,旨在为一条氨基酸序列赋予标准化的功能标签:它催化什么反应(EC编号)、参与哪些生物学过程(GO生物过程)、在细胞中定位何处(GO细胞组分)、具备何种分子功能(GO分子功能)。
蛋白质功能预测对于解析疾病机制、挖掘药物靶点、赋能生物技术开发具备基础性价值。传统功能注释高度依赖湿实验,周期长、成本高昂、通量有限。随着高通量测序快速发展,新发现蛋白序列呈指数增长,实验验证的速度远远跟不上序列积累速度。
供需矛盾持续推动计算预测方法不断迭代演进。
二、技术演进:从同源比对到多模态智能推理

Three Generations of Protein Function Prediction
2.1第一代:序列同源比对
早期功能预测高度依赖BLAST等序列比对工具,基于序列相似性通常源于同源进化进而暗示功能保守的假设,将未知序列与数据库内已注释的同源序列做相似度匹配,转移功能注释。该方法在序列一致性高于40%时可靠性较高,面对远缘同源(序列一致性<25%)、孤儿蛋白时准确性显著下降。
2.2第二代:深度学习分类器
随着深度学习兴起,DeepGO等模型将GO功能预测定义为多标签分类任务,依托深度神经网络从序列特征中学习功能标签映射关系。后续DeepGO-SE进一步融合蛋白质语言模型与蛋白相互作用网络;有研究提出POSA-GO,将GO术语拓扑结构引入自注意力机制,实现对GO层级关系建模。
但分类器范式存在固有局限:传统分类器范式常将GO术语作为独立多标签处理,虽有部分模型引入GO层级结构,但封闭集监督学习的本质使其难以适配每年新增的功能类别。一旦GO本体出现训练集中不存在的新功能标签,传统封闭集监督学习范式便难以生效。
2.3第三代:多模态融合智能推理

Protein Language Model & Structure Integration
当前前沿方向迈入多模态智能推理阶段,学界普遍认为,序列信息与三维结构信息协同融合是提升预测精度的关键。HiFusionPro采用层级融合架构深度整合序列与结构信息,以蛋白质语言模型初始化结构编码器,实现早期特征共享,聚合多层级中间表征,克服传统后期特征拼接融合的短板。
RIMGOGraph将结构预测模型输出的三维结构转化为残基相互作用图,与蛋白语言模型嵌入联合训练,实现感知结构信息的功能预测;StructSeq2GO同样利用图表示学习提取结构特征,并与ProteinBERT序列嵌入融合;另有研究构建了多通道深度学习框架,在功能注释极度稀疏的数据背景下,实现稳健的蛋白质功能预测。
ProtDML另辟蹊径,依托距离度量学习显式建模功能标签之间的关联,通过相似性加权的推拉损失构建具备注释感知能力的特征空间,在CAFA3基准测试全部本体上取得最低语义距离。
三、零样本预测:破解“未见功能”的难题

Zero-Shot Prediction Workflow
蛋白质功能预测面临一大核心挑战:GO类别长尾分布且持续新增,超过2万个GO术语下,拥有实验注释的蛋白不足100个。传统监督学习无法处理训练阶段从未出现的全新功能类别,零样本功能预测成为突破该瓶颈的重要范式。
COSMOS(Context-aware GO Subgraph Mining System)构建包含近800万条功能语义关系的知识图谱,整合蛋白功能注释、GO层级关系、蛋白质相互作用、结构相似性信息。COSMOS摒弃全局图嵌入思路,针对目标蛋白的待预测功能提取局部子图,依靠多关系消息传递神经网络精准捕捉子图拓扑逻辑。
在零样本预测任务(训练集与测试集GO类别无交集)中,COSMOS分子功能分支Fmax可达0.915,相比DeepGOGATSE提升21.8%;在少样本、低同源测试条件下,Fmax分别领先最优基线13.8%、19.9%,在更复杂的生物过程分支上同样取得显著提升。消融实验证明,融合蛋白质相互作用与结构相似性信息,可为模型带来超过90%的性能提升(数据来自COSMOS原始论文的内部对照实验)。
COSMOS在真实案例中展现出优秀推理能力:针对SIRT6蛋白,模型不仅准确预测经典组蛋白去乙酰化酶活性,还识别出训练集时间节点之后才被实验证实的长链脂肪酰赖氨酸脱酰酶活性,并提供可追溯的子图推理路径作为预测依据。
MZSGO提出以“语义对齐”为核心的多模态零样本功能注释框架。模型同步编码蛋白质序列特征与结构域文本描述,借助大语言模型为结构域描述、GO标签构建统一语义空间,将分散的生物实体与功能概念嵌入同一可对比向量空间。零样本场景下,MZSGO针对未见标签的整体调和均值H达到0.6669,显著优于同类方法。
ProtNote依托自由格式文本,同时支持监督、零样本两种模式下的蛋白质功能预测,既能维持训练集注释预测精度,也可泛化至训练未覆盖的全新功能。STAR-GO基于Transformer联合建模GO术语语义与层级结构特征,进一步强化零样本推理能力。
四、评估基准:CAFA与ProteinGym
蛋白质功能预测模型需要标准化基准完成客观性能对比。
CAFA(Critical Assessment of Function Annotation)是蛋白质GO功能注释领域权威国际竞赛,专门面向蛋白功能预测任务。InterLabelGO⁺在CAFA系列挑战中表现优异;ProtDML在CAFA3基准全部本体上实现最低语义距离。
ProteinGym是大规模标准化基准套件,主要用于蛋白质突变适应度、突变效应预测,涵盖250余项深度突变扫描(DMS)实验、数百万突变序列,覆盖丰富蛋白家族与变异类型;该基准并不直接面向GO功能注释任务,多用于评估突变功能变化预测模型。
两类基准面向不同任务场景,为不同方向AI蛋白模型提供统一标尺,持续驱动领域技术迭代。
五、产业应用:从实验室到生产线

From Laboratory to Production
蛋白质功能预测技术正加速从学术研究走向产业化落地。
2025年3月,上海交通大学洪亮教授团队发布Venus(启明星)系列模型。与聚焦蛋白质结构预测的模型不同,Venus系列瞄准序列-功能预测这一核心目标,学习自然界蛋白质序列组织规律及其与功能的内在关联,其预测蛋白质突变功能的精度位居行业榜单之首。
团队建立的蛋白质序列数据集Venus-Pod含有近90亿条蛋白质序列,包含数亿个功能标签,是全球数据规模最大、功能批注标签最多的数据集,也是另一行业知名模型训练用的21亿蛋白质序列的4倍体量。具体构成为:36.2亿条陆地微生物蛋白质序列、26.4亿条海洋微生物蛋白质序列、24.3亿条抗体蛋白质序列、0.6亿条病毒蛋白质序列。Venus系列具备两大核心能力:AI定向进化与AI挖酶。配套开发了全球首款高通量大体积蛋白质表达、纯化与功能检测自动化一体机,可24小时不间断完成100余个蛋白的表达、纯化与检测,综合效率相比人工提升近10倍。
目前,Venus系列模型设计的多款蛋白质已实现产业化落地。在金赛药业单域抗体耐碱性改造项目中,借助模型指导改造,不到1年将普通单域抗体耐碱性提升4倍。平台现已为多家国内外企业开发数十款蛋白质产品,覆盖生物医药、生物能源、食品加工等赛道,多款产品实现产业化应用。
六、挑战与展望
尽管领域进展迅猛,蛋白质功能预测依旧面临多重挑战:
数据稀疏与长尾问题。每年持续新增数百条GO功能类别,传统监督学习难以适配全新类别,零样本泛化能力成为衡量模型长期价值的关键指标。
模型可解释性不足。深度学习模型常被视作“黑箱”,而生物学研究要求预测结果可追溯、可验证;COSMOS可输出子图推理路径、MZSGO建立语义对齐机制,代表可解释功能注释的前沿方向。
计算预测不能替代湿实验验证。所有AI预测结果最终仍需要实验佐证,但AI的核心价值,是将海量候选序列快速收敛至最具备研究价值的目标,大幅压缩研发试错空间。
未来技术趋势清晰可见:
多模态融合持续深化——序列、三维结构、蛋白相互作用、文献文本信息深度融合,持续提高预测精度;
零样本推理能力持续突破——模型具备识别训练从未见过的全新功能类别的能力;
预测与设计一体化——平台不仅回答“该蛋白具备什么功能”,更进一步指导“如何改造蛋白获得目标性能”。
从同源序列比对到多模态智能推理,从被动注释到主动推理,蛋白质功能预测正在系统性解码庞大的蛋白质“暗物质”。它为数十亿条功能未知的蛋白序列搭建起从序列到功能的快速通路,也为新药发现、酶资源挖掘、合成生物学创新筑牢数字化底层底座。