如何从数据库挖掘新酶?AI酶挖掘实战指南
发布于 2026年8月18日

在生物催化、合成生物学与工业酶制剂领域,发掘具备全新功能或更优性能的新型酶,始终是产业与基础研究的核心驱动力。传统酶挖掘高度依赖微生物分离培养、体外活性追踪等实验手段,普遍存在周期漫长、筛选通量低、阳性成功率有限等短板。随着高通量测序技术普及、公共蛋白质数据库数据呈指数级扩张,依托计算生物学开展数据库驱动的酶挖掘,现已成为领域内主流且高效的技术路线。
UniProtKB数据库已收录数亿条蛋白质序列,如何在海量序列中精准筛选目标候选酶,是一套体系化的生物信息学工程。本文整合主流公共数据库资源、传统序列挖掘策略与新一代AI技术范式,系统梳理从公共数据库挖掘新酶的完整技术流程。
一、核心数据库:酶挖掘的数据资源底座

The Enzyme Mining Data Stack
开展酶挖掘首先需要明确数据源,四类数据库构成现阶段计算酶挖掘的基础设施:
序列与功能注释数据库。UniProt是该方向最核心资源。UniProtKB包含人工审编的Swiss-Prot与自动注释的TrEMBL数据集,整合蛋白质序列、功能注释、三维结构信息、突变位点、翻译后修饰等多维度信息,绝大多数酶挖掘项目均以UniProtKB作为起始数据源。补充数据库包括NCBI nr(非冗余蛋白库,覆盖最广)、RefSeq(参考序列库,质量较高)。
酶学专用数据库。BRENDA收录经过实验验证的酶学数据,是全球最完备的酶信息系统,覆盖超8000个EC编号、约9万条酶条目及数百万条动力学/配体/文献注释,所有信息源自文献人工整理,是校验计算预测结果的关键参照。其他常用酶学数据库还包括:KEGG/MetaCyc(代谢通路与酶反应)、CAZy(碳水化合物活性酶,工业酶领域核心数据库)、ExplorEnz(酶命名与分类权威资源)。
宏基因组数据库:解锁未培养微生物酶资源。自然界超过99%微生物无法通过传统纯培养手段获得;宏基因组测序直接提取环境样品全部DNA,绕过微生物培养瓶颈。gcMeta等标准化宏基因组数据库搭建起序列挖掘与功能开发之间的桥梁,提供适配AI分析的标准化数据集。国际主流宏基因组库还包括IMG/M(联合基因组研究所)、MGnify(EMBL-EBI)。
国内研究团队利用机器学习解析万余个宏基因组组装基因组(MAGs),识别出数百万条酶序列,归属于近十万个同源蛋白簇,蕴藏大量尚未开发的天然酶资源。
蛋白质结构数据库:AlphaFold DB补齐结构维度。AlphaFold预测结构已覆盖超2亿条UniProt条目。ActSeek等工具支持在预测结构库中检索活性位点空间构象相似的蛋白,为酶挖掘开辟独立于序列相似度的结构筛选维度。结构数据库还包括实验结构库PDB、ESM Atlas(ESMFold预测结构库)等。
二、传统酶挖掘方法:序列相似性驱动的经典路线

The Twilight Zone of Homology
BLAST同源检索:最基础的起始手段。BLASTp是新酶挖掘的入门级工具。研究者以一条功能已知的目标酶作为种子序列,通过BLASTp在蛋白质数据库中检索同源序列。例如在新型4-乙烯基愈创木酚(4-VG)氧化酶挖掘研究中,团队以CSO2为种子序列,从UniProtKB筛选得到大量同源序列开展后续分析。
当序列一致性低于约30%(典型twilight zone;低于约20% 进入midnight zone)时,依靠序列相似度的同源检索极易失效——远缘同源蛋白可能仍具有相似功能,但序列层面已“面目全非”。大量远缘同源、具备潜在新催化功能的蛋白会被遗漏。实际筛选中,需结合E-value(期望值)阈值与序列覆盖度综合判断,具体阈值依酶家族保守程度而异。
多序列比对、系统发育分析与序列相似性网络。借助Clustal Omega、MUSCLE完成多序列比对,构建系统发育树,在酶家族进化分支中识别具备功能分化潜力的进化离群序列,是进阶筛选策略。
序列相似性网络(Sequence Similarity Network, SSN)是大规模酶家族分析的利器。与传统系统发育树相比,SSN以网络可视化方式呈现数千条序列之间的相似性关系,可直观划分功能聚类、识别潜在的新功能分支。一项基于BRENDA的阿魏酸酯酶研究,获取2085条目标序列,通过蛋白相似ity网络解析划分出三大聚类,指导候选酶分层筛选。
隐马尔可夫模型(HMM)与保守结构域筛选。Pfam数据库(现已整合入InterPro)提供大量蛋白结构域HMM模型,搭配hmmscan/hmmsearch工具,可以快速富集携带目标保守结构域的候选序列。与BLAST相比,HMM对远缘同源的识别能力更强,且能准确定位保守功能结构域的位置,是高效精准的过滤方案。
三、AI驱动的酶挖掘:从“相似序列检索”走向“功能推理”
以蛋白质语言模型(PLM)为代表的人工智能方法,正在重塑酶挖掘的能力边界。ESM系列(ESM-1b/ESM-2/ESM-3)等模型通过学习海量天然蛋白序列,将氨基酸序列转化为高维嵌入向量;在嵌入空间内,功能相近的蛋白质即便序列一致性极低,向量距离依然更近。
基于嵌入空间的功能相似性检索是该思路的典型应用:研究者以功能已知的种子酶为查询,在嵌入空间中检索向量距离最近的蛋白,从而发现序列差异大但功能相近的远缘同源酶。2025年发表于《Nature Communications》的ESM-Ezy研究正是这一思路的代表,该方法利用ESM-1b的嵌入空间进行相似性计算。在多铜氧化酶、L-天冬酰胺酶等多类酶的挖掘案例中,这类方法均取得了比传统BLAST更高的远缘挖掘命中率——44%的候选酶在至少一项性能指标上优于已知酶,包括催化效率、热耐受性、有机溶剂耐受性和pH稳定性,其中51%在环境修复应用中表现突出。在L-天冬酰胺酶的挖掘中,40%的候选酶比已知酶具有更高的比活力和催化效率。
机器学习分类器与酶性质预测模型。机器学习模型可以将数万条候选序列压缩至少量高潜力靶点。模型能够预测酶最适温度、最适pH、热稳定性、可溶性以及动力学参数Km、kcat。在4-VG氧化酶挖掘工作中,研究者首先利用CataPro预测1500条候选序列动力学参数,筛选前150条,结合结构聚类最终锁定5条开展实验验证;最优变体SsCSO催化活性较参考酶提升19.53倍。
整合式自动化挖掘工作流。Gene Surfing是基于Snakemake流程框架搭建的生物信息学分析流程,集成数据质控、基因组组装、功能注释、同源序列检索模块。已发表验证案例显示,该流程识别超131万条潜在木质纤维素降解酶序列,127条完成功能验证,活性阳性比例达84.25%;聚乙烯降解酶挖掘中,38条候选异源表达验证,活性阳性率81.5%。
四、实践流程:从零开始挖掘新酶标准化方案

enzyme database landscape
第一步:明确挖掘目标,收集种子序列。清晰定义目标催化功能(耐热脂肪酶、PET降解酶、氧化酶等),收集2—5条经过实验验证、高可信度种子序列,优先选用Swiss-Prot人工注释条目。若需构建高质量HMM模型,则建议收集10+条覆盖不同进化分支的代表性序列。
第二步:初步扩增同源序列。采用BLASTp以种子序列为查询,在UniProtKB检索序列,先用较宽松的E-value(如1e-5至1e-20,依家族大小调整)和覆盖度(50–70%)扩增近—中同源序列;再用InterPro/Pfam结构域校验剔除假阳性;低于 ~30% 一致性的远缘候选进入第三步AI富集。
第三步:AI驱动候选富集(核心环节)。针对低相似度区间容易被BLAST漏掉的远缘同源蛋白,利用ESM系列蛋白质语言模型生成序列嵌入,在嵌入空间检索与种子序列功能相近的蛋白;同时借助机器学习模型批量预测候选酶关键理化性质与动力学参数。
第四步:结构模拟与候选优先级排序。利用AlphaFold预测高优先级候选酶三维结构;采用TM-align评估整体结构相似度,结合ActSeek/活性位点比对进一步评估催化功能保守性。综合序列新颖程度、预测催化性能、结构合理性开展多目标排序。
第五步:湿实验功能验证。选取排名前10—50条候选酶,完成基因合成、异源表达与体外活性测试。在功能定义明确的酶家族中,经过AI多轮筛选后,候选酶实验阳性率可达到80%以上。
五、总结与展望
数据库导向的新酶挖掘,已经从单一BLAST同源检索,演进为「公共数据库检索 + AI功能预测 + 结构校验 + 湿实验验证」一体化技术体系。传统序列比对擅长寻找序列相近的同源蛋白,而AI模型能够实现跨序列相似度限制的功能预判,在庞大序列空间中锁定高性能候选,将待验证序列规模从数千条压缩至数十条。
UniProt提供序列广度,BRENDA提供实验功能信息深度,宏基因组数据库拓展未培养微生物来源的酶资源维度;人工智能则成为串联多源数据、实现高通量精准挖掘的核心引擎。远缘挖掘命中率提升、自动化流程超80%实验阳性率、AI筛选助力酶活性数十倍提升等案例共同印证:计算导向酶挖掘正式迈入“AI优先(AI-first)”时代。
与此同时,该体系仍存在局限:蛋白质语言模型存在功能预测假阳性;AlphaFold静态结构难以反映构象动态变化;大量宏基因组来源序列缺少注释信息,增加筛选难度。未来,从数据库挖掘获得的天然酶不仅可直接作为生物催化剂投入应用,还能作为模板启动AI辅助定向进化,打通「天然酶挖掘→理性改造」完整研发链条,持续加速生物催化技术落地。