返回列表

AI零样本预测:蛋白质工程如何摆脱突变试错?

发布于 2026年7月12日

AI零样本预测:蛋白质工程如何摆脱突变试错?

传统蛋白质工程改造酶、功能蛋白需要构建上万份突变体开展湿实验,研发周期长达数年、成本居高不下。AI零样本预测技术带来范式变革,依托蛋白质语言模型、逆折叠、多模态表征算法,无需目标蛋白实验数据,即可提前预判突变功能,大幅压缩实验量、缩短研发周期。依托该技术,蛋白改造周期从2-5年缩短至4-6个月,是工业酶、基因编辑工具、药物结合蛋白研发的核心升级方案。

在传统蛋白质工程中,改造一款目标酶或功能蛋白,往往需要构建数千乃至上万个突变体逐一检测活性,整体流程耗时数月甚至数年。这套“先做实验,再看结果”的研发模式,完全依靠大规模筛选碰运气,研发人员无法提前预判哪组突变能提升性能,只能依靠海量实验试错。

而AI零样本预测显著改变了这一局面:无需提前积累目标蛋白的突变实验数据,仅依靠AI对海量天然蛋白序列的学习沉淀,就能在实验前精准预判突变带来的功能变化,推动蛋白质工程从“被动试错”迈入“主动预知”全新阶段。


一、什么是AI零样本预测?无需实验数据即可预判蛋白突变效果

 

Computational Light Probing Protein Active Site Pocket

Computational Light Probing Protein Active Site Pocket

“零样本”核心定义:模型进行突变预测时,从未接触过该目标蛋白的任何功能实验数据,既不依赖目标蛋白自建突变文库,也不需要同源蛋白活性检测结果,仅依靠预训练阶段学习到的海量天然蛋白序列进化规律完成推理。

通俗类比:传统定向进化如同在陌生城市漫无目的地步行探索,每一条路线都需要实地走一遍才能知晓结果;零样本预测相当于提前拿到完整城市地图,即便从未走过目标路线,也能依据地图规律判断最优通行方案。

蛋白质语言模型(PLM)是零样本预测核心底层工具

这类模型借鉴自然语言处理技术,依托上亿条天然蛋白质序列完成自监督预训练,不依赖目标蛋白的定向湿实验数据,而是自主挖掘氨基酸序列、蛋白三维结构与生物功能之间的内在关联。

行业代表性模型ESM-2经过大规模序列预训练,仅输入蛋白序列就能判断单点突变对蛋白功能的影响。相关研究证实,ESM-2零样本预测输出的96个优质突变变体,可直接作为自动化蛋白进化平台的初始候选,大幅减少前期筛选工作量。

目前零样本预测主流分为三大成熟技术路线,适配不同蛋白研发场景:

蛋白质语言模型直接预测

依托掩码语言建模(MLM)完成训练,计算序列每个位点替换为其他氨基酸的适配概率。概率越高,代表该突变符合蛋白自然进化规律,更大概率维持甚至提升催化、结合功能,是无结构蛋白改造首选方案。

逆折叠模型约束优化(AiCE框架)

和语言模型从序列切入不同,逆折叠算法以蛋白三维结构为起点,反向推导可稳定折叠的氨基酸序列。AiCE基于ESM-IF1、ProteinMPNN等通用逆折叠模型,融合结构约束与进化约束,批量筛选高适配单突变、组合突变,无需针对每种蛋白单独训练模型,实现通用型零样本进化,适合有解析结构的酶、核酸工具改造。

多模态深度表征学习(ProMEP)

ProMEP同步融合约1.6亿条蛋白的序列、结构双维度信息,捕捉进化特征与物理化学约束,无需多序列比对(MSA-free)即可完成突变预测,在基因编辑蛋白改造场景中取得了优于现有方法的预测精度(据Cell Research 2024年研究)。


二、AI零样本预测三大核心优势,直击传统蛋白工程痛点

 

Data Grid to Protein Crystal Iteration Pipeline

Data Grid to Protein Crystal Iteration Pipeline

传统蛋白质工程长期存在三大行业瓶颈:实验通量有限、蛋白序列空间庞大、多突变协同效应难以预判。零样本预测有效应对上述痛点:

1.海量突变计算机预筛选,仅保留少量高潜力变体做实验

传统定向进化需要构建文库、蛋白表达、活性检测多轮循环,资源与时间消耗巨大。零样本预测可一次性批量评估上万组突变组合,直接筛出性能最优候选,有效缩减湿实验规模。

2025年《Nature Communications》研究案例:科研团队将蛋白质语言模型ESM-2的零样本预测与自动化生物铸造厂联动,搭建全自动蛋白进化平台。以tRNA合成酶为模型酶,AI先利用ESM-2零样本预测96个变体启动进化循环,实验数据回传训练多层感知机(MLP) 预测模型,10天完成四轮进化,酶活性最高提升2.4倍。同等改造效果,传统定向进化通常需要数月周期,研发效率实现显著提升。

2.精准评估组合突变,规避局部最优研发陷阱

传统改造大多仅引入少量单点突变,极易陷入局部最优,无法找到全局最优突变组合。零样本预测可同步评估多位点协同突变效应。

MODIFY集成框架结合蛋白语言模型与序列密度算法,自动剔除有害突变;搭配帕累托优化设计突变文库,在保证突变多样性的前提下筛选高适配变体,兼顾性能提升与序列广度,突破单点改造局限(据Nature 2024年研究)。

3.仅需蛋白序列,无三维结构也能开展改造

传统理性设计高度依赖高分辨率蛋白晶体结构,大量未解析结构的“孤儿蛋白”难以改造。而蛋白质语言模型驱动的零样本预测仅依靠氨基酸序列即可完成分析,拓宽蛋白改造适用范围。

ProMEP模型在基因编辑酶改造中落地验证:改造TnpB基因编辑酶,5位点突变变体编辑效率达74.04%,野生型仅24.66%;优化TadA碱基编辑器,15位点突变实现A-to-G转换频率77.27%,优于行业主流ABE8e工具,同时大幅降低脱靶、旁观者突变风险(据Cell Research 2024年研究)。


三、零样本预测三大底层技术突破,支撑产业化落地

上述三大技术路线之所以能够实现产业化落地,得益于以下关键突破:

1.蛋白质语言模型:自主学习蛋白进化内在规律

自监督预训练让模型读懂“蛋白语言”,自主识别氨基酸排列与功能的关联,不仅能捕捉局部序列特征,还可识别远距离氨基酸位点的协同、拮抗关系,精准预判多突变叠加产生的上位效应,无需实验数据就能评估组合突变效果。

2.逆折叠+结构约束融合(AiCE框架)

AiCE基于ESM-IF1、ProteinMPNN等通用逆折叠模型,通过学习“序列-结构”对应关系,评估突变时同步考量蛋白折叠稳定性,适配脱氨酶、核酸酶、逆转录酶等多类蛋白改造,覆盖几十至数千长度氨基酸序列,有益突变命中率可达较高水平,不同体系存在差异。(据Cell 2025年研究)。

依托AiCE优化的多款碱基编辑器性能全面升级:enABE8e将编辑窗口缩窄至5bp(较野生型ABE8e的9bp缩减约50%);enSdd6-CBE保真度提升1.3倍;线粒体编辑器enDdd1-DdCBE活性最高提升14.3倍(根据Cell 2025年研究)。

3.序列+结构多模态融合(ProMEP)

单一序列或单一结构信息存在局限性,ProMEP整合双维度表征,进化信息与空间物理约束互补,突变效应预测精度、运算速度同步提升,成为高性能基因编辑工具开发核心工具。


四、零样本预测真实产业价值,企业落地成果验证

 

Trial-and-Error Fragments vs AI-Guided Protein Crystal

Trial-and-Error Fragments vs. AI-Guided Protein Crystal

零样本预测不再局限实验室理论研究,已全面落地工业酶、基因编辑、创新药物蛋白研发赛道,带来三大明确产业收益:

1.研发周期大幅压缩

传统酶、功能蛋白完整改造周期2-5年,AI零样本预测前置筛选环节,整体研发周期缩短至4-6个月。

国内蛋白设计企业天鹜科技自研的 MatwingsVenus™(晓鹜™)平台,依托百亿级天然蛋白序列完成预训练,搭载成熟零样本预测算法,搭建从需求定义到优质序列输出的自闭环AI设计体系。据天鹜科技官网,平台凭借大模型强大的泛化能力,在无实验数据的情况下即可精准锁定高性能候选分子,实现研发周期跨越式缩短。

2.湿实验成本大幅降低

传统研发需要上万份突变样本逐一验证,AI零样本预测完成前置筛选后,仅需保留100个以内高潜力候选开展实验,大幅减少菌株构建、蛋白纯化、活性检测耗材与人力投入,研发成本显著下降。

3.拓宽蛋白改造边界

针对无解析结构、同源序列稀少、传统方法难以改造的孤儿蛋白,零样本预测仅依靠原始序列即可完成突变预判,填补传统技术空白。

4.赋能新药、新型生物材料研发

2026年6月《Nature》公开研究证明,研究团队采用NISE迭代策略,从头设计靶向两款小分子药物exatecan、apixaban的结合蛋白,设计成功率分别达到100%、83%,最优结合体亲和力达纳摩尔至皮摩尔级别(根据Nature 2026年研究)。

对exatecan结合蛋白做2个氨基酸定点替换后,亲和力再提升100倍,同时稳定药物易水解内酯环,延长药物作用周期。该成果证实,零样本预测技术不仅适用于工业酶活性优化,还可覆盖药物递送、生物传感、催化合成等多元化场景。

企业落地案例:天鹜科技AI蛋白改造服务

据天鹜科技官网及公开报道,MatwingsVenus™(晓鹜™)平台搭载成熟零样本预测算法,已落地30余项蛋白质定制改造项目,覆盖工业酶制剂、体外诊断、创新药、基因编辑工具四大领域,近10款产品实现产业化量产,多款自研酶性能达到或优于国际头部厂商同类产品。

依托零样本预测前置筛选优势,企业可同步完成多指标协同优化,兼顾催化活性、热稳定性、底物特异性、耐酸碱等工业刚需,一站式解决传统蛋白改造周期长、成功率低、成本高的痛点。


五、行业新趋势:零样本预测重构蛋白质工程底层范式

纵观蛋白工程行业发展历程,技术已经完成从“天然筛选、人工试错”到“AI零样本精准预知”的关键跃迁,完整覆盖突变预测、全新序列设计、候选文库筛选全流程:

预测环节:IECata、ESM-2等深度学习模型,零样本预判kcat/Km等核心动力学参数,快速筛除无效突变(根据2025年发表于PMC的研究);

设计环节:RFdiffusion等扩散模型生成目标骨架,ProteinMPNN/ESM-IF等逆折叠模型为骨架设计氨基酸序列,定向优化催化位点、药物结合口袋;

筛选环节:机器学习直接通过原始序列预判蛋白活性、底物选择性,省去大量前期预实验。

AI零样本预测技术落地分为三个发展阶段:第一阶段仅作为结构解析、机理预测辅助工具;第二阶段实现从零生成全新高活性蛋白序列;现阶段可同步平衡活性、稳定性、选择性多重指标,一站式解决工业化应用复杂约束。

传统蛋白工程逻辑是“先实验,后验证”,实验是唯一筛选手段;零样本预测构建了全新逻辑:“先计算,后验证”,AI承担绝大部分筛选工作,湿实验仅用于少量优质变体性能确认。这场变革的行业意义,等同于手工绘图升级为CAD计算机建模,将大量重复性实验体力工作转化为AI智能计算。

2025年《Cell》相关AiCE研究明确提出:理想蛋白工程方案应当以最少实验工作量实现最优改造效果,零样本预测正是该理念的最优落地路径。依靠海量预训练序列知识替代重复湿实验,依靠模型推理替代人工经验试错。

未来,伴随AI蛋白质模型持续迭代,蛋白催化活性、药物结合能力、编辑效率等性能指标都将成为可定制、可编程的标准化属性。无论是生物发酵工业酶、临床基因编辑药物、小分子靶向结合蛋白,均可通过零样本AI预测快速定制高性能蛋白产品,有效突破传统技术带来的产能、成本、性能瓶颈,驱动合成生物学、生物制造产业规模化高速发展。