AI蛋白研究:从"读天书"到"编代码",生命科学正在经历什么?
发布于 2026年7月16日

如果把生命比作一台精密的机器,蛋白质就是机器里各司其职的核心零件:结构支架、催化酶、信号开关、物质运输载体。人类基因组编码约2万个蛋白编码基因,加上翻译后修饰和可变剪接,实际功能蛋白质的种类远超这个数字,每一类都拥有独一无二的三维空间结构与生物功能。
过去数十年,全球科研人员都在“解读”蛋白质这本生命天书——基因测序、结构解析、功能验证,全程依托人工实验摸索。而人工智能的介入,正式将蛋白研究从阅读时代推入可编程编写时代,这也是当下生命科学最具变革性的赛道:AI蛋白研究(AI-driven Protein Research)。
一、AI蛋白研究,到底在研究什么?

Three Key Research Areas in AI Proteomics
AI蛋白研究,是依托人工智能大模型、深度学习算法、多序列比对、分子动力学模拟等技术,围绕蛋白质结构解析、功能优化、从头设计、场景验证全流程开展的智能化科研体系,区别于传统依赖生物实验试错的研发模式,实现了“算法推演优先、实验精准验证、数据闭环迭代”的全新科研逻辑。
行业通常将AI蛋白研究分为三大核心方向:
1. 蛋白质结构预测——"看清"蛋白质的样貌
这是AI在蛋白质领域最先取得突破的方向。2021年AlphaFold 2在CASP竞赛中实现接近冷冻电镜精度的蛋白单体结构预测,攻克了困扰结构生物学近50年的蛋白质折叠难题。2024年诺贝尔化学奖授予了蛋白质设计领域的David Baker、Minkyung Baek,以及蛋白质结构预测领域的Demis Hassabis和John Jumper,正式标志着这一方向获得了科学界的最高认可。
今天,结构预测已经从"单点突破"走向"全面覆盖":从单链蛋白到蛋白复合物、蛋白-配体复合物、蛋白-核酸复合物,再到蛋白质构象动态变化预测——AI正在逐步揭开蛋白质结构的完整图景。2026年最新发表在 Communications Biology 上的综述指出,结构生物学正进入"第二波浪潮":蛋白质构象全景预测和高亲和力蛋白结合体的常规从头设计,正在成为两个全新的前沿方向。
2. 蛋白质功能预测——"读懂"蛋白质的作用
知道了结构,还得知道它"干什么"。
AI功能预测要回答的问题包括:这个蛋白和谁结合?催化什么反应?在什么条件下稳定?可能有什么副作用?传统方法依赖昂贵且耗时的实验测定,而AI可以通过序列和结构数据快速推断蛋白质的功能属性——从酶的催化活性,到抗体的亲和力,再到蛋白的热稳定性和溶解度。
蛋白质语言模型(Protein Language Model)的兴起,让这一方向取得了突破性进展。这类模型在数十亿条蛋白质序列上训练,学会了氨基酸序列的"语法规则",能够像大语言模型理解文字一样理解蛋白质——不需要明确知道它的结构,就能预测它的功能、稳定性甚至相互作用。
3. 蛋白质从头设计——"创造"全新的蛋白质
这是AI蛋白研究的最高阶形态,也是最具想象力的方向:不依赖任何已知的天然蛋白模板,从零开始设计出自然界从未存在过、但具有特定功能的全新蛋白质。
行业内称之为从头蛋白质设计(De Novo Protein Design)。它的逻辑是反向的:先定义你想要的功能,AI直接生成满足功能的氨基酸序列。
2025年以来,这个方向进展尤为迅速。斯坦福大学与SLAC国家加速器实验室的研究团队开发出一种快速蛋白质设计方法,从一个设计蛋白出发,衍生出两种功能完全不同的新蛋白——其中一种是迄今为止活性最高的人工设计酶。南京大学团队则通过AI设计出名为"SuperMyo"的超稳定蛋白质,其机械展开力达到天然同类蛋白的五倍以上,熔解温度超过100°C,且在150°C极端高温下仍能维持结构与功能完整性,相关成果发表于 Nature Chemistry。
这些进展意味着,AI蛋白研究已经从"分析已有"迈向"创造未有"的新阶段。
二、AI蛋白研究带来三大颠覆性产业变革
技术的进步最终要落到产业价值上。AI蛋白研究的意义,不只是发表了多少论文,而是它实实在在地提升了蛋白质研发的效率、降低了成本、拓展了可能性。
1. 筛选逻辑转变:从"大海捞针"到"定向设计"
传统蛋白质工程的核心痛点是"大海捞针"。一条300个氨基酸的蛋白存在20³⁰⁰种序列组合——这个数字远超可观测宇宙中的原子总数。天然随机突变如同在宇宙中找一颗特定的星球,成功概率微乎其微。
AI从根本上改变了搜索逻辑。它不是"随机试",而是"有方向地找"——基于对蛋白质序列-结构-功能关系的深度理解,在巨大的序列空间里直接定位到"有希望"的区域,把需要实验验证的候选数量从几十万压缩到几十甚至几个。
据行业测算,传统蛋白改造的实验阳性率约为千分之一量级;而在AI辅助设计的项目中,候选蛋白的有效命中率可提升一到两个数量级,研发周期从年级缩短到月级,实现效率的数量级飞跃。
2. 性能边界拓宽:突破天然蛋白进化局限
天然蛋白质是数十亿年进化的产物,但进化的目标是"生存",不是"工业生产"或"人类治病"。天然蛋白往往只适配常温、生理pH等温和环境,而工业制造和创新药往往需要蛋白耐受高温、强碱、高有机溶剂等极端条件。
AI从头设计打破了这个限制。既然不依赖天然模板,就能设计出自然界根本不存在的稳定结构和催化功能。针对传统方法难以开发的"光滑无结合口袋"难成药靶点——那些表面平滑、缺少典型结合位点的蛋白,AI也可以直接设计高亲和力结合蛋白,拓宽药物开发可覆盖的靶点范围。
3. 研发模式:从"专家依赖"到"平台化生产"
传统蛋白工程高度依赖资深专家的经验。一个成熟的蛋白工程师往往需要十年以上的训练周期,人才供给长期制约行业扩张。
AI产业化平台正在改变这一点。通过将行业通用的专家知识、成熟的算法流程内置到平台系统中,实验人员可以借助AI工具自主完成大部分蛋白改造与设计工作,降低了行业的准入门槛,也加速了生物医药、合成生物等企业的管线扩张速度。
三、AI蛋白研究的技术底座:不是一个模型,而是一套体系

AI Protein Three-Layer Technology Platform
大众普遍误以为AI蛋白研究等同于单一结构预测模型,完整产业级AI蛋白体系分为三层递进架构:
第一层:基础模型层。 包括蛋白质结构预测模型、蛋白质语言模型、扩散生成模型等。这些模型是"底座",通过在海量数据上训练,获得对蛋白质的通用理解能力。目前业内代表性的技术路线包括基于扩散模型的结构生成、基于大语言模型的序列生成、以及两者的融合方案。
第二层:专用工具层。 在基础模型之上,是大量针对特定任务优化的专业工具——亲和力预测、稳定性预测、成药性评估、信号肽设计、密码子优化、表达量预测……每一个子问题都有对应的算法和工具。
第三层:闭环系统层。 这是最关键、也是最难的一层。单独的模型和工具只能解决计算端的问题,而真正的蛋白质研究需要"设计—合成—表达—纯化—检测—反馈"的完整闭环。AI设计出来的蛋白能不能表达、有没有活性、稳定性够不够,最终要靠湿实验来验证。
2025年《Nature Reviews Bioengineering》综述明确:AI正在把蛋白工程从随机试错转化为可预测、可复现的工程化学科,而落地的核心支撑正是“AI设计-实验验证”闭环体系。
据多家行业研究机构测算,2025年全球AI蛋白质设计市场规模约为5–15亿美元(差异源于统计口径:窄口径仅计入AI设计软件与服务,宽口径包含整个蛋白质工程相关市场),预计未来数年将保持15–20%的年复合增长率。市场高速增长的底层逻辑,正是产业端对完整干湿闭环研发体系的旺盛需求。
四、产业实践:MatwingsVenus™(晓鹜™)平台干湿闭环探索
在全球AI蛋白研究的浪潮中,中国企业也在快速跟进并形成自己的特色。以上海天鹜科技旗下 MatwingsVenus™(晓鹜™) 平台为代表,国内企业走的是一条"AI设计+自动化实验+产业落地"的全链条路径。
MatwingsVenus™(晓鹜™)平台的核心思路,是把AI蛋白研究从"算法工具"升级为"干湿闭环的研发基础设施"。具体来说,体现在三个层面:
第一,对话式交互降低门槛。 平台采用对话式智能体架构,用户用自然语言描述需求,智能体自动完成任务拆解、工具调用、方案设计和结果呈现。这让不熟悉计算生物学的实验人员也能快速用上AI蛋白设计能力,而不必学习复杂的算法和软件操作。
第二,整合式工具链覆盖全流程。 平台整合了200余种专业蛋白质设计工具和大规模功能注释数据库,从结构预测、序列设计、性质评估到突变优化、成药性分析,覆盖蛋白质研究的主要环节。用户不必在不同工具之间来回切换,在一个平台上就能完成完整的设计工作流。
第三,干湿闭环确保落地性。 更关键的是,MatwingsVenus™(晓鹜™)平台将云端AI设计与自动化湿实验平台无缝衔接——AI设计的序列可以直接驱动自动化实验室进行合成、表达、纯化和功能检测,实验结果再回喂给模型优化下一轮设计,每一轮实验都让AI变得更准,每一次迭代都让研发效率更高。
目前平台已在多个方向验证了这一模式的有效性:在免疫调控受体靶点的从头结合剂设计项目中,数十个AI设计的分子在体外实验中展现出明确的细胞阻断活性;在甜味蛋白Monellin的改造项目中,经过多轮迭代,多个样本的甜度相比野生型提高了十几倍,同时耐热性维持在75°C的高位区间。
这些案例说明,AI蛋白研究不只是论文里的概念,而是已经在中国企业的实践中产生了实实在在的产业价值。
五、AI蛋白研究的下一站:从工具到基础设施
如果回看过去十年AI蛋白研究的发展,你会发现一条清晰的演进路径:
2010年代末:深度学习开始用于蛋白质结构预测,精度逐步提升
2021年:AlphaFold 2取得结构预测的突破,"AI能看清蛋白"
2023–2024年:扩散模型和生成式AI进入蛋白质设计领域,"AI能设计蛋白"
2025–2026年:AI设计与自动化实验的闭环体系逐步成熟,"AI能交付有功能的蛋白"
每一步都在往前走,每一步都在把AI蛋白研究从"论文成果"推向"产业基础设施"。
当然,挑战依然存在。2026年发表在Nature Machine Intelligence上的观点文章指出,蛋白质语言模型的可解释性亟待加强——不能是事后补做的附加项。此外,数据质量、实验成本和人才培养等问题也需行业共同面对。
但方向是明确的。当AI越来越懂蛋白质,当实验验证越来越自动化,当设计-验证的闭环越来越高效——蛋白质研发正在从一门依赖经验和运气的手艺,变成一门可预测、可复现、可规模化的工程学科。
对于中国的生命科学产业来说,这不仅是技术升级的机遇,更是实现供应链自主可控的重要抓手。从抗体药到工业酶,从疫苗到合成生物——每一个依赖蛋白质性能的领域,都可能因为AI蛋白研究的进步而迎来效率的系统性提升。
AI蛋白研究的故事才写了第一章,但它的最后一章,可能远比我们今天能想象的更加宏大。