UniProt蛋白质查询教程:搜索框到底该输什么?
发布于 2026年8月24日

注:本文操作和数据基于UniProt 2026年版本,具体界面和功能以官网最新版本为准。
在蛋白质工程与生物信息学研究中,蛋白质序列与功能信息的查询是最基础也最核心的工作环节。无论是研究一个陌生蛋白的功能、寻找同源序列,还是为后续实验设计提供依据,UniProt都是绕不开的第一站。
UniProt(Universal Protein Resource)是全球领先的、高质量且免费的蛋白质序列与功能信息资源库。它由欧洲生物信息学研究所(EMBL-EBI)、瑞士生物信息学研究所(SIB)和PIR(蛋白质信息资源,乔治城大学)三家机构组成的UniProt Consortium共同维护。
一、UniProt的核心组成:理解你正在查什么

Core components of the UniProt database
在进行查询之前,首先需要了解UniProt的数据结构。UniProt由多个相互关联的数据库组成,其中最核心的是UniProtKB(UniProt Knowledgebase,知识库)。
UniProtKB分为两个互补的部分:
UniProtKB/Swiss-Prot(已审编/Reviewed):这部分条目由专家团队进行人工审编。审编人员会系统性地阅读科学文献,结合计算分析结果,为每条蛋白质记录添加功能描述、结构域信息、亚细胞定位、疾病关联、翻译后修饰等高质量注释。Swiss-Prot中的数据可靠性高、注释丰富,是进行功能研究的首选数据源。目前Swiss-Prot已收录 575,503条经过人工审编的蛋白质序列(截至2026年6月)。
UniProtKB/TrEMBL(未审编/Unreviewed):这部分条目的注释由计算系统自动完成,尚未经过人工审核。TrEMBL的数据主要来自核酸序列数据库的编码序列翻译,覆盖范围极广,但注释质量参差不齐,使用时需要用户自行判断。
重要更新:自2026年起,UniProt对TrEMBL的收录策略进行了重大调整——从“全面收录”转向“精选收录”,仅保留具有实验证据或生物学重要性的条目,以及参考蛋白质组序列;大量未分类物种和宏基因组来源的条目被转入UniParc归档库。因此TrEMBL的总条目数较此前的峰值(约2.5亿条)已有明显下降。
简单来说,做精细研究用Swiss-Prot,做大规模筛查用TrEMBL,两者结合则覆盖最全。
除了UniProtKB,UniProt还提供了其他几个重要数据集:
Proteomes:按物种组织的完整蛋白质组数据集,涵盖从细菌到人类的数千个物种;
UniRef:按序列相似度聚类的非冗余数据库(分为UniRef100、UniRef90、UniRef50三个层级),用于提高大规模搜索和比对的效率;
UniParc:作为序列归档库,收录所有出现过的蛋白质序列且每条只存一次,是查找历史序列和被移除条目的主要来源。自2026年TrEMBL精简后,UniParc的这一作用尤为重要。
二、基本查询:从搜索框开始
2.1最简单的搜索方式
在UniProt首页顶部的搜索框中,你可以直接输入以下内容进行快速检索:
蛋白质名称,如胰岛素、p53、白细胞介素-6(IL-6)
基因名称,如BRCA1、TP53
UniProt登录号,如P01308(胰岛素的UniProt ID)
物种名称,如人类、小鼠
关键词组合,如“激酶人类”
输入关键词后,点击搜索按钮或按回车键即可。
小技巧:在搜索框中可以直接使用字段前缀语法(如gene:tp53 organism:“homo sapiens”)进行快速限定,无需进入高级搜索页面。
2.2搜索结果页面的快速筛选
搜索结果页面左侧有筛选面板,可以快速缩小范围。通过物种筛选可以选择目标物种,只看特定物种的蛋白;通过数据来源筛选可以选择只显示经过人工审编的高质量条目;还可以按序列长度、分子量等理化属性进行筛选。
2.3看懂搜索结果列表
搜索结果列表中,每一条记录都包含关键信息:
Entry:该蛋白质唯一的UniProt登录号(如P01308)
Entry Name:蛋白ID的简要名称(如INS_HUMAN)
Protein names:蛋白质的完整名称
Gene names:编码该蛋白的基因名称
Organism:蛋白质的物种来源
Length:氨基酸序列长度
注意:Entry(登录号)和Entry Name(条目名)是两种不同的标识符,混用可能导致查不到结果。登录号是稳定不变的唯一标识,推荐优先使用。

Workflow for UniProt protein query
三、蛋白质详情页面:读懂一个蛋白条目
点击Entry名称进入详情页面后,左侧的目录导航栏可以快速定位到不同的信息板块。这些板块包含了蛋白质的几乎所有已知信息:
功能板块描述蛋白质的生物学功能,包括参与的代谢通路、催化的反应、结合的分子等。
名称与分类板块提供蛋白质和基因的名称、同义词以及物种分类信息。
亚细胞定位板块显示蛋白质在细胞内的具体位置。
疾病与变异板块记录与该蛋白相关的疾病信息及致病突变。
表达板块显示基因在不同组织或细胞中的表达水平。
翻译后修饰板块提供蛋白质的磷酸化、糖基化等修饰信息和蛋白加工过程。
相互作用板块汇集来自IntAct等数据库的蛋白-蛋白相互作用数据,包括二元互作、复合物成员关系及互作证据。
结构板块提供蛋白质的三维结构信息,整合了PDB中的实验解析结构以及AlphaFold / SWISS-MODEL等来源的预测结构模型,支持交互式查看。
家族与结构域板块展示蛋白质所属家族及结构域信息。
序列板块提供蛋白质的氨基酸序列,包括所有亚型的序列。
四、高级搜索:精准定位目标蛋白
当基本搜索返回的结果太多时,高级搜索可以帮助你精准定位。
点击搜索框旁边的Advanced链接进入高级搜索页面。高级搜索支持构建复杂逻辑语句,使用AND、OR、NOT组合多个条件;使用特定字段如基因名、蛋白质名、物种等;以及筛选数据状态,如只显示Swiss-Prot条目。
例如,搜索“人类BRCA1基因编码的、经过人工审编的蛋白质”,可以通过组合基因名、物种名称和审编状态三个条件来实现精准定位。
高级搜索的核心逻辑是“字段:值”的配对模式。掌握几个常用字段,就能组合出极其精准的查询条件。
五、UniProt内置的四大分析工具

Built-in analysis tools within UniProt
除了基本的查询功能外,UniProt还内置了四款强大的蛋白质序列分析工具。
5.1 BLAST:序列相似性搜索
BLAST是最常用的序列比对工具。在UniProt中,你可以在首页顶部工具栏点击BLAST进入。
使用方法是:将你的蛋白质或核酸序列粘贴到输入框中,选择目标数据库,点击运行即可。BLAST结果会被保存七天,可以随时查看。
选择数据库时,UniProtKB/Swiss-Prot最适合查找功能已知、注释可靠的同源蛋白;而UniProtKB/TrEMBL则适合在更广的序列空间中进行搜索,寻找远缘同源蛋白。二者之间的核心区别在于注释质量,Swiss-Prot经过人工审编可靠性高,而TrEMBL覆盖更广但注释未经人工验证。
BLAST结果解读的要点包括:E-value越低表示匹配越显著;序列一致性反映匹配区域的相似程度;应重点关注那些E值低、覆盖度高、一致性好的匹配结果。
5.2 Align:多序列比对
Align工具支持使用Clustal Omega等主流比对引擎,可对多条蛋白质或核酸序列进行多序列比对。使用场景包括将目标蛋白与多个同源序列进行比对,识别保守残基和功能关键区域。
5.3 Peptide Search:短肽匹配
Peptide Search工具允许提交短肽序列,在UniProtKB中查找包含该短肽的所有蛋白质。主要使用场景是质谱鉴定出的肽段需要确认来源蛋白。
5.4 ID Mapping:跨数据库标识符转换
不同数据库中同一蛋白质可能对应完全不同的标识符,如UniProt accession、Gene ID、PDB ID、Ensembl ID等。
ID Mapping工具支持批量提交大量标识符(单次最多约10万个ID,视具体映射类型而定),将其统一映射到UniProt条目或外部数据库。使用场景包括:将基因名称列表转换为UniProt登录号、将UniProt ID映射到PDB ID以获取结构信息,以及批量获取多条蛋白质的序列或注释信息。
实用提示:在ID Mapping时指定物种名称,可以显著减少无关结果,提高映射准确率。
六、最新功能:UniProt的重要更新
近年来UniProt网站完成了多次重要改版,并推出了多项新功能:
Tools Dashboard(工具仪表盘)。网站改版后统一了工具入口,Tools Dashboard让用户可以在统一界面中查看和管理自己的BLAST、Align、Peptide Search和ID Mapping任务,支持保存为收藏或重新提交。
TrEMBL自动注释质量持续提升。引入了包括机器学习模型在内的多种计算方法辅助功能预测和结构域注释,提升了自动注释的整体质量。
参考蛋白质组持续扩展。参考蛋白质组数据集不断扩充,以更好地捕捉生物多样性。
结构展示增强。在结构板块中,AlphaFold预测结构的展示得到了增强,支持更方便的交互式查看和分析。
TrEMBL收录策略重大调整。自2026年起,UniProtKB/TrEMBL从“全面收录”转向“精选收录”——仅保留具有实验证据或生物学重要性的条目,以及参考蛋白质组序列;大量未分类物种和宏基因组来源的条目被转入UniParc归档库。这一调整显著减少了TrEMBL的冗余度,也意味着某些之前能在TrEMBL中查到的序列现在需要去UniParc查找。
七、总结
UniProt蛋白质查询的核心思路是:先通过基本或高级搜索定位目标条目,再通过详情页面获取全面信息,最后利用内置工具进行深度分析。
根据不同研究场景,UniProt提供了差异化的查询路径。对于快速查询已知蛋白,直接在搜索框输入名称或登录号即可完成定位。当需要查找特定物种的蛋白时,可以在基本搜索后配合左侧的物种筛选功能快速缩小范围。面对多条件精准定位的需求,高级搜索配合字段组合是最佳选择。对于新序列的功能预测,可以通过BLAST同源搜索并结合Swiss-Prot的高质量注释来完成推断。当需要批量数据转换时,ID Mapping服务可以高效完成任务。而进行多序列保守性分析时,Align多序列比对工具则非常实用。
从最基本的搜索框到高级检索,从BLAST到ID Mapping,UniProt为蛋白质序列与功能信息的查询提供了从“查得到”到“查得准”再到“查得全”的完整工具链。掌握了这套方法,你就能在数亿条蛋白质序列中,快速找到自己需要的那一个,并为后续的蛋白质工程研究奠定坚实的数据基础。