返回列表

蛋白质结构TM score怎么看?阈值、RMSD 区别与常见误区

发布于 2026年8月31日

蛋白质结构TM score怎么看?阈值、RMSD 区别与常见误区

引言

做蛋白质结构预测、同源建模或突变设计时,你一定见过TM score 这个指标。它是衡量两个蛋白质结构相似程度的黄金标准,但很多人只知道"越高越好",却不清楚它到底怎么算、多少算高、和 RMSD 有什么区别、有哪些容易踩的坑。本文以问答式结构,系统拆解 TM score 的定义、计算方法、判读标准与典型应用,为蛋白质工程和酶工程研究者提供一份可直接上手的实用教程。

 

一、TM score 到底是什么?

TM score(Template Modeling score,模板建模得分)是衡量两个蛋白质三维结构整体相似程度的定量指标,取值范围在 0 到 1 之间——数值越高,两个结构越相似

 

它的核心思想是:将两个蛋白质结构叠加对齐后,计算每对对应残基的距离,再通过一个归一化函数将距离转化为相似度得分,最后取所有残基的平均值。与均方根偏差(RMSD)不同,TM score 引入了一个与蛋白质长度相关的距离阈值 d₀(对蛋白质,d₀ ≈ 1.24×(L-15)^(1/3) - 1.8,L 为序列长度),使得长蛋白和短蛋白的得分具有可比性。

 

这个指标最早由结构生物信息学家在蛋白质结构预测评估中提出,如今已成为结构比对、模型质量评估、折叠分类等领域的通用标准。AlphaFold 等结构预测工具的结果评估中,TM score 也是核心指标之一。

 

注意:TM score 不是严格对称的,以 A 为参考和以 B 为参考的得分可能略有不同,比较时需注意参考方向。

 

二、TM score 多少算"结构相似"?

这是大家问得最多的问题。虽然没有绝对的阈值,但领域内大致有以下共识:

l < 0.17:随机相似。两个无关蛋白随机对齐的期望得分约为0.17,此区间得分无结构生物学意义

l < 0.3:基本不相似。 大概率属于不同折叠类型,常见于随机选取的两个无关蛋白。

l 0.3 – 0.5:弱相似。 可能存在远源同源关系或共同的结构域,对应超家族水平的演化关系。

l 0.5 – 0.7:中等相似。 通常属于同一折叠类型或同一家族,对应 SCOP/CATH 分类层面的结构同源性。

l 0.7 – 0.9:高度相似。 整体折叠基本一致,常见于同源建模结果与实验结构的比较。

l > 0.9:非常相似。 几乎可以认为是同一个结构,常见于突变体与野生型的结构比较、NMR 不同模型之间。

 

两个特别重要的分界点:

 

TM score ≈ 0.5:通常被认为是"同一折叠类型"的经验分界线,具有统计学意义。

TM score ≈ 0.8:通常被认为是"高精度结构预测"的分界线,AlphaFold 对很多人类蛋白的预测都能达到这个水平。

这些阈值只是经验参考,具体判断还要结合蛋白大小、结构域数量、研究问题等因素综合考量。

 

三、TM score vs RMSD:有什么区别?


A Comparison of the Principles and Differences Between TM-score and RMSD

 A Comparison of the Principles and Differences Between TM-score and RMSD

 

很多人会把TM score 和 RMSD 放在一起比较,其实它们各有侧重,不能互相替代:

 

归一化方式不同。 RMSD 单位是埃(Å),没有长度归一化,长蛋白和短蛋白的 RMSD 不能直接比较;TM score 做了长度归一化,不同大小的蛋白可以直接比较。

 

对局部偏差的敏感度不同。 RMSD 对局部大偏差非常敏感,一小段结构错位就能把整体 RMSD 拉得很高;TM score 更看重整体折叠,对局部偏差的容忍度更高。

 

阈值意义不同。 TM score 有公认的统计显著性阈值(约 0.5);RMSD 没有统一阈值,是否合理取决于蛋白大小和研究场景。

 

正确做法是两个指标结合看:TM score 评估全局折叠,RMSD 评估关键区域精度。

 

四、TM score怎么算?常用工具有哪些?

手动计算TM score 几乎不可能,实际工作中都是用现成的结构比对工具:

 

TM-align:最经典、使用最广泛的TM score 计算工具,专门为 TM score 优化了对齐算法。输入两个 PDB 结构文件,一条命令就能得到 TM score、对齐残基数、RMSD 等完整结果,速度快、结果稳定,是目前的事实标准。

 

MM-align:TM-align 的多链版本,可以对多亚基复合物进行整体结构比对,输出复合物层面的 TM score。对于抗体、多聚体酶等多链蛋白,需要用 MM-align。

 

除此之外,部分结构生物信息学平台还提供在线计算服务,适合不熟悉命令行的研究人员使用。此外,Biotite等Python库也提供了TM-score计算接口,适合批量处理和自动化流程集成。

 

小提示:计算TM score 时要注意序列对应关系。同一蛋白的不同构象可直接比对;同源蛋白需要先确定残基对应关系,再做结构叠加。

 

五、三个常见误区


Protein Structure prediction

 Common Misconceptions

 

误区一:TM score 高就等于功能相同

TM score 衡量的是整体结构相似性,但功能往往由几个关键残基的精确空间位置决定。两个蛋白整体 TM score 很高,活性中心几个关键残基的朝向不同,功能就可能天差地别。判断功能相似性,除了看整体得分,更要看活性位点、结合界面等关键区域的局部结构。

 

误区二:全局得分高,每个结构域都准

对于多结构域蛋白,全局TM score 可能掩盖了某个结构域的巨大差异。比如两个蛋白有两个结构域,一个完全一样,另一个朝向差了 90 度,全局得分可能仍然不低。遇到多结构域蛋白,建议分结构域分别计算。

 

误区三:得分低就是预测错了

AlphaFold 等工具预测的结构,有时候和实验结构的得分不高,但不一定是预测错了——也可能是蛋白本身构象动态大,晶体结构只是其中一个构象,而预测的是另一个。特别是柔性蛋白、膜蛋白、多结构域蛋白,这种情况更常见。

 

六、蛋白质工程中的实际应用

对于蛋白质工程和酶工程研究者,TM score 不只是学术指标,还有很多实际用途:

 

同源建模质量评估。 模型靠不靠谱?和实验结构的TM score 是最直接的指标。一般 > 0.7 可以用于初步位点分析,低于 0.5 参考价值有限。

 

突变体构象风险预判。 做了定点突变,想知道会不会破坏整体折叠?比较突变体和野生型的预测结构TM score,如果 > 0.9 通常说明折叠保持良好,掉得明显就要警惕。

 

对接前结构筛选。 分子对接前用TM score 筛掉折叠明显不对的模型,可以节省大量计算时间,也能减少假阳性结果。

 

设计结果验证。 AI 设计的蛋白或突变体,和预期折叠一不一致?计算 TM score 是最基本的验证步骤。

 

七、MatwingsVenus™(晓鹜™)平台中的 TM score 应用

上海天鹜科技自主研发的MatwingsVenus™(晓鹜™)蛋白质研发智能体,在结构预测与蛋白质设计模块中,支持 TM score 等结构相似性与质量评估指标。

 

用户输入序列后,平台不仅输出预测的三维结构,还会自动给出多维度结构质量评估,包括与同源模板的TM score 比对、结构域划分与置信度分析等。研究者不需要手动下载结构、安装比对工具、编写分析脚本,可一站式获取结构质量的多维度评估结果。

 

在突变设计方面,平台在输出候选突变体时,会同步评估突变对整体结构折叠的影响——如果预测突变可能导致折叠显著变化,系统会给出风险提示,帮助研究者在实验前筛掉有明显风险的突变体,减少无效实验。对于多结构域蛋白,平台还支持分结构域分析,避免全局高分掩盖局部问题的情况。

 

八、FAQ:几个高频问题

Q:TM score多少算高?和RMSD有什么区别?

A:一般认为TM score > 0.5表示两个蛋白属于同一折叠类型,> 0.8表示高度相似。与RMSD相比,TM score对整体折叠更敏感且不受蛋白大小影响,适合评估全局相似性;RMSD对局部偏差更灵敏,适合评估活性中心等关键区域精度。两者互补,建议结合使用。

 

Q:序列不同的蛋白可以算TM score吗?

A:可以。TM-align等工具会自动通过结构比对确定残基对应关系,输出两个同源蛋白之间的TM score,不需要预先做序列比对。

 

Q:只有序列没有结构能算TM score吗?

A:不能。TM score需要两个三维结构才能计算。如果只有序列,可以先用AlphaFold等工具预测结构,再计算TM score。

 

结语

最后,用三句话总结TM score的正确打开方式:

 

第一,看全局也看局部。 TM score 评估整体折叠,RMSD 评估关键区域精度,两者结合更全面。

第二,记住两个关键阈值。 0.5 是同一折叠类型的分界线,0.8 是高精度预测的经验线。

第三,高分不等于功能相同。 整体相似不代表关键位点相同,功能判断还要看局部细节。

 

掌握了这些,TM score 就不再是论文里一个看不懂的数字,而是结构分析和蛋白设计中真正能用的工具。