UniProt深度解读-p2.3:蛋白质序列分类及Proteome数据库食用指南

2025-03-25 15:00:44, shygza 上海易算生物科技有限公司


本章节将为您介绍

  • UniProt序列的记录和分类

  • Proteome数据库定义

  • 为何我推荐One Gene One Protein(OGP)序列数据库及其和其他数据库类别的差异

往期导读:

Part
01

UniProt序列类型

UniProt Sequence/

    回顾下p1里的这张流程图,UniProt收集序列后将相同序列的来源信息汇总入序列仓库UniParc,如人的白蛋白相关数据非常多,可以看到大量的是各个专利数据库里用到了白蛋白序列,都会被记录在UniParc,后续相关有用的链接就会加入ALBU_HUMAN的专门页面中。


    但是,在任何时候我们都无法保证生物体就只会编码固定序列的蛋白质。因此UniProt会首先尽可能列出收集到的各个版本序列,如下图,在获取到更加准确的文献或其他来源注释前,火鸡的A2M蛋白可能有多个转录本。


    以上蛋白在UniProtKB中会全部记录,在更进一步注释前只会进行进化树分析后选择最祖先的蛋白序列收录Proteome数据库(下一节具体阐述)。如:

    最终只有A0A803YGR9这个蛋白被收录到one gene one protein(以下缩写ogp)的最成熟序列Proteome数据库,也是我通常推荐客户采用的搜库文件。其余蛋白是A2M的isoform还是不同的转录本,还是fragment则暂时还无法确定。下图是各个Proteome的ogp数据库下载的统一位置:

    对于已经得到人工注释(SwissProt)的蛋白来说,会对区分可变剪切还是isoform,如人白蛋白,可以在UniProt中搜到10个序列

但其实如果我们挖掘TrEMBL完整的人类数据库的话可以找到12条序列。

多出来的两个其实就是经过注释为白蛋白isoform的两个蛋白。

P02768-2

Isoform2,第43-234氨基酸缺失
P02768-3
Isoform3,第164-376氨基酸缺失

而对于这没被归入isoform的其余序列,大部分都高度同源,主要在N端有各种可变剪切。除了已知的2个isoform外,其余标注为独立的蛋白,不纳入SwissProt,比如D6RHD5,和经典的P02768相比,缺失N端150个左右氨基酸,同时N端多了MSQLKIVTNHL起始序列,剩余的全部一模一样。因此在绝大多数研究中,是否要纳入这些可变剪切序列进行分析则得看这段序列是不是可能成为唯一的鉴定多肽(概率很低),另外您得思考下,如果鉴定到这段多肽后使ALB结果可以分离成P02768和D6RHD5两个结果,再后续的功能注释和解读你是否做好了准备,如果没有,那么这个结果也可能对你毫无用处。下图是这些蛋白的序列比对结果

    做个简单的总结如下,对于经典模式生物如人、大肠杆菌、酵母(2种),基本Swissprot全覆盖,因此能够准确的区分大部分isoform,fragment和可变剪切。见下表,2022年1月SwissProt注释情况:

Species

SwissProt

Coding

Genes

SwissProt

占比

Homo sapiens

20376

20577

99%

Mus musculus

17107

21985

78%

Arabidopsis thaliana 

16202

27473

59%

Rattus norvegicus

8147

21589

38%

Saccharomyces cerevisiae

6050

6059

100%

Bos taurus

6017

23846

25%

Schizosaccharomyces pombe

5121

5122

100%

Escherichia coli

4400

4402

100%

Caenorhabditis elegans

4353

19818

22%

Drosophila melanogaster

3643

13821

26%

Xenopus laevis 

3471

43236

8%

Danio rerio

3233

25707

13%

Part
02

Proteome数据库定义

UniProt Sequence/

    

    UniProt中的蛋白质组指的是对应物种的基因组已经过完全测序所构建得到其蛋白质组所有序列集合。

什么是蛋白质组?

    蛋白质组是一组被认为由生物体表达的蛋白质。大多数UniProt蛋白质组基于完全测序基因组的翻译,并且通常包括来自染色体以外的序列,例如质粒或存在在生物体中的其他独立器官基因组。一些蛋白质组还可能包括由于测序错误或gap而无法映射到当前基因组的高质量cDNA的蛋白质序列。这些序列会在手动核查并找到支持证据后才包括在蛋白质组中,包括仔细分析来自高度相似物种的同源序列。

    随着越来越多的同一生物体的基因组被测序,UniProt引入了唯一的蛋白质组标识符,UPID,并以区分有相同物种分类标识符的不同蛋白质组。比如COVID19就有多个Proteome;而人就是UP000005640

    UniProt 蛋白质组可能包括人工审核(UniProtKB/Swiss-Prot)和未人工审核(UniProtKB/TrEMBL)条目。被人工审核的条目的比例因蛋白质组而异,对于高度整合的模式生物的蛋白质组来说显然比例更大:如酿酒酵母288C大肠杆菌菌株K12的蛋白质组完全由人工审查的条目组成。整合是一个持续的过程,随着新信息的出现,蛋白质组会以定期更新:伪基因和其他可疑的未表征ORF可能被删除,其他新鉴定和表征的序列可能被添加。

    大多数UniProt蛋白质组是基于向国际核苷酸序列数据库联盟(INSDC)提交的基因组序列的翻译。

    UniProt为了补充脊椎动物物种序列与Ensembl合作进行序列补充,和Ensembl Genomes合作补充非脊椎动物物种,WormBase Parasite补充寄生线虫和VectorBase补充病原体载体基因组。此外,也有新的流程用于导入NCBI RefSeq注释的特定非冗余基因组。由于INSDC缺乏基因模型注释,这些数据来源补充了一些特定的关键基因组的蛋白质组序列。INSDC和非INSDC衍生的蛋白质组分别通过Unirprot的assembly和annotation模块溯源。


    因此,UniProt中的Proteome数据库由所有UniProtKB / Swiss-Prot条目(无论它们是否映射到非INSDC注释基因组)以及那些映射到该蛋白质组的非INSDC资源的UniProtKB / TrEMBL条目组成。

    迄今为止,这些流程已被用于在UniProtKB中注释人类蛋白质组,主要模式生物和其他特别感兴趣的物种的其他序列。


Part
03

为何推荐Proteome的OGP库

UniProt Sequence/

    上图对比了几个不同注释程度的物种:人、小鼠、火鸡和COVID19的各个数据库蛋白数量(黄色背景)以及典型的几类序列在不同数据库中的归属情况(蓝色背景)。

    我们可以得出如下结论

  1. isoform在经过SwissProt人工注释后会合并入主Accession(不再保留单独列表),从而需要通过在下载fasta时单独选择canonical+isoform才能获取,所以不同版本的下载方式增加的isoform数量会基本不变(均来自于SwissProt蛋白),下载方式见下图:

    ,所以你现在应该有一个概念,SwissProt注释率很低的物种,点击FASTA canonical还是canonical&isoform是没有区别的。不是说这些物种没有isoform,而是因为没有经过人工注释而合并,真正的isoform还是以独立蛋白存储而已(见上图例子中B蛋白的ID变化),如果没有得到SwissProt注释,那么大部分同源蛋白依然被视为可变剪切,如上图中的C蛋白;

  2. 对于大多数有Proteome数据库的物种来说,选择Proteome还是OGP的区别就在于要不要纳入大量的相同基因(代表下游生信注释基本相同)的可变剪切蛋白,按需选择,个人建议没想明白的就用OGP

  3. 小鼠基因组编码蛋白并不是全部都得到了人工注释(78%),因此仅选择swissprot数据库的话会丢失近5000个编码基因的蛋白,有些老师会发现用这两个版本分别搜库好像结果差异不大。的确是这样,没有被注释的这些蛋白多数为研究非常少或者各器官中表达丰度非常低的蛋白,但并不是说它们没有意义或不存在;

  4. 的数据库因为注释率非常高且有大量的转录本得到了测序,所以全库(TrEMBL)中,相对于其他物种来说蛋白种类多得多(NCBI里更是有100多万种)。因此TrEMBL20万(含Isoform)人蛋白序列相对于Proteome约10万条序列多的部分大部分是各类蛋白在不同研究中发现的fragment,以及大量的IgG蛋白不同变体Proteome相对于OGP多出来的部分大多数是可变剪切OGP相对于SwissProt(含Isoform)的版本来说就是少了各类蛋白的isoform序列(大部分isoform相对于OGP的canonical seuqence会更短)。

One Gene One Protein(OGP) 固定下载位置如下图:

也就是我第一小节提到的那16213个coding gene的编码蛋白序列,而所有transcripts对应的那28237条序列。这也是TrEMBL基于测序结果注释进行整理的原因,有可能会将多个isoform序列标注为不同蛋白质。如果你觉得UniProt这种做法会丢失信息。那么也可以下载含有7条A2M基因编码蛋白序列的fasta文件。那就点击OGP下载链接上面的28237这个链接,然后的下载操作步骤如下:

    

总结

作为使用中最具有指导性的章节的总结,我用实际搜库结果给大家举个例子,如何让血液蛋白质组结果凭空变多呢?看文献/拿到别人给的结果时,你就可以记得留个心眼了。

例1:人血液DDA单针分析,1% Pro+Pep FDR(Protein all包含所有0Unique pep的蛋白)


OGP
Proteome
TrEMBL
Protein Group
436
425
389
Protein
517
1048
1574
Protein all
725
21693153
Peptides
4352
4053
4039
PSM
7267
6777
6702

你需要记住一点,有的分析软件的Protein Group方式是可以修改参数的,这样结果PG可能和Protein基本一样,我这个表格的统计是以只要share pep就合并入一个PG的方式统计,故ALBU的匹配结果:

全部isoform+可变剪切都被归属于同一个Protein Group,经典序列P02768覆盖了最大的PSM。而TrEMBL相对于OGP多了的近1000个protein,主要涵盖的蛋白类型就是各类immunoglobulin,也和TrEMBL中近3万种各类免疫球蛋白变体所对应。有的软件会把只要有一个unique pep就单独拎出来建一个protein group,那这样的结果就多很多了。


例2:人293T细胞单针DIA分析 1%Pro+Pep  FDR


OGP
Proteome
TrEMBL
Protein Group
1024510258
9231
Precursor
112052
113284
112465

可以发现,细胞结果Proteome的结果略多13个PG,忽略不计,也说明了OGP方法的通用性。

    如果您对本章节介绍还有疑问,可以后台向我们提问或者继续关注我们。

    下一章节,我们将详细解读SwissProt和TrEMBL在注释上的异同

  1. UniProt的背景及其在蛋白质组学研究中的重要角色

  2. UniProt蛋白质序列数据的来源及其组成信息

  3. UniProt蛋白质序列功能注释的过程

  4. UniProt的使用基本操作


上海易算生物科技有限公司

转载请注明出处

若有任何疑问,欢迎邮件或来电咨询:

marketing@omicsolution.com

support@omicsolution.com

  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018
  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018

Copyright ©2007-2026 ANTPEDIA, All Rights Reserved