UniProt 2026_02重大更新:蛋白组数据进入“参考蛋白组优先”时代

2026-06-30 14:15:37, GPT5.5 上海易算生物科技有限公司



横向公众号标题图    2026 年 6 月 10 日,UniProt 发布 2026_02 版本。本次更新之所以单独给大家介绍,是因为UniProtKB的数据组织逻辑发生了系统性调整:UniProtKB 现在主要由 reference proteomes 中的蛋白条目,以及具有实验或重要生物学意义的精选条目组成;非参考蛋白组中的大量蛋白条目不再继续作为 UniProtKB 的活跃条目保留,而是通过 UniParc 等资源继续提供序列追溯。

这意味着,后续做 DIA、PRM、MRM、建库、FASTA 下载、旧 accession 复核和跨版本报告解释时,不能只问“UniProt 里有没有这条蛋白”,还要问:

  • 它来自 reference proteome 还是 non-reference proteome?
  • 这个 proteome 有没有被 excluded?
  • 该物种是否有 pan proteome?
  • 旧 accession 如果从 UniProtKB 消失,是否还能在 UniParc 追溯?
  • 本项目使用的 FASTA 对应哪个 UniProt release?

UniProt变得越来越好用,但拉丁文命名法,以及英文常用名和中文的常见物种名及其分类就无法在如此专业的网站上快速入门了。
您可以点击文末的阅读原文,从我司个性化定制版本的uniprot reference proteome浏览器中找到这些易用性配置,有需要进一步优化和加入的功能欢迎在本文下方直接回复。

另外,如果你是个初学者,对这些概念还有点迷惑,可以先阅读我们往期更入门点的介绍,其中部分我个人推荐的选取方式现在也已经在最新版本uniprot里作为默认信息了,未来选择起来将更加方便:
易算整理 | 2025 年了,面对 UniProt 的 FASTA 数据库,你还在纠结选哪个吗?
UniProt深度解读-p1:UniProt的背景及其在蛋白质组学研究中的重要角色
UniProt深度解读-p2.1案例分析:COVID19蛋白质组和UniProt
UniProt深度解读-p2.2:UniProt蛋白质序列数据来源及背景信息
UniProt深度解读-p2.3:蛋白质序列分类及Proteome数据库食用指南

一、UniProtKB长期扩张后结构性压缩

UniProtKB 统计页显示,UniProtKB 总条目数在过去十年主要由 TrEMBL 的快速增长推动:

版本
发布时间
UniProtKB 合计
2015_01
2015-01-07
89,998,523
2020_01
2020-02-26
178,316,438
2023_01
2023-02-22
246,391,488
2025_03
2025-06-18
253,635,358
2025_04
2025-10-15
199,579,901
2026_01
2026-01-28
203,130,941
2026_02
2026-06-10
149,810,139

2025_04 和 2026_02 是两个明显拐点。官方 release notes 将这一轮 UniProtKB protein space reorganization 总结为:UniProtKB accession 数量减少 43%,reference proteome 数量增加 36%,有 reference proteome 的物种数量增加 34%。在 2026_02 当前统计中,Swiss-Prot 为 575,503 条,TrEMBL 为 149,234,636 条,合计 149,810,139 条。

这组数字说明一个关键变化:UniProtKB 不是简单“变少”,而是把活动知识库压缩到更可维护、更能代表物种 protein space 的结构中。

二、Reference proteome:默认 FASTA 的第一选择

Reference proteome 是某个物种中最适合作为默认参考的蛋白组集合。它的作用不是覆盖所有菌株、所有组装和所有可能变体,而是在数据质量、完整度、代表性和稳定性之间取得平衡。

新的 reference proteome 选择流程分为两类:

细胞生物,包括 Bacteria、Archaea 和 Eukaryota,使用 MMseqs2 对同一物种内的 proteomes 进行蛋白聚类和蛋白组相似性分析,目标是用尽量少的 reference proteomes 覆盖该物种主要 protein space。

病毒则主要对齐 ICTV Virus Metadata Resource 中的 exemplar genomes,同时保留 UniProt curator 根据生物学意义手动选择的参考蛋白组。

在进入自动选择前,proteome 需要通过基本门槛:taxonomy 必须明确到 species;不能是 excluded proteome;新导入的 metagenome assembly、pathogen surveillance project 和 Candidatus 物种暂不参与自动晋升。若一个物种只有一个合格 proteome,它会自动成为 reference proteome;若同一物种有多个 proteomes,则通过 MMseqs2、BUSCO 完整度、代表性分数和历史稳定性综合判断。

UniProt新发表的预印本中的方法学解释了这个设计的背景:公共数据库中的 genome assemblies 持续增长,直接把所有 translated proteins 都保留在 UniProtKB 会造成冗余、低质量条目和长期维护压力。新的选择流程用 MMseqs2 替代旧流程中的高成本聚类环节,并通过 Proteome Priority Score 兼顾 BUSCO 完整度、代表性和 release 间稳定性。

三、Pan proteome:理解物种内部多样性

Reference proteome 回答“默认用哪套蛋白组”。Pan proteome 回答“同一物种多个蛋白组共同呈现什么蛋白空间”。

UniProt 的 pan proteome workflow 会对同一 species 中的合格 proteomes 进行 MMseqs2 聚类,每个 protein cluster 选择一条代表序列,并提供三个标准化输出:

  • pp<taxid>.fasta.gz:每个 protein cluster 一条代表序列,FASTA header 中带 Protein Frequency。
  • pp<taxid>_matrix.tsv.gz:cluster-by-proteome count matrix,可判断每个簇在哪些 proteomes 中出现。
  • pp<taxid>_stats.json:物种统计、release 和方法版本信息。

Protein Frequency,简称 PF,表示某个 protein cluster 在该物种参与聚类的 proteomes 中出现的比例。PF 接近 100% 的簇常用于识别 core proteins;PF 在较低范围的簇可帮助观察 accessory proteins、菌株差异、生态适应和局部多样性。

在蛋白质组学项目中,pan proteome 不一定替代 reference FASTA,但它非常适合用于解释非模式生物、菌株差异、病原体物种内部多样性和“某些蛋白为什么只在部分组装中出现”。

四、Proteome similarity score:判断非参考蛋白组离参考有多近

当同一个 species 有多个 proteomes 时,UniProt 新增的 proteome similarity score 可以帮助判断某个 proteome 与 reference proteome 的接近程度。

它的计算逻辑可以简化理解为:

某个 proteome 中有多少蛋白能与 reference proteome 的蛋白对齐。

这个 score 是有方向性的。官方示例中,Proteome A 有 5 条蛋白,Proteome B 有 8 条蛋白,MMseqs2 聚成 4 个 protein clusters。A 相对 B 的 similarity score 是 80%,但 B 相对 A 是 25%。这说明 A 的蛋白空间能较好被 B 覆盖,但 B 中有更多 A 不覆盖的蛋白。

在实际项目中,这个分数可以用于:

  • 判断某个 non-reference proteome 是否接近 reference proteome。
  • 选择是否需要 strain-specific FASTA。
  • 解释同物种不同 assembly 导致的 accession 或 protein group 差异。
  • 在旧项目复核时判断数据库版本和 proteome 选择是否可能影响鉴定结果。

五、Excluded proteome:因何被去除?

UniProt 2026_02 更新也强化了 proteome exclusion规则。被 excluded 的 proteome 中的序列仍可在 UniParc 追溯,但它们不适合作为默认 UniProtKB 活跃条目或常规 FASTA 来源。

常见排除原因包括:

  • 污染或混合:contaminated、mixed culture、chimeric、hybrid。
  • 组装异常:misassembled、sequence duplications、genome length too large / too small。
  • 质量不足:low gene count、low quality proteome、low quality sequence。
  • 来源边界:metagenome、derived from metagenome、large multi-isolate project。
  • 分类和代表性问题:unverified source organism、over-represented proteome。

对于非模式生物或病原体项目,下载 FASTA 前应先检查 proteome 页面中的 status 和 exclusion reason。否则,后续数据库搜索、peptide uniqueness、protein inference 和报告注释都可能受到影响。

六、UniParc、UniRef 和 ProtNLM2:条目去向与注释入口

2026_02 后,如果旧 accession 在 UniProtKB 中查不到,不代表这条序列消失。非参考蛋白组中被移除的条目仍可在 UniParc 中追溯,UniProtKB 搜索旧 accession 时也可能跳转到对应 UniParc 页面。

UniRef 也跟随本轮重组优化了用于聚类的 UniParc 序列,并优先使用更高质量的 RefSeq 条目。官方 release notes 中提到,虽然 UniRef cluster 数量下降,但 UniRef90 和 UniRef50 的覆盖仍得到维护。

另一个值得关注的变化是 ProtNLM2。ProtNLM 原本主要用于预测 protein name;ProtNLM2 扩展到 protein function comments、subcellular locations、keywords 和 GO terms。2026_02 中约 26,000 个 TrEMBL 条目开放了 ProtNLM2 试点注释。页面会以 AI annotation toggle 展示预测内容,并用 Evidencer 提供字符串匹配、外部数据库、phmmer 序列相似和 TM-align 结构相似等证据。

ProtNLM2 的正确使用方式是把它当作注释线索,而不是替代人工复核、实验文献、保守结构域或功能实验。

七、蛋白质组项目中的实际建议

对于常规人类、鼠、大鼠、酵母等模式生物 DIA 项目,优先使用 reference proteome 对应的 UniProtKB FASTA,并记录 release 版本、proteome ID、下载日期、是否包含 isoform 和 decoy 生成方式。(人类样品可以参考one gene one protein库,因为reference里包含大量non coding序列,根据课题需求慎重选择)

对于菌株、非模式生物、病原体或环境来源样本,先检查该物种是否有 reference proteome,再查看 non-reference proteome 的 similarity score 和 exclusion reason。需要 strain-specific FASTA 时,应在报告中明确说明选择原因。

对于旧项目复核,如果 accession 从 UniProtKB 活跃条目中消失,先进入 UniParc 查序列和 history,再判断是否需要映射到新的 UniProtKB 注释或在报告中说明数据库版本差异。

对于需要解释物种内部差异的研究,pan proteome 的 PF 和 matrix 比单一 reference FASTA 更有信息量。PF 可用于筛选 core proteins 和 accessory proteins,matrix 可用于确认蛋白簇在哪些 proteomes 中出现。

八、总结

UniProt 2026_02 的 proteome 更新,本质上是把蛋白知识库从“尽量多收录”推进到“以高质量参考蛋白组代表物种 protein space”。对蛋白质组学用户来说,后续 FASTA 选择、数据库版本记录、旧 accession 复核和报告解释,都需要把 reference proteome、pan proteome、similarity score、exclusion reason 和 UniParc 去向纳入常规判断。

参考资料

  • 易算UniProt个性化浏览器 : https://gemma.omicsolution.com/uniprot-browser.html
  • UniProt release 2026_02: https://www.uniprot.org/release-notes/2026-06-10-release
  • UniProtKB statistics: https://www.uniprot.org/uniprotkb/statistics
  • Statistics history endpoint: https://rest.uniprot.org/statistics/history/entry
  • Reference proteomes workflow: https://www.uniprot.org/help/ref_proteomes_workflow
  • Proteome changes summary: https://www.uniprot.org/help/refprot_only_changes
  • Pan proteomes workflow: https://www.uniprot.org/help/pan_proteomes_workflow
  • Proteome similarity score: https://www.uniprot.org/help/proteome_similarity
  • Proteome exclusion reasons: https://www.uniprot.org/help/proteome_exclusion_reasons
  • ProtNLM: https://www.uniprot.org/help/ProtNLM
  • Preprint: https://www.biorxiv.org/content/10.64898/2026.05.12.720148v1


  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018
  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018

Copyright ©2007-2026 ANTPEDIA, All Rights Reserved