2026-06-30 14:15:37, GPT5.5 上海易算生物科技有限公司
2026 年 6 月 10 日,UniProt 发布 2026_02 版本。本次更新之所以单独给大家介绍,是因为UniProtKB的数据组织逻辑发生了系统性调整:UniProtKB 现在主要由 reference proteomes 中的蛋白条目,以及具有实验或重要生物学意义的精选条目组成;非参考蛋白组中的大量蛋白条目不再继续作为 UniProtKB 的活跃条目保留,而是通过 UniParc 等资源继续提供序列追溯。
这意味着,后续做 DIA、PRM、MRM、建库、FASTA 下载、旧 accession 复核和跨版本报告解释时,不能只问“UniProt 里有没有这条蛋白”,还要问:
UniProtKB 统计页显示,UniProtKB 总条目数在过去十年主要由 TrEMBL 的快速增长推动:
2025_04 和 2026_02 是两个明显拐点。官方 release notes 将这一轮 UniProtKB protein space reorganization 总结为:UniProtKB accession 数量减少 43%,reference proteome 数量增加 36%,有 reference proteome 的物种数量增加 34%。在 2026_02 当前统计中,Swiss-Prot 为 575,503 条,TrEMBL 为 149,234,636 条,合计 149,810,139 条。
这组数字说明一个关键变化:UniProtKB 不是简单“变少”,而是把活动知识库压缩到更可维护、更能代表物种 protein space 的结构中。
Reference proteome 是某个物种中最适合作为默认参考的蛋白组集合。它的作用不是覆盖所有菌株、所有组装和所有可能变体,而是在数据质量、完整度、代表性和稳定性之间取得平衡。
新的 reference proteome 选择流程分为两类:
细胞生物,包括 Bacteria、Archaea 和 Eukaryota,使用 MMseqs2 对同一物种内的 proteomes 进行蛋白聚类和蛋白组相似性分析,目标是用尽量少的 reference proteomes 覆盖该物种主要 protein space。
病毒则主要对齐 ICTV Virus Metadata Resource 中的 exemplar genomes,同时保留 UniProt curator 根据生物学意义手动选择的参考蛋白组。
在进入自动选择前,proteome 需要通过基本门槛:taxonomy 必须明确到 species;不能是 excluded proteome;新导入的 metagenome assembly、pathogen surveillance project 和 Candidatus 物种暂不参与自动晋升。若一个物种只有一个合格 proteome,它会自动成为 reference proteome;若同一物种有多个 proteomes,则通过 MMseqs2、BUSCO 完整度、代表性分数和历史稳定性综合判断。
UniProt新发表的预印本中的方法学解释了这个设计的背景:公共数据库中的 genome assemblies 持续增长,直接把所有 translated proteins 都保留在 UniProtKB 会造成冗余、低质量条目和长期维护压力。新的选择流程用 MMseqs2 替代旧流程中的高成本聚类环节,并通过 Proteome Priority Score 兼顾 BUSCO 完整度、代表性和 release 间稳定性。
Reference proteome 回答“默认用哪套蛋白组”。Pan proteome 回答“同一物种多个蛋白组共同呈现什么蛋白空间”。
UniProt 的 pan proteome workflow 会对同一 species 中的合格 proteomes 进行 MMseqs2 聚类,每个 protein cluster 选择一条代表序列,并提供三个标准化输出:
pp<taxid>.fasta.gz:每个 protein cluster 一条代表序列,FASTA header 中带 Protein Frequency。pp<taxid>_matrix.tsv.gz:cluster-by-proteome count matrix,可判断每个簇在哪些 proteomes 中出现。pp<taxid>_stats.json:物种统计、release 和方法版本信息。Protein Frequency,简称 PF,表示某个 protein cluster 在该物种参与聚类的 proteomes 中出现的比例。PF 接近 100% 的簇常用于识别 core proteins;PF 在较低范围的簇可帮助观察 accessory proteins、菌株差异、生态适应和局部多样性。
在蛋白质组学项目中,pan proteome 不一定替代 reference FASTA,但它非常适合用于解释非模式生物、菌株差异、病原体物种内部多样性和“某些蛋白为什么只在部分组装中出现”。
当同一个 species 有多个 proteomes 时,UniProt 新增的 proteome similarity score 可以帮助判断某个 proteome 与 reference proteome 的接近程度。
它的计算逻辑可以简化理解为:
某个 proteome 中有多少蛋白能与 reference proteome 的蛋白对齐。
这个 score 是有方向性的。官方示例中,Proteome A 有 5 条蛋白,Proteome B 有 8 条蛋白,MMseqs2 聚成 4 个 protein clusters。A 相对 B 的 similarity score 是 80%,但 B 相对 A 是 25%。这说明 A 的蛋白空间能较好被 B 覆盖,但 B 中有更多 A 不覆盖的蛋白。
在实际项目中,这个分数可以用于:
UniProt 2026_02 更新也强化了 proteome exclusion规则。被 excluded 的 proteome 中的序列仍可在 UniParc 追溯,但它们不适合作为默认 UniProtKB 活跃条目或常规 FASTA 来源。
常见排除原因包括:
对于非模式生物或病原体项目,下载 FASTA 前应先检查 proteome 页面中的 status 和 exclusion reason。否则,后续数据库搜索、peptide uniqueness、protein inference 和报告注释都可能受到影响。
2026_02 后,如果旧 accession 在 UniProtKB 中查不到,不代表这条序列消失。非参考蛋白组中被移除的条目仍可在 UniParc 中追溯,UniProtKB 搜索旧 accession 时也可能跳转到对应 UniParc 页面。
UniRef 也跟随本轮重组优化了用于聚类的 UniParc 序列,并优先使用更高质量的 RefSeq 条目。官方 release notes 中提到,虽然 UniRef cluster 数量下降,但 UniRef90 和 UniRef50 的覆盖仍得到维护。
另一个值得关注的变化是 ProtNLM2。ProtNLM 原本主要用于预测 protein name;ProtNLM2 扩展到 protein function comments、subcellular locations、keywords 和 GO terms。2026_02 中约 26,000 个 TrEMBL 条目开放了 ProtNLM2 试点注释。页面会以 AI annotation toggle 展示预测内容,并用 Evidencer 提供字符串匹配、外部数据库、phmmer 序列相似和 TM-align 结构相似等证据。
ProtNLM2 的正确使用方式是把它当作注释线索,而不是替代人工复核、实验文献、保守结构域或功能实验。
对于常规人类、鼠、大鼠、酵母等模式生物 DIA 项目,优先使用 reference proteome 对应的 UniProtKB FASTA,并记录 release 版本、proteome ID、下载日期、是否包含 isoform 和 decoy 生成方式。(人类样品可以参考one gene one protein库,因为reference里包含大量non coding序列,根据课题需求慎重选择)
对于菌株、非模式生物、病原体或环境来源样本,先检查该物种是否有 reference proteome,再查看 non-reference proteome 的 similarity score 和 exclusion reason。需要 strain-specific FASTA 时,应在报告中明确说明选择原因。
对于旧项目复核,如果 accession 从 UniProtKB 活跃条目中消失,先进入 UniParc 查序列和 history,再判断是否需要映射到新的 UniProtKB 注释或在报告中说明数据库版本差异。
对于需要解释物种内部差异的研究,pan proteome 的 PF 和 matrix 比单一 reference FASTA 更有信息量。PF 可用于筛选 core proteins 和 accessory proteins,matrix 可用于确认蛋白簇在哪些 proteomes 中出现。
UniProt 2026_02 的 proteome 更新,本质上是把蛋白知识库从“尽量多收录”推进到“以高质量参考蛋白组代表物种 protein space”。对蛋白质组学用户来说,后续 FASTA 选择、数据库版本记录、旧 accession 复核和报告解释,都需要把 reference proteome、pan proteome、similarity score、exclusion reason 和 UniParc 去向纳入常规判断。
07-01 汉尧
Innopsys激光共聚焦芯片扫描仪助力牙周炎机制研究06-30 环亚生物
InnoScan微阵列生物芯片扫描分析仪助力糖尿病药物伊美格列明对胰岛α细胞的作用机制研究06-30 环亚生物
InnoScan荧光微阵列生物芯片扫描分析仪助力缺血性中风的神经机制研究06-30
InnoScan激光共聚焦荧光微阵列生物芯片扫描分析仪助力新防伪材料开发06-30 环亚生物
离子色谱法:精准检测84消毒液中的氯离子含量06-30 YOKON
以象科技-高光谱分析系列 | 塑料ABS POM PP PVC光谱数据分析06-30 以象科技
苏州安益谱十周年创始人张小华博士致辞06-30
最新影响因子14.1和8.5!MedComm系列期刊2025 JCR再创佳绩06-30
第四轮通知|mLife Research Conference 202606-30
Adv Sci | 北京大学王伟,首都师范大学周冕,中国农科院植保所彭焕:植物寄生线虫调控大豆根生物钟与翻译的分子机制06-30
“Wiley威立”社媒账号为中国作者提供免费文章推广服务,帮助您的研究扩大影响力06-30
QB | IF:2.2; CiteScore:2.9,期刊2025年度引证指标表现突出06-30
仪器租赁 | 赛默飞 离子色谱,月租金9590元起06-29
三轮通知 | 浙江省第十一届分析测试学术报告会06-29
未验先投!一检测公司 分析员被禁业5年06-29
细胞计数行业金标准——库尔特原理(电阻抗法)06-29 环亚生物
Moxi GO II 库尔特流式细胞仪在CAR-T疗法中的应用06-29 环亚生物
Orflo快速流式细胞仪助力新型基因编码钙指示剂的研究06-29 APGBio
Orflo快速流式细胞仪助力外周血单核细胞的呼吸功能与进行性青光眼性视力丧失相关研究06-29



