Genome Biology | 易算、苏大携手发表单细胞蛋白质组DIA最新算法 Full-DIA

2026-04-30 11:51:13, GPT5.5 上海易算生物科技有限公司


过去很多年,生命科学更习惯从 DNA 和 RNA 的角度回答这个问题。基因组告诉我们细胞带着什么说明书,转录组告诉我们哪些基因正在被读出。但真正执行生命活动的,往往是蛋白质:酶在催化,受体在感知,转录因子在调控,结构蛋白在支撑细胞形态。

因此,单细胞蛋白质组学一直被视为理解细胞状态的关键拼图。它希望在单个细胞尺度上,直接测量成千上万个蛋白的丰度变化。但单个细胞里的蛋白质量极低,质谱信号弱,背景噪声、干扰信号和算法阈值都会影响最终结果。

在这些挑战中,有一个问题经常被低估,却会直接决定下游分析能不能站得住:

缺失值

近日,苏州大学、Cedars-Sinai医学中心宋健博士携手易算生物在 Genome Biology 发表了Full-DIA算法,用深度学习提升单细胞蛋白质组数据的鉴定、定量和矩阵完整性。相比单纯追求“多鉴定一些蛋白”,我们的工作的核心价值在于:单细胞蛋白质组数据分析需要从源头减少缺失值,而不是依赖下游生信分析被动填补缺失值。

在单细胞蛋白质组矩阵中,同一个 NA 可能代表真实低表达,也可能来自弱信号被过滤或鉴定不一致

缺失值不是简单的空白

我们平时组学分析通常从一张矩阵表格开始。列是单个样品或者单细胞里的单个细胞,行是不同分子。转录组里是基因表达矩阵,蛋白质组里是蛋白质定量矩阵。

DIA技术已经大大改善了传统LFQ里DDA采集引起的缺失值。然而在单细胞蛋白质组里这个现象依然严重。一个蛋白在某些细胞中有数值,在另一些细胞中没有数值,表面上看,这只是矩阵里少了一个数字;但在单细胞蛋白质组中,它可能对应完全不同的原因。

它可能是真的生物学差异:这个蛋白在某类细胞中确实很低,甚至没有表达。

它也可能是技术原因:蛋白真实存在,但信号太弱,被现有软件过滤掉了。

它还可能是鉴定不一致:同一个肽段在一部分样本中通过阈值,在另一部分样本中因为打分略低被排除。

最麻烦的是,生信分析师只能从实验室拿到蛋白定量矩阵,它本身无法告诉我们:这个空白到底是低表达,还是算法没有把真实信号捞出来。他能做的只有往下去缺失值。

对于单细胞数据来说,这个区别非常关键。因为单细胞研究关心的正是细胞之间的差异。如果缺失值主要来自算法不稳定,研究者就可能把“检测失败”误读成“细胞异质性”。

为什么单细胞更怕缺失值?

在常规蛋白质组样本中,一个样本往往包含大量细胞,蛋白信号相对充足。即使某些肽段偶尔缺失,整体统计仍有一定缓冲。

单细胞样本没有这个余量。每个细胞都是一个独立样本,输入量极低,许多肽段处在检测边缘。一个真实存在的低丰度蛋白,可能只因为某一次信噪比略差,就从矩阵里消失。

这会带来连锁影响。

聚类时,细胞可能不是按真实状态分开,而是按缺失模式分开。
差异分析时,缺失可能被当成表达下降,产生假阳性或降低检出率。
通路富集时,一组不稳定蛋白可能牵引出看似显著但生物学上不够合理的结果。
跨批次整合时,不同批次的缺失模式会被误认为批次效应或细胞亚群差异。

所以,对单细胞蛋白质组而言,减少缺失值不是锦上添花,而是让数据真正可分析、可比较、可解释的基础。

关键不是“填补”,而是“少缺

传统处理缺失值的方式,是先得到一张稀疏矩阵,再用统计方法填补。常见策略包括填 0、填低值、用分布模型估计,或用矩阵分解方法推断。

这些方法有各自用途,但也都会引入假设:缺失是否主要来自低丰度?是否随机发生?相似细胞是否应该有相似表达?如果这些假设不成立,填补本身就可能改变生物学结论。

更理想的方向,是把缺失值问题前移到质谱数据解析阶段:在原始信号层面尽可能判断“这个肽段是不是真的存在”,在严格错误率控制下报告更完整的定量矩阵。

这也是 Full-DIA 带来的一个重要思路。它不是把缺失值留给下游分析去补,而是在鉴定和定量过程中保留更多原始碎片离子证据,并通过深度学习评分、全局错误率控制和强度去噪,生成更完整的蛋白质矩阵。

换句话说,少缺失不是放宽标准,也不是把所有空白都填上数字;少缺失的前提,是在不增加错误发现的情况下,把那些真实存在但被局部阈值过滤的弱信号重新识别出来。

Full-DIA 的核心思路:从原始碎片离子证据出发,在鉴定、全局错误率控制和强度校正过程中减少缺失值。

如何从分析方法上减少缺失值?

要减少缺失值,核心并不是更激进地报结果,而是更聪明地利用数据中已有的证据。可以从四个层面理解。

第一,保留碎片离子层面的原始证据


蛋白质组定量不是直接数蛋白分子,而是从碎片离子强度推断肽段强度,再从肽段强度推断蛋白强度。如果过早地在单个样本层面过滤信号,很多弱但真实的碎片证据就会丢失。更合理的做法,是尽可能保留可追溯的碎片离子强度和信号质量信息,为跨样本判断留下空间。

第二,利用跨样本一致性


在一组可比较的样本中,同一个肽段如果在大多数样本里都有稳定信号,只是在少数样本里因为信号弱或打分略低而没有通过阈值,那么这些“边缘缺失”就值得重新检查。跨样本匹配的价值在于,它不把每个样本孤立地看,而是把同一肽段在整个队列中的证据放在一起判断。

第三,在队列层面控制错误率


减少缺失值不能以增加假阳性为代价。真正有用的算法必须同时回答两个问题:哪些被过滤的信号可能是真实存在的?哪些跨样本匹配可能是错误转移?因此,错误率控制需要从单个 run 扩展到整个队列或整个实验层面,让矩阵更完整,同时仍然可信。

第四,对低质量强度进行去噪和校正


单细胞数据中,低丰度肽段常常出现不连续峰形、碎片离子比例异常或信噪比偏低。深度学习模型可以学习碎片离子之间、样本之间的强度结构,把共洗脱质量、谱图相似性和跨样本一致性纳入判断,从而降低低置信度测量对最终定量的影响。


Full-DIA 的设计正体现了这一类思路:从碎片离子矩阵出发,在全局 FDR 控制下形成更完整的肽段和蛋白质矩阵,并通过模型校正低质量信号。它的意义不只是软件性能提升,更是把“减少缺失值”从后处理问题变成了数据分析流程中的核心目标。

Full-DIA 具体做了什么?

Full-DIA 的流程可以理解为三步:先尽可能准确地找到真实肽段,再把碎片离子强度组织成完整矩阵,最后用深度学习对低质量测量进行校正。


Full-DIA 工作流程

第一步是肽段鉴定。Full-DIA 采用 peptide-centric 的分析思路,从谱图库中的目标肽段出发,在每个样本中寻找对应的洗脱信号。为了判断一个信号是否真实,它不仅看传统的质量误差、保留时间偏差和碎片离子强度,还引入了两个深度学习模型。

DeepProfile 关注的是共洗脱一致性。一个真实肽段的前体离子和多个碎片离子,应该在相近的时间和信号空间中一起出现。如果只是噪声或干扰峰,它可能在某个维度上看起来像目标肽段,但很难在多个离子之间形成稳定一致的洗脱结构。DeepProfile 的作用,就是从这种多离子共洗脱模式中学习“真实信号长什么样”。

DeepMall 关注的是谱图相似性。它比较观测到的碎片离子与谱图库预期碎片之间是否一致,同时结合质量偏差、信号质量、碎片类型、洗脱相关性等信息,判断这些碎片证据是否真的支持目标肽段。

第二步是全局错误率控制。传统逐样本分析容易出现一种情况:同一个肽段在某些样本里通过阈值,在另一些样本里被过滤。Full-DIA 不只看单个样本的局部结果,而是在多个样本之间计算全局 FDR。这样做的好处是,最终进入矩阵的肽段和蛋白,是在整个实验层面经过错误率控制的,而不是由某个样本中的局部阈值单独决定。

第三步是完整矩阵构建和强度校正。Full-DIA 会保存目标肽段在各个样本中的碎片离子强度信息,并在全局 FDR 确定可信肽段后,回到所有样本中取回对应的碎片离子强度,构建样本 x 碎片离子矩阵。随后,DeepQuant 通过自监督自编码器对碎片离子强度进行去噪和校正。它不是简单填空,而是利用碎片离子之间、样本之间的强度结构和信号质量信息,重构更可信的强度。

最后,Full-DIA 将质量较高的碎片离子汇总为肽段强度,再进一步汇总为蛋白质强度。也就是说,它减少缺失值的方式不是“表格空了再补”,而是从碎片离子证据开始,把弱信号、边缘信号和跨样本一致性纳入同一个分析流程。

Full-DIA 的效果体现在哪里?

Full-DIA 的提升贯穿鉴定深度、定量准确性、矩阵完整性和下游生物学解释

Full-DIA 与DIA-NN进行了多数据集比较。提升主要体现在四个方面。

第一,鉴定深度提高


在全局 1% FDR 条件下,Full-DIA 在多个测试数据集上相对于DIA-NN 2.2报告了更多 precursor 鉴定。论文中四个数据集的 precursor 层面提升分别为 14%、32%、55% 和 14%。蛋白质组层面的变化相对更依赖数据集和蛋白推断规则,分别为 1%、7%、19% 和 -4%。这说明 Full-DIA 在肽段和 precursor 层面的信号挖掘更稳定,而蛋白层面的收益会受到蛋白归并和共享肽段等因素影响。

Full-DIA 在多个测试数据集上的鉴定数量和运行时间比较

第二,定量准确性更好


在具有已知比例的混合样本评估中,Full-DIA 得到的肽段和蛋白质定量结果更接近理论比例。在血浆梯度样本中,Full-DIA 的肽段强度与上样量之间的相关性也高于对照软件,蛋白层面保持略高或相当的相关性。对于单细胞蛋白质组来说,这一点很重要:减少缺失值不能牺牲定量准确性,否则完整矩阵只是“看起来完整”

在已知比例混合样本中,Full-DIA 的定量结果更接近理论比例

第三,低输入场景更受益


论文还在低上样量样本中评估了 Full-DIA。结果显示,在最低上样量条件下,Full-DIA 相对于DIA-NN的肽段鉴定数量有明显优势,而在上样量较高时,两种方法的结果更接近。这符合单细胞蛋白质组的实际痛点:当信号本来就强时,算法差异不会被充分放大;当信号弱、噪声高、缺失值多时,更精细的信号识别和强度校正才会真正发挥作用。

第四,下游生物学分析可靠


Full-DIA 生成的无缺失蛋白质矩阵用于下游分析时,在免疫刺激和细胞周期等单细胞数据中呈现出更符合生物学预期的结果。例如,在免疫刺激数据中,Full-DIA 富集到的通路更集中于已知的炎症和先天免疫相关过程;在细胞周期数据中,它对不同阶段细胞的分离更清晰,轮廓系数从 0.20 提升到 0.25,并富集到更符合 G2-M 转换的有丝分裂相关过程。

在免疫刺激单细胞数据中,Full-DIA 结果通路相关性更好

在细胞周期单细胞数据中,Ful-DIA 支持更清晰的细胞阶段分离和通路富集

这些结果共同说明,Full-DIA 的优势不是单一指标的提升,而是从鉴定、定量、矩阵完整性到生物学解释的一整条链路更稳。对单细胞蛋白质组而言,这比单纯增加少量鉴定数量更重要。

低缺失值为什么会改变生物学解释?

单细胞蛋白质组的目标,不只是生成一张更大的表,而是从这张表里读出生物学状态。

当缺失值减少后,很多分析会变得更可靠。

细胞聚类更容易反映真实状态,而不是检测深度差异。
差异蛋白分析能减少假阴性,让真实变化更容易被发现。
通路富集会更聚焦于符合生物学背景的过程。
跨样本、跨批次、跨条件整合时,矩阵的一致性更好。

这在单细胞场景中特别重要。单细胞研究常常关心连续状态、过渡细胞、稀有亚群和微弱扰动。如果缺失值过多,这些细腻结构会被噪声淹没;如果矩阵更完整,蛋白质层面的异质性才更可能被保留下来。

也就是说,减少缺失值并不是为了让数据“看起来更满”,而是为了让每一个细胞在蛋白质空间中的位置更可信。

这种思路能推广到哪里?

虽然 Full-DIA 的研究聚焦于单细胞蛋白质组,但“从源头减少缺失值”的思想并不局限于单细胞。

低上样量样本、大规模队列和其他多组学,同样存在弱信号、跨样本匹配和缺失问题

它同样适用于极微量蛋白质组。比如微量组织切片、稀有细胞群、临床穿刺样本、激光显微切割样本等,都会遇到信号弱、重复性有限、缺失值偏高的问题。跨样本证据整合和全局错误率控制可以帮助这些场景获得更稳定的定量矩阵。

它也适用于大规模队列研究。临床队列、药物筛选和时间序列实验往往包含大量样本,传统逐样本分析容易产生不一致鉴定。队列级分析能够把“一个分子在整组样本中的表现”作为判断依据,减少由局部阈值造成的假阴性。

它还可以启发其他多组学数据分析。无论是代谢组、脂质组,还是空间组学,只要数据中存在弱信号、跨样本匹配和缺失值问题,都可以借鉴类似思路:不要只在末端填补缺失,而要在原始信号、跨样本一致性和错误率控制之间建立更紧密的联系。

未来,高质量组学分析的竞争可能不只是“测得更深”,而是“矩阵更完整、错误率更可控、结论更可解释”。

结语

单细胞蛋白质组学正在进入一个新阶段。真正重要的问题不再只是能鉴定多少蛋白,而是这些蛋白能否在每个细胞中稳定、可信地定量。

缺失值越少,细胞之间的比较就越可靠;错误率控制越严格,完整矩阵就越有意义;数据分析越贴近原始信号,生物学解释就越不容易被算法噪声带偏。

从这个角度看,Full-DIA 的价值不只是提出一个新的分析工具,而是强调了一条更普适的路线:把缺失值问题前移,在鉴定、匹配、定量和错误率控制的全过程中减少缺失,让单细胞蛋白质组真正成为理解细胞状态的定量语言。

参考文章:Song J, Momenzadeh A, Liu H, Shen C, Meyer JG, Wu X. Genome Biology, 2026. DOI: 10.1186/s13059-026-04087-x.


业务咨询


邮箱
sales@omicsolution.com
企业微信
产品矩阵




  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018
  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018

Copyright ©2007-2026 ANTPEDIA, All Rights Reserved