小变异检测难题迎刃而解,DRAGEN 凭何实力 “问鼎”?

2025-04-22 02:22:40 Illumina因美纳(中国)科学器材有限公司



引言

通过二代测序(NGS)解锁基因组的潜力对于生物医学研究和精准医疗至关重要。为了最大限度地从NGS中获取洞见,研究人员需要能够将原始测序数据转化为有意义结果的分析工具。DRAGEN通过采用高度可重构的现场可编程门阵列(FPGA)技术,为NGS数据提供精准、全面且高效的二级分析。DRAGEN显著加速了NGS数据的二级分析,包括数据拆分、序列比对、变异检测等关键步骤,此外,DRAGEN专门针对基因组分析中的常见挑战进行优化,例如:分析时间过长、数据量庞大,以及基因组复杂区域的变异检测。


在2020年的Precision FDA Truth V2挑战赛中,DRAGEN v3.7在全部基准区域和难比对区域(相较于Sentieon、Seven Bridges、BWA-GATK等)均获得最高准确性评级(图1)。1,2

图1:DRAGEN在难比对区域和所有基准区域的分析中表现更佳

之后推出的DRAGEN v4.3在原有卓越性能基础上实现了显著提升:通过引入强大的机器学习(ML)和进一步改进的基于泛基因组参考索引的多基因组比对,在小变异检测准确度方面达到前所未有的水平——在所有基准区域中F1分数高达99.89%(图 2)。

图2:DRAGEN在所有基准区域分析中的准确性——F1分数(%)综合考虑了精确率和召回率。3,4 基于参考数据集,分数越高表明准确性越高。

基于泛基因组参考

索引的多基因组比对

DRAGEN通过整合群体单倍型的定相变异(phased variants)并利用群体来源的替代重叠群(alt contigs)来增强参考基因组,使之能够高效执行基于泛基因组参考的序列比对,显著提升Illumina reads在复杂基因组区域的比对质量。这一创新功能拓展了Illumina reads的有效覆盖范围,使得此前无法准确分析的基因组区域也能实现精准比对和变异检测。


多基因组比对是一种利用群体数据辅助序列比对的方法,其核心在于将群体中存在的替代序列信息构建为包含分叉与汇聚的动态路径结构(图3)。通过图数据结构,样本reads能够沿图谱中的最佳匹配路径进行精准比对。

图3:基于泛基因组参考的多基因组比对——在泛基因组参考中,群体中记录的替代序列信息以多样化的分叉与汇聚路径形式呈现。

DRAGEN首次在v3.7版本中引入多基因组比对,显著提升了变异检测的准确性。3 最新的DRAGEN v4.3进一步实现了精准度的飞跃性提升:相较于v3.6.3错误率降低83%,与v4.2.7版本相比错误率减少40%(图4)。5

图4:持续创新的DRAGEN二级分析——GIAB 样本HG002(NIST v4.2.14)5中 SNP与Indel假阳性与假阴性的改进。该数据直观展现了DRAGEN在短短四年内实现的重大突破:通过技术迭代,SNP和Indel的检测错误得到显著降低。

为了更精准反映特定人群的遗传特征,DRAGEN v4.3新增了定制化泛基因组参考索引(之前版本也称图形基因组、多基因组)功能,可显著提升研究中的变异检测准确性。用户可通过以下两种方式构建定制参考索引:

  1. 使用自有基因组组装数据;

  2. 选用人类泛基因组参考联盟(HPRC)提供的基因组组装数据集。


例如,若基于特定研究人群的44个HPRC基因组组装数据构建定制泛基因组参考索引,其变异检测准确度将显著优于旧版本DRAGEN,如v4.2(图5)。 对于常规应用场景,建议使用v4.3默认内置的泛基因组参考索引(基于128个样本),其适用性表现更优。5

图5:DRAGEN二级分析基于定制参考索引的小变异检测准确度提升——在使用 GIAB HG001–HG007进行分析时,基于HPRC泛基因组参考索引的DRAGEN v4.3检测准确度显著优于v4.2版本。5默认的泛基因组参考索引(v4.3,基于128个样本构建)在通用场景下表现更优,其整体性能超越基于HPRC的定制参考索引(4.3-HPRC)。

机器学习

DRAGEN v3.9 首次在胚系小变异分析流程中引入了强大且高效的机器学习校准模块(DRAGEN-ML)作为可选项,并在v4.0中将其设为默认启用。启用后,流程会在标准变异检测步骤后运行机器学习模型,对最终VCF文件的QUAL和GQ字段进行重新校准,在某些情况下,机器学习也可能调整GT字段。校准前的QUAL、GT和GQ值分别保存在DQUAL、DGT和DGQ字段中,确保原始信息无损(图 6)。此步骤对30× WGS胚系变异分析增加约五分钟运行时间,因此准确性的提升对总运行时间的影响有限。

图6:启用机器学习模型的 DRAGEN胚系变异流程

DRAGEN ML模型通过监督式离线训练生成,训练集来自Precision FDA v4.2.1的基准数据集,利用reads特征和上下文特征优化小变异检测质量评分的准确性,用于训练模型的特征包括:比对质量、等位基因频率、变异质量分数、测序深度、GC含量、错配数以及其他内部比对和变异检测相关指标。

通过联合基于泛基因组参考索引的多基因组比对与机器学习,显著提升了小变异检测的准确性,有效降低假阳性/假阴性错误,从而提供最优的变异结果(图 7)。

图7:机器学习与多基因组比对协同降低假阳性与假阴性——基于 GIAB样本(Genome in HG001–HG007的分析结果5,未启用泛基因组参考索引时:机器学习单独应用可使错误率降低10%;同时启用泛基因组参考索引与机器学习:SNP 和 INDEL 错误率减少62%。

总 结

DRAGEN为NGS应用提供高精准度、全面覆盖且高效的二级分析解决方案。通过持续的技术迭代,其不仅进一步提升了检测准确性,还显著扩展了对基因组复杂区域的分析能力,从而能够可靠识别具有挑战性且具有临床价值的遗传变异。

  1. Food and Drug Administration. Truth Challenge V2: Calling Variants from Short and Long Reads in Difficult-to-Map Regions. precision.fda.gov/challenges/10/results.
  2. Illumina. DRAGEN sets new standard for data accuracy in PrecisionFDA benchmark data. Optimizing variant calling performance with Illumina machine learning and DRAGEN graph. illumina.com/science/genomics-research/articles/dragen-shines-again-precisionfda-truth-challenge-v2.html. Published January 12, 2022.
  3. Illumina. DRAGEN wins at PrecisionFDA Truth Challenge V2 showcase accuracy gains from alt-aware mapping and graph reference genomes. illumina.com/science/genomics-research/articles/dragen-wins-precisionfda-challenge-accuracy-gains.html.
  4. Internal data on file. Illumina, Inc., 2022.
  5. Zook JM, Catoe D, McDaniel J, et al. Extensive sequencing of seven human genomes to characterize benchmark reference materials. Sci Data. 2016;3:160025. Published 2016 Jun 7. doi:10.1038/sdata.2016.25
  6. https://help.dragen.illumina.com/product-guides/dragen-v4.3/dragen-dna-pipeline/small-variant-calling/ml-for-vc




.


  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018
  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018

Copyright ©2007-2026 ANTPEDIA, All Rights Reserved