2025-04-22 02:22:40 Illumina因美纳(中国)科学器材有限公司
引言
通过二代测序(NGS)解锁基因组的潜力对于生物医学研究和精准医疗至关重要。为了最大限度地从NGS中获取洞见,研究人员需要能够将原始测序数据转化为有意义结果的分析工具。DRAGEN通过采用高度可重构的现场可编程门阵列(FPGA)技术,为NGS数据提供精准、全面且高效的二级分析。DRAGEN显著加速了NGS数据的二级分析,包括数据拆分、序列比对、变异检测等关键步骤,此外,DRAGEN专门针对基因组分析中的常见挑战进行优化,例如:分析时间过长、数据量庞大,以及基因组复杂区域的变异检测。
在2020年的Precision FDA Truth V2挑战赛中,DRAGEN v3.7在全部基准区域和难比对区域(相较于Sentieon、Seven Bridges、BWA-GATK等)均获得最高准确性评级(图1)。1,2
图1:DRAGEN在难比对区域和所有基准区域的分析中表现更佳
之后推出的DRAGEN v4.3在原有卓越性能基础上实现了显著提升:通过引入强大的机器学习(ML)和进一步改进的基于泛基因组参考索引的多基因组比对,在小变异检测准确度方面达到前所未有的水平——在所有基准区域中F1分数高达99.89%(图 2)。
图2:DRAGEN在所有基准区域分析中的准确性——F1分数(%)综合考虑了精确率和召回率。3,4 基于参考数据集,分数越高表明准确性越高。
基于泛基因组参考
索引的多基因组比对
DRAGEN通过整合群体单倍型的定相变异(phased variants)并利用群体来源的替代重叠群(alt contigs)来增强参考基因组,使之能够高效执行基于泛基因组参考的序列比对,显著提升Illumina reads在复杂基因组区域的比对质量。这一创新功能拓展了Illumina reads的有效覆盖范围,使得此前无法准确分析的基因组区域也能实现精准比对和变异检测。
多基因组比对是一种利用群体数据辅助序列比对的方法,其核心在于将群体中存在的替代序列信息构建为包含分叉与汇聚的动态路径结构(图3)。通过图数据结构,样本reads能够沿图谱中的最佳匹配路径进行精准比对。
图3:基于泛基因组参考的多基因组比对——在泛基因组参考中,群体中记录的替代序列信息以多样化的分叉与汇聚路径形式呈现。
DRAGEN首次在v3.7版本中引入多基因组比对,显著提升了变异检测的准确性。3 最新的DRAGEN v4.3进一步实现了精准度的飞跃性提升:相较于v3.6.3错误率降低83%,与v4.2.7版本相比错误率减少40%(图4)。5
图4:持续创新的DRAGEN二级分析——GIAB 样本HG002(NIST v4.2.14)5中 SNP与Indel假阳性与假阴性的改进。该数据直观展现了DRAGEN在短短四年内实现的重大突破:通过技术迭代,SNP和Indel的检测错误得到显著降低。
为了更精准反映特定人群的遗传特征,DRAGEN v4.3新增了定制化泛基因组参考索引(之前版本也称图形基因组、多基因组)功能,可显著提升研究中的变异检测准确性。用户可通过以下两种方式构建定制参考索引:
使用自有基因组组装数据;
选用人类泛基因组参考联盟(HPRC)提供的基因组组装数据集。
例如,若基于特定研究人群的44个HPRC基因组组装数据构建定制泛基因组参考索引,其变异检测准确度将显著优于旧版本DRAGEN,如v4.2(图5)。 对于常规应用场景,建议使用v4.3默认内置的泛基因组参考索引(基于128个样本),其适用性表现更优。5
图5:DRAGEN二级分析基于定制参考索引的小变异检测准确度提升——在使用 GIAB HG001–HG007进行分析时,基于HPRC泛基因组参考索引的DRAGEN v4.3检测准确度显著优于v4.2版本。5默认的泛基因组参考索引(v4.3,基于128个样本构建)在通用场景下表现更优,其整体性能超越基于HPRC的定制参考索引(4.3-HPRC)。
机器学习
DRAGEN v3.9 首次在胚系小变异分析流程中引入了强大且高效的机器学习校准模块(DRAGEN-ML)作为可选项,并在v4.0中将其设为默认启用。启用后,流程会在标准变异检测步骤后运行机器学习模型,对最终VCF文件的QUAL和GQ字段进行重新校准,在某些情况下,机器学习也可能调整GT字段。校准前的QUAL、GT和GQ值分别保存在DQUAL、DGT和DGQ字段中,确保原始信息无损(图 6)。此步骤对30× WGS胚系变异分析增加约五分钟运行时间,因此准确性的提升对总运行时间的影响有限。
图6:启用机器学习模型的 DRAGEN胚系变异流程
DRAGEN ML模型通过监督式离线训练生成,训练集来自Precision FDA v4.2.1的基准数据集,6 利用reads特征和上下文特征优化小变异检测质量评分的准确性,用于训练模型的特征包括:比对质量、等位基因频率、变异质量分数、测序深度、GC含量、错配数以及其他内部比对和变异检测相关指标。
通过联合基于泛基因组参考索引的多基因组比对与机器学习,显著提升了小变异检测的准确性,有效降低假阳性/假阴性错误,从而提供最优的变异结果(图 7)。
图7:机器学习与多基因组比对协同降低假阳性与假阴性——基于 GIAB样本(Genome in HG001–HG007的分析结果5,未启用泛基因组参考索引时:机器学习单独应用可使错误率降低10%;同时启用泛基因组参考索引与机器学习:SNP 和 INDEL 错误率减少62%。
总 结
DRAGEN为NGS应用提供高精准度、全面覆盖且高效的二级分析解决方案。通过持续的技术迭代,其不仅进一步提升了检测准确性,还显著扩展了对基因组复杂区域的分析能力,从而能够可靠识别具有挑战性且具有临床价值的遗传变异。
04-23 Dr. Dai
MSTD系列显微镜专用电动滑台:显微镜下图像分毫必现04-23 光电行业都会关注
展会回顾|“融两业共生之力 筑湾区超级枢纽”2026大湾区创新生态大会04-22 谱临晟
荧飒光学践行企业社会责任,赋能光电人才高质量培养04-22 荧飒光学
天平安装丨现场直击地震对天平的影响,几十台天平瞬间“跳动”?04-22 小普
报名通知丨英斯特朗塑料力学测试高阶培训研讨会04-22 英斯特朗
成都科林分析邀您共赴TFF·2026酒类风味分析与感官评价暨创新技术论坛,期待与您相遇!04-22
吉艾姆4月双展齐发 | 武汉科仪展+脂在浙里研讨会04-22
应用笔记 | 基于Flex自动化平台的多体液胞外囊泡分离及EV蛋白质组学分析流程04-21 肖伟弟 曾嘉明
CCMT2026开展即高能 | Equator-X™ 双模式测量仪引爆全场04-21
告别预测偏差!Percepta自建专属训练库,pKa预测更准更快04-21 ACDLabs 李丹
世界地球日,查看地球的【愿望清单】04-21
【前沿激荡,智汇北京】IGC 2026圆满落幕,益世科生物共绘细胞基因治疗新蓝图04-21
硬核方案护航核安全|衡昇质谱斩获核材料检测装备大奖04-21
会议预告 | 英盛生物邀您共赴2026第六届北京临床质谱论坛!04-21
Turbiscan在陶瓷3D打印粘结剂分散稳定性表征中的应用及关键意义04-21 大昌华嘉
GranuCharge (粉体静电分析仪)用于研究湿度对粉末表面性能的影响04-21 大昌华嘉
生物打印鼻软骨的理想材料:GelMA水凝胶的力学与细胞外基质平衡新探索04-21 大昌华嘉生命科学
Biolin Theta系列接触角测量 | 如何在表面表征应用中使用接触角:前进角04-21 大昌华嘉
大昌华嘉科学仪器荣获Novasina 2025年度“成长与创新先锋奖”!04-21 大昌华嘉












