Nature 子刊丨mGWAS分析超全解读

2021-05-19 17:49:26, 小迈 武汉迈维代谢生物科技股份有限公司




mGWAS概念

metabolomeGenome-Wide Association Study):利用测序技术获得队列样本的基因型数据,结合代谢组数据,开展代谢物的全基因组关联分析,解析代谢遗传机制,促进个性化疾病预防和复杂疾病治疗的发展。











40个全基因组关联研究中361种血液代谢物的遗传力评估


 ● 期刊:Nature Communications

  IF=12.121

 ● 发表时间:2020-01



摘要   


通常,代谢组学研究那些参与细胞新陈代谢的小分子,总的代谢物层面的表型差异中约有50%是由于遗传差异引起的,而不同代谢物类别之间的遗传力(heritability)估计值也有所不同。我们回顾了2008年11月至2018年10月发表的所有全基因组关联和(外显子组)测序的研究,并确定了与代谢物水平相关的> 800种特异性代谢物基因座(metabolite loci)。在一个双胞胎队列研究中(N = 5117),这些代谢物基因座被用来估计309种脂类和52种有机酸的总遗传力(h2total),和已知代谢物基因座(h2Metabolite-hits)所捕获的遗传力比例。我们的研究揭示了在不同种类的脂类和有机酸中,h2metabol- hits呈现出显著差异。此外,不饱和程度高的磷脂酰胆碱比不饱和程度低的磷脂酰胆碱具有更高的h2Metabolite-hits估计值。本研究表明,常见遗传变异对代谢产物水平变化的重要性,并阐明了代谢产物的遗传结构。



前言   


一般来说,我们将代谢组定义为代谢产物的集合,即参与细胞代谢的各种小分子物质,它们在细胞中产生,并可分为许多类别。代谢组学领域的总体目标是对代谢组及其在疾病的生物学机制和代谢紊乱中的作用提供一个全面的概述,并阐明这种作用可能为疾病的诊断提供新的治疗靶标或生物标志物。代谢物水平的变化可能由性别、年龄、生理效应、行为和生活方式因素(如:饮食等)引起。遗传差异则可能是代谢组学概况直接变异的来源,也可能是通过遗传因素对生理、行为和(或)生活方式的影响而产生变异的间接来源。


对人类新陈代谢中常见遗传变异的全基因组和代谢组分析已经成功地识别出了受基因影响的代谢产物。2008年,第一个全基因组关联研究(GWAS;N = 284位参与者)确定了与代谢物水平相关的四个遗传变异。此后,随着样本数量的增加以及在不同人群中的GWAS研究,鉴定了数百个单核苷酸多态性(SNP)与代谢物之间的关系,而这些代谢物来源十分广泛。通过利用低频率和罕见变异分析(外显子组)测序,更多的代谢物基因座被确认。我们对所有发现的代谢物数量性状位点(QTL)进行了全面的综述,见附表1。


双胞胎和家庭研究已经确定,代谢物水平的遗传力(h2由于遗传因素造成的表型变异的比例)平均为50%,范围从h2 = 0%到h2 = 80%。一些研究报告显示,不同种类的脂类物种或脂蛋白亚类之间的遗传力估计值存在差异。例如,Rhee et al.报告称氨基酸比脂质具有更高的遗传力。必需氨基酸不能被生物体合成,它的遗传力比在体内合成的非必需氨基酸要低。可通过技术手段,估计测得的SNP对性状遗传力的贡献,并且在给定家庭成员的SNP数据的同时,可估计SNP相关(h2SNP)和谱系相关(h2ped)的遗传变异。但是,当涉及到家庭成员的数据时,遗传效应(h2total)解释的方差可能会由于共同的环境因素和/或非加性遗传效应而向上偏斜。


加深对代谢物遗传背景的了解,将有助于我们理解疾病和特征的病因学,如:心脏代谢疾病、偏头痛、精神疾病和认知障碍。在这里,我们的目的是通过分析来自多个代谢组学平台的大量双胞胎和家庭成员(N = 5117)的数据,进一步了解遗传因素对空腹血液代谢量(简称代谢物)变化的影响。具体来说,我们的目标是估计代谢物水平的总遗传方差h2total),并阐明已知代谢物类特异性和非特异性位点(h2Metabolite-hits)对代谢物水平的贡献。为此,我们通过代谢物的分类,分析2008年11月至201810月之间发布的所有代谢物-SNP关联,并使用混合线性模型同时估算369种代谢物的h2total,h2SNP和h2Metabolite-hits值。在这些模型中,h2Metabolite-hits由两个方差成分组成,一个成分归因于与特定超类的代谢物相关的代谢物基因座(h2Class-hits),另一个成分归因于其他代谢物基因座(h2Notclass-hits)。脂类h2total的中位值为0.47,有机酸为0.40,有机酸的中位值为0.06,有机酸为0.01,其中大部分h2代谢物h2hit归为h2class-hits。通过使用混合效应元回归模型来检验代谢物类别和脂类种类之间遗传力估计的差异,我们进一步扩展了目前对代谢物类别遗传病因学的知识。虽然h2total的估计值在代谢物类别之间没有显著差异,但h2Metabolite-hits和h2Class-hits在脂类和有机类之间观察到显著差异。


有趣的是,磷脂酰胆碱和甘油三酸酯(TGs)随着其脂肪酰基侧链中碳原子和/或双键数量的增加而显示出更高的遗传力。Draisma等人推测,这可能是由于不同碳原子数目的磷脂酰胆碱或TG的代谢转换轮数不同所致。为了区分磷脂酰胆碱和TGs的脂肪酰基侧链中碳原子数或双键数的影响,我们进行了其他单变量后续分析。结果表明,对于更复杂的磷脂酰胆碱(即具有更大数量的碳原子和/或双键),h2metabolites -hits估计值更高 单因素随访表明,这可能归因于磷脂酰胆碱中双键的数量(例如,不饱和度)。




结果
1

代谢物分类

200811月至201810月期间,进行了40GWA和(外显子组)测序研究,确定了242,580个代谢物-SNP或代谢物比率-SNP的关联。所有242,580个关联都可以在补充数据中找到,该数据通过研究列出了重要的SNP-代谢物关联。这些关联包括1804个独特的代谢物或比例和49,231个独特的SNP(将所有SNP转换为NCBI build 37后为43,830。检索每种代谢物的人类代谢组数据库(HMDB)标识符,以提取有关代谢物的疏水性和化学分类的信息(请参见方法)。剔除未识别的代谢物,我们将953种代谢物按照HMDB分类分为12个超类(1)43个超类或77个亚类,其中大部分代谢物被分为脂类或有机酸超类。脂类可细分为8类,每类有195,795个代谢- snp关联(平均= 17,589;SD = 32,553),在32个亚类中,亚类代谢- SNP关联的数量从140,440(平均= 4673;SD = 9124)。这些有机酸及其衍生物被分为9类,与代谢- SNP关联的数量从126832(平均= 3374;SD = 8832)。有机酸及其衍生物也被划分为17个有机酸亚类,亚类代谢- SNP关联数从126,448(平均= 1786;SD = 6371;1)在所有四个平台中,我们评估了427个代谢物,剔除比率和未包括在选定代谢物-SNP关联列表中的超类代谢物后,可以得到402个代谢物的数据。代谢物的完整清单及其分类和未转化水平的四分位值载于补充表。402种代谢物分为336种脂类、53种有机酸、9种有机氧化合物、3种蛋白质和1种有机氮化合物。这些超类由12个类组成。在本文中我们主要关注前两个超类。经过质量控制(QC),从这两个超类中保留369个代谢物进行分析。


2

代谢产物的遗传影响

5117名参与者的数据来自以下四个代谢组学平台:南丁克健康质子核磁共振(1H-NMR)平台、超性能液相色谱质谱(UPLC-MS)脂质组平台、莱顿1H-NMR平台和Biocrates Absolute-IDQTM p150平台。参与者在荷兰双胞胎登记簿(NTR)登记,聚集在2445个核心家庭中。所有参与者的代谢组学和SNP数据都是可用的。样本的背景和人口统计学特征见表2


我们旨在评估先前确定的代谢物和GWA和(外显子)测序在我们独立样本中的遗传变异解释的方差。显然,我们的结果取决于过去的研究能力,因为代谢物遗传变异的列表是基于以前的GWA和(外显子)测序研究。我们在中提供了每个过去研究的样本量,并给出了每个代谢物与SNP关联的样本量。


混合线性模型包括单个遗传相关性矩阵(GRM)中与代谢物相关的所有遗传变异位点,将包含与某些代谢物相关但与其他不相关的SNP,或者包含许多与给定代谢物不相关的SNP。 因此,我们为与代谢物命中相关的基因座创建了两个GRM(请参见方法):一个类别特异的和一个非类别特异的(即,除目标代谢物类别外,GRMs包含所有代谢物的代谢物基因座)。我们探索了针对12个类别特异和相应的非类别特异GRM的模型。 这些模型显示出高度的不收敛性(总计37.9%),其中包括小型类特异GRM的模型显示出更高的不收敛性。因此,本文其余部分的结果是基于代谢物超类,即脂质和有机酸。



 

表1  每个超类的独特代谢物数量概述



 

表2  每个代谢组学平台的参与者特征


对于369种脂质和有机酸,我们进行了无约束的四方差成分分析(图1)。在全基因组复杂性状分析(GCTA)中,我们指定了一个模型,在该模型中,我们将代谢物变异分为SNP相关(h2SNP谱系相关(h2ped、特定类别代谢物位点相关(h2class-hits),以及与非代谢物类别相关的(h2notclass-hits)遗传变异(图1)。我们报告了总遗传力(h2total),一部分可归因于代谢物超类特定基因座(h2Class-hits),另一部分可归因于非超类代谢物基因座(h2Notclass-hits以及已知代谢物基因座对代谢物水平的贡献(h2Metabolite-hits)。在两组分析中,分别使用类特异性和非类特异性的GRM(使用LDAK程序创建)分别对脂质和有机酸进行了分析。在脂质分析中,采用了包含479个脂质基因座的类特异性GRM包含596个基因座的非类特异性GRM在有机酸分析中,包括397个基因座的类特异性GRM683个基因座的非类特异性GRM。在分析之前,将代谢物数据标准化(对数log均一化或逆秩;请参见方法)。所有模型中,均包括抽血者的年龄、性别、来自SNP基因型数据的前十个主要成分(PC、基因分型芯片和代谢组学测量批次作为协变量。


 

图1  四方差分量模型概述



包括所有369种代谢物53种有机酸和316种脂质)的四方差遗传分量模型的估计值。基因组相关性矩阵残差最大似然(GREML)算法收敛于中的361种(97.8%)代谢物,有6种代谢物(1.6%)的GREML算法不收敛。由于不可逆方差-协方差矩阵,未完成对2种代谢物的分析(0.5%)。309种脂质的h2total估计值介于0.110.66之间(平均值= 0.47;平均值s.e. 0.04)。对h2Metabolite-hits的估计值介于-0.050.16之间(平均值= 0.06;平均值s.e. = 0.03;表3)。52种有机酸的h2total 估计值范围为0.140.72(平均= 0.41;平均值s.e. = 0.04)。h2Metabolite-hits的估计值范围为-0.080.11(平均值= 0.01;平均s.e. = 0.023)。一般来说,脂质和有机酸的h2class均高于h2Notclass,脂质的h2Class-hits范围为-0.020.160.06;平均s.e. = 0.02),有机酸的h2Class-hits范围为-0.040.14(平均值= 0.01;平均s.e. = 0.02)。对于脂质而言,h2Notclass-hits为零(平均值s .e. = 0.02范围为-0.060.12。对于脂质而言,有机酸,h2Notclass-hits为零(平均值s .e. = 0.02范围为-0.060.05(表3)。



 

  表3  四方差分量模型的遗传力估计值


本研究囊括了多个代谢组学平台数据,对代谢产物在多个平台上的测量结果进行比较。一项早期研究表明,43种代谢物中有29种出现在两个平台上,并在两个平台上都显示出中等的遗传力。本研究搜集多个平台上测量的61种代谢物,且在每个平台上的h2total均为中等,同时,不同平台上评估的相同代谢物的h2total均为正相关,正相关系数为0.36。



3

不同代谢物类别之间的遗传力差异

如图2所示,以下几种有机酸之间的遗传力差异:酮酸,羟基酸和羧酸。酮酸,其次是羧酸,具有最高的h2total中位值与h2Class-hits估计值(图2)。虽说羟酸的h2Notclass-hits中位值与h2Metabolite-hits估计值最高,但这些代谢物的h2total中位值与h2Class-hits估计值最低(图2)。为了调查遗传力在有机酸类别之间是否存在显著性差异,我们应用了多元混合效应元回归模型,对代谢物平台效应进行了校正(请参见方法)。多元混合效应元回归模型显示,有机酸类别的h2totalh2Class-hits不存在显著性差异。然而,通过多元混合效应元回归模型观察,有机酸类别之间的h2Metabolite-hits估计值有显著性差异(F447= 3.44,错误发现率(FDR)校正后的p= 0.03 )和h2Notclass-hits估算值(F447= 19.95FDR校正后的p= 1.25×10-08)。


 

  所有52种羧酸类的遗传力


同时,我们使用多元混合效应元回归来评估必需氨基酸和非必需氨基酸、脂质之间的遗传力差异。元回归分析显示,必需氨基酸和非必需氨基酸之间没有显著的均值差异(表4)。使用多元混合效应元回归模型发现,在不同种类的脂质之间存在着较小但显著的平均遗传力差异(图3)。对于不同种类的脂质,h2Metabolite-hits估计值有显著差异(F8300= 8.47FDR校正后的p= 0.004)。




 

 图3 所有309种脂类的分类遗传力



最后,我们探讨了磷脂酰胆碱和TGs的遗传力是否随着脂肪酰基侧链中碳原子数和/或双键数量的增加而增加。为此,我们针对TG二酰基磷脂酰胆碱(PCaa)和酰基-烷基磷脂酰胆碱(PCae;请参见方法),分别采用单变量和多元混合效应元回归模型。多元混合效应元回归模型显示,碳原子和双键数量的变化与PCaah2Metabolite-hits估计值显著相关F352= 7.05FDR校正后的p= 0.009)和PCae''sF345= 3.41FDR校正后的p= 0.05)。碳原子数较多的磷脂酰胆碱的遗传力估计值较低,而双键数目较的磷脂酰胆碱的遗传力估计值较高。具有可变碳原子数和/或双键的磷脂酰胆碱之间的不同可能导致了h2Class估计值的改变。单变量模型证实了上述结果。


 

表4 必需氨基酸和非必需氨基酸的遗传力估计值





讨论

我们对GWA和代谢组学相关研究进行了全面评估,并创建了一个关于欧洲人种样本的SNPs和血液代谢物相关性的研究数据库。我们整理241,965个全基因组代谢物关联,并将相关代谢物分类为超类类和亚类。补充数据中提供了所有血液代谢物-SNP关联的完整概述。来自该数据库的信息用于构建GRMs,用于在369个代谢物分析中筛选遗传变异组分。我们研究中的代谢物数据来源于四个代谢组学平台上测量的大量双胞胎队列(N = 5117集中2445个家庭中)。我们专注于两个代谢物超类。通过将所有代谢物定位到HMDB,我们能够将测得的代谢物和所有先前发表的代谢物分类为脂质或有机酸。在当前的研究中,我们试图基于十年的GWA和(外显子组)测序研究来阐明已知代谢物基因座对代谢物水平(h2Metabolite-hits)的贡献。我们研究能够区分h2Class-hitsh2Notclass-hits代谢物基因座对代谢物类别和脂质种类之间遗传力差异的作用。


为了评估h2total估计值在代谢物类别和脂质种类之间的差异,我们将多元混合效应元回归模型应用于h2Metabolite-hitsh2Class-hitsh2Notclass-hits的估计之中。我们观察到,代谢物类别之间的h2total估计值无显著性差异。与先前的双胞胎研究一致,必需氨基酸和非必需氨基酸之间的遗传力估计均无显著性差异。我们发现,不同类别的有机酸之间存在着显著h2Metabolite-hits差异。与羧酸相比,酮酸的h2Metabolite-hits估计值低得多。脂肪酰基脂蛋白和类固醇的h2Class-hits代谢物基因座遗传度估计值明显更高。同样,有报道显示,脂质类遗传力呈现出显著异质性,磷脂的h2totalh2SNP低于鞘脂或甘油脂。最后,我们评估了遗传力是否随着脂质种类复杂性的增加而增加。我们发现,对于复杂的二酰基和酰基烷基磷脂酰胆碱中,h2Metabolite-hits估计值是这种情况,但对于更复杂的甘油三酯而言,情况并非如此。先前的研究报道显示,多不饱和脂肪酸脂质中存在着较高的h2SNP估计值。此外,与传统脂质测量相关的基因座可解释2–21%的脂质水平差异。这些结果加在一起表明,磷脂酰胆碱中较高的遗传力是由较少数量的碳原子和较高数量的双键(例如较大的不饱和度)驱动的。


评估脂类和有机酸的平均遗传力差异,似乎脂类比有机酸具有更高的h2totalh2Class-hitsh2metabolof -hits估计数(3)。以往的双家系研究表明,脂类和有机酸之间的遗传力差异很少被研究。这可能是因为大多数代谢组学平台主要关注的是脂类或有机酸。脂类代谢物类在代谢组学平台上往往有很好的代表,而有机酸则没有代表。因此,由于这种失衡,有机酸的h2Class-hitsh2Metabolite-hits估计值的分析将得不到足够的数据支持。


目前的研究有几个局限性。首先,我们的研究结果在多大程度上适用于非欧洲血统的人群尚不清楚。人类常见代谢途径的基因座最有可能在不同人种中复制。其次,基于来自近亲(如表兄妹或近亲)的数据,所解释的总方差估计值可能显示出向上的偏差。这种偏差是由共同的环境影响、上位相互作用或显性效应所造成的。虽然目前的研究结果可能会因为纳入了双胞胎、兄弟姐妹和父母而产生偏差,但样本也涵盖了许多不相关的个体,这将有助于减少可能产生的偏差。


Kettunen等人以经典双胞胎设计研究了Nightingale Health 1H-NMR平台的217种代谢物,并报道了6.45%的代谢物的显性效应。Tsepsilov等进行了针对非加性遗传效应的GWA研究,并得出结论,代谢物水平和比值的大多数遗传效应实际上是加性的。总之,这些研究表明,显性效应对代谢物水平带来的偏差较小。


很少有关于双胞胎研究能够证实共同环境影响对代谢物水平的作用。总体而言,少数代谢物具有共同的环境影响,共同环境的影响相对较小。对于父母和他们的后代,或成年双胞胎和兄弟姐妹在内的研究,都会出现一个问题,即共同环境会关注哪些影响因素。在后代开始独立生活之前,这些共同环境对后代的持久影响是否与父母以及彼此之间共享?为了阐明共同环境在代谢物水平上的作用,有必要进行更多的研究。


第三,h2SNP估计值的标准很高。虽然所有h2SNP估算值添加到补充材料中,但我们强调,本文的主要目标是调查独立样品中已知代谢物基因座的贡献,而不是获取代谢物的h2SNP估算值。


最后,基于十年GWA和(外显子组)测序研究中40项不同研究的SNP,我们得到了h2metabolite-hits估算值。这些研究的样本量和功效均不同,其中一些研究仅涉及211个人,而另一些研究则包括24,000多个人。对于代表性不足的代谢物,较低的功效可能会导致遗传力估计值发生偏差。 但是,利用十年之中的40项研究中的信息,并从多个研究中选取大量代谢物类别的基因座,此类代谢物的数量并不多。新的和未来的研究将增加被确定为代谢物基因座的变异的数量。 预计对英国生物样本库Biobank的投资,将大幅增加用于人类代谢组的大规模基因组研究的样本量,并随后增加代谢产物基因座的数量。


孟德尔随机化可能受益于我们对鉴定的代谢物基因座的全面论述。所鉴定出的基因座可以用作复杂特征的全代谢组孟德尔随机研究的工具。此外,我们的工作为常见遗传变异在代谢物类别和脂质种类之间特定类别的遗传力差异所发挥的作用提供了宝贵的见解。因而,需要进一步的研究来阐明稀有遗传变异对代谢产物水平的贡献,以及稀有遗传变异在代谢产物类别之间贡献的差异。一种合理的方法是对大量的全基因组测序数据样本进行类似的研究。 这种方法使用等位基因频率(MAF)和连锁不平衡(LD)分层GREML分析,由于身高和体重指数的稀有变异而发现额外的变异。


总之,本研究有助于了解空腹血液代谢产物水平的遗传结构,以及不同类别代谢产物之间的遗传结构差异。通过包含已知代谢物位点扩展GREML框架,使我们能够同时估计361个代谢物的h2totalh2metabolite-hits(h2Class-hitsh2Notclass-hits组成)。在不同种类的脂类和有机酸以及更复杂的二酰基和酰基烷基磷脂酰胆碱中,观察到h2Metabolite-hits估计值存在显著性差异。未来的研究应解决可遗传和不可遗传生活方式对代谢物变异比例的影响,因为这将促进个性化疾病预防和复杂疾病治疗的发展。





方法

1
受试者

在NTR的代谢组学数据中,可获取6011个囊括了双胞胎和家庭成员的受试者的血样数据,其中5667人已进行了基因分型。本研究中描述的四个代谢组学实验的血液样本主要收集于NTR生物库项目的参与者。其中,1.3%血液样本收集于禁食两个小时以上的受试者,而绝大部分禁食过夜后(98.7%)收集血液样本。生育妇女在无药周或月经周期的第24天收集血液样本。在本篇论文中,我们排除了非欧洲血统的参与者,以及在抽血时使用降脂药物且未遵守禁食方案的参与者。在完成了代谢组学数据的预处理之后,每个平台的单独子集被合并为每个平台一个数据集,当有多个观测值时,每个平台保留一个(随机选择的)观测值。研究的最终参与者人数为5117,具体针对平台样本量范围从14484227个个体,分布在946-2179个家庭中。个体的相关特征信息可以在表2中找到。Central Ethics Committee on Research Involving Human Subjects of the VU University Medical Centre, Amsterdam批准了这些项目,该研究机构是经过the U.S. Office of Human Research Protections认证的机构审查委员会(IRB number IRB00002991 under Federal-wide Assurance- FWA00017598; IRB/institute codes, NTR 03180 and EMIF-AD 2014.210)。


2
代谢谱

血浆和血清样本已在四个代谢组学平台上进行了分析两个质子核磁共振波谱(1H-NMR)平台和两个质谱(MS)平台。血浆样品在Nightingale Health 1H-NMR平台(Nightingale Health Ltd.Helsinki, Finland)MS脂质平台和Leiden 1H-NMR平台上进行分析。使用Biocrates Absolute-IDQTM p150平台(Biocrates Life Sciences AGInnsbruck, Austria)分析血清样本。



3
代谢组学数据预处理

每个平台和每个批次代谢组学数据分别进行预处理。当平均变异系数超过25%,漏失率超过5%时,将代谢物排除在分析之外。如果代谢物测量值低于检测或定量的下限,或者被分类为离群值,则将其设置为缺失。由于代谢物测量值低于检测/定量极限而被设置为缺失的,将使用该极限值的一半作为填充值,或当该极限值未知该代谢物的最低观测水平的一半作为填充值。所有剩余的缺失值均通过链式方程(multivariate imputation by chained  equations, mice)的多变量填充法推算得出。平均每个代谢物估算9个值(SD = 12;范围:1-151)。在1H-NMR平台上每种代谢物的数据均通过反正态秩变换进行标准化,而Biocrates代谢组学平台和UPLC-MS脂质组学平台的估算值,则是通过自然对数变换log进行标准化处理确保从这些平台获得的数据符合先前的归一化方法


4
基因分型、估算和祖先离群值检测

基因型信息来自6个不同基因分型阵列的21,001NTR参与者(Affymetrix 6.0 [N = 8640], Perlegen-Affymetrix [N = 1238], Illumina Human Quad Bead 660 [N = 1439], Affymetrix Axiom [N = 3144], Illumnia GSA [N = 5938]Illumina Omni Express 1 M [N = 238]),以及来自荷兰参考基因组计划GONL的序列数据(BGI full sequence at 12 × (N = 364)。如果样本的基因型检出率90%,性别缺失或杂合度(Plink F statistic超出-0.10~0.10范围,则将其剔除;如果是AT / GC回文结构且MAF0.4~0.5之间SNP或者MAF低于0.01,如果Hardy Weinberg平衡(HWE)的p <10−5,孟德尔错误数大于20,且基因型检出率小于0.95,则将SNPs去除。QC质控后将六个基因分型阵列与GONL参考基因组V4比对,如果等位基因和参考基因组不匹配,或基因分型阵列与该参考基因组之间的等位基因频率差异大于0.10则去除SNPs


六个基因分型芯片的数据合并为一个数据集(1,781,526SNP)。基于整个阵列中共有的〜10.6 K SNPs数据,使用PLINKKING对所有个体的Identity-by-decentIBD)进行了估算。接着,将IBD与预期的家庭成员进行了比较,如果发生不匹配,则将个人移除。将重复的单卵双胞胎N=3032)或三胞胎N=7)和NTR GONL样品(N=364)去除,并使用MACH-ADMIX进行基因型填充后,对基因型填充后的数据进行过滤包括去除与单个基因分型芯片显著相关p<10−5),HWE p<10−5,孟德尔误差率>mean+3SD填充质量(R2)低于0.90SNPs数据。最终跨平台填充数据集包括1,314,639SNPs,其中20,792SNPsX染色体上。


我们使用基于HRC1000G填充准备和检查工具(版本4.2.5https//www.well.ox.ac.uk/~wrayner/tools)的PERL,对跨平台填充数据进行比对最终对1,302,481SNP进行定相,常染色体使用EAGLEX染色体使用SHAPEIT,再使用1000 Genomes Phase 3进行基因型填充 (1000GP3 version 5)。使用SMARTPCA进行PCA分析得到10PCs投影。祖先离群值(非荷兰血统;N=1823)是指PC值超出欧洲/英国人口范围的个体。消除祖先异常值后,将重新计算前10PCs



5
代谢物位点的管理

201810月,运用PubMedGoogle Scholar对已发表的GWA和(外显子组)测序研究进行了检索,这些研究使用1H-NMR质谱或气相色谱的方法血样中代谢组学或脂肪酸代谢进行了分析。


200811月至201810月期间,出版40欧洲人为样本来源的血液代谢组学的GWA或(外显子组)测序研究报告。提取了所有研究的全基因组显著p<5×10-8)代谢物-SNP关联位点,仅包括常染色体SNP的结果,并基于汇总统计数据(不包括NTR样品)报告SNP效应大小和p值。40项研究显示,报告了242,580个代谢物-SNP或代谢物比值-SNP的关联。这些关联涵盖了1804个独特的代谢物或比例和49,231个独特的SNPs。对于所有代谢物,均检索了其人类代谢组数据库(HMDB),PubChemChemical Entities of Biological Interest and International Chemical Identifier identifiers依据从HMDB中提取的信息,将有关代谢物分为超类类和类。如果没有HMDB标识符,并且无法提取分类信息,则根据专家意见分为超类类和类。排除比值和未鉴定的代谢物,将953种代谢物分为12个超类43个类或77个亚类。基于代谢物标识符,我们还提取了每种代谢物的logS)值,以评估代谢物的疏水性。logS)值表示1-辛醇和水(两种流体几乎不互溶)之间的分配系数的对数。分配系数是当一种物质加入辛醇-水混合物中时,其在水和辛醇中的浓度之比,此表示化合物的疏水性。因此,如果代谢物比1-辛醇更具疏水性,我们将其分类为疏水性,否则将其分类为亲水性。


通过不同的基因组数据dbSNP图谱报告了49,231个独特SNPrsID或染色体碱基对位置,因此我们将所有SNP提升至HG19 build 37版本,之后保留了43,830个独特SNPs。所有双等位基因代谢物SNPs均从我们的1000GP3数据中提取,其中不包括295个三烯酸SNPs4256个无法从1000GP3中检索到的SNPs。接下来,进行MAF>1%(去除了2067SNP),R2>> 0.702002SNPs)和HWE p<<10-472SNP)过滤,从而为NTR参与者产生了35,138个代谢物SNPs。接下来,我们创建了两个超类特异代谢物基因座列表和两个非超类特异代谢物基因座列表。为了创建被分类为脂质和类脂质分子(例如脂质)的652种独特代谢产物相关的基因座列表,我们使用0.10LD阈值(r2)(2500独立个体中半径为500kb将所有112,760种脂质-SNP关联聚类(PLINK版本1.9)。通过聚类鉴定出482个主要的SNP,或脂质的基因座。另有12,169SNP被确定为脂质的LD-proxies。为了获得脂质基因座的非超类列表,从所有代谢物-SNP关联的列表中删除了12,651个脂质基因座和LD-proxies,并将得到的列表聚集在一起以获得598个非超类基因座。将相同的聚类方法应用于26,352个有机酸-SNP关联分析,从而确定398个有机酸位点,10,781个有机酸LD-proxies687个非超类位点。


6
遗传关系矩阵的建构

共构建了六个加权GRMs,对SNPs之间的不均匀和远距离LD进行了校正(LDAK版本4.9)。通过模拟比较了加权GRMs加权GRMs的使用。其中两个GRMs使用跨平台填充数据集作为主干,其他四个GRMs则是基于从1000GP3填充数据中提取的SNPs。在计算第一个GRM之前,跨平台填充数据集的常染色体SNPs进行MAF<1%)过滤,并去除脂质和有机酸位点,它们的LD-proxies  50 kb范围内的SNPs(请参阅代谢物位点管理,得到434,216SNPs,构建LDAK GRMGREML分析中的VG1)方差分量基于GRM(请参见遗传分析;图1)。GREML分析中的VG2)方差分量基于LDAK GRM跨平台填充数据集(MAF大于1%的所有常染色体SNPs447,794SNPs祖先异常值被删除,对于sharing小于0.05的所有个体基因组sharing设置为零,(图1)。基于提取的1000GP3脂质位点(479 SNP)或有机酸位点(397 SNP)的LDAK GRM,如所述的聚类方法获得代谢物GREML分析中VG3)方差分量。最后,非脂质LDAK GRM596 SNPs)或非有机酸LDAK GRM683 SNPs)提供了GREML分析中VG4)方差分量(图1 )。通过如上所述的聚集程序获得非分类特异代谢物基因座,构建 LDAK GRM。补充数据标明每个列出的SNP是否属于任何特定类别或不属于类别的LDAK GRM



7
遗传力分析

使用GCTA软件包(1.91.7版)的混合线性模型来比较三个模型,其中包括可变数量的协变量。补充数据给出了三种不同的模型,补充说明给出了协变量的完整描述和模型比较。选择最简约的模型进行进一步分析。最终模型包括荷兰人口的前十遗传PCs基因分型芯片性别和抽血年龄作为协变量。对于Nightingale Health 1H-NMRBiocrates平台的代谢物,将测量批次作为协变量包括在内。


最终的四方差成分模型(包括四个GRM)可以估算由超类特异的重要代谢物基因座和非超类特异的重要代谢物基因座解释的变异比例。四方差分量模型中的前两个方差分量(图1),V(G1)V(G2)允许全基因组SNPh2g)估算加性遗传方差效应,以及与谱系(h2ped相关的加性遗传效应,V(G3)V(G4)获取了类别特异的(h2Class-hits)和类别特异的h2Notclass-hits加性遗传效应基于四方差分量模型,可以计算三个加性遗传力估计值:显著的代谢物基因座(h2Metabolite-hits)解释的总方差V(G3)/VpV(G4)/Vp之和组成,其中Vp表型方差,h2SNP定义为V(G1)/VpV(G3)/VpV(G4)/Vp的总和,解释的总方差(h2total)定义为V(G1)/VpV(G2)/VpV(G3)/VpV(G4)/Vp的总和(图1)。我们注意到,遗传因素解释的总方差也可能包括共同环境,显性作用和上位性的影响,这可能导致h2total估计值的向上偏差。预计这种偏见将由存在密切相关的参与者引起,这些参与者除了加性遗传效应外还可能共享这些效应。为了计算复合方差估计的标准误差(se),我们从每种代谢物的V(G1)V(G3)V(G4) GRM的参数方差-协方差矩阵中随机抽取了10,000个新方差。根据原始均值和方差/协方差矩阵,在R中随机抽样创建10,000个多元正态分布(MASS软件包版本7.3-50中的mvrnorm函数)。然后,根据10,000个样本中的比率的标准偏差确定特定比率的标准差。四方差成分模型中,包括限定为正的方差成分,因此允许h2SNPh2Metabolite-hits估计值为负。如果V不是正的,则所有四方差分量模型都在必要时应--reml-bendV倒置方差-协方差矩阵V,当方差分量为负时,有可能会发生这种情况。最后,我们计算了删除掉V(G3)V(G4)或同时删除的简化模型的对数似然,并计算了LRTp值。


8
混合效应元回归分析

为了研究不同类别代谢产物之间的遗传力估计值的差异,我们应用了混合效应回归模型,使用R(版本3.5.1)的metafor软件包(版本2.0-0进行该模型的计算。在这里,我们通过代谢物分类和代谢物组学平台对所有成功分析的361个代谢物的遗传力进行了估算。我们纳入了一个矩阵,将表型相关性和代谢物之间的样品重叠结合起来作为随机因素,以校正代谢物和参与者之间的依赖性。该矩阵包括对角线上代谢物的样大小,非对角线通过N1,2* r*(n1 *n2)0.5进行计算,其中N1,2是代谢物之间的样品重叠n1是代谢物1样本大小,n2是代谢物2的样大小,r是代谢物之间的表型(斯皮尔曼氏rho)相关性。在所有的混合效应元回归分析中,我们基于夹心方差估计获得了可靠的估计值,通过代谢物聚类校正不同代谢物之间的样品重叠。首先,我们使用多元混合效应元回归模型同时估算代谢物类别和代谢组学平台对h2totalh2SNPh2Metabolite-hits以及h2Class-hitsh2Notclass-hits估计值的影响。随后,为进一步评估磷脂酰胆碱和TGs的脂肪酰基链中碳原子或双键数量的影响,进行单变量模型拟合。对单变量和多元模型使用p.adjust函数R分别进行了多重校正。





            助力科研






迈维代谢             


迈维代谢五周年真情回馈



咨询电话:027-62433042

微信:18062045271

邮箱:support@metware.cn

网址:www.metware.cn

我就知道你“在看”


  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018
  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018

Copyright ©2007-2026 ANTPEDIA, All Rights Reserved