干货 | KEGG—通路分析宝典,怎么看?(内含圣诞礼物)

2021-05-19 17:44:24, 小迈 武汉迈维代谢生物科技股份有限公司



KEGG 数据库于 1995 年由 Kanehisa Laboratories 推出 0.1 版,目前发展为一个综合性数据库,其中最核心的为 KEGG PATHWAY 和 KEGG ORTHOLOGY 数据库。在 KEGG ORTHOLOGY 数据库中,将行使相同功能的基因聚在一起,称为 Ortholog Groups (KO entries),每个 KO 包含多个基因信息,并在一至多个 pathway 中发挥作用。而在 KEGG PATHWAY 数据库中,将生物代谢通路划分为 6 类,分别为:细胞过程(Cellular Processes)、环境信息处理(Environmental Information Processing)、遗传信息处理(Genetic Information Processing)、人类疾病(Human Diseases)、新陈代谢(Metabolism)、生物体系统(Organismal Systems)。


作为常用数据库,它是了解高级功能和生物系统(如细胞、 生物和生态系统),从分子水平信息,尤其是大型分子数据集生成的基因组测序和其他高通量实验技术的实用程序数据库资源

数据库中包含各种各样的数据对象,这些数据对象是为了用来对生物系统进行计算机模拟的。因此,各个数据库中的数据记录都被称为KEGG对象。这些对象可以通过KEGG对象标识符来识别,标识符由一个与数据库相关的前缀加五个数字构成。


 

我们往往通过这些数据信息,查看关注基因、代谢物、酶等的功能,KEGG提供的整合代谢途径(pathway)查询十分出色,包括碳水化合物、核苷、氨基酸等的代谢及有机物的生物降解,不仅提供了所有可能的代谢途径,而且对催化各步反应的酶进行了全面的注解,包含有氨基酸序列、PDB库的链接等等。KEGG是进行生物体内代谢分析、代谢网络研究的强有力工具。与其他数据库相比,KEGG 的一个显著特点就是具有强大的图形功能,它利用图形来介绍众多的代谢途径以及各途径之间的关系。



通路中各种符号标识 :

  • K+num:基因ID号,表示在所有同源物种中具有相似结构或功能的一类同源蛋白

  • ko+num:代谢通路名称,表示一个特定的生物路径

  • M+ num:模块名称

  • C+ num:化合物名称

  • E-,-,-,-:酶名称

  • R + num : 反应名

  • RC+ num :反映类型

  • RP+num:反应物对



除了查看单个基因、代谢物的功能以外, 我们往往会拿到若干个基因的集合(比如差异基因),为了更清楚的了解这些基因的功能,从庞杂的组学数据中发掘规律,往往用到了富集分析,对基因功能进行富集分析, 就有可能发现在生物学过程中起关键作用的生物通路, 并且帮助理解生物学过程的分子机制。

简而言之,基因富集分析是在一组基因中找到具有一定基因功能特征和生物过程的基因集,在研究差异表达基因、筛选基因的后续分析中经常使用

常用的富集分析基于超几何分布,超几何分布是一种重要的离散型概率分布,其概率质量函数可以这样定义:假设有限总体包含N个样本,其中质量合格的为m个,则剩余的N-m个为不合格样本,如果从该有限总体中抽取出n个样本,其中有k个是质量合格的概率为:



以基因为例,对于实际的KEGG富集来讲,总体N即为基因总数(背景基因),有m个质量合格,即一共有m个基因注释到某个通路;抽取n个样本即为目标基因(通常选取差异基因),其中有k个质量合格,即目标基因中有k个注释到该通路。

通过该算法,会得到一个p值,一般情况认为p < 0.05即为显著。但是这是对于一个通路来说的情况, 对于整个KEGG通路来说, 要验证上百个通路(即多重假设检验),这时候就需要引入多重检验来进行校正,从而减低假阳性结果在我们的检验中出现的次数。

主要使用的校正办法有Bonferroni 校正法,它可以称作是“最简单粗暴有效”的校正方法,它拒绝了所有的假阳性结果发生的可能性,通过对p值的阈值进行校正来实现消除假阳性结果。Bonferroni 校正的公式为p*(1/n),其中p为原始阈值,n为总检验次数。如果原始的P值为0.05,检验次数为10000次,那么在Bonferroni 校正中,校正的阈值就等于5%/ 10000 = 0.000005,所有P值超过0.00005的结果都被认为是不可靠的。这样的话假阳性结果在10000次检验中出现的次数为 10000 * 0.000005 =0.5,还不到1次。但是这也存在问题:Bonferroni 委实太过严格,被校正后的阈值拒绝的不只有假阳性结果,很多阳性结果也会被它拒绝

另外一种常用的校正方法是FDR(FalseDiscovery Rate) 校正,相对Bonferroni 来说,FDR温和得多,这种校正方法不追求完全没有假阳性结果,而是将假阳性结果和真阳性的比例控制在一定范围内

举个例子,我们最开始设定的情况中进行了10000次检验,这次我们设定FDR<0.05,如果我们的检验对象为差异表达的基因,那么在10000次检验中假如得到了500个基因,那么这500个基因中的假阳性结果小于 500*5% = 25 个。

校正完毕后,选择符合阈值条件的结果,这些通路就可以当成是候选通路,结合通路图,进行更深入的研究



圣诞
福利
MERRY CHRISTMAS

活动详情

●●● Merry Christmas ●●●

2021年倒计时45天......

2021年倒计时30天......

2021年倒计时15天......

2021年倒计时10天......

你在忙着倒计时奔向2021的怀抱

我在忙着给你准备平安夜&圣诞节的礼物

圣诞老人入境需要隔离14天

所以这个圣诞礼物小迈提前为你准备了!


一、参与方式

2020年12月24日00:00至2020年12月25日12:00期间,点击文末“阅读原文”进入答题页面,完成闯关即可进入抽奖页面。

温馨提示:

(1)看图答题都是迈维代谢的产品名称,答题之前先来看一下迈维产品线做一下功课吧!



(2)答题技巧

  • 答不对就一直答,直到冲刺到抽奖页面!(答题没有次数限制哟)

  • 一手产品线,一手答题页面,我就不信答不对!

二、抽奖规则

(1)每人最多两次抽奖机会;

(2)中奖后查看奖品详情可获得兑奖方式或将奖品详情截图发至微信公众号后台兑奖;


三、关于兑换奖品

需要邮寄的奖品将在活动结束后3-5天内寄出!(抽奖前请务必填写真实联系地址,否则兑奖不成功)


四、其他

仅限生物学医学等相关专业教师、医生、在站博士后、在站研究生参与本次活动。


记得关注我们,12月24日零点准时抽奖!

Merry Christmas



99%的代谢组学研究者都在阅读下文:

客户文章 | Hepatology:慢性乙型肝炎病毒感染中与结合胆红素水平相关的MAIT细胞失调
PLOS Med|中国人2型糖尿病发病风险Biomarker新发现
文献解读 | 雌激素竟能降低心血管疾病的发生率,你晓得不?
一惠到底 | 氧化脂质免费全新升级--Oxylipins氧化脂质COX通路生理药理作用
高能预警 | 脂质组学客户文章二连发!
干货 | 想了解肠道菌群?看这一篇就够了!




咨询电话:027-62433042

微信:18062045271

邮箱:support@metware.cn

网址:www.metware.cn

我就知道你“在看”


  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018
  • 客服电话: 400-6699-117 转 1000
  • 京ICP备07018254号
  • 电信与信息服务业务经营许可证:京ICP证110310号
  • 京公网安备1101085018

Copyright ©2007-2026 ANTPEDIA, All Rights Reserved