2021-05-19 17:44:24, 小迈 武汉迈维代谢生物科技股份有限公司

KEGG 数据库于 1995 年由 Kanehisa Laboratories 推出 0.1 版,目前发展为一个综合性数据库,其中最核心的为 KEGG PATHWAY 和 KEGG ORTHOLOGY 数据库。在 KEGG ORTHOLOGY 数据库中,将行使相同功能的基因聚在一起,称为 Ortholog Groups (KO entries),每个 KO 包含多个基因信息,并在一至多个 pathway 中发挥作用。而在 KEGG PATHWAY 数据库中,将生物代谢通路划分为 6 类,分别为:细胞过程(Cellular Processes)、环境信息处理(Environmental Information Processing)、遗传信息处理(Genetic Information Processing)、人类疾病(Human Diseases)、新陈代谢(Metabolism)、生物体系统(Organismal Systems)。
作为常用数据库,它是了解高级功能和生物系统(如细胞、 生物和生态系统),从分子水平信息,尤其是大型分子数据集生成的基因组测序和其他高通量实验技术的实用程序数据库资源。
数据库中包含各种各样的数据对象,这些数据对象是为了用来对生物系统进行计算机模拟的。因此,各个数据库中的数据记录都被称为KEGG对象。这些对象可以通过KEGG对象标识符来识别,标识符由一个与数据库相关的前缀加五个数字构成。
我们往往通过这些数据信息,查看关注基因、代谢物、酶等的功能,KEGG提供的整合代谢途径(pathway)查询十分出色,包括碳水化合物、核苷、氨基酸等的代谢及有机物的生物降解,不仅提供了所有可能的代谢途径,而且对催化各步反应的酶进行了全面的注解,包含有氨基酸序列、PDB库的链接等等。KEGG是进行生物体内代谢分析、代谢网络研究的强有力工具。与其他数据库相比,KEGG 的一个显著特点就是具有强大的图形功能,它利用图形来介绍众多的代谢途径以及各途径之间的关系。
通路中各种符号标识 :
K+num:基因ID号,表示在所有同源物种中具有相似结构或功能的一类同源蛋白
ko+num:代谢通路名称,表示一个特定的生物路径
M+ num:模块名称
C+ num:化合物名称
E-,-,-,-:酶名称
R + num : 反应名
RC+ num :反映类型
RP+num:反应物对
除了查看单个基因、代谢物的功能以外, 我们往往会拿到若干个基因的集合(比如差异基因),为了更清楚的了解这些基因的功能,从庞杂的组学数据中发掘规律,往往用到了富集分析,对基因功能进行富集分析, 就有可能发现在生物学过程中起关键作用的生物通路, 并且帮助理解生物学过程的分子机制。
简而言之,基因富集分析是在一组基因中找到具有一定基因功能特征和生物过程的基因集,在研究差异表达基因、筛选基因的后续分析中经常使用。
常用的富集分析基于超几何分布,超几何分布是一种重要的离散型概率分布,其概率质量函数可以这样定义:假设有限总体包含N个样本,其中质量合格的为m个,则剩余的N-m个为不合格样本,如果从该有限总体中抽取出n个样本,其中有k个是质量合格的概率为:


以基因为例,对于实际的KEGG富集来讲,总体N即为基因总数(背景基因),有m个质量合格,即一共有m个基因注释到某个通路;抽取n个样本即为目标基因(通常选取差异基因),其中有k个质量合格,即目标基因中有k个注释到该通路。
通过该算法,会得到一个p值,一般情况认为p < 0.05即为显著。但是这是对于一个通路来说的情况, 对于整个KEGG通路来说, 要验证上百个通路(即多重假设检验),这时候就需要引入多重检验来进行校正,从而减低假阳性结果在我们的检验中出现的次数。
主要使用的校正办法有Bonferroni 校正法,它可以称作是“最简单粗暴有效”的校正方法,它拒绝了所有的假阳性结果发生的可能性,通过对p值的阈值进行校正来实现消除假阳性结果。Bonferroni 校正的公式为p*(1/n),其中p为原始阈值,n为总检验次数。如果原始的P值为0.05,检验次数为10000次,那么在Bonferroni 校正中,校正的阈值就等于5%/ 10000 = 0.000005,所有P值超过0.00005的结果都被认为是不可靠的。这样的话假阳性结果在10000次检验中出现的次数为 10000 * 0.000005 =0.5,还不到1次。但是这也存在问题:Bonferroni 委实太过严格,被校正后的阈值拒绝的不只有假阳性结果,很多阳性结果也会被它拒绝。
另外一种常用的校正方法是FDR(FalseDiscovery Rate) 校正,相对Bonferroni 来说,FDR温和得多,这种校正方法不追求完全没有假阳性结果,而是将假阳性结果和真阳性的比例控制在一定范围内。
举个例子,我们最开始设定的情况中进行了10000次检验,这次我们设定FDR<0.05,如果我们的检验对象为差异表达的基因,那么在10000次检验中假如得到了500个基因,那么这500个基因中的假阳性结果小于 500*5% = 25 个。
校正完毕后,选择符合阈值条件的结果,这些通路就可以当成是候选通路,结合通路图,进行更深入的研究。
活动详情
99%的代谢组学研究者都在阅读下文:

我就知道你“在看”
05-13 汉尧
会议邀请 | 2026(南京)制药行业质量控制技术大会暨展览会05-13 纳纯小助手
淮安色谱质谱学术研讨会|清谱科技携创新质谱方案惊艳亮相05-13
[AFM] 如何同时实现高响应度与毫秒级响应速度?这项 Ga₂O₃ 研究给出了新答案05-12 光电传感器量测
默克邀您相约2026 In Vivo X 创新峰会05-12
邀请函丨BioReliance®生物安全检测之监管解读与前沿技术研讨会05-12
Ultimate XS-C18对异构体的分离效果如何?05-12 分离纯化部
中国矿业大学:在长达数月的反复实验周期中,福立气相色谱仪表现出了极强的稳定耐用性05-12
文献速递|InnoScan激光共聚焦荧光微阵列生物芯片扫描分析仪助力脊髓损伤后神经功能恢复研究05-12 环亚生物
InnoQuant激光共聚焦全景玻片扫描在非小细胞肺癌肿瘤微环境研究中的应用05-12 环亚生物
InnoScan荧光微阵列生物芯片扫描分析仪助力缺血性中风的神经机制研究05-12
Innopsys激光共聚焦扫描仪助力结直肠癌靶点发现05-12 环亚生物
学员招募|赛默飞扫描电镜培训班广州站05-12
国际博物馆日|用科技解码被岁月封印的“潜信息”05-12 安捷伦科技
做寡核苷酸 LC/MS 的人,都在偷偷用这根“作弊神器”05-12 安捷伦科技
食品 PFAS 检测新方案 | 一套流程,覆盖多种类食品基质05-12 安捷伦科技
农残智能判读软件客户专属 | 依据新版 GB2763 更新数据库,判读效率再提升05-12 安捷伦科技
HPLC/UHPLC 双平台高效赋能,精准助力食品国标 GB 5009.35-2023 落地05-12 安捷伦科技
安捷伦 × 南阳光电产业协会:一场跨越千里的“追光”之旅05-12 安捷伦科技
相聚杭州 | 安捷伦邀您共赴第五届可持续航空燃料(SAF)技术经济研讨会05-12 安捷伦科技




