干货分享:表观多组学关联分析研究思路及应用案例

大家好,这里是专注表观组学十余年,领跑多组学科研服务的易基因。

表观多组学是指在整体层面系统解析DNA甲基化、RNA修饰、组蛋白修饰、染色质可及性等多种表观调控层级的学科方向。其核心在于将不同维度的调控信息关联到同一基因组坐标,观察它们如何协同或拮抗,最终决定基因是否转录、何时转录、转录多少。

多组学关联分析可以探究分子调控与表型间的关联机制,解析生物分子功能和调控机制,同时多组学数据资源之间可相互验证,减少单一组学分析带来的假阳性,提高研究可靠性。


什么是关联分析?

关联分析是一种实用的分析技术,就是发现存在于大量数据集中的关联性或相关性,从而描述一个事物中某些属性同时变化的规律和模式。

需要特别注意的是:相关≠ 因果;相关≠ 必然

非因果关系/尚不清楚因果关系。是一种没有方向的联系。

图例:分子的相互作用,产生关联

图例:实际应用中往往三管齐下


组学技术关联性及其组合方式

图例:表观组学关联分析的组合方式

多组学关联的意义:串联证据,互相验证,从不同的角度合力探索和解释生物学问题

判断组学之间是否可以进行关联:是否有关联的生物学理论基础

如:

启动子区甲基化会抑制基因的表达。

基因主体甲基化与基因表达正相关。

开放染色质状态与基因表达有关。

蛋白质是mRNA翻译的产物。

miRNA可与mRNA相互作用影响其表达和翻译

图例:易基因表观多组学关联分析研究内容


常用的关联分析思路

(1)直接关联

① 重叠分析

特点:简单粗暴,也适用于样本量少的情况。

a.分析结果:韦恩图。

关联理论基础:DNA甲基化、miRNA和siRNA协同作用调控基因表达。

图例:WGBS+totalRNA-seq,含DMR的差异表达基因、差异miRNA靶向的差异表达基因、差异siRNA靶向的差异表达基因三者之间的重叠关系分析


b.分析结果:韦恩图、九宫格图。

关联理论基础:RNA甲基化可有效调控基因表达。

c. 分析结果:元件水平分析图、IGV信号图。


② 皮尔森/斯皮尔曼相关性分析

特点:准确计算相关性程度(R值),及其显著性(p值)。

分析结果:散点图(+拟合线)、相关性热图

关联理论基础:DNA甲基化可直接调控基因表达。

图例:血液组织RRBS+RNA-seq,DMR的甲基化水平与差异表达的表达水平之间的皮尔森关联分析。


图例:癌与癌旁DNA甲基化芯片+RNAseq,DMC的甲基化水平与差异表达的表达水平之间的皮尔森关联分析。


关联理论基础:RNA转录和蛋白质翻译具有上下游关系。


图例:胚胎scRNA-seq+蛋白质组,两连续发育阶段之间的RNA和表蛋白质表达的相关性分析。


(2)模型关联

回归分析(regression analysis)是确定两组或两组以上变量间关系的统计方法。回归分析按照变量的数量分为一元回归和多元回归。两个变量使用一元回归,两个以上变量使用多元回归。

多元线性回归模型(multiple linear model)

Y~k0X0+k1X1+…+C

特点:基于基因表达、蛋白质、代谢物等之间的直接和间接相互作用联系。

分析结果:关联网络图

关联理论基础:肠道菌群可通过产生代谢物进入血液,运输至肝脏影响肝脏细胞基因表达。

图例:肠道菌群16S+血液代谢组+肝脏转录组,通过多元线性模型关联分析,筛选出若干优秀模型,组建低剂量抗生素饲喂促进仔猪快速生长的多组学调控网络。


(3)网络关联

细胞内所有大分子相互作用的集合,称为相互作用组(Interactome),是大多数基因型与表型关系的基础,可以用来指导解释组学技术检测到的变化如何干扰整个机体。

机体的分子响应和变化具有功能富集性、通路富集性。因此不同组学检测数据也具有相似的功能富集性和变化规律。

网络关联算法正是基于这些生物学理论基础。

基于WGCNA的共变关联网络分析(WGCNA module correlation)

基于表观模块的差异网络分析(EMDN algorithm)

相似性网络融合分析(SNF algorithm)

多组学因子分析(Multi-Omics Factor Analysis,MOFA)

分析结果:关联网络图


基于WGCNA的共变关联网络分析

利用组间差异基因鉴定共甲基化和共表达模块。

模块-模块相关性、模块表型相关性可以有效识别具有功能富集性的多组学变化模块。

关联理论基础:基因组DNA的甲基化与基因表达变化具有功能富集性。

图例:血液组织RRBS + RNA-seq,基因的差异甲基化模式与基因表达模式的共变关联网络分析。

前期直接关联得到的基因很少;

改变策略,采用基于WGCNA的共变关联网络分析,得到的共甲基化和共表达基因均富集于自噬相关通路。


基于表观模块的差异网络分析(EMDN algorithm)

利用组间差异基因鉴定共甲基化(共表达)模块。

差异共甲基化(差异共表达)网络筛选。

从多个差异共变网络中筛选共同网络。

图例:基于表观模块的差异网络分析(EMDN algorithm)


相似性网络融合分析 (SNF algorithm)

图例:

SNF算法(图1d)使用了一种基于信息传递理论的非线性算法,该方法迭代更新每个网络,使其与其他网络更加相似。经过几次迭代之后,SNF收敛到单个网络中。

算法的优点是,弱相似性(低权重的边)消失,有助于降低噪声,而在一个或多个网络中存在的强相似性(高权重的边)被添加到其他网络中。

图例:融合网络三个cluster内部的连接性、紧密性和cluster之间相对较少的边界,说明该算法可以更清晰地显示多形性成胶质细胞瘤(GBM)患者的分型情况。


多组学因子分析(Multi-Omics Factor Analysis,MOFA)

图例:

采用完全无监督的学习方式,将主成分分析(PCA)的概念拓展到多组学数据,从而挖掘出隐藏在复杂生物数据背后的可解释低维表示。

MOFA本质上是一种多视图、无监督的因子分析模型。它不局限于两种数据类型,可以同时整合多种组学数据(如转录组、表观基因组、蛋白质组等)。

假设不同数据模态中的变异是由一组共同的、潜在的“驱动因素”所驱动的。MOFA的任务就是将这些潜在的驱动因素从高维嘈杂的数据中“剥离”和“提炼”出来。


关联后续挖掘思路

基因表达相关的组学:

基因敲除/抑制

基因过表达

甲基化组学:

甲基化酶基因的敲除与过表达


多组学关联分析案例解析

案例1:DNA甲基化修饰多组学案例

案例2:RNA修饰多组学案例

案例3:染色质可及性多组学案例

参考文献:

①Yan H, Bombarely A, Xu B, et al.Autopolyploidization in  switchgrass alters phenotype and flowering time viaepigenetic  and tranion regulation[J]. Journal of experimental botany,2019

② Pekow, J., Hernandez, K.,. (2019). IBD-associated Colon Cancers Differ  in DNA Methylation and Gene Expression Profiles Compared with  Sporadic Colon Cancers. Journal of Crohn’s and Colitis, 13(7), 884–893.

③ Zhang, D., Hu, Q., … Gao, F. (2019). Epigenetic and transcriptional signatures of  ex situ conserved golden snub-nosed monkeys (Rhinopithecus roxellana). Biological Conservation, 237, 175–184.

④Gao, Y., Liu, X.. (2017). Protein Expression Landscape of Mouse Embryos during  Pre-implantation Development. Cell Reports, 21(13), 3957–3969.

⑤Inter-correlated gut microbiota and SCFAs changes upon antibiotics exposure links with rapid body-mass gain in weaned piglet model. The Journal of nutritional biochemistry, 2019, 74: 108246.

⑥ Multiple network algorithm for epigenetic modules via the integration of genome-wide DNA methylation and gene expression data. BMC Bioinformatics, 2017,18(1), 1–13.

⑦ Similarity network fusion for aggregating data types on a genomic scale. Nature Methods, 2014,11(3), 333–337.

⑧ Multi-Omics Factor Analysis-a framework for unsupervised integration of multi-omics data sets. Mol Syst Biol, 2018,14(6), e8124.

⑨ Zhang, P., Zhao, Q., Song, Y. et al. Identification of key genes controlling anthocyanin biosynthesis in the fruits of a bud variety of Tarocco blood-orange. BMC Plant Biol 25, 230 (2025). Doi:0.1186/s12870-025-06212-7.

⑩Feng Y, Yu Z, Tang M, Li J, Peng B, Juaiti M, Tang Y, Liang B, Ouyang M, Liu Q, Song J. Transcriptome-Wide N6-Methyladenosine Alternations in Pulmonary Arteries of Monocrotaline-Induced Pulmonary Arterial Hypertension in Rats and Novel Therapeutic Targets. Biomedicines. 2024 Feb 4;12(2) doi: 10.3390/biomedicines12020364.

⑪Yin S, Lu K, Tan T, Tang J, Wei J, Liu X, Hu X, Wan H, Huang W, Fan Y, Xie D, Yu Y. Transcriptomic and open chromatin atlas of high-resolution anatomical regions in the rhesus macaque brain. Nat Commun. 2020 Jan 24;11(1):474. doi: 10.1038/s41467-020-14368-z.

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容