2026年6月,密歇根州立大学Robert VanBuren团队在The Plant Cell发表了题为Predicting complex phenotypes using multi-omics data in maize的文章。该文章整合基因组、转录组与无人机表型数据,构建多组学模型,并对129个玉米性状进行预测,揭示多组学融合的价值及复杂性状的网络调控机制。

玉米复杂性状由遗传、调控网络与环境共同互作决定,传统基因组预测依赖静态SNP标记,难以捕捉基因型–环境互作(G×E)效应与动态生理响应。因此,研究以WiDiv群体(约750份自交系)为材料,整合基因组(3.4万个SNP)、转录组(2.8万个基因)及无人机表型组(950个植被指数),并在9个不同环境/年份下收集129个玉米性状。模型层面上,对比了线性混合模型(rrBLUP)和非线性支持向量回归(SVR),并采用5折交叉验证,以皮尔逊相关系数评估预测精度。

研究表明,多组学模型整体优于单组学,其中“基因组+转录组”组合表现最佳。转录组作为连接基因型与表型的关键桥梁,不仅显著提升预测精度,还增强跨环境泛化能力,并有效捕捉G×E效应。相比之下,表型组(无人机植被指数)单独预测能力较弱,但在部分特定性状(如根系性状)中仍具有一定补充价值。

利用密歇根州的转录组数据,可准确预测内布拉斯加州的开花时间,这揭示了转录组中蕴含着保守的发育核心程序。同时,同一基因的表达-表型关联在不同环境下差异显著(如MADS-box 15仅在内布拉斯加强相关),表明多环境转录组整合能有效捕捉静态SNP难以检测的G×E互作。

研究发现,产量预测的模型权重呈现典型的多基因弥散模式,如:前10%的基因仅贡献36%的总权重,表明预测精度依赖于成百上千个转录本的协同信号,而非少数主效基因。高权重正向关联基因主要富集于光合电子传递、蛋白稳态及养分转运等代谢通路,而负向关联基因则集中于脱水响应等胁迫防御通路,这表明高产基因型的核心在于“代谢高效与蛋白稳定”,低产则伴随资源向防御通路的倾斜,进一步印证了复杂性状源于系统级的网络状态,而非少数主效基因决定。

该研究整合基因组、转录组与表型组数据用于复杂性状预测,显著提升了预测精度,并增强了对G×E互作的解析能力,同时推动从静态向动态生理网络理解的转变,为提升模型泛化能力与揭示性状网络机制提供了新路径。