2026年7月,以色列特拉维夫大学Eilon Shani教授与Itay Mayrose教授团队在Trends in Plant Science发表了题为Navigating genetic redundancy in plant genomes: insights for research and breeding的综述文章。该研究系统梳理了植物基因组中遗传冗余的成因、类型划分及其对功能解析与育种实践的多重制约,并结合人工智能预测模型与CRISPR多重基因编辑技术,提出了系统性破解遗传冗余的策略框架,为植物功能基因组学研究和多倍体作物精准改良提供了重要的理论依据与方法学参考。

1.不止是“备份”:冗余的四种面孔
并非所有遗传冗余都具有相同的生物学属性。根据基因对之间的功能重叠程度与环境依赖性,综述作者将其划分为以下类型:
●完全冗余:单个基因失活不产生表型,必须多个成员同时失活才出现异常。
●部分冗余:成员间功能有重叠,但也各有专属分工。
●不等冗余:一个基因挑大梁,另一个只起辅助缓冲作用。
●条件冗余:补偿机制平时“静默”,只在干旱、盐碱等胁迫条件下才启动。
此外还有通路水平的冗余,即不同代谢或信号通路之间可互相替代。
完全冗余保障核心功能的稳定性,不等冗余在维持功能的同时允许部分成员分化,条件冗余则帮助植物在波动环境中实现资源的最优配置。

2.数据说话:植物基因组里到底有多少“备份”?
研究者利用PLAZA与Ensembl Plant两个数据库,对98个已完成基因组测序的植物物种进行了系统比较。结果显示:
●二倍体被子植物中,多基因家族基因占比平均为74%–75%,其中拟南芥约75%、水稻71%、番茄70%,莴苣与胡萝卜高达84%;
●无油樟显著偏低(48%–62%),因其为最古老被子植物谱系;
●多倍体物种中该比例进一步提升,棉花从82%升至92%,小麦增幅约10%。
此外,除序列相似性外,表达模式的保守性同样是维持冗余功能的关键因素。即使两个重复基因的蛋白编码区已发生显著分化,只要其调控区域得以保留,仍可在相同组织中维持重叠表达,继续发挥补偿作用。

3.育种家的烦恼:冗余带来的三大难题
遗传冗余对功能研究与作物改良构成三重制约:
难题一:表型被“掩盖”
单基因突变常因同源基因代偿而不产生可见变化。如番茄FUL1与FUL2共同调控成熟,单敲除仅轻微影响色素,双敲除才显著降低番茄红素,易导致基因功能被低估。
难题二:高阶突变体难构建
识别潜在冗余基因需大规模生信分析与实验验证,而同时失活多个旁系同源拷贝的传统操作极为困难,尤其对拷贝数众多的基因家族。
难题三:优良性状难以聚合
冗余基因常以串联簇形式紧密排列,难以通过杂交拆分。多倍体作物尤为突出,如小麦MLO家族需同时失活三个同源拷贝才能获得白粉病抗性。此外,序列高度相似也增加了分子标记设计与比对的难度。
4.从“大海捞针”到“精准定位”:预测工具的升级之路
早期预测冗余主要依赖氨基酸序列比对(如BLAST),但该方法局限性明显——功能重叠不仅取决于序列,还受表达调控、蛋白修饰及网络互作影响。
后续开发的CAFRI工具(分别针对水稻与拟南芥)整合了序列相似性与多组织、多发育阶段、多环境条件下的表达谱,显著提升了预测的针对性。
近年来,机器学习模型的引入使预测能力大幅提升。2021年的模型已纳入功能注释、进化属性、蛋白特征、表达模式、表观修饰与网络互作六大类特征,预测准确率AUC-ROC达到0.84;2024年进一步引入深度学习,使预测准确性和跨物种泛化能力持续提高。
当前的核心瓶颈在于训练数据的质量——判断一对基因“非冗余”往往只基于有限实验条件,若尚未在适宜条件下检测,则可能被错误归类。未来需结合大规模CRISPR筛选、单细胞转录组等技术,构建更全面、更具代表性的训练数据集。

5.CRISPR“团灭”:如何一次性解决冗余基因家族
当冗余基因被预测识别后,如何实现其系统性失活是下一关键步骤。传统的化学诱变或杂交聚合面对紧密连锁的基因簇时效率低下。CRISPR技术提供了两条有效路径:
路径一:单条sgRNA靶向保守序列
通过设计识别家族保守区域的单条sgRNA,一次编辑即可同时作用于多个成员。例如,拟南芥中靶向AITR家族的sgRNA成功获得五重与六重突变体,显著提高耐旱耐盐性,且无生长发育代价。
路径二:多重sgRNA载体同步编辑
在大豆中,针对三个乙烯信号冗余基因,采用多重CRISPR/Cas9载体同步编辑,获得的三重突变体开花提前约7天,产量提升1.65倍。
在此基础上,研究团队已在拟南芥与番茄中构建了全基因组规模的CRISPR突变体文库,并进一步划分为功能性亚文库。每个文库植株携带针对多个冗余基因的sgRNA组合,在T1代即可产生大量高阶突变体,有效暴露被遮蔽的表型。在棉花中,针对CDPK基因家族的CRISPR文库也已成功用于抗虫关键基因的田间筛选。

6.未来展望:从“拦路虎”到“好帮手”
综述在结语中指出,未来遗传冗余研究的重点将从“识别成对冗余基因”转向“解析条件依赖的冗余基因模块”——即在特定组织、特定环境信号与特定发育时空中动态理解基因间的补偿关系。
值得重点关注的三个方向:
●单细胞与空间转录组技术:在细胞分辨率下解析冗余的空间分布,明确补偿事件发生在哪些细胞类型。
●AI驱动的多组学预测模型:整合染色质状态、三维基因组构象、蛋白互作与代谢约束,实现跨物种的高精度预测。
●育种应用转化:将多重编辑与等位基因叠加、拷贝特异性基因分型相结合,在优良种质中实现多基因位点的优化配置。
这篇综述系统梳理了植物遗传冗余的成因与类型,基于98个基因组数据揭示了其普遍性,并指出该现象导致表型遮蔽、育种受阻等核心问题。文章进一步提出结合机器学习预测与CRISPR多重编辑的系统性破解策略。该综述为植物功能基因组学与多倍体育种提供了重要方法论框架,有望推动遗传冗余从研究障碍向作物设计工具转变。