2026年3月,科罗拉多州立大学Geoffrey P. Morris等在国际顶级期刊Nature在线发表了题为A sorghum pangenome reference improves global crop trait discovery这一篇具有里程碑意义的文章。研究构建了33份泛基因组及1984份重测序资源,证实了高粱“多中心驯化假说”,揭示了干旱驱动的基因交流模式,并建立了精准关联抗逆性状的k-mer分型方法。
1.研究背景:单一参考基因组的局限
高粱是全球第五大谷类作物,年种植面积超过4000万公顷,是数亿人口的主食来源,也是应对气候变化的战略作物。
然而,传统单一参考基因组(BTx623)难以完整捕获结构变异(SVs)、拷贝数变异(CNVs)和存在/缺失变异(PAVs)。这些大尺度变异恰是许多重要农艺性状的遗传基础。单一参考基因组导致的“参考偏向”严重制约了遗传解析的完整性和分子育种的推进效率。
2.核心资源:泛基因组与多样性模板
研究团队构建了三层基因组资源体系:
(1) 升级参考基因组 BTx623 V5
●contig数量从4783个降至34个,N50达到50.74Mb;
●连续性提升140倍,修正V3版本多处结构拼接错误。
(2) 33个泛基因组参考
●涵盖4个遗传模式材料、9个多样性谱系代表、20个全球重要育种亲本;
●序列总量接近单一参考基因组的2倍;
●鉴定出325个大于100kb的结构变异、26个大于1Mb的倒位变异。
(3) 1984份多样性重测序面板
●737份地方品种、500份育种材料、746份具精确地理参考的种质;
●覆盖全部5个植物学类型;
●配备田间与温室系统表型数据。
3.关键发现一:SHATTERING1证实多中心驯化
研究在落粒性基因SH1位点首次发现7856bp插入片段(含2161bp精确重复),该结构变异仅能通过完整基因组组装识别。
k-mer分型显示三个SH1单倍型呈现显著的地理-植物学类型关联:sh1-1是主要分布于坦桑尼亚的Kafir类型(61.1%);sh1-2是主要分布于尼日利亚的Bicolor(60.0%)、Durra(89.0%)和Guinea(82.8%)类型;sh1-3是主要分布于肯尼亚的Caudatum类型(68.2%),证实了高粱多中心独立驯化假说。
同时,单倍型与遗传亚群并非完全对应,隔离基因池间存在基因渐渗,为整合全球优良基因资源提供了理论基础。
4.关键发现二:干旱驱动的适应性基因流
研究对433份非洲种质进行景观基因组学解析,主要发现如下:
空间尺度:高粱等位基因差异度的特征尺度为125km,是拟南芥的17倍,与珍珠粟相近,凸显人类介导的远距离基因流动的关键作用。
迁移屏障:埃塞俄比亚高原和萨赫勒西部-中部为低基因流区域;南北与东西轴线存在显著基因流梯度,与高粱适应性分化假说吻合。
干旱驱动:高干旱区域种质的等位基因差异度显著低于低干旱区域。高干旱区域间扩展单倍型重叠总和为12.2Mb,显著高于低干旱区域的8.4Mb(P=0.0013),干旱相关基因在大空间尺度上显著富集。
5.关键发现三:蜀黍苷BGC的结构变异
蜀黍苷是高粱中兼具植食性昆虫防御和脱水回避功能的氰苷类次生代谢物,是连接生理与田间表现的关键枢纽。研究发现其含量与氰化物释放潜力无显著相关性(r=0.075),表明代谢调控存在独立维度。GWAS定位1号染色体约175kb BGC,CYP79A1基因A211V突变可增强底物结合力。泛基因组k-mer聚类将33个成员划分为4个簇,表型解释力提升15%,且高表达种质多分布于低降水区域,表明该基因簇受干旱与虫害双重选择。
6.方法学创新:k-mer等位基因字典
传统泛基因组图方法需将所有重测序读段并反复比对至不断更新的图结构,计算负担极重。
本研究为每个基于k-mer的分型方法建立等位基因字典方案:为每个目标基因座的所有已知等位基因构建诊断性短序列(80bp),直接在大规模重测序数据中计数匹配,无需复杂比对。该方法计算高效、易于扩展,诊断性k-mer可直接转化为低成本育种标记,并已成功应用于独脚金抗性和蚜虫抗性等复杂位点的育种标记开发。
本研究构建了33个泛基因组与1984份种质重测序资源,证实多中心驯化假说,揭示干旱驱动基因流,建立k-mer精准分型方法。该资源破解了广适与地方品种的育种困局,为基因编辑提供模板,有望推广至其它作物,助力全球粮食安全。