HPRC2

HPRC2概览

这篇文章介绍的是 HPRC2(Human Pangenome Reference Consortium Release 2),即人类泛基因组参考计划的第二阶段成果。论文于 2026年7月22日发布在 bioRxiv,目前属于尚未经过同行评审的预印本。研究以230名个体的两个单倍型为基础,构建了约460条单倍型基因组,并配套建立泛基因组图、坐标系统、基因注释、泛转录组和泛表观基因组。

一、研究背景

传统人类基因组分析通常将测序数据比对到一个线性参考基因组,如GRCh38。但任何一个人的基因组都不可能代表全部人群遗传多样性,特别容易遗漏:

大片段插入、缺失、倒位和拷贝数变异;
高度重复区域,如着丝粒、端粒附近和节段重复;
不存在于GRCh38中的序列;
嵌套在新插入序列内部的变异;
不同人群中特有或频率差异较大的单倍型。

T2T-CHM13虽然补齐了GRCh38缺失的许多区域,但它本质上仍然只是一个单倍型基因组。泛基因组的思路是把很多人的单倍型组装、它们之间的比对关系,以及基因和调控元件注释整合起来,用“图结构”而非一条线来表示人类遗传多样性。HPRC1已经证明这一框架可行,但仅包含88条主要单倍型,样本量、复杂区域完整性和功能注释仍然有限。

因此,这篇论文主要回答四个问题:

增加多少、选择哪些样本,才能覆盖绝大部分常见遗传变异?
长读长技术能否大幅提高每个人基因组的完整性和准确性?
如何在泛基因组中表示传统参考基因组不存在的序列和变异?
泛基因组是否能真正改善变异检测、功能基因组学和疾病相关研究?
二、总体研究方法

研究的整体流程可以概括为:

样本优化选择 → 多平台长读长测序 → 单倍型分辨组装 → 质量控制 → 泛基因组比对和建图 → 基因、转录和表观遗传注释 → 实际应用验证。

  1. 样本选择

作者开发了 MaxVar贪心算法。每轮计算候选个体能够为现有参考增加多少尚未覆盖的常见变异,优先选择边际贡献最大的个体。常见变异定义为等位基因频率AF≥1%。

局部祖源则使用 PCLAI:将每条染色体划分为多个窗口,把窗口投影到1000 Genomes样本形成的二维PCA空间,得到连续的祖源坐标和不确定性,而不是简单地给一个人贴单一“大陆祖源”标签。

  1. 测序和组装

主要使用:

PacBio HiFi:高单碱基准确度;
Oxford Nanopore超长读长:跨越长重复序列;
Illumina Hi-C或父母短读长数据:区分父源和母源单倍型;
Hifiasm:组装;
DeepPolisher:单碱基纠错;
HMM-Flagger、NucFlag和k-mer分析:检测结构错误及计算QV。

126名个体采用trio分相,104名个体采用Hi-C分相。两种方式完整度和连续性相近,说明现在即使没有父母样本,也可以获得较好的单倍型分辨组装。

  1. 泛基因组表示

作者使用了三套互补方法:

Minigraph:结构变异分辨率,图较小,适合可视化和读段定位;
Minigraph-Cactus,MC:碱基级多序列比对,包含小变异和结构变异;
IMPG/PGGB:参考无关的成对比对集合,能够覆盖部分着丝粒和卫星重复区域。

此外还建立了Pantree和GRef两种泛基因组坐标系统,用于描述不在GRCh38或T2T-CHM13上的序列。

三、各结果部分

  1. HPRC2覆盖了超过99%的常见小变异
    方法

作者首先用1000 Genomes已有的基因型运行MaxVar选择样本,然后在约44万名All of Us参与者中验证覆盖率。

结果

All of Us数据中共有约727万个AF≥1%的常见小变异:

HPRC1的88条单倍型覆盖约91.92%;
HPRC2的460条单倍型覆盖约99.43%;
模型推测约932条单倍型时可达到99.9%。

当频率阈值降低到AF≥0.1%,即加入较罕见变异时:

HPRC1覆盖约62%;
HPRC2覆盖约83%;
要覆盖99%以上,预计需要数千条甚至更多单倍型。
意义

HPRC2已经接近覆盖研究人群中的全部常见变异;今后继续增加样本,主要收益将来自更罕见、更具人群特异性的变异。

  1. 连续局部祖源标注和ELSI设计
    方法

PCLAI不把一个个体整体归入某一祖源类别,而是沿染色体逐窗口估计祖源坐标。

结果

祖源相对单一的个体,在各染色体上的坐标较稳定;具有近期混合祖源的个体则表现为不同祖源片段交替出现。重组断点附近的不确定性通常更高。

ELSI处理

作者强调遗传祖源不等于种族、民族或身份:

样本优先根据实际遗传变异选择,而不是根据种族标签选择;
保留1000 Genomes原始样本标签;
只有在分析需要时才使用聚合祖源标签;
将标签写成“AFR-like”“EUR-like”等,表示遗传相似性,而不是身份认定。

  1. 组装质量显著提高,产生数千条T2T染色体
    主要结果

HPRC2包含:

3,666条完全无缺口的T2T染色体,占约35%;
2,490条仅有少数缺口的T2T scaffold,占约24%;
合计约59%的染色体达到T2T contig或T2T scaffold水平;
93%的染色体只有不超过3个缺口或断点。

平均碱基质量约为QV55,相当于约每35万个碱基出现一个预测错误;HPRC1约为QV52.5,即约每17.5万个碱基一个错误。

结构不可靠区域比例由:

HPRC1的6.9%;
降至HPRC2的3.1%。

在GRCh38本身能够良好表示的区域中,不可靠比例仅约0.59%。

复杂区域的具体改善

8p23.1区域包含约4.1 Mb的大倒位,其两侧是高度相似的节段重复:

HPRC1中约45.7%的单倍型在这里存在组装缺口;
HPRC2中所有组装在此区域均无缺口并被预测为正确;
主要得益于ONT超长读长跨越两侧重复结构。

着丝粒完整且准确的比例也由HPRC1的约15%提高至HPRC2的约66%。

  1. 更完整的单倍型变异图谱
    方法

作者分别建立Minigraph、MC和IMPG/PGGB泛基因组表示,并用由14种变异检测器共同支持的联合变异集进行评价。

结果

相较HPRC1,HPRC2的MC图增加了:

至少两个单倍型共有的非参考序列:约42 Mb;
至少一个单倍型存在的序列:约128 Mb;
可比对的非参考序列总量:约271 Mb;
其中约106 Mb属于AF≥1%的常见序列。

图中包含:

3,449万个小变异位点,HPRC1为2,078万个;
10.916万个结构变异位点,HPRC1为6.59万个;
结构变异对应的非参考节点长度约189.92 Mb,HPRC1为90.78 Mb。

与联合真值集比较:

小变异F1:99.16%,HPRC1为97.87%;
结构变异F1:92.64%,HPRC1为88.29%。

不过,在串联重复区域中,HPRC2的结构变异精确率略有下降,可能是因为更大的图增加了重复区域的表示复杂度。

  1. 建立非参考序列的泛基因组坐标

传统VCF只能很好地描述相对于线性参考的变异。如果一个大插入本身不在GRCh38中,那么插入内部的小SNP或indel就很难获得正常坐标。

方法

作者提出:

Pantree:在泛基因组图上构建最小生成树,以图的边描述变异;
GRef:在原线性参考之外增加一组非冗余的插入序列contig。
结果

Pantree发现非参考位置上存在:

约260万个SNP;
约230万个indel;
约8万个结构变异。

分别占可比对泛基因组全部SNP、indel和SV的7.1%、23.0%和52.2%。

每条单倍型中位数包含:

79,088个非参考SNP;
57,435个非参考indel或MNP;
9,517个非参考SV。

合计约14.3万个变异,占每个样本全部变异约2.6%。

意义

“非参考变异”不是极少量例外,而是每个人基因组中相当稳定的一部分。线性参考会系统性遮蔽这些变异。

  1. 复杂结构变异区域得到更深入描述
    6.1 节段重复

作者在459条单倍型中检测大于1 kb、序列一致性超过90%的节段重复,并用短读长深度进行验证。

结果显示:

每条单倍型平均约171.6 Mb节段重复;
94.6%的节段重复得到验证;
泛基因组约12%,即382.7 Mb,属于节段重复;
只有约42.5 Mb在所有人中近似固定;
AFR样本平均携带更多、也更独特的节段重复。
6.2 移动元件插入

共识别23,531个多态性移动元件插入:

18,597个Alu;
3,260个L1;
1,500个SVA;
77个LTR;
约30%为HPRC2首次报告。

虽然全部位点中52.4%属于罕见变异,但一个人携带的移动元件插入绝大部分是常见变异。

6.3 串联重复和VNTR

HPRC2观察到的VNTR等位基因数量较HPRC1增加约60%;考虑重复单元的具体序列组成时,增加约68%。

作者不仅分析重复次数,还分析重复单元的排列和序列组成。与只看长度相比,使用motif组成可以多识别约14%具有群体差异的位点。

6.4 着丝粒

利用专门工具Centrolign比较α卫星阵列。即使HPRC2样本量显著增加,只有42.5%的着丝粒单倍型能找到序列差异小于20%的近邻,说明着丝粒具有很高的进化周转和单倍型多样性。

因此,全基因组其他区域的常见变异虽接近饱和,但着丝粒仍远未饱和。

6.5 亚端粒跨染色体重排

IMPG比对发现染色体间同源序列主要集中在:

近端着丝粒染色体短臂;
X、Y染色体的PAR和XTR区域;
染色体末端的亚端粒区域。

除已知区域外,作者在41条染色体臂上发现伪同源区域,形成15个跨染色体序列群,支持不同染色体末端之间存在反复的异位交换。

6.6 G-四链体区域

作者用PGGB图中的SNP研究预测G-四链体结构区域,发现约377,395个SNP位于G4区域,其中:

6.2%未进入gnomAD;
19.3%无法映射到GRCh38。

G4区域的SNP密度普遍高于非G4区域,提示这些结构可能具有较高突变率;但在启动子和5′UTR等功能区差异较小,可能说明纯化选择在去除部分G4相关变异。

  1. 泛转录组和基因注释
    方法

作者使用两套独立注释流程:

CAT2;
Ensembl。

并对206名个体的淋巴母细胞系进行PacBio Kinnex长读长RNA测序。

基因注释结果

两套流程结果高度一致:

每条含X的单倍型约有20,000–20,200个蛋白编码基因;
含Y的单倍型约有19,200–19,500个;
几乎所有单倍型都包含全部预期的单拷贝蛋白编码基因;
非编码基因完整度超过98%;
每条单倍型平均有126个基因重复或缺失事件。

TBC1D3是祖源相关性和拷贝数变化最明显的基因家族之一。在两个主要结构区中分别发现89种和130种结构配置,说明单一参考无法代表这类高度多拷贝基因座。

长读长转录结果

作者发现:

74,897种在超过1%单倍型中出现、但GENCODE未记录的转录本异构体;
68,681条“参考差异转录本”,涉及578个基因;
每条单倍型中位数约有53个相关基因。

例子包括:

RAD52内部25.7 kb重复,产生具有重复蛋白结构域的新转录本;
MOCS1的3′UTR串联重复与基因表达升高相关;
MYBL2内含子中的AluY插入形成低甲基化CpG岛并启动新的转录本。

  1. 泛表观基因组
    8.1 非参考CpG和甲基化

HPRC2发现1,760万个T2T-CHM13中不存在的CpG位点,相当于相对单一参考增加51.9%。其中:

647万个属于常见非参考CpG,增长曲线已接近饱和;
1,090万个属于罕见或极罕见CpG,仍随样本数近似线性增长;
卫星重复、转座元件、CpG岛和节段重复贡献最多。

PacBio与ONT的甲基化估计高度一致;Panmethyl图上分析与个人组装分析的平均R²达到0.97。

8.2 mQTL

作者识别80,854个启动子甲基化数量性状位点:

10.2%位于传统短读长、线性参考难以分析的复杂区域;
以SV为首要变异的mQTL在着丝粒和卫星区域富集1.71倍;
PM20D1例子显示,相关变异频率和甲基化状态随局部祖源显著变化。
8.3 染色质可及性

38个样本进行了Fiber-seq:

每条单倍型平均识别约151,963个可及染色质元件;
39个样本形成568,430个共识峰;
其中51,111个峰位于GRCh38不存在的区域,占全部共识峰的9%;
64%的非参考峰位于节段重复中。

这说明基于GRCh38的ENCODE等调控元件图谱,即使在研究充分的淋巴细胞中也不是完整的。

  1. 泛基因组的实际应用
    9.1 从短读长数据检测结构变异

用PanGenie分析3,202个1000 Genomes短读长样本:

每个样本中位数可可靠基因分型27,428个SV;
比HPRC1增加9,339个;
相对HGSVC3+HPRC1增加2,742个;
新增加的主要是较罕见SV。

根据这些基因型重建的单倍型序列达到中位QV43,但卫星重复和部分节段重复仍难以通过短读长准确重建。

9.2 医学复杂基因座

在318个难分析、医学相关的基因座中,HPRC2减少了缺乏近似参考单倍型的比例。

具体例子:

RCCX/CYP21A2区域增加51%的信息标记,发现7条可能携带先天性肾上腺皮质增生风险的单倍型;
D4Z4区域分析发现两个个体携带处于FSHD1收缩范围内的许可型单倍型。

这些结果主要说明参考资源可用于解析复杂基因座,并不等同于对相关个体作出临床诊断。

9.3 小变异检测

使用DeepVariant和Sentieon,将HPRC2图与传统GRCh38流程比较:

各种测序平台的总体小变异错误减少36%–52.4%;
SNP错误减少50.1%–67.7%。

即使最终结果仍表达在GRCh38坐标上,泛基因组也能够减少错误比对和参考等位基因偏倚。

9.4 eQTL和性状关联

在430个具有WGS和RNA-seq数据的1000 Genomes样本中,作者将传统变异集与PanGenie、danbing-tk和EdgeDepth发现的泛基因组变异合并。

结果:

发现10,169个eGenes;
泛基因组特异变异占lead marker的20.3%;
多等位SV和10–49 bp中等长度indel作为lead variant的比例明显增加;
893个eGenes的关联强度提高至少20%;
581个,即5.7%,提高超过50%。

这提示未来GWAS使用泛基因组后,可能提高复杂区域和结构变异相关信号的发现能力。

四、讨论部分总结

  1. 作者认为HPRC2的主要贡献

作者将HPRC2的贡献概括为:

常见遗传变异覆盖率超过99%;
组装结构错误和碱基错误相对HPRC1约减半;
同时提供三种互补的泛基因组比对表示;
首次建立系统化的非参考序列坐标;
建立大规模匹配的泛转录组、甲基化组和染色质可及性图谱;
多项基准表明泛基因组流程已能稳定优于线性参考流程。

  1. 仍未解决的技术问题

HPRC2还不是完全T2T的人群参考:

34%的活性α卫星着丝粒阵列不完整或存在错误标记;
只有157条近端着丝粒染色体短臂完全连续且无结构错误,约占6.8%;
部分高度相似节段重复可能仍是组装伪影,平均约12.5 Mb/单倍型;
长同聚物仍然是单碱基准确度的主要限制;
rDNA阵列仍难以可靠组装。

  1. “覆盖99%”不能理解成覆盖全部人类变异

99%以上主要指:

AF≥1%的常见变异;
以1000 Genomes和All of Us所代表的人群为基础;
主要针对相对容易组装的约90%基因组区域。

对于AF≥0.1%的变异,覆盖率仅略高于80%。这些较罕见变异往往可能具有较大效应,因此未来仍需数千个甚至更多高质量组装。

  1. 人群代表性和伦理问题

当前资源仍不足以代表所有全球人群,尤其缺乏:

大洋洲人群;
东非、中非和南部非洲部分人群;
1000 Genomes未充分覆盖的其他社区。

作者特别强调,不能仅仅因为某个群体“可能携带新变异”就进行提取式招募。未来扩展必须重视社区参与、知情同意、利益共享、标签使用和长期信任。

  1. 功能数据的限制

当前长读长RNA、甲基化和Fiber-seq主要来自淋巴母细胞系:

不能代表脑、心脏、肝脏、胚胎等其他组织;
某些转录本或调控元件可能只在特定细胞类型中存在;
LCL培养过程本身可能改变部分表观遗传状态;
因此,目前的“泛转录组”和“泛表观基因组”仍是细胞类型受限的第一版。

作者明确提出未来需要扩大到不同组织、细胞类型和遗传背景。

  1. 作者对未来HPRC3的设想

HPRC2是三阶段计划中的第二阶段,不是最终参考。下一阶段重点包括:

让几乎所有染色体单倍型达到T2T scaffold或更高水平;
改进着丝粒、卫星重复和rDNA的比对;
扩大全球人群代表性;
让泛基因组工具能够像“黑箱”一样直接整合到常规变异检测和转录组流程;
最终获得更完整、参考偏倚更低的人类遗传变异图谱。
五、整篇论文的核心结论

这篇论文的核心并不只是“增加了更多基因组”,而是证明:

当样本经过优化选择、基因组以单倍型和T2T方式组装,并以图结构表示时,人类大部分常见遗传变异已经可以被较完整地纳入统一参考框架。

HPRC2的最大价值主要有三点:

减少参考偏倚:不再默认GRCh38中的序列和等位基因就是“正常”状态。
打开复杂区域:着丝粒、节段重复、VNTR、多拷贝基因和非参考插入开始可以系统研究。
连接功能和疾病研究:不仅表示DNA变异,也开始把变异与转录、甲基化、染色质可及性和eQTL联系起来。

但它仍不是“完整覆盖所有人类遗传多样性”的最终版本。常见变异接近饱和,不代表罕见变异、超重复区域、所有全球人群和所有组织类型也已经得到充分覆盖。

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容