HPRC2概览
这篇文章介绍的是 HPRC2(Human Pangenome Reference Consortium Release 2),即人类泛基因组参考计划的第二阶段成果。论文于 2026年7月22日发布在 bioRxiv,目前属于尚未经过同行评审的预印本。研究以230名个体的两个单倍型为基础,构建了约460条单倍型基因组,并配套建立泛基因组图、坐标系统、基因注释、泛转录组和泛表观基因组。
一、研究背景
传统人类基因组分析通常将测序数据比对到一个线性参考基因组,如GRCh38。但任何一个人的基因组都不可能代表全部人群遗传多样性,特别容易遗漏:
大片段插入、缺失、倒位和拷贝数变异;
高度重复区域,如着丝粒、端粒附近和节段重复;
不存在于GRCh38中的序列;
嵌套在新插入序列内部的变异;
不同人群中特有或频率差异较大的单倍型。
T2T-CHM13虽然补齐了GRCh38缺失的许多区域,但它本质上仍然只是一个单倍型基因组。泛基因组的思路是把很多人的单倍型组装、它们之间的比对关系,以及基因和调控元件注释整合起来,用“图结构”而非一条线来表示人类遗传多样性。HPRC1已经证明这一框架可行,但仅包含88条主要单倍型,样本量、复杂区域完整性和功能注释仍然有限。
因此,这篇论文主要回答四个问题:
增加多少、选择哪些样本,才能覆盖绝大部分常见遗传变异?
长读长技术能否大幅提高每个人基因组的完整性和准确性?
如何在泛基因组中表示传统参考基因组不存在的序列和变异?
泛基因组是否能真正改善变异检测、功能基因组学和疾病相关研究?
二、总体研究方法
研究的整体流程可以概括为:
样本优化选择 → 多平台长读长测序 → 单倍型分辨组装 → 质量控制 → 泛基因组比对和建图 → 基因、转录和表观遗传注释 → 实际应用验证。
- 样本选择
作者开发了 MaxVar贪心算法。每轮计算候选个体能够为现有参考增加多少尚未覆盖的常见变异,优先选择边际贡献最大的个体。常见变异定义为等位基因频率AF≥1%。
局部祖源则使用 PCLAI:将每条染色体划分为多个窗口,把窗口投影到1000 Genomes样本形成的二维PCA空间,得到连续的祖源坐标和不确定性,而不是简单地给一个人贴单一“大陆祖源”标签。
- 测序和组装
主要使用:
PacBio HiFi:高单碱基准确度;
Oxford Nanopore超长读长:跨越长重复序列;
Illumina Hi-C或父母短读长数据:区分父源和母源单倍型;
Hifiasm:组装;
DeepPolisher:单碱基纠错;
HMM-Flagger、NucFlag和k-mer分析:检测结构错误及计算QV。
126名个体采用trio分相,104名个体采用Hi-C分相。两种方式完整度和连续性相近,说明现在即使没有父母样本,也可以获得较好的单倍型分辨组装。
- 泛基因组表示
作者使用了三套互补方法:
Minigraph:结构变异分辨率,图较小,适合可视化和读段定位;
Minigraph-Cactus,MC:碱基级多序列比对,包含小变异和结构变异;
IMPG/PGGB:参考无关的成对比对集合,能够覆盖部分着丝粒和卫星重复区域。
此外还建立了Pantree和GRef两种泛基因组坐标系统,用于描述不在GRCh38或T2T-CHM13上的序列。
三、各结果部分
- HPRC2覆盖了超过99%的常见小变异
方法
作者首先用1000 Genomes已有的基因型运行MaxVar选择样本,然后在约44万名All of Us参与者中验证覆盖率。
结果
All of Us数据中共有约727万个AF≥1%的常见小变异:
HPRC1的88条单倍型覆盖约91.92%;
HPRC2的460条单倍型覆盖约99.43%;
模型推测约932条单倍型时可达到99.9%。
当频率阈值降低到AF≥0.1%,即加入较罕见变异时:
HPRC1覆盖约62%;
HPRC2覆盖约83%;
要覆盖99%以上,预计需要数千条甚至更多单倍型。
意义
HPRC2已经接近覆盖研究人群中的全部常见变异;今后继续增加样本,主要收益将来自更罕见、更具人群特异性的变异。
- 连续局部祖源标注和ELSI设计
方法
PCLAI不把一个个体整体归入某一祖源类别,而是沿染色体逐窗口估计祖源坐标。
结果
祖源相对单一的个体,在各染色体上的坐标较稳定;具有近期混合祖源的个体则表现为不同祖源片段交替出现。重组断点附近的不确定性通常更高。
ELSI处理
作者强调遗传祖源不等于种族、民族或身份:
样本优先根据实际遗传变异选择,而不是根据种族标签选择;
保留1000 Genomes原始样本标签;
只有在分析需要时才使用聚合祖源标签;
将标签写成“AFR-like”“EUR-like”等,表示遗传相似性,而不是身份认定。
- 组装质量显著提高,产生数千条T2T染色体
主要结果
HPRC2包含:
3,666条完全无缺口的T2T染色体,占约35%;
2,490条仅有少数缺口的T2T scaffold,占约24%;
合计约59%的染色体达到T2T contig或T2T scaffold水平;
93%的染色体只有不超过3个缺口或断点。
平均碱基质量约为QV55,相当于约每35万个碱基出现一个预测错误;HPRC1约为QV52.5,即约每17.5万个碱基一个错误。
结构不可靠区域比例由:
HPRC1的6.9%;
降至HPRC2的3.1%。
在GRCh38本身能够良好表示的区域中,不可靠比例仅约0.59%。
复杂区域的具体改善
8p23.1区域包含约4.1 Mb的大倒位,其两侧是高度相似的节段重复:
HPRC1中约45.7%的单倍型在这里存在组装缺口;
HPRC2中所有组装在此区域均无缺口并被预测为正确;
主要得益于ONT超长读长跨越两侧重复结构。
着丝粒完整且准确的比例也由HPRC1的约15%提高至HPRC2的约66%。
- 更完整的单倍型变异图谱
方法
作者分别建立Minigraph、MC和IMPG/PGGB泛基因组表示,并用由14种变异检测器共同支持的联合变异集进行评价。
结果
相较HPRC1,HPRC2的MC图增加了:
至少两个单倍型共有的非参考序列:约42 Mb;
至少一个单倍型存在的序列:约128 Mb;
可比对的非参考序列总量:约271 Mb;
其中约106 Mb属于AF≥1%的常见序列。
图中包含:
3,449万个小变异位点,HPRC1为2,078万个;
10.916万个结构变异位点,HPRC1为6.59万个;
结构变异对应的非参考节点长度约189.92 Mb,HPRC1为90.78 Mb。
与联合真值集比较:
小变异F1:99.16%,HPRC1为97.87%;
结构变异F1:92.64%,HPRC1为88.29%。
不过,在串联重复区域中,HPRC2的结构变异精确率略有下降,可能是因为更大的图增加了重复区域的表示复杂度。
- 建立非参考序列的泛基因组坐标
传统VCF只能很好地描述相对于线性参考的变异。如果一个大插入本身不在GRCh38中,那么插入内部的小SNP或indel就很难获得正常坐标。
方法
作者提出:
Pantree:在泛基因组图上构建最小生成树,以图的边描述变异;
GRef:在原线性参考之外增加一组非冗余的插入序列contig。
结果
Pantree发现非参考位置上存在:
约260万个SNP;
约230万个indel;
约8万个结构变异。
分别占可比对泛基因组全部SNP、indel和SV的7.1%、23.0%和52.2%。
每条单倍型中位数包含:
79,088个非参考SNP;
57,435个非参考indel或MNP;
9,517个非参考SV。
合计约14.3万个变异,占每个样本全部变异约2.6%。
意义
“非参考变异”不是极少量例外,而是每个人基因组中相当稳定的一部分。线性参考会系统性遮蔽这些变异。
- 复杂结构变异区域得到更深入描述
6.1 节段重复
作者在459条单倍型中检测大于1 kb、序列一致性超过90%的节段重复,并用短读长深度进行验证。
结果显示:
每条单倍型平均约171.6 Mb节段重复;
94.6%的节段重复得到验证;
泛基因组约12%,即382.7 Mb,属于节段重复;
只有约42.5 Mb在所有人中近似固定;
AFR样本平均携带更多、也更独特的节段重复。
6.2 移动元件插入
共识别23,531个多态性移动元件插入:
18,597个Alu;
3,260个L1;
1,500个SVA;
77个LTR;
约30%为HPRC2首次报告。
虽然全部位点中52.4%属于罕见变异,但一个人携带的移动元件插入绝大部分是常见变异。
6.3 串联重复和VNTR
HPRC2观察到的VNTR等位基因数量较HPRC1增加约60%;考虑重复单元的具体序列组成时,增加约68%。
作者不仅分析重复次数,还分析重复单元的排列和序列组成。与只看长度相比,使用motif组成可以多识别约14%具有群体差异的位点。
6.4 着丝粒
利用专门工具Centrolign比较α卫星阵列。即使HPRC2样本量显著增加,只有42.5%的着丝粒单倍型能找到序列差异小于20%的近邻,说明着丝粒具有很高的进化周转和单倍型多样性。
因此,全基因组其他区域的常见变异虽接近饱和,但着丝粒仍远未饱和。
6.5 亚端粒跨染色体重排
IMPG比对发现染色体间同源序列主要集中在:
近端着丝粒染色体短臂;
X、Y染色体的PAR和XTR区域;
染色体末端的亚端粒区域。
除已知区域外,作者在41条染色体臂上发现伪同源区域,形成15个跨染色体序列群,支持不同染色体末端之间存在反复的异位交换。
6.6 G-四链体区域
作者用PGGB图中的SNP研究预测G-四链体结构区域,发现约377,395个SNP位于G4区域,其中:
6.2%未进入gnomAD;
19.3%无法映射到GRCh38。
G4区域的SNP密度普遍高于非G4区域,提示这些结构可能具有较高突变率;但在启动子和5′UTR等功能区差异较小,可能说明纯化选择在去除部分G4相关变异。
- 泛转录组和基因注释
方法
作者使用两套独立注释流程:
CAT2;
Ensembl。
并对206名个体的淋巴母细胞系进行PacBio Kinnex长读长RNA测序。
基因注释结果
两套流程结果高度一致:
每条含X的单倍型约有20,000–20,200个蛋白编码基因;
含Y的单倍型约有19,200–19,500个;
几乎所有单倍型都包含全部预期的单拷贝蛋白编码基因;
非编码基因完整度超过98%;
每条单倍型平均有126个基因重复或缺失事件。
TBC1D3是祖源相关性和拷贝数变化最明显的基因家族之一。在两个主要结构区中分别发现89种和130种结构配置,说明单一参考无法代表这类高度多拷贝基因座。
长读长转录结果
作者发现:
74,897种在超过1%单倍型中出现、但GENCODE未记录的转录本异构体;
68,681条“参考差异转录本”,涉及578个基因;
每条单倍型中位数约有53个相关基因。
例子包括:
RAD52内部25.7 kb重复,产生具有重复蛋白结构域的新转录本;
MOCS1的3′UTR串联重复与基因表达升高相关;
MYBL2内含子中的AluY插入形成低甲基化CpG岛并启动新的转录本。
- 泛表观基因组
8.1 非参考CpG和甲基化
HPRC2发现1,760万个T2T-CHM13中不存在的CpG位点,相当于相对单一参考增加51.9%。其中:
647万个属于常见非参考CpG,增长曲线已接近饱和;
1,090万个属于罕见或极罕见CpG,仍随样本数近似线性增长;
卫星重复、转座元件、CpG岛和节段重复贡献最多。
PacBio与ONT的甲基化估计高度一致;Panmethyl图上分析与个人组装分析的平均R²达到0.97。
8.2 mQTL
作者识别80,854个启动子甲基化数量性状位点:
10.2%位于传统短读长、线性参考难以分析的复杂区域;
以SV为首要变异的mQTL在着丝粒和卫星区域富集1.71倍;
PM20D1例子显示,相关变异频率和甲基化状态随局部祖源显著变化。
8.3 染色质可及性
38个样本进行了Fiber-seq:
每条单倍型平均识别约151,963个可及染色质元件;
39个样本形成568,430个共识峰;
其中51,111个峰位于GRCh38不存在的区域,占全部共识峰的9%;
64%的非参考峰位于节段重复中。
这说明基于GRCh38的ENCODE等调控元件图谱,即使在研究充分的淋巴细胞中也不是完整的。
- 泛基因组的实际应用
9.1 从短读长数据检测结构变异
用PanGenie分析3,202个1000 Genomes短读长样本:
每个样本中位数可可靠基因分型27,428个SV;
比HPRC1增加9,339个;
相对HGSVC3+HPRC1增加2,742个;
新增加的主要是较罕见SV。
根据这些基因型重建的单倍型序列达到中位QV43,但卫星重复和部分节段重复仍难以通过短读长准确重建。
9.2 医学复杂基因座
在318个难分析、医学相关的基因座中,HPRC2减少了缺乏近似参考单倍型的比例。
具体例子:
RCCX/CYP21A2区域增加51%的信息标记,发现7条可能携带先天性肾上腺皮质增生风险的单倍型;
D4Z4区域分析发现两个个体携带处于FSHD1收缩范围内的许可型单倍型。
这些结果主要说明参考资源可用于解析复杂基因座,并不等同于对相关个体作出临床诊断。
9.3 小变异检测
使用DeepVariant和Sentieon,将HPRC2图与传统GRCh38流程比较:
各种测序平台的总体小变异错误减少36%–52.4%;
SNP错误减少50.1%–67.7%。
即使最终结果仍表达在GRCh38坐标上,泛基因组也能够减少错误比对和参考等位基因偏倚。
9.4 eQTL和性状关联
在430个具有WGS和RNA-seq数据的1000 Genomes样本中,作者将传统变异集与PanGenie、danbing-tk和EdgeDepth发现的泛基因组变异合并。
结果:
发现10,169个eGenes;
泛基因组特异变异占lead marker的20.3%;
多等位SV和10–49 bp中等长度indel作为lead variant的比例明显增加;
893个eGenes的关联强度提高至少20%;
581个,即5.7%,提高超过50%。
这提示未来GWAS使用泛基因组后,可能提高复杂区域和结构变异相关信号的发现能力。
四、讨论部分总结
- 作者认为HPRC2的主要贡献
作者将HPRC2的贡献概括为:
常见遗传变异覆盖率超过99%;
组装结构错误和碱基错误相对HPRC1约减半;
同时提供三种互补的泛基因组比对表示;
首次建立系统化的非参考序列坐标;
建立大规模匹配的泛转录组、甲基化组和染色质可及性图谱;
多项基准表明泛基因组流程已能稳定优于线性参考流程。
- 仍未解决的技术问题
HPRC2还不是完全T2T的人群参考:
34%的活性α卫星着丝粒阵列不完整或存在错误标记;
只有157条近端着丝粒染色体短臂完全连续且无结构错误,约占6.8%;
部分高度相似节段重复可能仍是组装伪影,平均约12.5 Mb/单倍型;
长同聚物仍然是单碱基准确度的主要限制;
rDNA阵列仍难以可靠组装。
- “覆盖99%”不能理解成覆盖全部人类变异
99%以上主要指:
AF≥1%的常见变异;
以1000 Genomes和All of Us所代表的人群为基础;
主要针对相对容易组装的约90%基因组区域。
对于AF≥0.1%的变异,覆盖率仅略高于80%。这些较罕见变异往往可能具有较大效应,因此未来仍需数千个甚至更多高质量组装。
- 人群代表性和伦理问题
当前资源仍不足以代表所有全球人群,尤其缺乏:
大洋洲人群;
东非、中非和南部非洲部分人群;
1000 Genomes未充分覆盖的其他社区。
作者特别强调,不能仅仅因为某个群体“可能携带新变异”就进行提取式招募。未来扩展必须重视社区参与、知情同意、利益共享、标签使用和长期信任。
- 功能数据的限制
当前长读长RNA、甲基化和Fiber-seq主要来自淋巴母细胞系:
不能代表脑、心脏、肝脏、胚胎等其他组织;
某些转录本或调控元件可能只在特定细胞类型中存在;
LCL培养过程本身可能改变部分表观遗传状态;
因此,目前的“泛转录组”和“泛表观基因组”仍是细胞类型受限的第一版。
作者明确提出未来需要扩大到不同组织、细胞类型和遗传背景。
- 作者对未来HPRC3的设想
HPRC2是三阶段计划中的第二阶段,不是最终参考。下一阶段重点包括:
让几乎所有染色体单倍型达到T2T scaffold或更高水平;
改进着丝粒、卫星重复和rDNA的比对;
扩大全球人群代表性;
让泛基因组工具能够像“黑箱”一样直接整合到常规变异检测和转录组流程;
最终获得更完整、参考偏倚更低的人类遗传变异图谱。
五、整篇论文的核心结论
这篇论文的核心并不只是“增加了更多基因组”,而是证明:
当样本经过优化选择、基因组以单倍型和T2T方式组装,并以图结构表示时,人类大部分常见遗传变异已经可以被较完整地纳入统一参考框架。
HPRC2的最大价值主要有三点:
减少参考偏倚:不再默认GRCh38中的序列和等位基因就是“正常”状态。
打开复杂区域:着丝粒、节段重复、VNTR、多拷贝基因和非参考插入开始可以系统研究。
连接功能和疾病研究:不仅表示DNA变异,也开始把变异与转录、甲基化、染色质可及性和eQTL联系起来。
但它仍不是“完整覆盖所有人类遗传多样性”的最终版本。常见变异接近饱和,不代表罕见变异、超重复区域、所有全球人群和所有组织类型也已经得到充分覆盖。