Ensembl变异效应预测器(VEP)

William McLaren于2016年发表在Genome Biology中的文章The Ensembl Variant Effect Predictor


摘要

Ensembl变异效应预测器是编码区和非编码区基因组变异分析、注释和排序的强大工具集。它提供了对大量基因组注释的访问,具有各种接口以满足不同的需求,以及配置和扩展分析的简单选项。它是开源的,可以免费使用,并且支持结果的完全再现性。Ensembl变异效应预测器可以简化和加速各种研究设计中的变异解释。


背景

对基因组或外显子组测序产生的变异数据进行分析是生物学从基础研究到临床翻译基因组学进展的基础。它是调查功能和从基于标准化治疗的医疗护理系统向针对单个患者的医疗护理系统发展的关键。

对于常见或罕见疾病患者,变异分析的潜在好处包括改善患者护理、监测和治疗结果。在癌症方面,利用基因测试数据已经取得了许多成功。例如,BRCA突变遗传检测呈阳性的患者可以选择选择性预防性手术;表现出EGFR基因突变的肺癌患者或三阴性乳腺癌患者可以定制他们的药物处方以提高成功率。

罕见疾病由于发病率低和相关等位基因的不完全外显,很难单独诊断。然而,全基因组测序(WGS)或全外显子组测序数据的变异分析可以导致潜在基因突变的发现。识别相关突变有利于研究治疗方案和未来的药物发现。同时,即使是诊断的直接好处也可能导致更准确的预后,并消除额外医疗调查的负担。

全世界最常见的非传染性疾病是心血管疾病、癌症和糖尿病。尽管有许多基于阵列的全基因组关联研究(GWAS)在寻找风险位点,但在这些条件下,只有相对较小的可遗传成分被阐明。大量样本中的WGS需要产生足够的统计能力来检测具有潜在表型或疾病关联的罕见变异。WGS研究还将检测基因组调控区和非编码区的变异,这些变异被认为包含大多数特征相关变异,并在癌症中发挥作用

大规模测序和变异分析的潜力是革命性的。认识到这一价值,冰岛、英国和美国发起了重大的人口排序计划。在其他物种中,基因组10K、1001拟南芥基因组和1000公牛基因组计划等工作具有类似的目标,但在不同的资助模式下运作,通常比以智人为重点的项目获得的支持更少。

DNA测序技术的不断改进,加上目前每个人类基因组的成本约为1000美元,导致大量基因组、外显子组和随后的变异数据需要解释。同时,由于变异解释的困难,确定功能性后果的分析成本仍然大大增加。例如,一个典型的二倍体人类基因组大约有350万个单核苷酸变异(SNVs)和1000个基因组参考序列的拷贝数变异。这些变体中约有20000-25000个是蛋白质编码,其中10000个改变氨基酸,但只有50-100个是蛋白质截短或功能丧失变体。对大量变异的手动审查是不切实际的,而且成本高昂,还有额外的困难,例如缺乏功能注释或解释一个单倍型中的多个变异。

变异解释通常考虑变异对转录本或蛋白质的影响。因此,它依赖于转录本注释和将变体定位到蛋白质编码区或非编码区。智人符号有两个主要来源:国家生物技术信息中心(NCBI)的GENCODE和参考序列(RefSeq)。这两套转录本注释都会受到版本更改和更新的影响,这些更改和更新可能会修改变体报告和解释。为了数据再现性,必须严格跟踪转录异构体和转录版本,尽管在某些情况下,即使包括版本也不足以避免所有潜在的误解。转录集的产生方式存在差异:GENCODE注释基于基因组,而RefSeq转录本独立于参考基因组。尽管RefSeq转录本可以纠正参考汇编中的错误,并提供具有改进的生物学表示性的转录本(例如GRCh37参考中的ABO、ACTN3和ALMS1基因),但基因组和转录本集之间的差异可能会在报告cDNA和基因组水平的变体时引起混淆和错误(例如,这些描述涉及相同的变体:NM_000059.3:c.7397C>T,NC_000013.11:g.32355250T=)GENCODE的目标是创建一个全面的转录本集,以代表任何组织和发育阶段的每种异构体的表达,因此,每个蛋白质编码基因平均有近四种转录本异构体。

因此,由于有多个转录本亚型,大多数基因对给定的变体都有多个注释(G蛋白偶联受体56基因(GPR56)在Ensembl release 79中有61个转录本)。随着更多实验数据的积累,这个数字将增加。选择正确的转录异构体和版本进行一致的变体注释是一项挑战。最后,在参考基因组具有多个替代单倍型表示(“ALT”)的基因座中,对于不同的ALT,变体可能有不同的解释。例如,rs150580082映射到多个ALT,但仅在其中一些ALT中引入了终止密码子。在这种情况下,仅考虑主装配映射将产生误导性结果。

使用人类基因组变异学会(HGVS)命名法的变异报告也基于转录或蛋白质。因此,当使用HGVS命名法时,上述转录本注释的困难可能会导致混淆和歧义。对于具有多种转录亚型的基因中的变体,存在许多可能的注释。例如,rs121908462是一种与ADGRG1(粘附G蛋白偶联受体G1)中的多微回相关的致病性变体。该变体在Ensembl中有126个HGV描述(存在更有效的HGV描述),因为它与75个转录本重叠,在dbSNP中还有103个不同的描述。每个基因座的多个转录本导致更多的注释。这些要求以一致的方式进行过滤,这增加了变体解释的不稳定性和复杂性。

鉴于这些分析挑战和不断增加的测序数据量,需要一个强大的计算工具来帮助区分转录本中的变体优先级,并管理变体分析的复杂性。为了促进这一点,我们开发了Ensembl变异效应预测器(VEP),它与其他工具(见表1和“讨论”部分)以及先前发布的Ensembl SNP效应预测器显著不同。VEP是一个软件套件,用于对基因组编码区和非编码区的大多数类型的基因组变异进行注释和分析。从疾病调查到人群研究,它是一个重要的工具来注释变异并为进一步分析确定子集的优先级。


VEP已用于分析农场动物的特征,用于临床患者诊断和GWAS研究。它已被用于许多大型项目的分析,包括1000个基因组和外显子组聚合联合体(ExAC)。VEP注释被用作工具的输入,用于深入探索各种注释,如GEMINI。它是一个灵活的工具,对任何需要详细注释序列变量的项目都有价值。


结果

VEP注释了两大类基因组变异:(1)具有特定和明确变化的序列变异(包括SNV、插入、删除、多碱基对替换、微卫星和串联重复);和(2)较大的结构变体(长度大于50个核苷酸),包括DNA拷贝数或插入和删除发生变化的结构变体。对于所有输入变量,VEP返回对转录本、蛋白质和调节区域影响的详细注释。对于已知或重叠变异,包括等位基因频率和疾病或表型信息。

VEP可用于分析任何具有组装基因组序列和注释基因集的物种的数据。注释80种脊椎动物物种和许多无脊椎动物所需的数据文件分别由Ensembl和Ensembl基因组发布。这些数据定期更新,确保可以使用同期生物学知识进行分析。VEP还支持最新的GRCh38和以前的GRCh37人体组件。重要的是,使用Ensembl存档版本,所有结果都是完全可复制的。最后,研究人员可以使用他们自己的转录本数据进行分析。如尚未在Ensembl或用于新颖或私人注释的物种中。VEP脚本包中包含一个脚本,用于从通用特征格式(GFF)和FASTA文件对创建注释集。

VEP的每个版本都与Ensembl的特定版本相关联。这种明确的版本控制确保所有结果在整个版本中都是稳定的,这对于出处和再现性至关重要。为了避免基于先前转录本或蛋白质版本对变体的误解,输出包括HGVS编码描述中的标识符和版本。VEP是开源的,免费使用,并积极维护和开发。邮件列表提供了对电子邮件的响应性支持。这种广泛的使用有助于确保快速发现和纠正错误,并能够从广泛的项目团队中收集建议。

VEP结果的性质以及输入和输出格式、不同接口和性能细节如下所述。

转录本注释

VEP结果包括多种基因和转录本相关信息(表2)。可以使用在主要引用程序集或ALT序列上设置的任何转录本,但VEP默认选择Ensembl注释。对于Homo sapiens和Mus musculus,这是GENCODE基因集,这表明它是Ensembl基于证据的转录预测与手动注释的完全融合,为这些物种创建了最广泛的转录亚型集。Ensembl转录本与参考基因组装配完全匹配,从而消除了由于参考和转录本注释之间的差异而导致注释错误的可能性。如果配置为使用RefSeq转录本集,则报告转录本和基因组参考组件之间的不匹配,以消除解释中可能出现的混淆。

一个变体可能有一个以上的替代非参考等位基因,并且可能重叠一个以上的转录脚本或调控区域。因此,为了呈现最全面的注释,VEP输出报告是每一变异、每一基因组特征的交替等位基因的一行(或单位)注释。到目前为止,还没有一个可靠的每种组织类型的显性转录物的表示法,因为VEP包含了各种数据来帮助筛选任何不同的转录物亚型。例如,H. sapiens, M. musculus过滤后的GENCODE基本转录本集包括绝大多数被确定为显性表达的转录本,一致编码序列(CCDS)注释突出显示了在RefSeq和Ensembl中具有相同CD的转录本。在一些物种中,使用转录物支持水平数据对转录物的支持证据进行排序可以优先考虑审查结果,而APPRIS提供了主要转录物亚型的自动注释。还包括对UniProt中已知蛋白质的交叉引用和筛选蛋白质编码转录本中变体的选项。在智人中,对于需要稳定注释的临床相关位点,VEP可以在位点参考基因组(LRG)序列上注释。此外,VEP有一个灵活的“插件”体系结构(在“VEP脚本”一节中描述),以支持算法扩展和附加分析。例如,一个实验性插件GXA.pm使用表达图谱项目中的数据指示许多转录物在组织中的表达水平,这些转录物可用于筛选转录异构体。

蛋白质注释

蛋白质序列的变化用表3中的信息注释。VEP还利用蛋白质的生物物理性质指示氨基酸变化的影响。这些数据可以通过预测给定突变对合成蛋白质功能状态的危害程度,改善对没有相关表型或疾病数据的蛋白质变体的解释。所有可能的氨基酸替换都会预先计算分数和预测,并在必要时进行更新,以确保即使是新变体的注释也能快速进行。从耐受性中分类不耐受性(SIFT)结果适用于Ensembl中使用最多的十种物种。PolyPhen-2结果适用于人类蛋白质。其他致病性预测因子得分,如Condel、FATHMM和MutationTaster可通过VEP插件获得人类数据(表4)。

非编码区域注释

非编码区的变体如果落在调控区,可能会对转录或翻译调控产生影响。VEP报告了非编码RNA、基因组调控区或转录因子结合基序中的变异,还报告了结合基序一致得分的变化(表5),已证明与疾病有关。Ensembl调控构建,使用来自ENCODE、BLUEPRINT和NIH表观基因组路线图的数据,是主要的调控注释,但VEP分析可限于在特定细胞类型中观察到的调控区域。GERP和其他来自基因组多重比对的保守分数,可以预测非编码区的功能重要性,可以通过插件添加。GWAVA、CADD和FATHMM-MKL插件也可用,它们整合了基因组和表观基因组因素,对非编码变体进行分级和优先排序。

频率、表型和引用注释

VEP搜索Ensembl变异数据库,其中包含大量免费提供的脊椎动物生殖系和体细胞变异数据。Ensembl整合和质量检查来自dbSNP和20个物种的其他来源的变体。其他人类数据包括来自COSMIC和人类基因突变数据库的突变,以及来自基因组变体档案数据库的结构变体和拷贝数变体。因此,VEP可以引用数百万种变体来识别先前报告的变体。VEP报告了来自1000个基因组、NHLBI外显子组测序和ExAC项目的等位基因频率。这些可以用作过滤器,允许排除常见变体作为致病性候选(所提供注释列表见表6,过滤器列表见表7)。VEP包括已被引用的变体的PubMed标识符,并使用OMIM、Orphanet、GWAS目录和其他数据源中的数据对与表型、疾病或性状相关的变体进行注释。ClinVar指定的临床意义状态也适用于人类变体。

输入和输出格式

VEP支持变量调用格式(VCF)的输入数据,VCF是下一代测序管道中使用的标准交换格式。与其他工具(表1)不同,VEP还可以处理变体标识符(例如,来自dbSNP)和HGV命名符号(例如,使用Ensembl、RefSeq或LRG转录本和蛋白质的HGVS:‘ENST000061779.4:c.102944T>C’;‘BRCA2:p.Val2466Ala’;‘Q15118:p.Val42Phe’)。这些标识符通常用于出版物和报告中。该功能还可用于将变异从cDNA或蛋白质坐标“反向映射”到基因组,反之亦然。

VEP输出由HTML或文本格式的摘要文件和以制表符分隔、VCF、GVF或JSON格式的主结果文件组成。默认的以制表符分隔的输出设计为以易于解析的可读格式显示关键数据,并且可以包括详细和复杂的数据。VEP的VCF输出遵循与其他注释工具提供商商定的标准,以促进结果的透明交叉比较和基准测试。

使用与序列本体(SO)协作定义的一组标准化变体注释术语来描述变体结果。每个结果项都有一个稳定的标识符和定义,从而消除了定义或意义上的歧义。从本体上构建结果可以实现强大的查询:可以在一个查询中检索所有编码变体,而无需指定每个子类别,如停止、错义、同义等。SO术语被广泛使用,包括UCSC基因组浏览器、1000基因组计划、ClinVar、,ExAC项目和国际癌症基因组联盟,允许透明的互操作性和交叉验证。

VEP接口

VEP独立于平台,可用作(1)在线工具,(2)易于安装的Perl脚本,或(3)通过Ensembl代表性状态传输(REST)应用程序接口(API)。每个接口都经过优化,以支持不同数量的数据和不同水平的生物信息学经验。这三种方法都使用相同的核心代码库,以确保每个接口的结果一致。全面的测试套件支持所有代码,由Travis CI执行持续集成,确保高质量的代码,在发布之前必须通过严格的质量测试。

VEP Web

VEP Web提供了一个简单的点击式界面。这是以交互方式探索注释的理想选择。门户最适合首次使用或小规模分析。当前支持的最大压缩上传数据文件大小为50 MB,足以容纳大约200万行典型VCF数据。

对于单变量分析,web界面包含“即时VEP”功能。粘贴或键入单个变体,如手稿中HGVS符号中的变体,将快速返回基本结果预测数据。要提交多个变体的请求,可以通过URL和使用简单在线表单选择的选项上传、粘贴或提供数据。VEP最常用的一组有限插件可通过web界面使用。请求由Ensembl web服务器上的资源管理系统处理,以分配请求负载。

输出网页(参见图1中的示例)显示了汇总统计数据和图表,以提供结果的概述。它还有一个带有详细结果预览的表,还有一个配置输出过滤的简单界面。通过一系列下拉菜单,可以使用基本逻辑关系组合多个过滤器(参见表7中的示例),从而允许创建复杂的定制查询。这旨在帮助确定少量变体的优先级。结果可以通过登录Ensembl帐户进行存储。

VEP脚本

可下载的Perl脚本是使用VEP最强大、最灵活的方法。它支持比其他接口更多的选项,对输入文件大小没有限制,并且包括大量的输入、输出、过滤和分析选项。

要安装脚本,只需下载VEP包并运行安装程序脚本,该脚本将自动下载必要的API和注释文件(或“缓存”文件)。每个Ensembl版本都提供最新数据的更新。完整的源代码可以在EnsemblGithub存储库中免费获得。
(详细安装以及VEP REST API可去ensembl官网查看详细教程)

讨论

性能

VEP脚本可以线程化,以便在具有多个CPU核的系统上实现快速性能。一个典型的人类个体的变异集可以在现代四核机器上在大约一个小时内处理;Illumina的Platinum基因组集中NA12878的4474140个变体花了62分钟处理(表8)。使用较小的GENCODE基本基因集,这将缩短到32分钟。一个可忽略的启动时间意味着VEP在小型和大型数据集上实现了相似的吞吐量。一个典型的外显子组测序数据集(100000到200000个变体)在5分钟内处理完毕。

为了提高运行时间,单个VEP作业可以跨多个处理器内核线程化。更大规模的并行处理架构(如计算场)可以进一步细分VEP作业(例如,通过染色体)。

表8将VEP的运行时性能与Annovar和SnpEff进行了比较。对于较小的输入文件,VEP的性能与其他工具相当或更快。VEP通过使用Perl(一种解释性语言)编写SnpEff而不是使用编译的Java编写SnpEff,从而为SnpEff留出了时间。SnpEff在启动时将其整个注释数据库加载到内存中,而VEP则根据需要加载相关的基因组片段;

这说明在较小的数据集上,VEP的性能优于SnpEff。Annovar虽然也是用Perl编写的,但它提供的注释深度与VEP不同,因此运行速度更快。还应注意,VEP通过REST API或VEP web界面的即时VEP功能,在几分之一秒内返回单个变量的预测。用户无需下载或安装任何软件即可使用,这是Annovar和SnpEff都无法提供的。

运行时间随重叠基因组特征的数量和复杂性而变化,因此对于具有稀疏注释的物种,分析时间比具有丰富注释的物种(如人类和小鼠)要快。

由于web和REST实现基于与VEP脚本相同的底层代码,因此性能大体上与上述代码相当,并考虑了作业队列(用于web)、数据网络传输(用于web和REST)和请求限制(用于REST)。

结论

Ensembl变异效应预测软件为在大规模测序项目和小型分析研究中注释和优先排序变异的系统方法提供了工具和方法。通过以标准方式自动化注释并减少手动审查所需的时间,它有助于管理与SNV分析、短插入(删除)、拷贝数变体和结构变体相关的许多常见挑战。VEP使用广泛的参考数据对变异进行注释,包括转录本、调控区、先前观察到的变异频率、引文、临床意义信息以及变异生物物理后果的预测。

获得的变体注释的质量、数量和稳定性取决于所用转录本集的选择。因此,VEP允许灵活选择转录本。为了有效地管理大量的变异注释和转录异构体,VEP提供了几种方法来对结果进行优先级排序,并减少需要手动审查的变异数量。可以选择这些过滤器,VEP还支持构建自定义过滤器。独特的是,VEP算法可以通过插件进行扩展,以执行额外的计算,并可以分析定制的、可能是私有的数据。

解释基因组中的所有变体仍然是一个尚未解决的挑战。越来越多的大规模WGS将检测基因组编码区和非编码区的罕见变异,并进一步可能识别与疾病相关的位点。在公共存储库(如dbSNP和European Variant Archive)中提供这些变体,或使用联邦资源发现这些变体,将对分析带来重大好处。全球基因组健康联盟(GA4GH)信标项目等新兴项目目前正在开发可能的分布式解决方案。

改进的功能注释对于非编码区域中的变体尤其重要。许多落在特定组织中调节基因表达的基因座上。描述转录物和组织之间的关联将有助于选择组织特异性转录物亚型的子集进行变体注释,并调整结果。此外,通过提供从调控区到调控基因的联系,可以解释疾病潜在的分子机制。来自大规模工作的数据,如基因型组织表达项目,其目的是系统地描述不同组织中调节性变体的影响[84],将整合到VEP参考数据中,以便VEP获得最新数据进行分析。

如上所述,标准化SO术语用于描述各种后果,VEP结果可以VCF格式输出。在GA4GH中开发全面的变量注释数据交换格式的工作正在进行中。此外,GA4GH正在定义变异与表型、性状和疾病之间关联的表示标准。当这些格式成熟时,VEP将支持这些格式。

当前的注释工具,包括VEP,独立地注释每个输入变量,而不考虑跨多个变异位点组合替代等位基因的潜在复合效应。这一限制意味着不考虑两个或两个以上影响同一密码子的变体,或下游变体纠正的阅读框移位。将来,如果基因型数据分阶段转化为单倍型,VEP将准确地对这些事件进行注释。

VEP还定期进行扩展和改进,在核心VEP代码和插件库中添加了新功能。尽管这些发展通常是由可用于H. sapiens的新注释或数据集驱动的。它们都是为了与任何物种兼容而设计的。一旦在其他物种中获得了额外的注释和测序数据,VEP扩展也可以被充分利用(例如,1000头公牛项目、1000只鸡项目、1001拟南芥项目和动物基因组功能注释(FAANG)联盟)。为了改进全基因组分析,VEP将利用未来测序项目的数据,实施新算法并采用数据交换标准,从而为变异解释带来持续的好处。

方法

这部分可以查阅原文细看,链接:https://pubmed.ncbi.nlm.nih.gov/27268795/


end

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容