氨基酸水平的信噪比分析可确定特定氨基酸位点遗传变异的普遍程度,该值已相对于特定人群的背景遗传变异进行标准化。这有助于识别变异 "热点" 在蛋白质序列中(信号)高于群体中罕见变异频率(噪声)的区域。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
氨基酸水平的信噪比分析可确定特定氨基酸位点遗传变异的普遍程度,该值已相对于特定人群的背景遗传变异进行标准化。这有助于识别变异 "热点" 在蛋白质序列中(信号)高于群体中罕见变异频率(噪声)的区域。
新一代基因测序技术在成本和速度方面的进步,推动了临床全外显子组和全基因组检测的迅速普及。尽管这提高了与遗传综合征相关的可能致病突变的检出率,但也显著增加了偶然发现的临床意义未明遗传变异(VUS)的数量。确定这些变异的临床意义,对科研人员和临床医生而言均构成重大挑战。一种辅助判断其致病可能性的方法是基于蛋白质序列水平的信噪比分析。本实验方案描述了一种氨基酸水平的信噪比分析方法,该方法结合已知蛋白质拓扑结构中每个氨基酸位置的变异频率,识别在初级序列中病理变异可能性显著升高(相对于人群"背景"变异)的区域。该方法可识别出具有高致病信号的氨基酸残基位置"热点",从而有助于重新评估由新一代基因检测所发现的VUS的诊断权重。
基因测序平台的快速发展已彻底改变了遗传学在医学中的可及性与作用。过去仅限于单个基因或少数几个基因的检测,随着新一代基因测序成本的降低和速度的提升,目前在临床实践中已常规开展对基因组全部编码序列(全外显子组测序,WES)乃至整个基因组(全基因组测序,WGS)的测序。WES和WGS已 在危重新生儿和儿童中,当怀疑存在遗传综合征时,该方法已被频繁使用,作为一种已证实的诊断工具,可改变临床管理方案1,2尽管这提高了与遗传综合征相关的可能致病性突变的检出率,但也显著增加了偶然发现的遗传变异或未知诊断意义的意外阳性结果(VUS)的数量。尽管其中一些变异被忽略且不予报告,但位于与潜在致命性或严重疾病相关基因上的变异通常会被报告。目前的指南建议报告在特定基因中发现的偶然变异,这些变异可能对患者具有医学意义,包括与心肌病和通道病等易导致猝死的疾病相关的基因。3尽管该建议旨在识别出易患致心律失常性猝死疾病的高危个体,但变异检测的敏感性远高于特异性。这导致意义未明的变异(VUS)及偶然发现的诊断价值不明确的变异数量不断增长,其发生频率远超过特定人群中相应疾病的患病率。4一种此类疾病——长QT综合征(LQTS)——是一种典型的由基因突变引起的心脏离子通道病,这些基因编码心脏离子通道或与通道相互作用的蛋白质,导致心肌复极延迟。5。这种延迟的复极化在静息心电图上表现为QT间期延长,会导致心室发生潜在致命性心律失常的电生理易感性,例如 尖端扭转型室性心动过速尽管已有多个基因被发现与该疾病的发生相关,但其中的突变 KCNQ1编码 IKs 钾通道(KCNQ1,Kv7.1)是1型长QT综合征的致病原因,下文将其作为示例使用6. 说明了变异解读的复杂性,即在与长QT综合征(LQTS)相关基因中存在罕见变异,所谓 "背景遗传变异" 此前已有描述7,8.
除了已知致病性变异的大规模汇编型数据库外,目前已有多种策略可用于预测不同变异所产生的效应。其中一些方法基于算法,例如 SIFT 和 Polyphen 2,可用于筛选大量新发的非同义变异,以预测其有害性9,10尽管这些工具被广泛使用,但其特异性较低,限制了它们在以下情况下的适用性 "呼叫" 临床意义未明变异11. "信噪比" 分析是一种基于目标基因座上已知致病变异频率与人群罕见遗传变异频率进行标准化比较,从而评估某变异与疾病相关可能性的工具。若某变异位于致病突变频率相对于人群变异频率较高的基因座(即信噪比较高),则该变异更可能与疾病相关。相反,在致病突变频率相对较低而人群罕见变异频率较高的基因中偶然发现的罕见变异(即信噪比较低),则与疾病相关的可能性较小。信噪比分析在最新发布的心肌病和通道病遗传检测指南中已体现出其诊断价值;然而,目前该方法仅应用于全基因水平或特定结构域水平12近年来,随着病理变异(疾病数据库、文献中的队列研究)以及基于人群的对照变异(外显子组聚合联盟,ExAC 和基因组聚合数据库,GnomAD)的可获取性不断提高13),该方法已应用于蛋白质一级序列中的各个氨基酸位置。氨基酸水平的信噪比分析已被证明在将偶然发现的与长QT综合征(LQTS)相关基因变异分类为可能致病性方面具有实用价值 "背景" 遗传变异而非疾病相关变异。在与长QT综合征(LQTS)相关的三个主要基因中,包括 KCNQ1,这些偶然发现的变异缺乏一个 显著的信噪比,表明这些变异在单个氨基酸位点的频率反映的是罕见的群体变异,而非与疾病相关的突变。此外,当将蛋白质特异性的结构域拓扑结构与高信噪比区域叠加时,可发现致病性突变 "热点" 定位于蛋白质的关键功能区14该方法有望用于确定:1)某变异体与疾病或人群相关的可能性;2)识别与人类疾病相关的蛋白质中新的关键功能结构域。
访问受限。请登录或开始试用以查看此内容。
1. 确定目标基因及特定剪接异构体
注意:此处我们演示 Ensembl 的使用方法15 以确定与目标疾病发病机制相关的感兴趣基因的共识序列(即 KCNQ1 基因突变与长QT综合征(LQTS)相关。除 Ensembl 外,还可通过美国国家生物技术信息中心(NCBI)的 RefSeq 获取相关信息。16 加利福尼亚大学圣克鲁斯分校(UCSC)人类基因组浏览器17 (参见 材料表).
2. 创建实验性遗传变异数据库(即“"Signal")
注意:此处我们演示如何创建一个与目标基因相关的疾病变异数据库,其中包含这些疾病相关变异在患有目标疾病个体中的频率。该数据库可以有多种形式,代表了 "信号" (表型阳性遗传变异),将相对于对照变异数据库进行标准化。这可以包括:1)与疾病相关的变异,用于与意义未明的变异(VUSs)进行比较 用于识别该蛋白的新功能结构域和/或2)意义未明的变异(VUSs),包括偶然发现的VUSs,将其与疾病相关变异进行比较,以评估其致病可能性。本文将以KCNQ1中的疾病相关变异为例进行说明;然而,该方法同样适用于偶然发现的VUSs或任何其他实验变异集的分析。
3. 创建对照基因变异数据库("噪声")
注意:此处我们演示如何创建目标基因中对照变异的数据库,并记录其在对照人群中的相应频率。该数据库代表了"噪声"(表型阴性、基于人群的遗传变异),即实验性变异数据库将据此进行标准化的背景。此类变异被称为"对照"变异。
4. 氨基酸水平信噪比计算与映射
5. 蛋白质结构域拓扑叠加
6. 变异位点叠加
访问受限。请登录或开始试用以查看此内容。
KCNQ1 基因的氨基酸水平信噪比分析代表性结果如图6所示。本示例展示了在 GnomAD 队列(对照队列)中发现的罕见变异、偶然发现的全外显子组测序(WES)变异(实验队列#1),以及被认为可能与疾病相关的长QT综合征(LQTS)病例相关变异(实验队列#2)。此外,还展示了将 WES 队列和 LQTS 队列的变异频率相对于 GnomAD 队列变异频率进行归一化后的信噪比分析结果。与 LQTS 相关的变异在对应离子通道孔道区、选择性滤过区以及 KCNE1 结合区的结构域中表现出较高的信噪比。相比之下,WES 队列中偶然发现的变异并未明显表现出特定区域的信噪比显著升高,提示这些变异可能反映了背景遗传变异。本示例未如上所述使用变异的次要等位基因频率(MAF);然而,其仍体现了前述所有相同原理。
访问受限。请登录或开始试用以查看此内容。
在过去的十年中,高通量基因检测在应用范围和可及性方面取得了显著进展。然而,对于许多遗传基础明确的疾病(如心肌病),扩大检测范围并未提高诊断检出率21。此外,许多已发现变异的诊断价值仍存在显著不确定性。这部分是由于全外显子组测序(WES)和全基因组测序(WGS)中偶然发现的罕见变异数量不断增加,可能导致误诊22。基于氨基酸水平的信噪比分析方法,建立在已广泛认可的变异致病性预测策略基础上,其优势在于可利用大规模人群基因组研究数据,进一步优化对变异的解读。
因此,该方案中最关键的步骤之一是对照组和实验组队列的选择。目前许多公开的大型基因组研究可通过综合数据库(如 GnomAD)获取,这些数据库可为本方案提供具有代表性的对照队列,其样本量目前最多可达 138,632 人。尽管这些综合队列中的所有受试者并非显然健康,但在罕见病研究背景下,庞大的样本量使该资源极具价值,并允许设定严格的次要等位基因频率(MAF)排除阈值。排除常见变异是必要的,因为它们不太可能导致高外显率的孟德尔遗传病。根据以往研究,...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
APL 受美国国立卫生研究院 K08-HL136839 项目资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 1000基因组计划 | N/A | www.internationalgenome.org | |
| ClinVar | N/A | www.ncbi.nlm.nih.gov/clinvar | |
| Ensembl基因组浏览器 | N/A | uswest.ensembl.org/index.html | |
| Excel | Microsoft | office.microsoft.com/excel/ | 用于所有示例公式和函数 |
| 外显子聚合联盟 | N/A | www.exac.broadinstitute.org | |
| 基因组聚合数据库 | N/A | www.gnomad.broadinstitute.org | |
| 美国国家生物技术信息中心结构域与结构数据库 | N/A | www.ncbi.nlm.nih.gov/guide/domains-structures/ | |
| 美国国家生物技术信息中心基因数据库 | N/A | www.ncbi.nlm.nih.gov/gene/ | |
| 美国国家生物技术信息中心蛋白质数据库 | N/A | www.ncbi.nlm.nih.gov/protein/ | |
| 美国国家心肺血液研究所GO外显子组测序项目 | N/A | www.evs.gs.washington.edu/EVS/ | |
| SnapGene | GSL Biotech LCC | www.snapgene.com | |
| 加州大学圣克鲁兹分校人类基因组浏览器 | N/A | www.genome.ucsc.edu |
访问受限。请登录或开始试用以查看此内容。