整合基因组学浏览器(IGV)软件为临床变异检测中的底层数据提供了丰富且直观的观察窗口。本文展示了五个实例,演示如何快速区分真实的致病性变异与技术假象,从而增强从事下一代测序检测结果判读的实践人员的诊断信心。
方法文章
* These authors contributed equally
整合基因组学浏览器(IGV)软件为临床变异检测中的底层数据提供了丰富且直观的观察窗口。本文展示了五个实例,演示如何快速区分真实的致病性变异与技术假象,从而增强从事下一代测序检测结果判读的实践人员的诊断信心。
整合基因组学浏览器(IGV)是临床基因组学中的关键工具,能够实现对复杂测序数据的可视化与解读。将临床知识与测序结果的视觉评估相结合,是分子病理学家及其他专业人员评估并最终确定病例的主要方式。虽然有多种软件工具可提供辅助,但必须系统地理解并应用这些工具与底层数据之间的关系。本研究介绍了下一代测序(NGS)数据文件类型(如FASTQ、BAM、VCF)的基本背景,并讨论了其格式与用途。随后,我们描述了IGV如何从这些文件中提取细节信息的功能特性。我们采用一系列基于临床案例的精选实例,引导读者使用IGV软件,对照人类参考基因组,审查各类具有临床意义的变异。这些临床案例经过精心筛选,旨在展示基因组数据解读中存在的一些复杂情况,并说明在常规工作流程中使用IGV如何能够提供超越常规生物信息学软件算法变异 calling 的额外解读信息。利用IGV内置工具对基因组变异进行视觉检查,可揭示影响变异解读的细微上下文线索(例如变异等位基因频率、链偏向性、组织特异性背景)。尽管本研究重点在于使用IGV检测和解读体细胞变异,但所提供的应用方法也可推广至生殖系变异分析场景,包括复杂变异的分析和嵌合现象的检测。
近年来,下一代测序(NGS)技术的应用已彻底改变了肿瘤学诊疗模式,为诊断、预后评估及治疗方案选择提供了重要依据1。NGS检测已成为多种肿瘤类型的诊疗标准,主要用于:1)确立分子特征明确的肿瘤诊断;2)依据与肿瘤类型无关的生物标志物检测结果指导治疗决策;3)对特定肿瘤类型进行风险分层2,3。NGS及其他生物标志物检测的准确且及时的结果,已成为肿瘤患者临床诊疗和治疗规划中的关键组成部分。
下一代测序(NGS)检测通常在大型参考实验室或具备足够专业知识和资源以开发和维持此类检测的医院或学术实验室中进行。学术实验室基因组学组织(Genomics Organization for Academic Laboratories, GOAL)旨在建立一个协作网络,专注于共享学术知识和试剂成本4。GOAL联盟的一项重要工作是开展针对临床研究审核与报告关键环节的培训课程。这些课程以实践性教学形式开发,包括关于整合基因组学浏览器(integrative genomics viewer, IGV)的互动研讨会,用以展示其在基因组医学中的基本功能和高级功能。
IGV 是一种数据可视化工具,旨在帮助用户轻松地查看 NGS 数据及其他大型数据集,因为大多数 NGS 数据在缺乏图形用户界面的情况下往往体量庞大且难以处理5。IGV 最初并非为临床变异分析而设计,但由于其对所有分子领域专业人员(无论其生物信息学经验水平如何)均易于使用,已被许多实验室广泛采用,作为复杂数据审查工作流程的一部分6。本研究旨在建立一种机制,将这些信息传播给更广泛的基因组学实验室专业人员群体。
在临床工作流程中使用IGV的临床需求包括检测测序错误、处理基因组变异识别中的复杂情况,以及其他可通过额外可视化手段辅助进行恰当数据解读的常见变异7。使用IGV需要来自NGS研究的标准生物信息学文件8。IGV软件的核心功能支持测序数据的可视化,同时需要配置一系列用于临床变异解读的偏好设置和选项(补充文件1)。
短读长测序流程以 FASTQ、二进制比对图(BAM)和变异调用格式(VCF)文件标准为典型。NGS 通过并行生成数百万条短读长实现高通量。尽管该策略极大地加快了数据生成速度,但每条读长仅是原始 DNA 或 RNA 的一个片段。它通过接头序列固定在 NGS 流式芯片的某个位置。来自光学处理的序列和碱基质量信息被记录在FASTQ文件中。这些原始读长包含核苷酸序列及其对应的每个碱基的质量分数。因此,处理原始读长的早期步骤之一是将每条读长比对到参考基因组8。当每条读长被分配到参考基因组中比对概率最高的特定位置时,对应于同一位置的读长会在每个位点处"堆积",此类数据遵循序列比对图谱(SAM)规范存储于 BAM 文件中(详见 https://samtools.github.io/hts-specs/SAMv1.pdf;最后验证时间:2025年9月30日)(图1A)。该信息可通过基因组浏览器(如 IGV)进行可视化检查。如图1B所示,将读长相互比较或与参考序列本身进行比较,可揭示核苷酸序列之间的差异或不一致之处。全基因组范围内仅这些"变异"位点的汇总信息被整合成 VCF 文件,因此 VCF 文件的大小通常远小于 BAM 文件,但仍包含变异审查所需的大量有用信息。正因如此,VCF 文件通常是变异检测流程的最终输出结果(图1C)。因此,FASTQ 文件包含原始读长和质量数据,BAM 文件提供这些读长比对到基因组的置信度信息,而 VCF 文件则表示参考序列与样本序列之间的差异,为潜在报告内容的审查提供了更易于管理的数据量。
本研究中的六个临床案例展示了分子实验室中体细胞变异检测相关的常见分析场景,以及影响基础数据正确理解与解读的复杂问题。总体而言,这些案例的选择旨在逐步呈现日益复杂的解读情境,并说明如何利用IGV中的高级功能更全面地描述基因组特征。尽管本研究重点在于体细胞变异的解读,但这些功能同样适用于利用IGV对生殖系变异进行可视化与解读6。需要注意的是,本文所使用的术语基于合成测序化学技术,对于其他平台,在适当情况下可采用相应的类比术语或概念。
每个临床案例均以简要的临床背景开始,随后提供如何分析变异或多个变异并解答问题的指导:所存在的变异中哪一个(如果有)是真实的,哪一个(如果有)是人工假象。临床背景结合测序数据的具体特征,对于回答这一问题至关重要。
本文提供的数据是模拟数据与真实患者NGS数据的混合。然而,所有患者数据均通过去除标签和单一位点读取提取的组合方式实现了去标识化。本方案遵循所有作者所在机构的人类研究伦理委员会的适用指南。
1. 下载最新版本的整合基因组学浏览器(Integrative Genomics Viewer,IGV)
注意:IGV 是一款用于可视化多种基因组(包括人类基因组)的免费可下载程序(https://igv.org/doc/desktop/#DownloadPage/)。IGV 会定期更新,以包含转录本、功能和轨迹的新版本,最新版本通常位于列表的顶部。
2. 理解临床案例并下载所需文件
3. 设置覆盖度轨迹图
注意:在 IGV 中,主窗口包含一个"覆盖度轨道"。在某些情况下,即使含有特定癌症变异的测序读段所占比例很小,也可能具有临床意义。因此,在基因组被检测区域实现非常高的测序深度至关重要。如果仅有 2% 的读段包含某一特定变异,则可能需要数百至数千的测序深度才能可靠地检出该变异——这也正是“"深度测序"”这一术语的由来。
4. 设置软剪切读段
注意:该设置对于检测较大的结构变异非常有价值,例如基因重排、拷贝数变化或复合插入-缺失事件。高级示例(如专注于EGFR扩增和缺失的示例)展示了软剪切读段如何佐证那些标准变异检测方法可能遗漏的结构变异的存在。
5. 临床案例
值得注意的是,本研究重点在于描述在IGV中进行变异审阅以用于临床报告的细微要点。最终的临床报告应依据各实验室经过验证的分析流程、质量标准和报告政策而定。对该重要主题的全面讨论已超出本研究的范围;然而,美国医学遗传学与基因组学学会和分子病理学协会已制定并发布了相关推荐标准和指南7,目前在临床实验室中得到常规应用。
临床案例 #1 解读:
鉴于较高的变异等位基因频率(VAF)、平衡的链分布以及KRAS c.34G>T (p.G12C)在肺癌中已知的发生率(图2A),病例A中的该变异可指导靶向治疗,因此在临床上必须予以报告。尽管在第二个(肉瘤)病例中也检出了相同的KRAS c.34 G>T变异(图2B),但存在多个提示假阳性结果的警示信号:(1)报告的变异等位基因频率(VAF)约为1%,远低于在肿瘤细胞含量估计即使仅为20%的样本中,驱动事件所预期达到的水平;(2)支持该变异的测序读段表现出链偏向性,几乎全部出现在正向链上。结合此类癌症中缺乏生物学合理性,这些证据表明病例B中的发现为技术假象。
临床案例 #2 解读:
本示例说明了临床医生必须注意的多种不同错误。首先,变异检测算法可能将相邻的遗传变异正确或错误地识别为两个单核苷酸变异(SNV),或识别为一个单一的多核苷酸变异(MNV)(图2C)。这源于体细胞变异检测工具中单倍型感知变异检测算法实现方式的差异。目前仅有少数较新发表的变异检测工具整合了这一功能14,15。其次,诸如上述的技术性差异和命名法差异,会由测序中心通过不同的生物信息学分析流程上传至外部数据库,因此可能导致本应列为单一遗传变异的条目出现多种不同的记录。除非定期对数据库进行等位基因相位整合,否则这些差异可能对后续的临床解读产生多种不利影响。综上所述,这些潜在的误差来源可能共同导致错误的患者检测报告。这一复杂情况凸显了使用高质量软件(如IGV)进行变异可视化的重要性。
临床案例 #3 解读:
鉴于多重测序支持该重复序列的存在,且已知 KIT 基因第9外显子重复在胃肠道间质瘤(GIST)中具有组成型激活的机制,我们可以得出结论:该 KIT c.1504_1509dup(p.A502_Y503dup)变异是真实存在的,而非测序 artifacts(图3)。KIT 基因突变是 GIST 中常见的驱动事件,发生率约为 90%。在此背景下,准确的变异特征鉴定至关重要,因为尽管第11外显子的激活突变最为常见,但第9外显子突变的 GIST 在对酪氨酸激酶抑制剂的敏感性方面表现出不同的行为,从而影响治疗策略的选择。鉴于 KIT 突变在 GIST 中具有重要的临床意义,该变异应纳入最终报告中。
临床案例 #4 解读:
根据覆盖度轨迹、典型的短片段缺失特征、测序读段支持情况,以及非小细胞肺癌(NSCLC)中 EGFR 19号外显子缺失导致其组成性激活的已知机制,可以确定该 EGFR c.2235_2249del (p.E746_A750del) 变异真实存在,而非技术假象(图4)。许多 EGFR 突变(包括这一常见的19号外显子缺失)对酪氨酸激酶抑制剂高度敏感。 鉴于 EGFR 突变在非小细胞肺癌中的重要临床意义,该变异应纳入最终报告中。
临床案例 #5 和案例 #6 解读:
热图视图证实了EGFR基因的扩增,通过BLAT分析的外显子1与8之间的断点连接也验证了该患者中的这两个发现(图5和图6)。EGFR扩增通常被认为是一种提示更具侵袭性疾病的预后因素,而EGFRvIII基因重排是胶质母细胞瘤(GBM)特异性的生物标志物,且具有潜在的可靶向性16,17。
可使用保存在 GitHub 代码仓库 https://github.com/Eitan177/Demo_IGV 主分支中的文件(更新于2026年6月9日)重现所选工作流程。该仓库包含六个会话文件(每个示例对应一个)、五对 bam 和 bai 文件(每个使用比对文件的示例对应一对),以及10个片段文件(seg files),用于第五个示例(该示例使用片段文件而非比对文件)。

图1:NGS 文件标准与测序工作流程。(A)在流动池上生成的短读段通过光学检测进行追踪,并以 FASTQ 格式存储,该格式包含序列数据和每个碱基的质量分数。随后,这些读段被排序并比对到参考基因组,生成 BAM 文件,其中每条读段在其匹配的基因组位点处“堆积”显示。(B)通过变异检测算法识别参考序列与读段之间的差异(例如点突变、小片段插入缺失)。(C)最终,这些检测到的变异被汇总为 VCF 文件,记录其位置、参考/替代碱基以及其他注释信息。请点击此处查看此图的放大版本。

图 2:基于 IGV 的 KRAS c.34G>T (p.G12C) 和 BRAF c.1798_1799delinsAA (p.V600K) 可视化展示。 (A)在 IGV 中可视化一个真实存在的变异(KRAS c.34G>T (p.G12C)),显示高测序深度(数千条读段),约 35–40% 的读段携带 G→T 改变。正向(红色)与反向(蓝色)读段分布均衡,提示为真实的杂合突变。(B)在非相关组织中发现的疑似技术假象,其变异支持读段极少(1% VAF)。大多数变异读段集中在正向链(红色),表明存在链偏好性。(C)在 IGV 中观察到的复杂变异 BRAF c.1798_1799delinsAA (p.V600K),显示为顺式(cis)的两碱基替换(GT→AA)。请点击此处查看该图的放大版本。

图3:可视化小片段插入。(A)在IGV中以“压缩”视图显示KIT 外显子9,有助于识别目标区域。(B)通过观察插入条和软剪切碱基识别出目标区域(红框)。(C)在IGV中设置“展开”视图,以便可视化插入序列。(D)点击插入条(红框)可显示插入的序列。(E)将插入序列与参考序列比对,以识别重复的碱基。(F)按读段链方向排序,显示软剪切碱基对应于反向读段中的插入。请点击此处查看该图的高清版本。

图4:可视化一个小的缺失突变。(A)EGFR 19号外显子的“压缩”视图,显示在多个测序读段中存在缺失。(B)利用覆盖度轨迹查看缺失位点及其邻近位置的读段数量。(C)“展开”视图,显示缺失并确定缺失的碱基数。(D)与参考序列(红色框)比对,确认缺失的碱基。请点击此处查看该图的放大版本

图5: 可视化拷贝数增加 (Aseg 文件包含六列:样本 ID、染色体、起始位置、终止位置、片段内的标记数以及片段的均值。B) 直接将 seg 文件加载到 IGV 中可实现便捷的可视化。C) 在全基因组视图中展示数据。每个样本将显示为一行数据,颜色表示数值,红色代表 >0 和蓝色用于 <0,颜色越深表示数值距离0越远。打开目标样本及同一批次中的九个随机样本后,结果显示为包含十行的多样本热图。目标样本在底部以红色框标出。D)将视野缩小至 EGFR 位点,目标样本底部显示为红色条带,而随机样本显示为白色或蓝色条带。该位点处目标样本与其他行随机样本之间的颜色差异表明,目标样本中的扩增信号高于此位点的背景或噪声水平。E) 放大至7号染色体,可观察到包含该位点的区域存在明显对比 EGFR 在我们的样本中存在,而在随机样本中不存在。 EGFR 扩增在底部样本中显示为一条红色细线。F)将视野缩小至 MET 位点,MET 扩增在九个随机样本中以及目标样本中均以不同程度被复制,表明该扩增检出可能为一种假象。这凸显了真实拷贝数变异检出与伪影在表现上的差异 EGFR 基因座和一种人为产物 请点击此处以查看此图的放大版本。

图6: 可视化 EGFRvIII 基因重排。 在分析该案例前,请确保已设置好软剪切碱基的可视化功能(详见补充文件1以获取更多细节)。(A)导航至第一个候选连接位点,并将比对轨道的显示模式设为“Squished”(压缩模式)。(B)在该基因座范围内移动,反复使用按碱基排序的快捷键“control-s”,直到在比对轨道顶部出现大量相似软剪切读段的堆积峰。堆积峰中相似软剪切读段的数量越多,表明发生结构重排的置信度越高。(C)BLAT 工具会提取软剪切碱基的序列,并识别该序列在基因组中的位置,同时提供一个量化评分,用于衡量该序列与目标数据库中特定序列的匹配程度。选择某一行将跳转至该位置。(D)再次使用“control-s”按碱基排序功能,可显示另一侧读段上的软剪切堆积峰。为确认样本中相对于 hg38 参考基因组不存在额外的碱基序列,可右键单击含有连续软剪切碱基的读段,并再次对这些软剪切碱基执行 BLAT 比对。生成的表格将显示连接位点的第一个断点,即最初可视化的位置——外显子1-内含子1连接处。(E)选择表格中的第一行可返回第一个断点。BLAT 参考比对连接处的碱基序列与作为查询序列的软剪切碱基完全一致,表明整段软剪切读段均包含在参考序列比对中。请点击此处查看该图的放大版本。
补充文件 1: 推荐的 IGV 设置。请点击此处下载该文件。
补充文件 2:简化的实验流程。请点击此处下载该文件。
临床报告中的准确变异审阅依赖于复杂的生物信息学算法,并需结合利用IGV对复杂变异进行可视化审阅5,6。本研究旨在汇编一份简洁的资源,提供在IGV中可视化简单和复杂基因组变异的推荐设置(补充文件1)。本研究重点关注常见的体细胞变异及其在IGV中的审阅方法。
本方案首先评估一个简单替换突变(图2A)和一个复杂替换突变(图2C),并特别关注判断所发现的变异是真实突变还是技术假象。接着介绍简单插入突变(图3)和简单缺失突变(图4),重点说明这些变异在IGV中的表现特征。最后讨论复杂的基因组变异,包括拷贝数变异(图5)和结构重排(图6)。每种变异类型的关键分析步骤以简明工作流程的形式总结于补充文件2中。本研究旨在帮助读者熟悉不同类型的基因组变异在IGV中的呈现方式5。
值得注意的是,IGV 并不作为独立检测变异的流程工具使用。尽管超出本文范围,但强烈建议研究实验室并要求临床实验室制定相应的实验室政策和程序,以应对基于检测验证在变异等位基因分数和测序深度方面的局限性所确定的可报告变异,明确在特定情况下是否需要对变异进行正交验证,同时应考虑生物信息学软件版本管理的复杂性以及视觉解读中的观察者间差异1,7。
所有作者均声明不存在利益冲突。
我们感谢所有 IGV 软件的开发者,以及目前资助 IGV 开发的美国国立卫生研究院(NIH)基金: U24CA258406。本研究的开发未获得任何资金支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| BLAT | BLAT 基因组搜索 | https://genome.ucsc.edu/cgi-bin/hgBlat | 独立的 BLAT 网页。BLAT API 可在 IGV 中使用,无需额外安装 |
| CNVKit | GitHub | https://github.com/etal/cnvkit | 公开的 GitHub 仓库,可免费下载 CNVKit。此处还提供下载和运行 CNVKit 的说明。 |
| 示例 #5 的对照片段文件 #1 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/c1.seg | 拷贝数文件 |
| 示例 #5 的对照片段文件 #2 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/c2.seg | 拷贝数文件 |
| 示例 #5 的对照片段文件 #3 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/c4.seg | 拷贝数文件 |
| 示例 #5 的对照片段文件 #4 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/c5.seg | 拷贝数文件 |
| 示例 #5 的对照片段文件 #5 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/c6.seg | 拷贝数文件 |
| 示例 #5 的对照片段文件 #6 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/c7.seg | 拷贝数文件 |
| 示例 #5 的对照片段文件 #7 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/c8.seg | 拷贝数文件 |
| 示例 #5 的对照片段文件 #8 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/c9.seg | 拷贝数文件 |
| 示例 #5 的对照片段文件 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/c3.seg | 拷贝数文件 |
| 人类基因组序列 | 人类基因组序列 | https://hgdownload.soe.ucsc.edu/goldenPath/hg38/bigZips/latest/hg38.fa.gz | 包含 Hg38 人类基因组版本的可下载 fasta 文件。 该文件可在 IGV 中直接使用,无需额外下载 |
| 人类基因组序列 | 人类基因组序列 | https://hgdownload.soe.ucsc.edu/goldenPath/hg19/bigZips/latest/hg19.fa.gz | 包含 Hg19 人类基因组版本的可下载 fasta 文件。该文件可在 IGV 中直接使用,无需额外下载 |
| IGV 软件包 | IGV 软件 | https://data.broadinstitute.org/igv/projects/downloads/2.19/IGV_Win_2.19.7-WithJava-installer.exe | 版本为 2.19.7 的 IGV 软件(含 Java,JDK 21),可免费下载。此处链接适用于 Windows,但 Linux 和 Mac 的链接也可用。 |
| 示例 #5 病例的片段文件 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/proband.seg | 拷贝数文件 |
| 教程 GitHub 仓库 | GitHub | https://github.com/Eitan177/Demo_IGV/tree/main | 公开的 GitHub 仓库,包含重现六个示例所需的全部文件 |
| 示例 #1 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/KRAS.xml | 会话文件 |
| 示例 #1 病例 A 的 bai 索引 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/kras2A_fixed_backbone_ 2A_new_final_sorted.bam.bai | 比对文件 |
| 示例 #1 病例 A 的 bam 比对文件 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/kras2A_fixed_backbone_ 2A_new_final_sorted.bam | 比对文件 |
| 示例 #1 病例 B 的 bai 索引 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/kras2B_fixed_backbone_ 2B_new_final_sorted.bam.bai | 比对文件 |
| 示例 #1 病例 B 的 bam 比对文件 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/kras2B_fixed_backbone_ 2B_new_final_sorted.bam | 比对文件 |
| 示例 #2 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/BRAF.xml | 会话文件 |
| 示例 #2 bai 索引 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/fig2C_braf_v600k_2bp_ backbone_2CD_new_final_sorted.bam.bai | 比对文件 |
| 示例 #2 bam 比对文件 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/fig2C_braf_v600k_2bp_ backbone_2CD_new_final_sorted.bam | 比对文件 |
| 示例 #3 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/KIT.xml | 会话文件 |
| 示例 #3 的 bai 索引文件 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/KITdupmod2.bai | 比对文件 |
| 示例 #3 的 bam 比对文件 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/KITdupmod2.bam | 比对文件 |
| 示例 #4 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/EGFR.xml | 会话文件 |
| 示例 #4 比对文件 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/EGFRE746_A750delmod.bam | 比对文件 |
| 示例 #4 bai 索引 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/EGFRE746_A750delmod.bai | 比对文件 |
| 示例 #5 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/copynumber.xml | 会话文件 |
| 示例 #6 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/egfr_vIII.xml | 会话文件 |
| 示例 #6 bai 索引 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/proband.bai | 比对文件 |
| 示例 #6 bam 比对文件 | GitHub | https://github.com/Eitan177/Demo_IGV/blob/main/proband.bam | 比对文件 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可