方法文章

分子病理学家使用整合基因组浏览器(IGV)进行临床变异解读

37 次观看

DOI:

10.3791/71808

2026年8月14日

* These authors contributed equally

本文内容

摘要

整合基因组学浏览器(IGV)软件为临床变异检测中的底层数据提供了丰富且直观的观察窗口。本文展示了五个实例,演示如何快速区分真实的致病性变异与技术假象,从而增强从事下一代测序检测结果判读的实践人员的诊断信心。

摘要

整合基因组学浏览器(IGV)是临床基因组学中的关键工具,能够实现对复杂测序数据的可视化与解读。将临床知识与测序结果的视觉评估相结合,是分子病理学家及其他专业人员评估并最终确定病例的主要方式。虽然有多种软件工具可提供辅助,但必须系统地理解并应用这些工具与底层数据之间的关系。本研究介绍了下一代测序(NGS)数据文件类型(如FASTQ、BAM、VCF)的基本背景,并讨论了其格式与用途。随后,我们描述了IGV如何从这些文件中提取细节信息的功能特性。我们采用一系列基于临床案例的精选实例,引导读者使用IGV软件,对照人类参考基因组,审查各类具有临床意义的变异。这些临床案例经过精心筛选,旨在展示基因组数据解读中存在的一些复杂情况,并说明在常规工作流程中使用IGV如何能够提供超越常规生物信息学软件算法变异 calling 的额外解读信息。利用IGV内置工具对基因组变异进行视觉检查,可揭示影响变异解读的细微上下文线索(例如变异等位基因频率、链偏向性、组织特异性背景)。尽管本研究重点在于使用IGV检测和解读体细胞变异,但所提供的应用方法也可推广至生殖系变异分析场景,包括复杂变异的分析和嵌合现象的检测。

引言

近年来,下一代测序(NGS)技术的应用已彻底改变了肿瘤学诊疗模式,为诊断、预后评估及治疗方案选择提供了重要依据1。NGS检测已成为多种肿瘤类型的诊疗标准,主要用于:1)确立分子特征明确的肿瘤诊断;2)依据与肿瘤类型无关的生物标志物检测结果指导治疗决策;3)对特定肿瘤类型进行风险分层2,3。NGS及其他生物标志物检测的准确且及时的结果,已成为肿瘤患者临床诊疗和治疗规划中的关键组成部分。

下一代测序(NGS)检测通常在大型参考实验室或具备足够专业知识和资源以开发和维持此类检测的医院或学术实验室中进行。学术实验室基因组学组织(Genomics Organization for Academic Laboratories, GOAL)旨在建立一个协作网络,专注于共享学术知识和试剂成本4。GOAL联盟的一项重要工作是开展针对临床研究审核与报告关键环节的培训课程。这些课程以实践性教学形式开发,包括关于整合基因组学浏览器(integrative genomics viewer, IGV)的互动研讨会,用以展示其在基因组医学中的基本功能和高级功能。

IGV 是一种数据可视化工具,旨在帮助用户轻松地查看 NGS 数据及其他大型数据集,因为大多数 NGS 数据在缺乏图形用户界面的情况下往往体量庞大且难以处理5。IGV 最初并非为临床变异分析而设计,但由于其对所有分子领域专业人员(无论其生物信息学经验水平如何)均易于使用,已被许多实验室广泛采用,作为复杂数据审查工作流程的一部分6。本研究旨在建立一种机制,将这些信息传播给更广泛的基因组学实验室专业人员群体。

在临床工作流程中使用IGV的临床需求包括检测测序错误、处理基因组变异识别中的复杂情况,以及其他可通过额外可视化手段辅助进行恰当数据解读的常见变异7。使用IGV需要来自NGS研究的标准生物信息学文件8。IGV软件的核心功能支持测序数据的可视化,同时需要配置一系列用于临床变异解读的偏好设置和选项(补充文件1)。

短读长测序流程以 FASTQ、二进制比对图(BAM)和变异调用格式(VCF)文件标准为典型。NGS 通过并行生成数百万条短读长实现高通量。尽管该策略极大地加快了数据生成速度,但每条读长仅是原始 DNA 或 RNA 的一个片段。它通过接头序列固定在 NGS 流式芯片的某个位置。来自光学处理的序列和碱基质量信息被记录在FASTQ文件中。这些原始读长包含核苷酸序列及其对应的每个碱基的质量分数。因此,处理原始读长的早期步骤之一是将每条读长比对到参考基因组8。当每条读长被分配到参考基因组中比对概率最高的特定位置时,对应于同一位置的读长会在每个位点处"堆积",此类数据遵循序列比对图谱(SAM)规范存储于 BAM 文件中(详见 https://samtools.github.io/hts-specs/SAMv1.pdf;最后验证时间:2025年9月30日)(图1A)。该信息可通过基因组浏览器(如 IGV)进行可视化检查。如图1B所示,将读长相互比较或与参考序列本身进行比较,可揭示核苷酸序列之间的差异或不一致之处。全基因组范围内仅这些"变异"位点的汇总信息被整合成 VCF 文件,因此 VCF 文件的大小通常远小于 BAM 文件,但仍包含变异审查所需的大量有用信息。正因如此,VCF 文件通常是变异检测流程的最终输出结果(图1C)。因此,FASTQ 文件包含原始读长和质量数据,BAM 文件提供这些读长比对到基因组的置信度信息,而 VCF 文件则表示参考序列与样本序列之间的差异,为潜在报告内容的审查提供了更易于管理的数据量。

本研究中的六个临床案例展示了分子实验室中体细胞变异检测相关的常见分析场景,以及影响基础数据正确理解与解读的复杂问题。总体而言,这些案例的选择旨在逐步呈现日益复杂的解读情境,并说明如何利用IGV中的高级功能更全面地描述基因组特征。尽管本研究重点在于体细胞变异的解读,但这些功能同样适用于利用IGV对生殖系变异进行可视化与解读6。需要注意的是,本文所使用的术语基于合成测序化学技术,对于其他平台,在适当情况下可采用相应的类比术语或概念。

每个临床案例均以简要的临床背景开始,随后提供如何分析变异或多个变异并解答问题的指导:所存在的变异中哪一个(如果有)是真实的,哪一个(如果有)是人工假象。临床背景结合测序数据的具体特征,对于回答这一问题至关重要。

方案

本文提供的数据是模拟数据与真实患者NGS数据的混合。然而,所有患者数据均通过去除标签和单一位点读取提取的组合方式实现了去标识化。本方案遵循所有作者所在机构的人类研究伦理委员会的适用指南。

1. 下载最新版本的整合基因组学浏览器(Integrative Genomics Viewer,IGV)

注意:IGV 是一款用于可视化多种基因组(包括人类基因组)的免费可下载程序(https://igv.org/doc/desktop/#DownloadPage/)。IGV 会定期更新,以包含转录本、功能和轨迹的新版本,最新版本通常位于列表的顶部。

  1. 从上方统一资源定位符(URL)下载名为“适用于 Windows(包含 Java)的 IGV”的文件到桌面,此操作可能需要管理员凭据,具体取决于所在机构的设置。
  2. 在 IGV 内选择计划在报告中调用的人类基因组版本(例如 hg19 或 hg38)。
    注意:本研究使用了 IGV 2.19.7 版本。在本方案中,下载的是适用于 Windows 且包含 Java 的版本。IGV 以默认的 8 GB 内存分配运行。IGV 偏好设置选项卡及其他部分中推荐的设置详见补充文件 1

2. 理解临床案例并下载所需文件

  1. 访问 GitHub 代码仓库:所有文件均可在 GitHub 仓库 https://github.com/Eitan177/Demo_IGV 中下载。
    注意:每个示例均有对应的会话文件存放在 GitHub 仓库中,加载该会话文件可避免单独加载文件并导航至特定基因座,因为会话文件已自动完成这些步骤。
  2. 通过文件菜单加载会话文件。点击 文件 > 打开会话,然后选择相应的会话文件。

3. 设置覆盖度轨迹图

注意:在 IGV 中,主窗口包含一个"覆盖度轨道"。在某些情况下,即使含有特定癌症变异的测序读段所占比例很小,也可能具有临床意义。因此,在基因组被检测区域实现非常高的测序深度至关重要。如果仅有 2% 的读段包含某一特定变异,则可能需要数百至数千的测序深度才能可靠地检出该变异——这也正是“"深度测序"”这一术语的由来。

  1. 确保覆盖度轨迹存在: 从顶部菜单中,单击 查看 > 偏好 并选择 比对 标签。在标签顶部,有一个标有 显示覆盖度轨迹 确保已检查。
  2. 确保具有临床意义的低丰度变异检测阈值:导航至 比对 如步骤3.1所述点击标签,向下滚动直至出现标有 覆盖等位基因分数 可见。将框中的数值设为 0.01,然后按下 保存 (偏好设置窗口在点击后应关闭) 保存).

4. 设置软剪切读段

注意:该设置对于检测较大的结构变异非常有价值,例如基因重排、拷贝数变化或复合插入-缺失事件。高级示例(如专注于EGFR扩增和缺失的示例)展示了软剪切读段如何佐证那些标准变异检测方法可能遗漏的结构变异的存在。

  1. 启用软剪切: 从顶部菜单中,点击 查看 > 偏好设置,然后选择 比对 选项卡。向下滚动至 显示软剪切碱基 复选框,确保其已勾选(补充文件 1),以显示部分比对的读段——即其末端未能清晰比对至参考序列而被"剪切"掉的读段。

5. 临床案例

  1. 小节 #1:区分真实的 KRAS (Kirsten 大鼠肉瘤病毒癌基因同源物)致病性变异与测序伪影的区分
    注意:病例A为一名65岁男性,新近诊断为肺腺癌,组织学评估显示肿瘤占比约为80%。NGS检测鉴定出一个 KRAS NM_004985.5 c.34G>T (p.G12C) 变异,这是一种非小细胞肺癌(NSCLC)中已知的驱动突变。该错义变异导致的结果 KRAS c.34G>T (p.G12C) 突变发生于约 13% 的肺腺癌病例中,是靶向治疗的适用指征9病例B涉及一名54岁女性,已知患有肉瘤(估计肿瘤组织占50%,正常组织占50%)。相同的 KRAS c.34G>该样本中检测到T(p.G12C)变异。然而,由于 KRAS c.34G>p.G12C突变在肉瘤中鲜有报道,其存在提示可能存在测序假象。 
    1. IGV 工作流程(会话文件 KRAS.xml)             
      1. 加载数据:在基因组下拉菜单中选择 Hg19,加载 bam 文件 kras2A_fixed_backbone_2A_new_final_sorted.bam,并导航至 chr12:25,398,281–25,403,833 以聚焦该区域 KRAS 基因区域。注意索引文件(与bam文件同名,但以.bai结尾)必须与bam文件位于同一目录中。  
      2. 探究覆盖度与VAF:分析第2外显子中密码子12(NM_004985.5)) 并点击覆盖度轨道中的变异位点,以显示该位点的测序深度。注意观察G→T颠换(颠换事件),其变异等位基因频率(VAF)为35%–40%,与杂合型克隆驱动突变高度一致。图2A,尤其是在约80%肿瘤细胞含量的背景下。   
      3. 查找链偏好性:按链进行颜色编码(参见 补充文件 1第4步)显示肺样本中正向(红色)与反向(蓝色)分布接近50:50。  
      4. 重复步骤 5.1.1.1–5.1.1.3 用于病例 B(肉瘤样本):加载 bam 文件 kras2B_fixed_backbone_2B_new_final_sorted.bam,并记录 <1% VAF 且几乎完全由前向链支持,提示为 PCR/比对假象(图2B).
  2. 小节 #2: 纠正多核苷酸变异(MNV)的错误分类。
    注意:一名50岁女性转移性黑色素瘤患者接受基于下一代测序(NGS)的肿瘤分子谱分析。分析结果发现一个潜在的 BRAF (B-Raf 原癌基因,丝氨酸/苏氨酸激酶)c.1798_1799delinsAA 突变。而 BRAF NM_004333.6:c.1799T>A (p.V600E) 在多种实体瘤中更为常见, BRAF c.1798_1799delinsAA(p.V600K)对黑色素瘤具有相对特异性,因为紫外线可诱导C > 二嘧啶中的T转换10根据HGVS规则,两个单核苷酸变异(SNVs)在 顺式 应命名为单个MNV。在许多情况下,生物信息学分析流程可能会错误地将这种复杂变异识别为两个相邻的SNV 顺式: BRAF c.1798G>A 和 BRAF c.1799T>A. 由于存在技术性(即与变异检测软件相关)和生物学(顺式 在区分(区别)考虑因素方面,存在一种担忧:除非在临床审核期间能够可视化查看数据,否则在报告签发时该突变可能被错误报告。      
    1. IGV 工作流程(会话文件 BRAF.xml)           
      1. 加载数据:在基因组下拉菜单中选择 Hg38,加载 bam 文件 kras2B_fixed_backbone_2B_new_final_sorted.bam,并导航至 chr7:140,453,136–140,753,336。注意索引文件(与 bam 文件同名,但以 .bai 结尾)需与 bam 文件位于同一目录中。
      2. 放大至第600个密码子 BRAF注意:根据相邻覆盖度轨迹位置显示为绿色和蓝色(而非灰色),提示存在 GT→AA 双核苷酸变化,与 p.V600K 一致. 
      3. 扫描两个独立的单核苷酸变异(SNV),以确定它们是否处于 顺式 :请注意,这两个SNV均比对到相同的reads上,且位于同一序列中 顺式.  
      4. 探究链方向与覆盖度:对读段进行颜色编码,以显示大致均匀的正向/反向支持(参见 补充文件 1,第4步),且VAF超过50%,符合克隆性驱动突变特征。覆盖深度轨迹的阈值为0.01(见 补充文件 1,设置的第三步)可确保部分亚克隆(如果存在)仍能被观察到(图2C).  
      5. 注意上下文及MNV命名规范:这两个核苷酸变化彼此相邻。根据专家共识,应将位于同一测序读段上且距离在50 bp以内的SNV合并称为一个MNV "复合物" 或 "delins" 变异体11. 
  3. 小节 #3:探究一个 KIT 胃肠道间质瘤(GIST)中(KIT原癌基因,受体酪氨酸激酶)外显子9插入
    注意:一名58岁男性胃肠道间质瘤患者接受切除手术,医嘱进行下一代测序(NGS)检测。结果显示可能存在一个变异位点 KIT. KIT 突变是胃肠道间质瘤(GIST)中常见的驱动因素,约出现在75%的病例中,且具有可靶向性。在第11外显子激活突变之后, KIT 9号外显子激活突变是最常见的驱动因素,但9号外显子突变的GIST与11号外显子突变的GIST在酪氨酸激酶抑制剂敏感性方面表现不同12. 
    1. IGV 工作流程(会话文件 KIT.xml)
      1. 加载数据:选择 Hg19 基因组并加载 BAM 文件 KITdupmod2.bam,确保索引文件(与 bam 文件同名,但以 .bai 结尾)位于同一目录中。导航至 chr4:55,592,144-55,592,257,该区域对应 KIT 基因第 9 外显子的一部分 KIT 基因
      2. 挤压视图:右键单击比对轨道并选择 压扁的 以收起视图图3A).
      3. 定位插入片段:在覆盖度轨迹图正上方,位于55,592,178和55,592,179位点之间,找到形似箭头的插入标记,指示一个短插入片段图3B,C).
      4. 与插入片段交互:点击箭头展开视图,然后点击其中一个填补空缺的测序读段,以在弹出窗口中查看详细信息。将插入的序列与参考序列进行比对,以判断其是否为重复序列图3D,E).
      5. 查看覆盖度:点击插入箭头正下方的覆盖度轨迹,以显示支持该变异的读段数量,可将其与总读段数进行比较,从而估算出变异等位基因频率(VAF),本例中约为 28%。
      6. 检查链偏向性:按读段链方向排序并查看软剪切碱基(参见 补充文件 1,第3节)以显示反向测序读段中插入位点旁侧的目标区域图3F).
  4. 小节 #4:探究一个 EGFR (表皮生长因子受体)非小细胞肺癌(NSCLC)中的19号外显子缺失
    注意:一名70岁女性新诊断为非小细胞肺癌(NSCLC),接受肿瘤切除手术。对含有足够肿瘤纯度的组织切片进行二代测序(NGS)检测,结果显示可能存在一个变异 EGFR许多 EGFR 该突变对酪氨酸激酶抑制剂敏感,此变异可能影响患者的治疗方案及预后13.
    1. IGV 工作流程(会话文件 EGFR.xml)
      1. 加载 数据:选择 Hg19 基因组,加载 bam 文件 EGFRE746_A750delmod.bam,并确保索引文件(与 bam 文件同名,但以 .bai 结尾)位于同一目录中,然后导航至 chr7:55,242,420-55,242,513,该区域对应于 EGFR 基因第 19 外显子的一部分 EGFR 基因
      2. 使用覆盖度轨迹分析缺失:查看覆盖度轨迹,识别出位于读段末端之外且覆盖度较低的小区域图 4A,B)。覆盖度轨迹分析显示,在19号外显子的一小部分区域覆盖度较低。
      3. 利用测序读段分析缺失:展开比对视图以显示含有比对空缺的读段,空缺在读段中以黑色线条表示(图4C,D).
      4. 考虑基因组背景:研究涉及缺失及其紧邻区域的参考序列核苷酸序列。结合缺失在参考序列中的位置来评估缺失的检出结果,因为同聚物或重复区域中的缺失可能代表测序假象,尤其是在变异等位基因频率较低时。参见 观察一个小的缺失 部分 补充文件 2 有关工作流程的详细描述。
  5. 小节 #5:探究 EGFR 胶质母细胞瘤患者体内的改变
    注意:一名77岁女性患者,患有 IDH 野生型胶质母细胞瘤接受下一代测序(NGS)检测。她的结果显示存在潜在的 EGFR 拷贝数增加和一种潜在的 EGFRvIII 重排(外显子2–7的缺失)。两者均 EGFR 扩增与 EGFRvIII 这些改变在胶质母细胞瘤中具有预后和治疗意义。此外,这两种改变常共同发生,意味着当其中一种改变在低水平被检测到时,另一种改变的存在可为其检测结果的可靠性提供支持。
    1. IGV 工作流程(会话文件 copynumber.xml):
      1. 加载数据:选择 Hg38 基因组,加载片段文件 proband.seg 以及对照样本 c1.seg-c9.seg,通过将其拖放至IGV窗口中。导航至Chr7。
        注意:由 CNVKit 生成的分割文件可供下载。使用 CNVKit 生成拷贝数定量的完整工作流程不在本研究范围之内。简而言之,采用 CNVKit 版本 0.9.9(可从 https://github.com/etal/cnvkit 下载),并结合由正常、整倍体样本组成的预建混合参考样本进行分析。输入文件为包含分布在全基因组范围内的 9,144 个 CNV 骨架探针位置的 bed 文件。需要重点考虑的是,拷贝数分析流程的具体输入和参数设置的重要性,低于在同一批次运行中所有样本均采用相同处理方案这一原则,这有助于识别系统性偏差。
      2. 评估热图:比较目标样本(在热图中找到对应于此样本的行,该行已标注 先证者)及其他样本(c1-9)以区分真实的拷贝数变化与人为假象。
        注意:通过所有样本在某一基因座上的垂直视觉比较,可识别每个样本相对于背景的异常情况(基于行间颜色差异的定性差异,而非定量差异)。请参见 图5观察拷贝数变化 部分 补充文件 2 详细步骤请参见。
  6. 小节 #6:探究 EGFRvIII 在一名胶质母细胞瘤患者中。
    注意:该患者同时存在以下证据 EGFRvIII 重排(外显子2–7的缺失)。两者均 EGFR 扩增与 EGFRvIII 改变在胶质母细胞瘤中具有预后和治疗意义。此外,这两种改变经常共同出现,意味着当其中一种改变在低水平被检测到时,另一种改变的存在可为其检测结果的可靠性提供支持。
    1. IGV 工作流程(会话文件 egfr_vIII.xml):
      1. 加载数据:选择 Hg19 基因组,加载患者的 bam 文件 proband.bam,并确保索引文件(与 bam 文件同名,扩展名为 .bai)位于同一目录中,然后导航至 EGFR 基因
      2. 可视化断裂点 EGFRvIII:调整视图以单独检查候选断点(外显子2上游和外显子7下游) EGFRvIII),并执行“按碱基排序”  (或使用快捷方式 Ctrl-s 在 Windows/Linux 上或 Cmd-s 在断点处使用 Mac 上的软件查看软剪切读段的堆积情况。
      3. BLAT 比对读段:右键单击一个软剪切序列并选择 BLAT 序列(IGV 使用 UCSC 的默认参数,BLAT 默认参数详见 https://ucsc.crg.eu/FAQ/FAQblat.html)。点击第一行并观察 Blat 轨迹 位于IGV轨道区域底部的内容。
        注意:即使仅有一条读段比对到外显子1/内含子1的连接处以及内含子6/外显子7的连接处,也可能足以作为证据 EGFRvIII 只要排除了其他样本交叉污染作为该读数的原因即可。参考 图6 以及 观察结构重排 部分 补充文件 2 详细步骤请参见。

结果

值得注意的是,本研究重点在于描述在IGV中进行变异审阅以用于临床报告的细微要点。最终的临床报告应依据各实验室经过验证的分析流程、质量标准和报告政策而定。对该重要主题的全面讨论已超出本研究的范围;然而,美国医学遗传学与基因组学学会和分子病理学协会已制定并发布了相关推荐标准和指南7,目前在临床实验室中得到常规应用。

临床案例 #1 解读:

鉴于较高的变异等位基因频率(VAF)、平衡的链分布以及KRAS c.34G>T (p.G12C)在肺癌中已知的发生率(图2A),病例A中的该变异可指导靶向治疗,因此在临床上必须予以报告。尽管在第二个(肉瘤)病例中也检出了相同的KRAS c.34 G>T变异(图2B),但存在多个提示假阳性结果的警示信号:(1)报告的变异等位基因频率(VAF)约为1%,远低于在肿瘤细胞含量估计即使仅为20%的样本中,驱动事件所预期达到的水平;(2)支持该变异的测序读段表现出链偏向性,几乎全部出现在正向链上。结合此类癌症中缺乏生物学合理性,这些证据表明病例B中的发现为技术假象。

临床案例 #2 解读:

本示例说明了临床医生必须注意的多种不同错误。首先,变异检测算法可能将相邻的遗传变异正确或错误地识别为两个单核苷酸变异(SNV),或识别为一个单一的多核苷酸变异(MNV)(图2C)。这源于体细胞变异检测工具中单倍型感知变异检测算法实现方式的差异。目前仅有少数较新发表的变异检测工具整合了这一功能14,15。其次,诸如上述的技术性差异和命名法差异,会由测序中心通过不同的生物信息学分析流程上传至外部数据库,因此可能导致本应列为单一遗传变异的条目出现多种不同的记录。除非定期对数据库进行等位基因相位整合,否则这些差异可能对后续的临床解读产生多种不利影响。综上所述,这些潜在的误差来源可能共同导致错误的患者检测报告。这一复杂情况凸显了使用高质量软件(如IGV)进行变异可视化的重要性。

临床案例 #3 解读:

鉴于多重测序支持该重复序列的存在,且已知 KIT 基因第9外显子重复在胃肠道间质瘤(GIST)中具有组成型激活的机制,我们可以得出结论:该 KIT c.1504_1509dup(p.A502_Y503dup)变异是真实存在的,而非测序 artifacts(图3)。KIT 基因突变是 GIST 中常见的驱动事件,发生率约为 90%。在此背景下,准确的变异特征鉴定至关重要,因为尽管第11外显子的激活突变最为常见,但第9外显子突变的 GIST 在对酪氨酸激酶抑制剂的敏感性方面表现出不同的行为,从而影响治疗策略的选择。鉴于 KIT 突变在 GIST 中具有重要的临床意义,该变异应纳入最终报告中。

临床案例 #4 解读:

根据覆盖度轨迹、典型的短片段缺失特征、测序读段支持情况,以及非小细胞肺癌(NSCLC)中 EGFR 19号外显子缺失导致其组成性激活的已知机制,可以确定该 EGFR c.2235_2249del (p.E746_A750del) 变异真实存在,而非技术假象(图4)。许多 EGFR 突变(包括这一常见的19号外显子缺失)对酪氨酸激酶抑制剂高度敏感。 鉴于 EGFR 突变在非小细胞肺癌中的重要临床意义,该变异应纳入最终报告中。

临床案例 #5 和案例 #6 解读:

热图视图证实了EGFR基因的扩增,通过BLAT分析的外显子1与8之间的断点连接也验证了该患者中的这两个发现(图5图6)。EGFR扩增通常被认为是一种提示更具侵袭性疾病的预后因素,而EGFRvIII基因重排是胶质母细胞瘤(GBM)特异性的生物标志物,且具有潜在的可靶向性16,17

可使用保存在 GitHub 代码仓库 https://github.com/Eitan177/Demo_IGV 主分支中的文件(更新于2026年6月9日)重现所选工作流程。该仓库包含六个会话文件(每个示例对应一个)、五对 bam 和 bai 文件(每个使用比对文件的示例对应一对),以及10个片段文件(seg files),用于第五个示例(该示例使用片段文件而非比对文件)。

figure-results-1
图1:NGS 文件标准与测序工作流程。A)在流动池上生成的短读段通过光学检测进行追踪,并以 FASTQ 格式存储,该格式包含序列数据和每个碱基的质量分数。随后,这些读段被排序比对到参考基因组,生成 BAM 文件,其中每条读段在其匹配的基因组位点处“堆积”显示。(B)通过变异检测算法识别参考序列与读段之间的差异(例如点突变、小片段插入缺失)。(C)最终,这些检测到的变异被汇总为 VCF 文件,记录其位置、参考/替代碱基以及其他注释信息。请点击此处查看此图的放大版本。

figure-results-2
图 2:基于 IGV 的 KRAS c.34G>T (p.G12C) 和 BRAF c.1798_1799delinsAA (p.V600K) 可视化展示。A)在 IGV 中可视化一个真实存在的变异(KRAS c.34G>T (p.G12C)),显示高测序深度(数千条读段),约 35–40% 的读段携带 G→T 改变。正向(红色)与反向(蓝色)读段分布均衡,提示为真实的杂合突变。(B)在非相关组织中发现的疑似技术假象,其变异支持读段极少(1% VAF)。大多数变异读段集中在正向链(红色),表明存在链偏好性。(C)在 IGV 中观察到的复杂变异 BRAF c.1798_1799delinsAA (p.V600K),显示为顺式(cis)的两碱基替换(GT→AA)。请点击此处查看该图的放大版本。

figure-results-3
图3:可视化小片段插入。A)在IGV中以“压缩”视图显示KIT 外显子9,有助于识别目标区域。(B)通过观察插入条和软剪切碱基识别出目标区域(红框)。(C)在IGV中设置“展开”视图,以便可视化插入序列。(D)点击插入条(红框)可显示插入的序列。(E)将插入序列与参考序列比对,以识别重复的碱基。(F)按读段链方向排序,显示软剪切碱基对应于反向读段中的插入。请点击此处查看该图的高清版本。

figure-results-4
图4:可视化一个小的缺失突变。(AEGFR 19号外显子的“压缩”视图,显示在多个测序读段中存在缺失。(B)利用覆盖度轨迹查看缺失位点及其邻近位置的读段数量。(C)“展开”视图,显示缺失并确定缺失的碱基数。(D)与参考序列(红色框)比对,确认缺失的碱基。请点击此处查看该图的放大版本

figure-results-5
图5: 可视化拷贝数增加 (Aseg 文件包含六列:样本 ID、染色体、起始位置、终止位置、片段内的标记数以及片段的均值。B) 直接将 seg 文件加载到 IGV 中可实现便捷的可视化。C) 在全基因组视图中展示数据。每个样本将显示为一行数据,颜色表示数值,红色代表 >0 和蓝色用于 <0,颜色越深表示数值距离0越远。打开目标样本及同一批次中的九个随机样本后,结果显示为包含十行的多样本热图。目标样本在底部以红色框标出。D)将视野缩小至 EGFR 位点,目标样本底部显示为红色条带,而随机样本显示为白色或蓝色条带。该位点处目标样本与其他行随机样本之间的颜色差异表明,目标样本中的扩增信号高于此位点的背景或噪声水平。E) 放大至7号染色体,可观察到包含该位点的区域存在明显对比 EGFR 在我们的样本中存在,而在随机样本中不存在。 EGFR 扩增在底部样本中显示为一条红色细线。F)将视野缩小至 MET 位点,MET 扩增在九个随机样本中以及目标样本中均以不同程度被复制,表明该扩增检出可能为一种假象。这凸显了真实拷贝数变异检出与伪影在表现上的差异 EGFR 基因座和一种人为产物 请点击此处以查看此图的放大版本。

figure-results-6
图6 可视化 EGFRvIII 基因重排。 在分析该案例前,请确保已设置好软剪切碱基的可视化功能(详见补充文件1以获取更多细节)。(A)导航至第一个候选连接位点,并将比对轨道的显示模式设为“Squished”(压缩模式)。(B)在该基因座范围内移动,反复使用按碱基排序的快捷键“control-s”,直到在比对轨道顶部出现大量相似软剪切读段的堆积峰。堆积峰中相似软剪切读段的数量越多,表明发生结构重排的置信度越高。(C)BLAT 工具会提取软剪切碱基的序列,并识别该序列在基因组中的位置,同时提供一个量化评分,用于衡量该序列与目标数据库中特定序列的匹配程度。选择某一行将跳转至该位置。(D)再次使用“control-s”按碱基排序功能,可显示另一侧读段上的软剪切堆积峰。为确认样本中相对于 hg38 参考基因组不存在额外的碱基序列,可右键单击含有连续软剪切碱基的读段,并再次对这些软剪切碱基执行 BLAT 比对。生成的表格将显示连接位点的第一个断点,即最初可视化的位置——外显子1-内含子1连接处。(E)选择表格中的第一行可返回第一个断点。BLAT 参考比对连接处的碱基序列与作为查询序列的软剪切碱基完全一致,表明整段软剪切读段均包含在参考序列比对中。请点击此处查看该图的放大版本。

补充文件 1: 推荐的 IGV 设置。请点击此处下载该文件。

补充文件 2:简化的实验流程。请点击此处下载该文件。

讨论

临床报告中的准确变异审阅依赖于复杂的生物信息学算法,并需结合利用IGV对复杂变异进行可视化审阅5,6。本研究旨在汇编一份简洁的资源,提供在IGV中可视化简单和复杂基因组变异的推荐设置(补充文件1)。本研究重点关注常见的体细胞变异及其在IGV中的审阅方法。

本方案首先评估一个简单替换突变(图2A)和一个复杂替换突变(图2C),并特别关注判断所发现的变异是真实突变还是技术假象。接着介绍简单插入突变(图3)和简单缺失突变(图4),重点说明这些变异在IGV中的表现特征。最后讨论复杂的基因组变异,包括拷贝数变异(图5)和结构重排(图6)。每种变异类型的关键分析步骤以简明工作流程的形式总结于补充文件2中。本研究旨在帮助读者熟悉不同类型的基因组变异在IGV中的呈现方式5

值得注意的是,IGV 并不作为独立检测变异的流程工具使用。尽管超出本文范围,但强烈建议研究实验室并要求临床实验室制定相应的实验室政策和程序,以应对基于检测验证在变异等位基因分数和测序深度方面的局限性所确定的可报告变异,明确在特定情况下是否需要对变异进行正交验证,同时应考虑生物信息学软件版本管理的复杂性以及视觉解读中的观察者间差异1,7

披露

所有作者均声明不存在利益冲突。

致谢

我们感谢所有 IGV 软件的开发者,以及目前资助 IGV 开发的美国国立卫生研究院(NIH)基金: U24CA258406。本研究的开发未获得任何资金支持。

材料

本文使用的材料清单
姓名公司目录编号评论
BLATBLAT 基因组搜索https://genome.ucsc.edu/cgi-bin/hgBlat独立的 BLAT 网页。BLAT API 可在 IGV 中使用,无需额外安装
CNVKitGitHubhttps://github.com/etal/cnvkit公开的 GitHub 仓库,可免费下载 CNVKit。此处还提供下载和运行 CNVKit 的说明。
示例 #5 的对照片段文件 #1GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c1.seg拷贝数文件
示例 #5 的对照片段文件 #2GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c2.seg拷贝数文件
示例 #5 的对照片段文件 #3GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c4.seg拷贝数文件
示例 #5 的对照片段文件 #4GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c5.seg拷贝数文件
示例 #5 的对照片段文件 #5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c6.seg拷贝数文件
示例 #5 的对照片段文件 #6GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c7.seg拷贝数文件
示例 #5 的对照片段文件 #7GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c8.seg拷贝数文件
示例 #5 的对照片段文件 #8GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c9.seg拷贝数文件
示例 #5 的对照片段文件GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/c3.seg拷贝数文件
人类基因组序列人类基因组序列https://hgdownload.soe.ucsc.edu/goldenPath/hg38/bigZips/latest/hg38.fa.gz包含 Hg38 人类基因组版本的可下载 fasta 文件。  该文件可在 IGV 中直接使用,无需额外下载
人类基因组序列人类基因组序列https://hgdownload.soe.ucsc.edu/goldenPath/hg19/bigZips/latest/hg19.fa.gz包含 Hg19 人类基因组版本的可下载 fasta 文件。该文件可在 IGV 中直接使用,无需额外下载
IGV 软件包IGV 软件https://data.broadinstitute.org/igv/projects/downloads/2.19/IGV_Win_2.19.7-WithJava-installer.exe版本为 2.19.7 的 IGV 软件(含 Java,JDK 21),可免费下载。此处链接适用于 Windows,但 Linux 和 Mac 的链接也可用。
示例 #5 病例的片段文件GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/proband.seg拷贝数文件
教程 GitHub 仓库GitHubhttps://github.com/Eitan177/Demo_IGV/tree/main公开的 GitHub 仓库,包含重现六个示例所需的全部文件
示例 #1GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/KRAS.xml会话文件
示例 #1 病例 A 的 bai 索引GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/kras2A_fixed_backbone_
2A_new_final_sorted.bam.bai
比对文件
示例 #1 病例 A 的 bam 比对文件GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/kras2A_fixed_backbone_
2A_new_final_sorted.bam
比对文件
示例 #1 病例 B 的 bai 索引GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/kras2B_fixed_backbone_
2B_new_final_sorted.bam.bai
比对文件
示例 #1 病例 B 的 bam 比对文件GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/kras2B_fixed_backbone_
2B_new_final_sorted.bam
比对文件
示例 #2GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/BRAF.xml会话文件
示例 #2  bai 索引GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/fig2C_braf_v600k_2bp_
backbone_2CD_new_final_sorted.bam.bai
比对文件
示例 #2  bam 比对文件GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/fig2C_braf_v600k_2bp_
backbone_2CD_new_final_sorted.bam
比对文件
示例 #3GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/KIT.xml会话文件
示例 #3 的 bai 索引文件GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/KITdupmod2.bai比对文件
示例 #3 的 bam 比对文件GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/KITdupmod2.bam比对文件
示例 #4GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/EGFR.xml会话文件
示例 #4 比对文件GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/EGFRE746_A750delmod.bam比对文件
示例 #4 bai 索引GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/EGFRE746_A750delmod.bai比对文件
示例 #5GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/copynumber.xml会话文件
示例 #6GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/egfr_vIII.xml会话文件
示例 #6 bai 索引GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/proband.bai比对文件
示例 #6 bam 比对文件GitHubhttps://github.com/Eitan177/Demo_IGV/blob/main/proband.bam比对文件

参考文献

  1. Tjota MY, Segal JP, Wang P. Clinical utility and benefits of comprehensive genomic profiling in cancer. J Appl Lab Med. 2024;9(1):76-91.
  2. Freedman AN, et al. Use of next-generation sequencing tests to guide cancer treatment: results from a nationally representative survey of oncologists in the United States. JCO Precis Oncol. 2018;2:PO.18.00169.
  3. Ghoreyshi N, et al. Next-generation sequencing in cancer diagnosis and treatment: clinical applications and future directions. Discov Oncol. 2025;16:578.
  4. Aisner DL, et al. The Genomics Organization for Academic Laboratories (GOAL): A vision for a genomics future for academic pathology. Acad Pathol. 2023;10(3):100090.
  5. Robinson JT, Thorvaldsdóttir H, Wenger AM, Zehir A, Mesirov JP. Variant review with the Integrative Genomics Viewer (IGV). Cancer Res. 2017;77(21):e31-e34.
  6. Thorvaldsdóttir H, Robinson JT, Mesirov JP. Integrative Genomics Viewer (IGV): high-performance genomics data visualization and exploration. Brief Bioinform. 2013;14(2):178-192.
  7. Richards S, et al. Standards and guidelines for the interpretation of sequence variants: a joint consensus recommendation of the American College of Medical Genetics and Genomics and the Association for Molecular Pathology. Genet Med. 2015;17(5):405-424.
  8. Larson NB, Oberg AL, Adjei AA, Wang L. A clinician's guide to bioinformatics for next-generation sequencing. J Thorac Oncol. 2023;18(2):143-157.
  9. Jänne PA, et al. Adagrasib in non-small-cell lung cancer harboring a KRAS G12C mutation. N Engl J Med. 2022;387(2):120-131.
  10. Vandenberg BN, et al. Contributions of replicative and translesion DNA polymerases to mutagenic bypass of canonical and atypical UV photoproducts. Nat Commun. 2023;14(1):2576.
  11. Dunn T, Narayanasamy S. vcfdist: accurately benchmarking phased small variant calls in human genomes. Nat Commun. 2023;14(1):8149.
  12. Trent JC. Toward personalized, targeted therapy of gastrointestinal stromal tumor. Gastrointest Cancer Res. 2008;2(5):256-257.
  13. Xu CW, et al. Molecular characteristics and clinical outcomes of EGFR Exon 19 C-helix deletion in non-small cell lung cancer and response to EGFR TKIs. Transl Oncol. 2020;13(9):100791.
  14. Guille A, et al. A benchmarking study of individual somatic variant callers and voting-based ensembles for whole-exome sequencing. Brief Bioinform. 2024;26(1):bbae697.
  15. Cooke DP, Wedge DC, Lunter G. A unified haplotype-based method for accurate and comprehensive variant calling. Nat Biotechnol. 2021;39(7):885-892.
  16. Ezzati S, Salib S, Balasubramaniam M, Aboud O. Epidermal Growth Factor Receptor inhibitors in glioblastoma: current status and future possibilities. Int J Mol Sci. 2024;25(4):2316.
  17. Vivanco I, et al. Differential sensitivity of glioma- versus lung cancer-specific EGFR mutations to EGFR kinase inhibitors. Cancer Discov. 2012;2(5):458-471.

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

VCF BAM
视频即将推出

相关文章