2019年5月19日
本文介绍了一种生物信息学方法及相关分析,用于在特定位点水平上鉴定 LINE-1 的表达。
转座元件是人类基因组不稳定性的主要来源之一。了解其在不同组织和条件下的表达情况,对于理解其对基因组的影响至关重要。大多数L1转录本是其他转录本被动包含L1相关序列的结果,这些转录本在L1生命周期中并无作用。
我们的方法能够消除这种无关的背景信号。该方案可适用于任何可移动元件的研究,甚至可用于任何序列基因组中的病毒研究。但需要存在至少一定程度的序列变异,以便区分不同位点。
对该方法进行可视化演示,对于阐明在位点特异性水平上可靠识别表达的L1重复元件所需的高度严谨性和操作细节至关重要。本实验流程始于细胞质RNA提取及下一代测序,具体步骤详见文本方案。通过选择性提取细胞质RNA,可显著减少存在于细胞核内含子mRNA中表达的L1相关序列读段。
在测序文库构建过程中,为减少与L1无关的转录噪声,另一步骤是选择带有聚腺苷酸化的转录本。这可以去除在非mRNA物种中发现的与L1相关的转录本噪声。在Linux终端中输入命令行,使用bowtie1将测序得到的FASTQ文件与感兴趣的RNA-seq样本进行比对分析。
这种比对策略要求通过全面的基因组搜索,将转录本唯一且共线性地比对到基因组上。该策略可确保将测序读段特异性地定位至单一 L1 位点的结果具有高可信度。使用 SAMtools 和 Linux 命令对输出的 BAM 文件按链分离,分别获取正义链和反义链。
请注意,如果未使用标准的下一代测序方案,实际的标志值可能会有所不同。该链分离步骤通过消除可能的反义链 L1 相关比对读段,能够过滤掉与 L1 逆转座无关的 L1 序列内部产生的转录噪声。使用 bedtools 针对 L1 位点的注释生成读段计数。
首先输入命令行,以生成正链上L1在正义方向的读段计数,然后输入命令行,以生成负链上L1在正义方向的读段计数。用于识别L1的注释信息特指具有功能启动子区域的全长L1,可有效消除原本来源于截短型L1的背景噪声。为比对到每个注释L1位点的读段创建一个电子表格。
将为底链生成的读数计数文本文件复制过来,并将该工作表标记为 minus_bottom。根据第 J 列中读数从高到低的顺序对所有列进行排序。将为顶链生成的读数计数文本文件复制过来,根据第 J 列中读数从高到低的顺序对所有列进行排序,并将该工作表标记为 top_plus。
创建第三个页面,标记为“combined”,并添加来自 minus_bottom 和 plus_top 页面中读数不少于 10 的所有位点。根据 J 列中读数从高到低的顺序对所有列进行排序。为了辅助基因组区域(特别是在 L1 位点内或附近)的可比对性,从 NCBI 下载了目标物种的全基因组成对测序文件,并按照文本方案中所述方法将其转换为 FASTQ 文件。现在,在加载文件之前,对 BAM 文件建立索引,以便在 Integrative Genomics Viewer(简称 IGV)中查看。
在IGV中加载感兴趣的参考基因组,以可视化已注释的基因。同时加载全长L1元件的注释文件以可视化L1注释,加载人类RNA表达的BAM文件以可视化来自目标样本的比对转录本,以及加载人类基因组可比对性的BAM文件以评估基因组区域的可比对性。移除每个BAM文件关联的覆盖度和连接行。
压缩人类RNA表达和人类基因组可比对性的BAM文件,以便所有IGV轨道能够显示在同一屏幕上。消除与L1逆转座无关的L1序列转录噪声的最后关键步骤,是手动构建已鉴定出具有定位RNA测序转录本的全长L1序列。手动审编包括在相应基因组环境背景下可视化每个表达的L1位点,以确认表达源自L1启动子。
根据电子表格合并页面上列出的 L1 位点坐标,在 IGV 中手动检查每个具有唯一比对转录本的 L1 位点及其周围的基因组环境,进行人工筛选。若在 L1 方向上游至多五 kb 范围内无任何测序读段,则判定该位点为由其自身启动的真实表达位点。将对应行标记为绿色,并注明其为真实表达 L1 的原因。若 L1 上游区域本身不可比对,则此规则例外。
如果情况如此,则将该行标记为红色,并注明:L1启动子上游区域的表达无法评估,因此不能可靠地确定L1的表达。若在L1上游直至五千碱基范围内存在测序读段,则将该位点整理为并非由其自身启动子真实表达。将该行标记为红色,并说明其并非真实表达L1的原因。若某一位点位于一个表达基因的内含子内,且表达方向相同,并在L1上游存在读段;或位于一个同向表达基因的下游,且在L1上游存在读段;或表现为未注释的表达模式且在L1上游存在读段,则将该位点整理为假阳性。但存在例外情况:当仅有极少量读段直接覆盖L1启动子起始位点,但位置略位于L1上游时,若此类L1案例在上游无其他读段,则可认为该L1为真实表达。
将该行标记为绿色,并注明其为真实表达的L1。若某个L1位点的比对读段分布模式与其特定区域的可比对性不一致,则应将其归类为可能为假的L1位点。如果某个L1具有高度可比对性,但读段仅在L1内部某个较短区域内大量堆积,则该信号更可能并非来源于L1自身启动子驱动的表达,而更可能来自未注释的其他来源,例如外显子或LTR序列。在此类情况下,应将该位点标记为橙色,并注明该位点可疑的原因。
通过在 UCSC 基因组浏览器中检查 L1 位置来验证可疑富集区域的来源。如果某个位点位于零星表达的未注释基因组区域中,则应将其整理为非真实表达的位点。测序读段可能在 L1 位点上游 10 千碱基处表达。但大约每隔 10 千碱基,就会有比对到基因组的读段,其中部分读段与 L1 序列比对上。这些 L1 序列出现比对读段,可能是由于基因组表达存在未被注释的模式所致。
对于此类情况,将位点标注为红色,并注明该位点可疑的原因。为了评估每个 L1 位点的可比对性,使用 bedtools 程序、FL-L1 注释文件以及比对后的基因组序列数据,确定比对到 L1 位点的唯一比对读段数量。当有 400 个唯一读段比对到某一 L1 位点时,将其定义为具有完全覆盖度的可比对性。
确定将每个个体L1的基因组DNA比对读段缩放至400所需的缩放因子。为了根据各个L1位点的可比对性获得标准化的表达量度量,将该因子乘以比对到各个真实表达L1的RNA转录本读段数。每一步均用于突出显示由L1自身启动子驱动表达的L1元件与其他非L1生命周期相关转录本中包含L1元件的各种方式之间的差异。图中显示的是在DU145前列腺肿瘤细胞系中表达的人类基因组中所有全长完整L1元件上唯一比对的转录本读段。
黑色表示经过人工审校后确认为真实表达的特定位点,红色表示经过人工审校后被排除为真实表达的读段所对应的特定位点,灰色表示每个位点比对到的读段数少于10个的位点。
由于这些位点仅占转录本读段的一小部分,因此未进行人工审校。约有4500个位点因无任何比对上的读段而未在图中显示。经过人工审校后,唯一比对到DU145细胞中真实表达的特异性L1位点的读段数量范围为175条至人为设定的最低阈值10条。
在根据每个位点的可比对性得分对读段进行校正后,大多数位点的表达定量值有所增加。在DU145细胞中,经可比对性校正后,唯一比对到真实表达的特定L1位点的读段数范围为612至4条,且高表达至低表达位点的排序发生了变化。每一步均在降低高水平的转录背景噪声中起着关键作用。
然而,最关键的步骤是对每个 L1 位点进行人工审编,以确认其自身启动子的转录活性。在 DU145 细胞中通过生物信息学方法鉴定出的 L1 位点中,约有 50% 被排除,因其转录信号来源于其他转录本的背景噪音,这凸显了获得可靠结果所需的高度严谨性。为了鉴定最年轻的 L1 元件,我们建议采用针对 L1 转录本的 5' 端 RACE 富集方法,并结合 PacBio 等能够产生较长读长、从而实现更特异性比对的测序技术。
通过这种方法,我们可以严格且可靠地识别和定量 L1 的表达模式。这为深入理解单个 L1 位点的调控机制及其潜在影响奠定了基础。
本文介绍了一种严格的RNA-Seq生物信息学方案,用于识别和定量人类基因组中长散布元件-1(Long INterspersed Elements-1,LINE-1或L1)的位点特异性表达。该方法解决了由于L1元件具有重复性和高丰度特性而导致的本底转录噪声与真实L1表达难以区分的技术难题。本方案以DU145前列腺肿瘤细胞系为例进行演示,能够可靠地检测全长且自主表达的L1位点。
可靠地区分长散布核元件-1(LINE-1,L1)在特定位点的表达,对于理解疾病相关体系中基因组不稳定性驱动因素至关重要。该RNA-Seq与生物信息学分析流程可实现对真实表达L1位点的高分辨率定位与定量,直接支持早期发现阶段的机制去风险化和靶点验证。通过严格过滤转录噪声,该方法增强了转化基因组学和生物标志物研究的预测可信度。
该方案贯穿从早期假设验证到临床前模型验证的整个发现过程,为位点特异性的可移动元件表达提供了可重复使用的分析能力。