2022年10月21日
本文提交的实验方案详细说明了从研究宿主-病原体相互作用的RNA测序转录组数据中预测和功能注释环状RNA所需的完整in silico分析流程。
环状RNA在不同的生物学过程中发挥重要的调控作用。本方案适用于初学者在宿主与病原体相互作用领域开展环状RNA分析。本文整合了多种工具,建立了一套简化的流程,可用于环状RNA的可靠预测与定量、环状RNA功能富集分析、环状RNA与微小RNA相互作用预测,以及环状RNA共表达网络的构建。
该简化流程可应用于临床样本,以鉴定宿主与病原体相互作用环境中的特定候选分子及其诊断和预后价值。我预计此前无编程经验的研究人员在实施该技术的初始阶段会遇到困难。因此,建议学习本技术所用编程语言的基础知识。
我认为,与单纯阅读相比,通常观察编程语言如何应用会更直观且更容易理解。首先,打开一个 Linux 终端,在宿主参考基因组的目录中执行 bwa index 和 hisat2-build 命令以对基因组进行索引。准备一个 yml 配置文件,其中包含文件名、工具路径、已下载参考文件的路径以及索引文件的路径。
指定RNA测序数据的文库类型,并使用默认参数或手动参数运行Ciriquant工具。准备一个文本文件,其中包含RNA测序数据的ID、Ciriquant输出的GTF文件路径,以及RNA测序数据的分组信息(对照组或处理组)。在Linux终端中,以准备好的文本文件作为输入,运行prep_Ciriquant。
此次运行将生成一个文件列表。准备第二个文本文件,其中包含数据列表,包括RNA序列ID及其对应的StringTie输出文件路径。该文件的布局必须与之前准备的文本文件类似,但无需包含分组列的运行信息。
使用此文本文件作为输入运行 prepde.py,以生成基因计数矩阵文件。使用 library_info 执行 Ciri_DE_Replicate。
以 csv、circRNA_BSJ.csv 和 gene_count_matrix.csv 文件作为输入,输出最终的 circRNA_DE。
tsv 文件。为了筛选并确定差异表达(DE)的 circRNA 数量,可使用 R 或其他任何电子表格软件打开 circRNA_DE.tsv 文件。
从 CircR 的 GitHub 页面下载 CircR 文件后,使用 WinRar 或 7-Zip 等相应软件将其解压并提取内容,存放到用于开展分析的新目录中。在进行 circRNA miRNA 分析之前,需先安装 SAMTools、miRanda、RNAhybrid 和 Pybedtools 等必需的软件程序。
使用 SAMtools FAIDX 命令对目标生物的参考基因组文件建立索引,并准备一个包含感兴趣差异表达环状 RNA(DE circRNAs)坐标的制表符分隔的 bed 文件作为输入文件。接着,使用 Python3 执行 Circr.py。
参数需在命令行中指定 circRNA 输入文件、目标生物的参考基因组、所选生物的基因组版本、线程数以及输出文件的名称。Circr 分析完成后,程序将输出一个以 CSV 格式保存的 circRNA-miRNA 相互作用文件。请准备一个以制表符分隔的文件,包含感兴趣的 circRNA 及其靶向的 miRNA。
第一列为 circRNA 名称。第二列指明第一列 RNA 的类型。第三列为靶向的 miRNA。
第四列指定了第三列中RNA的类型。要构建ceRNA网络图谱,请打开Cytoscape软件,依次点击文件、导入、从文件导入网络,选择准备好的文件并上传。然后点击样式按钮,以更改网络的视觉样式。
然后按填充颜色右侧的箭头,为该列选择类型,映射类型选择离散映射,并为每种 RNA 类型选择所需的颜色。接着转到形状设置以更改节点的形状,并按照前面显示的步骤操作。对于 circRNA 来源基因的基因本体论和 KEGG 分析,需确保使用 clusterProfiler 和 org.Hs.eg.
db 软件包已在我们的工作室中安装。将差异表达的 circRNA 信息导入 R studio 工作区。如果用户希望将亲本基因名称转换为其他格式,例如 entrezid,可使用类似 bidder 的函数。
使用基因 ID 作为输入,利用 clusterProfiler 软件包中的 enrichGO 函数并采用默认参数进行基因本体(gene ontology)富集分析。最后,以基因 ID 作为输入,使用 clusterProfiler 软件包中的 enrichKEGG 函数进行 KEGG 富集分析。本图展示了差异表达 circRNA 来源基因的基因本体富集分析气泡图。
横轴上的基因比例是指输入列表中与特定基因本体术语相关的基因数量除以该术语中基因的总数。图中圆点的大小由计数值表示,即输入列表中与特定基因本体术语相关的基因数量。圆点越大,表示与该术语相关的输入基因数量越多。
图中的点根据 p 值进行颜色编码,p 值是通过比较某个注释术语的观测频率与随机预期频率计算得出的。只有当 p 值小于 0.01 时,富集结果才具有统计学显著性,并被绘制在气泡图中。此处,生物过程方面富集最显著的前三项包括核糖核蛋白复合物的生物合成、对病毒的响应以及对生物刺激响应的调控。
在分子功能方面,仅有作用于RNA的催化活性和单链RNA结合在统计学上显著富集。在细胞组分方面,仅有逆向转运复合体在统计学上显著富集。该代表性图像以气泡图形式展示了差异表达环状RNA亲本基因的KEGG富集分析结果。
在此情况下,仅有两个 KEGG 通路得到富集,分别为流感 A 和病毒生命周期通路。进行该实验时最重要的步骤之一,是在运行 injury one 时确保所使用的 RNA circ 数据集具有正确的性状类型。本文提供的生物信息学分析流程有助于预测潜在的环状 RNA 及其功能注释。
然而,仍需开展严谨的验证工作以提供可靠的证据。本方案将使研究人员能够发现稳定的RNA及其在不同密码子和病原体相互作用中的潜在功能角色,并可进一步深入研究。
查看完整文字稿并访问数千部科学视频
本方案概述了一种全面的计算机预测和功能表征环状RNA(circRNA)的流程,用于分析宿主-病原体相互作用背景下的RNA测序数据。该流程旨在帮助编程经验有限的新手有效开展环状RNA分析。
利用RNA测序数据进行环状RNA(circRNA)的生物信息学鉴定与表征,有助于在早期发现参与宿主-病原体相互作用的新型调控元件。该计算分析流程可在开展耗资较大的湿实验验证之前,为目标选择和功能注释提供预测可信度。在发现阶段整合circRNA分析,可增强项目筛选能力,并降低后续转化研究的风险。
该方案将环状RNA的发现置于湿实验验证之前,架起了宿主-病原体研究中早期发现与临床前研究之间的桥梁。