2021年5月28日
本实验方案的目的是利用RNA测序数据研究候选基因的进化与表达。
本方案概述了研究候选基因分子进化与表达的生物信息学步骤。本文提供了详细的指导,使任何具备最少生物信息学经验的研究人员均可顺利执行该方案。此分析流程可应用于任何生物体及任何基因家族。
进行生物信息学分析时,一个常见问题是shell脚本运行失败。在执行本方案时,请确保使用最新版本的软件,仔细阅读错误文件,并认真查阅使用手册。首先,在终端或PuTTY应用程序窗口中登录计算机集群账户。
在终端中,使用 Wget 下载 SRA Toolkit 2.8.1 版本,然后完成程序的安装。在 NCBI 中搜索所需样本的 SRA 登录号,随后在终端窗口中获取 RNA 测序数据。对于双端测序文件类型,获取两个 FASTQ 文件。
如果存在参考基因组,可在线查找。要获取参考基因组序列,可在终端窗口中输入 wget 命令,然后粘贴链接地址。如果可获取,还应复制该参考基因组的 GTF 文件和蛋白质 FASTA 文件。
对基因组进行索引,然后比对测序读段并计算每个样本的表达量。将结果文件重命名为具有描述性的名称,并生成一个包含所有计数的矩阵。打开一个互联网浏览器窗口,访问 NCBI GenBank。
在搜索栏中输入目标基因的名称以及已测序的近缘物种的名称。在搜索栏左侧选择“Protein”,然后点击“Search”。通过点击“Send to”,然后选择“File”,来提取序列。
在“格式”中选择 FASTA,然后单击“创建文件”。使用本地终端窗口或 FileZilla 将同源基因的 FASTA 文件传输到计算机集群。接下来,在计算机集群上使用 BLAST+ 搜索候选基因,从基因组或转录组翻译的蛋白质 FASTA 文件中创建 BLAST 数据库。
将来自NCBI的同源基因序列与目标物种的数据库进行BLAST比对,然后使用more命令查看输出文件。从目标物种中复制唯一的基因ID至一个新的文本文件,并提取候选基因的序列。
为了使用双向BLAST验证基因注释,请前往BLAST局部比对搜索工具,选择BLASTP,粘贴候选序列,选择非冗余蛋白序列数据库,然后点击BLAST。打开MEGA软件,点击“Align”,然后选择“Edit/Build Alignment”,选择“Create a new alignment”,并点击“OK”。选择“Protein”。当比对窗口打开后,点击“Edit”。
单击“从文件插入序列”,选择包含候选基因和可能同源基因蛋白质序列的FASTA文件。选择所有序列。找到臂状符号并将其悬停。
应选择使用 MUSCLE 算法进行序列比对。点击手臂图标,然后点击“比对蛋白质”以比对序列,可编辑参数,或直接点击“确定”使用默认参数。本实验方案应用于水螅(Hydra vulgaris)组织,水螅是一种属于刺胞动物门的淡水无脊椎动物。
研究视蛋白基因有助于深入了解动物眼睛和感光机制的演化。从NCBI GenBank中提取了水螅(H.vulgaris)及其他物种的视蛋白相关基因序列,并生成FASTA文件。在MEGA中对视蛋白基因进行比对,从而鉴定出某些水螅视蛋白缺失了与感光分子结合所必需的保守赖氨酸氨基酸。
使用海蜇(Hydra vulgaris)及其他物种的视蛋白序列构建了最大似然树。系统发育分析表明,视蛋白基因在刺胞动物中通过谱系特异性复制进化,且在 H. vulgaris 中可能通过串联重复方式进行复制。接下来,使用 edgeR 进行差异表达分析,以研究视蛋白基因的绝对表达水平。
为了确定一个或多个视蛋白在基盘(即头部)中是否上调,进行了基盘与体柱、出芽区、足部和触手之间的成对比较。研究发现,基盘与体柱之间有1,774个转录本差异表达。通过多个比较分析确定了在多个组织间均上调的基因,并在Blast2GO中进行了功能富集分析。
最后,研究了在芽殖的不同阶段以及再生的不同时间点,不同组织中视蛋白基因的绝对表达水平。通过肉眼观察序列比对结果和系统发育树,可以确认候选基因是否属于目标基因家族。若某些基因的序列差异过大,或形成一个与其他所有基因均不相关的独立分支,则这些基因很可能属于另一个不同的基因家族。
本方案的结果可视为假设生成性的。该流程能够突出候选基因,供后续研究进行功能层面的深入分析。在探究了水螅视蛋白表达后,我们目前正采用类似技术,在不同物种中研究相关基因,以期识别其功能上的相似性与差异性。
查看完整文字稿并访问数千部科学视频
本实验方案利用RNA测序数据研究候选基因的分子进化及其表达,重点关注 Hydra vulgaris 中的视蛋白基因。该研究展示了一种可应用于多种生物的生物信息学分析流程。
该生物信息学分析流程可系统性地研究基因家族的进化与表达,通过在早期发现阶段进行机制性去风险化,支持靶点验证。通过整合系统发育分析与RNA-seq定量,该方法能够预测并增强候选基因的优先级排序信心,识别在不同物种中具有保守或分化功能的基因。该策略有助于在投入资源开展功能研究之前,识别出基于机制的合理假设,从而辅助项目组合的筛选与决策。
该方法可融入从靶点鉴定到先导化合物优化的整个发现流程,能够推动研究从序列分析到功能优先级排序的假设驱动型进展。