方法文章

用于改进真菌病原体 ChIP-seq 与转录组分析的峰识别算法(WonderPeaks 与 PeakStream)

DOI:

10.3791/68301

2025年8月8日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本报告介绍了 WonderPeaks,一种用于分析 RNA-seq 和 ChIP-seq 数据的新型计算工具。该工具能够成功识别测序数据中的峰信号(reads 堆积),从而实现对 RNA-seq 中非翻译区边界的表征,并检测 ChIP-seq 中的染色质富集,为真菌病原体研究提供有价值的见解。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

通过转录组学和转录调控因子活性分析基因表达变化,已成为理解真菌致病过程中多种响应机制的基本方法。本文介绍了两种计算工具,旨在解决在研究真菌病原体(特别是基因组注释有限的非模式 真菌)转录调控中的关键挑战。首先,我们提出WonderPeaks,一种新颖的峰识别算法,该算法利用来自下一代测序(NGS)实验的基因组比对数据的一阶导数,识别染色质免疫沉淀结合测序(ChIP-seq)中的富集峰。其次,我们介绍PeakStream,它是WonderPeaks的扩展工具,用于对采用poly(A)引物文库构建方法生成的转录组数据中的3'非翻译区(UTRs)进行注释。这两个工具共同构成了一个端到端的数据分析流程,为研究真菌转录调控的研究人员提供了一种用户友好的解决方案。我们以真菌病原体Candida albicans的数据为例,验证了这些工具的有效性,成功识别出ChIP-seq数据中已验证的峰,并通过与相同条件下总RNA测序数据的比较,注释了经过验证的UTRs。我们还讨论了WonderPeaks在ChIP-seq数据分析中相较于当前先进方法的局限性,并提出了未来改进的方向。最终,本研究为研究转录调控提供了实用的指导和强大的资源,不仅对致病性真菌研究具有直接意义,也具有广泛基因组研究的潜在应用价值。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

真菌病原体已成为一个新兴的全球健康问题,近年来感染病例不断上升1。许多此类病原体表现出高度抗真菌耐药性,并与较高的死亡率相关2。然而,与模式真菌生物相比,许多致病性真菌仍缺乏充分表征,凸显了进一步研究其致病机制的必要性。染色质免疫沉淀测序(ChIP-Seq)和RNA测序(RNA-Seq)等新一代测序(NGS)技术在揭示真菌致病性相关基因表达分子机制方面发挥着关键作用。

从NGS数据中获得的分析结果的质量在很大程度上取决于用于原始数据分析的软件的准确性。NGS数据分析面临的关键挑战之一是峰识别(peak calling)——即准确鉴定NGS读段富集的区域——由于文库制备和测序技术种类繁多,这一过程尤为复杂,难以实现通用解决方案。MACS算法3(包括其较新版本MACS3)被广泛认为是分析ChIP-seq数据集的金标准。然而,MACS依赖于用户定义的参数——例如最小峰长度和最大间隔——这些参数可能不具备普适性,且通常在分析前难以确定。值得注意的是,最新的MACS3版本包含一种截断分析(cut-off analysis)功能,允许用户在峰识别前估算参数。为了提升性能,用户还可以提供一份“黑名单”基因组区域列表,这些区域因染色质结构或拷贝数变异可能引入偏差。尽管MACS仍是ChIP-seq数据分析中最常用且最受信赖的峰识别工具,但可供选择的替代算法仍较少,尤其是在需要高度定制化参数设置的情况下。

RNA-Seq 是研究病原性真菌在不同条件下基因表达响应的宝贵技术 体内 生长,例如在组织培养或小鼠感染模型中4,5,6,7在这些条件下,准确的差异表达分析需要较高的测序深度,这可能在成本和资源上具有较高要求8,9文库制备方法如基于多聚腺苷酸化(poly(A))引物的测序(3'RNA-Seq),利用设计用于与mRNA的poly(A)尾退火的引物进行cDNA合成,可有助于减少基因表达分析所需的测序深度10然而,这种方法依赖于高质量的基因组注释,尤其是位于3'非翻译区(UTRs)的注释,因为多聚腺苷酸化引物事件产生的峰通常位于这些区域。11许多研究不足的真菌病原体的基因组注释中缺乏任何非翻译区(UTR)注释,这使得在这些生物体中应用3'RNA-Seq技术变得困难。此外,单个基因的UTR长度在不同的生长条件和细胞类型中可能具有动态变化。12,13尽管已开发出多种用于识别和注释UTR的新分析工具,但其中许多工具是针对哺乳动物数据集设计的,而哺乳动物的基因结构与真菌存在显著差异;此外,这些工具往往需要来自独立测序实验(如单细胞测序或逆转录mRNA测序)的数据,这会增加研究人员进行转录组分析所需的时间和成本12,14,15.

本文介绍了WonderPeaks,一种基于一阶导数原理设计的新型峰识别软件,可用于动态识别NGS数据集中的峰信号(图1)。WonderPeaks通过计算覆盖度信号的一阶导数,并利用该值——即峰的斜率——来定义潜在的峰。该算法会搜索一阶导数在用户设定或数据推断的斜率阈值以上出现局部最大值(表示信号上升)后,紧接着在同一阈值以上出现局部最小值(表示信号下降)的情况,从而检测数据集中的所有候选峰。在ChIP-seq应用中,WonderPeaks通过比较实验组与对照组样本之间的所有候选峰,识别出特异性富集的峰。我们将WonderPeaks应用于先前发表的白色念珠菌(Candida albicans)转录因子ChIP-seq数据集16,结果表明该软件能够成功识别出原始研究中关键基因上游的峰信号,同时我们也讨论了该算法在此类应用中的当前局限性。

我们还介绍了 PeakStream,这是一种利用 WonderPeaks 在 3'RNA-Seq 数据集中识别峰的软件工具。3'RNA-Seq 文库依赖于准确的 3' 非翻译区(UTR)注释,因为通过 poly(A) 引物生成的读段通常会延伸至基因编码序列(CDS)终止密码子之外,因此在仅关注编码区域的标准注释下,这些读段往往未被计入。PeakStream 分析流程旨在利用 3' RNA-Seq 数据创建新的基因组注释,重点关注基因编码序列(CDS)区域下游的区域。PeakStream 将这些峰分配给相应基因,生成可用于下游读段计数程序的新基因组注释。我们证明,在 3'RNA-Seq C. albicans 数据集中,使用 PeakStream 能够准确识别并将下游由 poly(A) 产生的峰正确分配给对应的基因。PeakStream 还可注释那些不太可能与任何现有基因注释相关联的峰,有助于发现潜在的新转录本。综上所述,PeakStreamWonderPeaks 构成了一套功能强大且用户友好的工具组合,适用于新一代测序(NGS)数据集中的峰检测。

使用一阶导数的NGS峰检测示意图;ChIP-Seq和3'非翻译区注释方法及数据分析。
图1:WonderPeaks和PeakStream进行峰检测的概览图。左侧:使用一阶导数进行峰检测。右上方:使用WonderPeaks对ChIP-Seq数据集进行峰检测。右下方:使用PeakStream对RNA-Seq数据集进行峰检测。请点击此处查看此图的放大版本。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 安装(如已完成可跳过

  1. 先决条件
    1. 安装 Anaconda 或 Miniconda 以加载运行预处理(第 5 节)和 WonderPeaks(第 6 节或第 7 节)所需的依赖项。
      注意:有关 Anaconda 的用户指南,请参见参考文献16.
    2. 安装 Python:通过 Anaconda 或 Miniconda 安装 Python。
    3. 安装 Jupyter Notebook 以执行本方法中的所有函数。
      注意:Jupyter Notebook 的初学者用户指南见参考文献17.
      注意:对于真菌基因组(≤100 Mbp),应确保计算环境至少具备 20 个核心、8 GB 内存和 30 GB 可用磁盘空间。
  2. 安装预处理函数。
    1. 在终端中执行: conda create -n WP_preprocessing
    2. 在终端中执行: conda activate WP_preprocessing
    3. 在终端中执行: conda env update --file environment.yml --name <当前环境名称>
      注意: environment.yml 是一个包含所有软件包依赖项的文件,应从 https://github.com/mgarber21/WonderPeaks_preprocessing.git 下载。
    4. 在终端中执行: pip install WonderPeaks-preprocessing
    5. 在终端中执行: conda deactivate WP_preprocessing
  3. 安装 WonderPeaks 函数:
    1. 在终端中执行: conda create -n WonderPeaks
    2. 在终端中执行: conda activate WonderPeaks
    3. 在终端中执行: conda env update --file environment.yml --name <当前环境名称>
      注意: environment.yml 是一个包含所有软件包依赖项的文件,应从 https://github.com/mgarber21/WonderPeaks.git 下载。
    4. 在终端中执行: pip install WonderPeaks
    5. 在终端中执行: conda deactivate WonderPeaks
      注意:步骤 1.2 和 1.3 实现以下目的:它们 创建 为预处理(第5节)和WonderPeaks(第6节和第7节)创建一个独立的Conda环境,以隔离依赖关系,避免与其他软件产生冲突。他们 激活 环境,为其安装和运行 WP_preprocessing 或 WonderPeaks 特定功能做好准备。它们 安装 预处理数据所需的软件依赖项和工具。它们 失活 不使用时应关闭环境,以防止意外修改并释放系统资源。
  4. 从 WonderPeaks GitHub 仓库下载 Jupyter Notebook 文件和模板。将下载的 WonderPeaks 文件上传至包含原始数据的操作系统中(目录将在第 2 节中创建)。
    注意:Jupyter Notebook 包含运行预处理、WonderPeaks 和 PeakStream 工作流程所需的预编写脚本和模板。将其上传至与原始数据相同的系统,可确保路径和目录正确对齐。

2. 创建数据目录

注意:WonderPeaks 和 PeakStream 工作流程要求所有数据(原始数据和已处理数据)均存储在同一目录中。此步骤说明如何创建该新目录({data_directory} = /path/to/your/data),以及如何将实验原始数据(未处理的测序读段)移至该目录中名为 raw_data 的文件夹内。

  1. 创建一个数据目录。
    1. 在终端中执行 mkdir {data_directory}(例如 mkdir /path/to/your/data
  2. 为未处理的测序读段创建一个原始数据子目录。
    1. 在终端中执行 mkdir {data_directory}/raw_data(例如 mkdir /path/to/your/data /raw_data
  3. 将未处理的测序读段移至原始数据目录。
    1. 在终端中执行 mv {current_path_to_raw_data}/*fastq* {data_directory}/raw_data(例如 mv current/data/path/*fastq* /path/to/your/data /raw_data

3. 创建用户输入文件(NGS_user_input.csv)

注意:输入文件指定了用户生成的用于运行预处理和 WonderPeaks 的配置。

  1. 从 WonderPeaks GitHub 仓库下载模板文件 NGS_user_inputs.csv
  2. 更新 NGS_user_inputs.csv 中的字段,具体如下:
    数据目录:/path/to/your/data
    基因组目录:/path/to/your/genome
    基因组 fasta 文件:genome.fasta
    基因组注释:genome_annotation.gtf(提供 GTF 格式的基因组注释文件名)
  3. 将更新后的 NGS_user_inputs.csv 保存到第 2 节中创建的数据目录中。
    警告:请勿更改文件名;只有命名为 NGS_user_input.csv 时,WonderPeaks 才能识别该文件。

4. 创建元数据文件(NGS_user_metadata.csv)

注意:元数据文件用于存储与实验相关的任何信息。可以添加额外的列来描述实验条件,但这些列不会影响后续步骤。

  1. 下载模板 NGS_user_metadata.csv 来自 WonderPeaks GitHub 仓库。
  2. 更新字段 NGS_user_metadata.csv 字段如下:
    1. 文件:确保文件名中不含空格,包含文件扩展名(例如 fastq、fastq.gz),且不包含绝对路径。
    2. bedgraph:通过将此字段设置为以下选项之一,指定是否应在 PeakStream 中包含该文件 真实 错误.
      1. 设定 bedgraph 领域到 错误 当文件可以合理地从 PeakStream 分析中排除时。例如,在 RNAseq 实验中,对于突变体或其他样本间预期不存在 UTR 差异的情况,将 bedgraph 参数设置为 bedgraph=FALSE。但务必设置 bedgraph 领域到 真实 所有 对照文件RNA测序 实验和用于 所有文件 在一个 ChIPseq 实验
    3. 设计因子
      1. 设计因子1:指定一个与实验设计相关的因素(例如, 治疗 样本类型).
      2. 设计因子2:指定一个与实验设计相关的第二个设计因素(例如, 菌株 表位)。对于一个 RNA测序 实验,包括 治疗 菌株 作为典型的设计因素。 治疗 列中列出所应用的处理方式(例如,对照、药物1),以及 菌株 列中列出菌株信息(例如,野生型、突变体)。对于一个 ChIPseq 实验,包括 样本类型 表位 作为典型的设计因素。该 样本类型 列说明蛋白是否带有标签,表位列则列出表位的名称 表位 使用。
        注意: 设计因素 是实验设计特有的属性。
        WonderPeaks 可兼容无标签对照或输入对照作为基线。
      3. 确保设计因子列 不要 包括独特的重复编号(例如,sample_type:[tagged, tagged, untagged_control, untagged_control],而非 sample_type:[tagged_1, tagged_2, untagged_control_1, untagged_control_2])。在运行过程中提供独特的重复编号将导致错误。
      4. 请务必使用下划线(_)_在设计因子名称中使用下划线(_)而非空格。
      5. 对于ChIPseq应用,确保 样本类型 (或自定义名称)列中的元数据文件包含含有词语的术语 标签 对照.
        注意:例如,有效条目可包括 标记的 未标记对照组提供一个 样本类型 缺少这些术语的列将在运行过程中导致错误。
        注意:对于染色质免疫沉淀(ChIP)应用,用户必须指定两个 设计因素.
      6. 将设计因素添加到相应行中 NGS_user_inputs.csv确保用于设计因子的列名以分号分隔的字符串形式列出(例如, 处理;菌株或样本类型;表位).
        注意:设计中的因素 NGS_user_inputs.csv 必须匹配列 NGS_user_metadata.csv 完全正确。任何不匹配的运行都会在运行过程中导致错误(图2, 补充表 S1, 补充表 S2).

转录组学元数据表;ChiP-Seq样本类型、细胞类型注释、数据文件路径。
图2:NGS_user_input.csv 和 NGS_user_metadata.csv 示例。 NGS_user_input.csv(上图)和 NGS_user_metadata.csv(下图)的示例,用粉红色或蓝色文字及箭头突出显示 designfactor 列与 designfactor 列之间的对应关系。请点击此处查看此图的放大版本。

5. NGS 数据预处理

注意:如果使用自定义预处理,请跳至第5节或第6节。

  1. 打开NGS预处理Jupyter笔记本(NGS_Preprocessing.ipynb)。
  2. 在笔记本界面的右上角激活 WP_preprocessing 环境(在步骤1.2中创建)。
  3. 通过按住 Shift键 然后按下 Enter Shift+Enter)来执行第一个单元格。
  4. 在Jupyter笔记本的第二个单元格中,通过设置 Directory = "path/to/your/data" 来更新目录路径,其中 path/to/your/data/ 是在 第2节 中创建的目录。
  5. 生成比对文件。预处理函数将使用 FastP18 进行 剪切;使用 FastQC19MultiQC20 进行 质量控制;使用 STAR21 进行 比对。输出的比对文件将保存到数据目录下的一个名为 startout 的子目录中(例如:path/to/your/data/starout);使用 samtools view22 进行 过滤可选),将比对文件过滤为仅保留高于 NGS_user_inputs.csv 中指定阈值的读段。
    注意:这些函数一次仅处理数据集的单端读段(例如R1)。用户可在 NGS_user_inputs.csv 中指定 FastP STAR 的运行选项(例如:FastP:adapter_sequence(可选);STAR:genomeDir, genomeFastaFiles, sjdbGTFfil)。
  6. 使用 Shift + Enter 执行第二个单元格中的预处理函数。
    注意:第二个单元格中的任务可能需要数小时才能完成。如果运行中断,请重复步骤5.3–5.6以重新启动运行。先前步骤的进度不会被覆盖,过程将从中断处继续。
  7. 使用 BamCoverage23 生成比对覆盖度的轨迹文件(参见步骤5.7.1和5.7.2)。
    注意:对于 ChIPseq,WonderPeaks需要包含正链和反链读段覆盖度的单个bedgraph文件。对于采用Poly(A)引物的 RNAseq,PeakStream需要两个bedgraph文件,分别对应正链读段(_fwd.bedgraph)和反链读段(_rev.bedgraph)。正链和反链读段由 BamCoverage23 中的 filterRNAstrand 参数生成。
    1. 使用以下参数进行ChIPseq分析:outfilfeformat="bedgraph",strand=None,binsize=20,smoothLength=60,minMappingQuality=255,normalizeUsing="CPM"。
      注意:输出:生成包含正链和反链读段覆盖度的单个bedgraph文件。输出结果存储在 /path/to/your/data/bedgraphout 图3)。
      1. 使用 Shift + Enter 在第三个单元格中执行 BamCoverage 函数。
    2. 使用以下参数进行RNAseq分析:outfilfeformat="bedgraph",strand="forward" 或 "reverse",binsize=20,smoothLength=60,minMappingQuality=255,normalizeUsing="CPM"。
      警告:请务必分别将strand设置为forward和reverse各执行一次函数,以生成两个方向读段的文件。
      注意:输出:生成两个bedgraph文件:一个用于正链读段(_fwd.bedgraph),另一个用于反链读段(_rev.bedgraph)。输出结果存储在 /path/to/your/data/ bedgraphout(图3)。
      1. 使用 Shift + Enter 在第三个单元格中执行 BamCoverage 函数。

ChIP-seq 数据分析目录,使用 CPM 方法标准化的 bedgraph 文件,生物信息学设置。
图 3:WonderPeaks 的文件组织。 数据文件夹的截图,其中包含位于目录 bedgrapghout/normalizeUsingCPM 中的 bedgraph 文件。请点击此处查看该图的放大版本。

6. ChIPseq 的 WonderPeaks

  1. 预检
    1. 确认所有具有文件句柄的 bedgraph 文件 .bedgraph 位于数据目录中名为的子目录内 bedgraph输出 (图3).
    2. 确认 设计因素 在 user_inputs 文件中NGS_user_inputs.csv) (图2)与元数据文件中的列相匹配NGS_user_metadata.csv)且设计因子列的行不唯一(参见 注意 在步骤 4.2.4 中)。
  2. 打开NGS预处理Jupyter Notebook(WP4ChIP.ipynb).
  3. 激活 WonderPeaks (在步骤 1.3 中创建的环境)位于笔记本界面的右上角。
  4. 使用以下命令执行细胞操作 Shift+Enter 直到断点处以运行峰检测。完成后,处理数据的记录将被保存并存储在数据目录内名为 WonderPeaks
    1. 寻找 WOnder_init.csv:所有原始覆盖度及其一阶导数计算结果的串联。
    2. 注意 WOnder_未过滤峰.csv:基于一阶导数检测到的所有未过滤峰的合并。
    3. 观察 bedgraph_summary.csv:在对每个文件和染色体进行分组后,得分统计信息的汇总。
  5. 定义运行参数:
    1. 运行 1st markdown 分隔符下方的细胞
      注意:该图显示按指定条件分组的原始数据 设计因素 以及一个显示设计因子的表格将会弹出;请使用该表格和图表确定后续步骤中的数值(图4).
    2. 在下一个单元格中,指定以下值: 评分截断值,倍数变化 设计因子 (图4).
      1. 评分阈值 是用于确定峰是否被纳入输出结果的阈值。为确定 score_cut,需观察图表,并选择一个接近标记数据中位数的值(参见虚线所示)。 图4)。按如下方式输入该值: score_cut=值.
      2. fold_change 是用于判断峰是否为真实峰的标记与未标记比值分数的阈值。为确定倍数变化(fold_change),请观察图表,并选择一个高于未标记数据与标记数据中位数比值的数值。按如下方式输入该值: fold_change= 值.
      3. 设计因子值 是实验设计的一部分。可能的设计因素列于 红色 在打印的表格中。为确定设计因子,请选择红色列出的数值之一。将该值用引号括起后输入,格式如下: designfactor_value ="{ value}".
  6. 运行下一个单元格 Shift + Enter 进行峰过滤和峰映射分析。数据和汇总图将存储在数据目录中名为 WonderPeaks.
    1. 观察 {designfactor_value}_标记与未标记.csv所有重叠峰的透视表,每列对应一个带标签和无标签的样本。
    2. 注意 {designfactor_value}_所有带标签的峰.csv:基于用户参数的所有真实峰的汇总表(步骤 6.5)。
    3. 观察 {designfactor_value}_peaks2gtf.csv基于用户参数(步骤 6.5)将实际峰位映射到用户指定注释文件中的基因。
  7. 可选:通过重新执行步骤 6.5–6.6 来切换步骤 6.5 中的参数。如果使用相同的 设计因子值在步骤6.6中所述生成的文件将被覆盖。

使用数据表进行代码和图形分析,重点关注数据处理中峰标记的参数。
图 4:ChIP-seq 分析中 WonderPeaks 工具的 designfactor_value 和用户自定义阈值设置界面截图。 WonderPeaks Jupyter Notebook 的截图,展示了表格中可选的 designfactor_value 选项,以及如何在下一个代码单元格中应用该值。顶部黑色箭头指向显示可能 designfactor_value 取值的表格;其中 Op 值被圈出,并作为用户在选项单元格中选定的 designfactor_value 输入(底部黑色箭头所示)。在图中,实线和虚线分别表示不透明细胞实验中已标记样本和未标记样本的近似中位峰得分。这些中位数用于定义 score_cut 参数(已标记样本的中位数)和 fold_change 参数(已标记与未标记样本中位数的比值)。请点击此处查看该图的放大版本。

3'RNA测序的PeakStream

  1. 预检查:
    1. 确认所有 bedgraph 文件均位于数据目录下的一个名为 bedgraphout 的子目录中(图 2)。
    2. 打开 NGS 预处理 Jupyter Notebook(PeakStream.ipynb)。
    3. 在笔记本界面的右上角激活 WonderPeaks 环境(该环境在步骤 1.3 中创建)。
  2. 使用 Shift+Enter 依次执行单元格,直至运行峰值识别和峰值比对的断点。执行完成后,将生成一个新的注释文件,其中包含预测的 3' UTR 以及 FeatureCounts24 的读段计数文件,并保存至数据目录下名为 PeakStream 的子目录中(图 5)。
    ​注意:默认情况下,输出文件仅包含蛋白质编码生物类型的注释,但可通过 biotype 选项进行切换。

PeakStream 初始化代码,用于基因组数据分析中特征计数的 Python 脚本。
图 5:PeakStream 的文件组织结构。显示数据文件夹的截图,其中 bedgraph 文件位于 bedgrapghout 目录中。请点击此处查看该图的放大版本。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

WonderPeaks
在完成 ChIP-seq 实验后,研究人员通常使用峰值识别软件(如 MACS3)来鉴定由表位标签标记的 DNA 结合蛋白富集的基因组区域。我们开发了 WonderPeaks,作为一种用户友好的峰值识别工具,旨在利用上述方法识别峰值。

WonderPeaks 通过首先计算覆盖度的一阶导数来识别峰,并利用该值(峰的斜率)定义潜在的峰。随后,算法搜索一阶导数中存在局部最大值且高于用户设定的斜率阈值(表示评分上升)的情况,紧接着出现同一阈值以上的局部最小值(表示评分下降)。每个峰的中心位置被计算为一阶导数局部最小值与最大值之间的中点。若不同样本间的峰彼此间距在 120 bp 以内,则将这些峰归为一组,其最终位置取该组峰平均位置的中心点。在一阶导数计算完成后,使用文件和染色体内部覆盖度的第 75 百分位数对峰进行过滤,以消除基线噪声。通过上述步骤,算法将测试样本和对照样本中所有可能峰的汇总信息保存为一个摘要文件(WOnder_unfiltered_peaks.csv)。我们注意到...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

新一代测序(NGS)技术为研究真菌病原体中的基因调控和表达提供了前所未有的洞察力。因此,计算工具必须既全面——能够捕获实验中产生的全部数据——又易于普通用户(尤其是实验人员)使用。在本报告中,我们介绍了两种工具,WonderPeaks 和 PeakStream,它们分别满足了真菌病原体研究人员在 ChIP-seq 和 RNA-seq 工作流程中的这些需求。

WonderPeaks 是一种用户友好的 ChIP-seq 实验峰识别分析流程。与广泛使用的 MACS 相比,WonderPeaks 成功识别了在高富集样本(不透明细胞类型中的 Wor4)和低富集样本(白色细胞类型中的 Wor4)中由 MACS 检测到的峰,并且还发现了 MACS 未能识别的新峰。WonderPeaks 算法基于一阶导数的优势在于,它能够在参数设置极少的情况下调用数据集中所有可能的峰,并依据生物学上合理的标准进行系统性过滤。换句话说,该算法模拟了人类通过视觉判断来评估峰有效性的过程。

目前,WonderPeaks 在 ChIP-seq 数据的峰识别方面尚未优...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明无利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本工作得到了美国国立卫生研究院(NIH)基金项目 RO1AI175080 和 R01GM037049(授予 Alexander D. Johnson)以及 NIH T32 培训基金项目 T32 AI 60537-20(授予 H.G)的支持。我们感谢 Alexander Johnson、Matthew Lohse、Jenny Zhang 和 Brian Wang 提供有益的讨论和建议。同时感谢 Carol Gross 实验室成员的反馈意见。我们感谢 Ananda Mendoza 提供的技术支持。测序工作在加州大学旧金山分校(UCSF)CAT 平台完成,该平台由 UCSF PBBR、RRP IMIA 以及 NIH 1S10OD028511-01 基金项目资助。我们承认使用了 OpenAI 的 ChatGPT 来协助排查代码问题,并为稿件修改提供建议。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
CORALL 总RNA-seq V1试剂盒Lexogen095湿实验材料 
丝状真菌核糖体RNA去除试剂(Filamentous-Fungi riboPOOL)siTOOLsdp-P096-6湿实验材料 
高灵敏度RNA ScreenTapeAgilent5067-5579湿实验材料 
高灵敏度RNA ScreenTape LadderAgilent5067-5581湿实验材料 
高灵敏度RNA ScreenTape样本缓冲液Agilent5067-5580湿实验材料 
https://github.com/mgarber21/WonderPeaks/blob/main/environment.ymlWonderPeaks依赖项列表
https://github.com/mgarber21/WonderPeaks_preprocessing/blob/main/environment.ymlWonderPeaks_preprocessing依赖项列表
Monarch Spin RNA纯化试剂盒NEBT2040L湿实验材料 
pygenometracks (3.9)
QuantSeq 3′ mRNA-Seq FWD文库构建试剂盒 V1Lexogen015湿实验材料 
Qubit RNA高灵敏度(HS)检测试剂盒InvitrogenQ32852湿实验材料 
RNA Clean & Concentrator-5Zymo ResearchR1016湿实验材料 
TURBO DNA-free试剂盒ThermoFisherAM1907湿实验材料 
WonderPeaks(0.1.14)
WonderPeaks_preprocessing(0.2.3)

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. fungal priority pathogens list to guide research, development and public health action. , WHO. https://www.who.int/publications/i/item/9789240060241 (2022).
  2. Fisher, M. C., Denning, D. W. The WHO fungal priority pathogens list as a game-changer. Nat Rev Microbiol. 21 (4), 211-212 (2023).
  3. Gaspar, J. M. Improved peak-calling with MACS2. bioRxiv. 496521, (2018).
  4. Muñoz, J. F., et al. Coordinated host-pathogen transcriptional dynamics revealed using sorted subpopulations and single macrophages infected with Candida albicans. Nat Commun. 10 (1), 1607(2019).
  5. Miramón, P., Pountain, A. W., Lorenz, M. C. Candida auris-macrophage cellular interactions and transcriptional response. Infect Immun. 91 (11), e0027423(2023).
  6. Lindemann-Perez, E., Rodríguez, D. L., Pérez, J. C. An approach to analyze spatiotemporal patterns of gene expression at single-cell resolution in Candida albicans-infected mouse tongues. mSphere. 9 (9), e0028224(2024).
  7. Mo, X., et al. In vivo RNA sequencing reveals a crucial role of Fus3-Kss1 MAPK pathway in Candida glabrata pathogenicity. mSphere. 9 (11), e0071524(2024).
  8. Haas, B. J., Chin, M., Nusbaum, C., Birren, B. W., Livny, J. How deep is deep enough for RNA-Seq profiling of bacterial transcriptomes. BMC Genomics. 13, 734(2012).
  9. Zaheer, R., et al. Impact of sequencing depth on the characterization of the microbiome and resistome. Sci Rep. 8 (1), 5890(2018).
  10. Xiong, Y., et al. A comparison of mRNA sequencing with random primed and 3′-directed libraries. Sci Rep. 7 (1), 14626(2017).
  11. Ma, F., et al. A comparison between whole transcript and 3' RNA sequencing methods using Kapa and Lexogen library preparation methods. BMC Genomics. 20, 9(2019).
  12. Fansler, M. M., Mitschka, S., Mayr, C. Quantifying 3′UTR length from scRNA-seq data reveals changes independent of gene expression. Nat Commun. 15 (1), 4050(2024).
  13. Tuch, B. B., et al. The transcriptomes of two heritable cell types illuminate the circuit governing their differentiation. PLoS Genet. 6, e1001070(2010).
  14. Shenker, S., Miura, P., Sanfilippo, P., Lai, E. C. IsoSCM: improved and alternative 3′ UTR annotation using multiple change-point inference. RNA. 21 (1), 14-27 (2015).
  15. Haese-Hill, W., Crouch, K., Otto, T. D. peaks2utr: a robust Python tool for the annotation of 3′ UTRs. Bioinformatics. 39 (3), btad112(2023).
  16. Anaconda - Getting started. , https://docs.anaconda.com/anaconda/getting-started/ (2025).
  17. Pryke, B. Jupyter Notebook tutorial. , https://www.dataquest.io/blog/jupyter-notebook-tutorial/ (2025).
  18. Chen, S., Zhou, Y., Chen, Y., Gu, J. fastp: an ultra-fast all-in-one FASTQ preprocessor. Bioinformatics. 34 (17), i884-i890 (2018).
  19. Andrews, S. FastQC: a quality control tool for high throughput sequence data. , https://www.bioinformatics.babraham.ac.uk/projects/fastqc/ (2010).
  20. Ewels, P., Magnusson, M., Lundin, S., Käller, M. MultiQC: summarize analysis results for multiple tools and samples in a single report. Bioinformatics. 32 (19), 3047-3048 (2016).
  21. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  22. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), giab008(2021).
  23. Ramírez, F., et al. deepTools2: a next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44 (W1), W160-W165 (2016).
  24. Liao, Y., Smyth, G. K., Shi, W. featureCounts: an efficient general purpose program for assigning sequence reads to genomic features. Bioinformatics. 30 (7), 923-930 (2014).
  25. Lohse, M. B., Johnson, A. D. Identification and characterization of Wor4, a new transcriptional regulator of white-opaque switching. G3 (Bethesda). 6 (3), 721-729 (2016).
  26. Nagalakshmi, U., et al. The transcriptional landscape of the yeast genome defined by RNA sequencing. Science. 320 (5881), 1344-1349 (2008).
  27. Diaz, A., Park, K., Lim, D. A., Song, J. S. Normalization, bias correction, and peak calling for ChIP-seq. Stat Appl Genet Mol Biol. 11 (3), Article 9(2012).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

ChIP Seq WonderPeaks PeakStream 3
视频即将推出

相关文章