方法文章

细菌群体中层级基因型与附属基因组位点的启发式挖掘

DOI:

10.3791/63115

2021年12月7日

* These authors contributed equally

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该分析性计算平台为对细菌群体基因组学感兴趣的微生物学家、生态学家和流行病学家提供了实用指导。具体而言,本文展示了如何进行:i)基于系统发育指导的分层基因型作图;ii)基于频率的基因型分析;iii)亲缘关系与克隆性分析;iv)谱系差异性附属基因座的鉴定。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

细菌全基因组测序(WGS)的常规化和系统性应用正在提升公共卫生实验室和监管机构所开展流行病学调查的准确性和分辨率。大量公开可用的WGS数据可用于在大规模上研究病原菌群体。最近,一个名为ProkEvo的免费计算平台被发布,旨在利用细菌WGS数据实现可重复、自动化且可扩展的基于层级结构的群体基因组分析。本研究中对ProkEvo的应用展示了将标准的群体基因型图谱绘制与附属基因组内容挖掘相结合在生态推断中的重要性。特别是,本工作使用R编程语言,基于ProkEvo生成的结果进行了群体尺度的层级分析。主要目标是为微生物学家、生态学家和流行病学家提供一个实用指南,展示如何:i)使用系统发育指导的层级基因型图谱绘制方法;ii)评估基因型的频率分布以作为生态适应性的代理指标;iii)利用特定的基因型分类来确定亲缘关系和遗传多样性;以及iv)绘制谱系特异性的附属基因座图谱。为了增强分析的可重复性和可移植性,采用了R Markdown文件来完整展示整个分析流程。示例数据集包含了来自人畜共患食源性病原菌Salmonella Newport的2,365个分离株的基因组数据。基于系统发育锚定的层级基因型图谱绘制(血清型 -> BAPS1 -> ST -> cgMLST)揭示了该群体的遗传结构,突出显示序列型(ST)是关键的区分性基因型。在三个最主要的谱系中,ST5与ST118的共同祖先比与高度克隆型的ST45谱系更为接近。基于ST的差异进一步体现在附属的抗菌药物耐药性(AMR)基因座分布上。最后,采用基于系统发育锚定的可视化方法,将层级基因型与AMR内容相结合,揭示了亲缘结构和谱系特异性的基因组特征。综上所述,该分析方法为利用泛基因组信息开展启发式细菌群体基因组分析提供了一些指导原则。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

细菌全基因组测序(WGS)在公共卫生实验室和监管机构的常规监测及流行病学调查中的应用日益广泛,已显著加强了对病原体暴发事件的调查能力1,2,3,4。因此,目前已有大量去标识化的WGS数据公开可用,可用于以前所未有的规模研究病原菌物种的群体生物学特征,包括基于群体结构、基因型频率以及跨多个储存库、地理区域和环境类型的基因/等位基因频率的研究5。最常见的基于WGS的流行病学调查通常仅依赖共享的核心基因组内容进行分析,即仅使用共享(保守)区域进行基因型分类(例如变异位点检测),而这些变异位点则成为流行病学分析和溯源追踪的基础1,2,6,7。通常,基于细菌核心基因组的分型采用多位点序列分型(MLST)方法,所用位点数量从七个到数千个不等8,9,10。这些基于MLST的策略包括将预组装或已完成组装的基因组序列比对至高度审编的数据库,从而将等位基因信息整合为可重复的基因型单元,用于流行病学和生态学分析11,12。例如,基于MLST的分类可在两个分辨率层次上生成基因型信息:较低分辨率的序列型(STs)或ST谱系(7个位点),以及较高分辨率的核心基因组MLST(cgMLST)变异型(约300–3,000个位点)10

基于MLST的基因型分类在计算上具有可移植性,并且在不同实验室之间具有高度可重复性,因此被广泛接受为细菌物种水平以下的一种准确分型方法13,14。然而,细菌种群的结构具有物种特异性的克隆程度差异(即基因型同质性)、基因型之间复杂的等级亲缘关系模式15,16,17,以及附属基因组内容分布上的广泛变异18,19。因此,一种更为整体化的方法应超越对MLST基因型的离散分类,纳入不同分辨率尺度下基因型的层级关系,并将附属基因组内容的分布映射到基因型分类体系中,从而促进基于种群的推断18,20,21。此外,分析还可聚焦于即使亲缘关系较远的基因型之间附属基因组位点的共同遗传模式21,22。总体而言,这种综合方法能够无偏地探究种群结构与特定基因组组成(例如,基因位点)在地理空间或环境梯度上的分布之间的关系。该方法可提供有关特定种群生态特征的基础性和实用性信息,进而解释其在不同储存宿主(如食品动物或人类)中的嗜性及传播模式。

这种基于系统的、分层的、以群体为导向的方法需要大量的全基因组测序(WGS)数据,以获得足够的统计学效力来预测可区分的基因组特征。因此,该方法需要一个能够同时处理成千上万个细菌基因组的计算平台。最近开发的ProkEvo是一个免费、自动化、可移植且可扩展的生物信息学平台,支持基于分层整合的细菌群体分析,包括泛基因组作图20。ProkEvo支持对中等到大规模细菌数据集的研究,同时提供一个框架,使用户能够生成可验证和可推断的流行病学、生态学假设以及表型预测,并可根据需要进行自定义。本研究作为该流程的补充,提供了一份操作指南,介绍如何将ProkEvo生成的输出文件作为输入,用于分层群体分类和附属基因组挖掘的分析与解读。本研究以动物源性血清型Salmonella enterica谱系I中的S. Newport群体为例,旨在为微生物学家、生态学家和流行病学家提供实用指导,具体包括:i)使用自动化的、依赖系统发育的方法绘制分层基因型图谱;ii)评估基因型的频率分布,作为评价生态适应性的代理指标;iii)采用独立的统计方法确定谱系特异性的克隆化程度;iv)绘制谱系差异性耐药(AMR)位点,作为在群体结构背景下挖掘附属基因组内容的示例。更广泛而言,该分析方法提供了一个可推广的框架,能够在适用于推断进化和生态模式的规模上开展基于群体的基因组分析,而不限于特定目标物种。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 准备输入文件

注意:该实验方案可在此处获取 - https://github.com/jcgneto/jove_bacterial_population_genomics/tree/main/code。 本方案假设研究人员已专门使用 ProkEvo(或类似流程)生成了所需的输出文件,这些文件可在 Figshare 仓库中获取(https://figshare.com/account/projects/116625/articles/15097503 - 需登录凭证 - 用户必须创建免费账户方可访问文件!)。值得注意的是,ProkEvo 可自动从 NCBI-SRA 仓库下载基因组序列,仅需提供一个包含基因组编号列表的 .txt 文件作为输入20,本研究中用于 S. Newport 美国分离株的该文件已在此提供(https://figshare.com/account/projects/116625/articles/15097503?file=29025729)。 有关如何安装和使用该细菌基因组学平台的详细信息,请参见此处(https://github.com/npavlovikj/ProkEvo/wiki/2.-Quick-start)20

  1. 使用 FastTree23 生成核心基因组系统发育树,方法如前所述20,该步骤不属于生物信息学平台的一部分20。FastTree 需要 Roary24 生成的核心基因组比对文件作为输入文件。系统发育树文件命名为 newport_phylogeny.tree  (https://figshare.com/account/projects/116625/articles/15097503?file=29025690)。
  2. 生成包含 Salmonella 血清型分类信息及cgMLST变异检测数据的 SISTR25 输出结果(sistr_output.csv - https://figshare.com/account/projects/116625/articles/15097503?file=29025699)。
  3. 使用 fastbaps26,27 生成 BAPS 文件,其中包含将基因组划分为亚群或单倍型的 BAPS 1-6 级分类结果(fastbaps_partition_baps_prior_l6.csv - https://figshare.com/account/projects/116625/articles/15097503?file=29025684)。
  4. 使用 MLST 程序(https://github.com/tseemann/mlst)28 基于 MLST 对基因组进行 ST 分型分类(salmonellast_output.csv - https://figshare.com/account/projects/116625/articles/15097503?file=29025696)。
  5. 使用 ABRicate(https://github.com/tseemann/abricate)29 生成包含每个基因组中比对到的抗菌素耐药基因位点的 .csv 格式输出文件(sabricate_resfinder_output.csv - https://figshare.com/account/projects/116625/articles/15097503?file=29025693)。
    注意:用户可关闭 ProkEvo 生物信息学流程中的特定部分(更多信息请参见:- https://github.com/npavlovikj/ProkEvo/wiki/4.2.-Remove-existing-bioinformatics-tool-from-ProkEvo)。本文所展示的分析方法为在完成生物信息学流程后如何开展基于群体的分析提供了指导。 

2. 下载并安装统计软件和集成开发环境(IDE)应用程序

  1. 下载适用于 Linux、Mac 或 PC 的最新免费版本 R 软件30,并按照默认安装步骤进行安装。
  2. 在此处下载最新免费版本的 RStudio 桌面版集成开发环境31,并按照默认安装步骤进行安装。
    ​注意:后续步骤已包含在提供的脚本中,包括代码使用的详细说明,应依次运行以生成本文所展示的结果和图表(https://github.com/jcgneto/jove_bacterial_population_genomics/blob/main/code/data_analysis_R_code.Rmd)。用户也可选择使用其他编程语言(如 Python)进行此类分析。在此情况下,请参考脚本中的步骤作为分析框架来执行相应操作。 

3. 安装并激活数据科学库

  1. 首先在分析过程中一次性安装所有数据科学相关的库,避免每次重新运行脚本时重复安装。使用 install.packages() 函数进行库的安装。或者,用户也可以点击集成开发环境(IDE)中的 Packages 选项卡,自动安装所需的包。以下为安装所有必要库所使用的代码:
    # 安装 Tidyverse
    install.packages("tidyverse")
    # 安装 skimr

    install.packages("skimr")
    # 安装 vegan
    install.packages("vegan")
    # 安装 forcats
    install.packages("forcats")
    # 安装 naniar
    install.packages("naniar")
    # 安装 ggpubr
    install.packages("ggpubr")
    # 安装 ggrepel
    install.packages("ggrepel")
    # 安装 reshape2
    install.packages("reshape2")
    # 安装 RColorBrewer
    install.packages("RColorBrewer")
    # 安装 ggtree
    if (!requireNamespace("BiocManager", quietly = TRUE))
      install.packages("BiocManager")
    BiocManager::install("ggtree")
    # 安装 ggtree 时会提示是否安装依赖项,输入 "a" 可安装/更新所有依赖项
  2. 在脚本开头、安装完成后,使用 library() 函数激活所有库或包。以下为激活所有必要包的示例:
    # 激活所有库和包
    library(tidyverse)
    library(skimr)
    library(vegan)
    library(forcats)
    library(naniar)
    library(ggtree)
    library(ggpubr)
    library(ggrepel)
    library(reshape2)
    library(RColorBrewer)
  3. 在代码块中使用 {r, include = FALSE} 来抑制库和包安装及激活代码的输出,如下所示:
    ``` {r, include = FALSE}
    # 安装 Tidyverse

    install.packages("tidyverse")
    ```

    注意:此步骤为可选,但可避免在最终的 html、doc 或 pdf 报告中显示大量不必要的代码。
  4. 有关所有库具体功能的简要说明以及获取更多信息的有用链接,请参见步骤 3.4.1–3.4.11。
    1. Tidyverse — 使用该集合包进行数据科学相关操作,包括数据输入、可视化、解析与聚合以及统计建模。通常,该库中包含实用的 ggplot2(数据可视化)和 dplyr(数据整理与建模)等包32
    2. skimr — 使用该包生成数据框的汇总统计信息,包括识别缺失值33
    3. vegan — 使用该包进行群落生态学的统计分析,例如计算基于多样性的统计量(如 alpha 多样性和 beta 多样性)34
    4. forcats — 使用该包处理分类变量,例如重新排序分类。该包属于 Tidyverse 库的一部分32
    5. naniar — 使用该包中的 viss_miss() 函数,可视化数据框中各变量缺失值的分布情况35
    6. ggtree — 使用该包可视化系统发育树36
    7. ggpubr — 使用该包提升基于 ggplot2 的可视化图表质量37
    8. ggrepel — 使用该包在图形内部进行文本标注38
    9. reshape2 — 使用该包中的 melt() 函数,将数据框从宽格式转换为长格式39
    10. RColorBrewer — 使用该包管理基于 ggplot2 的可视化图表中的颜色40
    11. 使用以下基本函数进行探索性数据分析:使用 head() 查看数据框的前几条观测值,使用 tail() 查看数据框的最后几条观测值,使用 is.na() 统计数据框中缺失值的行数,使用 dim() 检查数据集的行数和列数,使用 table() 统计某一变量中的观测值数量,使用 sum() 计算观测值或实例的总数。

4. 数据录入与分析

注意:有关本分析每个步骤的详细信息,可参见提供的脚本(https://github.com/jcgneto/jove_bacterial_population_genomics/blob/main/code/data_analysis_R_code.Rmd)。但以下是一些需要考虑的重要事项:

  1. 使用 read_csv() 函数完成所有基因组数据录入,包括所有基因型分类(血清型、BAPS、ST 和 cgMLST)。
  2. 在多数据集整合之前,重命名变量、创建新变量,并从每个数据集中选择感兴趣的列。
  3. 不要从任何独立数据集中删除缺失值。应等到所有数据集合并后,再对缺失值进行修改或排除。如果为每个数据集创建了新的变量,则默认情况下缺失值将被归类到新生成的分类之一中。
  4. 检查是否存在错误字符(如连字符或问号),并将其替换为 NA(不适用)。对缺失值进行同样处理。
  5. 根据基因型的层级顺序(血清型 -> BAPS1 -> ST -> cgMLST)以及基于单个基因组鉴定结果的分组方法。
  6. 使用多种策略检查缺失值,并明确处理此类不一致情况。仅当分类不可靠时,才将基因组或分离株从数据中剔除。否则,应根据具体分析情况,逐案处理缺失值(NA)。
    注意:强烈建议制定策略以处理此类数值 先验的避免移除在任何变量中存在缺失值的全部基因组或分离株。例如,某基因组可能具有ST分型信息,但缺乏cgMLST变异编号;在此情况下,该基因组仍可用于基于ST的分析。
  7. 所有数据集汇总后,将其赋值给一个数据框名称或对象,以便在后续分析的多个位置中使用,避免为论文中的每个图表重复生成相同的元数据文件。

5. 进行分析并生成可视化结果

注意:生成所有分析和可视化的每一步的详细说明,可在本文的 markdown 文件中找到(https://github.com/jcgneto/jove_bacterial_population_genomics/tree/main/code)。 每个图的代码被分段组织,整个脚本应按顺序运行。此外,每个主图和补充图的代码均以单独文件提供(见补充文件 1补充文件 2)。以下是生成每个主图和补充图时需考虑的一些关键要点(附带代码片段)。

  1. 使用 ggtree 绘制系统发育树并整合基因型信息图1).
    1. 通过分别调整 xlim() 和 gheatmap(width = ) 函数内的数值,优化 ggtree 图形尺寸,包括环的直径和宽度(参见下方示例代码)。
      树状图 <- ggtree(树, layout = "圆形") + xlim(-250, NA)
      图1 <- gheatmap(树状图, d4, 偏移量=.0, 宽度=20, 列名 = FALSE)
      注意:如需更详细地比较可用于系统发育绘图的程序,请参阅此项工作20该研究尝试探索改进基于ggtree的可视化策略,例如通过减小数据集规模来优化,但在分支长度和系统发育树拓扑结构的清晰区分度方面,其效果仍不及Phandango41.
    2. 将所有元数据尽可能归并为最少的类别,以在使用系统发育树绘制多层数据时便于选择着色面板(https://github.com/jcgneto/jove_bacterial_population_genomics/blob/main/code/figure_1.Rmd)。根据研究关注的问题和领域知识进行数据归并。
  2. 使用条形图评估相对频率(图2).
    1. 将ST谱系和cgMLST变异株的汇总数据进行整合,以促进数据可视化。在选择用于数据汇总的经验性或统计学阈值时,需结合具体研究问题进行考虑。
    2. 用于检查ST型频率分布以确定阈值的示例代码如下所示:
      st_dist <- d2 %>% 按(ST)分组 %>% # 按 ST 列分组
      count() %>% # 计算观察值的数量
      按 n 降序排列 # 将计数值按降序排列
    3. 有关如何将次要(低频)ST进行聚合的示例代码见下文。如下所示,未被编号为5、31、45、46、118、132或350的ST被归为一组 "其他STs". 使用类似的代码处理cgMLST变异(https://github.com/jcgneto/jove_bacterial_population_genomics/blob/main/code/figure_2.Rmd)。
      d2$st <- 如果(d2$ST == 5),则 "ST5", # 创建一个新的 ST 列,将次要的 S 型菌株归类为“其他”
       如果(d2$ST == 31, "ST31",
        ifelse(d2$ST == 45, "ST45",
         ifelse(d2$ST == 46, "ST46",
          ifelse(d2$ST == 118, "ST118",
      ifelse(d2$ST == 132, "ST132",如果(d2$ST == 350, "ST350", "其他STs")))))))
  3. 采用嵌套方法计算每个 ST 世系在各个 BAPS1 亚组中的比例,以鉴定具有祖先关联关系的 ST(即属于同一 BAPS1 亚组的 ST)图3)。以下代码展示了如何计算基于ST的BAPS1各亚组中的比例(https://github.com/jcgneto/jove_bacterial_population_genomics/blob/main/code/figure_3.Rmd):
    baps <- d2b %>% 筛选(血清型 == "纽波特") %>% # 过滤器 纽波特 血清型
    select(baps_1, ST) %>% # 选择 baps_1 和 ST 列
    mutate(ST = as.numeric(ST)) %>%>% # 将 ST 列更改为数值型
    drop_na(baps_1, ST) %>% # 删除缺失值
    group_by(baps_1, ST) %>% # 按 baps_1 和 ST 分组
    总结(n = n())%>% # 计数观察
    mutate(prop = n/sum(n)*100) # 计算比例
  4. 使用基于 Resfinder 的基因注释结果,绘制 AMR 位点在 ST 进化谱系中的分布情况(图4).
    注意:Resfinder 已广泛应用于生态学和流行病学研究42蛋白质编码基因的注释可能因数据库的整理和更新频率不同而有所差异。如果使用建议的生物信息学分析流程,研究人员可以比较不同数据库中基于AMR的位点分类结果20务必检查哪些数据库正在持续更新。为避免错误识别,请勿使用过时或质量较差的数据库。
    1. 使用经验性或统计学阈值筛选出最重要的 AMR 位点,以方便可视化。提供一个包含所有 ST 世系中各 AMR 位点计算比例的原始 .csv 文件,示例如下(https://figshare.com/account/projects/116625/articles/15097503?file=29025687)。
    2. 使用以下代码(https://github.com/jcgneto/jove_bacterial_population_genomics/blob/main/code/figure_4.Rmd)计算每个ST的AMR比例:
      # ST45 的计算
      d2c <- 数据6 %>% filter(st == "ST45") # 首先筛选 ST45 数据
      # 对于ST45,计算耐药基因座的比例,并仅保留比例大于10%的基因座

      d3c <- d2c %>% select(id, 基因) %>% # 选择列
      group_by(id, gene) %>% # 按 id 和基因分组
      summarize(计数 = n()) %>% # 计数观察
      mutate(count = replace(count, count == 2, 1)) %>% # 将计数值等于 2 的替换为 1,以仅保留每个基因的一个拷贝(重复可能不可靠),但研究人员可自行决定是否排除或保留这些重复。若研究人员希望排除重复,则使用 filter(count != 2) 函数,否则保持原样
      过滤(计数) <= 1) # 筛选计数小于或等于 1 的数据
      d4c <- d3c %>% group_by(基因) %>% # 按基因分组
      汇总(值 = 计数()) %>% # 计数观测值
      mutate(total = table(data1$st)[6]) %>% # 获取 st 的总数量 mutate(prop = (value/total)*100) # 计算比例
      ​d5c <- d4c %>% mutate(st = "ST45") # 创建一个st列并添加ST信息
    3. 完成所有ST的计算后,使用以下代码将数据集合并为一个数据框:
      # 合并数据集
      d6 <- rbind(d5a, d5b, d5c, d5d, d5e, d5f, d5g, d5h) # 合并数据集(按行)
    4. 要导出包含计算比例的 .csv 文件,请使用以下代码:
      # 导出包含ST和AMR基因座信息的数据表
      abx_newport_st <- d6 写入.csv(abx_newport_st,"abx_newport_st.csv", 行名 = FALSE)
    5. 在绘制基于AMR的ST谱系分布图之前,需根据阈值对数据进行过滤,以方便可视化,如下所示:
      # 筛选耐药基因座,其比例大于或等于10%
      d7 <- d6 %>% filter(prop >= 10) # 通过经验或统计方法确定阈值
  5. 使用 ggtree 将核心基因组系统发育树与分层基因型分类及耐药性数据(AMR)在同一图中展示图5).
    1. 使用上述参数优化 ggtree 中图形的大小(参见步骤 5.1.1)。
    2. 通过整合变量或使用二元分类(如基因的有无)来优化可视化效果。图表中添加的特征越多,颜色选择过程就越困难。 (https://github.com/jcgneto/jove_bacterial_population_genomics/blob/main/code/figure_5.Rmd)
      注:补充图——完整代码的详细说明可在此处找到(https://github.com/jcgneto/jove_bacterial_population_genomics/blob/main/code/data_analysis_R_code.Rmd)。
  6. 使用 ggplot2 中的散点图,在不进行数据聚合的情况下展示 ST 型别或 cgMLST 变异型的分布,同时突出显示最频繁的基因型补充图1) (https://github.com/jcgneto/jove_bacterial_population_genomics/blob/main/code/supplementary_figure_s1.Rmd)。 
  7. 通过嵌套分析评估ST谱系的组成,即基于cgMLST变异型的比例来初步了解ST相关的遗传多样性,同时鉴定最常见变异型及其遗传关系(即属于同一ST的cgMLST变异型比属于不同ST的变异型具有更近的共同祖先)补充图2(https://github.com/jcgneto/jove_bacterial_population_genomics/blob/main/code/supplementary_figure_s2.Rmd) 
  8. 使用群落生态学指标——即辛普森多样性指数(Simpson's D 指数)——来衡量各主要 ST 世系的克隆性程度或基因型多样性43 (补充图3).
    1. 在不同基因型分辨率水平(包括BAPS 1至6级以及cgMLST)上计算ST谱系间的多样性指数。以下是在基因型分辨率的BAPS 1级(BAPS1)进行该计算的代码示例:
      # BAPS 1级(BAPS1)
      # 丢弃 ST 和 BAPS1 中含有缺失值(NA)的样本,按 ST 和 BAPS1 分组,然后计算辛普森指数
      baps1 <- 数据6 %>%
      select(st, BAPS1) %>% # 选择列
      drop_na(st, BAPS1) %>% # 删除缺失值
      按 BAPS1 对 st 进行分组># 按列分组
      总结(n = n())%>% # 统计观测值
      突变(simpson = 多样性(n, "辛普森")) %>% # 计算多样性
      按 st 分组 %>% # 按列分组
      summarise(simpson = mean(simpson)) %>% # 计算索引的均值
      melt(id.vars=c("st"),测量变量="辛普森",
      变量名="索引",值.名称="值") %># 转换为长格式
      mutate(strat = "BAPS1")# 创建一个 strat 列
      注意:遗传多样性更高的群体(即在不同基因型分辨率层次上具有更多变异)在cgMLST水平上具有更高的指数,并且从BAPS 2级到6级呈现出基于指数的数值递增趋势(https://github.com/jcgneto/jove_bacterial_population_genomics/blob/main/code/supplementary_figure_s3.Rmd)。 
  9. 通过绘制所有分辨率层级(BAPS1-6)下BAPS亚群的相对频率,分析ST谱系的基因型多样性程度补充图4)。群体多样性越高,BAPS亚群(单倍型)的分布就越稀疏,从BAPS1(较低分辨率)到BAPS6(较高分辨率)呈现这一趋势(https://github.com/jcgneto/jove_bacterial_population_genomics/blob/main/code/supplementary_figure_s4.Rmd)。 

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

通过利用计算平台 ProkEvo 进行群体基因组学分析,细菌全基因组测序数据挖掘的第一步是结合核心基因组系统发育关系来考察其层级化的群体结构(图1)。在以下情况下 S. 肠炎沙门氏菌 谱系I,以 S. Newport 数据集的群体结构按层级划分如下:血清型(最低分辨率层级)、BAPS1 亚群或单倍型、ST 世系,以及 cgMLST 变异型(最高分辨率层级)20. 这种基于系统发育指导的层级种群结构分析特别允许检验以下几点:i)在基于SISTR被错误分类为其他血清型的基因组情况下,其系统发育分布 沙门氏菌;ii) 种群的遗传或亲缘结构;iii) 不同基因型分辨率水平下的分化模式;iv) 确定支撑进化、生态或流行病学模式的主要基因型单元;v) 通过BAPS1亚群或单倍型组成分析ST谱系间的祖先关系,以及ST谱系内cgMLST变异型之间的关系;vi) 基于cgMLST变异型组成对ST谱系基因型同质性程度的部分评估。

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

基于系统的启发式方法和分层种群结构分析为识别细菌数据集中可能解释独特生态学和流行病学模式的新基因组特征提供了框架20。此外,将附属基因组数据映射到种群结构上,可用于推断祖先获得和/或近期衍生的性状,这些性状有助于ST谱系或cgMLST变异株在不同储存库中的传播6,20,21,45,46。更广泛而言,对细菌种群中泛基因组内容分布的全球性评估可揭示种群近期可能经历的生态趋向性或地理空间/时间瓶颈背后的多样化模式18,21。对于致病菌而言,通过挖掘临床分离株与环境分离株的种群结构,可识别与人畜共患病事件相关的遗传决定因素,并用于改进诊断和监测手段

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明不存在任何竞争利益。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究工作得到了内布拉斯加大学林肯分校农业研究部(UNL-IANR)、国家抗菌耐药性研究与教育中心以及内布拉斯加食品与健康中心(隶属于食品科学与技术系,UNL)的资金支持。本研究的完成依赖于内布拉斯加大学林肯分校的霍兰计算中心(HCC),该中心获得了内布拉斯加研究计划的支持。我们还感谢通过霍兰计算中心访问开放科学网格(OSG)所提供的资源,开放科学网格由美国国家科学基金会和美国能源部科学办公室提供支持。本研究使用了Pegasus工作流管理软件,该软件由美国国家科学基金会资助(项目编号 #1664162)。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
经筛选的耐药性数据https://figshare.com/account/projects/116625/articles/14829225?file=28758762
原始耐药性数据https://figshare.com/account/projects/116625/articles/14829225?file=28547994
BAIPS 分析结果https://figshare.com/account/projects/116625/articles/14829225?file=28548003
核心基因组系统发育树https://figshare.com/account/projects/116625/articles/14829225?file=28548006
基因组 SRA 数据https://figshare.com/account/projects/116625/articles/14829225?file=28639209
Linux、Mac 或 PC任意高性能计算平台
MLST 分析结果https://figshare.com/account/projects/116625/articles/14829225?file=28547997
SISTR 分析结果https://figshare.com/account/projects/116625/articles/14829225?file=28548000
需提供 figshare 账户凭据以登录并访问相关文件

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Grad, Y. H., et al. Genomic epidemiology of the Escherichia coli O104:H4 outbreaks in Europe, 2011. Proceedings of the National Academy of Sciences of the United States of America. 109 (8), 3065-3070 (2012).
  2. Worby, C. J., Chang, H. -H., Hanage, W. P., Lipsitch, M. The distribution of pairwise genetic distances: a tool for investigating disease transmission. Genetics. 198 (4), 1395-1404 (2014).
  3. Leekitcharoenphon, P., et al. Global genomic epidemiology of Salmonella enterica serovar Typhimurium DT104. Applied and Environmental Microbiology. 82 (8), 2516-2526 (2016).
  4. Alba, P., et al. Molecular epidemiology of Salmonella Infantis in Europe: insights into the success of the bacterial host and its parasitic pESI-like megaplasmid. Microbial Genomics. 6 (5), (2020).
  5. Zhou, Z., Alikhan, N. -F., Mohamed, K., Fan, Y. the Agama Study Group, Achtman, M. The EnteroBase user's guide, with case studies on Salmonella transmissions, Yersinia pestis phylogeny, and Escherichia core genomic diversity. Genome Research. 30 (1), 138-152 (2020).
  6. Azarian, T., et al. Global emergence and population dynamics of divergent serotype 3 CC180 pneumococci. PLOS Pathogens. 14 (11), 1007438(2018).
  7. Saltykova, A., et al. Comparison of SNP-based subtyping workflows for bacterial isolates using WGS data, applied to Salmonella enterica serotype Typhimurium and serotype 1,4,[5],12:i. PLOS ONE. 13 (2), 0192504(2018).
  8. Achtman, M., et al. Multi-locus sequence typing as a replacement for serotyping in Salmonella enterica. PLoS Pathogens. 8 (6), 1002776(2012).
  9. Maiden, M. C. J., et al. Multi-locus sequence typing: A portable approach to the identification of clones within populations of pathogenic microorganisms. Proceedings of the National Academy of Sciences of the United States of America. 95 (6), 3140-3145 (1998).
  10. Alikhan, N. -F., Zhou, Z., Sergeant, M. J., Achtman, M. A genomic overview of the population structure of Salmonella. PLOS Genetics. 14 (4), 1007261(2018).
  11. Gupta, A., Jordan, I. K., Rishishwar, L. stringMLST: a fast k-mer based tool for multi-locus sequence typing. Bioinformatics. 33 (1), 119-121 (2017).
  12. Jolley, K. A., Maiden, M. C. BIGSdb: Scalable analysis of bacterial genome variation at the population level. BMC Bioinformatics. 11 (1), 595(2010).
  13. Maiden, M. C. J., et al. MLST revisited: the gene-by-gene approach to bacterial genomics. Nature Reviews Microbiology. 11 (10), 728-736 (2013).
  14. Maiden, M. C. J. Multilocus sequence typing of bacteria. Annual Review of Microbiology. 60 (1), 561-588 (2006).
  15. Shapiro, B. J., Polz, M. F. Ordering microbial diversity into ecologically and genetically cohesive units. Trends in Microbiology. 22 (5), 235-247 (2014).
  16. Cordero, O. X., Polz, M. F. Explaining microbial genomic diversity in light of evolutionary ecology. Nature Reviews Microbiology. 12 (4), 263-273 (2014).
  17. Achtman, M., Wagner, M. Microbial diversity and the genetic nature of microbial species. Nature Reviews Microbiology. 6 (6), 431-440 (2008).
  18. Abudahab, K., et al. PANINI: Pangenome neighbour identification for bacterial populations. Microbial Genomics. 5 (4), (2019).
  19. Laing, C. R., Whiteside, M. D., Gannon, V. P. J. Pan-genome analyses of the species Salmonella enterica, and identification of genomic markers predictive for species, subspecies, and serovar. Frontiers in Microbiology. 8, 1345(2017).
  20. Pavlovikj, N., Gomes-Neto, J. C., Deogun, J. S., Benson, A. K. ProkEvo: an automated, reproducible, and scalable framework for high-throughput bacterial population genomics analyses. PeerJ. 9, 11376(2021).
  21. McNally, A., et al. Combined analysis of variation in core, accessory and regulatory genome regions provides a super-resolution view into the evolution of bacterial populations. PLOS Genetics. 12 (9), 1006280(2016).
  22. Langridge, G. C., et al. Patterns of genome evolution that have accompanied host adaptation in Salmonella. Proceedings of the National Academy of Sciences of the United States of America. 112 (3), 863-868 (2015).
  23. Price, M. N., Dehal, P. S., Arkin, A. P. FastTree 2 - Approximately maximum-likelihood trees for large alignments. PLoS ONE. 5 (3), 9490(2010).
  24. Page, A. J., et al. Roary: rapid large-scale prokaryote pan genome analysis. Bioinformatics. 31 (22), 3691-3693 (2015).
  25. Yoshida, C. E., et al. The Salmonella In silico typing resource (SISTR): An open web-accessible tool for rapidly typing and subtyping draft Salmonella genome assemblies. PLOS ONE. 11 (1), 0147101(2016).
  26. Cheng, L., Connor, T. R., Siren, J., Aanensen, D. M., Corander, J. Hierarchical and spatially explicit clustering of DNA sequences with BAPS software. Molecular Biology and Evolution. 30 (5), 1224-1228 (2013).
  27. Tonkin-Hill, G., Lees, J. A., Bentley, S. D., Frost, S. D. W., Corander, J. Fast hierarchical Bayesian analysis of population structure. Nucleic Acids Research. 47 (11), 5539-5549 (2019).
  28. Seemann, T. MLST. GitHub. , Available from: https://github.com/tseemann/mist (2020).
  29. Seemann, T. ABRicate. GitHub. , Available from: https://github.com/tseemann/abricate (2020).
  30. R Core Team. R: A language and environment for statistical computing. R Foundation for Statistical Computing. , Vienna, Austria. at. Available from: https://cran.r-project.org (2021).
  31. Studio Team. RStudio: Integrated Development for R. Studio, PBC. , Boston, MA. Available from: http://www.rstudio.com (2020).
  32. Wickham, H., et al. Welcome to the Tidyverse. Journal of Open Source Software. 4 (43), 1686(2019).
  33. rOpenSci: The skimr package. GitHub. , Berkeley, CA. Available from: https://github.com/ropensci/skimr/ (2021).
  34. Oksanen, J., et al. vegan: Community ecology package. R package version 2.5-5. , Available from: https://CRAN.R-project.org/package=vegan (2019).
  35. Tierney, N. J., Cook, D. H. Expanding tidy data principles to facilitate missing data exploration, visualization and assessment of imputations. arXiv. , Available from: http://arxiv.org/abs/1809.02264 (2020).
  36. Yu, G. Using ggtree to visualize data on tree-like structures. Current Protocols in Bioinformatics. 69 (1), (2020).
  37. Kassambara, A. ggpubr: "ggplot2" Based Publication Ready Plots. R package version 0.4.0. , Available from: https://CRAN.R-project.org/package=ggpubr (2020).
  38. Slowikowski, K. ggrepel: Automatically Position Non-Overlapping Text Labels with "ggplot2”. R package version 0.9.1. , Available from: https://CRAN.R-project.org/package=ggrepel (2021).
  39. Wickham, H. Reshaping Data with the reshape Package. Journal of Statistical Software. 21 (12), (2007).
  40. Neuwirth, E. RColorBrewer: ColorBrewer Palettes. R package version 1.1-2. , Available from: https://CRAN.R-project.org/package=RColorBrewer (2014).
  41. Hadfield, J., Croucher, N. J., Goater, R. J., Abudahab, K., Aanensen, D. M., Harris, S. R. Phandango: an interactive viewer for bacterial population genomics. Bioinformatics. 34 (2), 292-293 (2018).
  42. Perron, G. G., et al. Functional characterization of bacteria isolated from ancient arctic soil exposes diverse resistance mechanisms to modern antibiotics. PLOS ONE. 10 (3), 0069533(2015).
  43. Mitchell, P. K., et al. Population genomics of pneumococcal carriage in Massachusetts children following introduction of PCV-13. Microbial Genomics. 5 (2), (2019).
  44. Klemm, E. J., et al. Emergence of host-adapted Salmonella Enteritidis through rapid evolution in an immunocompromised host. Nature Microbiology. 1 (3), 15023(2016).
  45. Břinda, K., et al. Rapid inference of antibiotic resistance and susceptibility by genomic neighbour typing. Nature Microbiology. 5 (3), 455-464 (2020).
  46. MacFadden, D. R., et al. Using genetic distance from archived samples for the prediction of antibiotic resistance in Escherichia coli. Antimicrobial Agents and Chemotherapy. 64 (5), (2020).
  47. Mageiros, L., et al. Genome evolution and the emergence of pathogenicity in avian Escherichia coli. Nature Communications. 12 (1), 765(2021).
  48. Yahara, K., et al. Genome-wide association of functional traits linked with Campylobacter jejuni survival from farm to fork. Environmental Microbiology. 19 (1), 361-380 (2017).
  49. Walter, J., Maldonado-Gómez, M. X., Martínez, I. To engraft or not to engraft: an ecological framework for gut microbiome modulation with live microbes. Current Opinion in Biotechnology. 49, 129-139 (2018).
  50. Maldonado-Gómez, M. X., et al. Stable engraftment of Bifidobacterium longum AH1206 in the human gut depends on individualized features of the resident microbiome. Cell Host & Microbe. 20 (4), 515-526 (2016).
  51. Zhao, S., et al. Adaptive evolution within gut microbiomes of healthy people. Cell Host & Microbe. 25 (5), 656-667 (2019).
  52. Treangen, T. J., Ondov, B. D., Koren, S., Phillippy, A. M. The Harvest suite for rapid core-genome alignment and visualization of thousands of intraspecific microbial genomes. Genome Biology. 15 (11), 524(2014).
  53. Letunic, I., Bork, P. Interactive Tree Of Life (iTOL) v5: an online tool for phylogenetic tree display and annotation. Nucleic Acids Research. 49, 293-296 (2021).
  54. Croucher, N. J., et al. Rapid phylogenetic analysis of large samples of recombinant bacterial whole genome sequences using Gubbins. Nucleic Acids Research. 43 (3), 15(2015).
  55. Fenske, G. J., Thachil, A., McDonough, P. L., Glaser, A., Scaria, J. Geography shapes the population genomics of Salmonella enterica Dublin. Genome Biology and Evolution. 11 (8), 2220-2231 (2019).
  56. Lees, J. A., et al. Fast and flexible bacterial genomic epidemiology with PopPUNK. Genome Research. 29 (2), 304-316 (2019).
  57. Cohan, F. M. Towards a conceptual and operational union of bacterial systematics, ecology, and evolution. Philosophical Transactions of the Royal Society B: Biological Sciences. 361 (1475), 1985-1996 (2006).
  58. Cohan, F. M., Koeppel, A. F. The origins of ecological diversity in prokaryotes. Current Biology. 18 (21), 1024-1034 (2008).
  59. Cohan, F. M. Transmission in the origins of bacterial diversity, from ecotypes to phyla. Microbial Transmission. 5 (5), 311-343 (2019).
  60. Davis, J. J., et al. The PATRIC bioinformatics resource center: expanding data and analysis capabilities. Nucleic Acids Research. 48, 606-612 (2019).
  61. Feng, Y., Zou, S., Chen, H., Yu, Y., Ruan, Z. BacWGSTdb 2.0: a one-stop repository for bacterial whole-genome sequence typing and source tracking. Nucleic Acids Research. 49, 644-650 (2021).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

ProkEvo

相关文章