Article de méthode

Algorithmes d’appel de pics (WonderPeaks et PeakStream) comme outils pour améliorer le ChIP-seq et l’analyse transcriptomique chez les agents pathogènes fongiques

DOI :

10.3791/68301

8 août 2025

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce rapport présente WonderPeaks, un nouvel outil de calcul pour l’analyse des données de séquençage d’ARN et de ChIP. Cet outil permet d’identifier avec succès les pics (lire les empilements) dans les données de séquençage, ce qui permet de caractériser les limites de régions non traduites dans le RNA-seq et de détecter l’enrichissement en chromatine dans le ChIP-seq, fournissant ainsi des informations précieuses pour la recherche sur les agents pathogènes fongiques.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La caractérisation des changements dans l’expression des gènes par la transcriptomique et l’activité du régulateur de la transcription est devenue une approche fondamentale pour comprendre les diverses réponses impliquées dans la pathogenèse fongique. Cet article présente deux outils informatiques conçus pour relever les principaux défis de l’étude de la régulation transcriptionnelle chez les agents pathogènes fongiques, en particulier les non-modèles avec une annotation génomique limitée. Tout d’abord, nous présentons WonderPeaks, un nouvel algorithme d’appel de pics qui exploite le premier dérivé de données génomiques cartographiées provenant d’expériences de séquençage de nouvelle génération (NGS) pour identifier des pics enrichis en immunoprécipitation de chromatine suivie d’un séquençage (ChIP-seq). Deuxièmement, nous présentons PeakStream, une extension de WonderPeaks pour l’annotation des régions non traduites (UTR) 3' dans les données transcriptomiques générées à l’aide de la préparation de banques poly(A)-amorcées. Ensemble, ces outils fournissent un pipeline d’analyse de données de bout en bout, offrant une solution conviviale pour les chercheurs qui étudient la régulation de la transcription chez les champignons. Nous démontrons leur efficacité avec des données provenant de l’agent pathogène fongique Candida albicans, en identifiant avec succès des pics vérifiés dans les données ChIP-seq et en annotant les UTR validés en les comparant aux données de séquençage de l’ARN total dans les mêmes conditions. Nous discutons également des limites de WonderPeaks pour les données ChIP-seq par rapport aux méthodes actuelles de pointe et proposons des orientations pour des améliorations futures. En fin de compte, ce travail fournit des conseils pratiques et des ressources puissantes pour l’étude de la régulation transcriptionnelle, avec une pertinence immédiate pour les champignons pathogènes et des applications potentielles dans des études génomiques plus larges.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les agents pathogènes fongiques sont un problème de santé mondial émergent, avec une augmentation des infections ces dernières années1. Bon nombre de ces agents pathogènes présentent une résistance élevée aux antifongiques et sont associés à des taux de mortalité importants2. Cependant, par rapport aux organismes fongiques modèles, de nombreux champignons pathogènes restent mal caractérisés, ce qui souligne la nécessité de poursuivre les recherches sur leurs mécanismes de pathogénicité. Les techniques de séquençage de nouvelle génération (NGS) telles que le séquençage par immunoprécipitation de la chromatine (ChIP-Seq) et le séquençage de l’ARN (RNA-Seq) jouent un rôle essentiel dans la découverte des mécanismes moléculaires de l’expression génique sous-jacente à la pathogénicité fongique.

La qualité des informations dérivées des données NGS dépend fortement de la précision du logiciel utilisé pour l’analyse des données brutes. Parmi les principaux défis de l’analyse des données NGS figure l’appel de pointe, c’est-à-dire l’identification précise des régions de lectures NGS enrichies, qui est particulièrement complexe en raison de la grande variété de techniques de préparation et de séquençage des bibliothèques, ce qui rend une solution universelle peu pratique. L’algorithme MACS3, y compris sa version la plus récente, MACS3, est largement considéré comme la référence pour l’analyse des ensembles de données ChIP-seq. Cependant, MACS s’appuie sur des paramètres définis par l’utilisateur, tels que la longueur de crête minimale et l’écart maximal, qui peuvent ne pas être universellement applicables et sont souvent difficiles à déterminer avant l’analyse. Notamment, la dernière version de MACS3 inclut une fonction d’analyse de coupure qui permet aux utilisateurs d’estimer les paramètres avant les appels de pointe. Pour améliorer les performances, les utilisateurs peuvent également fournir une liste de régions génomiques « blacklistées » connues pour introduire un biais dû à la structure de la chromatine ou à la variation du nombre de copies. Bien que MACS reste l’outil d’appel de pointe le plus couramment utilisé et le plus fiable pour les données ChIP-seq, peu d’algorithmes alternatifs sont disponibles, en particulier pour les cas nécessitant des paramètres hautement personnalisés.

RNA-Seq est une technique inestimable pour étudier les réponses d’expression génique des champignons pathogènes pendant la croissance in vivo, comme dans la culture tissulaire ou les modèles d’infection de souris 4,5,6,7. Une profondeur de séquençage élevée est nécessaire pour une analyse précise de l’expression différentielle dans ces conditions, qui peuvent être prohibitives en termes de coûts et de ressources 8,9. Les méthodes de préparation de banques telles que le séquençage par poly-adénylation (poly(A))-amorçage (3'RNA-Seq), qui utilise des amorces conçues pour recuire les queues poly(A) de l’ARNm pour la génération d’ADNc, peuvent aider à réduire la profondeur de séquençage nécessaire à l’analyse de l’expression génique10. Cependant, cette approche repose sur des annotations génomiques de haute qualité, en particulier des régions non traduites 3' (UTR), où les pics des événements d’amorçage poly(A) sont généralement situés11. Les annotations génomiques de nombreux agents pathogènes fongiques sous-étudiés n’ont pas d’annotations UTR, ce qui rend difficile l’utilisation du 3'RNA-Seq chez ces organismes. De plus, la longueur UTR d’un seul gène peut être dynamique dans différentes conditions de croissance et types de cellules12,13. Bien qu’un certain nombre de nouveaux outils d’analyse aient été mis au point pour identifier et annoter les UTR, beaucoup d’entre eux sont conçus pour des ensembles de données de mammifères, dont l’organisation des gènes diffère considérablement de celle des champignons, ou nécessitent des données provenant d’expériences de séquençage indépendantes, telles que le séquençage unicellulaire ou inverse de l’ARNm, ce qui peut augmenter le temps et les coûts pour un chercheur cherchant à effectuer une analyse du transcriptome12, 14 et 15.

Dans cet article, nous présentons WonderPeaks, un nouveau logiciel d’appel de pics, conçu sur les principes de la dérivée première, qui peut être utilisé pour appeler dynamiquement des pics dans des ensembles de données NGS (Figure 1). WonderPeaks identifie les pics en calculant la dérivée première du signal de couverture et en utilisant cette valeur - la pente du pic - pour définir les pics potentiels. L’algorithme recherche les cas où la dérivée première présente un maximum local au-dessus d’un seuil de pente fourni par l’utilisateur ou déduit des données (indiquant un signal croissant), suivi d’un minimum local au-dessus du même seuil (indiquant un signal décroissant), détectant ainsi tous les pics candidats dans l’ensemble de données. Pour les applications ChIP-seq, WonderPeaks compare tous les pics candidats entre les échantillons de test et de contrôle afin d’identifier les pics enrichis de manière unique. En appliquant WonderPeaks à un ensemble de données ChIP-seq précédemment publié d’un facteur de transcription dans l’agent pathogène fongique Candida albicans16, nous avons démontré sa capacité à identifier avec succès les pics en amont des gènes clés mis en évidence dans l’étude originale, tout en discutant des limites actuelles de l’algorithme dans cette application.

Nous présentons également PeakStream, un outil logiciel qui exploite WonderPeaks pour identifier les pics dans les ensembles de données 3'RNA-Seq. Les banques 3'RNA-Seq dépendent d’annotations 3' UTR précises, car les lectures générées par poly(A)-amorçage s’étendent souvent au-delà du codon stop des séquences codantes (CDS) des gènes et ne sont donc pas comptabilisées lors de l’utilisation d’annotations standard axées uniquement sur les régions codantes. Le pipeline d’analyse PeakStream a été conçu pour créer de nouvelles annotations génomiques à l’aide de données de séquençage d’ARN 3', en se concentrant sur les régions en aval des régions de séquence codante de gène (CDS). PeakStream attribue ces pics aux gènes, générant une nouvelle annotation génomique à utiliser dans les programmes de comptage de lecture en aval. Nous montrons que l’utilisation de PeakStream permet d’identifier avec précision et d’attribuer des pics générés par des poly(A) en aval au gène approprié dans un ensemble de données 3'RNA-Seq C. albicans . PeakStream annote également les pics peu susceptibles d’être associés à des annotations génétiques actuelles, facilitant ainsi la découverte de nouveaux transcrits possibles. Ensemble, PeakStream et WonderPeaks représentent une suite puissante d’outils conviviaux pour la détection des pics dans les ensembles de données de séquençage de nouvelle génération (NGS).

figure-introduction-1
Figure 1 : Aperçu général de l’appel de pointe par WonderPeaks et PeakStream. À gauche : Pic de l’appel à l’aide de la dérivée première. En haut à droite : Appel de crête sur les ensembles de données ChIP-Seq à l’aide de WonderPeaks. En bas à droite : Appel de pointe sur des ensembles de données RNA-Seq à l’aide de PeakStream. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Installation (ignorer si terminée)

  1. Conditions préalables
    1. Installez Anaconda ou Minconda pour charger les exigences d’exécution du prétraitement (section 5) et WonderPeaks (section 6 ou section 7).
      REMARQUE : Pour un guide d’utilisation d’Anaconda, voir la référence16.
    2. Installez Python : Python dans Anaconda ou Miniconda.
    3. Installez Jupyter Notebooks pour exécuter toutes les fonctions de cette méthode.
      REMARQUE : Un guide d’utilisation pour les ordinateurs portables Jupyter pour débutants se trouve dans la référence17.
      ATTENTION : Pour les génomes fongiques (≤100 Mbp), assurez-vous d’un environnement informatique avec au moins 20 cœurs, 8 Go de RAM et 30 Go d’espace disque disponible.
  2. Installez les fonctions de prétraitement.
    1. Dans le terminal, exécutez : conda create -n WP_preprocessing
    2. Dans le terminal, exécutez : conda activate WP_preprocessing
    3. Dans le terminal, exécutez : conda env update --file environment.yml --name
      REMARQUE : Le environment.yml est un fichier qui contient toutes les dépendances du paquet et qui doit être téléchargé à partir de https://github.com/mgarber21/WonderPeaks_preprocessing.git.
    4. Dans le terminal, exécutez : pip install WonderPeaks-preprocessing
    5. Dans le terminal, exécutez : conda deactivate WP_preprocessing
  3. Installez les fonctions WonderPeaks :
    1. Dans le terminal, exécutez : conda create -n WonderPeaks
    2. Dans le terminal, exécutez : conda activate WonderPeaks
    3. Dans le terminal, exécutez : conda env update --file environment.yml --name
      REMARQUE : Le environment.yml est un fichier qui contient toutes les dépendances du paquet et doit être téléchargé à partir de https://github.com/mgarber21/WonderPeaks.git.
    4. Dans le terminal, exécutez : pip install WonderPeaks
    5. Dans le terminal, exécutez : conda deactivate WonderPeaks
      REMARQUE : Les étapes 1.2 et 1.3 permettent d’obtenir les résultats suivants : elles créent un environnement Conda dédié au prétraitement (section 5) et à WonderPeaks (sections 6 et 7), en isolant les dépendances pour éviter les conflits avec d’autres logiciels. Ils activent l’environnement, le configurent pour l’installation et l’exécution de fonctions spécifiques à WP_preprocessing ou à WonderPeaks. Ils installent les dépendances logicielles et les outils nécessaires au prétraitement des données. Ils désactivent l’environnement lorsqu’ils ne sont pas utilisés pour éviter toute modification accidentelle et libérer des ressources système.
  4. Téléchargez des blocs-notes et des modèles Jupyter à partir du référentiel GitHub WonderPeaks. Téléchargez les téléchargements de WonderPeaks sur le système d’exploitation contenant les données brutes (le répertoire sera créé dans la section 2).
    REMARQUE : les blocs-notes Jupyter contiennent des scripts et des modèles pré-écrits nécessaires à l’exécution des flux de travail de prétraitement, WonderPeaks et PeakStream. En les téléchargeant sur le même système que les données brutes, vous vous assurez que les chemins d’accès et les répertoires s’alignent correctement.

2. Créez un répertoire de données

REMARQUE : Les flux de travail WonderPeaks et PeakStream nécessitent que toutes les données (brutes et traitées) soient stockées dans le même répertoire. Cette étape explique comment créer ce nouveau répertoire ({data_directory} = /chemin/vers/votre/données) et comment déplacer des données brutes expérimentales (lectures de séquençage non traitées) vers un dossier de ce répertoire appelé raw_data.

  1. Créez un répertoire de données.
    1. Dans le terminal, exécutez mkdir {data_directory} (par exemple mkdir /chemin/vers/votre/données)
  2. Créez un sous-répertoire de données brutes pour les lectures de séquençage non traitées.
    1. Dans le terminal, exécutez mkdir {data_directory}/raw_data (par exemple mkdir /chemin/vers/votre/données /raw_data)
  3. Déplacez les lectures de séquençage non traitées vers le répertoire de données brutes.
    1. Dans le terminal, exécutez mv {current_path_to_raw_data}/*fastq* {data_directory}/raw_data (par exemple mv current/data/path/*fastq* /path/to/your/data /raw_data

3. Créez le fichier d’entrées utilisateur (NGS_user_input.csv)

REMARQUE : Le fichier d’entrée spécifie les configurations générées par l’utilisateur pour l’exécution du prétraitement et de WonderPeaks.

  1. Téléchargez le modèle NGS_user_inputs.csv à partir du référentiel GitHub WonderPeaks.
  2. Mettez à jour les champs dans NGS_user_inputs.csv. Mettez à jour les champs comme suit :
    Répertoire de données : /chemin/vers/votre/données
    Répertoire du génome : /chemin/vers/votre/génome
    Fasta du génome : genome.fasta
    Annotation du génome : genome_annotation.gtf (fournir le nom de fichier de l’annotation du génome au format GTF)
  3. Enregistrez les NGS_user_inputs.csv mises à jour dans le répertoire de données créé au chapitre 2.
    ATTENTION : Ne modifiez pas le nom du fichier ; WonderPeaks ne reconnaîtra ce fichier que s’il est nommé NGS_user_input.csv.

4. Créer un fichier de métadonnées (NGS_user_metadata.csv)

REMARQUE : Le fichier de métadonnées est utilisé pour stocker toute information pertinente à l’expérience. Des colonnes supplémentaires peuvent être ajoutées pour décrire les conditions de l’expérience, mais celles-ci n’affecteront pas les étapes suivantes.

  1. Téléchargez le modèle NGS_user_metadata.csv à partir du référentiel GitHub de WonderPeaks.
  2. Mettre à jour les champs dans NGS_user_metadata.csv Les champs sont les suivants :
    1. file : assurez-vous que le nom du fichier n’a pas d’espaces, qu’il inclut le descripteur de fichier (par exemple, fastq, fastq.gz) et qu’il n’inclut pas le chemin absolu.
    2. bedgraph : spécifiez si le fichier doit être inclus dans PeakStream en définissant ce champ sur TRUE ou FALSE.
      1. Définissez le champ bedgraph sur FALSE lorsque le fichier peut raisonnablement être exclu de l’analyse PeakStream. Par exemple, dans une expérience de RNAseq, définissez le paramètre bedgraph bedgraph=FALSE pour les mutants ou d’autres cas où les différences UTR entre les échantillons ne sont pas attendues. Cependant, assurez-vous de définir le champ bedgraph sur TRUE pour tous les fichiers de contrôle d’une expérience RNAseq et pour tous les fichiers d’une expérience ChIPseq .
    3. Facteur de conception
      1. designfactor1 : Précisez un facteur de conception pertinent pour le plan d’expérience (p. ex., traitement ou sample_type).
      2. designfactor2 : Spécifiez un deuxième facteur de design pertinent pour le plan d’expérience (p. ex., souche ou épitope). Dans le cas d’une expérience de RNAseq, incluez le traitement et la souche comme facteurs de conception typiques. La colonne des traitements énumère les traitements appliqués (p. ex., témoin, médicament 1) et la colonne des souches fournit des renseignements sur les souches (p. ex., type sauvage, mutant). Pour une expérience ChIPseq, incluez sample_type et l’épitope comme facteurs de conception typiques. La colonne sample_type indique si la protéine a été marquée ou non, et la colonne épitope indique le nom de l’épitope utilisé.
        REMARQUE : les facteurs de conception sont des attributs spécifiques au plan d’expérience.
        WonderPeaks est compatible avec les commandes non balisées ou les commandes d’entrée comme référence.
      3. Assurez-vous que les colonnes du facteur de conception n’incluent pas de numéro de réplication unique (par exemple, sample_type : [tagged, tagged, untagged_control, untagged_control] et non sample_type : [tagged_1, tagged_2, untagged_control _1, untagged_control _2]. Si vous fournissez des numéros de réplication uniques, une erreur se produira lors de l’exécution.
      4. Veillez à utiliser des traits de soulignement (_) au lieu d’espaces dans les noms de facteurs de conception.
      5. Pour l’application ChIPseq, assurez-vous que la colonne sample_type (ou nom personnalisé) du fichier de métadonnées inclut des termes contenant les mots tag et control.
        REMARQUE : Par exemple, les entrées valides peuvent inclure des tags et des untagged_control. Fournir une colonne sample_type sans ces termes entraînera une erreur lors de l’exécution.
        ATTENTION : Pour l’application ChIP, l’utilisateur doit spécifier deux facteurs de conception.
      6. Ajoutez des facteurs de conception à la ligne de NGS_user_inputs.csv appropriée. Assurez-vous que les noms de colonne utilisés pour les facteurs de conception sont répertoriés sous forme de chaîne séparée par des points-virgules (par exemple, traitement ; souche ou sample_type ; épitope).
        ATTENTION : Les facteurs de conception de NGS_user_inputs.csv doivent correspondre exactement aux colonnes de NGS_user_metadata.csv . Toute exécution non appariée entraînera une erreur pendant l’exécution (Figure 2, Table supplémentaire S1 et Table supplémentaire S2).

figure-protocol-1
Figure 2 : Exemple NGS_user_input.csv et NGS_user_metadata.csv. Exemples de NGS_user_input.csv (panneau supérieur) et NGS_user_metadata.csv (panneau inférieur), mettant en évidence la correspondance entre les colonnes designfactor et designfactor avec du texte et des flèches roses ou bleus. Veuillez cliquer ici pour voir une version agrandie de cette figure.

5. Prétraitement des données NGS

REMARQUE : Passez à la section 5 ou à la section 6 si vous utilisez un prétraitement personnalisé.

  1. Ouvrez le prétraitement NGS Jupyter Notebook (NGS_Preprocessing.ipynb).
  2. Activez WP_preprocessing environnement (créé à l’étape 1.2) dans le coin supérieur droit de l’interface du bloc-notes.
  3. Exécutez la première cellule en maintenant la touche Maj enfoncée, puis en appuyant sur Entrée (Maj+Entrée).
  4. Dans la deuxième cellule du bloc-notes Jupyter, mettez à jour le chemin d’accès au répertoire en définissant le répertoire = « chemin/vers/votre/données »,chemin/vers/votre/données/ est le répertoire créé dans la section 2.
  5. Générez des fichiers d’alignement. Les fonctions de prétraitement effectueront le découpage à l’aide de FastP18 ; Contrôle de la qualité à l’aide de FastQC19 et MultiQC20 ; Alignement à l’aide de STAR21. Les fichiers d’alignement de sortie sont enregistrés dans un sous-répertoire nommé startout dans le répertoire de données (par exemple, chemin/vers/votre/données/starout) ; Filtrage (facultatif) à l’aide de samtools view22, filtrez le fichier d’alignement pour ne garder que les lectures au-dessus d’un seuil spécifié dans NGS_user_inputs.csv.
    REMARQUE : Ces fonctions ne traiteront que des lectures uniques (par exemple, R1) de l’ensemble de données à la fois. Les utilisateurs peuvent spécifier des options d’exécution pour FastP et STAR dans le NGS_user_inputs.csv (par exemple, FastP : adapter_sequence (facultatif) ; STAR : genomeDir, genomeFastaFiles, sjdbGTFfil).
  6. Exécutez les fonctions de prétraitement dans la deuxième cellule avec Maj + Entrée.
    REMARQUE : Les tâches de la deuxième cellule peuvent prendre plusieurs heures. Si l’exécution est interrompue, répétez les étapes 5.3 à 5.6 pour redémarrer l’exécution. La progression des étapes précédentes ne sera pas écrasée et le processus reprendra là où il s’est arrêté.
  7. Générez des fichiers de trace de la couverture d’alignement à l’aide de BamCoverage23 (voir les étapes 5.7.1 et 5.7.2).
    REMARQUE : Pour ChIPseq, WonderPeaks nécessite des fichiers bedgraph uniques contenant une couverture pour les lectures avant et arrière. Pour le RNAseq avec amorçage Poly(A), PeakStream nécessite deux fichiers bedgraph, un pour les lectures directes (_fwd.bedgraph) et un pour les lectures inverses (_rev.bedgraph). Les lectures avant et arrière sont générées à l’aide du paramètre filterRNAstrand dans BamCoverage23.
    1. ChIPseq en utilisant les paramètres suivants : outfilfeformat="bedgraph », strand=None, binsize=20, smoothLength=60, minMappingQuality=255, normalizeUsing="CPM ».
      REMARQUE : Sortie : Produit des fichiers bedgraph uniques contenant une couverture pour les lectures avant et arrière. La sortie est stockée dans /path/to/your/data/bedgraphout (Figure 3).
      1. Exécutez la fonction BamCoverage dans la troisième cellule à l’aide de Maj + Entrée.
    2. RNAseq en utilisant les paramètres suivants : outfilfeformat="bedgraph », strand="forward » or « reverse », binsize=20, smoothLength=60, minMappingQuality=255, normalizeUsing="CPM ».
      ATTENTION : Assurez-vous d’exécuter la fonction deux fois avec strand réglé sur forward ou reverse pour générer des fichiers pour les lectures dans les deux sens.
      REMARQUE : Sortie : Produit deux fichiers bedgraph : un pour les lectures directes (_fwd.bedgraph) et un pour les lectures inverses (_rev.bedgraph). La sortie est stockée dans /path/to/your/data/ bedgraphout (Figure 3).
      1. Exécutez la fonction BamCoverage dans la troisième cellule à l’aide de Maj + Entrée.

figure-protocol-2
Figure 3 : Organisation des fichiers pour WonderPeaks. Une capture d’écran du dossier data avec les fichiers bedgraph dans le répertoire bedgrapghout/normalizeUsingCPM. Veuillez cliquer ici pour voir une version agrandie de cette figure.

6. WonderPeaks pour ChIPseq

  1. Pré-vérification
    1. Vérifiez que tous les fichiers bedgraph avec le descripteur de fichier .bedgraph se trouvent dans un sous-répertoire du répertoire de données appelé bedgraphout (Figure 3).
    2. Vérifiez que les facteurs de conception du fichier user_inputs (NGS_user_inputs.csv) (Figure 2) correspondent aux colonnes du fichier de métadonnées (NGS_user_metadata.csv) et que les lignes des colonnes du facteur de conception ne sont pas uniques (voir la mise en garde à l’étape 4.2.4).
  2. Ouvrez le prétraitement NGS Jupyter Notebook (WP4ChIP.ipynb).
  3. Activez WonderPeaks (environnement créé à l’étape 1.3) dans le coin supérieur droit de l’interface du bloc-notes.
  4. Exécutez les cellules à l’aide de Maj+Entrée jusqu’au point d’arrêt pour exécuter l’appel de pointe. Une fois terminé, un enregistrement des données traitées sera sauvegardé et stocké dans un sous-répertoire du répertoire de données appelé WonderPeaks
    1. Recherchez WOnder_init.csv : une concaténation de toute la couverture brute et des résultats du calcul de la dérivée première.
    2. Note WOnder_unfiltered_peaks.csv : une concaténation de tous les pics non filtrés appelés sur la base de la dérivée première.
    3. Observe bedgraph_summary.csv : un résumé des statistiques de score après regroupement de chaque fichier et chromosome.
  5. Définissez les paramètres d’exécution :
    1. Exécutez la 1èrecellule en dessous du point d’arrêt Markdown.
      REMARQUE : Un graphique affichant les données brutes séparées par les facteurs de conception spécifiés et un tableau montrant les facteurs de conception apparaîtront ; utilisez le tableau et le graphique pour déterminer les valeurs dans les étapes suivantes (Figure 4).
    2. Dans la cellule suivante, spécifiez les valeurs de score_cut, fold_change et designfactor (Figure 4).
      1. score_cut s’agit de la valeur seuil utilisée pour déterminer si un pic doit être pris en compte dans la sortie. Pour déterminer la score_cut, observez le graphique et choisissez une valeur proche de la médiane des données balisées (voir ligne hachée, Figure 4). Entrez cette valeur comme suit : score_cut= valeur.
      2. fold_change est la valeur seuil des scores de ratio tagged :untagged utilisée pour déterminer si un pic est considéré comme réel. Pour déterminer le fold_change, observez le graphique et choisissez une valeur supérieure au rapport des médianes des données non balisées et balisées. Entrez cette valeur comme suit : fold_change= valeur.
      3. designfactor_value est spécifié dans le cadre du plan d’expérience. Les facteurs de conception possibles sont énumérés en rouge dans le tableau imprimé. Pour déterminer le facteur de conception, choisissez l’une des valeurs indiquées en rouge. Entrez cette valeur entre guillemets comme suit : designfactor_value ="{ value} ».
  6. Exécutez les cellules suivantes à l’aide de Maj + Entrée pour exécuter le filtrage et le mappage des pics. Les données et les graphiques récapitulatifs seront stockés dans un sous-répertoire du répertoire de données appelé WonderPeaks.
    1. Observez {designfactor_value}_taggedVuntagged.csv : un tableau croisé dynamique de tous les pics qui se chevauchent avec une colonne pour chacun des échantillons étiquetés et non étiquetés.
    2. Note {designfactor_value}_all_tagged_peaks.csv : Un tableau récapitulatif de tous les pics réels, basé sur les paramètres de l’utilisateur (étape 6.5).
    3. Observe {designfactor_value}_peaks2gtf.csv : une cartographie des pics réels, basée sur les paramètres de l’utilisateur (étape 6.5), aux gènes dans le fichier d’annotations spécifié par l’utilisateur.
  7. Facultatif : Basculez les paramètres à l’étape 6.5 en réexécutant les étapes 6.5 et 6.6. Si vous utilisez le même designfactor_value, les fichiers générés, comme décrit à l’étape 6.6, seront écrasés.

figure-protocol-3
Figure 4 : Capture d’écran mettant en évidence les seuils designfactor_value et spécifiés par l’utilisateur dans WonderPeaks pour ChIP-seq. Capture d’écran du bloc-notes jupyter de WonderPeaks, mettant en évidence les options de designfactor_value possibles à partir du tableau affiché et comment implémenter le designfactor_value dans la cellule suivante. La flèche noire supérieure pointe vers un tableau affichant les entrées de designfactor_value possibles. la valeur Op est encerclée et affichée comme l’entrée utilisateur sélectionnée pour designfactor_value dans la cellule des options (flèche noire en bas). Dans le graphique, les lignes pleines et pointillées indiquent les scores de crête médians approximatifs pour les échantillons marqués et non marqués, respectivement, dans les expériences sur cellules opaques. Ces médianes sont utilisées pour définir les paramètres score_cut (médiane balisée) et fold_change (le rapport entre les médianes balisées et non balisées). Veuillez cliquer ici pour voir une version agrandie de cette figure.

7. PeakStream pour 3'RNAseq

  1. Pré-vérification :
    1. Vérifiez que tous les fichiers bedgraph se trouvent dans un sous-répertoire du répertoire de données appelé bedgraphout (Figure 2).
    2. Ouvrez le bloc-notes Jupyter de prétraitement NGS (PeakStream.ipynb)
    3. Activez WonderPeaks (environnement créé à l’étape 1.3) dans le coin supérieur droit de l’interface du bloc-notes.
  2. Exécutez les cellules à l’aide de Maj+Entrée jusqu’au point d’arrêt pour exécuter l’appel de pointe et le mappage de pointe. Une fois terminé, un nouveau fichier d’annotation avec des UTR 3' prédits et des fichiers de comptage de lecture FeatureCounts24 sera enregistré et stocké dans un sous-répertoire de votre répertoire de données appelé PeakStream (Figure 5).
    REMARQUE : Par défaut, le fichier de sortie n’inclura que des annotations pour les biotypes codant pour les protéines, mais cela peut être basculé à l’aide de l’option biotype.

figure-protocol-4
Figure 5 : Organisation des fichiers pour PeakStream. Une capture d’écran du dossier data avec les fichiers bedgraph dans le répertoire bedgrapghout. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pics d’émerveillement
Après avoir réalisé une expérience ChIP-seq, les chercheurs utilisent couramment des appelants de pointe, tels que MACS3, pour identifier des régions génomiques enrichies par une protéine de liaison à l’ADN marquée par un épitope. Nous avons développé WonderPeaks en tant qu’appelant de pic convivial conçu pour identifier les pics à l’aide de la méthode décrite ci-dessus.

WonderPeaks identifie les pics en calculant d’abord la dér...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les techniques de séquençage de nouvelle génération (NGS) fournissent des informations inégalées sur la régulation et l’expression des gènes chez les agents pathogènes fongiques. En tant que tels, les outils de calcul doivent être à la fois complets - capturant toutes les données générées dans une expérience - et accessibles au grand public, en particulier aux scientifiques de laboratoire. Dans ce rapport, nous avons présenté deux outils, WonderPeaks et PeakStream, qui répondent à ces be...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont aucun conflit d’intérêts à déclarer.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce travail a été soutenu par des subventions des National Institutes of Health (NIH) RO1AI175080 et R01GM037049 (à Alexander D. Johnson) et une subvention de formation NIH T32 AI 60537-20 (à H.G). Nous remercions Alexander Johnson, Matthew Lohse, Jenny Zhang et Brian Wang pour leurs discussions et leurs conseils utiles. Nous remercions également les membres du laboratoire de Carol Gross pour leurs commentaires. Nous remercions Ananda Mendoza pour son soutien technique. Le séquençage a été effectué à l’UCSF CAT, avec le soutien des subventions UCSF PBBR, RRP IMIA et NIH 1S10OD028511-01. Nous reconnaissons l’utilisation de ChatGPT d’OpenAI pour l’aide au dépannage du code et la fourniture de suggestions pour modifier le manuscrit.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
CORALL Total RNA-seq V1 kitLexogen095Matériel de laboratoire humide  ;
Champignons filamenteux riboPOOLsiTOOLsdp-P096-6Matériau de laboratoire humide  ;
ScreenTape d’ARN haute sensibilitéAgilent5067-5579Matériel de laboratoire humide  ;
Échelle de ruban d’écran d’ARN haute sensibilitéAgilent5067-5581Matériel de laboratoire humide  ;
Tampon d’échantillon d’ARN ScreenTape haute sensibilitéAgilent5067-5580Matériel de laboratoire humide  ;
liste des dépendances pour WonderPeaks
https://github.com/mgarber21/WonderPeaks_preprocessing/blob/main/environment.ymlliste des dépendances pour WonderPeaks_preprocessing
Monarch Spin RNA Cleanup KiNEBT2040LMatériel de laboratoire humide  ;
pygenometracks (3.9)
QuantSeq 3&prime ; mRNA-Seq FWD Library Prep Kit V1Lexogen015Matériel de laboratoire humide  ;
Kit de dosage de l’ARN Qubit à haute sensibilité (HS)InvitrogenQ32852Matériel de laboratoire humide  ;
ARN propre & Concentrateur-5Zymo ResearchR1016Matériel de laboratoire humide  ;
Kit TURBO sans ADNThermoFisherAM1907Matériel de laboratoire humide  ;
Pics Merveilleux(0.1.14)
WonderPeaks_preprocessing(0.2.3)
https://github.com/mgarber21/WonderPeaks/blob/main/environment.yml

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. fungal priority pathogens list to guide research, development and public health action. , WHO. https://www.who.int/publications/i/item/9789240060241 (2022).
  2. Fisher, M. C., Denning, D. W. The WHO fungal priority pathogens list as a game-changer. Nat Rev Microbiol. 21 (4), 211-212 (2023).
  3. Gaspar, J. M. Improved peak-calling with MACS2. bioRxiv. 496521, (2018).
  4. Muñoz, J. F., et al. Coordinated host-pathogen transcriptional dynamics revealed using sorted subpopulations and single macrophages infected with Candida albicans. Nat Commun. 10 (1), 1607(2019).
  5. Miramón, P., Pountain, A. W., Lorenz, M. C. Candida auris-macrophage cellular interactions and transcriptional response. Infect Immun. 91 (11), e0027423(2023).
  6. Lindemann-Perez, E., Rodríguez, D. L., Pérez, J. C. An approach to analyze spatiotemporal patterns of gene expression at single-cell resolution in Candida albicans-infected mouse tongues. mSphere. 9 (9), e0028224(2024).
  7. Mo, X., et al. In vivo RNA sequencing reveals a crucial role of Fus3-Kss1 MAPK pathway in Candida glabrata pathogenicity. mSphere. 9 (11), e0071524(2024).
  8. Haas, B. J., Chin, M., Nusbaum, C., Birren, B. W., Livny, J. How deep is deep enough for RNA-Seq profiling of bacterial transcriptomes. BMC Genomics. 13, 734(2012).
  9. Zaheer, R., et al. Impact of sequencing depth on the characterization of the microbiome and resistome. Sci Rep. 8 (1), 5890(2018).
  10. Xiong, Y., et al. A comparison of mRNA sequencing with random primed and 3′-directed libraries. Sci Rep. 7 (1), 14626(2017).
  11. Ma, F., et al. A comparison between whole transcript and 3' RNA sequencing methods using Kapa and Lexogen library preparation methods. BMC Genomics. 20, 9(2019).
  12. Fansler, M. M., Mitschka, S., Mayr, C. Quantifying 3′UTR length from scRNA-seq data reveals changes independent of gene expression. Nat Commun. 15 (1), 4050(2024).
  13. Tuch, B. B., et al. The transcriptomes of two heritable cell types illuminate the circuit governing their differentiation. PLoS Genet. 6, e1001070(2010).
  14. Shenker, S., Miura, P., Sanfilippo, P., Lai, E. C. IsoSCM: improved and alternative 3′ UTR annotation using multiple change-point inference. RNA. 21 (1), 14-27 (2015).
  15. Haese-Hill, W., Crouch, K., Otto, T. D. peaks2utr: a robust Python tool for the annotation of 3′ UTRs. Bioinformatics. 39 (3), btad112(2023).
  16. Anaconda - Getting started. , https://docs.anaconda.com/anaconda/getting-started/ (2025).
  17. Pryke, B. Jupyter Notebook tutorial. , https://www.dataquest.io/blog/jupyter-notebook-tutorial/ (2025).
  18. Chen, S., Zhou, Y., Chen, Y., Gu, J. fastp: an ultra-fast all-in-one FASTQ preprocessor. Bioinformatics. 34 (17), i884-i890 (2018).
  19. Andrews, S. FastQC: a quality control tool for high throughput sequence data. , https://www.bioinformatics.babraham.ac.uk/projects/fastqc/ (2010).
  20. Ewels, P., Magnusson, M., Lundin, S., Käller, M. MultiQC: summarize analysis results for multiple tools and samples in a single report. Bioinformatics. 32 (19), 3047-3048 (2016).
  21. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  22. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), giab008(2021).
  23. Ramírez, F., et al. deepTools2: a next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44 (W1), W160-W165 (2016).
  24. Liao, Y., Smyth, G. K., Shi, W. featureCounts: an efficient general purpose program for assigning sequence reads to genomic features. Bioinformatics. 30 (7), 923-930 (2014).
  25. Lohse, M. B., Johnson, A. D. Identification and characterization of Wor4, a new transcriptional regulator of white-opaque switching. G3 (Bethesda). 6 (3), 721-729 (2016).
  26. Nagalakshmi, U., et al. The transcriptional landscape of the yeast genome defined by RNA sequencing. Science. 320 (5881), 1344-1349 (2008).
  27. Diaz, A., Park, K., Lim, D. A., Song, J. S. Normalization, bias correction, and peak calling for ChIP-seq. Stat Appl Genet Mol Biol. 11 (3), Article 9(2012).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Analyse ChIP Seqalgorithme WonderPeaksoutil PeakStreamr gulation de la transcriptionannotation des 3 UTRs quen age de nouvelle g n rationCandida albicans
Vidéo bientôt disponible

Articles connexes