$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La qualité et le découpage de l’adaptateur permettent de conserver les lectures avec une qualité de séquençage élevée
Les techniques de séquençage à haut débit sont susceptibles de générer des erreurs de séquençage telles que des « mutations » de séquence dans les lectures. De plus, les dimères d’adaptateur de séquençage peuvent être enrichis dans les ensembles de données de séquençage en raison d’une mauvaise suppression de l’adaptateur lors de la préparation de la bibliothèque. Des erreurs de séquençage excessives, telles que des mutations de lecture, la génération de lectures plus courtes que nécessaire pour un mappage correct et l’enrichissement des dimères de l’adaptateur, peuvent augmenter le temps de mappage de lecture et peuvent produire des lectures mappées faussement positives qui faussent les résultats de l’analyse bio-informatique en aval. Par conséquent, un filtrage de qualité et un découpage de l’adaptateur sont nécessaires pour conserver des lectures de haute qualité pour l’analyse et l’interprétation en aval.
Afin de conserver des lectures de haute qualité pour l’analyse, ce pipeline d’analyse CUT&RUN (Figure 2) utilise FastQC26 et Trim Galore27. Le script shell « Script_03_fastQC.sh » exécute FastQC pour tous les fichiers fastq du répertoire de travail. Les résultats (figure 3) de cette étape, à l’aide de l’ensemble de données CTCF CUT & RUN accessible au public de GSE126612 (SRR8581589), identifient certaines lectures avec des bases de score de faible qualité (figure 3A, C) et certains degrés de non-concordance de la distribution du contenu GC par séquence entre l’estimation théorique et les lectures réelles (figure 3E).
L’exécution du script « Script_04_trimming.sh » pour exécuter Trim Galore supprime avec succès les lectures avec des bases de score de faible qualité (inférieures à 20 dans la figure 3A) et de faibles qualités de séquence moyennes évidentes avant le découpage (Figure 3B-D). De plus, « Script_04_trimming.sh » permet également de supprimer avec succès l’enrichissement moyen du contenu GC de 55 ~ 60 % affiché dans la distribution GC « pré-découpage » sur le graphique de séquence (Figure 3E, F). Ces résultats démontrent que ce pipeline d’analyse CUT&RUN filtre les lectures de haute qualité pour faciliter une cartographie rapide et précise des lectures vers le génome de référence.
La distribution de la taille de l’insert peut donner une estimation des résultats d’appel de pointe
En raison de l’utilisation de la MNase dans CUT&RUN (Figure 1), les lectures CUT&RUN cartographiées devraient présenter des pics de taille de fragments d’ADN mono- (~200 pb) et di-nucléosomale (~350 pb) dans les graphiques de distribution de la taille des inserts (Figure 4). Des problèmes de détection pour certaines cibles peuvent entraîner des inserts courts (< 100 pb) (Figure 4C). Un niveau élevé de lectures courtes réduit le nombre de lectures pouvant être utilisées pour les appels de pointe à haut niveau de confiance, réduisant ainsi le nombre de pics et impactant l’analyse en aval. Dans ce pipeline d’analyse CUT&RUN, « Script_10_insert-size-analysis.sh » exécute la fonction « picard.jar CollectInsertSizeMetrics » pour effectuer l’analyse de la distribution de la taille d’insert et exporter les histogrammes en tant que sortie de visualisation (Figure 2). Dans les tracés de sortie (Figure 4A-C), l’axe des x indique la plage de tailles d’insertion, le côté gauche de l’axe des y et l’histogramme plein représentent le nombre d’inserts dont la valeur se trouve sur l’axe des x, et le côté droit de l’axe des y montre, avec la ligne pointillée, la fraction cumulée des inserts dont la taille est égale ou supérieure à la valeur de l’axe des x. Par conséquent, l’emplacement sur l’axe des X avec le changement de pente le plus spectaculaire de la ligne pointillée qui coupe le niveau supérieur de l’histogramme identifie la taille principale de l’insert dans l’échantillon. Parmi les lectures cartographiées sur le génome de référence d’intérêt (humain, hg19), les fragments d’échantillon H3K27Ac (marque d’histone active) présentent la distribution attendue de la taille des inserts CUT&RUN avec la taille mononucléosomale la plus élevée et des pics de taille di-nucléosomale détectables (Figure 4B). Les fragments d’échantillon CTCF ont montré des groupes supplémentaires dans des régions de longueur de fragment de 100 ~ 200 pb (Figure 4A). Dans l’ensemble, le pipeline d’analyse CUT&RUN fournit des scripts shell faciles à utiliser pour effectuer une analyse de la distribution de la taille des inserts après avoir cartographié les lectures sur les génomes de référence. Ces analyses deviennent importantes pour estimer l’efficacité des appels de pointe avant l’analyse en aval.
Le pipeline d’analyse CUTnRUN d’Easy Shells fournit des options de filtration et de normalisation pour créer des comptages de lecture fiables
L’un des points critiques de l’analyse CUT&RUN est d’obtenir des paires de lecture mappées appropriées en filtrant les paires de lecture problématiques à partir des sorties de mappage initiales et en normalisant le nombre de lectures mappées filtrées avec une méthode de calcul de normalisation spécifique qui peut répondre aux objectifs/besoins de l’analyse de l’utilisateur. Le pipeline d’analyse CUT&RUN discuté dans cette étude comprend un script « Script_07_filter-sort-bam.sh » pour supprimer les paires de lecture qui sont mappées sur des chromosomes non canoniques, les régions23 de la liste noire annotées publiquement, et TA répète les régions18,22 à partir des paires lues qui ont été mappées par le nœud papillon2 à l’aide de « Script_06_bowtie2-mapping.sh ». Ces filtrations sont nécessaires pour supprimer les paires de lecture qui peuvent produire des signaux de pointe de faux-positifs, des valeurs aberrantes et des pics appelés dans l’analyse en aval (Figure 5 ; régions de la boîte jaune).
En plus des filtrations, l’application de la bonne méthode de normalisation est un facteur important pour visualiser avec précision la différence de signal entre les échantillons. Par conséquent, le pipeline d’analyse CUT&RUN comprend des scripts « Script_09_normalization_SFRC.sh » et « Script_09_normalization_SRPMC.sh » pour fournir deux méthodes de normalisation vérifiées publiquement : la lecture fractionnée mise à l’échelle (SFRC)22 et le nombre de lectures mappées par million normalisées de pointes de pointe dans le contrôle négatif (SRPMC)24,25 (Figure 5A-D). Étant donné que SFRC n’inclut pas de contrôle (par exemple, IgG) ni d’échantillon de pointe dans la formule, la normalisation SFRC peut être utilisée pour des échantillons qui ne comprennent aucun échantillon de contrôle ou qui sont censés montrer des différences de signal dans des régions locales uniquement sans différence d’échelle à l’échelle du génome. Les échantillons normalisés SFRC traités par le pipeline d’analyse CUT&RUN (Figure 5A-D ; pistes rouges) produisent les mêmes modèles de distribution de signaux que les lectures cartographiées de GEO accessibles au public (Figure 5A-D ; pistes noires), ce qui suggère que ce pipeline peut reproduire les résultats de la publication.
La méthode SRPMC est utile pour normaliser les échantillons qui comprennent à la fois des échantillons de contrôle et des échantillons de pointe et qui devraient montrer une différence de signal globale entre les échantillons (figure 5A-D ; pistes vertes). Étant donné qu’un échantillon H3K27Ac (SRR8581599) présente un rapport « (lectures CUT et RUN réelles)/(lectures de pointe) » (RPS d’échantillon ; 997) beaucoup plus élevé que les autres répétitions (237, 175 et 161), les signaux H3K27Ac relatifs semblent différents entre les répétitions dans les échantillons normalisés SFRC et SRPMC (Figure 5A-D ; H3K27Ac comparé sur toutes les pistes). Les échantillons RNAPII-S5P présentent un RPS d’échantillon (1,7, 0,8, 2,1) relativement plus faible que le contrôle IgG (259), de sorte que les échantillons RNAPII-S5P présentent un signal inférieur à celui du contrôle IgG après normalisation SRPMC (Figure 5A-D ; RNAPII-S5P comparé sur toutes les pistes). Par conséquent, le pipeline d’analyse CUT&RUN abordé ici recommande d’utiliser la méthode SRPMC uniquement pour les échantillons qui ont suffisamment de lectures dans les échantillons expérimentaux par rapport aux lectures de contrôle IgG et de contrôle de pointe.
La comparaison du diagramme de Venn peut donner des idées pour choisir une meilleure méthode d’appel de pic et des options
Plusieurs programmes d’appel de pic permettent d’identifier une occupation protéique significativement enrichie dans l’ensemble du génome. Les programmes utilisés pour l’analyse CUT&RUN comprennent les programmes de la famille MACS2 et SEACR4 qui sont les principales méthodes à ce jour. Cependant, il peut être difficile, en particulier pour les débutants en bioinformatique, d’identifier la méthode et les options d’appel de pic les plus appropriées pour un projet CUT&RUN donné. Par conséquent, le pipeline d’analyse CUT&RUN comprend des étapes d’analyse du diagramme de Venn pour donner aux utilisateurs la possibilité de comparer la similitude et la différence des résultats d’appel de pointe entre diverses options d’appel de pointe (options Script_17_intervene) et programmes d’appel de pointe (Script_19_intervene_methods.sh) (Figure 6A-H).
D’après la comparaison, les pics fusionnés CTCF, H3K27ac et RNAPII-S5P qui sont appelés avec et sans option de contrôle IgG pendant l’étape d’appel de pointe, MACS2 et MACS3 ont appelé plus de pics avec l’option de contrôle IgG (Figure 6A), mais SEACR a appelé plus de pics sans option de contrôle IgG dans les options strictes et détendues (Figure 6B-D). Par conséquent, le pipeline d’analyse CUT&RUN suggère (1) d’appliquer l’option de contrôle IgG pour MACS2 et MACS3, (2) d’appeler séparément les pics pour les échantillons expérimentaux CUT&RUN et les échantillons de contrôle IgG, puis de filtrer les pics IgG ultérieurement pour l’appelant de pic SEACR. Entre MACS2 et MACS3, MACS3 a appelé un peu plus de pics (Figure 6A).
De plus, la comparaison des pics appelés par MACS2 et MACS3 avec l’option de contrôle IgG et SEACR sans option de contrôle IgG montre que les pics SEACR appelés avec l’option stricte se chevauchent davantage avec les pics MACS 2 et MACS3 que les pics SEACR appelés avec l’option détendue (Figure 6E,F). Ainsi, les sorties du pipeline d’analyse CUT&RUN suggèrent que l’option stricte maximise la cohérence SEACR avec les appels de pointe MACS. Enfin, le diagramme de Venn permettant de comparer le chevauchement des pics appelés par SEACR avec normalisation pour les fichiers bedGraph CUT&RUN et sans normalisation pour les fichiers bedGraph CUT&RUN normalisés ne révèle aucune différence entre les méthodes SFRC et SRPMC pour SEACR avec l’option stricte. Les pics SFRC présentent des nombres de pics beaucoup plus élevés et un meilleur chevauchement avec les pics d’options normalisées (« norme » dans la figure 6) que les pics SRPMC pour SEACR avec des options détendues (figures 6G, H).
Comparaisons statistiques entre les répétitions et les échantillons
Pour tirer des conclusions précises sur plusieurs répétitions, il faut évaluer la similitude des répétitions. Le pipeline d’analyse CUT&RUN utilisé ici utilise le calcul du coefficient de corrélation statistique basé sur Deeptools215, le regroupement de cartes thermiques et l’analyse en composantes principales (PCA) pour faciliter l’identification des échantillons et des réplications appropriés pour une analyse en aval valide. Le regroupement de cartes thermiques basé sur le coefficient de corrélation de Pearson a montré une corrélation statistiquement significative entre les répétitions pour CTCF, H3K27Ac et RNAPII-S5P à leurs régions de pic appelées (figure 7A-C). Cependant, l’ACP a montré qu’un échantillon de CTCF (SRR8581590) et H3K27Ac (SRR8581608) est situé relativement loin des autres réplicats (Figure 7D) dans toutes les régions de CTCF, H3K27Ac et RNAPII-S5P appelées régions de pic.
Selon le diagramme de Venn pour comparer les pics entre les répétitions, les pics CTCF (SRR8581590) ont montré le moins de chevauchement avec d’autres répétitions dans les trois résultats d’appel de pic (Figure 7E-G), et les pics H3K27Ac (SRR8581608) ont montré le moins de chevauchement avec d’autres répétitions dans les résultats d’appel de crête SEACR (Figure 7F). les pics H3K27Ac (SRR8581608) n’ont pas présenté de chevauchement minimal avec d’autres répétitions dans les résultats d’appel de pics MACS2 et MACS3 (figure 7F), ce qui peut suggérer que la distance entre les répétitions dans l’ACP n’est pas suffisante pour définir un échantillon aberrant. Par conséquent, le pipeline d’analyse CUT&RUN propose de définir la réplication aberrante comme « l’échantillon qui présente un faible coefficient de corrélation de Pearson dans le groupe de clustering de cartes thermiques, une longue distance dans le tracé PCA avec d’autres répétitions et un chevauchement de pics le plus faible entre les répétitions ».
L’appel de pointe facilite la visualisation et l’interprétation des données CUT&RUN
Le pipeline d’analyse CUT&RUN détaillé dans cette étude utilise deux types d’appelants de pointe accessibles au public : la famille MACS et SEACR. Pour optimiser la visualisation des pics appelés, ce pipeline sélectionne le bac de signal le plus élevé comme centre de pic pour les analyses de carte thermique et de méta-tracé. Tous les pics CTCF, H3K27Ac et RNAPII-S5P appelés par les appelants de crête MACS3 et SEACR ont montré un modèle de distribution de pic plus net au centre des bins de signaux les plus élevés (Figure 8A-F, graphiques « focalisés ») qu’au centre de régions de pics entières (Figure 8A-F, graphiques « entiers »). Les échantillons CUT&RUN traités par le pipeline d’analyse CUTnRUN d’Easy Shells avec normalisation SFRC (Figure 8 A-F, graphiques « SFRC ») présentent des modèles de distribution de signal similaires à ceux des échantillons normalisés SFRC dont les paires de lecture brutes mappées sont disponibles publiquement dans GEO (Figure 8A-F, graphiques « publics ») aux pics appelés par le pipeline d’analyse. Ainsi, le pipeline d’analyse CUT&RUN peut reproduire avec succès les résultats de publication.

Figure 1 : Schéma de la procédure expérimentale CUT&RUN. CUT&RUN est une approche enzymatique permettant de détecter les interactions protéine-ADN dans le génome. La procédure CUT&RUN commence par la liaison des cellules (ou des noyaux isolés) au concanavalin A conjugué à des billes magnétiques pour permettre l’isolement et la manipulation d’un faible nombre de cellules tout au long de la procédure. Les cellules isolées sont perméabilisées à l’aide d’un détergent doux pour faciliter l’introduction d’un anticorps qui cible la protéine d’intérêt. La nucléase micrococcique (MNase) attachée à la protéine A ou à l’étiquette de la protéine A/G est ensuite introduite dans la cellule perméabilisée. La pA-MNase (ou pAG-MNase) est recrutée dans l’anticorps lié à l’aide d’une étiquette de protéine A ou de protéine A/G. Une fois que la MNase est localisée sur les sites cibles, la nucléase est brièvement activée par l’introduction de calcium pour digérer l’ADN autour de la protéine cible. La digestion de la MNase aboutit à des complexes mononucléosomales ADN-protéines. Le calcium est ensuite chélaté pour terminer la réaction de digestion, et de courts fragments d’ADN issus de la digestion de la MNase sont libérés des noyaux par une courte incubation à 37°C, puis soumis à la purification de l’ADN, à la préparation de banques et au séquençage à haut débit1. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Figure 2 : Résumé schématique du pipeline d’analyse CUT&RUN d’Easy-Shell. Le pipeline d’analyse CUT&RUN Easy-Shell est conçu en trois sections principales : (1) le contrôle qualité et le mappage des fichiers de lecture bruts (à gauche ; violet), (2) la normalisation des lectures et des nombres de lectures mappés et des appels de pics (au centre ; vert), et (3) la validation des lectures mappées et des pics appelés (à droite ; rose). Dans chaque étape, le numéro de script shell correspondant, une brève description et l’outil de programme utilisé dans cette étape (entre parenthèses) sont fournis. Les flèches de la plaine indiquent les écoulements directs entre les pas. Ce pipeline d’analyse CUT&RUN fournit deux méthodes de normalisation de lecture qui peuvent répondre aux besoins des utilisateurs avec et sans lectures de contrôle, des processus de validation multicouches pour identifier les répliques appropriées pour l’analyse en aval et l’identification ciblée des pics pour la création de cartes thermiques et de métaplots bien ciblés. Ce pipeline d’analyse est écrit dans des scripts shells faciles à utiliser de manière étape par étape pour offrir aux débutants en bioinformatique la possibilité d’apprendre et de pratiquer l’analyse de base des données CUT&RUN en lisant et en éditant les scripts eux-mêmes. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Figure 3 : Comparaison des résultats du contrôle de la qualité avant et après l’élagage de la qualité. Certaines sorties de rapport de contrôle qualité de FastQC affichent l’effet du découpage de la qualité à l’aide des lectures de SRR8581589 (GSM3609748, CTCF). Les résultats affichés sont les suivants : (A) Score de qualité sur l’ensemble des bases avant le rognage. (B) Même lecture que A) post-rognage. (C) Distribution du score de qualité sur toutes les séquences avant le découpage. (D) Même lecture que C) post-rognage. (E) Distribution du CG sur toutes les séquences avant le découpage. (F) Même lecture que E) post-rognage. Le score de qualité minimum à chaque position dans les lectures de séquençage (A, B) et la qualité moyenne minimale de la séquence (C, D) sont augmentés après le découpage de la qualité. De plus, cette étape peut réduire la différence entre la distribution théorique des nombres GC et le nombre réel de GC par base dans les lectures (E, F) en supprimant les paires de lectures qui ont un taux de non-correspondance de base élevé. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Figure 4 : Analyse de la distribution de la taille des inserts. Histogramme de la taille de l’insert pour (A) CTCF, (B) H3K27Ac et (C) l’ARN polymérase phosphorylée sérine 5 II (RNAPII-S5P). Les histogrammes montrent les différences relatives dans la distribution de la taille des inserts entre les échantillons. La ligne pointillée dans l’histogramme représente la fraction cumulée des lectures dont la taille d’insertion est supérieure ou égale à la valeur sur l’axe des x. N : nombre de lectures uniques cartographiées de manière concordante par échantillon après filtration. FR : fragments. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Figure 5 : Vue d’ensemble des échantillons CUT&RUN. Les lectures cartographiées CUT&RUN accessibles au public normalisées par le comptage fractionnaire échelonné (SFRC) sans filtration supplémentaire (pistes noires), les échantillons CUT&RUN traités par le pipeline d’analyse CUTnRUN d’Easy Shells avec normalisation SFRC (pistes rouges) et les lectures mappées « Spike-in normalized Per Million mapped reads in the negative Control (SRPMC ; pistes vertes) » sont montrées dans la région du cluster des gènes d’histones, et (B-D) trois autres régions avec des pics CTCF, H3K27Ac et RNAPII-S5P appelés par tous les appelants de pic MACS2, MACS3 et SEACR. Les cases jaunes mettent en évidence l’emplacement des signaux de pointe filtrés pendant l’étape de filtration dans le pipeline d’analyse CUTnRUN d’Easy Shells. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Figure 6 : Diagramme de Venn pour comparer les pics appelés par différents appelants de crête et les options d’appel de crête. (A) Comparaison entre les pics appelés par MACS2 et MACS3 avec et sans option d’entrée IgG pendant l’appel de pointe. (B-D) Comparaison entre les pics appelés par SEACR avec et sans l’option d’entrée IgG, les options 'strictes' et 'détendues', et avec l’option de normalisation à l’aide de fichiers de paires de lectures brutes (B), sans option de normalisation à l’aide de fichiers de comptage de lectures normalisés SFRC (C) ou de fichiers de comptage de lectures normalisés SRPMC (D). (E, F) Comparaison entre les pics appelés par MACS2, MACS3 avec l’option d’entrée IgG et SEACR avec l’option stricte (E) ou relâchée (F). (G,H) Comparaison entre les pics appelés par SEACR sans option d’entrée IgG et avec des options strictes (G) ou relâchées (H). avec IgG : pics appelés avec l’option d’entrée IgG. sans IgG : pics appelés sans l’option d’entrée IgG. norm : pics appelés avec l’option de normalisation. non : pics appelés sans option de normalisation. SFRC : pics appelés par des fichiers readcounts normalisés par la méthode du 'scaled fractional count (SFRC)'. SRPCM : pics appelés par des fichiers readcounts normalisés par la méthode SRPMC (Spike-in normalized Reads Per Million mapped reads in the negative Control). Veuillez cliquer ici pour voir une version agrandie de cette figure.

Figure 7 : Corrélation de Pearson, analyse en composantes principales et diagramme de Venn pour valider la similarité entre les répétitions. (A-C) Le regroupement des cartes thermiques avec les valeurs des coefficients de corrélation de Pearson affiche le degré de similitude entre les répétitions aux pics appelés par MACS2 (A), MACS3 (B) et SEACR (C). Le coefficient de corrélation de Pearson est dans une valeur comprise entre -1 et 1. Une valeur de coefficient de corrélation de Pearson absolue plus élevée indique une corrélation plus forte entre deux variables, et une valeur de coefficient de corrélation de Pearson positive indique une corrélation positive, où les deux variables se déplacent dans la même direction. Par conséquent, les échantillons présentant une similitude plus élevée présentent un pedigree plus proche dans le regroupement Heatmap et une valeur de coefficient de Pearson plus élevée. (D) L’analyse en composantes principales (ACP) montre un degré de similitude entre les répétitions et les échantillons à toutes les régions de pic CTCF, H3K27Ac et RNAPII-S5P qui sont appelées par MACS2 (à gauche), MACS3 (au centre) et SEACR (à droite). Les échantillons présentant une similitude plus élevée sont positionnés plus près les uns des autres dans le graphique ACP. (E-G) Analyse du diagramme de Venn pour comparer les pics trouvés dans chaque réplication par MACS2 (E), MACS3 (F) et SEACR (G). Le pipeline d’analyse CUT&RUN d’Easy-Shell a proposé d’appliquer les trois méthodes pour identifier les réplicats à forte similarité qui pourraient convenir à la fusion des pics appelés pour l’analyse en aval. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Figure 8 : Visualisation de la carte thermique et du métagraphique de la distribution du signal aux pics. La carte thermique et les métagraphiques affichent la distribution de l’enrichissement autour des centres de pic appelés à l’aide de différents appelants de pic. (A,B) Pics de couper-descendre CTCF appelés à partir d’une répétition (SRR8581589) par MACS3 (A) et SEACR (B). (C, D) H3K27Ac CUT&RUN pics appelés à partir d’une répétition (SRR8581607) à l’aide de MACS3 (C) et SEACR (D). (E, F) Pics RNAPII CUT&RUN appelés à partir d’une répétition (SRR8581589) par MACS3 (E) et SEACR (F). Les paires de lecture mappées accessibles au public (« Public » dans la figure 8) et les fragments mappés par le pipeline d’analyse CUTnRUN d’Easy Shells (« SFRC » dans la figure 8) sont comparés après la normalisation du « comptage fractionnel mis à l’échelle (SFRC) ». Les pics sont appelés par MACS3 avec l’option d’entrée IgG (« MACS3 w/ IgG » dans la figure 8) et SEACR sans entrée IgG et sans option de normalisation à l’aide de fichiers de comptage de lectures normalisés SFRC en mode strict (« SEACR w/o IgG non SFRC stringent » dans la figure 8). Deux versions des fichiers de coordonnées des pics appelés sont préparées : du début à la fin des pics appelés (« entier » dans la figure 8) et l’emplacement du bin avec le signal le plus élevé à l’intérieur des pics appelés (sommets dans MACS3 appelés pics ; « focalisé » dans la figure 8). Veuillez cliquer ici pour voir une version agrandie de cette figure.
Tableau 1 : Informations pour les fichiers fastq CUT&RUN dans GSE126612. Tous les fichiers fastq CUT&RUN de lecture brute qui sont inclus dans GSE126612 et sont sélectionnés comme exemple de jeu de données pour le pipeline d’analyse CUTnRUN d’Easy Shells sont répertoriés sous forme de table. La colonne 'Nom de fichier' affiche les noms de fichiers des lectures brutes de CUT&RUN fastq qui seront affichés dans '~/Desktop/GSE126612/fastq' après l’exécution de 'Script_02_download-fastq.sh'. 'md5sum' partage MD5 (Message-Digest Algorithm 5) pour l’exemple de jeu de données qui peut être utilisé pour vérifier l’intégrité des fichiers après avoir téléchargé le jeu de données en exécutant 'Script_02_download-fastq.sh'. La dernière colonne décrit l’objectif de CUT&RUN pour chaque échantillon. Veuillez cliquer ici pour télécharger ce tableau.