$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
L’expression des gènes doit être étroitement régulée pour que les cellules puissent établir et maintenir leur fonction biologique correcte. Il est bien connu que l’expression aberrante des gènes est à l’origine de la pathogenèse de nombreuses maladies et, par conséquent, une grande partie de l’intérêt de la recherche réside dans la compréhension des mécanismes de régulation des gènes1. L’expression des gènes est facilitée par des éléments régulateurs tels que les promoteurs et les amplificateurs. Au sein de leur séquence, ces éléments contiennent des sites de liaison de facteur de transcription (TF) qui, lorsqu’ils sont actifs, fournissent une plate-forme pour la liaison TF. La liaison des TF à ces sites entraîne un déplacement des nucléosomes, ce qui entraîne une augmentation de l’accessibilité de l’ADN et une augmentation ultérieure de la licéité de la machinerie transcriptionnelle. En raison de cette accessibilité accrue, ces régions de l’ADN sont plus sensibles aux nucléases et aux transposases telles que la DNase et la Tn5, une propriété biochimique qui a été exploitée par les chercheurs qui étudient la régulation transcriptionnelle 2,3.
DNase-seq et ATAC-seq permettent aux chercheurs de cartographier les régions de chromatine ouverte, les sites de liaison TF et le positionnement nucléosomique à travers le génome. De ces deux techniques, ATAC-seq a gagné en popularité au cours de la dernière décennie en raison du protocole simple en deux étapes et d’un faible nombre de cellules requis (50 000 cellules contre 1 million par réplique pour DNase-seq). Alors que l’ATAC-seq fournit une vue d’ensemble du paysage général de la chromatine dans une population de cellules, il est largement agnostique quant aux protéines spécifiques qui se lient au génome 4,5. Afin d’identifier les endroits où une protéine spécifique interagit avec le génome, la technique de référence est l’immunoprécipitation de la chromatine (ChIP)-seq. Le ChIP-seq consiste à fixer chimiquement les interactions protéine-ADN dans une cellule, suivies d’une immunoprécipitation (« pull-down ») à l’aide d’un anticorps spécifique de la protéine d’intérêt pour sélectionner les fragments d’ADN liés par la protéine d’intérêt (POI). Ces fragments d’ADN peuvent être séquencés pour révéler les emplacements de liaison génomique de protéines spécifiques telles que les TF, ou des sites contenant des modifications d’histones spécifiques1. En combinant les ensembles de données ATAC-seq et ChIP-seq, il est possible d’obtenir une image détaillée du paysage réglementaire pour une population de cellules.
Le flux de travail de base requis pour l’analyse est le suivant : la qualité des lectures de séquençage brutes doit être contrôlée avant d’être alignée sur un génome de référence (« cartographie »). Les lectures mappées avec succès peuvent ensuite être filtrées pour supprimer à la fois les lectures de mauvaise qualité et les doublons PCR. Afin de visualiser ces lectures cartographiées et filtrées, il est nécessaire de calculer la « couverture » de ces lectures sur l’ensemble du génome. Cela génère un fichier qui peut être téléchargé sur un navigateur de génome tel que la vue multi-locus (MLV) ou le navigateur de génome UCSC en tant que « piste »6,7. L’identification des pics, ou « appel de pointe », de ces pistes de couverture est généralement réalisée à l’aide d’outils tels que LanceOtron ou MACS2 8,9. Enfin, grâce à l’analyse de l’emplacement, de la forme et de la taille des pics, des comparaisons peuvent être faites entre les échantillons ou les conditions biologiques. L’analyse et l’intégration de ces ensembles de données est un processus complexe en plusieurs étapes dans lequel différentes combinaisons d’outils bioinformatiques peuvent être mises en œuvre. Les différentes versions des outils peuvent être incompatibles les unes avec les autres et peuvent modifier le résultat du traitement des données. Il existe également une grande variété de puissance de calcul et de compétences de l’utilisateur requises pour mettre en œuvre différentes parties du traitement des données, comme le montrent les pipelines nf-core10, panpipes11, genpipes12, PEPATAC13 ou ChIP-AP14.
Dans l’ensemble, cela a entraîné des incohérences dans l’analyse et la présentation de l’analyse, ce qui a entraîné une reproductibilité, une accessibilité et une commodité médiocres pour toute personne ayant une connaissance limitée de la bio-informatique. Nous répondons à tous ces problèmes avec CATCH-UP (pipeline amont complet ATAC-seq et ChIP-seq), un pipeline facile à utiliser, flexible et modulaire pour le traitement des données ChIP-seq et ATAC/DNase-seq. La mise en œuvre de CATCH-UP nécessite une expérience minimale en bioinformatique ; Il peut être exécuté sur diverses infrastructures informatiques et permet une analyse reproductible des données au sein et entre les groupes de recherche.
CATCH-UP est un pipeline Snakemake basé sur Python conçu pour standardiser l’analyse des données ChIP-seq et ATAC-seq. Il prend des données de séquençage brutes (fichiers fastq.gz) en entrée et génère une sortie sous la forme de fichiers de pic (.bed) fournissant le résultat respectif pour chaque étape. Nous fournissons un fichier de configuration au format yaml (config.yaml), dans lequel l’utilisateur peut modifier les paramètres de chaque étape d’analyse. Le système de gestion mis en œuvre au sein de snakemake permet d’utiliser différentes infrastructures de calcul (telles que des serveurs, des clusters, des systèmes cloud ou des ordinateurs personnels) et en parallèle si l’utilisateur fournit une grande quantité de données.
Vous trouverez ci-dessous une description détaillée de chaque étape du flux de travail (voir la figure 1 pour l’illustration du flux de travail). Cette explication est essentielle afin de suivre le pas à pas dans la section protocole :
Déplacer fastq : la première étape du pipeline consiste à copier les fichiers fastq bruts dans le répertoire d’analyse nommé. Cela laisse les données d’origine intactes pour éviter d’endommager ou de modifier les fichiers de données brutes.
Concaténation : si les données de séquençage brutes contiennent plusieurs voies, cette étape est nécessaire pour concaténer les voies avant l’analyse. Par défaut, le pipeline gère tous les fichiers fastq comme des échantillons uniques. Cette étape de concaténation doit être définie dans le fichier de configuration.
Découpage : étape facultative de nettoyage des données. Cela permet de réduire les lectures de mauvaise qualité ou les séquences d’adaptateur à l’aide de trimmomatic15. L’utilisateur peut fournir des fichiers fasta personnalisés de séquences d’adaptateurs ; Un exemple est fourni dans le répertoire de l’adaptateur. Des paramètres de découpage supplémentaires peuvent être définis dans le fichier de configuration. Par défaut, le flux de travail ignore cette règle.
Aligneur : pour l’alignement, Bowtie216 est appliqué par défaut ; D’autres outils d’alignement tels que BWA-MEM217 peuvent également être spécifiés. L’outil d’alignement Bowtie2 est sélectionné par défaut car il est particulièrement apte à aligner des lectures relativement courtes sur des génomes relativement grands et est donc bien adapté à l’alignement des données ChIP-seq et ATAC-seq sur les génomes de mammifères. Pour éviter tout fichier intermédiaire, l’aligneur est redirigé vers la vue samtools pour enregistrer le fichier bam en sortie. Pour cette règle, l’utilisateur doit spécifier la construction du génome préférée sur laquelle cartographier les lectures, par exemple, hg19/hg38 (humain), mm10/mm39 (souris).
Filtrage : les lectures correctement mappées sont conservées, et les lectures de faible qualité sont filtrées. Par défaut : vue samtools, avec les paramètres : -bShuF 4 -f 3 -q 30.
Trier : les lectures alignées sont triées dans l’ordre de la coordonnée la plus à gauche. Par défaut : samtools sort (wrapper snakemake), avec le paramètre : -m 4G.
Marquer les doublons : toutes les lectures en double sont identifiées et signalées. L’utilisateur peut décider de les supprimer en modifiant le paramètre du fichier de configuration. Par défaut : Picard MarkDuplicates (wrapper snakemake), avec le paramètre : --REMOVE_DUPLICATES False pour marquer et conserver les doublons.
Fusionner bam : si les données de séquençage sont composées de répétitions ou d’échantillons, l’utilisateur peut souhaiter fusionner en un seul bam. Dans ce cas, l’utilisateur peut choisir de fusionner les bams ou de garder les fichiers bam séparés tout au long de l’analyse. Si l’utilisateur choisit de fusionner les bams (en utilisant samtools merge), un préfixe commun doit être spécifié pour les bams fusionnés.
Index : cette étape indexe les coordonnées triées. Par défaut : index samtools (wrapper snakemake), en utilisant les paramètres par défaut spécifiés par samtools.
BamCoverage : cette règle crée une piste de couverture bigwig à partir de lectures alignées. L’outil bamCoverage de deepTools est appliqué et la couverture est calculée comme le nombre de lectures par bac, dans lequel le bac représente une fenêtre d’une taille spécifiée. Dans ce pipeline, bamCoverage est appliqué avec les paramètres suivants définis par défaut : -bs 1 -normalizeUsing RPKM -extendReads.
Appel de pointe : LanceOtron8 a été sélectionné comme appel de pointe par défaut pour ce pipeline. Contrairement aux appelants de pointe traditionnels, qui sont principalement basés sur des tests statistiques, LanceOtron est un appelant de pic basé sur l’apprentissage profond, qui intègre des mesures d’enrichissement génomique et des tests statistiques et s’est avéré plus performant que l’appelant de pic standard de l’industrie, MACS29. Pour que les gros bonnets soient compatibles avec LanceOtron, la couverture doit être calculée par paire de bases, et RPKM normalisé ; cela se reflète dans les paramètres par défaut de l’étape BamCoverage. MACS2 peut être sélectionné comme appelant de pic alternatif. La libération de nouveaux appelants de pointe sera surveillée et intégrée, le cas échéant, afin de maintenir et d’optimiser le rendement de ce pipeline d’analyse.
TrackDb : cela crée une association de paires clé-valeur de fichiers bigwig afin de les charger et de les visualiser dans des outils tels que les plateformes MLV6 ou UCSC Genome Browser18 .
En plus des données de sortie, chaque étape du pipeline génère un fichier journal et des contrôles de qualité appropriés sont fournis afin que l’utilisateur puisse suivre la progression de l’analyse. FastQC19 s’applique aux données de séquençage brutes et rognées (si sélectionnées) (étapes 1 - Déplacer fastq et 2- Découpage). Samtools stats plus MultiQC20 sont utilisés pour collecter, produire et visualiser des rapports de contrôle qualité sur les fichiers bam en sortie dans les étapes 3 - Aligneur, 6 - Marquer les doublons et 7 - Fusionner bam. Pour plus d’informations sur chacun des outils utilisés dans les étapes ci-dessus, consultez le tableau 1.