$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Hücrelerin doğru biyolojik işlevlerini oluşturmaları ve sürdürmeleri için gen ekspresyonu sıkı bir şekilde düzenlenmelidir. Anormal gen ekspresyonunun birçok hastalığın patogenezinin altında yattığı iyi bilinmektedir ve bu nedenle, gen düzenleme mekanizmalarının anlaşılmasında çok fazla araştırma ilgisi yatmaktadır1. Gen ekspresyonu, destekleyiciler ve güçlendiriciler gibi düzenleyici unsurlar tarafından kolaylaştırılır. Dizileri içinde, bu elemanlar, aktif olduklarında TF bağlanması için bir platform sağlayan transkripsiyon faktörü (TF) bağlama bölgeleri içerir. TF'lerin bu bölgelerdeki bağlanması, nükleozomların yer değiştirmesine neden olur, bu da DNA erişilebilirliğinde bir artışa ve ardından transkripsiyonel mekanizmaya izin verilebilirlikte bir artışa neden olur. Bu artan erişilebilirliğin bir sonucu olarak, DNA'nın bu bölgeleri, transkripsiyonel düzenlemeyiaraştıran araştırmacılar tarafından yararlanılan biyokimyasal bir özellik olan DNaz ve Tn5 gibi nükleazlara ve transpozazlara karşı daha hassastır 2,3.
DNase-seq ve ATAC-seq, araştırmacıların genom boyunca açık kromatin, TF bağlanma bölgeleri ve nükleozomal konumlandırma bölgelerini haritalamasına olanak tanır. Bu iki teknikten ATAC-seq, basit iki aşamalı protokol ve düşük hücre sayısı gereksinimi (DNase-seq için replikat başına 1 milyona kıyasla 50.000 hücre) nedeniyle son on yılda popülerlik kazanmıştır. ATAC-seq, bir hücre popülasyonundaki genel kromatin manzarasına genel bir bakış sağlarken, hangi spesifik proteinlerin genomabağlandığı büyük ölçüde agnostiktir 4,5. Spesifik bir proteinin genom ile etkileşime girdiği yerleri belirlemek için altın standart teknik Kromatin İmmünopresipitasyon (ChIP)-seq.'dir. ChIP-seq, bir hücrede protein-DNA etkileşimlerinin kimyasal olarak sabitlenmesini ve ardından ilgilenilen protein (POI) tarafından bağlanan DNA fragmanlarını seçmek için ilgilenilen proteine özgü bir antikor kullanılarak immünopresipitasyonu ("aşağı çekme") içerir. Bu DNA fragmanları, TF'ler gibi spesifik proteinlerin genomik bağlanma konumlarını veya spesifik histon modifikasyonları içeren bölgeleri ortaya çıkarmak için dizilenebilir1. ATAC-seq ve ChIP-seq veri kümelerini birleştirerek, bir hücre popülasyonu için düzenleyici ortamın ayrıntılı bir resmi elde edilebilir.
Analiz için gerekli olan temel iş akışı şu şekildedir: ham dizileme okumaları, bir referans genoma hizalanmadan ("haritalama") önce kalite kontrolünden geçirilmelidir. Başarıyla eşlenen okumalar daha sonra hem düşük kaliteli okumaları hem de PCR kopyalarını kaldırmak için filtrelenebilir. Bu eşlenmiş ve filtrelenmiş okumaları görselleştirmek için, bu okumaların genom boyunca "kapsamını" hesaplamak gerekir. Bu, çok lokuslu görünüm (MLV) veya UCSC genom tarayıcısı gibi bir genom tarayıcısına bir "parça" olarak yüklenebilen bir dosya oluşturur6,7. Bu kapsama yollarının tepe tanımlaması veya "tepe çağrısı" tipik olarak LanceOtron veya MACS2 8,9 gibi araçlar kullanılarak elde edilir. Son olarak, tepe konumu, şekil ve boyut analizi yoluyla numuneler veya biyolojik koşullar arasında karşılaştırmalar yapılabilir. Bu veri kümelerinin analizi ve entegrasyonu, farklı biyoinformatik araç kombinasyonlarının uygulanabildiği karmaşık, çok adımlı bir süreçtir. Araçların farklı sürümleri birbiriyle uyumsuz olabilir ve veri işlemenin çıktısını değiştirebilir. NF-core10, panpipes11, genpipes12, PEPATAC13 veya ChIP-AP14 boru hatlarında gösterildiği gibi veri işlemenin farklı bölümlerini uygulamak için gereken hesaplama gücü ve kullanıcı yeterliliğinde de çok çeşitli vardır.
Genel olarak, bu, hem analizde hem de analizin raporlanmasında tutarsızlıklara yol açmış ve bu da biyoinformatik hakkında sınırlı bilgiye sahip herkes için zayıf tekrarlanabilirlik, erişilebilirlik ve rahatlığa yol açmıştır. Tüm bu sorunları, ChIP-seq ve ATAC/DNase-seq verilerini işlemek için kullanımı kolay, esnek ve modüler bir boru hattı olan CATCH-UP (tam ATAC-seq ve ChIP-seq yukarı akış boru hattı) ile ele alıyoruz. CATCH-UP'ın uygulanması minimum biyoinformatik deneyimi gerektirir; Çeşitli bilgi işlem altyapılarında çalıştırılabilir ve araştırma grupları içinde ve arasında tekrarlanabilir veri analizi sağlar.
CATCH-UP, ChIP-seq ve ATAC-seq verilerinin analizini standartlaştırmak için oluşturulmuş Python tabanlı bir Snakemake boru hattıdır. Ham sıralama verilerini (fastq.gz dosyaları) girdi olarak alır ve her adım için ilgili sonucu sağlayan tepe (.bed) dosyaları biçiminde bir çıktı oluşturur. Kullanıcının her analiz adımının parametrelerini düzenleyebileceği yaml biçiminde (config.yaml) bir yapılandırma dosyası sağlıyoruz. Snakemake içinde uygulanan yönetim sistemi, farklı bilgi işlem altyapılarının (sunucular, kümeler, bulut sistemleri veya kişisel bilgisayarlar gibi) ve kullanıcının büyük miktarda veri sağlaması durumunda paralel olarak kullanılmasını sağlar.
Aşağıda, iş akışının her adımının ayrıntılı bir açıklamasını sunuyoruz (iş akışı çizimi için Şekil 1'e bakın). Bu açıklama, protokol bölümündeki adım adım takip etmek için gereklidir:
Fastq'yu Taşı: İşlem hattının ilk adımı, ham FastQ dosyalarını adlandırılmış analiz dizinine kopyalamaktır. Bu, ham veri dosyalarının bozulmasını veya değiştirilmesini önlemek için orijinal verilere dokunulmaz.
Birleştirme: ham sıralama verileri birden fazla şerit içeriyorsa, analizden önce şeritleri birleştirmek için bu adım gereklidir. Varsayılan olarak, işlem hattı tüm fastq dosyalarını tek örnekler olarak işler. Bu birleştirme adımı, yapılandırma dosyasında tanımlanmalıdır.
Kırpma: isteğe bağlı veri temizleme adımı. Bu, trimmomatic15 kullanılarak düşük kaliteli okumaların veya adaptör dizilerinin kırpılmasına olanak tanır. Kullanıcı, adaptör dizilerinin özel fasta dosyalarını sağlayabilir; Bağdaştırıcı dizininde bir örnek verilmiştir. Konfigürasyon dosyasında ek kırpma parametreleri tanımlanabilir. Varsayılan olarak, iş akışı bu kuralı atlar.
Hizalayıcı: hizalama için Papyon216 varsayılan olarak uygulanır; BWA-MEM217 gibi alternatif hizalama araçları da belirtilebilir. Bowtie2 hizalama aracı, nispeten kısa okumaları nispeten büyük genomlara hizalamada özellikle usta olduğu ve bu nedenle ChIP-seq ve ATAC-seq verilerinin memeli genomlarına hizalanması için çok uygun olduğu için varsayılan olarak seçilir. Herhangi bir ara dosyadan kaçınmak için, hizalayıcı, bam dosyasını çıktıya kaydetmek için samtools görünümüne aktarılır. Bu kural için kullanıcı, okumaların eşleneceği tercih edilen genom yapısını belirtmelidir, örneğin, hg19/hg38 (insan), mm10/mm39 (fare).
Filtreleme: Düzgün eşlenmiş okumalar korunur ve düşük kaliteli okumalar filtrelenir. Varsayılan: samtools görünümü, parametrelerle: -bShuF 4 -f 3 -q 30.
Sırala: hizalanmış okumalar en soldaki koordinat sırasına göre sıralanır. Varsayılan: samtools sıralama (snakemake wrapper), parametre ile: -m 4G.
Yinelenenleri işaretle: tüm yinelenen okumalar tanımlanır ve işaretlenir. Kullanıcı, yapılandırma dosyası parametresini değiştirerek bunları kaldırmaya karar verebilir. Varsayılan: Picard MarkDuplicates (yılan sarmalayıcı), parametresiyle: --REMOVE_DUPLICATES False kopyaları işaretlemek ve korumak için.
Bam'ı birleştirme: Sıralama verileri çoğaltmalardan veya örneklerden oluşuyorsa, kullanıcı tek bir bam'da birleştirmek isteyebilir. Bu durumda, kullanıcı bamları birleştirmeyi veya bam dosyalarını analiz boyunca ayrı tutmayı seçebilir. Kullanıcı bams'ı birleştirmeyi seçerse (samtools merge kullanarak), birleştirilen bams için ortak bir önek belirtilmelidir.
İndeks: Bu adım, sıralanan koordinatları indeksler. Varsayılan: samtools tarafından belirtilen varsayılan parametreleri kullanan samtools dizini (snakemake wrapper).
BamCoverage: Bu kural, hizalanmış okumalardan büyük bir kapsama alanı parçası oluşturur. deepTools'tan bamCoverage aracı uygulanır ve kapsam, bölmenin belirli bir boyuttaki bir pencereyi temsil ettiği bölme başına okuma sayısı olarak hesaplanır. Bu işlem hattında, bamCoverage varsayılan olarak ayarlanan aşağıdaki parametrelerle uygulanır: -bs 1 -normalizeUsing RPKM -extendReads.
Tepe çağrısı: LanceOtron8 , bu işlem hattı için varsayılan tepe arayan olarak seçildi. Çoğunlukla istatistiksel olarak test tabanlı olan geleneksel tepe arayanların aksine, LanceOtron, genomik zenginleştirme ölçümlerini ve istatistiksel testleri içeren ve endüstri standardı tepe arayan MACS29'dan daha iyi performans gösterdiği gösterilen derin öğrenme tabanlı bir tepe arayandır. Büyük perukların LanceOtron ile uyumlu olması için, kapsama alanı baz çifti başına hesaplanmalı ve RPKM normalleştirilmelidir; bu, BamCoverage adımının varsayılan ayarlarına yansıtılır. MACS2, alternatif bir tepe arayan olarak seçilebilir. Bu analiz hattının performansını korumak ve optimize etmek için yeni tepe arayanların serbest bırakılması izlenecek ve uygun olduğu şekilde dahil edilecektir.
TrackDb: Bu, büyük peruk dosyalarını MLV 6 veya UCSCGenome Browser18 platformları gibi araçlarda yüklemek ve görselleştirmek için bir anahtar-değer çifti ilişkilendirmesi oluşturur.
Çıktı verilerine ek olarak, boru hattının her adımı bir günlük dosyası çıkarır ve kullanıcının analiz ilerlemesini takip edebilmesi için uygun kalite kontrol kontrolleri sağlanır. FastQC19, ham ve kırpılmış (seçilirse) sıralama verilerine uygulanır (adım 1 - Hızlı hareket et ve 2- Kırpma). Samtools istatistikleri ve MultiQC20, adım 3 - Hizalayıcı, 6 - Kopyaları işaretle ve 7 - Bam'ı birleştir adımlarında çıktıdaki bam dosyalarında kalite kontrol raporlarını toplamak, üretmek ve görselleştirmek için kullanılır. Yukarıdaki adımlarda uygulanan araçların her biri hakkında daha fazla bilgi için Tablo 1'e bakın.