$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Kalite ve adaptör kırpma, yüksek sıralama kalitesiyle okumaları korur
Yüksek verimli sıralama teknikleri, okumalarda dizi 'mutasyonları' gibi sıralama hataları oluşturmaya eğilimlidir. Ayrıca, kitaplık hazırlığı sırasında bağdaştırıcının zayıf çıkarılması nedeniyle sıralama bağdaştırıcısı dimerleri, sıralama veri kümelerinde zenginleştirilebilir. Okuma mutasyonları, uygun eşleme için gerekenden daha kısa okuma üretimi ve adaptör dimerlerinin zenginleştirilmesi gibi aşırı sıralama hataları, okuma eşleme süresini artırabilir ve aşağı akış biyoinformatik analiz sonuçlarını bozan yanlış pozitif eşlenmiş okumalar üretebilir. Bu nedenle, aşağı akış analizi ve yorumlaması için yüksek kaliteli okumaları korumak için kaliteli filtreleme ve adaptör kırpma gereklidir.
Analiz için yüksek kaliteli okumaları korumak için, bu CUT&RUN analiz hattı (Şekil 2) FastQC26 ve Trim Galore27'yi kullanır. "Script_03_fastQC.sh" kabuk komut dosyası, çalışma dizinindeki tüm fastq dosyaları için FastQC'yi çalıştırır. GSE126612'dan (SRR8581589) kamuya açık CTCF CUT&RUN veri setini kullanan bu adımın sonuçları (Şekil 3), düşük kaliteli puan tabanlarına sahip bazı okumaları (Şekil 3A,C) ve teorik tahmin ile gerçek okumalar arasında bazı derecelerde dizi başına GC içerik dağılımı uyumsuzluğunu tanımlar (Şekil 3E).
Trim Galore'u çalıştırmak için "Script_04_trimming.sh" komut dosyasının yürütülmesi, düşük kaliteli puan tabanlarına (Şekil 3A'da 20'nin altında) ve düşük ortalama dizi niteliklerine sahip bu okumaları başarıyla kaldırır ve ön kırpma belirgindir (Şekil 3B-D). Ek olarak, "Script_04_trimming.sh", dizi grafiği üzerinde 'kırpma öncesi' GC dağılımında görüntülenen U~60 ortalama GC içerik zenginleştirmesini de başarıyla kaldırır (Şekil 3E,F). Bu sonuçlar, bu CUT&RUN analiz hattının, referans genoma hızlı ve doğru okuma eşlemesini kolaylaştırmak için yüksek kaliteli okumalar için filtrelediğini göstermektedir.
Kesici uç boyutu dağılımı, en yüksek arama sonuçları için tahmin verebilir
CUT & RUN'da MNaz kullanımı nedeniyle (Şekil 1), eşlenmiş CUT&RUN okumalarının, uç boyutu dağılım grafikleri içinde mono- (~ 200 bp) ve di-nükleozomal (~ 350 bp) DNA fragman boyutu zirveleri sergilemesi beklenir (Şekil 4). Bazı hedeflerin algılanmasıyla ilgili sorunlar, kısa eklere (< 100 bp) neden olabilir (Şekil 4C). Yüksek düzeyde kısa okumalar, yüksek güvenilirlikli tepe çağrısı için kullanılabilecek okuma sayısını azaltır, böylece tepe sayıları azaltır ve aşağı akış analizini etkiler. Bu CUT&RUN analiz hattında "Script_10_insert-size-analysis.sh", kesici uç boyutu dağılım analizini gerçekleştirmek ve histogramları bir görselleştirme çıktısı olarak dışa aktarmak için "picard.jar CollectInsertSizeMetrics" işlevini çalıştırır (Şekil 2). Çıktı grafiklerinde (Şekil 4A-C), x ekseni kesici uç boyutu aralığını gösterir, y ekseninin sol tarafı ve doldurulmuş histogram, x eksenindeki değere sahip kesici uç sayısını temsil eder ve y ekseninin sağ tarafı, x eksenindeki değere eşit veya daha büyük bir kesici uç boyutuna sahip kesici uçların kümülatif kesirini ve kesikli çizgiyi gösterir. Bu nedenle, histogramdaki en yüksek seviye ile kesişen kesikli çizginin eğiminde en dramatik değişikliğe sahip X ekseni üzerindeki konum, numunedeki ana kesici uç boyutunu tanımlar. İlgilenilen referans genom (insan, hg19) üzerinde haritalanan okumalar arasında, H3K27Ac (aktif histon işareti) numune parçaları, en yüksek mono-nükleozomal boyut ve saptanabilir di-nükleozomal boyut zirveleri ile beklenen CUT&RUN kesici uç boyutu dağılımını sergiler (Şekil 4B). CTCF numune fragmanları, 100~200bp fragman uzunluğu bölgelerinde ek gruplar gösterdi (Şekil 4A). Toplamda, CUT&RUN analiz hattı, referans genomlar üzerinde eşleme okumalarından sonra kesici uç boyutu dağılım analizi gerçekleştirmek için kullanımı kolay kabuk komut dosyaları sağlar. Bu analizler, aşağı akış analizinden önce tepe çağrısının verimliliğini tahmin ederken önemli hale gelir.
Easy Shells CUTnRUN analiz hattı, güvenilir okuma sayıları oluşturmak için filtrelemeler ve normalleştirme seçenekleri sunar
CUT&RUN analizinin kritik noktalarından biri, ilk eşleme çıktılarından problemli okuma çiftlerini filtreleyerek ve filtrelenmiş eşlenmiş okuma sayılarını kullanıcı analizinin amaçlarını/ihtiyaçlarını karşılayabilecek özel normalizasyon hesaplama yöntemi ile normalleştirerek uygun eşlenmiş okuma çiftleri elde etmektir. Bu çalışmada tartışılan CUT&RUN analiz hattı, kanonik olmayan kromozomlar üzerinde eşlenen okuma çiftlerini, genel olarak açıklamalı kara liste bölgelerini23 ve TA tekrarlarıbölgelerini 18,22 "Script_06_bowtie2-mapping.sh" kullanılarak papyon2 ile eşlenen okuma çiftlerinden çıkarmak için "Script_07_filter-sort-bam.sh" komut dosyasını içerir. Bu filtrasyonlar, yanlış pozitif, aykırı değer ani yükselme sinyalleri üretebilen ve aşağı akış analizinde tepe noktaları olarak adlandırılan okuma çiftlerini çıkarmak için gereklidir (Şekil 5; sarı kutu bölgeleri).
Filtrasyonlara ek olarak, doğru normalizasyon yönteminin uygulanması, numuneler arasındaki sinyal farkını doğru bir şekilde görselleştirmek için önemli bir faktördür. Bu nedenle, CUT&RUN analiz hattı, genel olarak doğrulanmış iki normalleştirme yöntemi sağlamak için "Script_09_normalization_SFRC.sh" ve "Script_09_normalization_SRPMC.sh" komut dosyalarını içerir - ölçeklendirilmiş kesirli okuma (SFRC)22 ve negatif Kontrolde (SRPMC) Milyon Başına Spike-in normalleştirilmiş Okumalar eşlenmiş okumalar24,25 (Şekil 5A-D). SFRC, formülde kontrol (örneğin, IgG) veya spike-in numunesi içermediğinden, SFRC normalizasyonu, herhangi bir kontrol numunesi içermeyen veya genom çapında ölçek farkı olmadan yalnızca yerel bölgelerde sinyal farklılıkları göstermesi beklenen numuneler için kullanılabilir. CUT&RUN analiz boru hattı tarafından işlenen SFRC normalleştirilmiş numuneler (Şekil 5A-D; kırmızı izler), GEO'dan (Şekil 5A-D; siyah izler) halka açık eşlenmiş okumalarla aynı sinyal dağıtım modellerini üretir, bu da bu boru hattının yayın sonuçlarını yeniden üretebileceğini düşündürür.
SRPMC yöntemi, hem kontrol hem de Spike-in örneklerini içeren ve numuneler arasında küresel sinyal farkı göstermesi beklenen numuneleri normalleştirmek için kullanışlıdır (Şekil 5A-D; yeşil izler). Bir H3K27Ac numunesi (SRR8581599), diğer replikatörlerden (237, 175 ve 161) çok daha yüksek "(gerçek CUT&RUN okumaları)/(spike-in okumaları)" oranı (numune RPS; 997) sergilediğinden, bağıl H3K27Ac sinyalleri, SFRC ve SRPMC normalize edilmiş numunelerdeki replikasyonlar arasında farklı görünür (Şekil 5A-D; H3K27Ac tüm parçalarla karşılaştırıldığında). RNAPII-S5P numuneleri, IgG kontrolünden (259) nispeten daha düşük numune RPS (1.7, 0.8, 2.1) sergiler, bu nedenle RNAPII-S5P numuneleri, SRPMC normalizasyonundan sonra IgG kontrolünden daha düşük sinyal sergiler (Şekil 5A-D; RNAPII-S5P tüm parçalarda karşılaştırıldığında). Bu nedenle, burada tartışılan CUT&RUN analiz hattı, hem IgG kontrolüne hem de spike-in kontrol okumalarına göre deneysel numunelerde yeterli okumaya sahip numuneler için SRPMC yönteminin kullanılmasını önerir.
Venn şeması karşılaştırması, daha iyi tepe arama yöntemi ve seçenekleri seçmek için fikir verebilir
Çoklu pik çağırma programları, genom boyunca önemli ölçüde zenginleştirilmiş protein doluluğunun tanımlanmasını sağlar. CUT&RUN analizi için kullanılan bu tür programlar arasında şimdiye kadar ana yöntemler olarak MACS ailesi programları2 ve SEACR4 bulunmaktadır. Bununla birlikte, özellikle biyoinformatiğe yeni başlayanlar için, belirli bir CUT & RUN projesi için en uygun tepe arama yöntemini ve seçeneklerini belirlemek zor olabilir. Bu nedenle, CUT&RUN analiz hattı, kullanıcılara çeşitli tepe arama seçenekleri (Script_17_intervene seçenekleri) ve tepe arama programları (Script_19_intervene_methods.sh) arasındaki zirve arama sonuçlarının benzerliğini ve farkını karşılaştırma şansı vermek için Venn şeması analiz adımlarını içerir (Şekil 6A-H).
Karşılaştırmaya göre, pik arama adımı sırasında IgG kontrol seçeneği ile ve IgG kontrol seçeneği olmadan çağrılan birleştirilmiş CTCF, H3K27ac ve RNAPII-S5P pikleri, MACS2 ve MACS3 IgG kontrol seçeneği ile daha fazla pik çağırdı (Şekil 6A), ancak SEACR hem sıkı hem de rahat seçeneklerde IgG kontrol seçeneği olmadan daha fazla pik çağırdı (Şekil 6B-D). Bu nedenle, CUT&RUN analiz hattı (1) MACS2 ve MACS3 için IgG kontrol seçeneğinin uygulanmasını, (2) deneysel CUT&RUN örnekleri ve IgG kontrol numuneleri için tepe noktalarının ayrı ayrı çağrılmasını, ardından SEACR tepe çağırıcısı için daha sonra IgG tepe noktalarının filtrelenmesini önerir. MACS2 ve MACS3 arasında, MACS3 biraz daha fazla tepe noktası çağırdı (Şekil 6A).
Ayrıca, MACS2 ve MACS3 tarafından IgG kontrol seçeneği ile çağrılan tepe noktalarının ve IgG kontrol seçeneği olmayan SEACR ile çağrılan tepe noktalarının karşılaştırılması, sıkı seçenek ile çağrılan SEACR tepe noktalarının MACS 2 ve MACS3 tepe noktalarının, rahat seçenekle çağrılan SEACR tepe noktalarından daha fazla örtüştüğünü göstermektedir (Şekil 6E,F). Bu nedenle, CUT&RUN analiz boru hattı çıktıları, katı seçeneğin MACS tepe çağrısı ile SEACR tutarlılığını en üst düzeye çıkardığını göstermektedir. Son olarak, SEACR tarafından çağrılan tepe noktalarının örtüşmesini ham okuma sayıları CUT&RUN bedGraph dosyaları için normalleştirme ile ve normalleştirilmiş okuma sayıları CUT&RUN bedGraph dosyaları için normalleştirme olmadan karşılaştırmak için Venn şeması, katı seçenekle SEACR için SFRC ve SRPMC yöntemleri arasında hiçbir fark ortaya koymaz. SFRC tepe noktaları, rahat seçeneklere sahip SEACR için SRPMC tepe noktalarından çok daha yüksek tepe sayıları sergiler ve normalleştirilmiş seçenek tepe noktalarıyla (Şekil 6'da 'norm') daha iyi örtüşür (Şekil 6G,H).
Kopyalar ve örnekler arasında istatistiksel karşılaştırmalar
Birden çok kopya arasında doğru sonuçlar çıkarmak, kopya benzerliğinin değerlendirilmesini gerektirir. Burada kullanılan CUT&RUN analiz hattı, geçerli aşağı akış analizi için uygun numunelerin ve replikaların tanımlanmasını kolaylaştırmak için Deeptools215 tabanlı istatistiksel korelasyon katsayısı hesaplaması, ısı haritası kümelemesi ve temel bileşen analizi (PCA) kullanır. Pearson korelasyon katsayısına dayalı ısı haritası kümelemesi, CTCF, H3K27Ac ve RNAPII-S5P için replikalar arasında adlandırılan tepe bölgelerinde istatistiksel olarak anlamlı korelasyon gösterdi (Şekil 7A-C). Bununla birlikte, PCA, bir CTCF (SRR8581590) ve H3K27Ac (SRR8581608) örneğinin, tepe bölgeleri olarak adlandırılan tüm CTCF, H3K27Ac ve RNAPII-S5P'de diğer kopyalardan nispeten uzakta bulunduğunu gösterdi (Şekil 7D).
Replikasyonlar arasındaki tepe noktaları arasında karşılaştırma yapmak için kullanılan Venn şemasına göre, CTCF (SRR8581590) tepe noktaları, üç tepe arayan sonucunun hepsinde diğer kopyalarla en az örtüşme gösterdi (Şekil 7E-G) ve H3K27Ac (SRR8581608) tepe noktaları, SEACR tepe çağrısı sonuçlarında diğer kopyalarla en az örtüşme gösterdi (Şekil 7F). H3K27Ac (SRR8581608) tepe noktaları, MACS2 ve MACS3 tepe çağrı sonuçlarındaki diğer kopyalarla minimum örtüşme göstermedi (Şekil 7F), bu da PCA'daki kopyalar arasındaki mesafenin aykırı değer örneğini tanımlamak için yeterli olmadığını düşündürebilir. Bu nedenle, CUT&RUN analiz hattı, aykırı değer çoğaltmasını 'ısı haritası kümeleme grubunda düşük Pearson korelasyon katsayısı, diğer kopyalarla PCA grafiğinde uzun mesafe ve kopyalar arasında en düşük tepe örtüşmesi gösteren örnek' olarak tanımlamayı önermektedir.
Peak çağrısı, CUT&RUN verilerinin görselleştirilmesini ve yorumlanmasını kolaylaştırır
Bu çalışmada ayrıntılı olarak açıklanan CUT&RUN analiz hattı, iki tür halka açık tepe çağrısı kullanır: MACS ailesi ve SEACR. Çağrılan tepe noktalarının görselleştirilmesini optimize etmek için bu boru hattı, ısı haritası ve metaplot analizleri için tepe merkezi olarak en yüksek sinyal kutusunu seçer. MACS3 ve SEACR tepe arayanlar tarafından çağrılan tüm CTCF, H3K27Ac ve RNAPII-S5P tepe noktaları, en yüksek sinyal kutularının merkezinde (Şekil 8A-F, 'odaklanmış' grafikler) tüm tepe bölgelerinin merkezinden (Şekil 8A-F, 'bütün' grafikler) daha keskin tepe dağılım modeli gösterdi. SFRC normalizasyonu ile Easy Shells CUTnRUN analiz boru hattı tarafından işlenen CUT&RUN örnekleri (Şekil 8 AF, 'SFRC' grafikleri), ham eşlenmiş okuma çiftleri GEO'da (Şekil 8A-F, 'genel' grafikler) analiz boru hattı tarafından çağrılan zirvelerde halka açık olan SFRC normalleştirilmiş numunelerinkiyle benzer sinyal dağıtım modelleri sergiler (Şekil 8A-F, 'genel' grafikler). Böylece, CUT & RUN analiz hattı, yayın sonuçlarını başarılı bir şekilde yeniden üretebilir.

Şekil 1: CUT&RUN deneysel prosedürünün şeması. CUT&RUN, genom boyunca protein-DNA etkileşimlerini tespit etmek için enzim tabanlı bir yaklaşımdır. CUT & RUN prosedürü, prosedür boyunca düşük hücre sayılarının izolasyonunu ve manipülasyonunu sağlamak için hücrelerin (veya izole edilmiş çekirdeklerin) manyetik boncuklara konjuge Concanavalin A'ya bağlanmasıyla başlar. İzole edilmiş hücreler, ilgilenilen proteini hedef alan bir antikorun eklenmesini kolaylaştırmak için hafif bir deterjan kullanılarak geçirgenleştirilir. Protein A veya Protein A/G etiketine bağlanan mikrokokal nükleaz (MNaz) daha sonra geçirgen hücreye verilir. pA-MNase (veya pAG-MNase), bir Protein A veya Protein A/G etiketi kullanılarak bağlı antikora alınır. MNaz hedef bölgelere lokalize edildikten sonra, nükleaz, hedef proteinin etrafındaki DNA'yı sindirmek için kalsiyumun eklenmesiyle kısa bir süre aktive edilir. MNaz sindirimi, mono-nükleozomal DNA-protein kompleksleri ile sonuçlanır. Kalsiyum daha sonra sindirim reaksiyonunu sona erdirmek için şelatlanır ve MNaz sindiriminden gelen kısa DNA parçaları, 37 ° C'de kısa bir inkübasyon ile çekirdeklerden salınır, daha sonra DNA saflaştırması, kütüphane hazırlığı ve yüksek verimli dizileme1. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

Şekil 2: Easy-Shell CUT&RUN analiz hattının şematik özeti. Easy-Shell CUT&RUN analiz hattı üç ana bölümde tasarlanmıştır: (1) ham okuma dosyalarının kalite kontrolü ve eşlenmesi (sol; mor), (2) eşlenmiş okumaların ve okuma sayılarının normalleştirilmesi ve tepe çağrısı (orta; yeşil) ve (3) eşlenmiş okumaların ve çağrılan tepe noktalarının doğrulanması (sağ; pembe). Her adımda, karşılık gelen kabuk komut dosyası numarası, kısa bir açıklama ve o adımda kullanılan program aracı (parantez içinde) sağlanır. Düz oklar, adımlar arasındaki doğrudan akışları gösterir. Bu CUT&RUN analiz hattı, kontrol okumaları olan ve olmayan kullanıcıların ihtiyaçlarını karşılayabilen iki okuma normalleştirme yöntemi, aşağı akış analizi için uygun kopyaları tanımlamak için çok katmanlı doğrulama süreçleri ve iyi odaklanmış ısı haritası ve metaplot çıktı oluşturma için odaklanmış tepe tanımlama sağlar. Bu analiz hattı, biyoinformatiğe yeni başlayanlara, komut dosyalarını kendileri okuyarak ve düzenleyerek temel CUT & RUN veri analizini öğrenme ve uygulama fırsatı sağlamak için kullanımı kolay kabuk komut dosyalarında adım adım yazılmıştır. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

Şekil 3: Kalite kontrol sonuçlarının karşılaştırılması, kalite öncesi ve sonrası düzeltme. FastQC'den gelen kalite kontrol raporu çıktılarını seçin, SRR8581589'den okumaları (GSM3609748, CTCF) kullanarak kalite kırpmanın etkisini görüntüleyin. Gösterilen çıktılar şunları içerir: (A) Budama öncesi bazlar arasında kalite puanı. (B) A) kırpma sonrası ile aynı okuma. (C) Kırpma öncesi tüm dizilerde kalite puanı dağılımı. (D) Kırpma sonrası C) ile aynı okuma. (E) Kırpma öncesi tüm diziler üzerinde GC dağılımı. (F) E) kırpma sonrası ile aynı okuma. Sıralama okumaları (A, B) içindeki her pozisyondaki minimum kalite puanı ve minimum ortalama dizi kalitesi (C, D), kaliteli kırpmadan sonra artırılır. Ayrıca, bu adım, yüksek baz uyuşmazlık oranına sahip okuma çiftlerini çıkararak, teorik GC sayıları dağılımı ile okumalardaki (E, F) baz başına gerçek GC sayısı arasındaki farkı azaltabilir. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

Şekil 4: Kesici uç boyutu dağılım analizi. (A) CTCF, (B) H3K27Ac ve (C) serin 5 fosforile RNA polimeraz II (RNAPII-S5P) için kesici uç boyutu histogramı. Histogramlar, örnekler arasındaki kesici uç boyutu dağılımındaki göreli farklılıkları gösterir. Histogramdaki kesikli çizgi, x eksenindeki değerden büyük veya ona eşit bir ekleme boyutuna sahip okumaların kümülatif kısmını temsil eder. N: Filtrasyondan sonra numune başına uyumlu olarak eşlenen benzersiz okuma sayısı. FR: parçalar. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

Şekil 5: CUT&RUN örneklerine genel bakış. Ek filtreleme (siyah izler) olmadan ölçekli kesirli sayım (SFRC) ile normalleştirilen halka açık CUT&RUN eşlenmiş okumalar, SFRC normalizasyonu (kırmızı izler) ile Easy Shells CUTnRUN analiz hattı tarafından işlenen CUT&RUN örnekleri ve 'Negatif Kontrolde Milyonluk Eşlenmiş Okuma Başına Ani Normalleştirilmiş Okumalar (SRPMC; yeşil izler)' (A) histon genleri küme bölgesinde gösterilir, ve (BD) tüm MACS2, MACS3 ve SEACR tepe arayanlar tarafından çağrılan CTCF, H3K27Ac ve RNAPII-S5P tepe noktalarına sahip diğer üç bölge. Sarı kutular, Easy Shells CUTnRUN analiz hattındaki filtreleme adımı sırasında filtrelenen ani yükselme sinyallerinin konumunu vurgular. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

Şekil 6: Farklı tepe arayanlar tarafından çağrılan tepe noktaları ile tepe arama seçenekleri arasında karşılaştırma yapmak için Venn şeması. (A) Tepe çağrısı sırasında IgG giriş seçeneği olan ve olmayan MACS2 ve MACS3 tarafından çağrılan tepe noktaları arasında karşılaştırma. (B-D) IgG giriş seçeneği olan ve olmayan, 'sıkı' ve 'gevşek' seçenekleri olan SEACR tarafından çağrılan tepe noktaları ve ham okuma çiftleri dosyaları (B) kullanılarak normalleştirme seçeneğiyle, SFRC normalleştirilmiş okuma sayıları dosyaları (C) veya SRPMC normalleştirilmiş okuma sayıları dosyaları (D) kullanılarak normalleştirme seçeneği olmadan karşılaştırılması. (E,F) IgG giriş seçeneği ile MACS2, MACS3 ve sıkı (E) veya rahat (F) seçeneği ile SEACR tarafından çağrılan tepe noktaları arasında karşılaştırma. (G,H) IgG giriş seçeneği olmadan ve sıkı (G) veya rahat (H) seçeneklerle SEACR tarafından çağrılan tepe noktaları arasında karşılaştırma. IgG ile: IgG giriş seçeneği ile çağrılan tepe noktaları. IgG olmadan: IgG giriş seçeneği olmadan çağrılan tepe noktaları. Norm: Normalleştirme seçeneği ile çağrılan tepe noktaları. non: normalleştirme seçeneği olmadan çağrılan tepe noktaları. SFRC: 'ölçeklendirilmiş kesirli sayım (SFRC)' yöntemiyle normalleştirilen okuma sayıları dosyaları tarafından çağrılan tepe noktaları. SRPMC: 'Negatif Kontrol (SRPMC) yönteminde Milyon eşlenmiş okuma başına ani normalleştirilmiş Okuma Sayısı' tarafından normalleştirilen okuma sayıları dosyaları tarafından çağrılan tepe noktaları. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

Şekil 7: Replikalar arasındaki benzerliği doğrulamak için Pearson korelasyonu, Temel bileşen analizi ve Venn şeması. (A-C) Pearson korelasyon katsayısı değerleri ile ısı haritası kümelemesi, MACS2 (A), MACS3 (B) ve SEACR (C) tarafından adlandırılan zirvelerdeki replikalar arasındaki benzerlik derecesini gösterir). Pearson korelasyon katsayısı -1 ile 1 arasında bir değerdedir. Daha büyük bir mutlak Pearson korelasyon katsayısı değeri, iki değişken arasında daha güçlü bir korelasyonu gösterir ve pozitif bir Pearson korelasyon katsayısı değeri, iki değişkenin aynı yönde hareket ettiği pozitif bir korelasyonu gösterir. Bu nedenle, daha yüksek benzerliğe sahip örnekler, Isı Haritası kümelemesinde daha yakın soyağacı ve daha yüksek Pearson katsayı değeri sergiler. (D) Temel bileşen analizi (PCA), MACS2 (solda), MACS3 (ortada) ve SEACR (sağda) olarak adlandırılan tüm CTCF, H3K27Ac ve RNAPII-S5P tepe bölgelerindeki kopyalar ve numuneler arasındaki benzerlik derecesini gösterir. Daha yüksek benzerliğe sahip örnekler, PCA grafiğinde birbirine daha yakın konumlandırılır. (E-G) MACS2 (E), MACS3 (F) ve SEACR (G) ile her bir replikasyonda bulunan tepe noktalarını karşılaştırmak için Venn şeması analizi. Easy-Shell CUT&RUN analiz hattı, aşağı akış analizi için çağrılan tepe noktalarını birleştirmeye uygun olabilecek yüksek benzerliğe sahip kopyaları tanımlamak için üç yöntemin de uygulanmasını önerdi. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

Şekil 8: Tepe noktalarında sinyal dağılımının ısı haritası ve metaplot görselleştirmesi. Isı haritası ve meta grafikler, farklı tepe arayanlar kullanılarak adlandırılan tepe merkezleri etrafındaki zenginleştirme dağılımını görüntüler. (A,B) MACS3 (A) ve SEACR (B) tarafından bir replikeden (SRR8581589) çağrılan CTCF CUT&RUN tepe noktaları. (C,D) H3K27Ac CUT&RUN tepe noktaları, MACS3 (C) ve SEACR (D) kullanılarak bir kopyadan (SRR8581607) çağrılır. (E,F) MACS3 (E) ve SEACR (F) tarafından bir replikeden (SRR8581589) çağrılan RNAPII CUT&RUN tepe noktaları. Halka açık eşlenmiş okuma çiftleri ( Şekil 8'de 'Genel') ve Easy Shells CUTnRUN analiz boru hattı ( Şekil 8'de 'SFRC') tarafından eşlenen parçalar, 'ölçekli kesirli sayım (SFRC)' normalizasyonundan sonra karşılaştırılır. Tepe noktaları, IgG giriş seçeneği ile MACS3 ( Şekil 8'de 'IgG'li MACS3) ve IgG girişi olmadan ve SFRC normalleştirilmiş okuma sayıları dosyaları sıkı modda ( Şekil 8'de 'IgG olmayan SFRC sıkılaştırılmamış SEACR') kullanılarak normalleştirme seçeneği olmadan SEACR tarafından çağrılır. Çağrılan tepelerin koordinat dosyalarının iki versiyonu hazırlanır: çağrılan tepelerin başından sonuna kadar ( Şekil 8'de 'bütün') ve çağrılan tepeler içinde en yüksek sinyale sahip bölmenin konumu (MACS3'te zirveler tepe olarak adlandırılır; Şekil 8'de 'odaklanmış'). Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.
Tablo 1: GSE126612'daki CUT&RUN fastq dosyaları için bilgiler. GSE126612 dahil edilen ve Easy Shells CUTnRUN analiz hattı için örnek veri seti olarak seçilen tüm ham okumalar CUTnRUN fastq dosyaları bir tablo olarak listelenmiştir. 'Dosya Adı' sütunu, 'Script_02_download-fastq.sh' çalıştırıldıktan sonra '~/Desktop/GSE126612/fastq' içinde gösterilecek olan ham CUT&RUN reads fastq dosyalarının dosya adlarını gösterir. 'md5sum', 'Script_02_download-fastq.sh' çalıştırarak veri kümesini indirdikten sonra dosyaların bütünlüğünü doğrulamak için kullanılabilecek örnek veri kümesi için MD5'i (Message-Digest Algorithm 5) paylaşır. Son sütun, her örnek için CUT&RUN hedefini açıklar. Bu Tabloyu indirmek için lütfen buraya tıklayın.