Kontrola jakości i przycinanie adapterów pozwala na zachowanie odczytów o wysokiej jakości sekwencjonowania
Techniki sekwencjonowania wysokoprzepustowego są podatne na powstawanie błędów sekwencjonowania, takich jak „mutacje” sekwencji w odczytach. Ponadto w zbiorach danych sekwencyjnych mogą występować wzbogacone dimery adapterów sekwencjonujących z powodu niewystarczającego usunięcia adapterów podczas przygotowywania biblioteki. Nadmierne błędy sekwencjonowania, takie jak mutacje odczytów, generowanie odczytów krótszych niż wymagane do prawidłowego mapowania oraz wzbogacenie dimerów adapterów, mogą wydłużyć czas mapowania odczytów i prowadzić do powstania fałszywie dodatnich zmapowanych odczytów, co zniekształca wyniki późniejszych analiz bioinformatycznych. Dlatego niezbędne jest filtrowanie jakościowe i przycinanie adapterów, aby zachować odczyty wysokiej jakości do dalszych analiz i interpretacji.
Aby zachować wysoką jakość odczytów do analizy, ten potok analizy CUT&RUN (Rysunek 2) wykorzystuje narzędzia FastQC26 oraz Trim Galore27. Skrypt powłoki „Script_03_fastQC.sh” uruchamia FastQC dla wszystkich plików fastq w katalogu roboczym. Wyniki (Rysunek 3) tego etapu, uzyskane przy użyciu publicznie dostępnego zbioru danych CTCF CUT&RUN z GSE126612 (SRR8581589), wskazują na obecność odczytów z zasadami o niskiej jakości (Rysunek 3A,C) oraz pewien stopień niezgodności w rozkładzie zawartości GC na sekwencję pomiędzy szacunkiem teoretycznym a rzeczywistymi odczytami (Rysunek 3E).
Wykonanie skryptu "Script_04_trimming.sh" w celu uruchomienia programu Trim Galore skutecznie usuwa odczyty z zasadami o niskiej jakości (poniżej 20 na Rysunku 3A) oraz odczyty o niskiej średniej jakości sekwencji widocznej przed przycinaniem (Rysunek 3B-D). Ponadto "Script_04_trimming.sh" skutecznie usuwa wzbogacenie średniej zawartości GC na poziomie 55~60%, przedstawione na wykresie rozkładu GC w sekwencji przed przycinaniem (Rysunek 3E,F). Wyniki te dowodzą, że ten potok analizy CUT&RUN filtruje odczyty wysokiej jakości, aby ułatwić szybkie i dokładne mapowanie odczytów do genomu referencyjnego.
Rozkład wielkości wstawek może dostarczyć szacunkowych danych dla wyników wyznaczania pików (peak calling)
Ze względu na zastosowanie MNazy w metodzie CUT&RUN (Rysunek 1), oczekuje się, że zmapowane odczyty CUT&RUN będą wykazywać piki wielkości fragmentów DNA o charakterze mononukleosomalnym (~200 bp) i dinukleosomalnym (~350 bp) na wykresach rozkładu wielkości wstawek (Rysunek 4). Problemy z detekcją niektórych celów mogą skutkować krótkimi wstawkami (< 100 bp) (Rysunek 4C). Wysoki poziom krótkich odczytów zmniejsza liczbę odczytów, które mogą zostać wykorzystane do wysokopoziomowego wyznaczania pików, co redukuje liczbę pików i wpływa na dalszą analizę. W tym potoku analizy CUT&RUN skrypt „Script_10_insert-size-analysis.sh” uruchamia funkcję „picard.jar CollectInsertSizeMetrics”, aby przeprowadzić analizę rozkładu wielkości wstawek i wyeksportować histogramy jako wynik wizualizacji (Rysunek 2). Na wykresach wyjściowych (Rysunek 4A-C) oś X przedstawia zakres wielkości wstawek, lewa strona osi Y oraz wypełniony histogram reprezentują liczbę wstawek o wartości wskazanej na osi X, a prawa strona osi Y oraz linia przerywana wskazują skumulowaną frakcję wstawek o wielkości równej lub większej od wartości na osi X. Zatem zarówno miejsce na osi X z najbardziej gwałtowną zmianą nachylenia linii przerywanej, jak i najwyższy poziom histogramu identyfikują główną wielkość wstawki w próbce. Wśród odczytów zmapowanych na genom referencyjny (ludzki, hg19), fragmenty próbki H3K27Ac (aktywna marka histonowa) wykazują oczekiwany rozkład wielkości wstawek CUT&RUN z najwyższym pikiem o wielkości mononukleosomalnej i wykrywalnym pikiem o wielkości dinukleosomalnej (Rysunek 4B). Fragmenty próbki CTCF wykazały dodatkowe grupy w regionach długości fragmentów 100~200 bp (Rysunek 4A). Podsumowując, potok analizy CUT&RUN dostarcza łatwe w użyciu skrypty powłoki do przeprowadzania analizy rozkładu wielkości wstawek po zmapowaniu odczytów na genomach referencyjnych. Analizy te stają się istotne przy szacowaniu wydajności wyznaczania pików przed dalszą analizą.
Potok analizy Easy Shells CUTnRUN zapewnia opcje filtrowania i normalizacji w celu uzyskania wiarygodnych liczb odczytów
Jednym z krytycznych punktów analizy CUT&RUN jest uzyskanie odpowiednich zmapowanych par odczytów poprzez odfiltrowanie problematycznych par odczytów z początkowych wyników mapowania oraz normalizację przefiltrowanych liczb zmapowanych odczytów za pomocą specyficznej metody obliczeniowej, która odpowiada celom lub potrzebom analizy użytkownika. Potok analizy CUT&RUN omówiony w niniejszym badaniu zawiera skrypt „Script_07_filter-sort-bam.sh”, służący do usuwania par odczytów zmapowanych na chromosomy niekanoniczne, publicznie adnotowane regiony czarnej listy23 oraz regiony powtórzeń TA18,22 z par odczytów, które zostały zmapowane programem bowtie2 przy użyciu skryptu „Script_06_bowtie2-mapping.sh”. Filtrowanie to jest niezbędne do usunięcia par odczytów, które mogą generować fałszywie dodatnie wyniki, sygnały odstające (spike signals) oraz błędnie zidentyfikowane piki w dalszej analizie (Rysunek 5; regiony w żółtych ramkach).
Oprócz filtracji, zastosowanie odpowiedniej metody normalizacji jest istotnym czynnikiem umożliwiającym dokładną wizualizację różnic w sygnale pomiędzy próbkami. Dlatego potok analizy CUT&RUN zawiera skrypty „Script_09_normalization_SFRC.sh” oraz „Script_09_normalization_SRPMC.sh”, które zapewniają dwie publicznie zweryfikowane metody normalizacji – skalowaną frakcyjną liczbę odczytów (SFRC)22 oraz normalizację Spike-in w odniesieniu do liczby odczytów na milion zmapowanych odczytów w kontroli negatywnej (SRPMC)24,25 (Rysunek 5A-D). Ponieważ SFRC nie uwzględnia w wzorze próbki kontrolnej (np. IgG) ani próbki spike-in, normalizacja SFRC może być stosowana do próbek, które nie zawierają żadnej próbki kontrolnej lub w których oczekuje się różnic w sygnale jedynie w regionach lokalnych, bez różnic w skali całego genomu. Próbki znormalizowane metodą SFRC przetworzone przez potok analizy CUT&RUN (Rysunek 5A-D; ścieżki czerwone) wykazują takie same wzorce rozkładu sygnału jak publicznie dostępne zmapowane odczyty z GEO (Rysunek 5A-D; ścieżki czarne), co sugeruje, że ten potok analizy może odtworzyć wyniki publikacyjne.
Metoda SRPMC jest przydatna do normalizacji próbek, które obejmują zarówno próbki kontrolne, jak i próbki z dodatkiem wewnętrznym (spike-in) i w których spodziewana jest globalna różnica sygnału między próbkami (Rysunek 5A-D; ścieżki zielone). Ponieważ jedna próbka H3K27Ac (SRR8581599) wykazuje znacznie wyższy stosunek „(rzeczywiste odczyty CUT&RUN)/(odczyty spike-in)” (RPS próbki; 997) niż pozostałe powtórzenia (237, 175 i 161), względne sygnały H3K27Ac wydają się różne między powtórzeniami w próbkach normalizowanych metodami SFRC i SRPMC (Rysunek 5A-D; porównanie H3K27Ac we wszystkich ścieżkach). Próbki RNAPII-S5P wykazują stosunkowo niższy RPS próbki (1,7, 0,8, 2,1) niż kontrola IgG (259), w związku z czym po normalizacji SRPMC próbki RNAPII-S5P wykazują niższy sygnał niż kontrola IgG (Rysunek 5A-D; porównanie RNAPII-S5P we wszystkich ścieżkach). Dlatego omówiony tutaj schemat analizy CUT&RUN zaleca stosowanie metody SRPMC wyłącznie dla próbek, które posiadają wystarczającą liczbę odczytów w próbkach eksperymentalnych w stosunku do odczytów kontroli IgG oraz kontroli spike-in.
Porównanie za pomocą diagramu Venna może pomóc w wyborze lepszej metody i opcji wyznaczania szczytów (peak calling)
Wiele programów do wyznaczania szczytów umożliwia identyfikację istotnie wzbogaconego zajęcia białek w całym genomie. Do programów stosowanych w analizie CUT&RUN należą dotychczas przede wszystkim programy z rodziny MACS2 oraz SEACR4. Jednakże identyfikacja najodpowiedniejszej metody i opcji wyznaczania szczytów dla danego projektu CUT&RUN może być wyzwaniem, zwłaszcza dla osób początkujących w bioinformatyce. Dlatego potok analizy CUT&RUN obejmuje etapy analizy za pomocą diagramów Venna, aby umożliwić użytkownikom porównanie podobieństw i różnic w wynikach wyznaczania szczytów pomiędzy różnymi opcjami (Script_17_intervene-options) oraz programami do wyznaczania szczytów (Script_19_intervene_methods.sh) (Rysunek 6A-H).
Z porównania zmergeowanych pików CTCF, H3K27ac oraz RNAPII-S5P, które zostały wyznaczone z opcją kontroli IgG oraz bez niej podczas etapu wyznaczania pików, wynika, że MACS2 i MACS3 wyznaczyły więcej pików z zastosowaniem opcji kontroli IgG (Rycina 6A), natomiast SEACR wyznaczył więcej pików bez opcji kontroli IgG zarówno w ustawieniach rygorystycznych, jak i rozluźnionych (Rycina 6B-D). W związku z tym potok analizy CUT&RUN sugeruje (1) zastosowanie opcji kontroli IgG dla MACS2 i MACS3, (2) wyznaczanie pików osobno dla próbek eksperymentalnych CUT&RUN oraz próbek kontrolnych IgG, a następnie odfiltrowanie pików IgG w późniejszym etapie dla programu SEACR. Porównując MACS2 i MACS3, program MACS3 wyznaczył nieco więcej pików (Rycina 6A).
Ponadto porównanie szczytów wyznaczonych przez MACS2 i MACS3 z opcją kontroli IgG oraz SEACR bez opcji kontroli IgG pokazuje, że szczyty SEACR wyznaczone z opcją rygorystyczną (stringent) pokrywają się z szczytami MACS 2 i MACS3 w większym stopniu niż szczyty SEACR wyznaczone z opcją liberalną (relaxed) (Rysunek 6E,F). Zatem wyniki potoku analizy CUT&RUN sugerują, że opcja rygorystyczna maksymalizuje spójność SEACR z wyznaczaniem szczytów w MACS. Wreszcie, diagram Venna służący do porównania pokrycia szczytów wyznaczonych przez SEACR z normalizacją dla plików bedGraph CUT&RUN z surową liczbą odczytów oraz bez normalizacji dla plików bedGraph CUT&RUN z znormalizowaną liczbą odczytów nie wykazuje różnic między metodami SFRC i SRPMC dla SEACR z opcją rygorystyczną. Szczyty SFRC charakteryzują się znacznie większą liczbą szczytów i lepszym pokryciem z szczytami z opcją normalizacji ('norm' na Rysunku 6) niż szczyty SRPMC dla SEACR z opcjami liberalnymi (Rysunek 6G,H).
Porównania statystyczne między powtórzeniami a próbkami
Wyciągnięcie dokładnych wniosków z wielu powtórzeń wymaga oceny podobieństwa tych powtórzeń. Zastosowany tutaj potok analizy CUT&RUN wykorzystuje obliczenia współczynnika korelacji statystycznej oparte na Deeptools215, grupowanie na mapach ciepła (heatmap clustering) oraz analizę głównych składowych (PCA), aby ułatwić identyfikację próbek i powtórzeń odpowiednich do prawidłowej analizy w dalszych etapach. Grupowanie na mapach ciepła oparte na współczynniku korelacji Pearsona wykazało statystycznie istotną korelację między powtórzeniami dla CTCF, H3K27Ac i RNAPII-S5P w obrębie zidentyfikowanych regionów szczytowych (Rysunek 7A-C). Jednak analiza PCA wykazała, że jedna próbka CTCF (SRR8581590) oraz H3K27Ac (SRR8581608) znajduje się stosunkowo daleko od pozostałych powtórzeń (Rysunek 7D) we wszystkich zidentyfikowanych regionach szczytowych dla CTCF, H3K27Ac i RNAPII-S5P.
Zgodnie z diagramem Venna służącym do porównania szczytów między powtórzeniami, szczyty CTCF (SRR8581590) wykazywały najmniejszą część wspólną z innymi powtórzeniami we wszystkich trzech wynikach programów do wyznaczania szczytów (Rysunek 7E-G), natomiast szczyty H3K27Ac (SRR8581608) wykazywały najmniejszą część wspólną z innymi powtórzeniami w wynikach wyznaczania szczytów metodą SEACR (Rysunek 7F). Szczyty H3K27Ac (SRR8581608) nie wykazywały minimalnej części wspólnej z innymi powtórzeniami w wynikach wyznaczania szczytów MACS2 i MACS3 (Rysunek 7F), co może sugerować, że odległość między powtórzeniami w analizie PCA nie jest wystarczająca do zdefiniowania próbki odstającej. W związku z tym potok analizy CUT&RUN proponuje zdefiniowanie powtórzenia odstającego jako „próbki, która wykazuje niski współczynnik korelacji Pearsona w grupie klastrowania na mapie ciepła, dużą odległość od innych powtórzeń na wykresie PCA oraz najmniejszą część wspólną szczytów między powtórzeniami”.
Wyznaczanie szczytów (peak calling) ułatwia wizualizację i interpretację danych CUT&RUN
Procedura analizy CUT&RUN szczegółowo opisana w niniejszym badaniu wykorzystuje dwa rodzaje publicznie dostępnych programów do wyznaczania szczytów: rodzinę MACS oraz SEACR. Aby zoptymalizować wizualizację wyznaczonych szczytów, procedura ta wybiera bin o najwyższym sygnale jako centrum szczytu dla analiz map ciepła (heatmap) i metaplotów. Wszystkie szczyty CTCF, H3K27Ac i RNAPII-S5P wyznaczone przez programy MACS3 i SEACR wykazały bardziej ostry wzorzec rozkładu szczytów w centrum binów o najwyższym sygnale (Rycina 8A-F, wykresy „focused”) niż w centrum całych regionów szczytowych (Rycina 8A-F, wykresy „whole”). Próbki CUT&RUN przetworzone za pomocą procedury analizy Easy Shells CUTnRUN z normalizacją SFRC (Rycina 8 A-F, wykresy „SFRC”) wykazują podobne wzorce rozkładu sygnału jak próbki z normalizacją SFRC, których surowe zmapowane pary odczytów są publicznie dostępne w bazie GEO (Rycina 8A-F, wykresy „public”) w obrębie szczytów wyznaczonych przez procedurę analizy. Zatem procedura analizy CUT&RUN potrafi skutecznie odtworzyć wyniki publikowane w literaturze.

Rysunek 1: Schemat procedury eksperymentalnej CUT&RUN. CUT&RUN to metoda enzymatyczna służąca do wykrywania oddziaływań białko-DNA w całym genomie. Procedura CUT&RUN rozpoczyna się od związania komórek (lub wyizolowanych jąder komórkowych) z konkanawalną A sprzężoną z kuleczkami magnetycznymi, co umożliwia izolację i manipulację niewielką liczbą komórek w trakcie całej procedury. Wyizolowane komórki poddaje się permeabilizacji przy użyciu łagodnego detergentu, aby ułatwić wprowadzenie przeciwciała skierowanego przeciwko interesującemu białku. Następnie do permeabilizowanych komórek wprowadza się nukleazę mikrokokkową (MNase) połączoną z tagiem białka A lub białka A/G. pA-MNase (lub pAG-MNase) jest rekrutowana do związanego przeciwciała za pomocą tagu białka A lub białka A/G. Po zlokalizowaniu MNase w miejscach docelowych, nukleaza jest krótko aktywowana poprzez dodanie wapnia w celu strawienia DNA wokół białka docelowego. Trawienie przez MNase prowadzi do powstania mononukleosomalnych kompleksów DNA-białko. Następnie wapń jest chelatowany, aby zakończyć reakcję trawienia, a krótkie fragmenty DNA powstałe w wyniku trawienia przez MNase są uwalniane z jąder poprzez krótką inkubację w 37°C, a następnie poddawane oczyszczaniu DNA, przygotowaniu biblioteki i sekwencjonowaniu wysokoprzepustowemu1. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Rysunek 2: Schematycznego podsumowanie potoku analizy Easy-Shell CUT&RUN. Potok analizy Easy-Shell CUT&RUN został zaprojektowany w trzech głównych sekcjach: (1) kontrola jakości i mapowanie surowych plików odczytów (lewo; kolor fioletowy), (2) normalizacja zmapowanych odczytów oraz liczby odczytów i wyznaczanie piku (środek; kolor zielony) oraz (3) walidacja zmapowanych odczytów i wyznaczonych pików (prawo; kolor różowy). W każdym kroku podano odpowiadający mu numer skryptu powłoki, krótki opis oraz narzędzie programistyczne użyte w tym kroku (w nawiasach). Proste strzałki wskazują bezpośrednie przepływy między krokami. Ten potok analizy CUT&RUN oferuje dwie metody normalizacji odczytów, które mogą spełnić potrzeby użytkowników z odczytami kontrolnymi oraz bez nich, wielowarstwowe procesy walidacji w celu zidentyfikowania odpowiednich powtórzeń do dalszych analiz, a także ukierunkowaną identyfikację pików w celu stworzenia precyzyjnych map ciepła (heatmap) i metaplotów. Potok analizy ten został napisany w formie łatwych w użyciu skryptów powłoki w sposób krok po kroku, aby umożliwić osobom początkującym w bioinformatyce naukę i praktykę podstawowej analizy danych CUT&RUN poprzez czytanie i edytowanie samych skryptów. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.

Rysunek 3: Porównanie wyników kontroli jakości przed i po przycinaniu jakościowym. Wybrane wyniki raportów kontroli jakości z FastQC pokazują efekt przycinania jakościowego z wykorzystaniem odczytów z SRR8581589 (GSM3609748, CTCF). Przedstawione wyniki obejmują: (A) Wartość jakości dla poszczególnych zasad przed przycinaniem. (B) Ten sam odczyt co w A), po przycinaniu. (C) Rozkład wartości jakości dla wszystkich sekwencji przed przycinaniem. (D) Ten sam odczyt co w C), po przycinaniu. (E) Rozkład GC dla wszystkich sekwencji przed przycinaniem. (F) Ten sam odczyt co w E), po przycinaniu. Minimalna wartość jakości w każdej pozycji w obrębie odczytów sekwencjonowania (A, B) oraz minimalna średnia jakość sekwencji (C, D) ulegają zwiększeniu po przycinaniu jakościowym. Ponadto krok ten może zmniejszyć różnicę między teoretycznym rozkładem liczby zasad GC a rzeczywistą liczbą GC na zasadę w odczytach (E, F) poprzez usunięcie par odczytów o wysokim współczynniku niedopasowania zasad. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Rysunek 4: Analiza rozkładu wielkości wstawek. Histogram wielkości wstawek dla (A) CTCF, (B) H3K27Ac oraz (C) polimerazy RNA II fosforylowanej w serynie 5 (RNAPII-S5P). Histogramy przedstawiają względne różnice w rozkładzie wielkości wstawek między próbkami. Linia przerywana na histogramie reprezentuje skumulowaną frakcję odczytów o wielkości wstawki większej niż lub równej wartości na osi x. n: liczba zgodnych zmapowanych unikalnych odczytów na próbkę po filtracji. FR: fragmenty. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.

Rysunek 5: Przegląd krajobrazu próbek CUT&RUN. Przedstawiono publicznie dostępne zmapowane odczyty CUT&RUN znormalizowane według przeskalowanego ułamkowego zliczenia (SFRC) bez dodatkowej filtracji (ślady czarne), próbki CUT&RUN przetworzone za pomocą potoku analizy Easy Shells CUTnRUN z normalizacją SFRC (ślady czerwone) oraz „odczyty na milion zmapowanych odczytów w kontroli negatywnej znormalizowane przez spike-in (SRPMC; ślady zielone)” w (A) regionie klastra genów histonów oraz w (B-D) trzech innych regionach z pikami CTCF, H3K27Ac i RNAPII-S5P zidentyfikowanymi przez wszystkie programy do wywoływania pików: MACS2, MACS3 i SEACR. Żółte ramki wyróżniają lokalizację sygnałów spike odfiltrowanych podczas etapu filtracji w potoku analizy Easy Shells CUTnRUN. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 6: Diagram Venna porównujący piki zidentyfikowane przez różne programy do wywoływania pików (peak callers) oraz różne opcje wywoływania pików. (A) Porównanie pików zidentyfikowanych przez MACS2 i MACS3 z i bez opcji wejściowej IgG podczas wywoływania pików. (B-D) Porównanie pików zidentyfikowanych przez SEACR z i bez opcji wejściowej IgG, z opcjami „stringent” i „relaxed”, oraz z opcją normalizacji przy użyciu plików surowych par odczytów (B), bez opcji normalizacji przy użyciu plików liczb odczytów znormalizowanych metodą SFRC (C) lub plików liczb odczytów znormalizowanych metodą SRPMC (D). (E,F) Porównanie pików zidentyfikowanych przez MACS2, MACS3 z opcją wejściową IgG oraz SEACR z opcją stringent (E) lub relaxed (F). (G,H) Porównanie pików zidentyfikowanych przez SEACR bez opcji wejściowej IgG z opcjami stringent (G) lub relaxed (H). w/ IgG: piki zidentyfikowane z opcją wejściową IgG. w/o IgG: piki zidentyfikowane bez opcji wejściowej IgG. norm: piki zidentyfikowane z opcją normalizacji. non: piki zidentyfikowane bez opcji normalizacji. SFRC: piki zidentyfikowane na podstawie plików liczb odczytów znormalizowanych metodą „scaled fractional count (SFRC)”. SRPMC: piki zidentyfikowane na podstawie plików liczb odczytów znormalizowanych metodą „Spike-in normalized Reads Per Million mapped reads in the negative Control (SRPMC)”. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 7: Korelacja Pearsona, analiza głównych składowych i diagram Venna w celu walidacji podobieństwa między powtórzeniami. (A-C) Klastrowanie na mapie ciepła z wartościami współczynnika korelacji Pearsona obrazuje stopień podobieństwa między powtórzeniami w obszarach szczytów wyznaczonych przez MACS2 (A), MACS3 (B) oraz SEACR (C). Współczynnik korelacji Pearsona przyjmuje wartości od -1 do 1. Wyższa wartość bezwzględna współczynnika korelacji Pearsona wskazuje na silniejszą korelację między dwiema zmiennymi, a dodatnia wartość wskazuje na korelację dodatnią, w której obie zmienne zmieniają się w tym samym kierunku. W związku z tym próbki o większym podobieństwie wykazują bliższe pokrewieństwo w klastrowaniu na mapie ciepła oraz wyższą wartość współczynnika Pearsona. (D) Analiza głównych składowych (PCA) obrazuje stopień podobieństwa między powtórzeniami i próbkami we wszystkich obszarach szczytów CTCF, H3K27Ac i RNAPII-S5P wyznaczonych przez MACS2 (lewo), MACS3 (środek) i SEACR (prawo). Próbki o większym podobieństwie są rozmieszczone bliżej siebie na wykresie PCA. (E-G) Analiza diagramem Venna w celu porównania szczytów znalezionych w każdym powtórzeniu przez MACS2 (E), MACS3 (F) i SEACR (G). Zaproponowany potok analityczny Easy-Shell CUT&RUN stosuje wszystkie trzy metody w celu zidentyfikowania powtórzeń o wysokim podobieństwie, które mogą być odpowiednie do połączenia wyznaczonych szczytów w dalszych analizach. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 8: Wizualizacja mapy ciepła i metaplotu rozkładu sygnału w pikach. Mapa ciepła i metaploty przedstawiają rozkład wzbogacenia wokół centrów pików wyznaczonych za pomocą różnych programów do wyznaczania pików (peak callers). (A,B) Piki CTCF CUT&RUN wyznaczone z jednej repliki (SRR8581589) przez MACS3 (A) oraz SEACR (B). (C,D) Piki H3K27Ac CUT&RUN wyznaczone z jednej repliki (SRR8581607) przy użyciu MACS3 (C) oraz SEACR (D). (E,F) Piki RNAPII CUT&RUN wyznaczone z jednej repliki (SRR8581589) przez MACS3 (E) oraz SEACR (F). Publicznie dostępne zmapowane pary odczytów ('Public' na Rysunku 8) oraz fragmenty zmapowane przez potok analityczny Easy Shells CUTnRUN ('SFRC' na Rysunku 8) są porównywane po normalizacji metodą 'scaled fractional count (SFRC)'. Piki są wyznaczane przez MACS3 z opcją kontroli IgG ('MACS3 w/ IgG' na Rysunku 8) oraz przez SEACR bez kontroli IgG i bez opcji normalizacji przy użyciu plików liczby odczytów znormalizowanych SFRC w trybie rygorystycznym ('SEACR w/o IgG non SFRC stringent' na Rysunku 8). Przygotowano dwie wersje plików współrzędnych wyznaczonych pików: od początku do końca wyznaczonych pików ('whole' na Rysunku 8) oraz lokalizację bin z najwyższym sygnałem w obrębie wyznaczonych pików (szczyty w pikach wyznaczonych przez MACS3; 'focused' na Rysunku 8). Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.
Tabela 1: Informacje dotyczące plików fastq CUT&RUN w GSE126612. W formie tabeli przedstawiono wszystkie surowe odczyty z plików fastq CUT&RUN zawarte w GSE126612, które zostały wybrane jako przykładowy zestaw danych dla potoku analizy Easy Shells CUTnRUN. Kolumna „File Name” zawiera nazwy plików fastq z surowymi odczytami CUT&RUN, które będą widoczne w katalogu „~/Desktop/GSE126612/fastq” po uruchomieniu skryptu „Script_02_download-fastq.sh”. Kolumna „md5sum” podaje sumy kontrolne MD5 (Message-Digest Algorithm 5) dla przykładowego zestawu danych, które mogą posłużyć do weryfikacji integralności plików po pobraniu zestawu danych za pomocą skryptu „Script_02_download-fastq.sh”. Ostatnia kolumna opisuje cel CUT&RUN dla każdej próbki. Kliknij tutaj, aby pobrać tę tabelę.