Artykuł metodologiczny

Wstępna analiza i walidacja danych sekwencjonowania CUT&RUN

DOI:

10.3791/67359

13 grudnia 2024

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ten protokół prowadzi początkujących bioinformatyków przez wprowadzający potok analizy CUT&RUN, który umożliwia użytkownikom przeprowadzenie wstępnej analizy i walidacji danych sekwencjonowania CUT&RUN. Wykonanie opisanych tutaj kroków analizy, w połączeniu z adnotacją pików, pozwoli użytkownikom na uzyskanie mechanistycznego wglądu w regulację chromatyny.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Technika CUT&RUN ułatwia wykrywanie interakcji białko-DNA w całym genomie. Typowe zastosowania CUT&RUN obejmują profilowanie zmian w modyfikacjach ogona histonowego lub mapowanie zajętości chromatyny czynnika transkrypcyjnego. Powszechne zastosowanie CUT&RUN jest częściowo napędzane przez zalety techniczne w porównaniu z konwencjonalnym sekwencją ChIP, które obejmują niższe wymagania dotyczące wprowadzania komórek, niższe wymagania dotyczące głębokości sekwencjonowania oraz zwiększoną czułość przy zmniejszonym sygnale tła ze względu na brak środków sieciujących, które w przeciwnym razie maskują epitopy przeciwciał. Powszechne przyjęcie CUT&RUN zostało również osiągnięte dzięki hojnemu udostępnianiu odczynników przez laboratorium Henikoff oraz opracowaniu komercyjnych zestawów w celu przyspieszenia wdrożenia przez początkujących. Wraz ze wzrostem technicznego zastosowania CUT&RUN, analiza sekwencjonowania CUT&RUN i walidacja stają się krytycznymi wąskimi gardłami, które muszą zostać pokonane, aby umożliwić pełne przyjęcie przez zespoły laboratoryjne, w których przeważają mokre laboratoria. Analiza CUT&RUN zazwyczaj rozpoczyna się od kontroli jakości surowych odczytów sekwencjonowania w celu oceny głębokości sekwencjonowania, jakości odczytu i potencjalnych odchyleń. Odczyty są następnie dopasowywane do referencyjnego zestawu sekwencji genomu, a następnie wykorzystuje się kilka narzędzi bioinformatycznych do opisywania regionów genomu wzbogacenia białek, potwierdzania możliwości interpretacji danych i wyciągania wniosków biologicznych. Chociaż opracowano wiele potoków analizy in silico w celu wsparcia analizy danych CUT&RUN, ich złożona, wielomodułowa struktura i wykorzystanie wielu języków programowania sprawiają, że platformy te są trudne dla początkujących bioinformatyków, którzy mogą nie znać wielu języków programowania, ale chcą zrozumieć procedurę analizy CUT&RUN i dostosować swoje potoki analityczne. W tym miejscu udostępniamy jednojęzyczny protokół potoku analizy krok po kroku CUT&RUN, przeznaczony dla użytkowników o dowolnym poziomie doświadczenia bioinformatycznego. Protokół ten obejmuje przeprowadzanie krytycznych kontroli jakości w celu sprawdzenia, czy dane sekwencjonowania są odpowiednie do interpretacji biologicznej. Oczekujemy, że przestrzeganie protokołu wprowadzającego przedstawionego w tym artykule w połączeniu z adnotacją o pikach w dół pozwoli użytkownikom na wyciąganie wniosków biologicznych z własnych zestawów danych CUT&RUN.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Możliwość mierzenia interakcji między białkami a genomowym DNA jest fundamentalna dla zrozumienia biologii regulacji chromatyny. Skuteczne testy, które mierzą zajętość chromatyny dla danego białka, dostarczają co najmniej dwóch kluczowych informacji: i) lokalizacji genomowej oraz ii) obfitości białka w danym regionie genomu. Śledzenie zmian rekrutacji i lokalizacji białka będącego przedmiotem zainteresowania w chromatynie może ujawnić bezpośrednie docelowe loci białka i ujawnić mechanistyczne role tego białka w procesach biologicznych opartych na chromatynie, takich jak regulacja transkrypcji, naprawa DNA lub replikacja DNA. Dostępne obecnie techniki profilowania interakcji białko-DNA umożliwiają naukowcom badanie regulacji w niespotykanej dotąd rozdzielczości. Taki postęp techniczny był możliwy dzięki wprowadzeniu nowych technik profilowania chromatyny, które obejmują opracowanie przez laboratorium Henikoff metody rozszczepienia pod celami i uwalniania za pomocą nukleazy (Cleavage Under Targets and Release Using Nucleaase). CUT&RUN oferuje kilka zalet technicznych w porównaniu z konwencjonalną immunoprecypitacją chromatyny (ChIP), które obejmują niższe wymagania dotyczące wprowadzania komórek, niższe wymagania dotyczące głębokości sekwencjonowania oraz zwiększoną czułość przy zmniejszonym sygnale tła ze względu na brak środków sieciujących, które w przeciwnym razie maskują epitopy przeciwciał. Przyjęcie tej techniki do badania regulacji chromatyny wymaga dogłębnego zrozumienia zasady leżącej u podstaw tej techniki oraz zrozumienia, jak analizować, walidować i interpretować dane CUT&RUN.

Procedura CUT&RUN rozpoczyna się od wiązania komórek z konkanawaliną A sprzężoną z kulkami magnetycznymi, aby umożliwić manipulowanie niską liczbą komórek podczas całej procedury. Wyizolowane komórki są przepuszczane przy użyciu łagodnego detergentu, aby ułatwić wprowadzenie przeciwciała, które jest skierowane przeciwko białemu zainteresowaniu. Nukleaza mikrokokkowa (MNaza) jest następnie rekrutowana do związanego przeciwciała za pomocą znacznika białka A lub białka A / G połączonego z enzymem. Wapń jest wprowadzany w celu zainicjowania aktywności enzymatycznej. W wyniku trawienia MNazy powstają mononukleosomalne kompleksy DNA-białko. Wapń jest następnie chelatowany w celu zakończenia reakcji trawienia, a krótkie fragmenty DNA z trawienia MNazy są uwalniane z jąder, a następnie poddawane oczyszczaniu DNA, przygotowaniu biblioteki i sekwencjonowaniu o wysokiej przepustowości1 (Rysunek 1).

Podejścia in silico do mapowania i ilościowego określania obecności białek w całym genomie rozwinęły się równolegle z metodami mokrego laboratorium, używanymi do wzbogacania tych interakcji DNA-białko. Identyfikacja regionów wzbogaconych sygnałów (pików) jest jednym z najbardziej krytycznych etapów analizy bioinformatycznej. Początkowe metody analizy ChIP-seq wykorzystywały algorytmy, takie jak MACS2 i SICER3, które wykorzystywały modele statystyczne do odróżnienia bona fide miejsc wiązania białko-DNA od szumu tła. Jednak niższy szum tła i wyższa rozdzielczość danych CUT&RUN sprawiają, że niektóre programy wywołujące wartości szczytowe stosowane w analizie ChIP-seq nie nadają się do analizy CUT&RUN4. Wyzwanie to uwypukla potrzebę opracowania nowych narzędzi, które lepiej nadają się do analizy danych CUT&RUN. SEACR4 reprezentuje jedno z takich narzędzi, które zostało ostatnio opracowane w celu umożliwienia wywoływania szczytów z danych CUT&RUN, przy jednoczesnym pokonywaniu ograniczeń związanych z narzędziami zwykle stosowanymi do analizy ChIP-seq.

Biologiczne interpretacje z danych sekwencjonowania CUT&RUN są pobierane z danych wyjściowych poniżej wywołania piku w potoku analizy. Można zaimplementować kilka funkcjonalnych programów adnotacyjnych w celu przewidywania potencjalnego znaczenia biologicznego wywoływanych pików na podstawie danych CUT&RUN. Na przykład projekt Gene Ontology (GO) zapewnia ugruntowaną funkcjonalną identyfikację genów będących przedmiotem zainteresowania5,6,7. Różne narzędzia i zasoby programowe ułatwiają analizę GO w celu ujawnienia genów i zestawów genów wzbogaconych wśród szczytów CUT&RUN8,9,10,11,12,13,14. Ponadto oprogramowanie do wizualizacji, takie jak Deeptools15, Integrative genomics viewer (IGV)16 i UCSC Genome Browser17 umożliwiają wizualizację rozkładu sygnałów i wzorców w interesujących regionach genomu.

Zdolność do wyciągania interpretacji biologicznych z danych CUT&RUN zależy przede wszystkim od walidacji jakości danych. Kluczowe komponenty do walidacji obejmują ocenę: i) jakości sekwencjonowania biblioteki CUT&RUN, ii) podobieństwa replikacji oraz iii) dystrybucji sygnału w centrach szczytów. Zakończenie walidacji wszystkich trzech komponentów ma kluczowe znaczenie dla zapewnienia wiarygodności próbek z biblioteki CUT&RUN i wyników dalszej analizy. W związku z tym konieczne jest opracowanie wstępnych przewodników po analizie CUT&RUN, aby umożliwić początkującym bioinformatykom i badaczom w laboratoriach mokrych przeprowadzenie takich etapów walidacji w ramach standardowych procesów analizy CUT&RUN.

Wraz z rozwojem eksperymentu CUT&RUN w laboratorium mokrym, różne metody analizy in silico CUT&RUN, takie jak CUT&RUNTools 2.018,19, nf-core/cutandrun20 oraz CnRAP21, zostały opracowane do obsługi analizy danych CUT&RUN. Narzędzia te zapewniają zaawansowane podejścia do analizy jednokomórkowych i zbiorczych zestawów danych CUT&RUN i CUT&Tag. Jednak stosunkowo złożona modułowa struktura programu i wymagana znajomość wielu języków programowania do przeprowadzania tych potoków analitycznych może utrudniać przyjęcie ich przez początkujących bioinformatyków, którzy chcą dokładnie zrozumieć etapy analizy CUT&RUN i dostosować własne potoki. Obejście tej bariery wymaga nowego, wprowadzającego potoku analizy CUT&RUN, który jest dostarczany w postaci prostych skryptów krok po kroku zakodowanych przy użyciu prostego, pojedynczego języka programowania.

W tym artykule opisujemy prosty, jednojęzyczny protokół potoku analizy CUT&RUN, który dostarcza krok po kroku skrypty wspierane szczegółowymi opisami, aby umożliwić nowym i początkującym użytkownikom przeprowadzanie analizy sekwencjonowania CUT&RUN. Programy używane w tym potoku są publicznie dostępne przez oryginalne grupy deweloperów. Główne kroki opisane w tym protokole obejmują wyrównanie odczytu, wywołanie pików, analizę funkcjonalną i, co najważniejsze, etapy walidacji w celu oceny jakości próbki w celu określenia przydatności i wiarygodności danych do interpretacji biologicznej (Rysunek 2). Co więcej, potok ten daje użytkownikom możliwość porównywania wyników analiz z publicznie dostępnymi zestawami danych CUT&RUN. Ostatecznie, ten protokół procesu analizy CUT&RUN służy jako przewodnik wprowadzający i odniesienie dla początkujących analityków bioinformatycznych i badaczy w laboratoriach mokrych.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

UWAGA: Informacje dotyczące plików CUT&RUN fastq w GSE126612 są dostępne w Tabeli 1. Informacje dotyczące oprogramowania używanego w niniejszym badaniu są wymienione w Tabeli materiałów.

1. Pobieranie Easy-Shells_CUTnRUN z jego strony na Github

  1. Otwórz terminal z systemu operacyjnego.
    UWAGA: Jeśli użytkownik nie jest pewien, jak otworzyć terminal w macOS i Windows, zapoznaj się z tą stroną internetową (https://discovery.cs.illinois.edu/guides/System-Setup/terminal/). W przypadku Linuksa zapoznaj się z tą stroną internetową (https://www.geeksforgeeks.org/how-to-open-terminal-in-linux/).
  2. Pobierz skompresowany pakiet analityczny z Github za pomocą polecenia wget https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/archive/refs/heads/main.zip -O ~/Desktop/Easy-Shells_CUTnRUN.zip w terminalu.
  3. Po pobraniu pliku zip rozpakuj plik zip za pomocą polecenia unzip ~/Desktop/Easy-Shells_CUTnRUN.zip -d ~/Desktop/ w terminalu.
  4. Po rozpakowaniu usuń plik zip za pomocą polecenia rm ~/Desktop/Easy-Shells_CUTnRUN.zip w terminalu i zmień nazwę folderu za pomocą polecenia mv ~/Desktop/Easy-Shells_CUTnRUN-master ~/Desktop/Easy-Shells_CUTnRUN.
  5. Po usunięciu skompresowanego pliku wpisz chmod +x ~/Desktop/Easy-Shells_CUTnRUN/script/*.sh w terminalu, aby ustawić uprawnienia wykonywalne dla wszystkich skryptów powłokowych w katalogu roboczym. Od tej pory po prostu wpisz ścieżkę i nazwę tych skryptów powłokowych w terminalu lub przeciągnij skrypty do terminala i wejdź, aby uruchomić te skrypty powłokowe w terminalu.
    UWAGA: Powłoka Bash jest zwykle zainstalowana domyślnie na większości dystrybucji Linuksa. Jednak ostatnie wersje macOS nie zapewniają już domyślnej powłoki Bash. Jeśli system nie ma Bash, najpierw zainstaluj powłokę Bash. Odwiedź poniższe linki, aby uzyskać instrukcje dotyczące instalacji powłoki Bash w systemie operacyjnym Linux (https://ioflood.com/blog/install-bash-shell-linux/) i macOS (https://www.cs.cornell.edu/courses/cs2043/2024sp/styled-3/#:~:text=The first thing you will,you will see the following:). Te krokowe skrypty powłokowe zostały napisane, aby utworzyć jeden folder ~/Desktop/GSE126612 w celu przeprowadzenia większości tej analizy CUT&RUN w tym katalogu bez konieczności modyfikacji. Jeśli użytkownik rozumie, jak korzystać z tych skryptów powłokowych, użytkownicy mogą je przeglądać i dostosowywać, aby analizować inne zestawy danych CUT&RUN i modyfikować opcje zgodnie z potrzebami projektu. Aby czytać i edytować te skrypty powłokowe, rozważ użycie programu Visual Studio Code (https://code.visualstudio.com/) jako jednej z opcji łatwego w użyciu programu dostępnego dla głównych systemów operacyjnych.

2. Instalowanie programów wymaganych do Easy Shells CUTnRUN

  1. Wśród skryptów powłokowych o nazwie Script_01_installation_***.sh znajdź skrypt powłokowy, którego nazwa zawiera typ systemu operacyjnego użytkownika. Obecnie Easy Shells CUTnRUN obsługuje skrypt instalacyjny dla macOS, Debian/Ubuntu i systemów CentOS/RPM.
  2. Otwórz terminal i wpisz echo $SHELL, aby sprawdzić domyślną powłokę w aktywnym terminalu. Jeśli powłoka Bash jest domyślną powłoką w bieżącym terminalu, użytkownicy mogą zobaczyć coś takiego jak: /path/to/bash (lub podobną wiadomość, taką jak /bin/bash) w terminalu.
  3. Jeśli domyślna powłoka nie jest Bash, ustaw powłokę Bash jako domyślną powłokę za pomocą polecenia chsh -s $(which bash) w terminalu. Jeśli terminal używa powłoki Bash jako domyślnej, pomiń ten krok.
  4. W terminalu uruchom skrypt instalacyjny za pomocą polecenia ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_01_installation_***.sh lub przeciągnij plik skryptu powłokowego do terminala i wejdź.
  5. Przeczytaj plik Test_README.md w folderze /path/to/SEACR-1.3/Testfiles. Postępuj zgodnie z instrukcjami zawartych w pliku README, aby wyjaśnić, czy SEACR w systemie użytkownika działa poprawnie.
    UWAGA: Istotne jest sprawdzenie funkcji SEACR za pomocą plików testowych podanych na stronie SEACR Github, aby uzyskać odpowiednie wyniki wywoływania szczytów z danych CUT&RUN. Dlatego od razu po zainstalowaniu SEACR postępuj zgodnie z instrukcjami Test_README.md w /path/to/SEACR-1.3/Testfiles. Chociaż Easy Shells CUTnRUN zapewnia skrypty instalacyjne dla niektórych systemów operacyjnych, te skrypty mogą nie działać w systemie niektórych użytkowników, aby zainstalować wszystkie programy wymagane do Easy Shells CUTnRUN. Jeśli wystąpi jakikolwiek problem z instalacją, sprawdź oryginalną stronę internetową niezainstalowanego programu lub poproś o pomoc na stronie internetowej problemów Easy Shells CUTnRUN github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).

3. Pobieranie publicznie dostępnego zestawu danych CUT&RUN z Sequence Read Archive (SRA)

  1. Otwórz terminal i wpisz echo $SHELL, aby sprawdzić domyślną powłokę w akt

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Jakość i przycinanie adapterów zachowuje odczyty z wysoką jakością sekwencjonowania
Techniki sekwencjonowania o wysokiej przepustowości są podatne na generowanie błędów sekwencjonowania, takich jak "mutacje" sekwencji w odczytach. Co więcej, dimery adapterów sekwencjonowania mogą być wzbogacone o zestawy danych sekwencjonowania ze względu na słabe usunięcie adaptera podczas przygotowywania biblioteki. Nadmierne błędy sekwencjonowania, takie jak mutacje odczytu, generowanie odczytów krótszych niż wymagane do prawidłowego mapowania i wzbogacanie dimerów adapterów, mogą wydłużyć czas mapowania odczytu i mogą powodować fałszywie dodatnie odczyty mapowania, które zniekształcają wyniki dalszej analizy bioinformatycznej. W związku z tym wymagane jest wysokiej jakości filtrowanie i przycinanie adapterów, aby zachować wysoką jakość odczytów do dalszej analizy i interpretacji.

Aby zachować wysoką jakość odczytów do analizy, ten potok analizy CUT&RUN (Rysunek 2) wykorzystuje FastQC26 i Trim Galore27. Skrypt powłoki "Script_03_fastQC.sh" uruchamia FastQC dla wszystkich plików fastq w katalogu roboczym. Wyniki (Rysunek 3) tego kroku przy użyciu publicznie dostępnego zestawu danych CTCF CUT&RUN z GSE126612 (SRR8581589) identyfikują niektóre odczyty z podstawami wyników o niskiej jakości (Rysunek 3A,C) i pewne stopnie niezgodności rozkładu zawartości GC na sekwencję między teoretycznym oszacowaniem a rzeczywistymi odczytami (Rysunek 3E).

Wykonanie skryptu "Script_04_trimming.sh" w celu uruchomienia Trim Galore skutecznie usuwa te odczyty o niskiej jakości bazach wyników (poniżej 20 w Rysunek 3A) i niskiej średniej jakości sekwencji widoczne przed przycinaniem (Rysunek 3B-D). Ponadto "Script_04_trimming.sh" z powodzeniem usuwa 55 ~ 60% średniego wzbogacenia zawartości GC wyświetlanego w "wstępnym przycinaniu" rozkładu GC na wykresie sekwencji (Rysunek 3E,F). Wyniki te pokazują, że ten potok analityczny CUT&RUN filtruje w celu uzyskania wysokiej jakości odczytów, aby ułatwić szybkie i dokładne mapowanie odczytu do genomu referencyjnego.

Rozkład wielkości wstawienia może podać szacunkowe wyniki szczytowych połączeń
Ze względu na zastosowanie MNazy w CUT&RUN (Rysunek 1), oczekuje się, że zmapowane odczyty CUT&RUN będą wykazywać mono- (~200 pz) i dinukleosomalne (~350 pz) piki wielkości fragmentów DNA na wykresach rozkładu wielkości wstawki (Rysunek 4). Problemy z wykrywaniem niektórych celów mogą skutkować krótkimi wstawkami (< 100 pz) (Rysunek 4C). Wysoki poziom krótkich odczytów zmniejsza liczbę odczytów, które można wykorzystać do wywołania szczytowego o wysokim poziomie pewności, zmniejszając w ten sposób liczby szczytowe i wpływając na dalszą analizę. W tym potoku analizy CUT&RUN "Script_10_insert-size-analysis.sh" obsługuje funkcję "picard.jar CollectInsertSizeMetrics" w celu przeprowadzenia analizy rozkładu rozmiaru wstawienia i wyeksportowania histogramów jako danych wyjściowych wizualizacji (Rysunek 2). Na wykresach wyjściowych (Rysunek 4A-C), oś x pokazuje zakres rozmiarów wkładek, lewa strona osi y i wypełniony histogram reprezentują liczbę wstawień z wartością na osi x, a prawa strona osi y pokazuje i linię przerywaną skumulowany ułamek wkładek o rozmiarze wkładki równym lub większym niż wartość na osi x. W związku z tym zarówno położenie na osi X z najbardziej dramatyczną zmianą nachylenia linii przerywanej, która przecina się z poziomem szczytów na histogramie, identyfikuje główny rozmiar wstawki w próbce. Wśród odczytów zmapowanych na genomie referencyjnym będącym przedmiotem zainteresowania (człowiek, hg19), fragmenty próbki H3K27Ac (aktywny znacznik histonowy) wykazują oczekiwany rozkład wielkości insertu CUT&RUN z najwyższym rozmiarem mononukleosomalnym i wykrywalnymi pikami wielkości dinukleosomów (Figura 4B). Fragmenty próbki CTCF pokazały dodatkowe grupy w regionach o długości fragmentów 100 ~ 200 pz (Rysunek 4A). Podsumowując, potok analizy CUT&RUN zapewnia łatwe w użyciu skrypty powłoki do przeprowadzania analizy rozkładu rozmiaru wstawek po odwzorowaniu odczytów na genomach referencyjnych. Analizy te stają się ważne przy szacowaniu skuteczności wywołania szczytowego przed dalszą analizą.

Potok analizy Easy Shells CUTnRUN zapewnia opcje filtracji i normalizacji w celu tworzenia wiarygodnych odczytów
Jednym z krytycznych punktów analizy CUT&RUN jest uzyskanie prawidłowo zmapowanych par odczytu poprzez filtrowanie problematycznych par odczytu z początkowych danych wyjściowych mapowania i normalizację przefiltrowanych zmapowanych odczytów za pomocą określonej metody obliczania normalizacji, która może spełnić cele/potrzeby analizy użytkownika. Potok analizy CUT&RUN omówiony w tym badaniu obejmuje skrypt "Script_07_filter-sort-bam.sh" do usuwania par odczytu, które są mapowane na chromosomach niekanonicznych, publicznie opatrzonych adnotacjami regionów czarnej listy23 i regionów powtórzeń TA18,22 z par odczytu, które zostały zmapowane przez bowtie2 za pomocą "Script_06_bowtie2-mapping.sh". Filtracje te są wymagane do usunięcia par odczytu, które mogą generować fałszywie dodatnie, odstające sygnały szczytowe i zwane pikami w dalszej analizie (Rysunek 5; obszary żółtego pola).

Oprócz filtracji, zastosowanie prawidłowej metody normalizacji jest ważnym czynnikiem umożliwiającym dokładną wizualizację różnicy sygnału między próbkami. W związku z tym potok analizy CUT&RUN zawiera skrypty "Script_09_normalization_SFRC.sh" i "Script_09_normalization_SRPMC.sh", które zapewniają dwie publicznie zweryfikowane metody normalizacji - skalowany odczyt frakcyjny (SFRC)22 i znormalizowane odczyty Spike-in Per Million mapowane odczyty w kontroli ujemnej (SRPMC)24,25 (Rysunek 5A-Ponieważ SFRC nie obejmuje próbki kontrolnej (na przykład IgG) ani skoku próbki w formule, normalizacja SFRC może być stosowana dla próbek, które nie zawierają żadnej próbki kontrolnej lub oczekuje się, że będą wykazywać różnice w sygnałach w lokalnych regionach tylko bez różnicy w skali całego genomu. Znormalizowane próbki SFRC przetwarzane przez potok analizy CUT&RUN ( Rysunek 5A-D; czerwone ścieżki) wytwarza te same wzorce dystrybucji sygnału, co publicznie dostępne zmapowane odczyty z GEO (Rysunek 5A-D; czarne ścieżki), co sugeruje, że ten potok może odtworzyć wyniki publikacji.

Metoda SRPMC jest przydatna do normalizacji próbek, które obejmują zarówno próbki kontrolne, jak i próbki Spike-in, i oczekuje się, że pokażą globalną różnicę sygnału między próbkami (Rysunek 5A-D; zielone ścieżki). Ponieważ jedna próbka H3K27Ac (SRR8581599) wykazuje znacznie wyższy stosunek "(rzeczywiste odczyty CUT&RUN)/(odczyty skokowe)" (próbka RPS; 997) niż inne powtórzenia (237, 175 i 161), względne sygnały H3K27Ac wydają się różne między powtórzeniami w próbkach znormalizowanych SFRC i SRPMC (Rysunek 5A-D; H3K27Ac porównany na wszystkich ścieżkach). Próbki RNAPII-S5P wykazują stosunkowo niższy RPS próbki (1,7, 0,8, 2,1) niż kontrola IgG (259), dlatego próbki RNAPII-S5P wykazują niższy sygnał niż kontrola IgG po normalizacji SRPMC (Rysunek 5A-D; RNAPII-S5P porównane na wszystkich ścieżkach). W związku z tym, omawiany tutaj potok analizy CUT&RUN zaleca stosowanie metody SRPMC tylko dla próbek, które mają wystarczającą liczbę odczytów w próbkach eksperymentalnych w stosunku zarówno do odczytów kontrolnych IgG, jak i kontrolnych skoków.

Porównanie diagramu Venna może dostarczyć pomysłów na wybór lepszej metody i opcji wywoływania szczytów
Wiele programów wywoływania pików umożliwia identyfikację znacznie wzbogaconego zajętości białek w całym genomie. Do takich programów wykorzystywanych do analizy CUT&RUN należą programy z rodziny MACS2 i SEACR4 jako główne metody do tej pory. Jednak może to być trudne, szczególnie dla początkujących bioinformatyków, aby zidentyfikować najbardziej odpowiednią metodę i opcje wywoływania pików dla danego projektu CUT&RUN. W związku z tym potok analizy CUT&RUN obejmuje etapy analizy diagramu Venna, aby dać użytkownikom możliwość porównania podobieństwa i różnicy wyników wywołania szczytowego między różnymi opcjami wywołania szczytowego (Script_17_intervene-opcje) i programami wywołującymi szczyty (Script_19_intervene_methods.sh) (Rysunek 6A-H).

Zgodnie z porównaniem połączone piki CTCF, H3K27ac i RNAPII-S5P, które są wywoływane z i bez opcji kontroli IgG podczas kroku wywołania szczytu, MACS2 i MACS3 wywołały więcej pików z opcją kontroli IgG (Rysunek 6A), ale SEACR wywołał więcej pików bez opcji kontroli IgG zarówno w opcjach rygorystycznych, jak i zrelaksowanych (Rysunek 6B-D). W związku z tym proces analizy CUT&RUN sugeruje (1) zastosowanie opcji kontroli IgG dla MACS2 i MACS3, (2) wywołanie pików dla eksperymentalnych próbek CUT&RUN i próbek kontrolnych IgG oddzielnie, a następnie późniejsze odfiltrowanie pików IgG dla wywołującego pik SEACR. Pomiędzy MACS2 i MACS3, MACS3 wywołał nieco więcej szczytów (Rysunek 6A).

Ponadto, porównanie pików wywoływanych przez MACS2 i MACS3 z opcją kontroli IgG i SEACR bez opcji kontroli IgG pokazuje, że piki SEACR wywoływane opcją rygorystyczną pokrywają się z pikami MACS 2 i MACS3 bardziej niż piki SEACR wywoływane opcją zrelaksowaną (Rysunek 6E,F). W związku z tym wyniki potoku analizy CUT&RUN sugerują, że opcja rygorystyczna maksymalizuje spójność SEACR z wywołaniami szczytowymi MACS. Wreszcie, diagram Venna do porównania nakładania się pików wywoływanych przez SEACR z normalizacją dla plików CUT&RUN bedGraph dla odczytów surowych i bez normalizacji dla znormalizowanych plików bedGraph CUT&RUN nie ujawnia różnicy między metodami SFRC i SRPMC dla SEACR z opcją rygorystyczną. Piki SFRC wykazują znacznie wyższe liczby pików i lepiej pokrywają się ze znormalizowanymi pikami opcji ("norma" w Rysunek 6) niż piki SRPMC dla SEACR ze złagodzonymi opcjami (Rysunek 6G,H).

Statystyczne porównania między powtórzeniami a próbkami
Wyciąganie dokładnych wniosków na podstawie wielu powtórzeń wymaga oceny podobieństwa replik. Zastosowany tutaj potok analizy CUT&RUN wykorzystuje obliczenia współczynników korelacji statystycznej oparte na Deeptools215, grupowanie map cieplnych i analizę głównych składowych (PCA) w celu ułatwienia identyfikacji próbek i powtórzeń odpowiednich do prawidłowej dalszej analizy. Grupowanie mapy cieplnej oparte na współczynniku korelacji Pearsona wykazało statystycznie istotną korelację między kontrpróbami dla CTCF, H3K27Ac i RNAPII-S5P w ich nazywanych regionach szczytowych (Rysunek 7A-C). Jednak PCA wykazało, że jedna próbka CTCF (SRR8581590) i H3K27Ac (SRR8581608) znajdują się stosunkowo daleko od innych powtórzeń (Rysunek 7D) we wszystkich regionach CTCF, H3K27Ac i RNAPII-S5P zwanych regionami pików.

Zgodnie z diagramem Venna do porównania pików między powtórzeniami, piki CTCF (SRR8581590) wykazały najmniejsze nakładanie się na inne powtórzenia we wszystkich trzech wynikach wywołania piku (Rysunek 7E-G), a piki H3K27Ac (SRR8581608) wykazały najmniejsze nakładanie się z innymi powtórzeniami w wynikach wywołania pików SEACR (Rysunek 7F). piki H3K27Ac (SRR8581608) nie wykazywały minimalnego nakładania się z innymi powtórzeniami w wynikach wywołania pików MACS2 i MACS3 (Rysunek 7F), co może sugerować, że odległość między powtórzeniami w PCA nie jest wystarczająca do zdefiniowania próby odstającej. W związku z tym w procesie analizy CUT&RUN zaproponowano zdefiniowanie repliki wartości odstającej jako "próby, która wykazuje niski współczynnik korelacji Pearsona w grupie grupowania map cieplnych, dużą odległość na wykresie PCA z innymi powtórzeniami oraz najniższe nakładanie się pików między powtórzeniami".

Wywołanie szczytu ułatwia wizualizację i interpretację danych CUT&RUN
Potok analizy CUT&RUN szczegółowo opisany w tym badaniu wykorzystuje dwa typy publicznie dostępnych szczytowych rozmówców: rodzinę MACS i SEACR. Aby zoptymalizować wizualizację wywoływanych pików, ten potok wybiera najwyższy kosz sygnału jako centrum piku dla analiz mapy cieplnej i metawykresów. Wszystkie piki CTCF, H3K27Ac i RNAPII-S5P wywoływane przez wywołujących szczyty MACS3 i SEACR wykazywały ostrzejszy wzorzec rozkładu pików w środku najwyższych przedziałów sygnału (Rysunek 8A-F, wykresy 'skoncentrowane') niż w centrum całych regionów pików (Rysunek 8A-F, "całych" działek). Próbki CUT&RUN przetwarzane przez potok analizy CUTnRUN Easy Shells z normalizacją SFRC (Rysunek 8 A-F, wykresy 'SFRC') wykazują podobne wzorce dystrybucji sygnału jak w próbkach znormalizowanych SFRC, których surowe zmapowane pary odczytu są publicznie dostępne w GEO (Rysunek 8A-F, "publiczne" wykresy) w szczytach wywoływanych przez potok analizy. W ten sposób potok analizy CUT&RUN może z powodzeniem odtworzyć wyniki publikacji.

figure-results-1
Rysunek 1: Schemat procedury eksperymentalnej CUT&RUN. CUT&RUN to oparte na enzymach podejście do wykrywania interakcji białko-DNA w całym genomie. Procedura CUT&RUN rozpoczyna się od związania komórek (lub izolowanych jąder) z konkanawaliną A sprzężoną z kulkami magnetycznymi, aby umożliwić izolację i manipulację niską liczbą komórek podczas całej procedury. Wyizolowane komórki są przepuszczane przy użyciu łagodnego detergentu, aby ułatwić wprowadzenie przeciwciała, które jest skierowane przeciwko białemu zainteresowaniu. Nukleaza mikrokokkowa (MNaza) przywiązana do znacznika białka A lub białka A / G jest następnie wprowadzana do przepuszczalnej komórki. pA-MNaza (lub pAG-MNaza) jest rekrutowana do związanego przeciwciała za pomocą znacznika białka A lub białka A / G. Gdy MNaza zostanie zlokalizowana w miejscach docelowych, nukleaza jest na krótko aktywowana poprzez wprowadzenie wapnia w celu trawienia DNA wokół białka docelowego. W wyniku trawienia MNazy powstają mononukleosomalne kompleksy DNA-białko. Wapń jest następnie chelatowany w celu zakończenia reakcji trawienia, a krótkie fragmenty DNA z trawienia MNazy są uwalniane z jąder przez krótką inkubację w temperaturze 37°C, a następnie poddawane oczyszczaniu DNA, przygotowaniu biblioteki i sekwencjonowaniu o wysokiej przepustowości1. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-2
Rysunek 2: Schematyczne podsumowanie potoku analitycznego Easy-Shell CUT&RUN. Potok analizy Easy-Shell CUT&RUN został zaprojektowany w trzech głównych sekcjach - (1) kontrola jakości i mapowanie surowych plików odczytu (po lewej; fioletowy), (2) normalizacja zmapowanych odczytów i liczb odczytów oraz wywołania szczytów (w środku; zielony) oraz (3) walidacja zmapowanych odczytów i wywoływanych pików (po prawej; różowa). W każdym kroku podany jest odpowiedni numer skryptu powłoki, krótki opis oraz narzędzie programowe użyte w tym kroku (w nawiasach). Zwykłe strzałki pokazują bezpośrednie przepływy między krokami. Ten potok analizy CUT&RUN zapewnia dwie metody normalizacji odczytu, które mogą zaspokoić potrzeby użytkowników z odczytami kontrolnymi i bez nich, wielowarstwowe procesy walidacji w celu zidentyfikowania odpowiednich replikatów do dalszej analizy oraz ukierunkowaną identyfikację pików w celu dobrze ukierunkowanej mapy cieplnej i tworzenia danych wyjściowych metaplotu. Ten potok analizy jest napisany w łatwych w użyciu skryptach powłok krok po kroku, aby zapewnić początkującym bioinformatykom możliwość nauczenia się i przećwiczenia podstawowej analizy danych CUT&RUN poprzez czytanie i edytowanie samych skryptów. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-3
Rysunek 3: Porównanie wyników kontroli jakości przed i po przycinaniu. Wybrane wyniki raportu kontroli jakości z FastQC wyświetlają efekt przycinania jakości przy użyciu odczytów z SRR8581589 (GSM3609748, CTCF). Wyświetlane wyniki obejmują: (A) Wynik jakości we wstępnym przycinaniu baz. (B) Taki sam odczyt jak A) po przycinaniu. (C) Rozkład punktów jakości we wszystkich sekwencjach przed przycinaniem. (D) Taki sam odczyt jak C) po przycinaniu. (E) Rozkład GC we wszystkich sekwencjach wstępnego przycinania. (F) Taki sam odczyt jak E) po przycinaniu. Minimalny wynik jakości na każdej pozycji w odczytach sekwencjonowania (A, B) i minimalna średnia jakość sekwencji (C, D) są zwiększane po przycięciu jakościowym. Ponadto ten krok może zmniejszyć różnicę między teoretycznym rozkładem liczby GC a rzeczywistą liczbą GC na bazę w odczytach (E, F) poprzez usunięcie par odczytów, które mają wysoki współczynnik niezgodności zasad. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-4
Rysunek 4: Analiza rozkładu wielkości wstawki. Histogram rozmiaru wkładki dla (A) CTCF, (B) H3K27Ac i (C) polimerazy II fosforylowanego RNA 5 seryny (RNAPII-S5P). Histogramy pokazują względne różnice w rozkładzie wielkości wkładek między próbkami. Linia przerywana na histogramie reprezentuje skumulowany ułamek odczytów o rozmiarze wstawki większym lub równym wartości na osi x. N: liczba spójnie zmapowanych unikalnych odczytów na próbkę po filtracji. FR: Fragmenty. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-5
Rysunek 5: Przegląd próbek CUT&RUN w orientacji poziomej. Publicznie dostępne odczyty zmapowane metodą CUT&RUN znormalizowane przez skalowaną liczbę ułamkową (SFRC) bez dodatkowej filtracji (czarne ścieżki), próbki CUT&RUN przetworzone przez potok analityczny Easy Shells CUTnRUN z normalizacją SFRC (czerwone ścieżki) oraz "Spike-in normalized Reads Per Million mappped reads in the negative Control (SRPMC; zielone ścieżki)" są pokazane w regionie klastra genów histonów (A), oraz (B-D) pozostałe trzy regiony z pikami CTCF, H3K27Ac i RNAPII-S5P wywoływanymi przez wszystkich wywołujących szczyty MACS2, MACS3 i SEACR. Żółte pola wskazują lokalizację sygnałów szczytowych odfiltrowanych na etapie filtracji w potoku analizy Easy Shells CUTnRUN. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-6
Rysunek 6: Diagram Venna do porównania szczytów wywoływanych przez różnych dzwoniących szczyty i opcji wywoływania szczytów. (A) Porównanie pików wywoływanych przez MACS2 i MACS3 z opcją wejścia IgG i bez niej podczas wywołania szczytu. (B-D) Porównanie pików wywoływanych przez SEACR z opcją wprowadzania IgG i bez niej, opcjami "rygorystycznymi" i "złagodzonymi" oraz z opcją normalizacji przy użyciu plików par odczytu surowego (B), bez opcji normalizacji przy użyciu znormalizowanych plików odczytów SFRC (C) lub znormalizowanych plików odczytów SRPMC (D). (E,F) Porównanie pików wywoływanych przez MACS2, MACS3 z opcją wejścia IgG i SEACR z opcją rygorystyczną (E) lub zrelaksowaną (F). (G,H) Porównanie pików wywoływanych przez SEACR bez opcji wprowadzania IgG oraz z opcjami rygorystycznymi (G) lub złagodzonymi (H). w/ IgG: piki wywoływane za pomocą opcji wejścia IgG. bez IgG: piki wywoływane bez opcji wprowadzania IgG. norma: piki wywoływane z opcją normalizacji. Nie: Szczyty wywoływane bez opcji normalizacji. SFRC: piki wywoływane przez pliki readcounts znormalizowane metodą "skalowanej liczby ułamków (SFRC)". SRPMC: piki wywoływane przez pliki odczytów znormalizowane przez "Spike-in znormalizowane odczyty na milion zmapowanych odczytów w metodzie kontroli ujemnej (SRPMC)". Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-7
Rysunek 7: Korelacja Pearsona, analiza głównych składowych i diagram Venna w celu sprawdzenia podobieństwa między powtórzeniami. (A-C) Grupowanie map cieplnych z wartościami współczynnika korelacji Pearsona pokazuje stopień podobieństwa między powtórzeniami w szczytach nazywanych przez MACS2 (A), MACS3 (B) i SEACR (C). Współczynnik korelacji Pearsona mieści się w przedziale od -1 do 1. Większa bezwzględna wartość współczynnika korelacji Pearsona wskazuje na silniejszą korelację między dwiema zmiennymi, a dodatnia wartość współczynnika korelacji Pearsona wskazuje na dodatnią korelację, w której obie zmienne poruszają się w tym samym kierunku. W związku z tym próbki o większym podobieństwie wykazują bliższy rodowód w grupowaniu mapy cieplnej i wyższą wartość współczynnika Pearsona. (D) Analiza głównych składowych (PCA) wykazuje stopień podobieństwa między kontrpróbami i próbkami we wszystkich regionach pików CTCF, H3K27Ac i RNAPII-S5P, które są nazywane przez MACS2 (po lewej), MACS3 (w środku) i SEACR (po prawej). Próbki o większym podobieństwie umieszcza się bliżej siebie na wykresie PCA. (E-G) Analiza diagramu Venna w celu porównania pików znalezionych w każdej kontrpróbie przez MACS2 (E), MACS3 (F) i SEACR (G). W ramach procesu analizatorskiego Easy-Shell CUT&RUN zaproponowano zastosowanie wszystkich trzech metod w celu identyfikacji powtórzeń o wysokim podobieństwie, które mogą być odpowiednie do połączenia wywołanych pików do dalszej analizy. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-8
Rysunek 8: Mapa cieplna i wizualizacja metawykresu rozkładu sygnału w szczytach. Mapa cieplna i metawykresy przedstawiają rozkład wzbogacenia wokół centrów szczytów wywoływanych przy użyciu różnych wywołujących szczyty. Panie przewodniczący, panie i panowie! Piki CTCF CUT&RUN wywoływane z jednej repliki (SRR8581589) przez MACS3 (A) i SEACR (B). (C,D) Piki H3K27Ac CUT&RUN wywoływane z jednej replikacji (SRR8581607) przy użyciu MACS3 (C) i SEACR (D). (E,F) Piki RNAPII CUT&RUN wywoływane z jednej repliki (SRR8581589) przez MACS3 (E) i SEACR (F). Publicznie dostępne zmapowane pary odczytu ("Public" w Rysunek 8) oraz fragmenty zmapowane przez potok analityczny Easy Shells CUTnRUN ("SFRC" w Rysunek 8) są porównywane po normalizacji "skalowanej liczby ułamków (SFRC)". Piki są wywoływane przez MACS3 z opcją wejścia IgG ("MACS3 w/ IgG" w Rysunek 8) i SEACR bez wejścia IgG i bez opcji normalizacji przy użyciu znormalizowanych plików odczytu SFRC w trybie rygorystycznym ("SEACR bez IgG non SFRC rygorystyczny" w Rysunek 8). Przygotowywane są dwie wersje plików współrzędnych wywoływanych szczytów: od początku do końca wywoływanych szczytów ('whole' w Rysunek 8) oraz lokalizacja bin z najwyższym sygnałem w obrębie wywoływanych szczytów (szczyty w MACS3 zwane szczytami; 'skupione' w Rysunek 8). Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Tabela 1: Informacje dotyczące plików CUT&RUN fastq w GSE126612. Wszystkie pliki CUT&RUN fastq z odczytami surowymi, które są zawarte w GSE126612 i są wybrane jako przykładowy zestaw danych dla potoku analizy Easy Shells CUTnRUN, są wymienione w formie tabeli. Kolumna 'Nazwa pliku' pokazuje nazwy plików raw CUT&RUN odczytuje pliki fastq, które zostaną pokazane w '~/Desktop/GSE126612/fastq' po uruchomieniu 'Script_02_download-fastq.sh'. "md5sum" współdzieli MD5 (Message-Digest Algorithm 5) dla przykładowego zestawu danych, który może być użyty do sprawdzenia integralności plików po pobraniu zestawu danych za pomocą uruchomienia "Script_02_download-fastq.sh". Ostatnia kolumna opisuje wartość docelową CUT&RUN dla każdej próbki. Kliknij tutaj, aby pobrać tę tabelę.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zdolność do mapowania zajętości białek na chromatynie ma fundamentalne znaczenie dla prowadzenia badań mechanistycznych w dziedzinie biologii chromatyny. W miarę jak laboratoria przyjmują nowe techniki mokrego laboratorium do profilowania chromatyny, możliwość analizowania danych sekwencjonowania z tych eksperymentów w mokrych laboratoriach staje się częstym wąskim gardłem dla naukowców pracujących w mokrych laboratoriach. W związku z tym opisujemy wstępny protokół krok po kroku, aby umożliwić początkującym bioinformatykom pokonanie wąskiego gardła w analizie oraz zainicjowanie analizy i kontroli jakości własnych danych sekwencjonowania CUT&RUN.

Ten protokół analizy CUT&RUN opisuje zastosowanie kilku kroków w celu zapewnienia ilościowego określenia sygnałów w dobrej wierze. Usunięcie odczytów o niskiej jakości i sekwencji adapterów z surowych danych odczytu jest jednym z pierwszych kroków kontroli jakości i jednym z najważniejszych kroków w celu uzyskania dokładnych wyników analizy. W związku z tym ten proces analizy obejmuje łatwe do zastosowania kroki przycinania jakości i adaptera za pomocą programu Trim-galore27. Ze względu na znaczenie tego procesu, ten potok analizy obejmuje etapy porównywania jakości wyników przed (krok 4.3) i po (krok 5.3) procesie przycinania (krok 5.5). Oprócz jakości i przycinania adapterów, ten potok analizy usuwa również niekanoniczne odczyty chromosomów, regiony powtórzeń TA i regiony z czarnej listy, które mogą wprowadzać stronniczość zawartości GC i fałszywie dodatnie skoki/zwane szczyty. Te etapy filtracji stanowią odpowiedni wstęp dla początkujących bioinformatyków, aby zrozumieć krytyczne etapy kontroli jakości w analizie danych CUT&RUN.

Po etapie filtracji ten potok analizy CUT&RUN zapewnia dwie opcje normalizacji: "skalowana liczba odczytów ułamkowych (SFRC)22" i "Znormalizowane odczyty na milion zmapowane odczyty w kontroli ujemnej (SRPMC)24,25 w celu utworzenia plików wejściowych do dalszego wywoływania i wizualizacji szczytów. Jeśli oczekuje się, że zestaw danych CUT&RUN ujawni tylko lokalne różnice bez różnic w sygnałach całego genomu między próbkami, skalowana ułamkowa liczba odczytów (ułamek zliczeń pomnożony przez rozmiar referencyjnego krasnala) może wystarczyć do dalszej analizy. Jeśli jednak istnieje możliwość, że między próbkami CUT&RUN wystąpią różnice w sygnale w skali globalnej, użytkownicy mogą wybrać metodę SRPMC, która uwzględnia stosunek odczytów między impulsem a próbką (zarówno eksperymentalne CUT&RUN, jak i próbki kontroli ujemnej) wraz z normalizacją odczytów na milion (RPM) dla odczytów kontroli ujemnej, aby odczyty kontroli ujemnej były porównywalne między różnymi próbkami. Ponieważ SRPMC zapewnia znormalizowane odczyty względem znormalizowanych odczytów kontroli ujemnej, takie podejście minimalizuje sygnał kontroli ujemnej, umożliwiając porównanie zestawów danych utworzonych w różnych partiach i grupach.

Ważnym czynnikiem w wywoływaniu pików próbek CUT&RUN jest eliminacja fałszywie dodatnich pików CUT&RUN podczas analizy in silico , częściowo poprzez włączenie próbek IgG. W szczególności ten potok analizy zapewnia podejścia do wywoływania szczytów dla różnych wywołujących szczyt w celu odrzucenia wyników fałszywie dodatnich CUT&RUN nazywanych szczytami. W przypadku szczytowych wywołujących MACS2/3 nasz potok analizy stosuje próbne odczyty IgG jako próbkę wejściową podczas szczytowego wywołania. W przypadku SEACR w tym procesie analizy zaleca się najpierw niezależne wywołanie pików dla próbek eksperymentalnych i próbek kontroli ujemnej, a następnie usunięcie pików, które nakładają się na próbki eksperymentalne i próbki kontroli ujemnej, ponieważ SEACR może "stracić" większość pików, jeśli zostanie im zapewniona kontrola ujemna podczas wywoływania pików próbek eksperymentalnych. Wyselekcjonowane piki wykazują porównywalne podobieństwo między różnymi szczytowymi rozmówcami i powtórzeniami (Rysunek 5). Ogólnie rzecz biorąc, usunięcie niskiej jakości, niekanonicznych chromosomów, regionu czarnej listy i odczytów powtórzeń TA, przycinanie sekwencji adapterów, normalizacja DNA o skokowym wzroście i właściwa obsługa kontroli negatywnej podczas szczytowych etapów wywoływania zapewnia użytkownikom odpowiednie pliki odczytów, które są odpowiednie do dalszych analiz. Dzięki wysokiej jakości znormalizowanym plikom odczytu i wyselekcjonowanym zwanym szczytami, użytkownicy mogą przystąpić do porównywania podobieństwa między replikacjami oraz tworzyć mapy cieplne i metawykresy z ultraczystym sygnałem tła, aby zweryfikować efektywne wywołanie szczytu.

Wywoływanie szczytów z wysokiej jakości odczytami oznacza rozpoczęcie wyciągania interpretacji biologicznych na podstawie danych CUT&RUN. Protokół ten opisuje uzyskiwanie skoncentrowanych sygnałów szczytowych na mapach cieplnych i metawykresach poprzez wyznaczenie najwyższych lub najbardziej statystycznie istotnych lokalizacji sygnału jako środków pików. Niektóre podejścia do wywołania szczytowego nie wybierają najwyższych sygnałów ani najbardziej istotnych statystycznie sygnałów w ich centralnej lokalizacji. W związku z tym ponowne zdefiniowanie środka każdego piku jako najwyższego sygnału lub najbardziej statystycznie istotnej lokalizacji sygnału służy jako ważny krok do tworzenia wizualnych danych wyjściowych z dobrze skoncentrowanymi sygnałami w środku wykresów. Pliki łóżka oryginalnych nazywanych pików są zachowywane w celu przeprowadzenia adnotacji pików i analizy istotności funkcjonalnej jako kolejne kroki po zakończeniu kroków opisanych w tym protokole.

Chociaż ten potok analizy CUT&RUN zawiera kroki opisujące instalację wymaganych programów, początkujący bioinformatycy mogą napotkać trudności w instalacji narzędzi analitycznych. W związku z tym utworzono powiązaną stronę problemu z Github, aby zapewnić bardziej szczegółowe opisy krok po kroku instalacji programu i ułatwić komunikację w celu wsparcia użytkowników podczas instalacji programu w ich własnym systemie. Kolejne kroki w procesie analizy CUT&RUN, wykraczające poza protokół opisany w tym artykule, obejmują adnotację pików, identyfikację nakładania się różnych typów wywoływanych pików oraz adnotację funkcjonalną dla wywołanych pików. Zakończenie etapów kontroli jakości i wywołanie pików opisane w tym protokole w połączeniu z adnotacją o pikach w dół umożliwi użytkownikom wyciągnięcie biologicznego znaczenia z ich danych CUT&RUN.

Ten potok analizy CUT&RUN został zbudowany w celu zapewnienia ogólnych, wprowadzających wskazówek krok po kroku dotyczących masowej analizy CUT&RUN. Ten potok ma pewne ograniczenia. Po pierwsze, chociaż ten potok analizy próbuje poradzić sobie z efektem zmienności zawartości GC poprzez filtrowanie odczytów w regionach czarnej listy (które obejmują "regiony artefaktów o wysokim sygnale" i "regiony powtórzeń artefaktów" oraz regiony powtórzeń TA), podejście to może nie być wystarczające dla niektórych organizmów, które mogą mieć charakterystyczną zawartość GC w swoim genomie. Dlatego jeśli użytkownicy obawiają się jakichkolwiek uprzedzeń związanych z treścią GC, rozważ dodanie kolejnego kroku w celu poprawienia zmapowanych odczytów. Dla początkujących bioinformatyków "computeGCBias" i "correctGCBias" w Deeptools mogą być opcjami do tego celu. Po drugie, ten potok analizy obsługuje zarówno odczyty o regularnym rozmiarze wkładki (100 bp-1 kb), jak i odczyty o małym rozmiarze wkładki (< 100 pz), które mogą być rzeczywistymi odczytami niektórych białek związanych z chromatyną, w tym samym pliku. Ponieważ ten potok analizy jest napisany w skryptach powłoki, użytkownicy mogą modyfikować "Script_08_bam-to-BEDPE-BED-bedGraph.sh", aby pobierać krótkie odczyty rozmiaru wstawienia oddzielnie od zwykłych odczytów rozmiaru fragmentu podczas etapu generowania zmapowanego pliku łóżka odczytów. Następnie, krótki rozmiar wkładki odczytuje plik łóżka może być znormalizowany niezależnie od zwykłych odczytów mapowanych rozmiarów wkładek, aby zminimalizować efekt zmniejszania. Po trzecie, aby zmniejszyć złożoność procesu analizy, Easy Shells CUTnRUN nie obejmuje etapu próbkowania w dół, aby dopasować głębokość sekwencjonowania próbek CUT&RUN. Użytkownicy mogą jednak zastosować krok próbkowania w dół po przefiltrowaniu plików bam przy użyciu widoku samtools28 lub PositionBasedDownsampleSam (Picard)29.

Wszystkie kroki analizy w tym protokole są napisane w skryptach powłoki, aby umożliwić początkującym bioinformatykom nauczenie się podstaw analizy CUT&RUN poprzez przejrzenie skryptów. Oczekujemy, że użytkownicy będą mogli ćwiczyć analizę bioinformatyczną krok po kroku, uruchamiając każdy skrypt powłoki sekwencyjnie w terminalu. Co więcej, prostota skryptów powłoki dostępnych w tym procesie analizy CUT&RUN pozwala użytkownikom na korygowanie i dostosowywanie tych skryptów w celu zastosowania tego potoku analizy do własnych danych CUT&RUN. Ostatecznie oczekujemy, że ten proces analizy CUT&RUN może zmniejszyć typowe wąskie gardła w procesie analizy danych CUT&RUN, umożliwiając badaczom z mokrych laboratoriów i początkującym bioinformatykom wyciąganie wniosków biologicznych z własnych danych sekwencjonowania CUT&RUN.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują brak ujawnień.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wszystkie ilustrowane postacie zostały stworzone za pomocą BioRender.com. CAI dziękuje za wsparcie udzielone poprzez nagrodę Ovarian Cancer Research Alliance Early Career Investigator Award, grant akceleracyjny Fundacji Forbeck oraz nagrodę Minnestoa Ovarian Cancer Alliance National Early Detection Research Award.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
bedGraphToBigWigENCODEhttps://hgdownload.soe.ucsc.edu/admin/exe/Oprogramowanie do kompresji i konwersji readcounts bedGraph do bigWig
bedtools-2.31.1The Quinlan Lab @ the U. of Utahhttps://bedtools.readthedocs.io/en/latest/index.htmlOprogramowanie do przetwarzania plików bam/bed/bedGraph
bowtie2 2.5.4UniwersytetJohnsa Hopkinsahttps://bowtie-bio.sourceforge.net/bowtie2/index.shtmlOprogramowanie do budowy indeksu muszki i wykonywania wyrównania
CollectInsertSizeMetrics (Picard)Broad institutehttps://github.com/broadinstitute/picardOprogramowanie do analizy rozkładu wielkości płytki
CutadaptNBIShttps://cutadapt.readthedocs.io/en/stable/index.htmlOprogramowanie do przycinania adapterów
Deeptoolsv3.5.1Instytut Maxa Planckahttps://deeptools.readthedocs.io/en/develop/index.htmlOprogramowanie do wykonywania analizy korelacji współczynników Pearsona, analizy głównych składowych oraz analizy mapy cieplnej/wykresu średniej
FastQC Wersja 0.12.0Babraham Bioinformaticshttps://github.com/s-andrews/FastQCOprogramowanie do sprawdzania jakości pliku fastq
Interwencjav0.6.1Biologia obliczeniowa i Regulacja genów - grupa Mathelierahttps://intervene.readthedocs.io/en/latest/index.htmlOprogramowanie do wykonywania analizy diagramu Venna przy użyciu plików szczytowych
MACSv2.2.9.1Inicjatywa Chana Zuckerbergahttps://github.com/macs3-project/MACS/tree/macs_v2Oprogramowanie do wywoływania szczytów
MACSv3.0.2Inicjatywa Chana Zuckerbergahttps://github.com/macs3-project/MACS/tree/masterOprogramowanie do wywoływania szczytów
Samtools-1.21Wellcome Sanger Institutehttps://github.com/samtools/samtoolsOprogramowanie do przetwarzania plików sam/bam
SEACRv1.3Howard Hughes Medial institutehttps://github.com/FredHutch/SEACROprogramowanie do wywoływania szczytów
Toolkit Release 3.1.1NCBIhttps://github.com/ncbi/-toolsOprogramowanie do pobierania SRR z GEO
Trim_Galore v0.6.10Babraham Bioinformaticshttps://github.com/FelixKrueger/TrimGaloreoprogramowanie do wykonywania wysokiej jakości i szybkiego przycinania

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Hainer, S. J., Fazzio, T. G. High-resolution chromatin profiling using CUT&RUN. Curr Protoc Mol Biol. 126 (1), e85(2019).
  2. Zhang, Y., et al. Model-based analysis of ChiP-Seq (MACS). Genome Biology. 9 (9), R137(2008).
  3. Xu, S., Grullon, S., Ge, K., Peng, W. Stem cell transcriptional networks: Methods and Protocols. , Springer. New York, NY. (2014).
  4. Meers, M. P., Tenenbaum, D., Henikoff, S. Peak calling by sparse enrichment analysis for cut&run chromatin profiling. Epigenetics Chromatin. 12 (1), 42(2019).
  5. Ashburner, M., et al. Gene ontology: Tool for the unification of biology. The gene ontology consortium. Nat Genet. 25 (1), 25-29 (2000).
  6. Harris, M. A., et al. The gene ontology (GO) database and informatics resource. Nucleic Acids Res. 32 (Database issue), D258-D261 (2004).
  7. The Gene Ontology Consortium. The gene ontology resource: 20 years and still going strong. Nucleic Acids Res. 47 (D1), D330-D338 (2019).
  8. Conesa, A., et al. Blast2go: A universal tool for annotation, visualization and analysis in functional genomics research. Bioinformatics. 21 (18), 3674-3676 (2005).
  9. Carbon, S., et al. AmiGO: Online access to ontology and annotation data. Bioinformatics. 25 (2), 288-289 (2009).
  10. Eden, E., Navon, R., Steinfeld, I., Lipson, D., Yakhini, Z. Gorilla: A tool for discovery and visualization of enriched go terms in ranked gene lists. BMC Bioinformatics. 10, 48(2009).
  11. Huang Da, W., Sherman, B. T., Lempicki, R. A. Bioinformatics enrichment tools: Paths toward the comprehensive functional analysis of large gene lists. Nucleic Acids Res. 37 (1), 1-13 (2009).
  12. Huang Da, W., Sherman, B. T., Lempicki, R. A. Systematic and integrative analysis of large gene lists using david bioinformatics resources. Nat Protoc. 4 (1), 44-57 (2009).
  13. Ge, S. X., Jung, D., Yao, R. ShinyGO: A graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  14. Tang, D., et al. SRplot: A free online platform for data visualization and graphing. PLoS One. 18 (11), e0294236(2023).
  15. Ramírez, F., et al. Deeptools2: A next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44 (W1), W160-W165 (2016).
  16. Robinson, J. T., et al. Integrative genomics viewer. Nat Biotechnol. 29 (1), 24-26 (2011).
  17. Kent, W. J., et al. The human genome browser at ucsc. Genome Res. 12 (6), 996-1006 (2002).
  18. Yu, F., Sankaran, V. G., Yuan, G. -C. CUT&RUNTools 2.0: A pipeline for single-cell and bulk-level CUT&RUN and CUT&Tag data analysis. Bioinformatics. 38 (1), 252-254 (2021).
  19. Zhu, Q., Liu, N., Orkin, S. H., Yuan, G. -C. CUT&RUNTools: A flexible pipeline for CUT&RUN processing and footprint analysis. Genome Biol. 20 (1), 192(2019).
  20. Chris Cheshire, C. -W., et al. Nf-core/cutandrun: Nf-core/cutandrun v3.2.2 iridium ibis. , At https://github.com/nf-core/cutandrun/tree/3.2.2 (2024).
  21. Kong, N. R., Chai, L., Tenen, D. G., Bassal, M. A. A modified CUT&RUN protocol and analysis pipeline to identify transcription factor binding sites in human cell lines. STAR Protoc. 2 (3), 100750(2021).
  22. Meers, M. P., Bryson, T. D., Henikoff, J. G., Henikoff, S. Improved CUT&RUN chromatin profiling tools. eLife. 8, e46314(2019).
  23. Amemiya, H. M., Kundaje, A., Boyle, A. P. The encode blacklist: Identification of problematic regions of the genome. Sci Rep. 9 (1), 9354(2019).
  24. Deberardine, M. BRgenomics for analyzing high-resolution genomics data in R. Bioinformatics. 39 (6), btad331(2023).
  25. Deberardine, M., Booth, G. T., Versluis, P. P., Lis, J. T. The nelf pausing checkpoint mediates the functional divergence of cdk9. Nat Commun. 14 (1), 2762(2023).
  26. Andrews, S. Fastqc: A quality control tool for high throughput sequence data. , At http://www.bioinformatics.babraham.ac.uk/projects/fastqc/ (2010).
  27. Krueger, F., James, F. O., Ewels, P. A., Afyounian, E., Schuster-Boeckler, B. FelixKrueger/TrimGalore: v0.6.7 - DOI via Zenodo. , (2021).
  28. Mcgaughey, D. Easy bam downsampling. , Available from: https://davemcg.github.io/post/easy-bam-downsampling/ (2018).
  29. Positionbaseddownsamplesam (picard). , GATK Team. At https://gatk.broadinstitute.org/hc/en-us/articles/360041850311-PositionBasedDownsampleSam-Picard (2020).

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

CUT And RUNoddzia ywania bia ko DNAzaj to chromatynywalidacja danych sekwencjonowaniawyznaczanie pik w peak callingmapowanie Bowtieadnotacja pik wanaliza g wnych sk adowychwykres korelacjiprofilowanie epigenetyczne

Powiązane artykuły