Artykuł metodologiczny

Algorytmy wywoływania pików (WonderPeaks i PeakStream) jako narzędzia do poprawy sekwencji ChIP i analizy transkryptomicznej w patogenach grzybowych

DOI:

10.3791/68301

8 sierpnia 2025

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ten raport przedstawia WonderPeaks, nowatorskie narzędzie obliczeniowe do analizy danych sekwencyjnych RNA i ChIP. Narzędzie to z powodzeniem identyfikuje piki (odczyt pileupów) w danych sekwencjonowania, umożliwiając charakterystykę granic regionów nieulegających translacji w sekwencji RNA i wykrywanie wzbogacenia chromatyny w ChIP-seq, dostarczając cennych informacji do badań nad patogenami grzybowymi.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Charakteryzowanie zmian w ekspresji genów poprzez transkryptomikę i aktywność regulatora transkrypcji stało się podstawowym podejściem do zrozumienia różnorodnych reakcji związanych z patogenezą grzybów. W artykule przedstawiono dwa narzędzia obliczeniowe zaprojektowane w celu sprostania kluczowym wyzwaniom w badaniu regulacji transkrypcji w patogenach grzybowych, w szczególności w przypadku patogenów niemodelowych z ograniczoną adnotacją genomiczną. Po pierwsze, przedstawiamy WonderPeaks, nowatorski algorytm wywoływania pików, który wykorzystuje pierwszą pochodną zmapowanych danych genomowych z eksperymentów sekwencjonowania nowej generacji (NGS) do identyfikacji wzbogaconych pików w immunoprecypitacji chromatyny, a następnie sekwencjonowania (ChIP-seq). Po drugie, wprowadzamy PeakStream, rozszerzenie WonderPeaks do opisywania 3' nietranslowanych regionów (UTR) w danych transkryptomicznych generowanych przy użyciu przygotowania biblioteki poli(A). Razem narzędzia te zapewniają kompleksową analizę danych, oferując przyjazne dla użytkownika rozwiązanie dla naukowców badających regulację transkrypcji u grzybów. Wykazujemy ich skuteczność za pomocą danych z patogenu grzybowego Candida albicans, z powodzeniem identyfikując zweryfikowane piki w danych ChIP-seq i dodając adnotacje do zwalidowanych UTR poprzez porównanie z całkowitymi danymi sekwencjonowania RNA w tych samych warunkach. Omawiamy również ograniczenia WonderPeaks dla danych ChIP-seq w porównaniu z obecnymi najnowocześniejszymi metodami i proponujemy kierunki przyszłych ulepszeń. Ostatecznie, prace te dostarczają praktycznych wskazówek i potężnych zasobów do badania regulacji transkrypcji, co ma bezpośrednie znaczenie dla grzybów chorobotwórczych i potencjalnych zastosowań w szerszych badaniach genomicznych.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Patogeny grzybicze są rosnącym globalnym problemem zdrowotnym, a liczba infekcji wzrosła w ostatnich latach1. Wiele z tych patogenów wykazuje wysoką oporność na leki przeciwgrzybicze i wiąże się ze znaczną śmiertelnością2. Jednak w porównaniu z modelowymi organizmami grzybowymi, wiele grzybów chorobotwórczych pozostaje słabo scharakteryzowanych, co podkreśla potrzebę dalszych badań nad ich mechanizmami chorobotwórczości. Techniki sekwencjonowania nowej generacji (NGS), takie jak sekwencjonowanie immunoprecypitacji chromatyny (ChIP-Seq) i sekwencjonowanie RNA (RNA-Seq), odgrywają kluczową rolę w odkrywaniu molekularnych mechanizmów ekspresji genów leżących u podstaw patogenności grzybów.

Jakość wglądu uzyskanego z danych NGS jest wysoce zależna od dokładności oprogramowania używanego do analizy surowych danych. Jednym z kluczowych wyzwań związanych z analizą danych NGS jest wywoływanie pików – dokładna identyfikacja regionów wzbogaconych odczytów NGS – co jest szczególnie złożone ze względu na dużą różnorodność technik przygotowania bibliotek i sekwencjonowania, co sprawia, że uniwersalne rozwiązanie jest niepraktyczne. Algorytm MACS3, w tym jego nowsza wersja, MACS3, jest powszechnie uważany za złoty standard analizy zestawów danych ChIP-seq. Jednak MACS opiera się na parametrach zdefiniowanych przez użytkownika, takich jak minimalna długość piku i maksymalna przerwa, które mogą nie mieć uniwersalnego zastosowania i często są trudne do określenia przed analizą. Warto zauważyć, że najnowsza wersja MACS3 zawiera funkcję analizy odcięcia, która pozwala użytkownikom oszacować parametry przed szczytowym wywołaniem. Aby zwiększyć wydajność, użytkownicy mogą również dostarczyć listę regionów genomu znajdujących się na "czarnej liście", o których wiadomo, że wprowadzają stronniczość ze względu na strukturę chromatyny lub zmienność liczby kopii. Chociaż MACS pozostaje najczęściej używanym i najbardziej zaufanym narzędziem do wywoływania szczytów dla danych ChIP-seq, dostępnych jest niewiele alternatywnych algorytmów, szczególnie w przypadkach wymagających wysoce dostosowanych ustawień parametrów.

RNA-Seq to nieoceniona technika do badania odpowiedzi ekspresji genów grzybów chorobotwórczych podczas wzrostu in vivo, takich jak hodowla tkankowa lub modele infekcji myszy4,5,6,7. Do dokładnej analizy wyrażeń różnicowych w tych warunkach wymagana jest duża głębokość sekwencjonowania, która może być zbyt kosztowna i zasobochłonna8,9. Metody przygotowania biblioteki, takie jak sekwencjonowanie poliadenylacji (poli(A))-priming (3'RNA-Seq), które wykorzystuje startery przeznaczone do wyżarzania do poli(A)-ogonów mRNA w celu wytworzenia cDNA, mogą pomóc w zmniejszeniu głębokości sekwencjonowania potrzebnej do analizy ekspresji genów10. Jednak to podejście opiera się na wysokiej jakości adnotacjach genomu, w szczególności 3' Nieulegających translacji regionów (UTR), w których zwykle zlokalizowane są piki ze zdarzeń poli(A)-priming11. Adnotacje genomu wielu niedostatecznie zbadanych patogenów grzybowych nie mają żadnych adnotacji UTR, co utrudnia stosowanie 3'RNA-Seq w tych organizmach. Ponadto długość UTR dla pojedynczego genu może być dynamiczna w różnych warunkach wzrostu i typach komórek12,13. Chociaż opracowano szereg nowych narzędzi analitycznych w celu identyfikacji i opisywania UTR, wiele z nich jest przeznaczonych dla zestawów danych ssaków, których organizacja genów znacznie różni się od organizacji grzybów, lub wymaga danych z niezależnych eksperymentów sekwencjonowania, takich jak sekwencjonowanie pojedynczej komórki lub odwrotne sekwencjonowanie mRNA, co może zwiększyć czas i koszty dla badacza chcącego przeprowadzić analizę transkryptomu12, 14,15.

W tym artykule prezentujemy WonderPeaks, nowatorskie oprogramowanie do wywoływania szczytów, zaprojektowane na zasadach pierwszej pochodnej, które może być używane do dynamicznego wywoływania szczytów w zestawach danych NGS (Rysunek 1). WonderPeaks identyfikuje szczyty, obliczając pierwszą pochodną sygnału pokrycia i używając tej wartości - nachylenia piku - do zdefiniowania potencjalnych szczytów. Algorytm wyszukuje przypadki, w których pierwsza pochodna wykazuje lokalne maksimum powyżej progu nachylenia dostarczonego przez użytkownika lub wywnioskowanego z danych (wskazującego na rosnący sygnał), po którym następuje lokalne minimum powyżej tego samego progu (wskazującego na sygnał malejący), wykrywając w ten sposób wszystkie kandydujące szczyty w zbiorze danych. W przypadku aplikacji ChIP-seq WonderPeaks porównuje wszystkie potencjalne piki między próbkami testowymi i kontrolnymi, aby zidentyfikować wyjątkowo wzbogacone piki. Stosując WonderPeaks do wcześniej opublikowanego zestawu danych ChIP-seq czynnika transkrypcyjnego w patogenie grzybowym Candida albicans16, wykazaliśmy jego zdolność do skutecznej identyfikacji pików przed kluczowymi genami podkreślonymi w pierwotnym badaniu, jednocześnie omawiając obecne ograniczenia algorytmu w tym zastosowaniu.

Wprowadzamy również PeakStream, narzędzie programowe, które wykorzystuje WonderPeaks do identyfikacji pików w zestawach danych 3'RNA-Seq. Biblioteki 3'RNA-Seq polegają na dokładnych adnotacjach 3' UTR, ponieważ odczyty generowane przez priming poli(A) często wykraczają poza kodon stop sekwencji kodujących (CDS) genów i dlatego nie są zliczane przy użyciu standardowych adnotacji skoncentrowanych wyłącznie na regionach kodujących. Potok analizy PeakStream został zaprojektowany w celu tworzenia nowych adnotacji genomu przy użyciu danych 3' RNA-Seq, koncentrując się na regionach poniżej regionów kodujących geny (CDS). PeakStream przypisuje te piki do genów, generując nową adnotację genomu do wykorzystania w programach zliczających odczyty. Pokazujemy, że zastosowanie PeakStream może dokładnie zidentyfikować i przypisać piki generowane przez poli(A) do odpowiedniego genu w zestawie danych 3'RNA-Seq C. albicans. PeakStream dodaje również adnotacje do pików, które prawdopodobnie nie są powiązane z żadnymi obecnymi adnotacjami genów, ułatwiając odkrycie możliwych nowych transkryptów. Razem, PeakStream i WonderPeaks reprezentują potężny zestaw przyjaznych dla użytkownika narzędzi do wykrywania szczytów w zestawach danych sekwencjonowania nowej generacji (NGS).

figure-introduction-1
Rysunek 1: Rysunek poglądowy na temat wywoływania szczytów przez WonderPeaks i PeakStream. Po lewej: Szczytowe wywołanie przy użyciu pierwszej pochodnej. U góry po prawej: wywoływanie szczytów w zestawach danych ChIP-Seq przy użyciu WonderPeaks. U dołu po prawej: wywoływanie szczytów w zestawach danych RNA-Seq przy użyciu PeakStream. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Instalacja (pomiń, jeśli została zakończona)

  1. warunki wstępne
    1. Zainstaluj Anaconda lub Minconda, aby załadować wymagania dotyczące uruchamiania przetwarzania wstępnego (sekcja 5) i WonderPeaks (sekcja 6 lub sekcja 7).
      UWAGA: Podręcznik użytkownika Anacondy można znaleźć w katalogu reference16.
    2. Zainstaluj Python: Python w Anaconda lub Miniconda.
    3. Zainstaluj Jupyter Notebooks, aby wykonać wszystkie funkcje w tej metodzie.
      UWAGA: Podręcznik użytkownika dla początkujących Jupyter Notebooks można znaleźć w reference17.
      UWAGA: W przypadku genomów grzybów (≤100 Mb/s) należy zapewnić środowisko obliczeniowe z co najmniej 20 rdzeniami, 8 GB pamięci RAM i 30 GB dostępnej przestrzeni dyskowej.
  2. Zainstaluj funkcje przetwarzania wstępnego.
    1. W terminalu wykonaj: conda create -n WP_preprocessing
    2. W terminalu wykonaj: conda activate WP_preprocessing
    3. W terminalu wykonaj: conda env update --file environment.yml --name
      UWAGA: environment.yml jest plikiem, który zawiera wszystkie zależności pakietów i powinien zostać pobrany z https://github.com/mgarber21/WonderPeaks_preprocessing.git.
    4. W terminalu wykonaj: install WonderPeaks-preprocessing
    5. W terminalu wykonaj: conda dezactivate WP_preprocessing
  3. Zainstaluj funkcje WonderPeaks:
    1. W terminalu wykonaj: conda create -n WonderPeaks
    2. W terminalu wykonaj: conda aktywuj WonderPeaks
    3. W terminalu wykonaj: conda env update --file environment.yml --name
      UWAGA: environment.yml jest plikiem, który zawiera wszystkie zależności pakietu i powinien zostać pobrany z https://github.com/mgarber21/WonderPeaks.git.
    4. W terminalu wykonaj: install WonderPeaks
    5. W terminalu wykonaj: conda dezaktywuj WonderPeaks
      UWAGA: Kroki 1.2 i 1.3 wykonują następujące czynności: Tworzą dedykowane środowisko Conda do wstępnego przetwarzania (sekcja 5) i WonderPeaks (sekcje 6 i 7), izolując zależności, aby uniknąć konfliktów z innym oprogramowaniem. Aktywują środowisko, konfigurując je do instalacji i uruchamiania funkcji WP_preprocessing lub specyficznych dla WonderPeaks. Instalują zależności oprogramowania i narzędzia wymagane do wstępnego przetwarzania danych. Dezaktywują one środowisko, gdy nie jest używane, aby zapobiec przypadkowej modyfikacji i zwolnić zasoby systemowe.
  4. Pobierz notesy Jupyter Notebook i szablony z repozytorium GitHub WonderPeaks. Prześlij pliki do pobrania WonderPeaks do systemu operacyjnego zawierającego surowe dane (katalog zostanie utworzony w sekcji 2).
    UWAGA: Notesy Jupyter zawierają wstępnie napisane skrypty i szablony niezbędne do uruchamiania przepływów pracy przetwarzania wstępnego, WonderPeaks i PeakStream. Przesłanie ich do tego samego systemu, co surowe dane, zapewnia prawidłowe wyrównanie ścieżek i katalogów.

2. Utwórz katalog danych

UWAGA: Przepływy pracy WonderPeaks i PeakStream wymagają, aby wszystkie dane (surowe i przetworzone) były przechowywane w tym samym katalogu. W tym kroku wyjaśniono, jak utworzyć ten nowy katalog ({data_directory} = /ścieżka/do/twoich/danych) i jak przenieść eksperymentalne dane surowe (odczyty nieprzetworzonego sekwencjonowania) do folderu w tym katalogu o nazwie raw_data.

  1. Utwórz katalog danych.
    1. W terminalu wykonaj polecenie mkdir {data_directory} (np. mkdir /ścieżka/do/twoich/danych)
  2. Utwórz podkatalog danych pierwotnych dla nieprzetworzonych odczytów sekwencjonowania.
    1. W terminalu wykonaj polecenie mkdir {data_directory}/raw_data (np. mkdir /ścieżka/do/twoich/danych /raw_data)
  3. Przenieś nieprzetworzone odczyty sekwencjonowania do katalogu z danymi pierwotnymi.
    1. W terminalu wykonaj mv {current_path_to_raw_data}/*fastq* {data_directory}/raw_data (np. mv current/data/path/*fastq* /path/to/your/data /raw_data

3. Utwórz plik danych wejściowych użytkownika (NGS_user_input.csv)

UWAGA: Plik wejściowy określa wygenerowane przez użytkownika konfiguracje do uruchamiania preprocessingu i WonderPeaks.

  1. Pobierz szablon NGS_user_inputs.csv z repozytorium GitHub WonderPeaks.
  2. Aktualizowanie pól w NGS_user_inputs.csv. Zaktualizuj pola w następujący sposób:
    Katalog danych: /ścieżka/do/twoich/danych
    Katalog genomu: /path/to/your/genome
    Genome fasta: genome.fasta
    Adnotacja genomu: genome_annotation.gtf (podaj nazwę pliku adnotacji genomu w formacie GTF)
  3. Zapisz zaktualizowane NGS_user_inputs.csv w katalogu danych utworzonym w sekcji 2.
    UWAGA: Nie zmieniaj nazwy pliku; WonderPeaks rozpozna ten plik tylko wtedy, gdy ma nazwę NGS_user_input.csv.

4. Utwórz plik metadanych (NGS_user_metadata.csv)

UWAGA: Plik metadanych służy do przechowywania wszelkich informacji istotnych dla eksperymentu. Można dodać dodatkowe kolumny opisujące warunki eksperymentu, ale nie będą one miały wpływu na kolejne kroki.

  1. Pobierz szablon NGS_user_metadata.csv z repozytorium GitHub WonderPeaks.
  2. Aktualizowanie pól w NGS_user_metadata.csv Pola są następujące:
    1. file: Upewnij się, że nazwa pliku nie zawiera spacji, zawiera uchwyt pliku (np. fastq, fastq.gz) i nie zawiera ścieżki bezwzględnej.
    2. bedgraph: Określ, czy plik powinien zostać uwzględniony w PeakStream, ustawiając to pole na wartość PRAWDA lub FAŁSZ.
      1. Ustaw pole bedgraph na wartość FALSE, jeśli plik można w rozsądny sposób wykluczyć z analizy PeakStream. Na przykład w eksperymencie RNAseq ustaw parametr bedgraph bedgraph=FALSE dla mutantów lub innych przypadków, w których różnice UTR między próbkami nie są oczekiwane. Należy jednak pamiętać, aby ustawić pole bedgraph na wartość TRUE dla wszystkich plików kontrolnych w eksperymencie RNAseq i dla wszystkich plików w eksperymencie ChIPseq.
    3. Czynnik projektowy
      1. designfactor1: Określ czynnik projektowy istotny dla projektu eksperymentalnego (np. leczenie lub sample_type).
      2. designfactor2: Określ drugi czynnik projektowy istotny dla projektu eksperymentalnego (np. szczep lub epitop). W przypadku eksperymentu RNAseq należy uwzględnić leczenie i szczep jako typowe czynniki projektowe. Kolumna leczenia zawiera listę zastosowanych metod leczenia (np. kontrola, lek1), a kolumna szczepu zawiera informacje o szczepie (np. typ dziki, mutant). W przypadku eksperymentu ChIPseq uwzględnij sample_type i epitop jako typowe czynniki projektowe. Kolumna sample_type zawiera informacje o tym, czy białko zostało oznaczone, czy nie, a kolumna epitopu zawiera nazwę użytego epitopu.
        UWAGA: czynniki projektowe są atrybutami specyficznymi dla projektu eksperymentalnego.
        WonderPeaks jest kompatybilny z nieoznaczonymi elementami sterującymi lub kontrolkami wejściowymi jako linią bazową.
      3. Upewnij się, że kolumny współczynnika projektowego nie zawierają unikatowego numeru repliki (np. sample_type: [tagged, tagged, untagged_control, untagged_control] nie sample_type: [tagged_1, tagged_2, untagged_control _1, untagged_control _2]. Podanie unikatowych numerów replikacji spowoduje błąd podczas uruchamiania.
      4. Pamiętaj, aby używać podkreśleń (_) zamiast spacji w nazwach czynników projektowych.
      5. W przypadku aplikacji ChIPseq upewnij się, że kolumna sample_type (lub nazwa niestandardowa) w pliku metadanych zawiera terminy zawierające wyrazy tag i control.
        UWAGA: Na przykład prawidłowe wpisy mogą obejmować oznaczone i untagged_control. Podanie kolumny sample_type bez tych warunków spowoduje błąd podczas uruchamiania.
        PRZESTROGA: W przypadku aplikacji ChIP użytkownik musi określić dwa czynniki projektowe.
      6. Dodaj czynniki projektowe do odpowiedniego wiersza NGS_user_inputs.csv. Upewnij się, że nazwy kolumn używane dla czynników projektowych są wymienione jako ciąg oddzielony średnikami (np. leczenie; szczep lub sample_type; epitop).
        UWAGA: Czynniki obliczeniowe w NGS_user_inputs.csv muszą dokładnie pasować do kolumn NGS_user_metadata.csv. Każdy niezgodny przebieg spowoduje błąd podczas przebiegu (Rysunek 2, Tabela uzupełniająca S1 i Tabela uzupełniająca S2).

figure-protocol-1
Rysunek 2: Przykładowe NGS_user_input.csv i NGS_user_metadata.csv. Przykłady NGS_user_input.csv (górny panel) i NGS_user_metadata.csv (dolny panel), wyróżniające dopasowanie między kolumnami designfactor i designfactor za pomocą różowego lub niebieskiego tekstu i strzałek. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

5. Wstępne przetwarzanie danych NGS

UWAGA: Przejdź do sekcji 5 lub sekcji 6, jeśli korzystasz z niestandardowego przetwarzania wstępnego.

  1. Otwórz wstępne przetwarzanie NGS Jupyter Notebook (NGS_Preprocessing.ipynb).
  2. Aktywuj środowisko WP_preprocessing (utworzone w kroku 1.2) w prawym górnym rogu interfejsu notesu.
  3. Wykonaj pierwszą komórkę, przytrzymując Shift, a następnie naciskając Enter (Shift+Enter).
  4. W drugiej komórce Jupyter Notebook zaktualizuj ścieżkę katalogu, ustawiając Katalog = "ścieżka/do/twoich/danych", gdzie ścieżka/do/twoich/danych/ jest katalogiem utworzonym w sekcji 2.
  5. Generuj pliki linii trasowania. Funkcje przetwarzania wstępnego wykonają przycinanie za pomocą FastP18; Kontrola jakości za pomocą FastQC19 i MultiQC20; Wyrównanie za pomocą STAR21. Wyjściowe pliki wyrównania są zapisywane w podkatalogu o nazwie startout w katalogu danych (np. path/to/your/data/starout); Filtrowanie (opcjonalnie) za pomocą samtools view22, filtruje plik wyrównania, aby zachować tylko odczyty powyżej progu określonego w NGS_user_inputs.csv.
    UWAGA: Te funkcje będą przetwarzać tylko pojedyncze odczyty (np. R1) zestawu danych jednocześnie. Użytkownicy mogą określić opcje uruchamiania dla FastP i STAR w NGS_user_inputs.csv (np. FastP: adapter_sequence (opcjonalnie); STAR: genomeDir, genomeFastaFiles, sjdbGTFfil).
  6. Wykonaj funkcje przetwarzania wstępnego w drugiej komórce za pomocą Shift + Enter.
    UWAGA: Wykonanie zadań w drugiej komórce może potrwać kilka godzin. Jeśli przebieg zostanie przerwany, powtórz kroki 5.3-5.6, aby ponownie uruchomić przebieg. Postęp z poprzednich kroków nie zostanie zastąpiony, a proces będzie kontynuowany w miejscu, w którym został przerwany.
  7. Wygeneruj pliki śledzenia pokrycia linii trasowania za pomocą BamCoverage23 (patrz kroki 5.7.1 i 5.7.2).
    UWAGA: W przypadku ChIPseq WonderPeaks wymaga pojedynczych plików bedgraph zawierających pokrycie zarówno dla odczytów do przodu, jak i do tyłu. W przypadku RNAseq z primingiem Poly(A) PeakStream wymaga dwóch plików bedgraph, jednego do odczytów do przodu (_fwd.bedgraph) i jednego do odczytów wstecznych (_rev.bedgraph). Odczyty do przodu i do tyłu są generowane przy użyciu parametru filterRNAstrand w BamCoverage23.
    1. ChIPseq przy użyciu następujących parametrów: outfilfeformat="bedgraph", strand=None, binsize=20, smoothLength=60, minMappingQuality=255, normalizeUsing="CPM".
      UWAGA: Wyjście: Tworzy pojedyncze pliki wykresu łóżka zawierające pokrycie zarówno dla odczytów do przodu, jak i do tyłu. Dane wyjściowe są przechowywane w /path/to/your/data/bedgraphout (Rysunek 3).
      1. Wykonaj funkcję BamCoverage w trzeciej komórce za pomocą Shift + Enter.
    2. RNAseq przy użyciu następujących parametrów: outfilfeformat="bedgraph", strand="forward" lub "reverse", binsize=20, smoothLength=60, minMappingQuality=255, normalizeUsing="CPM".
      UWAGA: Upewnij się, że wykonałeś funkcję dwa razy z pasmem ustawionym na przód lub do tyłu, aby wygenerować pliki do odczytu w obu kierunkach.
      UWAGA: Wyjście: Tworzy dwa pliki bedgraph: jeden dla odczytów do przodu (_fwd.bedgraph) i jeden dla odczytów wstecznych (_rev.bedgraph). Dane wyjściowe są przechowywane w /path/to/your/data/ bedgraphout (Rysunek 3).
      1. Wykonaj funkcję BamCoverage w trzeciej komórce za pomocą Shift + Enter.

figure-protocol-2
Rysunek 3: Organizacja plików dla WonderPeaks. Zrzut ekranu folderu danych z plikami bedgraph w katalogu bedgrapghout/normalizeUsingCPM. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

6. WonderPeaks dla ChIPseq

  1. Kontrola wstępna
    1. Upewnij się, że wszystkie pliki bedgraph z uchwytem pliku .bedgraph znajdują się w podkatalogu w katalogu danych o nazwie bedgraphout (Rysunek 3).
    2. Upewnij się, że czynniki projektowe w pliku user_inputs (NGS_user_inputs.csv) (Rysunek 2) są zgodne z kolumnami w pliku metadanych (NGS_user_metadata.csv) i że wiersze kolumn designfactor nie są unikatowe (patrz uwaga w kroku 4.2.4).
  2. Otwórz Jupyter Notebook przetwarzania wstępnego NGS (WP4ChIP.ipynb).
  3. Aktywuj WonderPeaks (środowisko utworzone w kroku 1.3) w prawym górnym rogu interfejsu notebooka.
  4. Wykonaj komórki przy użyciu Shift+Enter do momentu punktu przerwania, aby uruchomić wywołanie szczytowe. Po zakończeniu zapis przetworzonych danych zostanie zapisany i przechowywany w podkatalogu w katalogu danych o nazwie WonderPeaks
    1. Szukaj WOnder_init.csv: konkatenacji całego surowego pokrycia i wyników obliczenia pierwszej pochodnej.
    2. Uwaga WOnder_unfiltered_peaks.csv: konkatenacja wszystkich niefiltrowanych pików wywoływana na podstawie pierwszej pochodnej.
    3. Obserwuj bedgraph_summary.csv: podsumowanie statystyk wyników po pogrupowaniu każdego pliku i chromosomu.
  5. Zdefiniuj parametry uruchamiania:
    1. Uruchom 1. komórkę poniżej punktu przerwania przeceny.
      UWAGA: Pojawi się wykres przedstawiający surowe dane posegregowane według określonych czynników projektowych oraz tabela przedstawiająca czynniki projektowe; użyj tabeli i wykresu, aby określić wartości w kolejnych krokach (Rysunek 4).
    2. W następnej komórce określ wartości score_cut, fold_change i designfactor (Rysunek 4).
      1. score_cut jest wartością progową używaną do określenia, czy szczyt ma być uwzględniony w produkcie wyjściowym. Aby określić score_cut, obserwuj wykres i wybierz wartość zbliżoną do mediany oznaczonych danych (patrz linia skrótu, Rysunek 4). Wprowadź tę wartość w następujący sposób: score_cut= wartość.
      2. fold_change jest wartością progową wyników stosunkowych tagged:untagged używaną do określenia, czy szczyt jest uważany za rzeczywisty. Aby określić fold_change, obserwuj wykres i wybierz wartość powyżej stosunku median danych nieoznakowanych i oznaczonych. Wprowadź tę wartość w następujący sposób: fold_change= wartość.
      3. designfactor_value jest określone jako część projektu eksperymentalnego. Możliwe współczynniki obliczeniowe są wymienione na czerwono w wydrukowanej tabeli. Aby określić współczynnik projektowy, wybierz jedną z wartości zaznaczonych na czerwono. Wprowadź tę wartość między cudzysłowami w następujący sposób: designfactor_value ="{ value}".
  6. Wykonaj następne komórki za pomocą Shift + Enter, aby uruchomić filtrowanie i mapowanie szczytów. Dane i wykresy podsumowujące będą przechowywane w podkatalogu w katalogu danych o nazwie WonderPeaks.
    1. Observe {designfactor_value}_taggedVuntagged.csv: Tabela przestawna wszystkich nakładających się pików z kolumną dla każdej z oznaczonych i nieoznakowanych próbek.
    2. Uwaga {designfactor_value}_all_tagged_peaks.csv: Tabela podsumowująca wszystkie rzeczywiste szczyty, oparta na parametrach użytkownika (krok 6.5).
    3. Obserwuj {designfactor_value}_peaks2gtf.csv: Mapowanie rzeczywistych szczytów, na podstawie parametrów użytkownika (krok 6.5), do genów w pliku adnotacji określonym przez użytkownika.
  7. Opcjonalnie: Przełącz parametry w kroku 6.5, wykonując ponownie kroki 6.5–6.6. W przypadku korzystania z tej samej designfactor_value wygenerowane pliki, zgodnie z opisem w kroku 6.6, zostaną nadpisane.

figure-protocol-3
Rysunek 4: Zrzut ekranu przedstawiający progi designfactor_value i określone przez użytkownika w WonderPeaks dla ChIP-seq. Zrzut ekranu notatnika Jupyter WonderPeaks, przedstawiający możliwe opcje designfactor_value z wyświetlonej tabeli oraz sposób implementacji designfactor_value w następnej komórce. Górna strzałka wskazuje tabelę wyświetlającą możliwe wpisy designfactor_value; wartość Op jest zakreślona i wyświetlana jako wybrane dane wejściowe użytkownika dla designfactor_value w komórce opcji (strzałka u dołu). Na wykresie linie ciągłe i przerywane wskazują przybliżoną medianę wyników szczytowych odpowiednio dla próbek oznaczonych i nieoznakowanych w eksperymentach z nieprzezroczystymi komórkami. Te mediany służą do definiowania parametrów score_cut (mediana oznaczona) i fold_change (stosunek median oznaczonych do nieoznakowanych). Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

7. PeakStream dla 3'RNAseq

  1. Kontrola wstępna:
    1. Upewnij się, że wszystkie pliki bedgraph znajdują się w podkatalogu w katalogu danych o nazwie bedgraphout (Rysunek 2).
    2. Otwieranie notesu Jupyter Notebook przetwarzania wstępnego NGS (PeakStream.ipynb)
    3. Aktywuj WonderPeaks (środowisko utworzone w kroku 1.3) w prawym górnym rogu interfejsu notebooka.
  2. Wykonaj komórki przy użyciu Shift+Enter do punktu przerwania, aby uruchomić wywołania szczytowe i mapowanie szczytu. Po zakończeniu, nowy plik adnotacji z przewidywanymi 3' UTR i plikami zliczania odczytów FeatureCounts24 zostanie zapisany i przechowywany w podkatalogu w katalogu danych o nazwie PeakStream (Rysunek 5) .
    UWAGA: Domyślnie plik wyjściowy będzie zawierał tylko adnotacje dotyczące biotypów kodujących białka, ale można to przełączyć za pomocą opcji biotypu.

figure-protocol-4
Rysunek 5: Organizacja plików dla PeakStream. Zrzut ekranu folderu danych z plikami bedgraph w katalogu bedgrapghout. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

WonderPeaks
Po przeprowadzeniu eksperymentu ChIP-seq naukowcy często używają wywoływania szczytów, takich jak MACS3, aby zidentyfikować regiony genomu wzbogacone o białko wiążące DNA znakowane epitopami. Opracowaliśmy WonderPeaks jako przyjazny dla użytkownika program do wywoływania szczytów, przeznaczony do identyfikacji szczytów przy użyciu metody opisanej powyżej.

WonderPeaks identyfikuje szczyty, najpierw obliczając pierwszą pochodną pokrycia i ...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Techniki sekwencjonowania nowej generacji (NGS) zapewniają niezrównany wgląd w regulację i ekspresję genów w patogenach grzybowych. W związku z tym narzędzia obliczeniowe muszą być zarówno wszechstronne – przechwytujące wszystkie dane wygenerowane w eksperymencie – jak i dostępne dla ogółu użytkowników, zwłaszcza naukowców zajmujących się badaniami laboratoryjnymi. W tym raporcie przedstawiliśmy dwa narzędzia, WonderPeaks i PeakStream, które zaspokajają te potrzeby badaczy patogenów grzybowych w przepływach pracy ChIP-se...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają do zadeklarowania konfliktu interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ta praca była wspierana przez granty National Institutes of Health (NIH) RO1AI175080 i R01GM037049 (dla Alexandra D. Johnsona) oraz NIH T32 Training Grant Award T32 AI 60537-20 (dla H.G.). Dziękujemy Alexandrowi Johnsonowi, Matthew Lohse, Jenny Zhang i Brianowi Wangowi za pomocne dyskusje i rady. Dziękujemy również członkom Carol Gross' Lab za opinie. Dziękujemy Anandzie Mendozie za wsparcie techniczne. Sekwencjonowanie przeprowadzono w UCSF CAT, przy wsparciu grantów UCSF PBBR, RRP IMIA i NIH 1S10OD028511-01. Potwierdzamy korzystanie z ChatGPT firmy OpenAI w celu uzyskania pomocy w rozwiązywaniu problemów z kodem i dostarczania sugestii dotyczących edycji rękopisu.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Zestaw CORALL Total RNA-seq V1Lexogen095Mokry materiał laboratoryjny 
Grzyby strzępkowe ryboPOOLsiTOOLsdp-P096-6Mokry materiał laboratoryjny 
Taśma ekranowa RNA o wysokiej czułościAgilent5067-5579Mokry materiał laboratoryjny 
Drabinka taśmowa RNA o wysokiej czułościAgilent5067-5581Wet lab material 
Bufor do próbek RNA ScreenTape o wysokiej czułościAgilent5067-5580Wet lab material 
lista zależności dla WonderPeaks
https://github.com/mgarber21/WonderPeaks_preprocessing/blob/main/environment.ymllista zależności dla WonderPeaks_preprocessing
Monarch Spin RNA Cleanup KiNEBT2040LWet lab material 
pygenometracks (3.9)
QuantSeq 3′ mRNA-Seq FWD Zestaw do przygotowania biblioteki V1Lexogen015Mokry materiał laboratoryjny 
Zestaw do oznaczania wysokiej czułości RNA kubitu (HS)InvitrogenQ32852Mokry materiał laboratoryjny 
RNA Czyste & Concentrator-5Zymo ResearchR1016Mokry materiał laboratoryjny 
Zestaw TURBO bez DNAThermoFisherAM1907Mokry materiał laboratoryjny 
WonderPeaks(0.1.14)
WonderPeaks_preprocessing(0.2.3)
https://github.com/mgarber21/WonderPeaks/blob/main/environment.yml

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. fungal priority pathogens list to guide research, development and public health action. , WHO. https://www.who.int/publications/i/item/9789240060241 (2022).
  2. Fisher, M. C., Denning, D. W. The WHO fungal priority pathogens list as a game-changer. Nat Rev Microbiol. 21 (4), 211-212 (2023).
  3. Gaspar, J. M. Improved peak-calling with MACS2. bioRxiv. 496521, (2018).
  4. Muñoz, J. F., et al. Coordinated host-pathogen transcriptional dynamics revealed using sorted subpopulations and single macrophages infected with Candida albicans. Nat Commun. 10 (1), 1607(2019).
  5. Miramón, P., Pountain, A. W., Lorenz, M. C. Candida auris-macrophage cellular interactions and transcriptional response. Infect Immun. 91 (11), e0027423(2023).
  6. Lindemann-Perez, E., Rodríguez, D. L., Pérez, J. C. An approach to analyze spatiotemporal patterns of gene expression at single-cell resolution in Candida albicans-infected mouse tongues. mSphere. 9 (9), e0028224(2024).
  7. Mo, X., et al. In vivo RNA sequencing reveals a crucial role of Fus3-Kss1 MAPK pathway in Candida glabrata pathogenicity. mSphere. 9 (11), e0071524(2024).
  8. Haas, B. J., Chin, M., Nusbaum, C., Birren, B. W., Livny, J. How deep is deep enough for RNA-Seq profiling of bacterial transcriptomes. BMC Genomics. 13, 734(2012).
  9. Zaheer, R., et al. Impact of sequencing depth on the characterization of the microbiome and resistome. Sci Rep. 8 (1), 5890(2018).
  10. Xiong, Y., et al. A comparison of mRNA sequencing with random primed and 3′-directed libraries. Sci Rep. 7 (1), 14626(2017).
  11. Ma, F., et al. A comparison between whole transcript and 3' RNA sequencing methods using Kapa and Lexogen library preparation methods. BMC Genomics. 20, 9(2019).
  12. Fansler, M. M., Mitschka, S., Mayr, C. Quantifying 3′UTR length from scRNA-seq data reveals changes independent of gene expression. Nat Commun. 15 (1), 4050(2024).
  13. Tuch, B. B., et al. The transcriptomes of two heritable cell types illuminate the circuit governing their differentiation. PLoS Genet. 6, e1001070(2010).
  14. Shenker, S., Miura, P., Sanfilippo, P., Lai, E. C. IsoSCM: improved and alternative 3′ UTR annotation using multiple change-point inference. RNA. 21 (1), 14-27 (2015).
  15. Haese-Hill, W., Crouch, K., Otto, T. D. peaks2utr: a robust Python tool for the annotation of 3′ UTRs. Bioinformatics. 39 (3), btad112(2023).
  16. Anaconda - Getting started. , https://docs.anaconda.com/anaconda/getting-started/ (2025).
  17. Pryke, B. Jupyter Notebook tutorial. , https://www.dataquest.io/blog/jupyter-notebook-tutorial/ (2025).
  18. Chen, S., Zhou, Y., Chen, Y., Gu, J. fastp: an ultra-fast all-in-one FASTQ preprocessor. Bioinformatics. 34 (17), i884-i890 (2018).
  19. Andrews, S. FastQC: a quality control tool for high throughput sequence data. , https://www.bioinformatics.babraham.ac.uk/projects/fastqc/ (2010).
  20. Ewels, P., Magnusson, M., Lundin, S., Käller, M. MultiQC: summarize analysis results for multiple tools and samples in a single report. Bioinformatics. 32 (19), 3047-3048 (2016).
  21. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  22. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), giab008(2021).
  23. Ramírez, F., et al. deepTools2: a next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44 (W1), W160-W165 (2016).
  24. Liao, Y., Smyth, G. K., Shi, W. featureCounts: an efficient general purpose program for assigning sequence reads to genomic features. Bioinformatics. 30 (7), 923-930 (2014).
  25. Lohse, M. B., Johnson, A. D. Identification and characterization of Wor4, a new transcriptional regulator of white-opaque switching. G3 (Bethesda). 6 (3), 721-729 (2016).
  26. Nagalakshmi, U., et al. The transcriptional landscape of the yeast genome defined by RNA sequencing. Science. 320 (5881), 1344-1349 (2008).
  27. Diaz, A., Park, K., Lim, D. A., Song, J. S. Normalization, bias correction, and peak calling for ChIP-seq. Stat Appl Genet Mol Biol. 11 (3), Article 9(2012).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Analiza ChIP Seqalgorytm WonderPeaksnarz dzie PeakStreamregulacja transkrypcjiadnotacja 3 UTRsekwencjonowanie nowej generacjiCandida albicans
Film wkrótce dostępny

Powiązane artykuły