Patogeny grzybowe stanowią narastający problem w zakresie globalnej ochrony zdrowia, a liczba infekcji wzrosła w ostatnich latach1. Wiele z tych patogenów wykazuje wysoką oporność na środki przeciwgrzybicze i wiąże się ze znacznymi wskaźnikami śmiertelności2. Jednak w porównaniu z modelowymi organizmami grzybowymi, wiele grzybów patogennych pozostaje słabo scharakteryzowanych, co podkreśla potrzebę dalszych badań nad mechanizmami ich patogenności. Techniki sekwencjonowania następnej generacji (NGS), takie jak sekwencjonowanie immunoprecypitacji chromatyny (ChIP-Seq) oraz sekwencjonowanie RNA (RNA-Seq), odgrywają kluczową rolę w odkrywaniu molekularnych mechanizmów ekspresji genów leżących u podstaw patogenności grzybów.
Jakość wniosków wyciągniętych z danych NGS w dużym stopniu zależy od dokładności oprogramowania wykorzystywanego do analizy surowych danych. Jednym z kluczowych wyzwań w analizie danych NGS jest wyznaczanie pików (peak calling) – czyli precyzyjna identyfikacja regionów z wzbogaconymi odczytami NGS – co jest szczególnie skomplikowane ze względu na szeroką różnorodność technik przygotowania bibliotek i sekwencjonowania, co sprawia, że opracowanie uniwersalnego rozwiązania jest niepraktyczne. Algorytm MACS3, w tym jego nowsza wersja MACS3, jest powszechnie uważany za złoty standard w analizie zbiorów danych ChIP-seq. Jednak MACS opiera się na parametrach definiowanych przez użytkownika – takich jak minimalna długość piku i maksymalna przerwa (gap) – które mogą nie być uniwersalne i często są trudne do określenia przed analizą. Warto zauważyć, że najnowsza wersja MACS3 zawiera funkcję analizy punktu odcięcia (cut-off analysis), która pozwala użytkownikom oszacować parametry przed właściwym wyznaczaniem pików. Aby zwiększyć wydajność, użytkownicy mogą również dostarczyć listę „czarnych list” (blacklisted) regionów genomowych, o których wiadomo, że wprowadzają błąd ze względu na strukturę chromatyny lub zmienność liczby kopii. Choć MACS pozostaje najczęściej stosowanym i najbardziej zaufanym narzędziem do wyznaczania pików w danych ChIP-seq, dostępnych jest kilka alternatywnych algorytmów, szczególnie w przypadkach wymagających bardzo ściśle dostosowanych ustawień parametrów.
RNA-Seq jest nieocenioną techniką badania odpowiedzi ekspresji genów grzybów patogennych podczas wzrostu in vivo, na przykład w hodowlach tkankowych lub modelach infekcji myszy4,5,6,7. Do dokładnej analizy ekspresji różnicowej w tych warunkach wymagana jest wysoka głębokość sekwencjonowania, co może być kosztowne i nadmiernie obciążające zasoby8,9. Metody przygotowania bibliotek, takie jak sekwencjonowanie z inicjacją poliaadenylacją (poly(A))-priming Sequencing (3'RNA-Seq), w którym wykorzystuje się primery zaprojektowane do przyłączania się do ogonów poly(A) mRNA w celu generowania cDNA, mogą pomóc w zmniejszeniu głębokości sekwencjonowania potrzebnej do analizy ekspresji genów10. Podejście to opiera się jednak na wysokiej jakości adnotacjach genomu, w szczególności 3' niekodujących regionów nietranslacyjnych (UTRs), w których zazwyczaj znajdują się piki wynikające z zdarzeń inicjacji poly(A)11. Adnotacje genomów wielu słabo zbadanych grzybów patogennych są pozbawione adnotacji UTR, co utrudnia zastosowanie 3'RNA-Seq u tych organizmów. Ponadto długość UTR dla pojedynczego genu może być dynamiczna w zależności od różnych warunków wzrostu i typów komórek12,13. Choć opracowano szereg nowych narzędzi analitycznych do identyfikacji i adnotacji UTR, wiele z nich jest przeznaczonych dla zbiorów danych ssaków, których organizacja genów znacznie różni się od organizacji u grzybów, lub wymagają danych z niezależnych eksperymentów sekwencjonowania, takich jak sekwencjonowanie pojedynczych komórek lub odwrócone sekwencjonowanie mRNA, co może zwiększyć czas i koszty dla badacza dążącego do przeprowadzenia analizy transkryptomu12,14,15.
W niniejszej pracy przedstawiamy WonderPeaks, nowe oprogramowanie do wyznaczania pików (peak-calling), opracowane w oparciu o zasady pierwszej pochodnej, które może być wykorzystywane do dynamicznego wyznaczania pików w zestawach danych NGS (Rycina 1). WonderPeaks identyfikuje piki poprzez obliczanie pierwszej pochodnej sygnału pokrycia i wykorzystywanie tej wartości – nachylenia piku – do definiowania potencjalnych pików. Algorytm wyszukuje przypadki, w których pierwsza pochodna wykazuje lokalne maksimum powyżej określonego przez użytkownika lub wywnioskowanego z danych progu nachylenia (co wskazuje na sygnał rosnący), a następnie lokalne minimum powyżej tego samego progu (co wskazuje na sygnał malejący), wykrywając w ten sposób wszystkie kandydackie piki w zestawie danych. W zastosowaniach ChIP-seq program WonderPeaks porównuje wszystkie kandydackie piki pomiędzy próbkami testowymi a kontrolnymi, aby zidentyfikować piki o unikalnym wzbogaceniu. Stosując WonderPeaks do wcześniej opublikowanego zestawu danych ChIP-seq dla czynnika transkrypcyjnego u grzyba chorobotwórczego Candida albicans16, wykazaliśmy jego zdolność do skutecznego identyfikowania pików powyżej kluczowych genów wskazanych w oryginalnym badaniu, omawiając jednocześnie obecne ograniczenia algorytmu w tym zastosowaniu.
Przedstawiamy również PeakStream, narzędzie programistyczne wykorzystujące WonderPeaks do identyfikacji pików w zbiorach danych 3'RNA-Seq. Biblioteki 3'RNA-Seq zależą od dokładnych adnotacji 3' UTR, ponieważ odczyty generowane poprzez primery poly(A) często wykraczają poza kodon stop sekwencji kodujących (CDS) genów, przez co nie są zliczane przy użyciu standardowych adnotacji skupionych wyłącznie na regionach kodujących. Potok analizy PeakStream został zaprojektowany w celu tworzenia nowych adnotacji genomowych przy użyciu danych 3' RNA-Seq, z koncentracją na regionach znajdujących się poniżej sekwencji kodujących (CDS) genów. PeakStream przypisuje te piki do genów, generując nową adnotację genomu do wykorzystania w programach do zliczania odczytów w dalszych etapach analizy. Wykazujemy, że zastosowanie PeakStream pozwala na dokładną identyfikację i przypisanie pików generowanych przez poly(A) w regionach downstream do odpowiedniego genu w zbiorze danych 3'RNA-Seq dla C. albicans. PeakStream adnotuje również piki, które prawdopodobnie nie są powiązane z żadnymi obecnymi adnotacjami genów, co ułatwia odkrywanie potencjalnych nowych transkryptów. Wspólnie PeakStream i WonderPeaks stanowią potężny zestaw przyjaznych dla użytkownika narzędzi do detekcji piki w zbiorach danych sekwencjonowania następnej generacji (NGS).

Rycina 1: Schemat wykrywania pików za pomocą programów WonderPeaks i PeakStream. Lewo: Wykrywanie pików z wykorzystaniem pierwszej pochodnej. Prawy górny róg: Wykrywanie pików w zbiorach danych ChIP-Seq przy użyciu WonderPeaks. Prawy dolny róg: Wykrywanie pików w zbiorach danych RNA-Seq przy użyciu PeakStream. Kliknij tutaj, aby zobaczyć powiększoną wersję tej ryciny.