$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Patogeny grzybicze są rosnącym globalnym problemem zdrowotnym, a liczba infekcji wzrosła w ostatnich latach1. Wiele z tych patogenów wykazuje wysoką oporność na leki przeciwgrzybicze i wiąże się ze znaczną śmiertelnością2. Jednak w porównaniu z modelowymi organizmami grzybowymi, wiele grzybów chorobotwórczych pozostaje słabo scharakteryzowanych, co podkreśla potrzebę dalszych badań nad ich mechanizmami chorobotwórczości. Techniki sekwencjonowania nowej generacji (NGS), takie jak sekwencjonowanie immunoprecypitacji chromatyny (ChIP-Seq) i sekwencjonowanie RNA (RNA-Seq), odgrywają kluczową rolę w odkrywaniu molekularnych mechanizmów ekspresji genów leżących u podstaw patogenności grzybów.
Jakość wglądu uzyskanego z danych NGS jest wysoce zależna od dokładności oprogramowania używanego do analizy surowych danych. Jednym z kluczowych wyzwań związanych z analizą danych NGS jest wywoływanie pików – dokładna identyfikacja regionów wzbogaconych odczytów NGS – co jest szczególnie złożone ze względu na dużą różnorodność technik przygotowania bibliotek i sekwencjonowania, co sprawia, że uniwersalne rozwiązanie jest niepraktyczne. Algorytm MACS3, w tym jego nowsza wersja, MACS3, jest powszechnie uważany za złoty standard analizy zestawów danych ChIP-seq. Jednak MACS opiera się na parametrach zdefiniowanych przez użytkownika, takich jak minimalna długość piku i maksymalna przerwa, które mogą nie mieć uniwersalnego zastosowania i często są trudne do określenia przed analizą. Warto zauważyć, że najnowsza wersja MACS3 zawiera funkcję analizy odcięcia, która pozwala użytkownikom oszacować parametry przed szczytowym wywołaniem. Aby zwiększyć wydajność, użytkownicy mogą również dostarczyć listę regionów genomu znajdujących się na "czarnej liście", o których wiadomo, że wprowadzają stronniczość ze względu na strukturę chromatyny lub zmienność liczby kopii. Chociaż MACS pozostaje najczęściej używanym i najbardziej zaufanym narzędziem do wywoływania szczytów dla danych ChIP-seq, dostępnych jest niewiele alternatywnych algorytmów, szczególnie w przypadkach wymagających wysoce dostosowanych ustawień parametrów.
RNA-Seq to nieoceniona technika do badania odpowiedzi ekspresji genów grzybów chorobotwórczych podczas wzrostu in vivo, takich jak hodowla tkankowa lub modele infekcji myszy4,5,6,7. Do dokładnej analizy wyrażeń różnicowych w tych warunkach wymagana jest duża głębokość sekwencjonowania, która może być zbyt kosztowna i zasobochłonna8,9. Metody przygotowania biblioteki, takie jak sekwencjonowanie poliadenylacji (poli(A))-priming (3'RNA-Seq), które wykorzystuje startery przeznaczone do wyżarzania do poli(A)-ogonów mRNA w celu wytworzenia cDNA, mogą pomóc w zmniejszeniu głębokości sekwencjonowania potrzebnej do analizy ekspresji genów10. Jednak to podejście opiera się na wysokiej jakości adnotacjach genomu, w szczególności 3' Nieulegających translacji regionów (UTR), w których zwykle zlokalizowane są piki ze zdarzeń poli(A)-priming11. Adnotacje genomu wielu niedostatecznie zbadanych patogenów grzybowych nie mają żadnych adnotacji UTR, co utrudnia stosowanie 3'RNA-Seq w tych organizmach. Ponadto długość UTR dla pojedynczego genu może być dynamiczna w różnych warunkach wzrostu i typach komórek12,13. Chociaż opracowano szereg nowych narzędzi analitycznych w celu identyfikacji i opisywania UTR, wiele z nich jest przeznaczonych dla zestawów danych ssaków, których organizacja genów znacznie różni się od organizacji grzybów, lub wymaga danych z niezależnych eksperymentów sekwencjonowania, takich jak sekwencjonowanie pojedynczej komórki lub odwrotne sekwencjonowanie mRNA, co może zwiększyć czas i koszty dla badacza chcącego przeprowadzić analizę transkryptomu12, 14,15.
W tym artykule prezentujemy WonderPeaks, nowatorskie oprogramowanie do wywoływania szczytów, zaprojektowane na zasadach pierwszej pochodnej, które może być używane do dynamicznego wywoływania szczytów w zestawach danych NGS (Rysunek 1). WonderPeaks identyfikuje szczyty, obliczając pierwszą pochodną sygnału pokrycia i używając tej wartości - nachylenia piku - do zdefiniowania potencjalnych szczytów. Algorytm wyszukuje przypadki, w których pierwsza pochodna wykazuje lokalne maksimum powyżej progu nachylenia dostarczonego przez użytkownika lub wywnioskowanego z danych (wskazującego na rosnący sygnał), po którym następuje lokalne minimum powyżej tego samego progu (wskazującego na sygnał malejący), wykrywając w ten sposób wszystkie kandydujące szczyty w zbiorze danych. W przypadku aplikacji ChIP-seq WonderPeaks porównuje wszystkie potencjalne piki między próbkami testowymi i kontrolnymi, aby zidentyfikować wyjątkowo wzbogacone piki. Stosując WonderPeaks do wcześniej opublikowanego zestawu danych ChIP-seq czynnika transkrypcyjnego w patogenie grzybowym Candida albicans16, wykazaliśmy jego zdolność do skutecznej identyfikacji pików przed kluczowymi genami podkreślonymi w pierwotnym badaniu, jednocześnie omawiając obecne ograniczenia algorytmu w tym zastosowaniu.
Wprowadzamy również PeakStream, narzędzie programowe, które wykorzystuje WonderPeaks do identyfikacji pików w zestawach danych 3'RNA-Seq. Biblioteki 3'RNA-Seq polegają na dokładnych adnotacjach 3' UTR, ponieważ odczyty generowane przez priming poli(A) często wykraczają poza kodon stop sekwencji kodujących (CDS) genów i dlatego nie są zliczane przy użyciu standardowych adnotacji skoncentrowanych wyłącznie na regionach kodujących. Potok analizy PeakStream został zaprojektowany w celu tworzenia nowych adnotacji genomu przy użyciu danych 3' RNA-Seq, koncentrując się na regionach poniżej regionów kodujących geny (CDS). PeakStream przypisuje te piki do genów, generując nową adnotację genomu do wykorzystania w programach zliczających odczyty. Pokazujemy, że zastosowanie PeakStream może dokładnie zidentyfikować i przypisać piki generowane przez poli(A) do odpowiedniego genu w zestawie danych 3'RNA-Seq C. albicans. PeakStream dodaje również adnotacje do pików, które prawdopodobnie nie są powiązane z żadnymi obecnymi adnotacjami genów, ułatwiając odkrycie możliwych nowych transkryptów. Razem, PeakStream i WonderPeaks reprezentują potężny zestaw przyjaznych dla użytkownika narzędzi do wykrywania szczytów w zestawach danych sekwencjonowania nowej generacji (NGS).

Rysunek 1: Rysunek poglądowy na temat wywoływania szczytów przez WonderPeaks i PeakStream. Po lewej: Szczytowe wywołanie przy użyciu pierwszej pochodnej. U góry po prawej: wywoływanie szczytów w zestawach danych ChIP-Seq przy użyciu WonderPeaks. U dołu po prawej: wywoływanie szczytów w zestawach danych RNA-Seq przy użyciu PeakStream. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.