$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. Konfiguracja
- Zainstaluj R, jeśli nie jest jeszcze zainstalowany.
UWAGA: PAST jest napisany w języku R i dlatego wymaga, aby jego użytkownicy mieli zainstalowany język R. W chwili pisania tego tekstu instalacja PAST-a bezpośrednio z Bioconductor wymaga R4.0. Starsze wersje PAST-a można zainstalować z Bioconductor dla R3.6, a PAST-a można zainstalować z Github dla użytkowników z R3.5. Instrukcję instalacji R można pobrać z następującego linku: https://www.r-project.org/.
- Zainstaluj najnowszą wersję programu RStudio Desktop lub zaktualizuj program RStudio (opcjonalnie).
UWAGA: RStudio jest przydatnym środowiskiem do pracy z językiem R. Jego instalacja jest zalecana, szczególnie dla tych, którzy zdecydują się uruchomić PAST-a w wierszu poleceń, a nie za pośrednictwem aplikacji Shiny GUI. RStudio i jego instrukcję instalacji można znaleźć pod następującym linkiem: https://rstudio.com/products/rstudio/.
- Zainstaluj PASTa z Bioconductor11, postępując zgodnie z instrukcjami na stronie Bioconductor.
UWAGA: Instalacja za pośrednictwem Bioconductor powinna obsłużyć instalację zależności PAST. Dodatkowo, PAST można zainstalować z Github12, ale instalacja z Github nie zainstaluje zależności automatycznie.
- Zainstaluj PAST Shiny (opcjonalnie). Pobierz plik "app. R" ze strony Wydania repozytorium Github: https://github.com/IGBB/PAST/releases/, i zapamiętaj, gdzie znajduje się pobrany plik.
UWAGA: PAST może być używany, wywołując jego metody bezpośrednio za pomocą R, ale użytkownicy, którzy są mniej zaznajomieni z R, mogą uruchomić aplikację PAST Shiny, która zapewnia interfejs użytkownika z przewodnikiem. PAST Shiny to skrypt języka R dostępny w gałęzi shiny_app repozytorium PAST Github. PAST Shiny spróbuje zainstalować swoje zależności podczas pierwszego uruchomienia.
- Rozpocznij analizę od uruchomienia aplikacji na jeden z trzech sposobów opisanych poniżej.
- PRZESZŁOŚĆ Shiny z RStudio
- Korzystając z programu RStudio, utwórz nowy projekt w folderze, w którym znajduje się aplikacja. R znajduje się. Kliknij pozycję Plik | Nowy projekt i wybierz ten folder.
- Po utworzeniu nowego projektu otwórz aplikację. Plik R pobrany wcześniej. Program RStudio rozpoznaje tę aplikację. R to aplikacja Shiny, która tworzy przycisk Uruchom aplikację na pasku nad wyświetlanym kodem źródłowym. Kliknij Uruchom aplikację. Następnie program RStudio uruchomi okno, w którym zostanie wyświetlona aplikacja PAST Shiny.
- PAST Shiny z konsolą R
- Uruchom R i uruchom następujący kod, aby uruchomić aplikację PAST Shiny: shiny::runApp('ścieżka/do/folderu/z/błyszczącą/aplikacją. R". Zastąp tekst w cudzysłowie folderem, do którego należy się aplikacja. R został pobrany i zachowaj cytaty.
- PAST bez R Shiny
- Uruchom polecenie library(PAST) w konsoli języka R, aby załadować polecenie PAST.
2. Dostosuj analizę Shiny (opcjonalnie)
- Zmień tytuł analizy z "Nowa analiza" na taki, który lepiej odzwierciedla typ uruchamianej analizy, co pomaga śledzić wiele analiz (patrz Rysunek 1).

Rysunek 1. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
- Zmodyfikuj liczbę rdzeni i tryb. Ustaw liczbę rdzeni na dowolną liczbę z zakresu od 1 do całkowitej liczby na maszynie, ale pamiętaj, że poświęcenie większej ilości zasobów na PAST może spowolnić inne operacje na maszynie. Ustaw tryb na podstawie opisu w sekcji 6.
3. Załaduj dane GWAS
UWAGA: Sprawdź, czy dane GWAS są rozdzielane tabulatorami. Upewnij się, że plik asocjacyjny zawiera następujące kolumny: cecha, nazwa markera, locus lub chromosom, pozycja na chromosomie, wartość p i wartość R2 dla markera. Upewnij się, że plik efektów zawiera następujące kolumny: cecha, nazwa markera, locus lub chromosom, pozycja na chromosomie i efekt. Kolejność tych kolumn nie jest ważna, ponieważ użytkownik może określić nazwy kolumn podczas ładowania danych. Wszelkie dodatkowe kolumny są ignorowane. TASSEL13 może być użyty do utworzenia tych plików.
- Załaduj dane GWAS za pomocą PAST Shiny.
- Wybierz plik skojarzenia i plik efektów, korzystając z pól wyboru Plik skojarzeniowy i Plik efektów. Zmień nazwy kolumn w polach wejściowych Nazwa kolumny skojarzenia i Nazwa kolumn efektów poniżej pól wyboru plików, aby odzwierciedlić nazwy kolumn w danych.

Rysunek 2. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
- Załaduj dane GWAS za pomocą PAST-y w konsoli języka R.
- Zmodyfikuj i uruchom następujący kod:
gwas_data = load_GWAS_data("ścieżka/do/association_file.tsv", "ścieżka/do/effects_file.tsv", association_columns = c("Cecha", "Znacznik", "Locus", "Strona", "p", "marker_R2"), effects_columns = c("Cecha", "Znacznik", "Locus", "Miejsce", "Efekt")
- UWAGA: Zmień ścieżki do rzeczywistej lokalizacji plików GWAS. Wartości podane dla association_columns i effects_columns są wartościami domyślnymi. Jeśli nazwy nie są zgodne z wartościami domyślnymi, określ nazwy kolumn. W przeciwnym razie można je pominąć.
4. Dane o nierównowadze połączeń ładunkowych (LD)
UWAGA: Sprawdź, czy dane o nierównowadze powiązań (LD) są rozdzielane tabulatorami i zawierają następujące typy danych: Locus, Position1, Site1, Position2, Site2, Odległość w parach bazowych między Position1 i Position2 oraz wartość R2.
- Załaduj dane LD za pomocą PAST Shiny.
- Wybierz plik zawierający dane LD. W razie potrzeby zmień nazwy kolumn w polach wejściowych Nazwy kolumn LD poniżej pola wyboru pliku, aby dopasować je do nazw kolumn w danych LD.

Rysunek 3. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
- Załaduj dane LD za pomocą PAST-u w konsoli języka R.
- Zmodyfikuj i uruchom następujący kod, aby załadować dane LD:
LD = load_LD("ścieżka/do/LD.tsv", LD_columns = c("Locus1", "Pozycja1", "Witryna1", "Pozycja2", "Witryna2", "Dist_bp", "R.2")
UWAGA: Zmień ścieżkę do rzeczywistej lokalizacji pliku LD. Wartości podane dla LD_columns są wartościami domyślnymi. Jeśli nazwy nie są zgodne z tymi wartościami domyślnymi, określ poprawne nazwy kolumn; W przeciwnym razie można je pominąć.
5. Przypisywanie SNP do genów
UWAGA: Pobierz lub w inny sposób znajdź adnotacje w formacie GFF. Adnotacje te można często znaleźć w internetowych bazach danych dla określonych organizmów. Należy zachować ostrożność w przypadku adnotacji o niskiej jakości, ponieważ jakość danych adnotacji będzie miała wpływ na jakość analizy ścieżki. Upewnij się, że pierwsza kolumna tych adnotacji (chromosom) jest zgodna z formatem locus/chromosomu w danych asocjacji, efektów i LD. Na przykład adnotacje nie powinny wywoływać pierwszego chromosomu "chr1", jeśli pliki danych GWAS i LD wywołują pierwszy chromosom "1".
- Przypisz SNP do genów z PAST Shiny.
UWAGA: Więcej informacji na temat wyznaczania odpowiedniego punktu odcięcia R2 można znaleźć w Tang et al.6, w sekcji zatytułowanej "SNP to gene algorithm for the pathway analysis".
- Wybierz plik zawierający adnotacje GFF. Zastanów się, jaki rozmiar okna i odcięcie R2 są najbardziej odpowiednie dla rozważanego gatunku i zmodyfikuj, jeśli ustawienia domyślne nie pasują do przesłanych danych.
UWAGA: Wartości domyślne w PAST odzwierciedlają przede wszystkim wartości właściwe dla kukurydzy. W tym kroku używana jest liczba rdzeni ustawiona na początku analizy PAST Shiny (krok 2.2).

Rysunek 4. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
- Przypisz SNP do genów z PAST w konsoli języka R.
- Zmodyfikuj i uruchom następujący kod, aby przypisać SNP do genów:
geny = assign_SNPs_to_genes(gwas_data, LD, "ścieżka/do/adnotacji.gff", c("gen"), 1000, 0.8, 2)
UWAGA: W tym przykładowym kodzie podano kilka domyślnych sugestii: 1000 to rozmiar okna wokół SNP do wyszukiwania genów; 0,8 to wartość graniczna dla klasy R2; 2 to liczba rdzeni używanych do przetwarzania równoległego. Ścieżka do adnotacji powinna również zostać zmieniona na rzeczywistą lokalizację pliku adnotacji.
6. Odkryj ważne ścieżki
UWAGA: Sprawdź, czy plik ścieżek zawiera następujące dane w formacie rozdzielanym tabulatorami, z jedną linią dla każdego genu w każdej ścieżce: identyfikator ścieżki - identyfikator taki jak "PWY-6475-1"; opis ścieżki - dłuższy opis tego, co robią szlaki, taki jak "biosynteza trans-likopenu"; gen - gen w szlaku, który powinien pasować do nazw podanych w adnotacjach. Informacje o szlakach można prawdopodobnie znaleźć w internetowych bazach danych dla określonych organizmów, takich jak MaizeGDB. Drugą opcją określoną przez użytkownika jest tryb. "Rosnący" odnosi się do fenotypów, które odzwierciedlają, kiedy pożądana jest rosnąca wartość mierzonej cechy, takiej jak plon, podczas gdy "malejący" odnosi się do cechy, w przypadku której spadek mierzonych wartości jest korzystny, takich jak oceny uszkodzeń owadów. Znaczenie ścieżek jest testowane przy użyciu wcześniej opisanych metod4,6,14.
- Odkryj ważne ścieżki z PAST Shiny.
- Wybierz plik zawierający dane ścieżek i upewnij się, że tryb jest wybrany w opcjach analizy. W razie potrzeby zmień liczbę genów, które muszą znajdować się w ścieżce, aby zachować ją do analizy oraz liczbę permutacji użytych do utworzenia rozkładu zerowego, aby przetestować istotność efektu.

Rysunek 5. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
UWAGA: W tym kroku używana jest liczba rdzeni i tryb ustawiony na początku analizy PAST Shiny (Krok 2.2). Domyślna liczba genów jest obecnie ustawiona na 5 genów, więc szlaki z mniejszą liczbą znanych genów zostaną usunięte. Użytkownik może obniżyć tę wartość do 4 lub 3, aby uwzględnić krótsze ścieżki, ale spowoduje to ryzyko uzyskania wyników fałszywie dodatnich. Zwiększenie tej wartości może zwiększyć możliwości analizy, ale spowoduje usunięcie większej liczby ścieżek z analizy. Zmiana liczby używanych permutacji zwiększa i zmniejsza moc testu.
- Odnajduj ważne ścieżki za pomocą PAST w konsoli języka R.
- Zmodyfikuj i uruchom następujący kod, aby odnaleźć istotne ścieżki:
rugplots_data <- find_pathway_significance(geny, "path/to/pathways.tsv", 5, "rosnące", 1000, 2)
UWAGA: W tym przykładowym kodzie podano kilka sugerowanych wartości domyślnych. 5 to minimalna liczba genów, które muszą znajdować się w ścieżce, aby utrzymać ścieżkę w analizie, wzrost odnosi się do rosnącej ilości mierzonej cechy (zaleca się, aby użytkownik uruchamiał zarówno wzrost, jak i malejący, niezależnie od cechy; interpretacja danych będzie jednak inna dla tych dwóch), 1000 to liczba prób efektów w celu określenia rozkładu zerowego, a 2 to liczba rdzeni używanych do przetwarzania równoległego. Zmień ścieżkę do rzeczywistej lokalizacji pliku pathways.
7. Zobacz Rugplots
- Zobacz Rugplots z PAST Shiny.
- Po przesłaniu i ustawieniu wszystkich danych wejściowych kliknij przycisk Rozpocznij analizę. Pojawi się pasek postępu wskazujący, który krok analizy został ostatnio ukończony. Po zakończeniu analizy PAST Shiny przełączy się na zakładkę Wyniki. Tabela wyników zostanie wyświetlona w lewej kolumnie (oznaczona jako "ścieżki"), a wykresy rug zostaną wyświetlone w prawej kolumnie (oznaczone jako "wykresy").
- Użyj suwaka, aby sterować parametrami filtrowania. Gdy poziom filtrowania jest zadowalający, kliknij przycisk Pobierz wyniki w lewym dolnym rogu, aby pobrać wszystkie obrazy i tabele pojedynczo do pliku ZIP o nazwie zgodnej z tytułem analizy. Ten plik ZIP zawiera tabelę filtrowaną, tabelę niefiltrowaną i jeden obraz na ścieżkę w filtrowanej tabeli.

Rysunek 6. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Rysunek 7. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
- Wyświetlanie wykresów rug z PAST-ą w konsoli języka R
- Zmodyfikuj i uruchom następujący kod, aby zapisać wyniki:
plot_pathways(rugplots_data, "pvalue", 0.02, "rosnący", "output_folder")
UWAGA: W tym przykładowym kodzie podano kilka sugerowanych wartości domyślnych. pvalue dostarcza dane, które mogą być używane do filtrowania nieistotnych ścieżek po wybraniu progu istotności przez użytkownika; 0,02 jest wartością domyślną używaną w filtrowaniu, a zwiększanie odnosi się do rosnącej ilości mierzonej cechy (zaleca się, aby użytkownik uruchamiał zarówno wzrost, jak i malejący, niezależnie od cechy; interpretacja danych będzie jednak inna dla tych dwóch); output_folder jest folderem, w którym zostaną zapisane obrazy i tabele (ten folder musi istnieć przed uruchomieniem funkcji). W tym folderze jest zapisywana tabela przefiltrowanych wyników, wyników niefiltrowanych i poszczególnych obrazów dla każdej ścieżki w przefiltrowanych wynikach.