Dane spektralne MS/MS uzyskano z zanonimizowanych pozostałości próbek PTF, które zostały pobrane zgodnie z procedurami opartymi na wytycznych i przepisach zatwierdzonych przez komisję instytucjonalną, jak opisano wcześniej21,29,30.
UWAGA: Rycina 1 przedstawia ogólny schemat całego procesu roboczego, który składa się z pięciu modułów. Wszystkie dane wejściowe, wyjściowe oraz narzędzia programistyczne zostały podsumowane w Tabeli uzupełniającej 1.

Rysunek 1: Podsumowanie modułów przepływu pracy w klinicznej metaproteomice w środowisku Galaxy. Pełny przepływ pracy w klinicznej metaproteomice składa się z pięciu modułów: generowania bazy danych, odkrywania, weryfikacji, kwantyfikacji i interpretacji danych. (A) Duża, kompleksowa baza danych zawiera sekwencje białek gatunków drobnoustrojów, które prawdopodobnie występują w próbce, białka ludzkie oraz powszechne zanieczyszczenia. Narzędzie programowe MetaNovo bezpośrednio dopasowuje dane spektralne MS/MS do peptydów i wnioskuje o białkach oraz ich organizmach źródłowych na podstawie surowych danych MS i dużej wejściowej bazy sekwencji białek, tworząc zredukowaną bazę danych33. Zredukowana baza danych z MetaNovo jest następnie łączona z białkami ludzkimi i zanieczyszczeniami w celu utworzenia bazy danych do odkrywania peptydów. (B) Dwa algorytmy identyfikacji peptydów, SearchGUI/PeptideShaker oraz MaxQuant, dopasowują sekwencje peptydowe do widm MS/MS i docelowej bazy białek typu target-decoy49. (C) Peptydy zidentyfikowane przez SearchGUI/PeptideShaker i MaxQuant są następnie weryfikowane za pomocą PepQuery2. PepQuery2 rygorystycznie ponownie analizuje domniemane zidentyfikowane sekwencje peptydów drobnoustrojowych i ich dopasowane widma MS/MS w odniesieniu do innych potencjalnych dopasowań do proteomu gospodarza ludzkiego i/lub zanieczyszczeń, weryfikując w ten sposób wysokowiarygodne dopasowania drobnoustrojowe40,41. Zweryfikowane peptydy służą do wygenerowania zweryfikowanej bazy danych sekwencji białek, która zostanie wykorzystana do kwantyfikacji peptydów i białek. (D) Program MaxQuant42 przeszukuje dane MS/MS pod kątem zweryfikowanych sekwencji białek i kwantyfikuje peptydy drobnoustrojowe oraz wnioskowane białka wraz z białkami ludzkimi. (E) Unipept45 oraz MSstatsTMT46 są wykorzystywane w końcowym kroku do adnotowania białek pod kątem taksonomii i informacji funkcjonalnych (numery dostępowe Enzyme Commission), a także do generowania wykresów wulkanicznych i porównawczych. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
1. Znakowanie TMT i generowanie widm MS/MS
- W celu przygotowania do analizy MS należy pobrać próbki kliniczne zgodnie z wytycznymi i przepisami.
UWAGA: Ponieważ niniejszy protokół kładzie nacisk na przepływ pracy bioinformatycznej, procedury pobierania próbek klinicznych mogą różnić się od tych zastosowanych w niniejszej publikacji. W tym przypadku białka poddano trawieniu trypsyną do mieszaniny peptydów, a następnie oznakowano, frakcjonowano i analizowano za pomocą spektrometrii mas w celu wygenerowania danych spektralnych MS/MS do dalszej analizy z wykorzystaniem platformy Galaxy. Szczegółowe instrukcje dotyczące przetwarzania próbek zostały wcześniej opisane przez Boylan i wsp.29 oraz Afiuni-Zadel i wsp.30.
- Wyizolować białka z próbek klinicznych i strawić je do peptydów przy użyciu trypsyny29,30.
- Oznakować białka odczynnikiem Tandem Mass Tag (TMT)-11-plex. Odczynnik ten pomoże w kwantyfikacji peptydów i białek31,32.
- Podzielić oznakowane próbki losowo i równomiernie na cztery eksperymentalne grupy oparte na TMT.
- Do każdej grupy eksperymentalnej należy dołączyć jedną wspólną próbkę referencyjną, oznakowaną unikalnym tagiem TMT, która będzie służyć jako wspólny punkt odniesienia do porównania z każdą indywidualną próbką we wszystkich czterech grupach eksperymentalnych31,32.
- Przeprowadzić frakcjonowanie offline połączonych próbek za pomocą wysokopH-owej odwróconej chromatografii cieczowej (RPLC)29,30.
- Przeanalizować frakcje za pomocą tandemowej chromatografii cieczowej i spektrometrii mas (LC-MS/MS) z wykorzystaniem hybrydowego spektrometru mas quadrupole-Orbitrap29,30. Wygenerowane dane spektralne MS/MS zapisać w formacie Thermo Raw (thermo.raw).
UWAGA: W razie potrzeby pliki Thermo Raw są konwertowane do formatu Mascot Generic Format (.mgf), aby były kompatybilne z różnym oprogramowaniem. W niniejszym tekście skróty "RAW" i "MGF" oznaczają format plików wejściowych zestawów danych MS/MS. Na rysunkach zestawy danych MS/MS są reprezentowane przez te same ikony RAW dla uproszczenia.
2. Konfiguracja modułu
UWAGA: Wybory przycisków/menu są pogrubione. Przykładowe pliki, przepływy pracy i parametry narzędzi są dostępne w tabelach uzupełniających. Więcej informacji na temat korzystania z Galaxy można znaleźć na stronie FAQ GTN (https://training.galaxyproject.org/training-material/faqs/galaxy/).
- Serwer Galaxy Europe
- Uzyskaj dostęp do serwera Galaxy Europe (Galaxy EU; https://usegalaxy.eu/).
- Utwórz konto lub zaloguj się. Do utworzenia nowego konta wymagany jest ważny adres e-mail. Aby korzystać z Galaxy, zaloguj się jako użytkownik.
- Przygotowanie historii w Galaxy
- Jeśli użytkownik importuje przykładowe dane wejściowe z Tabeli uzupełniającej 2, należy wykonać kroki 2.2.1.1-2.2.1.3.
- Otwórz przykładowe historie Galaxy, korzystając z linków podanych w Tabeli uzupełniającej 2.
- Kliknij szary przycisk Import this history znajdujący się w lewym górnym rogu panelu (środkowego). Zmień nazwę historii i kliknij Copy History. Jeśli chcesz, dodaj własne zestawy danych do tej historii, klikając przycisk Upload w panelu po lewej stronie i dodając pliki do przesłania.
- Kliknij Start > Close. Przesłane pliki pojawią się w panelu historii po prawej stronie. Przed użyciem poczekaj, aż kolor zestawu (zestawów) danych zmieni się na zielony.
UWAGA: W przypadku importowania (kopiowania) istniejącej historii nie należy tworzyć oddzielnej (nowej) historii.
- Jeśli użytkownik tworzy nową historię i przesyła własne dane, należy wykonać kroki 2.2.2.1.-2.2.2.2.
- W panelu Historii (prawa strona) kliknij raz ikonę + (plus), aby utworzyć nową historię o nazwie „Unnamed History”. Kliknij ikonę ołówka obok historii i kliknij Save. Te same kroki dodawania zestawów danych do istniejącej (przykładowej) historii mają zastosowanie do przesyłania własnych danych.
- W panelu po lewej stronie kliknij Upload i dodaj pliki do przesłania. Kliknij Start > Close. Przesłane pliki pojawią się w nowej historii. Poczekaj, aż kolor zestawu (zestawów) danych zmieni się na zielony.
- Jeśli użytkownik analizuje jednocześnie wiele plików MS/MS, należy wykonać kroki 2.2.3.1.-2.2.3.3.
- Umieść je w kolekcji zestawów danych, aby wybrać je jako jedno wejście. Kliknij ikonę znaku wyboru w panelu Historii i zaznacz odpowiednie zestawy danych.
- Kliknij przycisk wyświetlający liczbę wybranych zestawów danych (np. 4 of 8 selected), a w menu rozwijanym kliknij Build Dataset List. W oknie pop-up wpisz nazwę kolekcji (np. MGF Data, RAW Data). Jeśli chcesz, zaznacz opcję ukrycia oryginalnych zestawów danych po utworzeniu kolekcji.
- Kliknij niebieski przycisk Create Collection w prawym dolnym rogu okna pop-up. Kliknij ikonę znaku wyboru w panelu Historii, aby odznaczyć zestawy danych.
UWAGA: Każdy z pięciu modułów powinien być uruchamiany we własnej (zaimportowanej lub nowej) historii Galaxy dla lepszej wygody użytkowania. Aby uniknąć powtórzeń, dalsze instrukcje dotyczące modułów pomijają konfigurację i skupiają się na krokach przepływu pracy.
- Importowanie i uruchamianie przepływu pracy (workflow)
UWAGA: Wszystkim użytkownikom, niezależnie od tego, czy korzystają z danych przykładowych, czy własnych, zdecydowanie zaleca się korzystanie i/lub adaptowanie modularnych przepływów pracy z predefiniowanymi parametrami (Tabela uzupełniająca 2). Dzięki temu użytkownicy unikną konieczności wyszukiwania i ustawiania parametrów dla każdego narzędzia. Jeśli chcą, użytkownicy mogą wyszukiwać narzędzia, klikając przycisk Tools w panelu po lewej stronie i wpisując nazwę narzędzia (tak dokładnie, jak to możliwe) w pasku wyszukiwania w sąsiednim panelu. Pasujące narzędzia pojawią się automatycznie. Kliknij właściwy wynik wyszukiwania i ustaw odpowiednie parametry (patrz Plik uzupełniający 1). Przed uruchomieniem narzędzia użytkownicy mogą skonfigurować powiadomienia e-mail, aby otrzymać alert po zakończeniu zadania, wybierając odpowiedni przycisk pod koniec listy parametrów. Dla wygody dostępne są dwa przyciski Run: jeden w prawym górnym rogu panelu środkowego, a drugi po polach parametrów. Tabela uzupełniająca 3 zawiera dodatkowe zasoby szkoleniowe. Wersje narzędzi i bazy danych są aktualne i sprawne w momencie pisania (czerwiec 2024), ale mogą ulec zmianie w miarę aktualizacji Galaxy oraz powiązanych narzędzi i baz danych.
- Otwórz przepływ pracy w nowej karcie, korzystając z linków w Tabeli uzupełniającej 2.
- Kliknij przycisk Import w prawym górnym rogu panelu. Otworzy się nowa karta z zielonym polem potwierdzającym zaimportowanie przepływu pracy. Zielone pole zawiera również dwie opcje: start using this workflow right away lub return to the previous page.
- Kliknij pierwszy przycisk („start using this workflow...”), aby otworzyć kartę Workflow w panelu środkowym interfejsu, która wyświetla wszystkie zapisane przepływy pracy. Znajdź właśnie zaimportowany przepływ pracy i kliknij niebieski przycisk play (trójkąt). Spowoduje to wyświetlenie pól wejściowych.
UWAGA: Dla każdego dostarczonego przepływu pracy pola wejściowe odpowiadają przykładowym danym wejściowym (Tabela uzupełniająca 2). Jeśli użytkownik analizuje własne dane, jego wejścia powinny być nazwane odpowiednio, aby zapewnić użycie poprawnych plików dla każdego modułu.
- Jeśli użytkownik chce przeglądać przepływy pracy na serwerze Galaxy EU, należy wykonać kroki 2.3.2.1-2.3.2.4.
- Kliknij przycisk Workflow na górnym pasku strony Galaxy. W tej karcie kliknij podkartę My workflows, aby wyświetlić wszystkie zaimportowane przepływy pracy. Aby wyświetlić przepływ pracy, kliknij przycisk Edit z ikoną ołówka, aby otworzyć Edytor Przepływów Pracy (Workflow Editor).
- W Edytorze Przepływów Pracy można wchodzić w interakcję z przepływem, np. poprzez klikanie i przeciąganie w celu reorganizacji, klikanie w narzędzia w celu ich wyświetlenia, zmianę parametrów itp. Po wprowadzeniu zmian zapisz edytowany przepływ pracy, klikając ikonę dyskietki na górze prawego panelu, a jeśli chcesz, uruchom przepływ pracy, klikając ikonę play (również na górze prawego panelu).
- Utwórz specyficzne dla użytkownika przepływy pracy do analizy niestandardowych danych wejściowych. W zależności od wiedzy użytkownika w zakresie metaproteomiki i doświadczenia z platformą Galaxy, zbuduj przepływ pracy, a następnie przeanalizuj dane.
- Jeśli użytkownik jest mniej doświadczony, może przetestować różne narzędzia w historii, a następnie wyekstrahować przepływ pracy z wykonanej analizy.
UWAGA: Ten wyekstrahowany przepływ pracy można rozszerzać, poprawiać i używać ponownie, co pozwala użytkownikom na dokładne odtworzenie swojej pracy. Bardziej szczegółowe instrukcje znajdują się w sekcji FAQ GTN dotyczącej przepływów pracy (https://training.galaxyproject.org/training-material/faqs/galaxy/#workflows).
- Kliknij każde pole wejściowe i wybierz odpowiednie wejście. Sekcje od 3 do 7 opisują wejścia modułów. Sprawdź, czy wszystkie wejścia są w akceptowalnym formacie, aby uniknąć błędów. Kliknij accepted formats pod każdym polem wejściowym, aby sprawdzić, czy wszystkie pliki są kompatybilne z narzędziami. Po zakończeniu kliknij Run workflow.
UWAGA: Jeśli użytkownik woli konfigurować narzędzia ręcznie, materiały instruktażowe dla każdego modułu tego klinicznego przepływu pracy metaproteomicznego są dostępne na stronie GTN (https://gxy.io/GTN:P00019). Szacowane czasy uruchamiania kluczowych narzędzi zostały zawarte w Tabeli uzupełniającej 2, jednak czasy te zależą od rozmiaru danych wejściowych, zależności narzędzi (takich jak wymagania dotyczące pamięci w porównaniu do pamięci przydzielonej), planowanych przerw konserwacyjnych, błędów itp. Statusy zadań są wskazywane przez kolor zestawu danych; po wybraniu (kliknięciu) zestawu danych pojawi się komunikat informujący, czy zadanie oczekuje w kolejce (szary), jest w toku (pomarańczowy), czy zakończyło się błędem (czerwony). Po zakończeniu zadania zestaw danych zmieni kolor na zielony (brak komunikatu potwierdzającego). Użytkownicy mogą zapisać się na powiadomienia e-mail o zakończeniu zadań (patrz UWAGA na początku kroku 2.3). Poniższe instrukcje modułów pomijają jawne kroki konfiguracji, ponieważ są one takie same dla każdego modułu (w razie potrzeby patrz sekcja 2 i FAQ GTN) i opisują kluczowe narzędzia dla każdego modułu. Pełna lista użytych narzędzi znajduje się w Tabeli uzupełniającej 1. Nazwy narzędzi zostały pogrubione. Dla odniesienia wszystkie nazwy narzędzi, wersje i opisy zostały zawarte w Tabeli Materiałów. Jeśli użytkownik uruchamia przykładowe przepływy pracy z Tabeli uzupełniającej 2, należy odnieść się do przykładowych nazw plików zawartych w nawiasach na końcu każdego kroku. Jeśli użytkownik uruchamia narzędzia niezależnie, przykładowe nazwy plików można zignorować. Aby zmienić nazwę zestawu danych, kliknij ikonę ołówka w prawym górnym rogu zestawu danych. W polu „Name” wpisz nową nazwę i kliknij Save.
3. Moduł 1: Generowanie bazy danych sekwencji białkowych
UWAGA: Jeśli użytkownik chce skorzystać z przykładowych danych wejściowych i przepływu pracy z Supplementary Table 2, należy ściśle przestrzegać instrukcji w sekcji 2. W przypadku Modułu 1 należy zaimportować dane wejściowe i przepływ pracy dla GENEROWANIA BAZY DANYCH (DATABASE GENERATION). Kolumna wyjściowa w Supplementary Table 2 zawiera przykłady ukończonych historii wyników do celów referencyjnych. Dla wszystkich modułów odpowiedni samouczek GTN znajduje się w Supplementary Table 3.
- Sporządź listę gatunków powiązanych z analizowaną chorobą lub schorzeniem i/lub miejscem pobrania próbek.
- Uzyskaj tę listę gatunków na podstawie przeglądu literatury. Alternatywnie, jeśli próbki zostały wcześniej przeanalizowane, uzyskaj listę gatunków z sekwencjonowania 16S rRNA lub metagenomiki.
- Zapisz tę listę gatunków jako plik tabularny (np. Species.tabular).
UWAGA: Na podstawie listy gatunków zostanie wygenerowana obszerna, kompleksowa baza danych sekwencji białkowych znanych mikroorganizmów chorobotwórczych, a następnie, przy użyciu MetaNovo, ta duża baza zawierająca miliony sekwencji białkowych zostanie zredukowana do bardziej zarządzalnej bazy zawierającej białka obecne w próbkach. Krok redukcji bazy danych jest kluczowy, ponieważ wiele narzędzi do przeszukiwania baz danych nie radzi sobie z milionami sekwencji. Zredukowana baza zostanie połączona z białkami ludzkimi i białkami zanieczyszczającymi w celu stworzenia kompaktowej bazy danych, która zostanie wykorzystana do identyfikacji peptydów w następnym module (sekcja 4).
- Użyj listy gatunków (Species.tabular) jako danych wejściowych dla UniProt (pobierz proteom jako fasta), aby wygenerować bazę danych sekwencji białkowych (Species UniProt FASTA.fasta).
- Uruchom Protein Database Downloader , aby wygenerować dwie kolejne bazy danych sekwencji białkowych: ludzkie SwissProt (tylko zweryfikowane) oraz białka zanieczyszczające (Human SwissProt Protein Database.fasta, Contaminants [cRAP] Protein Database.fasta). Białka zanieczyszczające określa się również jako common Repository of Adventitious Proteins, czyli cRAP.
- Wykorzystaj trzy bazy białek jako dane wejściowe dla narzędzia FASTA Merge Files and Filter Unique Sequences, aby usunąć duplikaty i wygenerować obszerną bazę danych sekwencji białkowych (Human UniProt Microbial Proteins cRAP for MetaNovo.fasta).
- Użyj dużej (kompleksowej) bazy danych (z kroku 3.4) oraz zestawów danych MS (MGF) jako danych wejściowych dla MetaNovo33, aby wygenerować zredukowaną bazę danych (MetaNovo Compact Database.fasta).
- Uruchom FASTA Merge Files and Filter Unique Sequences dla bazy wygenerowanej przez MetaNovo, bazy Human SwissProt (tylko zweryfikowane) oraz bazy cRAP, aby stworzyć zredukowaną (docelową) bazę danych sekwencji białkowych drobnoustrojów, białek ludzkich i zanieczyszczeń, która posłuży do wykrywania peptydów (Human UniProt Microbial Proteins [from MetaNovo] and cRAP.fasta).
4. Moduł 2: Identyfikacja peptydów poprzez przeszukiwanie baz danych
UWAGA: Jeśli użytkownik chce skorzystać z przykładowych danych wejściowych i schematu przepływu pracy z Tabeli uzupełniającej 2, należy ściśle przestrzegać instrukcji zawartych w sekcji 2. W przypadku Modułu 2 należy zaimportować dane wejściowe i schemat przepływu pracy dla DISCOVERY. Dla wszystkich modułów odpowiednie samouczki GTN znajdują się w Tabeli uzupełniającej 3. SearchGUI34,35,36 oraz PeptideShaker37 to oddzielne oprogramowania, lecz będą one traktowane jako jeden program do identyfikacji i przetwarzania peptydów, ponieważ są używane wspólnie. W celu zapewnienia kompatybilności oprogramowania, zestawy danych MS/MS zostaną przekonwertowane z formatu RAW do MGF dla SearchGUI/PeptideShaker przy użyciu narzędzia msconvert (zawartego w dostarczonym schemacie przepływu pracy). MaxQuant38 może przetwarzać pliki RAW.
- Uruchom FastaCLI aby dodać sekwencje białek pułapek do zredukowanej bazy danych (docelowej) w celu wygenerowania bazy danych sekwencji białek target-decoy (FastaCLI MetaNovo Human SwissProt cRAP with decoys.fasta).
UWAGA: FastCLI będzie wymagany wyłącznie w przypadku SearchGUI/PeptideShaker. Program MaxQuant może dodawać sekwencje pozorowane (decoys) oraz zanieczyszczenia do bazy danych sekwencji białkowych. W tym przypadku zredukowana baza danych zawiera już zanieczyszczenia (cRAP), dlatego MaxQuant został skonfigurowany tak, aby dodawać wyłącznie sekwencje pozorowane.
- Uruchom SearchGUI/PeptideShaker i MaxQuant w celu przeszukania zbiorów danych MS w zredukowanej bazie danych w celu identyfikacji peptydów i ostatecznego przypisania ich do sekwencji białek za pomocą przeszukiwania bazy danych sekwencji. Patrz Tabela uzupełniająca 4 dla parametrów narzędzia.
UWAGA: W niniejszym etapie zostaną wykorzystane dwa programy do identyfikacji peptydów (SearchGUI/PeptideShaker oraz MaxQuant) w celu określenia sekwencji peptydów i białek poprzez przeszukiwanie baz danych sekwencji. Programy te identyfikują peptydy w widmach MS/MS i przeszukują bazę danych sekwencji białkowych, dopasowując zaobserwowane dane peptydowe do teoretycznych, w tym masy peptydów oraz widma. W następnym module zidentyfikowane peptydy zostaną zweryfikowane za pomocą PepQuery2 w celu potwierdzenia otrzymania peptydów mikrobiologicznych (sekcja 5).
- Uruchom SearchGUI aby wygenerować plik archiwalny zawierający PSM (Search GUI w danych [#].searchgui_archive).
- Użyj pliku archiwalnego SearchGUI jako danych wejściowych dla PeptideShaker aby wygenerować raport PSM, raport peptydowy oraz raport białkowy (Peptide Shaker na danych [#]: [nazwa raportu].tabular).
- Uruchom MaxQuant w celu wygenerowania plików grup białek i peptydów (MaxQuant Protein Groups.tabular, MaxQuant Peptides.tabular).
UWAGA: Program MaxQuant wymaga pliku projektu eksperymentalnego, który zawiera warunki eksperymentalne, grupy próbek oraz relacje między próbkami (Experimental Design Discovery MaxQuant.tabular). Plik ten informuje program MaxQuant, w jaki sposób należy zorganizować i przeanalizować dane MS. Przykład został udostępniony w Tabela uzupełniająca 5W przypadku korzystania z własnych danych, użytkownicy muszą zmodyfikować ten plik, aby był on zgodny z ich zestawami danych MS.
- Użyj narzędzi do manipulacji tekstem w celu zarządzania wynikami z obu programów. Wyświetl schemat pracy DISCOVERY w Tabela uzupełniająca 2 aby sprawdzić, które narzędzia są odpowiednie dla SearchGUI/PeptideShaker oraz MaxQuant.
UWAGA: Następujące narzędzia do manipulacji tekstem są zaimplementowane w systemie Galaxy. Poniżej wyróżniono kluczowe narzędzia, dlatego użytkownikom zaleca się zapoznanie z przepływem pracy (Workflow) DISCOVERY, aby zobaczyć dodatkowe narzędzia, które nie zostały tutaj omówione. Instrukcje dotyczące wyświetlania przepływu pracy znajdują się w sekcji 2.
- Wybierz dopasowania mikrobiologiczne (Select microbial PSMs.tabular z SGPS, Select microbial peptides (MQ).tabular).
- Zastosowanie Filtr i Zapytanie tabelaryczne39 aby wybrać wiarygodne PSM i wyszukać odpowiadające im numery akcesyjne białek (Filter confident microbial PSMs.tabular, query results on data [# and #].tabular).
- Zastosowanie Odciąć aby wyodrębnić sekwencje peptydowe jako nowy zestaw danych (Cut on data [#].tabular).
- Zastosowanie Grupa aby uzyskać unikalne wpisy (np. unikalne sekwencje peptydów) dla każdego programu (MQ Peptides.tabular, SGPS Distinct Peptides.tabular).
- Łączyć dwie listy peptydów w jeden zestaw danych (SGPS-MQ Peptides.tabular).
- Grupa w celu usunięcia duplikujących się sekwencji peptydowych. Końcowa lista unikalnych peptydów mikrobiologicznych zostanie wykorzystana do weryfikacji w programie PepQuery2 (Distinct Peptides.tabular).
5. Moduł 3: Weryfikacja peptydów mikrobiologicznych
UWAGA: Jeśli użytkownik chce skorzystać z przykładowych danych wejściowych i przepływu pracy z Tabeli uzupełniającej 2, należy ściśle przestrzegać instrukcji zawartych w sekcji 2. W przypadku modułu 2 należy zaimportować dane wejściowe i przepływ pracy do weryfikacji (VERIFICATION). Dla wszystkich modułów odpowiedni samouczek GTN znajduje się w Tabeli uzupełniającej 3.
- Użyj następujących plików jako danych wejściowych dla PepQuery240,41: listy unikalnych peptydów mikrobiologicznych (Distinct Peptides for PepQuery.tabular); zestawów danych widm MS (MGF); ludzkiego referencyjnego bazy UniProt (wraz z izoformami) (Human UniProt+Isoforms FASTA.fasta) oraz baz danych sekwencji białek cRAP (cRAP.fasta). Parametry znajdują się w Uzupełniającej Tabeli 6.
UWAGA: Weryfikacja obecności peptydów i białek jest kluczowa dla uzyskania dokładnych danych i istotnych informacji na temat proteomu systemu biologicznego. PepQuery2 umożliwia walidację nowych, specyficznych dla choroby peptydów z wysoką czułością i swoistością. Zidentyfikowane peptydy mikrobiologiczne (z modułu 2) zostaną przeszukane w zestawieniu z ludzkimi sekwencjami białek oraz sekwencjami zanieczyszczeń, aby potwierdzić ich pochodzenie mikrobiologiczne (unikając błędnego przypisania peptydów ludzkich). Zweryfikowane peptydy zostaną wykorzystane do stworzenia bazy sekwencji zweryfikowanych białek, co jest niezbędne w celu ograniczenia liczby wyników fałszywie dodatnich podczas kwantyfikacji białek w następnym module (sekcja 6).
- Dla każdego zestawu danych MS/MS użytego jako wejście zostanie wygenerowany jeden plik rankingu PSM (PepQuery2 on collection [#]: psm_rank.tabular). Uruchom funkcję Collapse Collection na plikach rankingu PSM, aby utworzyć jeden połączony zestaw danych (Collapse Collection on data [#] .tabular), a następnie funkcję Filter, aby zachować wiarygodne PSM (Filter on [PSM rank collection].tabular).
- Uruchom funkcję Remove beginning, aby wykluczyć nagłówki kolumn, oraz funkcję Cut, aby wyodrębnić zweryfikowane sekwencje peptydowe jako nowy zestaw danych.
- Uruchom funkcję Cut na raportach peptydowych z programów SearchGUI/PeptideShaker i MaxQuant (SGPS Peptide Report.tabular, MaxQuant Peptide Report.tabular), aby wyodrębnić sekwencje peptydowe i wpisy białek jako nowy zestaw danych peptyd-białko (dla każdego programu), oraz funkcję Remove beginning, aby wykluczyć nagłówki kolumn.
- Concatenate sekwencje peptydowe i wpisy białek z obu programów, aby utworzyć nowy (połączony) zestaw danych peptyd-białko.
- Uruchom funkcję Query Tabular na połączonym zestawie danych peptyd-białko oraz na zweryfikowanych peptydach, aby przypisać zweryfikowane peptydy do powiązanych z nimi wpisów białek (Peptide and Protein from Peptide Reports.tabular). Wpisy białek są katalogowane według ich numerów dostępowych (znanych również jako identyfikatory UniProt ID).
- Użyj funkcji Group, aby zachować unikalne zweryfikowane peptydy i powiązane z nimi identyfikatory UniProt ID.
- Uruchom funkcję Query Tabular, aby wyodrębnić identyfikatory UniProt ID (UniProt-ID from verified Peptides.tabular).
- Wprowadź identyfikatory UniProt ID do narzędzia UniProt, aby uzyskać powiązane z nimi sekwencje białek w formie nowej bazy danych (UniProt.fasta).
- Uruchom funkcję FASTA Merge Files and Filter Unique Sequences na wygenerowanej przez UniProt bazie sekwencji białek, ludzkiej bazie UniProt (wraz z izoformami) oraz bazach zanieczyszczeń, aby utworzyć zweryfikowaną bazę danych, która zostanie użyta do kwantyfikacji peptydów (Quantitation Database for MaxQuant.fasta).
6. Moduł 4: Ilościowe oznaczanie w programie MaxQuant
UWAGA: Jeśli użytkownik chce skorzystać z przykładowych danych wejściowych i przepływu pracy z Tabeli uzupełniającej 2, należy ściśle przestrzegać instrukcji zawartych w sekcji 2. W przypadku modułu 2 należy zaimportować dane wejściowe i przepływ pracy dla QUANTIFICATION. Dla wszystkich modułów odpowiedni samouczek GTN znajduje się w Tabeli uzupełniającej 3.
- Wykorzystaj zweryfikowaną bazę sekwencji białek oraz zestawy danych MS (RAW) jako dane wejściowe dla programu MaxQuant42.
UWAGA: Pamiętaj, że MaxQuant wymaga pliku projektu eksperymentalnego, który może być tym samym plikiem, który został użyty do identyfikacji peptydów (krok 4.2). W razie potrzeby zmień nazwy plików. Zweryfikowana baza danych z poprzedniego modułu jest niezbędna do ograniczenia liczby wyników fałszywie dodatnich podczas kwantyfikacji białek. Kwantyfikacja białek umożliwia badaczom pomiar i porównanie zawartości peptydów i białek w próbkach biologicznych. Krok ten jest niezbędny do zrozumienia różnicowej ekspresji białek poprzez uzyskanie wglądu w zmiany ilościowe w różnych warunkach.
- Wygeneruj pliki Evidence, Protein Groups i Peptides (MaxQuant Evidence.tabular, MaxQuant Protein Groups.tabular, MaxQuant Peptides.tabular).
- Wybierz peptydy mikrobiologiczne z pliku MaxQuant Peptides (Select microbial peptides.tabular).
- Wytnij wyłącznie sekwencje peptydów mikrobiologicznych (Cut on data [#].tabular).
- Pogrupuj dane, aby uzyskać listę skwantyfikowanych peptydów mikrobiologicznych (Quantified Peptides.tabular).
7. Moduł 5: Interpretacja danych
UWAGA: Jeśli użytkownik chce skorzystać z przykładowych danych wejściowych i schematu przepływu z Supplementary Table 2, należy postępować zgodnie z instrukcjami w sekcji 2. W przypadku modułu 2 należy zaimportować dane wejściowe i schemat przepływu dla INTERPRETACJI DANYCH. Odnośne samouczki GTN dla wszystkich modułów znajdują się w Supplementary Table 3. Wyniki kwantyfikacji z programu MaxQuant z poprzedniego modułu zostaną tutaj wykorzystane do adnotacji taksonomicznych i funkcjonalnych przy użyciu Unipept oraz do analizy statystycznej przy użyciu MSstatsTMT. Unipept umożliwia badaczom identyfikację i kwantyfikację mikroorganizmów w zróżnicowanych środowiskach i integruje się z publicznymi bazami danych (takimi jak UniProt) w celu pobrania aktualnych adnotacji. Program MSstatsTMT został zaprojektowany do rzetelnej analizy statystycznej danych proteomiki ilościowej opartych na spektrometrii mas z wykorzystaniem znakowania TMT.
- Użyj listy ilościowo określonych peptydów mikrobiologicznych (Quantified Peptides.tabular) jako danych wejściowych do Unipept43,44,45 w celu przeprowadzenia adnotacji taksonomicznych i funkcjonalnych. Patrz Tabela uzupełniająca 7 dla parametrów oraz listy wyników.
- Interesującymi wynikami z programu Unipept są w tym przypadku drzewo taksonomii drobnoustrojów oraz drzewo białek enzymów (EC) drobnoustrojów (Microbial Taxonomy Tree.d3_hierarchy, Microbial EC Proteins Tree.d3_hierarchy).
- Aby wyświetlić drzewa, kliknij zestaw danych, aby otworzyć opcje. Kliknij Wizualizacja (4th opcja od lewej) > Przeglądarka taksonomiczna Unipept.
- Aby wyświetlić adnotacje taksonomiczne i funkcjonalne w tabeli (Unipept peptinfo.tabular): kliknij w ikona oka w prawym górnym rogu zestawu danych. Przewiń, aby wyświetlić każdy peptyd w osobnym wierszu oraz informacje w różnych kolumnach.
- Przed przeprowadzeniem analizy statystycznej przy użyciu MSstatsTMT należy uruchomić Wybierz plik grup białek z programu MaxQuant w celu utworzenia dwóch nowych zbiorów danych: białek mikrobiologicznych i ludzkich (Microbial Proteins.tabular, Human Proteins.tabular). Białka posiadają tagi taksonomiczne określające ich pochodzenie.
- Wyeliminuj białka zanieczyszczające z tagiem "Przesuń suwak w prawo, aby zwiększyć natężenie światła, lub w lewo, aby je zmniejszyć.."
- Zachowaj białka mikrobiologiczne i ludzkie, które są oznaczone jako mikrobiologiczne (np. "9LACO") i "CZŁOWIEK" tagi, odpowiednio (Microbial-Proteins.tabular, Human-Proteins.tabular).
- MSstatsTMT42,46,47 zostaną wykorzystane do przeprowadzenia analizy statystycznej. Jako dane wejściowe należy zastosować plik Evidence z programu MaxQuant (z modułu 4) oraz wybrane białka mikrobiologiczne (lub białka ludzkie) z poprzedniego kroku. Ten schemat analizy priorytetyzuje białka mikrobiologiczne, ale oferuje również możliwość charakterystyki białek ludzkich. Patrz Tabela uzupełniająca 8 dla parametrów i listy wyników.
UWAGA: MSstatsTMT wymaga pliku adnotacji oraz macierzy porównań (znanej również jako macierz kontrastów). Plik adnotacji określi sposób łączenia wyników kwantyfikacji, natomiast macierz porównań uwzględni różne grupy próbek. Przykłady tych plików (Annotation.tabular, Comparison Matrix.tabular) zostały dołączone do Tabela uzupełniająca 9 i Tabela uzupełniająca 10.
- Interesującymi wynikami z programu MSstatsTMT są w tym przypadku wykresy wulkaniczne oraz wykresy porównawcze dla białek mikrobiologicznych (Microbial Proteins Volcano Plot.pdf, Microbial Proteins Comparison.pdf). Wykresy można wyświetlić, klikając w ikona oka w prawym górnym rogu zbioru danych.