Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł metodologiczny

Przepływ pracy metaproteomiki klinicznej wdrożony w ramach platformy bioinformatycznej Galaxy w celu analizy interakcji gospodarz-mikrobiom leżących u podstaw chorób człowieka

1.6K wyświetleń

DOI:

10.3791/67581

10 stycznia 2025

W tym artykule

Podsumowanie

Metaproteomika kliniczna oferuje wgląd w ludzki mikrobiom i jego wpływ na choroby. Wykorzystaliśmy moc obliczeniową platformy Galaxy do opracowania modułowego przepływu pracy bioinformatycznego, który ułatwia złożoną analizę metaproteomiczną opartą na spektrometrii mas i charakteryzację różnych typów próbek klinicznych istotnych dla badań nad chorobami.

Streszczenie

Metaproteomika kliniczna ujawnia interakcje gospodarz-mikrobiom leżące u podstaw chorób. Istnieją jednak wyzwania związane z tym podejściem. W szczególności trudna jest charakterystyka białek drobnoustrojów występujących w małej liczebności w stosunku do białek gospodarza. Inne istotne wyzwania wiążą się z wykorzystaniem bardzo dużych baz danych sekwencji białek, co utrudnia czułość i dokładność podczas identyfikacji peptydów i białek na podstawie danych ze spektrometrii mas, a także z pobieraniem taksonomii i adnotacji funkcjonalnych oraz przeprowadzaniem analiz statystycznych. Aby rozwiązać te problemy, przedstawiamy zintegrowany bioinformatyczny przepływ pracy dla metaproteomiki opartej na spektrometrii mas, który łączy generowanie niestandardowych baz danych sekwencji białek, generowanie i weryfikację dopasowania widma peptydów, kwantyfikację, adnotacje taksonomiczne i funkcjonalne oraz analizę statystyczną. Ten przepływ pracy oferuje również charakterystykę białek ludzkich (przy jednoczesnym priorytetowym traktowaniu białek mikrobiologicznych), oferując w ten sposób wgląd w dynamikę gospodarz-mikroorganizm w chorobie. Narzędzia i przepływ pracy są wdrażane w ekosystemie Galaxy, umożliwiając rozwój, optymalizację i rozpowszechnianie tych zasobów obliczeniowych. Zastosowaliśmy ten przepływ pracy do analizy metaproteomicznej wielu typów próbek klinicznych, takich jak wymazy z nosogardzieli i płyn z płukania oskrzelowo-pęcherzykowego. Tutaj pokazujemy jego użyteczność poprzez analizę pozostałości płynu z wymazów z szyjki macicy. Kompletny przepływ pracy i towarzyszące mu zasoby szkoleniowe są dostępne w Galaxy Training Network, aby wyposażyć zarówno amatorów, jak i doświadczonych badaczy w niezbędną wiedzę i narzędzia do analizy ich danych.

Wprowadzenie

Metaproteomika oparta na spektrometrii mas (MS) identyfikuje i określa ilościowo białka mikrobiologiczne i ludzkie z próbek klinicznych. Podejście to pozwala lepiej zrozumieć reakcje mikrobiomu na chorobę i odkrywa potencjalne mediatory interakcji gospodarz-mikrobiom1,2. Chociaż analiza metaproteomiczna próbek klinicznych może odkryć interakcje mikrobiomu ze środowiskiem gospodarza, dziedzina ta nadal stoi przed wieloma wyzwaniami. Jednym z głównych wyzwań jest stosunkowo duża obfitość białek gospodarza (ludzkiego), co utrudnia identyfikację mniej obfitych białek drobnoustrojów. Co więcej, metaproteomika oparta na stwardnieniu rozsianym zależy od wykorzystania bardzo dużych baz danych sekwencji białek. Te bazy danych zawierają proteomy drobnoustrojów, które są obecne w próbce, co może skutkować dużą bazą danych zawierającą miliony sekwencji. Po wygenerowaniu widm tandemowej spektrometrii mas (MS/MS) z białek trawionych tryptycznie, widma MS/MS są przeszukiwane w dużych bazach danych sekwencji białek, dopasowując sekwencję peptydową do każdego widma (dopasowanie widma peptydowego lub PSM). Jednak czułość maleje, a ryzyko wyników fałszywie dodatnich wzrasta wraz z dużymi bazami danych używanymi do metaproteomiki3. Ponadto konserwatywne sekwencje białek w taksonach i niewystarczająca adnotacja kodowanych białek ograniczają adnotacje taksonomiczne i funkcjonalne dla wykrytych peptydów i białek4,5. Przedstawiamy bioinformatyczny przepływ pracy do skutecznej analizy metaproteomicznej próbek klinicznych, który rozwiązuje wiele z tych wyzwań i zapewnia dostępne zasoby oprogramowania dla naukowców do badania dynamiki mikrobiomu gospodarza leżącej u podstaw chorób ludzkich.

Kliniczna metaproteomika została wykorzystana do zbadania różnych typów próbek, w tym kału i wymazów z pochwy, między innymi, w celu rozszyfrowania mechanizmów patogennych w chorobach i warunkach6,7,8,9,10,11,12,13,14,15,16,17,18,19,20. W tym miejscu używamy metaproteomicznego przepływu pracy bioinformatycznego do analizy podzbioru danych MS/MS z próbek płynu testowego Pap (PTF) od pacjentów z rakiem jajnika (OVCA) i pacjentek bez OVCA21. Narzędzia programowe i przepływ pracy są dostępne za pośrednictwem platformy Galaxy, która usprawnia opracowywanie i wykonywanie złożonych klinicznych przepływów pracy metaproteomicznej22,23,24,25. Galaxy to platforma typu open source, która została zaprojektowana dla bioinformatyki i biologii obliczeniowej. Zapewnia środowisko internetowe do korzystania z narzędzi i przepływów pracy typu open source, w którym badacze akademiccy mogą wykonywać i udostępniać złożone analizy danych. Kwitnąca globalna społeczność programistów, analityków danych i użytkowników końcowych utrzymuje ekosystem Galaxy, w tym Galaxy Training Network (GTN; https://training.galaxyproject.org/), który oferuje zasoby szkoleniowe online i na żądanie22,23,24,25,26,27. Nasz przepływ pracy ma na celu ujawnienie nowego zrozumienia dynamiki gospodarz-mikroorganizm w próbkach klinicznych, a także wygenerowanie nowych, dobrze scharakteryzowanych celów peptydowych będących przedmiotem zainteresowania w celu opracowania ukierunkowanych testów klinicznych opartych na stwardnieniu rozsianym do dalszych badań próbek klinicznych6,20,28. Ponadto manuskrypt ten ma na celu zwrócenie uwagi na metodologię przepływu pracy w metaproteomice klinicznej. Bardziej szczegółowe i przyjazne dla początkujących przewodniki znajdują się w GTN (https://training.galaxyproject.org/), ponieważ jest to cenne źródło informacji, z którego można korzystać równolegle z tym manuskryptem dla użytkowników poszukujących dodatkowych wyjaśnień, które nie zostały omówione. Społeczność Galaxy jest autorem licznych manuskryptów, które mają pomóc początkującym użytkownikom platformy Galaxy20,21,22,23,24,25,26,27.

Wszystkie dodatkowe tabele (np. parametry narzędzi) i rysunki (np. przykładowe wykresy) dla tego manuskryptu zostały dostarczone jako osobne pliki i są odpowiednio przywoływane. W tym manuskrypcie użyto aktualnych wersji narzędzi w Galaxy w wersji 2.3.0. Dlatego wyniki mogą się nieznacznie różnić w zależności od aktualizacji Galaxy i wersji narzędzi. Platforma Galaxy i jej narzędzia są open-source i mogą być wykorzystywane do celów badań akademickich.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Dane spektralne MS/MS uzyskano z zanonimizowanych pozostałości próbek PTF, które zostały pobrane zgodnie z procedurami opartymi na wytycznych i przepisach zatwierdzonych przez komisję instytucjonalną, jak opisano wcześniej21,29,30.

UWAGA: Rycina 1 przedstawia ogólny schemat całego procesu roboczego, który składa się z pięciu modułów. Wszystkie dane wejściowe, wyjściowe oraz narzędzia programistyczne zostały podsumowane w Tabeli uzupełniającej 1.

figure-protocol-1
Rysunek 1: Podsumowanie modułów przepływu pracy w klinicznej metaproteomice w środowisku Galaxy. Pełny przepływ pracy w klinicznej metaproteomice składa się z pięciu modułów: generowania bazy danych, odkrywania, weryfikacji, kwantyfikacji i interpretacji danych. (A) Duża, kompleksowa baza danych zawiera sekwencje białek gatunków drobnoustrojów, które prawdopodobnie występują w próbce, białka ludzkie oraz powszechne zanieczyszczenia. Narzędzie programowe MetaNovo bezpośrednio dopasowuje dane spektralne MS/MS do peptydów i wnioskuje o białkach oraz ich organizmach źródłowych na podstawie surowych danych MS i dużej wejściowej bazy sekwencji białek, tworząc zredukowaną bazę danych33. Zredukowana baza danych z MetaNovo jest następnie łączona z białkami ludzkimi i zanieczyszczeniami w celu utworzenia bazy danych do odkrywania peptydów. (B) Dwa algorytmy identyfikacji peptydów, SearchGUI/PeptideShaker oraz MaxQuant, dopasowują sekwencje peptydowe do widm MS/MS i docelowej bazy białek typu target-decoy49. (C) Peptydy zidentyfikowane przez SearchGUI/PeptideShaker i MaxQuant są następnie weryfikowane za pomocą PepQuery2. PepQuery2 rygorystycznie ponownie analizuje domniemane zidentyfikowane sekwencje peptydów drobnoustrojowych i ich dopasowane widma MS/MS w odniesieniu do innych potencjalnych dopasowań do proteomu gospodarza ludzkiego i/lub zanieczyszczeń, weryfikując w ten sposób wysokowiarygodne dopasowania drobnoustrojowe40,41. Zweryfikowane peptydy służą do wygenerowania zweryfikowanej bazy danych sekwencji białek, która zostanie wykorzystana do kwantyfikacji peptydów i białek. (D) Program MaxQuant42 przeszukuje dane MS/MS pod kątem zweryfikowanych sekwencji białek i kwantyfikuje peptydy drobnoustrojowe oraz wnioskowane białka wraz z białkami ludzkimi. (E) Unipept45 oraz MSstatsTMT46 są wykorzystywane w końcowym kroku do adnotowania białek pod kątem taksonomii i informacji funkcjonalnych (numery dostępowe Enzyme Commission), a także do generowania wykresów wulkanicznych i porównawczych. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

1. Znakowanie TMT i generowanie widm MS/MS

  1. W celu przygotowania do analizy MS należy pobrać próbki kliniczne zgodnie z wytycznymi i przepisami.
    UWAGA: Ponieważ niniejszy protokół kładzie nacisk na przepływ pracy bioinformatycznej, procedury pobierania próbek klinicznych mogą różnić się od tych zastosowanych w niniejszej publikacji. W tym przypadku białka poddano trawieniu trypsyną do mieszaniny peptydów, a następnie oznakowano, frakcjonowano i analizowano za pomocą spektrometrii mas w celu wygenerowania danych spektralnych MS/MS do dalszej analizy z wykorzystaniem platformy Galaxy. Szczegółowe instrukcje dotyczące przetwarzania próbek zostały wcześniej opisane przez Boylan i wsp.29 oraz Afiuni-Zadel i wsp.30.
  2. Wyizolować białka z próbek klinicznych i strawić je do peptydów przy użyciu trypsyny29,30.
  3. Oznakować białka odczynnikiem Tandem Mass Tag (TMT)-11-plex. Odczynnik ten pomoże w kwantyfikacji peptydów i białek31,32.
    1. Podzielić oznakowane próbki losowo i równomiernie na cztery eksperymentalne grupy oparte na TMT.
    2. Do każdej grupy eksperymentalnej należy dołączyć jedną wspólną próbkę referencyjną, oznakowaną unikalnym tagiem TMT, która będzie służyć jako wspólny punkt odniesienia do porównania z każdą indywidualną próbką we wszystkich czterech grupach eksperymentalnych31,32.
  4. Przeprowadzić frakcjonowanie offline połączonych próbek za pomocą wysokopH-owej odwróconej chromatografii cieczowej (RPLC)29,30.
  5. Przeanalizować frakcje za pomocą tandemowej chromatografii cieczowej i spektrometrii mas (LC-MS/MS) z wykorzystaniem hybrydowego spektrometru mas quadrupole-Orbitrap29,30. Wygenerowane dane spektralne MS/MS zapisać w formacie Thermo Raw (thermo.raw).
    UWAGA: W razie potrzeby pliki Thermo Raw są konwertowane do formatu Mascot Generic Format (.mgf), aby były kompatybilne z różnym oprogramowaniem. W niniejszym tekście skróty "RAW" i "MGF" oznaczają format plików wejściowych zestawów danych MS/MS. Na rysunkach zestawy danych MS/MS są reprezentowane przez te same ikony RAW dla uproszczenia.

2. Konfiguracja modułu

UWAGA: Wybory przycisków/menu są pogrubione. Przykładowe pliki, przepływy pracy i parametry narzędzi są dostępne w tabelach uzupełniających. Więcej informacji na temat korzystania z Galaxy można znaleźć na stronie FAQ GTN (https://training.galaxyproject.org/training-material/faqs/galaxy/).

  1. Serwer Galaxy Europe
    1. Uzyskaj dostęp do serwera Galaxy Europe (Galaxy EU; https://usegalaxy.eu/).
    2. Utwórz konto lub zaloguj się. Do utworzenia nowego konta wymagany jest ważny adres e-mail. Aby korzystać z Galaxy, zaloguj się jako użytkownik.
  2. Przygotowanie historii w Galaxy
    1. Jeśli użytkownik importuje przykładowe dane wejściowe z Tabeli uzupełniającej 2, należy wykonać kroki 2.2.1.1-2.2.1.3.
      1. Otwórz przykładowe historie Galaxy, korzystając z linków podanych w Tabeli uzupełniającej 2.
      2. Kliknij szary przycisk Import this history znajdujący się w lewym górnym rogu panelu (środkowego). Zmień nazwę historii i kliknij Copy History. Jeśli chcesz, dodaj własne zestawy danych do tej historii, klikając przycisk Upload w panelu po lewej stronie i dodając pliki do przesłania.
      3. Kliknij Start > Close. Przesłane pliki pojawią się w panelu historii po prawej stronie. Przed użyciem poczekaj, aż kolor zestawu (zestawów) danych zmieni się na zielony.
        UWAGA: W przypadku importowania (kopiowania) istniejącej historii nie należy tworzyć oddzielnej (nowej) historii.
    2. Jeśli użytkownik tworzy nową historię i przesyła własne dane, należy wykonać kroki 2.2.2.1.-2.2.2.2.
      1. W panelu Historii (prawa strona) kliknij raz ikonę + (plus), aby utworzyć nową historię o nazwie „Unnamed History”. Kliknij ikonę ołówka obok historii i kliknij Save. Te same kroki dodawania zestawów danych do istniejącej (przykładowej) historii mają zastosowanie do przesyłania własnych danych.
      2. W panelu po lewej stronie kliknij Upload i dodaj pliki do przesłania. Kliknij Start > Close. Przesłane pliki pojawią się w nowej historii. Poczekaj, aż kolor zestawu (zestawów) danych zmieni się na zielony.
    3. Jeśli użytkownik analizuje jednocześnie wiele plików MS/MS, należy wykonać kroki 2.2.3.1.-2.2.3.3.
      1. Umieść je w kolekcji zestawów danych, aby wybrać je jako jedno wejście. Kliknij ikonę znaku wyboru w panelu Historii i zaznacz odpowiednie zestawy danych.
      2. Kliknij przycisk wyświetlający liczbę wybranych zestawów danych (np. 4 of 8 selected), a w menu rozwijanym kliknij Build Dataset List. W oknie pop-up wpisz nazwę kolekcji (np. MGF Data, RAW Data). Jeśli chcesz, zaznacz opcję ukrycia oryginalnych zestawów danych po utworzeniu kolekcji.
      3. Kliknij niebieski przycisk Create Collection w prawym dolnym rogu okna pop-up. Kliknij ikonę znaku wyboru w panelu Historii, aby odznaczyć zestawy danych.
        UWAGA: Każdy z pięciu modułów powinien być uruchamiany we własnej (zaimportowanej lub nowej) historii Galaxy dla lepszej wygody użytkowania. Aby uniknąć powtórzeń, dalsze instrukcje dotyczące modułów pomijają konfigurację i skupiają się na krokach przepływu pracy.
  3. Importowanie i uruchamianie przepływu pracy (workflow)
    UWAGA: Wszystkim użytkownikom, niezależnie od tego, czy korzystają z danych przykładowych, czy własnych, zdecydowanie zaleca się korzystanie i/lub adaptowanie modularnych przepływów pracy z predefiniowanymi parametrami (Tabela uzupełniająca 2). Dzięki temu użytkownicy unikną konieczności wyszukiwania i ustawiania parametrów dla każdego narzędzia. Jeśli chcą, użytkownicy mogą wyszukiwać narzędzia, klikając przycisk Tools w panelu po lewej stronie i wpisując nazwę narzędzia (tak dokładnie, jak to możliwe) w pasku wyszukiwania w sąsiednim panelu. Pasujące narzędzia pojawią się automatycznie. Kliknij właściwy wynik wyszukiwania i ustaw odpowiednie parametry (patrz Plik uzupełniający 1). Przed uruchomieniem narzędzia użytkownicy mogą skonfigurować powiadomienia e-mail, aby otrzymać alert po zakończeniu zadania, wybierając odpowiedni przycisk pod koniec listy parametrów. Dla wygody dostępne są dwa przyciski Run: jeden w prawym górnym rogu panelu środkowego, a drugi po polach parametrów. Tabela uzupełniająca 3 zawiera dodatkowe zasoby szkoleniowe. Wersje narzędzi i bazy danych są aktualne i sprawne w momencie pisania (czerwiec 2024), ale mogą ulec zmianie w miarę aktualizacji Galaxy oraz powiązanych narzędzi i baz danych.
    1. Otwórz przepływ pracy w nowej karcie, korzystając z linków w Tabeli uzupełniającej 2.
      1. Kliknij przycisk Import w prawym górnym rogu panelu. Otworzy się nowa karta z zielonym polem potwierdzającym zaimportowanie przepływu pracy. Zielone pole zawiera również dwie opcje: start using this workflow right away lub return to the previous page.
      2. Kliknij pierwszy przycisk („start using this workflow...”), aby otworzyć kartę Workflow w panelu środkowym interfejsu, która wyświetla wszystkie zapisane przepływy pracy. Znajdź właśnie zaimportowany przepływ pracy i kliknij niebieski przycisk play (trójkąt). Spowoduje to wyświetlenie pól wejściowych.
        ​UWAGA: Dla każdego dostarczonego przepływu pracy pola wejściowe odpowiadają przykładowym danym wejściowym (Tabela uzupełniająca 2). Jeśli użytkownik analizuje własne dane, jego wejścia powinny być nazwane odpowiednio, aby zapewnić użycie poprawnych plików dla każdego modułu.
    2. Jeśli użytkownik chce przeglądać przepływy pracy na serwerze Galaxy EU, należy wykonać kroki 2.3.2.1-2.3.2.4.
      1. Kliknij przycisk Workflow na górnym pasku strony Galaxy. W tej karcie kliknij podkartę My workflows, aby wyświetlić wszystkie zaimportowane przepływy pracy. Aby wyświetlić przepływ pracy, kliknij przycisk Edit z ikoną ołówka, aby otworzyć Edytor Przepływów Pracy (Workflow Editor).
      2. W Edytorze Przepływów Pracy można wchodzić w interakcję z przepływem, np. poprzez klikanie i przeciąganie w celu reorganizacji, klikanie w narzędzia w celu ich wyświetlenia, zmianę parametrów itp. Po wprowadzeniu zmian zapisz edytowany przepływ pracy, klikając ikonę dyskietki na górze prawego panelu, a jeśli chcesz, uruchom przepływ pracy, klikając ikonę play (również na górze prawego panelu).
      3. Utwórz specyficzne dla użytkownika przepływy pracy do analizy niestandardowych danych wejściowych. W zależności od wiedzy użytkownika w zakresie metaproteomiki i doświadczenia z platformą Galaxy, zbuduj przepływ pracy, a następnie przeanalizuj dane.
      4. Jeśli użytkownik jest mniej doświadczony, może przetestować różne narzędzia w historii, a następnie wyekstrahować przepływ pracy z wykonanej analizy.
        UWAGA: Ten wyekstrahowany przepływ pracy można rozszerzać, poprawiać i używać ponownie, co pozwala użytkownikom na dokładne odtworzenie swojej pracy. Bardziej szczegółowe instrukcje znajdują się w sekcji FAQ GTN dotyczącej przepływów pracy (https://training.galaxyproject.org/training-material/faqs/galaxy/#workflows).
    3. Kliknij każde pole wejściowe i wybierz odpowiednie wejście. Sekcje od 3 do 7 opisują wejścia modułów. Sprawdź, czy wszystkie wejścia są w akceptowalnym formacie, aby uniknąć błędów. Kliknij accepted formats pod każdym polem wejściowym, aby sprawdzić, czy wszystkie pliki są kompatybilne z narzędziami. Po zakończeniu kliknij Run workflow.
      UWAGA: Jeśli użytkownik woli konfigurować narzędzia ręcznie, materiały instruktażowe dla każdego modułu tego klinicznego przepływu pracy metaproteomicznego są dostępne na stronie GTN (https://gxy.io/GTN:P00019). Szacowane czasy uruchamiania kluczowych narzędzi zostały zawarte w  Tabeli uzupełniającej 2, jednak czasy te zależą od rozmiaru danych wejściowych, zależności narzędzi (takich jak wymagania dotyczące pamięci w porównaniu do pamięci przydzielonej), planowanych przerw konserwacyjnych, błędów itp. Statusy zadań są wskazywane przez kolor zestawu danych; po wybraniu (kliknięciu) zestawu danych pojawi się komunikat informujący, czy zadanie oczekuje w kolejce (szary), jest w toku (pomarańczowy), czy zakończyło się błędem (czerwony). Po zakończeniu zadania zestaw danych zmieni kolor na zielony (brak komunikatu potwierdzającego). Użytkownicy mogą zapisać się na powiadomienia e-mail o zakończeniu zadań (patrz UWAGA na początku kroku 2.3). Poniższe instrukcje modułów pomijają jawne kroki konfiguracji, ponieważ są one takie same dla każdego modułu (w razie potrzeby patrz sekcja 2 i FAQ GTN) i opisują kluczowe narzędzia dla każdego modułu. Pełna lista użytych narzędzi znajduje się w Tabeli uzupełniającej 1. Nazwy narzędzi zostały pogrubione. Dla odniesienia wszystkie nazwy narzędzi, wersje i opisy zostały zawarte w Tabeli Materiałów. Jeśli użytkownik uruchamia przykładowe przepływy pracy z Tabeli uzupełniającej 2, należy odnieść się do przykładowych nazw plików zawartych w nawiasach na końcu każdego kroku. Jeśli użytkownik uruchamia narzędzia niezależnie, przykładowe nazwy plików można zignorować. Aby zmienić nazwę zestawu danych, kliknij ikonę ołówka w prawym górnym rogu zestawu danych. W polu „Name” wpisz nową nazwę i kliknij Save.

3. Moduł 1: Generowanie bazy danych sekwencji białkowych

UWAGA: Jeśli użytkownik chce skorzystać z przykładowych danych wejściowych i przepływu pracy z Supplementary Table 2, należy ściśle przestrzegać instrukcji w sekcji 2. W przypadku Modułu 1 należy zaimportować dane wejściowe i przepływ pracy dla GENEROWANIA BAZY DANYCH (DATABASE GENERATION). Kolumna wyjściowa w Supplementary Table 2 zawiera przykłady ukończonych historii wyników do celów referencyjnych. Dla wszystkich modułów odpowiedni samouczek GTN znajduje się w Supplementary Table 3.

  1. Sporządź listę gatunków powiązanych z analizowaną chorobą lub schorzeniem i/lub miejscem pobrania próbek.
    1. Uzyskaj tę listę gatunków na podstawie przeglądu literatury. Alternatywnie, jeśli próbki zostały wcześniej przeanalizowane, uzyskaj listę gatunków z sekwencjonowania 16S rRNA lub metagenomiki.
    2. Zapisz tę listę gatunków jako plik tabularny (np. Species.tabular).
      UWAGA: Na podstawie listy gatunków zostanie wygenerowana obszerna, kompleksowa baza danych sekwencji białkowych znanych mikroorganizmów chorobotwórczych, a następnie, przy użyciu MetaNovo, ta duża baza zawierająca miliony sekwencji białkowych zostanie zredukowana do bardziej zarządzalnej bazy zawierającej białka obecne w próbkach. Krok redukcji bazy danych jest kluczowy, ponieważ wiele narzędzi do przeszukiwania baz danych nie radzi sobie z milionami sekwencji. Zredukowana baza zostanie połączona z białkami ludzkimi i białkami zanieczyszczającymi w celu stworzenia kompaktowej bazy danych, która zostanie wykorzystana do identyfikacji peptydów w następnym module (sekcja 4).
  2. Użyj listy gatunków (Species.tabular) jako danych wejściowych dla UniProt (pobierz proteom jako fasta), aby wygenerować bazę danych sekwencji białkowych (Species UniProt FASTA.fasta).
  3. Uruchom Protein Database Downloader , aby wygenerować dwie kolejne bazy danych sekwencji białkowych: ludzkie SwissProt (tylko zweryfikowane) oraz białka zanieczyszczające (Human SwissProt Protein Database.fasta, Contaminants [cRAP] Protein Database.fasta). Białka zanieczyszczające określa się również jako common Repository of Adventitious Proteins, czyli cRAP.
  4. Wykorzystaj trzy bazy białek jako dane wejściowe dla narzędzia FASTA Merge Files and Filter Unique Sequences, aby usunąć duplikaty i wygenerować obszerną bazę danych sekwencji białkowych (Human UniProt Microbial Proteins cRAP for MetaNovo.fasta).
  5. Użyj dużej (kompleksowej) bazy danych (z kroku 3.4) oraz zestawów danych MS (MGF) jako danych wejściowych dla MetaNovo33, aby wygenerować zredukowaną bazę danych (MetaNovo Compact Database.fasta).
  6. Uruchom FASTA Merge Files and Filter Unique Sequences dla bazy wygenerowanej przez MetaNovo, bazy Human SwissProt (tylko zweryfikowane) oraz bazy cRAP, aby stworzyć zredukowaną (docelową) bazę danych sekwencji białkowych drobnoustrojów, białek ludzkich i zanieczyszczeń, która posłuży do wykrywania peptydów (Human UniProt Microbial Proteins [from MetaNovo] and cRAP.fasta).

4. Moduł 2: Identyfikacja peptydów poprzez przeszukiwanie baz danych

UWAGA: Jeśli użytkownik chce skorzystać z przykładowych danych wejściowych i schematu przepływu pracy z Tabeli uzupełniającej 2, należy ściśle przestrzegać instrukcji zawartych w sekcji 2. W przypadku Modułu 2 należy zaimportować dane wejściowe i schemat przepływu pracy dla DISCOVERY. Dla wszystkich modułów odpowiednie samouczki GTN znajdują się w Tabeli uzupełniającej 3. SearchGUI34,35,36 oraz PeptideShaker37 to oddzielne oprogramowania, lecz będą one traktowane jako jeden program do identyfikacji i przetwarzania peptydów, ponieważ są używane wspólnie. W celu zapewnienia kompatybilności oprogramowania, zestawy danych MS/MS zostaną przekonwertowane z formatu RAW do MGF dla SearchGUI/PeptideShaker przy użyciu narzędzia msconvert (zawartego w dostarczonym schemacie przepływu pracy). MaxQuant38 może przetwarzać pliki RAW.

  1. Uruchom FastaCLI aby dodać sekwencje białek pułapek do zredukowanej bazy danych (docelowej) w celu wygenerowania bazy danych sekwencji białek target-decoy (FastaCLI MetaNovo Human SwissProt cRAP with decoys.fasta).
    UWAGA: FastCLI będzie wymagany wyłącznie w przypadku SearchGUI/PeptideShaker. Program MaxQuant może dodawać sekwencje pozorowane (decoys) oraz zanieczyszczenia do bazy danych sekwencji białkowych. W tym przypadku zredukowana baza danych zawiera już zanieczyszczenia (cRAP), dlatego MaxQuant został skonfigurowany tak, aby dodawać wyłącznie sekwencje pozorowane.
  2. Uruchom SearchGUI/PeptideShaker i MaxQuant w celu przeszukania zbiorów danych MS w zredukowanej bazie danych w celu identyfikacji peptydów i ostatecznego przypisania ich do sekwencji białek za pomocą przeszukiwania bazy danych sekwencji. Patrz Tabela uzupełniająca 4 dla parametrów narzędzia.
    UWAGA: W niniejszym etapie zostaną wykorzystane dwa programy do identyfikacji peptydów (SearchGUI/PeptideShaker oraz MaxQuant) w celu określenia sekwencji peptydów i białek poprzez przeszukiwanie baz danych sekwencji. Programy te identyfikują peptydy w widmach MS/MS i przeszukują bazę danych sekwencji białkowych, dopasowując zaobserwowane dane peptydowe do teoretycznych, w tym masy peptydów oraz widma. W następnym module zidentyfikowane peptydy zostaną zweryfikowane za pomocą PepQuery2 w celu potwierdzenia otrzymania peptydów mikrobiologicznych (sekcja 5).
    1. Uruchom SearchGUI aby wygenerować plik archiwalny zawierający PSM (Search GUI w danych [#].searchgui_archive).
    2. Użyj pliku archiwalnego SearchGUI jako danych wejściowych dla PeptideShaker aby wygenerować raport PSM, raport peptydowy oraz raport białkowy (Peptide Shaker na danych [#]: [nazwa raportu].tabular).
    3. Uruchom MaxQuant w celu wygenerowania plików grup białek i peptydów (MaxQuant Protein Groups.tabular, MaxQuant Peptides.tabular).
      UWAGA: Program MaxQuant wymaga pliku projektu eksperymentalnego, który zawiera warunki eksperymentalne, grupy próbek oraz relacje między próbkami (Experimental Design Discovery MaxQuant.tabular). Plik ten informuje program MaxQuant, w jaki sposób należy zorganizować i przeanalizować dane MS. Przykład został udostępniony w Tabela uzupełniająca 5W przypadku korzystania z własnych danych, użytkownicy muszą zmodyfikować ten plik, aby był on zgodny z ich zestawami danych MS.
  3. Użyj narzędzi do manipulacji tekstem w celu zarządzania wynikami z obu programów. Wyświetl schemat pracy DISCOVERY w Tabela uzupełniająca 2 aby sprawdzić, które narzędzia są odpowiednie dla SearchGUI/PeptideShaker oraz MaxQuant.
    UWAGA: Następujące narzędzia do manipulacji tekstem są zaimplementowane w systemie Galaxy. Poniżej wyróżniono kluczowe narzędzia, dlatego użytkownikom zaleca się zapoznanie z przepływem pracy (Workflow) DISCOVERY, aby zobaczyć dodatkowe narzędzia, które nie zostały tutaj omówione. Instrukcje dotyczące wyświetlania przepływu pracy znajdują się w sekcji 2.
    1. Wybierz dopasowania mikrobiologiczne (Select microbial PSMs.tabular z SGPS, Select microbial peptides (MQ).tabular).
    2. Zastosowanie Filtr i Zapytanie tabelaryczne39 aby wybrać wiarygodne PSM i wyszukać odpowiadające im numery akcesyjne białek (Filter confident microbial PSMs.tabular, query results on data [# and #].tabular).
    3. Zastosowanie Odciąć aby wyodrębnić sekwencje peptydowe jako nowy zestaw danych (Cut on data [#].tabular).
    4. Zastosowanie Grupa aby uzyskać unikalne wpisy (np. unikalne sekwencje peptydów) dla każdego programu (MQ Peptides.tabular, SGPS Distinct Peptides.tabular).
  4. Łączyć dwie listy peptydów w jeden zestaw danych (SGPS-MQ Peptides.tabular).
  5. Grupa w celu usunięcia duplikujących się sekwencji peptydowych. Końcowa lista unikalnych peptydów mikrobiologicznych zostanie wykorzystana do weryfikacji w programie PepQuery2 (Distinct Peptides.tabular).

5. Moduł 3: Weryfikacja peptydów mikrobiologicznych

UWAGA: Jeśli użytkownik chce skorzystać z przykładowych danych wejściowych i przepływu pracy z Tabeli uzupełniającej 2, należy ściśle przestrzegać instrukcji zawartych w sekcji 2. W przypadku modułu 2 należy zaimportować dane wejściowe i przepływ pracy do weryfikacji (VERIFICATION). Dla wszystkich modułów odpowiedni samouczek GTN znajduje się w Tabeli uzupełniającej 3.

  1. Użyj następujących plików jako danych wejściowych dla PepQuery240,41: listy unikalnych peptydów mikrobiologicznych (Distinct Peptides for PepQuery.tabular); zestawów danych widm MS (MGF); ludzkiego referencyjnego bazy UniProt (wraz z izoformami) (Human UniProt+Isoforms FASTA.fasta) oraz baz danych sekwencji białek cRAP (cRAP.fasta). Parametry znajdują się w Uzupełniającej Tabeli 6.
    UWAGA: Weryfikacja obecności peptydów i białek jest kluczowa dla uzyskania dokładnych danych i istotnych informacji na temat proteomu systemu biologicznego. PepQuery2 umożliwia walidację nowych, specyficznych dla choroby peptydów z wysoką czułością i swoistością. Zidentyfikowane peptydy mikrobiologiczne (z modułu 2) zostaną przeszukane w zestawieniu z ludzkimi sekwencjami białek oraz sekwencjami zanieczyszczeń, aby potwierdzić ich pochodzenie mikrobiologiczne (unikając błędnego przypisania peptydów ludzkich). Zweryfikowane peptydy zostaną wykorzystane do stworzenia bazy sekwencji zweryfikowanych białek, co jest niezbędne w celu ograniczenia liczby wyników fałszywie dodatnich podczas kwantyfikacji białek w następnym module (sekcja 6).
    1. Dla każdego zestawu danych MS/MS użytego jako wejście zostanie wygenerowany jeden plik rankingu PSM (PepQuery2 on collection [#]: psm_rank.tabular). Uruchom funkcję Collapse Collection na plikach rankingu PSM, aby utworzyć jeden połączony zestaw danych (Collapse Collection on data [#] .tabular), a następnie funkcję Filter, aby zachować wiarygodne PSM (Filter on [PSM rank collection].tabular).
    2. Uruchom funkcję Remove beginning, aby wykluczyć nagłówki kolumn, oraz funkcję Cut, aby wyodrębnić zweryfikowane sekwencje peptydowe jako nowy zestaw danych.
  2. Uruchom funkcję Cut na raportach peptydowych z programów SearchGUI/PeptideShaker i MaxQuant (SGPS Peptide Report.tabular, MaxQuant Peptide Report.tabular), aby wyodrębnić sekwencje peptydowe i wpisy białek jako nowy zestaw danych peptyd-białko (dla każdego programu), oraz funkcję Remove beginning, aby wykluczyć nagłówki kolumn.
  3. Concatenate sekwencje peptydowe i wpisy białek z obu programów, aby utworzyć nowy (połączony) zestaw danych peptyd-białko.
  4. Uruchom funkcję Query Tabular na połączonym zestawie danych peptyd-białko oraz na zweryfikowanych peptydach, aby przypisać zweryfikowane peptydy do powiązanych z nimi wpisów białek (Peptide and Protein from Peptide Reports.tabular). Wpisy białek są katalogowane według ich numerów dostępowych (znanych również jako identyfikatory UniProt ID).
  5. Użyj funkcji Group, aby zachować unikalne zweryfikowane peptydy i powiązane z nimi identyfikatory UniProt ID.
  6. Uruchom funkcję Query Tabular, aby wyodrębnić identyfikatory UniProt ID (UniProt-ID from verified Peptides.tabular).
  7. Wprowadź identyfikatory UniProt ID do narzędzia UniProt, aby uzyskać powiązane z nimi sekwencje białek w formie nowej bazy danych (UniProt.fasta).
  8. Uruchom funkcję FASTA Merge Files and Filter Unique Sequences na wygenerowanej przez UniProt bazie sekwencji białek, ludzkiej bazie UniProt (wraz z izoformami) oraz bazach zanieczyszczeń, aby utworzyć zweryfikowaną bazę danych, która zostanie użyta do kwantyfikacji peptydów (Quantitation Database for MaxQuant.fasta).

6. Moduł 4: Ilościowe oznaczanie w programie MaxQuant

UWAGA: Jeśli użytkownik chce skorzystać z przykładowych danych wejściowych i przepływu pracy z Tabeli uzupełniającej 2, należy ściśle przestrzegać instrukcji zawartych w sekcji 2. W przypadku modułu 2 należy zaimportować dane wejściowe i przepływ pracy dla QUANTIFICATION. Dla wszystkich modułów odpowiedni samouczek GTN znajduje się w Tabeli uzupełniającej 3.

  1. Wykorzystaj zweryfikowaną bazę sekwencji białek oraz zestawy danych MS (RAW) jako dane wejściowe dla programu MaxQuant42.
    UWAGA: Pamiętaj, że MaxQuant wymaga pliku projektu eksperymentalnego, który może być tym samym plikiem, który został użyty do identyfikacji peptydów (krok 4.2). W razie potrzeby zmień nazwy plików. Zweryfikowana baza danych z poprzedniego modułu jest niezbędna do ograniczenia liczby wyników fałszywie dodatnich podczas kwantyfikacji białek. Kwantyfikacja białek umożliwia badaczom pomiar i porównanie zawartości peptydów i białek w próbkach biologicznych. Krok ten jest niezbędny do zrozumienia różnicowej ekspresji białek poprzez uzyskanie wglądu w zmiany ilościowe w różnych warunkach.
    1. Wygeneruj pliki Evidence, Protein Groups i Peptides (MaxQuant Evidence.tabular, MaxQuant Protein Groups.tabular, MaxQuant Peptides.tabular).
  2. Wybierz peptydy mikrobiologiczne z pliku MaxQuant Peptides (Select microbial peptides.tabular).
  3. Wytnij wyłącznie sekwencje peptydów mikrobiologicznych (Cut on data [#].tabular).
  4. Pogrupuj dane, aby uzyskać listę skwantyfikowanych peptydów mikrobiologicznych (Quantified Peptides.tabular).

7. Moduł 5: Interpretacja danych

UWAGA: Jeśli użytkownik chce skorzystać z przykładowych danych wejściowych i schematu przepływu z Supplementary Table 2, należy postępować zgodnie z instrukcjami w sekcji 2. W przypadku modułu 2 należy zaimportować dane wejściowe i schemat przepływu dla INTERPRETACJI DANYCH. Odnośne samouczki GTN dla wszystkich modułów znajdują się w Supplementary Table 3. Wyniki kwantyfikacji z programu MaxQuant z poprzedniego modułu zostaną tutaj wykorzystane do adnotacji taksonomicznych i funkcjonalnych przy użyciu Unipept oraz do analizy statystycznej przy użyciu MSstatsTMT. Unipept umożliwia badaczom identyfikację i kwantyfikację mikroorganizmów w zróżnicowanych środowiskach i integruje się z publicznymi bazami danych (takimi jak UniProt) w celu pobrania aktualnych adnotacji. Program MSstatsTMT został zaprojektowany do rzetelnej analizy statystycznej danych proteomiki ilościowej opartych na spektrometrii mas z wykorzystaniem znakowania TMT.

  1. Użyj listy ilościowo określonych peptydów mikrobiologicznych (Quantified Peptides.tabular) jako danych wejściowych do Unipept43,44,45 w celu przeprowadzenia adnotacji taksonomicznych i funkcjonalnych. Patrz Tabela uzupełniająca 7 dla parametrów oraz listy wyników.
  2. Interesującymi wynikami z programu Unipept są w tym przypadku drzewo taksonomii drobnoustrojów oraz drzewo białek enzymów (EC) drobnoustrojów (Microbial Taxonomy Tree.d3_hierarchy, Microbial EC Proteins Tree.d3_hierarchy).
    1. Aby wyświetlić drzewa, kliknij zestaw danych, aby otworzyć opcje. Kliknij Wizualizacja (4th opcja od lewej) > Przeglądarka taksonomiczna Unipept.
    2. Aby wyświetlić adnotacje taksonomiczne i funkcjonalne w tabeli (Unipept peptinfo.tabular): kliknij w ikona oka w prawym górnym rogu zestawu danych. Przewiń, aby wyświetlić każdy peptyd w osobnym wierszu oraz informacje w różnych kolumnach.
  3. Przed przeprowadzeniem analizy statystycznej przy użyciu MSstatsTMT należy uruchomić Wybierz plik grup białek z programu MaxQuant w celu utworzenia dwóch nowych zbiorów danych: białek mikrobiologicznych i ludzkich (Microbial Proteins.tabular, Human Proteins.tabular). Białka posiadają tagi taksonomiczne określające ich pochodzenie.
    1. Wyeliminuj białka zanieczyszczające z tagiem "Przesuń suwak w prawo, aby zwiększyć natężenie światła, lub w lewo, aby je zmniejszyć.."
    2. Zachowaj białka mikrobiologiczne i ludzkie, które są oznaczone jako mikrobiologiczne (np. "9LACO") i "CZŁOWIEK" tagi, odpowiednio (Microbial-Proteins.tabular, Human-Proteins.tabular).
  4. MSstatsTMT42,46,47 zostaną wykorzystane do przeprowadzenia analizy statystycznej. Jako dane wejściowe należy zastosować plik Evidence z programu MaxQuant (z modułu 4) oraz wybrane białka mikrobiologiczne (lub białka ludzkie) z poprzedniego kroku. Ten schemat analizy priorytetyzuje białka mikrobiologiczne, ale oferuje również możliwość charakterystyki białek ludzkich. Patrz Tabela uzupełniająca 8 dla parametrów i listy wyników.
    UWAGA: MSstatsTMT wymaga pliku adnotacji oraz macierzy porównań (znanej również jako macierz kontrastów). Plik adnotacji określi sposób łączenia wyników kwantyfikacji, natomiast macierz porównań uwzględni różne grupy próbek. Przykłady tych plików (Annotation.tabular, Comparison Matrix.tabular) zostały dołączone do Tabela uzupełniająca 9 i Tabela uzupełniająca 10.
  5. Interesującymi wynikami z programu MSstatsTMT są w tym przypadku wykresy wulkaniczne oraz wykresy porównawcze dla białek mikrobiologicznych (Microbial Proteins Volcano Plot.pdf, Microbial Proteins Comparison.pdf). Wykresy można wyświetlić, klikając w ikona oka w prawym górnym rogu zbioru danych.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Ogólny protokół opisany w niniejszym opracowaniu został zademonstrowany na plikach MS/MS uzyskanych z podzbioru próbek PTF21. Do i wsp.21 przeanalizowali cztery pliki MS/MS z próbek PTF, które zostały pobrane zgodnie z procedurami opisanymi przez Boylana i wsp.29 oraz Afiuni-Zadela i wsp.30. Ten schemat postępowania priorytetyzuje białka mikrobiologiczne, ale oferuje elastyczność pozwalającą na równoległą charakterystykę białe...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Badania nad metaproteomiką kliniczną oferują potencjalne przełomy w badaniach klinicznych, ale nadal istnieją wyzwania związane z ich wdrożeniem. Mniejsza liczebność białek drobnoustrojów w stosunku do białek gospodarza w większości próbek utrudnia wykrywanie i charakteryzowanie białek niebędących gospodarzami 6,10. Zależność od dużych baz danych sekwencji białek w celu dokładnej identyfikacji i kwantyfikacji peptydów i białek, wraz ze złożonością taksonomicznie ...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy deklarują brak konfliktu interesów.

Podziękowania

Dziękujemy dr Amy Skubitz i dr Kristin Boylan (University of Minnesota) za pilotażowe zestawy danych oraz dr Paulowi Piehowskiemu, dr Tao Liu i dr Karin Rodland (Pacific Northwest National Laboratories (PNNL)) za ich doświadczenie w zbieraniu próbek i przetwarzaniu próbek PTF oraz generowaniu danych MS znakowanych TMT używanych w tym badaniu. Projekt ten został częściowo sfinansowany przez Minnesota Ovarian Cancer Alliance (MOCA), National Institutes of Health/National Cancer Institute Grant Number: 5R01CA262153 (A.P.N.S.), 1R21CA267707 (P.D.J i T.J.G.) oraz National Institutes of Health/National Cancer Institute Grant Number: P30CA077598 (P.D.J. i T.J.G.).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Zwiń kolekcjęGalaxyPGalaxy Wersja 5.1.1Łączy kolekcję listy zestawów danych w jeden plik (w kolejności listy)
Łączenie zestawów danychGalaxyPGalaxy Wersja 0.1.1Łączenie plików od końca do głowy
WytnijGalaxyPGalaxy Wersja 1.0.2Wytnij (wybierz) określone kolumny z pliku
FASTA Scalanie plików i filtrowanie unikalnych sekwencjiGalaxyPGalaxy Wersja 1.2.0Łączenie plików bazy danych FASTA
FastaCLI GalaxyPGalaxy Wersja 4.0.41+galaxy1Dołącza sekwencje zwodzące do plików FASTA
FASTA-tablularGalaxyPGalaxy w wersji 1.1.0Konwertuj sekwencje w formacie FASTA do formatu rozdzielanego tabulatorami
FiltrujGalaxyPGalaxy w wersji 1.1.1Filtruj kolumny za pomocą prostych wyrażeń
Filtr tabelarycznyGalaxyPGalaxy Wersja 3.3.0Filtruj plik tabelaryczny za pomocą filtrów liniowych
Serwer Galaxy Europe (EU)GalaxyPhttps://usegalaxy.eu/
GroupGalaxyPGalaxy Wersja 2.1.4Grupuj plik według określonej kolumny i wykonuj funkcje agregujące
Parametry identyfikacyjneGalaxyPGalaxy Wersja 4.0.41+galaxy1Ustaw parametry identyfikacyjne dla SearchGUI/PeptideShaker
Learning Pathway: Przepływy pracy metaproteomiki klinicznej w GalaxyGalaxyPhttps://training.galaxyproject.org/training-material/learning-pathways/clinical-metaproteomics.html
MaxQuantGalaxyPGalaxy w wersji 2.0.3.0+galaxy0 (moduł Discovery); Galaxy Version 1.6.17.0+galaxy4 (moduł kwantyfikacji)Pakiet oprogramowania do proteomiki ilościowej do analizy dużych plików danych spektrometrii mas
MetaNovoGalaxyPGalaxy Wersja 1.9.4+galaxy4Przeszukuj dane MS/MS w bazie danych FASTA (znanych białek), aby utworzyć docelową bazę danych (dopasowanych białek) do analizy spektrometrii
mas msconvertGalaxyPGalaxy Wersja 3.0.20287.2Konwertuj i/lub filtruj pliki spektrometrii mas
MSstatsTMTGalaxyPGalaxy Version 2.0.0+galaxy1Pakiet oparty na R do wykrywania zróżnicowanych ilości białek w eksperymentach proteomicznych opartych na spektrometrii mas typu shotgun przy użyciu znakowania tandemowego znacznika masy (TMT)
PepQuery2GalaxyPGalaxy w wersji 2.0.2+galaxy0Wyszukiwarka skoncentrowana na peptydach do identyfikacji i/lub walidacji znanych i nowych peptydów będących przedmiotem zainteresowania
PeptideShakerGalaxyPGalaxy Wersja 2.0.33+galaxy1Interpretuj wyniki z SearchGUI w celu identyfikacji białek
Pobieranie bazy danych białekGalaxyPGalaxy Wersja 0.3.4Pobierz określone sekwencje białek jako plik FASTA
Zapytaj o tabelarycznąwersję GalaxyPGalaxy w wersji 3.3.0Załaduj pliki tabelaryczne do  Baza danych SQLite
Usuń początekGalaxyPGalaxy Wersja 1.0.0Usuń określoną liczbę wierszy (nagłówka) z pliku
SearchGUIGalaxyPGalaxy Wersja 4.0.41+galaxy1Uruchom wyszukiwarki na listach szczytów MGF i przygotuj wyniki do wprowadzenia do Peptide Shaker
WybierzGalaxyPGalaxy w wersji 1.0.4Wybierz linie, które pasują do wyrażenia
UnipeptGalaxyPGalaxy Wersja 4.5.1Pobierz wpisy UniProt i informacje taksonomiczne dla peptydów tryptycznych
UniProtGalaxyPGalaxy Wersja 2.3.0Pobierz proteom jako plik XML (UniProtXML) lub FASTA z UniProtKB

Bibliografia

  1. Zhang, X., Li, L., Butcher, J., Stintzi, A., Figeys, D. Advancing functional and translational microbiome research using meta-omics approaches. Microbiome. 7 (1), 154(2019).
  2. Van Den Bossche, T., et al. The Metaproteomics Initiative: a coordinated approach for propelling the functional characterization of microbiomes. Microbiome. 9 (1), 243(2021).
  3. Tanca, A., et al. Evaluating the impact of different sequence databases on metaproteome analysis: insights from a lab-assembled microbial mixture. PloS One. 8 (12), e82981(2013).
  4. Seifert, J., et al. Bioinformatic progress and applications in metaproteogenomics for bridging the gap between genomic sequences and metabolic functions in microbial communities. Proteomics. 13 (18-19), 2786-2804 (2013).
  5. Muth, T., Renard, B. Y., Martens, L. Metaproteomic data analysis at a glance: advances in computational microbial community proteomics. Expert Rev Proteomics. 13 (8), 757-769 (2016).
  6. Bihani, S., et al. Metaproteomic analysis of nasopharyngeal swab samples to identify microbial peptides in COVID-19 patients. J Proteome Res. 22 (8), 2608-2619 (2023).
  7. Ayan, E., DeMirci, H., Serdar, M. A., Palermo, F., Baykal, A. T. Bridging the Gap between Gut Microbiota and Alzheimer's Disease: A metaproteomic approach for biomarker discovery in transgenic mice. Int J Mol Sci. 24 (16), 12819(2023).
  8. Levi Mortera, S., et al. A metaproteomic-based gut microbiota profiling in children affected by autism spectrum disorders. J Proteomics. 251, 104407(2022).
  9. Long, S., et al. Metaproteomics characterizes human gut microbiome function in colorectal cancer. NPJ Biofilms Microbiomes. 6 (1), 14(2020).
  10. Hardouin, P., Chiron, R., Marchandin, H., Armengaud, J., Grenga, L. Metaproteomics to Decipher CF Host-Microbiota interactions: Overview, challenges and future perspectives. Genes (Basel). 12 (6), 892(2021).
  11. Levi Mortera, S., et al. Functional and taxonomic traits of the gut microbiota in Type 1 diabetes children at the onset: A metaproteomic study. Int J Mol Sci. 23 (24), 15982(2022).
  12. Gonzalez, C. G., et al. Location-specific signatures of Crohn's disease at a multi-omics scale. Microbiome. 10 (1), 133(2022).
  13. Thuy-Boun, P. S., et al. Metaproteomics analysis of SARS-CoV-2-infected patient samples reveals presence of potential coinfecting microorganisms. J Proteome Res. 20 (2), 1451-1454 (2021).
  14. Grenga, L., et al. Taxonomical and functional changes in COVID-19 faecal microbiome could be related to SARS-CoV-2 faecal load. Environ Microbiol. 24 (9), 4299-4316 (2022).
  15. Biemann, R., et al. Fecal metaproteomics reveals reduced gut inflammation and changed microbial metabolism following lifestyle-induced weight loss. Biomolecules. 11 (5), 726(2021).
  16. Gómez-Varela, D., Xian, F., Grundtner, S., Sondermann, J. R., Carta, G., Schmidt, M. Increasing taxonomic and functional characterization of host-microbiome interactions by DIA-PASEF metaproteomics. Front Microbiol. 14, 1258703(2023).
  17. Jagtap, P. D., et al. BAL fluid metaproteome in acute respiratory failure. Am J Respir Cell Mol Biol. 59 (5), 648-652 (2018).
  18. Masson, L., Wilson, J., Amir Hamzah, A. S., Tachedjian, G., Payne, M. Advances in mass spectrometry technologies to characterize cervicovaginal microbiome functions that impact spontaneous preterm birth. Am J Reprod Immunol Microbiol. 90 (2), e13750(2023).
  19. Bankvall, M., et al. Metataxonomic and metaproteomic profiling of the oral microbiome in oral lichen planus - a pilot study. J Oral Microbiol. 15 (1), 2161726(2023).
  20. Kruk, M. E., et al. An integrated metaproteomics workflow for studying host-microbe dynamics in bronchoalveolar lavage samples applied to cystic fibrosis disease. mSystems. 9 (7), e0092923(2024).
  21. Do, K., et al. A novel clinical metaproteomics workflow enables bioinformatic analysis of host-microbe dynamics in disease. mSphere. 9 (6), e00793-e00823 (2024).
  22. Batut, B., et al. Community-driven data analysis training for biology. Cell Syst. 6 (6), 752-758.e1 (2018).
  23. Hiltemann, S., et al. Galaxy Training: A powerful framework for teaching. PLoS Comput Biol. 19 (1), e1010752(2023).
  24. Galaxy Community. The Galaxy platform for accessible, reproducible, and collaborative data analyses: 2024 update. Nucleic Acids Res. 52 (W1), W83-W94 (2024).
  25. Blankenberg, D., et al. Dissemination of scientific software with Galaxy ToolShed. Genome Biol. 15 (2), 403(2014).
  26. Blank, C., et al. Disseminating metaproteomic informatics capabilities and knowledge using the Galaxy-P framework. Proteomes. 6 (1), E7(2018).
  27. Mehta, S., et al. A Galaxy of informatics resources for MS-based proteomics. Expert Rev Proteomics. 20 (11), 251-266 (2023).
  28. Armengaud, J. Metaproteomics to understand how microbiota function: The crystal ball predicts a promising future. Environ Microbiol. 25 (1), 115-125 (2023).
  29. Boylan, K. L., et al. A feasibility study to identify proteins in the residual Pap test fluid of women with normal cytology by mass spectrometry-based proteomics. Clin Proteomics. 11 (1), 30(2014).
  30. Afiuni-Zadeh, S., et al. Evaluating the potential of residual Pap test fluid as a resource for the metaproteomic analysis of the cervical-vaginal microbiome. Sci Rep. 8 (1), 10868(2018).
  31. Rauniyar, N., Yates, J. R. Isobaric labeling-based relative quantification in shotgun proteomics. J Proteome Res. 13 (12), 5293-5309 (2014).
  32. Sivanich, M. K., Gu, T. -J., Tabang, D. N., Li, L. Recent advances in isobaric labeling and applications in quantitative proteomics. Proteomics. 22 (19-20), e2100256(2022).
  33. Potgieter, M. G., et al. MetaNovo: An open-source pipeline for probabilistic peptide discovery in complex metaproteomic datasets. PLoS Comput Biol. 19 (6), e1011163(2023).
  34. Vaudel, M., Barsnes, H., Berven, F. S., Sickmann, A., Martens, L. SearchGUI: An open-source graphical user interface for simultaneous OMSSA and X!Tandem searches. Proteomics. 11 (5), 996-999 (2011).
  35. Kim, S., Pevzner, P. A. MS-GF+ makes progress towards a universal database search tool for proteomics. Nat Commun. 5, 5277(2014).
  36. Barsnes, H., Vaudel, M. SearchGUI: A highly adaptable common interface for proteomics search and de novo engines. J Proteome Res. 17 (7), 2552-2555 (2018).
  37. Vaudel, M., et al. PeptideShaker enables reanalysis of MS-derived proteomics data sets. Nature Biotechnol. 33 (1), 22-24 (2015).
  38. Tyanova, S., Temu, T., Cox, J. The MaxQuant computational platform for mass spectrometry-based shotgun proteomics. Nat Protoc. 11 (12), 2301-2319 (2016).
  39. Johnson, J. E., et al. Improve your Galaxy text life: The Query Tabular Tool. F1000Res. 7, 1604(2018).
  40. Wen, B., Wang, X., Zhang, B. PepQuery enables fast, accurate, and convenient proteomic validation of novel genomic alterations. Genome Res. 29 (3), 485-493 (2019).
  41. Wen, B., Zhang, B. PepQuery2 democratizes public MS proteomics data for rapid peptide searching. Nat Commun. 14 (1), 2213(2023).
  42. Pinter, N., et al. MaxQuant and MSstats in Galaxy enable reproducible cloud-based analysis of quantitative proteomics experiments for everyone. J Proteome Res. 21 (6), 1558-1565 (2022).
  43. Mesuere, B., Willems, T., Van Der Jeugt, F., Devreese, B., Vandamme, P., Dawyndt, P. Unipept web services for metaproteomics analysis. Bioinformatics. 32 (11), 1746-1748 (2016).
  44. Gurdeep Singh, R., et al. Unipept 4.0: Functional analysis of metaproteome data. J Proteome Res. 18 (2), 606-615 (2019).
  45. Verschaffelt, P., Collier, J., Botzki, A., Martens, L., Dawyndt, P., Mesuere, B. Unipept Visualizations: an interactive visualization library for biological data. Bioinformatics. 38 (2), 562-563 (2022).
  46. Huang, T., et al. MSstatsTMT: Statistical detection of differentially abundant proteins in experiments with isobaric labeling and multiple mixtures. Mol Cell Proteomics. 19 (10), 1706-1723 (2020).
  47. Choi, M., et al. MSstats: an R package for statistical analysis of quantitative mass spectrometry-based proteomic experiments. Bioinformatics. 30 (17), 2524-2526 (2014).
  48. Jagtap, P., et al. Workflow for analysis of high mass accuracy salivary data set using MaxQuant and ProteinPilot search algorithm. Proteomics. 12 (11), 1726-1730 (2012).
  49. Eng, J. K., Searle, B. C., Clauser, K. R., Tabb, D. L. A face in the crowd: recognizing peptides through database search. Mol Cell Proteomics. 10 (11), R111.009522(2011).
  50. Bihani, S., et al. Metaproteomics for coinfections in the upper respiratory tract: The case of COVID-19. Methods Mol Biol. 2820, 165-185 (2024).
  51. Jagtap, P., et al. A two-step database search method improves sensitivity in peptide sequence matches for metaproteomics and proteogenomics studies. Proteomics. 13 (8), 1352-1357 (2013).
  52. O'Bryon, I., Jenson, S. C., Merkley, E. D. Flying blind, or just flying under the radar? The underappreciated power of de novo methods of mass spectrometric peptide identification. Protein Sci. 29 (9), 1864-1878 (2020).
  53. Elias, J. E., Gygi, S. P. Target-decoy search strategy for increased confidence in large-scale protein identifications by mass spectrometry. Nat Methods. 4 (3), 207-214 (2007).
  54. Kumar, D., Yadav, A. K., Dash, D. Choosing an optimal database for protein identification from tandem mass spectrometry data. Proteome Bioinformatics. 1549, 17-29 (2017).
  55. He, T., et al. Comparative evaluation of Proteome Discoverer and FragPipe for the TMT-based proteome quantification. J Proteome Res. 21 (12), 3007-3015 (2022).
  56. Searle, B. C., et al. Generating high quality libraries for DIA MS with empirically corrected peptide predictions. Nat Commun. 11 (1), 1548(2020).
  57. Easterly, C. W., et al. metaQuantome: An integrated, quantitative metaproteomics approach reveals connections between taxonomy and protein function in complex microbiomes. Mol Cell Proteomics. 18 (8 suppl 1), S82-S91 (2019).
  58. Lewis, M., et al. A Quantitative synthesis of early language acquisition using meta-analysis. , (2016).
  59. Bergmann, C., et al. Promoting replicability in developmental research through meta-analyses: Insights from language acquisition research. Child Dev. 89 (6), 1996-2009 (2018).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

spektrometria masbaza danych sekwencji białkowychidentyfikacja peptydówadnotacja taksonomicznaadnotacja funkcjonalnailościowe oznaczenie białek mikrobiologicznychanaliza statystyczna