Artykuł metodologiczny

Poruszanie się po danych proteomicznych opartych na spektrometrii mas przy użyciu bezpłatnych narzędzi obliczeniowych

DOI:

10.3791/68707

19 sierpnia 2025

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dane proteomiczne oparte na spektrometrii mas są dostępne w otwartych bazach danych i dostępne za pomocą bezpłatnych narzędzi. Biorąc pod uwagę złożoność przeszukiwania i opisywania baz danych, wielu biologom brakuje wiedzy, aby wykorzystać te zestawy danych. W tym miejscu przedstawiamy przewodnik dotyczący korzystania z bezpłatnych narzędzi do podstawowego wyszukiwania danych proteomicznych.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dane proteomiczne oparte na spektrometrii mas (MS), w tym akwizycja zależna od danych (DDA) i akwizycja niezależna od danych (DIA), są szeroko stosowane w badaniach biologicznych. Jednak zastosowanie tych zbiorów danych w badaniach walidacyjnych jest nadal ograniczone ze względu na brak jasnych demonstracji, jak skutecznie wyszukiwać i analizować dane proteomiczne. Aby wypełnić tę lukę, wybraliśmy jeden zestaw danych DDA i jeden zestaw danych DIA zdeponowany w repozytorium danych PRoteomics IDEntifications Database (PRIDE), aby lepiej zilustrować przebieg analizy danych proteomicznych i dalsze przetwarzanie wyników wyszukiwania białek. W celach demonstracyjnych użyliśmy dwóch bezpłatnych narzędzi obliczeniowych: FragPipe (v22.0) dla zbiorów danych DDA oraz DIA-NN (2.1.0) dla zbiorów danych DIA. Etapy przetwarzania końcowego, takie jak generowanie wykresów wulkanów i list rozregulowanych białek, zademonstrowano przy użyciu kodu R. Badanie to zawiera podstawowe protokoły wyszukiwania i analizowania danych proteomicznych, służąc jako niezbędny przewodnik dla początkujących do skutecznego radzenia sobie ze zbiorami danych proteomicznych. Dzięki tym pracom zamierzamy wyposażyć badaczy w wiedzę niezbędną do wykorzystania danych proteomicznych w ich badaniach biologicznych.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dziedzina proteomiki została zrewolucjonizowana przez powszechne przyjęcie repozytoriów danych o otwartym dostępie i narzędzi wolnegooprogramowania1, które odegrały zasadniczą rolę w rozwijaniu możliwości badawczych i promowaniu kultury udostępniania danych. Ustanowienie scentralizowanych zasobów, takich jak PRIDE2, oraz opracowanie ustandaryzowanych formatów danych przez Human Proteome Organization (HUPO) Proteomics Standards Initiative (PSI)3 stworzyły bezprecedensową okazję do ponownego wykorzystania i integracji danych. Jednak analiza i interpretacja danych proteomicznych nadal stanowi poważne bariery techniczne, szczególnie dla biologów i lekarzy, którzy chcą przeprowadzić ortogonalną walidację własnych wyników eksperymentalnych4. Niniejszy manuskrypt bezpośrednio odnosi się do tego wyzwania, przedstawiając niezależny od dostawcy obliczeniowy przepływ pracy, aby zapewnić dostępne ramy dla badaczy do niezależnego wyszukiwania, analizowania i integrowania publicznych danych proteomicznych z własnymi odkryciami, ułatwiając w ten sposób solidną walidację ortogonalną bez konieczności przeprowadzania dodatkowych eksperymentów w laboratorium mokrym. Praca ta jest szczególnie odpowiednia dla badaczy, którzy chcą ortogonalnie zweryfikować różnicową ekspresję określonych białek zidentyfikowanych we własnych eksperymentach i wygenerować nowe hipotezy poprzez zbadanie wzorców ekspresji ich białek będących przedmiotem zainteresowania w szerokim zakresie opublikowanych badań. Dostarczając przewodnik krok po kroku, staramy się umożliwić szerszemu gronu naukowców wykorzystanie pełnego potencjału publicznych danych proteomicznych, co ostatecznie zwiększy solidność i wpływ ich badań.

W proteomice opartej na spektrometrii mas (MS) skany MS1 i MS2 mają fundamentalne znaczenie dla pozyskiwania danych. Skany MS1 lub skany przeglądowe wykrywają i mierzą stosunek masy do ładunku (m/z) wszystkich jonów w próbce, zapewniając kompleksowy przegląd populacji jonów5. Skany MS2, zwane również skanami fragmentacyjnymi, polegają na izolowaniu i fragmentacji określonych jonów prekursorowych wybranych ze skanu MS1, generując widma jonów fragmentacyjnych do identyfikacji peptydów6.

Akwizycja zależna od danych (DDA) wybiera najliczniejsze jony ze skanów MS1 pod kątem fragmentacji MS2, tworząc prostsze widma, które usprawniają analizę. Jednak DDA może prowadzić do stochastycznego próbkowania i brakujących wartości w złożonych próbkach, ograniczając odtwarzalność7. W przeciwieństwie do tego, akwizycja niezależna od danych (DIA) systematycznie fragmentuje wszystkie jony w predefiniowanych oknach m/z , zapewniając kompleksowe pokrycie i minimalizując brakujące wartości. Zwiększa to dokładność ilościową i odtwarzalność8, chociaż DIA wymaga zaawansowanych narzędzi obliczeniowych do dekonwolucji wysoce złożonych widm MS29.

PRIDE (https://www.ebi.ac.uk/pride)2jest wiodącym repozytorium w ramach ProteomeXchange Consortium (https://www.proteomexchange.org)10, globalnej platformy do udostępniania danych proteomicznych. Użytkownicy mogą efektywnie poruszać się po tym ogromnym zasobie za pomocą wyszukiwania słów kluczowych, aby zlokalizować interesujące ich zestawy danych.

DIA-NN11, pakiet oprogramowania wykorzystujący głębokie sieci neuronowe, jest złotym standardem narzędzia do analizy danych proteomicznych niezależnych od danych (DIA). Wyróżnia się dokładnością identyfikacji i kwantyfikacji, dzięki czemu jest szczególnie skuteczny w przetwarzaniu złożonych zbiorów danych DIA12. W przypadku przepływów pracy akwizycji zależnej od danych (DDA) MSFragger13, zintegrowany z potokiem FragPipe, oferuje ultraszybką identyfikację peptydów. Innowacyjne podejście do indeksowania jonów fragmentarycznych umożliwia szybkie dopasowanie spektralne, przewyższając tradycyjne narzędzia ponad 100-krotnie pod względem szybkości.

Wyposażeni w te obszerne bazy danych i zaawansowane narzędzia, naukowcy mogą z łatwością ponownie wykorzystywać dane proteomiczne do walidacji badań krzyżowych i nowatorskich odkryć biologicznych. Ta dostępność umożliwiła identyfikację licznych biomarkerów białkowych w różnych chorobach14,15, poprawiła przewidywanie rokowania16 i umożliwiła klasyfikację podtypów molekularnych w oparciu o profile proteomiczne17.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

UWAGA: Rysunek 1zawiera przegląd przepływu pracy, a Spis materiałów zawiera szczegółowe opisy używanego oprogramowania.

figure-protocol-1
Rysunek 1: Zarys projektu badania. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

1. Przykładowa konfiguracja plików i oprogramowania

UWAGA: Wszystkie aplikacje są bezpłatne do indywidualnego użytku badawczego i mogą być uruchamiane na komputerze osobistym (obsługiwane są systemy Windows i Linux).

  1. Utwórz nowy katalog dla projektu.
  2. Pobierz JMU_LM2_8526_55.raw, JMU_LM2_8568_51.raw, JMU_LM2_8696_37.raw, JMU_LM2_2112_87.raw, JMU_LM2_2195_91.raw, JMU_LM2_2377_73.raw, 20150127_liver_XH03_T_01.raw, 20150127_liver_XH03_T_02.raw, 20150127_liver_XH03_T_03.raw, 20150127_liver_XH03_P_01.raw, 20150127_liver_XH03_P_02.raw, 20150127_liver_XH03_P_03.raw od PRIDE.
    UWAGA: Te dwie grupy plików można pobrać osobno z https://www.ebi.ac.uk/pride/archive/projects/PXD039273 i https://www.ebi.ac.uk/pride/archive/projects/PXD006512 (Rysunek 2).
  3. Pobierz i zainstaluj wymagane narzędzia programowe.
    1. Pobierz najnowszą wersję DIA-NN jako plik .msi. DIA-NN jest dostępny bezpłatnie jako plik .msi dla systemu Windows lub plik .zip dla systemu Linux z https://github.com/vdemichev/DiaNN/releases/tag/2.0
    2. Pobierz najnowszą wersję programu MSFileReader jako plik .exe. MSFileReader jest dostępny bezpłatnie jako plik .exe firmy https://github.com/thermofisherlsms/MSFileReader/blob/main/MSFileReader_x64.exe, który jest wymagany do przetwarzania surowych sformatowanych danych Thermo Fisher DIA.
    3. Pobierz najnowszą wersję zestawu .NET SDK jako plik .exe. Zestaw .NET SDK jest dostępny bezpłatnie jako plik .exe z https://dotnet.microsoft.com/en-us/download, który jest wymagany w systemie Windows do wykonania MSFileReader.
    4. Pobierz najnowszą wersję FragPipe jako plik .zip. FragPipe jest dostępny bezpłatnie jako plik .zip z https://github.com/Nesvilab/FragPipe/releases. Plik zip z jre jest zalecany, ponieważ zawiera środowisko uruchomieniowe Java dla systemu Windows, które jest potrzebne do uruchomienia FragPipe. MSFragger jest osadzony w FragPipe.
  4. Pobierz najnowszą wersję plików skryptów R i Rstudio oraz języka R z pliku uzupełniającego 1 i pliku uzupełniającego 2. R i RStudio można pobrać bezpłatnie z https://cran.rstudio.com/bin/windows/base/R-4.5.0-win.exe i https://posit.co/download/rstudio-desktop/.
  5. Rozpakuj skompresowane pliki i kliknij przycisk . exe lub .msi Pliki , aby zainstalować aplikacje.

2. Analiza danych DIA za pomocą DIA-NN

  1. Pobierz referencyjny plik proteomu fasta z UniProt. Aby pobrać proteom referencyjny Homo sapiens (informacje o izoformie nie są dołączone), przejdź do https://www.uniprot.org/proteomes/UP000005640 (Rysunek 3A).
  2. Kliknij przycisk Dodaj FAPSA , aby załadować referencyjny plik proteomu do DIA-NN.
  3. Wybierz dwie opcje: skrót FASTA do wyszukiwania bez biblioteki/generowania bibliotek oraz widma oparte na głębokim uczeniu, przewidywanie RT i lMs w części Generacja jonów prekursorowych. Kliknij przycisk Uruchom , aby wygenerować przewidywaną bibliotekę spektralną (Rysunek 3B).
    1. Po wygenerowaniu pliku przewidywanej biblioteki spektralnej użyj go ponownie do innych eksperymentów w ramach tych samych ustawień akwizycji eksperymentalnej, klikając przycisk Spectral , aby dodać przewidywaną bibliotekę.
  4. Odznacz dwie opcje w części Generowanie jonów prekursorowych i kliknij przycisk Typ, który odpowiada formatowi pliku w części wejściowej, aby załadować dane DIA.
  5. Ustaw Dokładność masy i Dokładność MS1 w obszarze Algorytm na 0,0 ppm.
  6. Dostosuj ustawienia zakresu masy prekursora i fragmentu w części Generacja jonów prekursora w oparciu o ustawienia eksperymentalne.
  7. Zachowaj inne ustawienia domyślne.
    1. Generacja prekursorów DIA-NN wykorzystuje trypsynę / P (rozszczepia się po K / R, chyba że następuje po niej prolina) z 1 pominiętym rozszczepieniem do modelowania częściowego trawienia; wyłączyć wycięcie N-term M dla peptydów niekanonicznych (np. immunopeptydomi) lub zwiększyć brakujące rozszczepienia do 2 dla dłuższych peptydów.
    2. Jawnie włącz modyfikacje zmiennych (domyślnie wyłączone) dla badań modyfikacji potranslacyjnej (PTM) (np. Ox (M) do utleniania, K-GG do ubikwitynacji) i rozszerz filtry peptydowe (długość: 7-30 aa; ładunek: 1-4+; prekursor m/z: 300-1800) zgodnie z ustawieniami eksperymentalnymi (np. długość: 5-50 aa, ładunek=1-6) dla dużych PTM lub nietryptycznych trawień.
    3. Ustawienia algorytmu wykorzystują automatyczną kalibrację (dokładność masy = 0,0 ppm) w celu precyzyjnego wyrównania masy — zastąpienie ręcznymi tolerancjami (np. 10 ppm) w przypadku urządzeń o niskiej rozdzielczości — oraz funkcję Match Between Runs (MBR) przesyłającą identyfikatory między seriami (wyłączona dla próbek niejednorodnych).
    4. Punktacja sieci neuronowych zwiększa pewność identyfikacji (zachowuje, chyba że jakość danych jest niska), podczas gdy kwantowa nieznakowana spektrometria mas (UMS) umożliwia bardzo precyzyjną kwantyfikację bez znaczników; przestawić się na oznaczanie ilościowe MS2 dla znaczników izobarycznych (np. TMT). Korzystaj z wyszukiwania bez biblioteki tylko z danymi DIA o wysokiej rozdzielczości, aby ominąć wymagania biblioteki spektralnej.
  8. Kliknij przycisk Uruchom . Poczekaj na wyniki, aż w interfejsie operacyjnym pojawi się komunikat Zakończono, wskazujący, że przebieg został zakończony (Rysunek 3C).

3. Analiza danych DDA za pomocą FragPipe

  1. Kliknij ikonę Fragpipe w folderze ~\FragPipe\fragpipe\bin po instalacji. Wszystkie ustawienia zależne można zobaczyć w zakładce Konfiguracja. Sprawdź, czy na komputerze istnieją trzy moduły (MSFragger, IonQuant, diaTracer, DIA-NN i Python). Jeśli nie, pobierz je, klikając Pobierz/Aktualizuj lub Pobierz (Rysunek 4A).
  2. Przejdź do następnej zakładki, Przepływ pracy. Wybierz opcję Domyślne dla przepływu pracy i kliknij Załaduj przepływ pracy. Kliknij Dodaj pliki , aby dodać ścieżki do plików. Przypisz nazwę eksperymentu i numer bioreplikatu w obszarze Przypisz pliki lub po prostu pozostaw je (Rysunek 4B).
  3. Teraz kliknij Baza danych i przejdź do tej zakładki. Załaduj plik fasta lub pobierz dowolne pliki fasta zgodnie z gatunkami próbek. Podczas pobierania wybierz opcje Tylko przeglądane sekwencje, Dodaj wabiki i Dodaj typowe zanieczyszczenia, aby uzyskać prosty przebieg (Rysunek 4C).
  4. Następnie kliknij MSFragger , aby zmienić kartę. Wybierz domyślną konfigurację zamkniętego wyszukiwania i kliknij Załaduj.
    UWAGA: Wyszukiwanie zamknięte jest w zasadzie wyszukiwaniem ustawionych modyfikacji, podczas gdy wyszukiwanie otwarte bada wszystkie możliwe modyfikacje danych, co jest bardziej czasochłonne i pamięciowe.
  5. W przypadku dopasowania szczytowego należy zachować ustawienia domyślne, z wyjątkiem tego, że zaleca się wybranie opcji Brak dla opcji Kalibracja i optymalizacja, ponieważ pozwoli to zaoszczędzić czas.
  6. W przypadku trawienia białek dostosuj parametry zgodnie z warunkami eksperymentalnymi. Zachowaj następujące ustawienia domyślne (Rysunek 5A).
    UWAGA: Tolerancje masy prekursora i fragmentu (± 20 ppm) określają maksymalny dopuszczalny błąd masy dla dopasowania widm eksperymentalnych do teoretycznych peptydów, przy czym dla instrumentów o wysokiej rozdzielczości zalecane są ściślejsze wartości. Reguły enzymatyczne (ścisła trypsyna) określają specyficzność rozszczepienia (po K/R, chyba że następuje P), przy czym pominięte rozszczepienia (2) dopuszczają częściowo strawione peptydy. Filtry długości peptydu (5-50 reszt) i masy (500-5000 Da) wykluczają mało prawdopodobnych kandydatów. Zmienne modyfikacje (np. +15,9949 Da na metioninie do utleniania, +79,96633 Da do S/T/Y do fosforylacji) pozwalają na wykrycie zmian chemicznych, podczas gdy kombinacje Max (5) ograniczają jednoczesne modyfikacje na peptyd w celu zarządzania przestrzenią wyszukiwania. Maksymalna liczba zmiennych modyfikacji na stronę (np. 3 na M) kontroluje częstotliwość modyfikacji. Podzielona baza danych poprawia wydajność w przypadku dużych proteomów, a błąd izotopu (0/1/2) uwzględnia błędnie przypisane piki izotopowe. Ustawienia te łącznie równoważą czułość, swoistość i obciążenie obliczeniowe w identyfikacji peptydów.
  7. Przejdź do karty Walidacja. Usuń zaznaczenie opcji Predict RT (Przewiduj widma ) i Predict spectra (Przewiduj widma), które są przeznaczone dla danych DIA (Rysunek 5B).
  8. Kliknij zakładkę Quant (MS1). Wybierz opcję Uruchom MS1 quant i kliknij Load Quant defaults. Wybierz IonQuant i zachowaj ustawienia domyślne (Rysunek 6A). Wyłącz MBR dla niestabilnych czasów przechowywania lub wyłącz normalizację intensywności , jeśli wystąpią globalne odchylenia skalowania; włącz opcję Zachowaj indeks na dysku, aby oszczędzać pamięć RAM z dużymi zestawami danych.
    UWAGA: Quant (MS1) domyślnie optymalizuje kwantyfikację bez znaczników przy użyciu MaxLPQ (MaxLFQ-based Protein Quantification, algorytm rozszerzający metodę MaxLFQ na grupy białek), wymagając ≥1 unikalnego jonu na białko (wzrost do ≥2 w celu uzyskania większej rygorystyczności kosztem pokrycia). Dopasowanie między przebiegami (MBR) przesyła identyfikatory między przebiegami przy użyciu tolerancji czasu przechowywania (RT) (domyślnie 0,4 min; dokręcić do 0,2 minuty w przypadku chromatografii stabilnej lub poluzować w przypadku zmienności gradientu) i tolerancji ruchliwości jonów (IM) (domyślnie 0,05 1/k0 [odwrócona ograniczona ruchliwość]; korekta na podstawie precyzji IM), filtrowane według ≤1% FDR (False Discovery Rate; domyślny jon MBR FDR=0,01; niższy do 0,005 dla rygoru). Wnioskowanie o białkach wykorzystuje uniquer+rascor (przypisanie peptydu brzytwy do grupowania białek). Wykrywanie cech wykorzystuje tolerancję masy 10 ppm (wzrost do 20 ppm dla MS o niskiej rozdzielczości lub spadek do 5 ppm dla wysokiej rozdzielczości).
  9. Teraz kliknij kartę Uruchom . Wybierz pozycję Katalog wyjściowy. Kliknij URUCHOM , aby rozpocząć analizę danych (Rysunek 6B).
    UWAGA: W przypadku danych proteomicznych bez znaczników, które nie koncentrują się na modyfikacjach lub nie używają kwantyfikacji opartej na znacznikach, nie stosuje się PTM, gliko i zakładki ilościowe (izobaryczne).

4. Analiza DIA-NN/FragPipe

UWAGA: Szczegółowe kody użyte w tym badaniu są zawarte jako Plik Uzupełniający 1 i Plik Uzupełniający 2. Wersje pakietów użyte w tym badaniu można znaleźć w pliku uzupełniającym 3.

  1. Otwórz program RStudio i odczytaj dane dotyczące ekspresji białek wygenerowane przez DIA-NN lub FragPipe. Do analizy zwykle używa się danych macierzy grup białkowych kończących się na .pg_matrix.tsv z DIA-NN oraz połączonych danych białkowych kończących się na .tsv z FragPipe.
  2. Usuń brakujące wartości bez wypełniania NA i odfiltruj grupy białek zidentyfikowane i oznaczone ilościowo za pomocą mniej niż dwóch unikalnych peptydów.
    UWAGA: Dane DIA w tym badaniu zostały wygenerowane przez przefiltrowane grupy białek, podczas gdy dane DDA pochodziły z niefiltrowanych grup białkowych.
  3. Normalizuj intensywność białek przy użyciu skalowania mediany lub normalizacji kwantylowej w próbkach. Dane DIA w tym badaniu zostały znormalizowane przez normalizację mediany, podczas gdy dane DDA przez normalizację kwantylu, aby lepiej zademonstrować te dwie metody.
    UWAGA: Normalizacja mediany jest odporna na wartości odstające i odpowiednia dla scenariuszy, w których większość białek pozostaje niezmieniona w próbkach, dzięki czemu mediana obfitości białek jest stabilnym punktem odniesienia. Jednak może się nie udać w scenariuszach z białkami o wysokiej zróżnicowanej ekspresji18. Normalizacja kwantylowa zapewnia równomierny rozkład obfitości białek w próbkach, co jest pomocne przy porównywaniu próbek o różnych rozkładach. Wykazano, że zmniejsza moc statystyczną i może nadmiernie normalizować dane, potencjalnie maskując prawdziwe różnice biologiczne18. W proteomice normalizacja mediany jest szeroko stosowana w badaniach bez znaczników w celu usunięcia systematycznych błędów systematycznych związanych z wydajnością urządzenia SM. Normalizacja kwantylu jest preferowana w przypadku zestawów danych na dużą skalę, analizy wyrażeń różnicowych i analizy skupień19,20.
  4. Oblicz log2-krotne zmiany (np. surowica PDAC w porównaniu z normalną) i wartości p testu t. Oblicz skorygowane wartości p za pomocą metody Benjaminiego-Hochberga. Zdefiniuj progi istotności (np. |log2FC| > 1, p_adj (FDR) < 0,05).
    UWAGA: Wartości odcięcia p wykorzystane w tym badaniu reprezentują wartości surowe, ponieważ zastosowanie skorygowanych wartości p (p_adj) wyeliminowałoby wszystkie wykrywalne białka w mocy statystycznej tych ograniczonych zestawów danych.
  5. Sprawdź, czy istnieją wartości braków/NA i wyklucz je. Wygeneruj wykres wulkanu, aby zwizualizować znaczące trafienia.
  6. Wybierz znacznie rozregulowane białka. Zastosuj normalizację Z-score do wartości ekspresji białka. Kreślenie grupowej mapy cieplnej z przykładowymi adnotacjami grupowymi.
  7. Mapuj białka do identyfikatorów Entrez za pomocą org. Hs.eg.db. Wykonaj wzbogacanie GO (proces biologiczny) i analizę szlaku KEGG.
    UWAGA: Kategorie procesów biologicznych (BP) są powszechnie wybierane w analizie ontologii genów (GO), ponieważ opisują większe procesy lub programy biologiczne realizowane przez wiele aktywności molekularnych20. Terminy te koncentrują się na funkcjach komórkowych, które zawodzą w chorobach takich jak rak, w tym na podstawowych procesach, takich jak regulacja cyklu komórkowego, procesy metaboliczne itp. Oprócz BP, analiza GO obejmuje również kategorie funkcji molekularnych (MF) i składnika komórkowego (CC). Terminy MF określają biochemiczne aktywności produktów genowych, takie jak transport jonów lub zdolności wiązania DNA. Terminy CC określają lokalizacje komórkowe, w których produkty genów pełnią swoje funkcje, takie jak jądro, błona mitochondrialna lub cytoszkielet.
  8. Wykonywanie zapytań dotyczących interakcji ≥ bazy danych STRINGdb (współczynnik ufności 400). Wygeneruj interaktywną sieć za pomocą visNetwork.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aby lepiej zilustrować poszukiwanie zestawów danych proteomicznych, wybraliśmy dwa typy zestawów danych do tej analizy. Dążąc do wykazania rozregulowanych białek w kontekście klinicznym, przeprowadziliśmy poszukiwania w PRIDE przy użyciu słów kluczowych, takich jak clinic. W szczególności wybraliśmy zestaw danych odpowiedni do analizy DIA z Konsorcjum Klinicznej Analizy Proteomicznej Nowotworów (CPTAC)21 oraz inny odpowiedni do analizy DDA z Chińskiego Projektu Pro...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Prezentowany protokół ilustruje analizę danych proteomicznych poprzez integrację bezpłatnych narzędzi, takich jak DIA-NN i FragPipe. Sukces zależy od kluczowych kroków, takich jak dokładny wybór jonów prekursorowych i ustawienia dokładności masy do generowania biblioteki spektralnej w DIA-NN (krok 2.3)27, które są zależne od instrumentu i mają kluczowe znaczenie dla pełnej identyfikacji peptydów. Podobnie, skrupulatna konfiguracja bazy danych w FragPipe (krok 3.4), w tym generowanie wabików i filt...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

F.Z. jest założycielem Molemuse Biotech Studio.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Projekt jest wspierany przez Molemuse Biotech Studio.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Zestaw .NET SDK w wersji 9.0.203Firmy Microsofthttps://dotnet.microsoft.com/en-us/download
DIA-NN w wersji 2.1.0https://github.com/vdemichev/DiaNN/releases/tag/2.0 
FragPipe v. 22.0https://github.com/Nesvilab/FragPipe/releases
MSFileReader w wersji 3.1 Rybak termicznyhttps://github.com/thermofisherlsms/MSFileReader/blob/main/MSFileReader_x64.exe
R 4.5.0https://cran.rstudio.com/bin/windows/base/R-4.5.0-win.exe
Rstudio v. 2024.12.1+563https://posit.co/download/rstudio-desktop/

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pedrioli, P. G. A., et al. A common open representation of mass spectrometry data and its application to proteomics research. Nat Biotechnol. 22 (11), 1459-1466 (2004).
  2. Perez-Riverol, Y., et al. The PRIDE database at 20 years: 2025 update. Nucl Acids Res. 53 (D1), D543-D553 (2025).
  3. Deutsch, E. W., et al. Proteomics Standards Initiative at Twenty Years: Current Activities and Future Work. J Proteome Res. 22 (2), 287-301 (2023).
  4. Schubert, O. T., Röst, H. L., Collins, B. C., Rosenberger, G., Aebersold, R. Quantitative proteomics: challenges and opportunities in basic and applied research. Nat Protoc. 12 (7), 1289-1294 (2017).
  5. Wang, X., Shen, S., Rasam, S. S., Qu, J. MS1 ion current-based quantitative proteomics: A promising solution for reliable analysis of large biological cohorts. Mass Spectro Rev. 38 (6), 461-482 (2019).
  6. Vaudel, M. MS2-Based Quantitation. Proteome Inform. , 155-177 (2016).
  7. Meyer, J. G. Qualitative and Quantitative Shotgun Proteomics Data Analysis from Data-Dependent Acquisition Mass Spectrometry. Shotgun Proteomics. 2259, 297-308 (2021).
  8. Fröhlich, K., et al. Data-Independent Acquisition: A Milestone and Prospect in Clinical Mass Spectrometry-Based Proteomics. Mol Cell Proteomics. 23 (8), 100800(2024).
  9. Zhang, F., Ge, W., Ruan, G., Cai, X., Guo, T. Data-Independent Acquisition Mass Spectrometry-Based Proteomics and Software Tools: A Glimpse in 2020. Proteomics. 20 (17-18), 1900276(2020).
  10. Deutsch, E. W., et al. The ProteomeXchange consortium at 10 years: 2023 update. Nucl Acids Res. 51 (D1), D1539-D1548 (2023).
  11. Demichev, V., Messner, C. B., Vernardis, S. I., Lilley, K. S., Ralser, M. DIA-NN:neural networks and interference correction enable deep proteome coverage in high throughput. Nat Meth. 17 (1), 41-44 (2020).
  12. Zhang, F., et al. A Comparative Analysis of Data Analysis Tools for Data-Independent Acquisition Mass Spectrometry. Mol Cell Proteomics. 22 (9), 100623(2023).
  13. Kong, A. T., Leprevost, F. V., Avtonomov, D. M., Mellacheruvu, D., Nesvizhskii, A. I. MSFragger: ultrafast and comprehensive peptide identification in mass spectrometry-based proteomics. Nat Meth. 14 (5), 513-520 (2017).
  14. Anderson, N. L., Anderson, N. G. The Human Plasma Proteome. Mol Cell Proteomics. 1 (11), 845-867 (2002).
  15. Kowal, J., et al. Proteomic comparison defines novel markers to characterize heterogeneous populations of extracellular vesicle subtypes. Proc Natl Acad Sci. 113 (8), E968-E977 (2016).
  16. Cao, L., et al. Proteogenomic characterization of pancreatic ductal adenocarcinoma. Cell. 184 (19), 5031-5052.e26 (2021).
  17. Dong, L., et al. Proteogenomic characterization identifies clinically relevant subgroups of intrahepatic cholangiocarcinoma. Cancer Cell. 40 (1), 70-87.e15 (2022).
  18. Dubois, E., Galindo, A. N., Dayon, L., Cominetti, O. Comparison of normalization methods in clinical research applications of mass spectrometry-based proteomics. 2020 IEEE Conf Computat Intelligence Bioinfo Computat Biol. , 1-10 (2020).
  19. Dressler, F. F., Brägelmann, J., Reischl, M., Perner, S. Normics: Proteomic Normalization by Variance and Data-Inherent Correlation Structure. Mol Cell Proteomics. 21 (9), 100269(2022).
  20. Dimmer, E. C., et al. The Gene Ontology - Providing a Functional Role in Proteomic Studies. Proteomics. 8 (23-24), pmic.200800002(2008).
  21. Lih, T. M., et al. Detection of Pancreatic Ductal Adenocarcinoma-Associated Proteins in Serum. Mol Cell Proteomics. 23 (1), 100687(2024).
  22. Chinese Human Proteome Project (CNHPP) Consortium. Proteomics identifies new therapeutic targets of early-stage hepatocellular carcinoma. Nature. 567 (7747), 257-261 (2019).
  23. Kanehisa, M., Furumichi, M., Sato, Y., Matsuura, Y., Ishiguro-Watanabe, M. KEGG: biological systems database as a model of the real world. Nucl Acids Res. 53 (D1), D672-D677 (2025).
  24. Campello, E., Ilich, A., Simioni, P., Key, N. S. The relationship between pancreatic cancer and hypercoagulability: a comprehensive review on epidemiological and biological issues. Br J Cancer. 121 (5), 359-371 (2019).
  25. Fang, L., Xu, Q., Qian, J., Zhou, J. Y. Aberrant Factors of Fibrinolysis and Coagulation in Pancreatic Cancer. OncoTargets Ther. 14, 53-65 (2021).
  26. Vlodavsky, I., Elkin, M., Ilan, N. Impact of heparanase and the tumor microenvironment on cancer metastasis and angiogenesis: basic aspects and clinical applications . Rambam Maimonides Med J. 2 (1), (2011).
  27. Fröhlich, K., et al. Benchmarking of analysis strategies for data-independent acquisition proteomics using a large-scale dataset comprising inter-patient heterogeneity. Nat Comm. 13 (1), 2622(2022).
  28. Polasky, D. A., et al. MSFragger-Labile: A Flexible Method to Improve Labile PTM Analysis in Proteomics. Mol Cell Proteomics. 22 (5), 100538(2023).
  29. Gerault, M. A., Camoin, L., Granjeaud, S. DIAgui: a Shiny application to process the output from DIA-NN. Bioinfo Adv. 4 (1), (2024).
  30. Hsiao, Y., et al. Analysis and Visualization of Quantitative Proteomics Data Using FragPipe-Analyst. J Proteome Res. 23 (10), 4303-4315 (2024).
  31. Yu, F., Deng, Y., Nesvizhskii, A. I. MSFragger-DDA+ enhances peptide identification sensitivity with full isolation window search. Nat Comm. 16 (1), 3329(2025).
  32. Li, K., Teo, G. C., Yang, K. L., Yu, F., Nesvizhskii, A. I. diaTracer enables spectrum-centric analysis of diaPASEF proteomics data. Nat Comm. 16 (1), 95(2025).
  33. Qiao, R., Li, H., Bian, H., Xin, L., Shan, B. De Novo sequencing-assisted homology search for DIA data analysis enables low abundance peptide variants discovery. Biorvix. 10, (2025).
  34. Meissner, F., Geddes-McAlister, J., Mann, M., Bantscheff, M. The emerging role of mass spectrometry-based proteomics in drug discovery. Nat Rev Drug Disc. 21 (9), 637-654 (2022).
  35. Zheng, Y., et al. Multi-omics data integration using ratio-based quantitative profiling with Quartet reference materials. Nat Biotechnol. 42 (7), 1133-1149 (2024).
  36. Bubis, J. A., et al. Challenging the Astral mass analyzer to quantify up to 5,300 proteins per single cell at unseen accuracy to uncover cellular heterogeneity. Nat Meth. 22 (3), 510-519 (2025).
  37. Leutert, M., Entwisle, S. W., Villén, J. Decoding Post-Translational Modification Crosstalk With Proteomics. Mol Cell Proteomics. 20, 100129(2021).
  38. Schneider, M., et al. A Scalable, Web-Based Platform for Proteomics Data Processing, Result Storage and Analysis. Proteome Res. 24 (3), 1241-1249 (2025).
  39. Jalili, V., et al. The Galaxy platform for accessible, reproducible and collaborative biomedical analyses: 2020 update. Nucl Acids Res. 48 (W1), W395-W402 (2020).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Proteomic Data AnalysisData Dependent AcquisitionData Independent AcquisitionProtein QuantificationVolcano PlotGene Ontology AnalysisKEGG Pathway AnalysisProtein Interaction Network

Powiązane artykuły