Opisany powyżej schemat postępowania zastosowano do zbioru danych MS dostępnego w repozytorium PRIDE38,39. W pierwotnym badaniu opracowano metodę (iMixPro), wykorzystującą znakowanie stabilnymi izotopami aminokwasów w hodowli komórkowej (SILAC), aby wyeliminować wyniki fałszywie dodatnie w eksperymentach MS z oczyszczaniem powinowactwem (AP-MS)38. W skrócie, eksperyment AP-MS polega na wykorzystaniu przeciwciał związanych z koralikami do wyizolowania białka zainteresowania (przynęty) oraz jego interaktorów (ofiar). Zebrane białka są następnie trawione i przygotowywane do analizy MS. Metoda przygotowania próbek oraz ustawienia instrumentu zostały opisane w pierwotnym badaniu oraz w repozytorium PRIDE (PXD004246). Wyzwaniem w tego typu eksperymentach jest duża liczba wyników fałszywie dodatnich, w szczególności białek wiążących się z koralikami, a nie z przynętą. W tym przypadku wykorzystano metodę SILAC do wygenerowania różnych stosunków izotopowych między prawdziwymi ofiarami a wynikami fałszywie dodatnimi: 3 próbki kontrolne (bez przynęty) hodowane w medium lekkim, 1 próbka wykazująca ekspresję przynęty hodowana w medium lekkim oraz 1 próbka wykazująca ekspresję przynęty hodowana w medium ciężkim są poddawane obróbce z użyciem koralików i dalszej analizie spektrometrią mas. Przy takim projekcie białka nieswoiste wiążące się z koralikami będą miały stosunek ciężki do lekkiego wynoszący 1:4, podczas gdy prawdziwe ofiary będą miały stosunek 1:138.
Dokonaliśmy ponownej analizy ich danych AP-MS z wykorzystaniem bazy danych OpenProt; jako białka-przynęty (baits) zastosowano trzy białka endogenne (PTPN14, JIP3 i IQGAP1) oraz dwa białka nadeksponowane (RAF1 i RNF41). Ponieważ w eksperymentach wykorzystano metodę SILAC, zastosowano przepływ pracy (workflow) Galaxy do kwantyfikacji białek (Materiał uzupełniający S3, Rycina 2). Workflow uruchomiono z wykorzystaniem pełnej bazy danych OpenProt (OpenProt_all) lub ograniczonej bazy danych OpenProt (OpenProt_2pep, obejmującej wyłącznie białka wykryte wcześniej przy użyciu minimum dwóch unikalnych peptydów).
Identyfikacja i kwantyfikacja białek były prawidłowe i powtarzalne we wszystkich zastosowanych bazach danych. Jak pokazano na Rysunku 3, większość białek zidentyfikowanych w oryginalnej pracy została również zidentyfikowana przy użyciu bazy OpenProt_2pep lub OpenProt_all (szczegółowa lista znajduje się w Materiałach uzupełniających S5). Wynik ten dowodzi, że opisany tutaj proces oraz bazy danych OpenProt pozwalają na identyfikację i kwantyfikację białek porównywalną z aktualnymi procedurami opartymi na bazach UniProtKB40. Jednakże zastosowanie baz OpenProt daje unikalną korzyść w postaci możliwości wykrywania nowych i wcześniej niewykrywalnych białek, co wykazano w niniejszym studium przypadku.
W ramach wszystkich zbiorów danych, z wykorzystaniem pewnych peptydów i bazy danych OpenProt_2pep, zidentyfikowano 11 dobrze udokumentowanych białek (1 izoformę i 10 AltProt), które obecnie nie są adnotowane w bazach danych (wszystkie numery dostępowe białek wraz z liczbą peptydów potwierdzających są dostępne w Materiałach uzupełniających S5). Baza ta pozwala na zastosowanie tradycyjnego poziomu FDR wynoszącego 1%, ponieważ wzrost przestrzeni przeszukiwań pozostaje umiarkowany. Te 11 białek nie zostało zidentyfikowanych w oryginalnym badaniu, ponieważ nie było ich w bazie danych.
W wszystkich zestawach danych, przy zastosowaniu pewnych peptydów oraz bazy danych OpenProt_all, odkryto 29 nowych białek (16 izoform i 13 AltProts; wszystkie numery dostępu białek wraz z liczbą peptydów potwierdzających są dostępne w Materialach Suplementarnych S6). Jak pokazano na Rysunku 3, zalecany rygorystyczny poziom FDR nie wpłynął na najbardziej wiarygodne identyfikacje białek, choć zmniejszył całkowitą liczbę zidentyfikowanych białek. W porównaniu z bazą danych OpenProt_2pep, można z większą pewnością zidentyfikować większą liczbę nowych białek. Wszystkie te nowe białka nie występują w bazie OpenProt_2pep. Podkreśla to kluczową rolę wyboru bazy danych w proteomice opartej na MS.
Odkryto jedno nowe białko będące interaktorem białka RAF1 (IP_637643). Korzystając ze strony OpenProt, można zauważyć, że białko to nie zostało dotąd wykryte za pomocą MS ani profilowania rybosomów (OpenProt v1.3). Białko składa się z 46 aminokwasów i podczas trawienia trypsyną może dostarczyć tylko dwa unikalne peptydy. Peptyd wykryty w zbiorze danych RAF1 AP-MS (frakcja 18) posiadał widmo dobrej jakości, co pokazano na Rysunku 4, i wykazywał stosunek ciężkiego do lekkiego izotopu na poziomie 1,09. Białko jest kodowane przez gen NANOGNBP1, który jest pseudogenem NANOGNB. Transkrypty (ENST00000448444), obecnie adnotowane jako niekodujące, zostały wykryte w kilku tkankach zgodnie z portalem GTEx40. Białko zawiera przewidywaną funkcjonalną domenę związaną z wiązaniem DNA (Gene Ontology GO:0003677)41.

Rysunek 1: Schemat wyboru bazy danych dla analiz proteomicznych. Analizy danych MS, a w szczególności wybór bazy danych, zależą od celów badawczych. Trzy powszechne cele przedstawiono w kolorze niebieskim (klasyczny potok proteomiczny), zielonym (wyczerpujące przeszukiwanie proteomiczne) i pomarańczowym (odkrywanie proteomiczne). Każdy cel wymaga zastosowania odpowiedniej bazy danych i potoku analizy. Do wyczerpującego i klasycznego potoku proteomicznego można użyć jednego narzędzia do identyfikacji. W przypadku potoku odkrywania proteomicznego zdecydowanie zalecamy stosowanie wielu silników identyfikacyjnych. Zalecane wartości FDR zaznaczono na czerwono, a wielkości baz danych białek wskazano w szarych polach. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 2: Graficzna reprezentacja wykorzystanego przepływu pracy w Galaxy.Krok po kroku przedstawiono schemat analizy proteomicznej zastosowany do ponownej analizy danych Eyckermana i wsp.38. Pliki wejściowe, wyszukiwanie peptydów i kwantyfikacja białek są oznaczone pomarańczowymi polami. Niebieskie pola odpowiadają wykorzystanym narzędziom, a szare pola odpowiadają wygenerowanym plikom wyjściowym. Różne wyszukiwarki (MS-GF+ i X!Tandem) są oznaczone różnymi kolorami (odpowiednio czerwonym i fioletowym), a strzałki wskazują ich niezbędne dane wejściowe i wyjściowe. Zielone pole wyróżnia narzędzie generujące listę identyfikacji białek. W przypadku wygenerowania wielu plików wyjściowych, ten wykorzystany w kolejnych krokach jest zaznaczony jako najbliższy strzałce. Ten przepływ pracy jest dostępny bezpłatnie w Materialach Uzupełniających S2. Plik konfiguracyjny z domyślnymi parametrami X!Tandem jest dostępny w Materialach Uzupełniających S4. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 3: Porównanie identyfikacji interaktorów dla poszczególnych białek przynęty przy użyciu różnych baz danych. Diagramy Venna identyfikacji białek z wykorzystaniem najbardziej wiarygodnej bazy OpenProt (na pomarańczowo, dowody potwierdzające w postaci minimum 2 unikalnych peptydów, OpenProt_2pep) z FDR 1%, całej bazy OpenProt (na niebiesko, OpenProt_all) z FDR 0,001% lub zgodnie z raportem w oryginalnej pracy38 (na szaro). Każdy diagram odpowiada zidentyfikowanym interaktorom dla wymienionych białek przynęty: RAF1, RNF41, PTPN14, JIP3 oraz IQGAP1. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.

Rycina 4: Widmo MS/MS zidentyfikowanego peptydu MDNLWAK(13C6) z nowego białka IP_637643. Intensywność jest względna (od 0 do 100%). Wybrane piki zaznaczono na czerwono, adnotacje jonów y są w kolorze ciemnoczerwonym, a adnotacje jonów b w kolorze zielonym. Wygenerowano w oprogramowaniu TOPPview34. Błąd prekursora = 2,70 ppm, wynik PEP = 0,12. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
| Termin | Definicja | Literatura |
| Alternatywna ramka odczytu (AltORF) | niekanoniczna ramka odczytu (ORF), która obecnie nie jest opisana w adnotacjach genomu, ale została opisana w OpenProt. | 15 |
| Referencyjna otwarta ramka odczytu (RefORF) | kanoniczna ORF adnotowana w adnotacjach genomowych oraz w OpenProt. | 15 |
| Alternatywne białka (AltProt) | nowe białko kodowane przez AltORF, bez istotnego podobieństwa do RefProt. Przedrostek numeru dostępu: IP_. | 15 |
| Białko referencyjne (RefProt) | białko obecnie adnotowane w bazach danych sekwencji białkowych, takich jak UniProtKB, Ensembl lub NCBI RefSeq, a także w OpenProt. | 15 |
| Nowa izoforma | nowe białko kodowane przez AltORF, wykazujące istotne podobieństwo do RefProt. Przedrostek numeru dostępu: II_. | 15 |
| Baza danych OpenProt_2pep | zawiera sekwencje wszystkich białek referencyjnych (RefProts) oraz nowych białek przewidzianych przez OpenProt, które zostały już wykryte przy użyciu minimum 2 unikalnych peptydów. | 15 |
| baza danych OpenProt_1pep | zawiera sekwencje wszystkich RefProtów oraz nowych białek przewidzianych przez OpenProt, które zostały już wykryte przy użyciu minimum 1 unikalnego peptydu. | 15 |
| Baza danych OpenProt_all | zawiera sekwencje wszystkich białek referencyjnych (RefProts) oraz nowych białek przewidzianych przez OpenProt. | 15 |
Tabela 1: Definicje terminów używanych w OpenProt oraz w całym protokole
Materiał uzupełniający S1: Przepływ pracy w programie Galaxy do obsługi bazy danych. Operacja ta dołączy sekwencje CRAPome oraz sekwencje decoy (odwrócone) do bazy wejściowej. Wynikiem jest plik Fasta. Kliknij tutaj, aby pobrać.
Materiał uzupełniający S2: Przepływ pracy w systemie Galaxy do identyfikacji białek. Służy on do identyfikacji białek z pliku danych spektrometrii mas przy użyciu dwóch wyszukiwarek (MS-GF+ oraz X!Tandem). Każdy parametr można dostosować według uznania przed uruchomieniem przepływu pracy. Kliknij tutaj, aby pobrać.
Materiał uzupełniający S3: Przepływ pracy Galaxy dla kwantyfikacji białek z wykorzystaniem znakowania stabilnymi izotopami (SIL). Narzędzie to służy do identyfikacji i kwantyfikacji białek z pliku danych spektrometrii mas przy użyciu dwóch silników wyszukiwania (MS-GF+ oraz X!Tandem). Każdy parametr można dostosować według uznania przed uruchomieniem przepływu pracy. Kliknij tutaj, aby pobrać.
Materiał uzupełniający S4: Plik konfiguracyjny parametrów domyślnych X!Tandem.Ten plik XML jest niezbędny do uruchomienia narzędzia X!TandemAdapter na platformie Galaxy. Prosimy kliknąć tutaj, aby pobrać.
Materiał uzupełniający S5: Ilościowe oznaczenia białek z zestawów danych iMixPro.Pliki danych z pracy Eyckerman i wsp. 201638 zostały przetworzone przy użyciu baz danych OpenProt i wyliczono ilość białek dla każdego wariantu. Jako przynęty (baits) zastosowano PTPN14, JIP3, IQGAP1, RAF1 oraz RNF41. Nazwy genów zaznaczone na zielono odpowiadają białkom zidentyfikowanym również w oryginalnej publikacji38. Nazwy genów zaznaczone na pomarańczowo odpowiadają znanym interaktorom według bazy BioGrid, które nie zostały opisane w oryginalnej publikacji. Nazwy genów zaznaczone na jasnoniebiesko odpowiadają nowym białkom zidentyfikowanym jako interaktory (odpowiedni numer dostępowy białka podano w nawiasach). Nazwy genów zaznaczone na jasnoszaro i pisane kursywą odpowiadają prawdopodobnym zanieczyszczeniom (białka keratyny). Kliknij tutaj, aby pobrać.
Materiał uzupełniający S6: Nowe białka zidentyfikowane w zbiorach danych iMixPro.Pliki danych z publikacji Eyckerman i wsp. 201638 zostały przetworzone przy użyciu baz danych OpenProt, a nowo zidentyfikowane białka są wymienione dla każdego warunku. Przynętami są PTPN14, JIP3, IQGAP1, RAF1 oraz RNF41. Wymieniono numery akcesyjne białek, zaczynające się od II_ dla nowych izoform znanego białka oraz od IP_ dla nowych białek z alternatywnej otwartej ramki odczytu (AltProt). Liczba peptydów potwierdzających jest podana w nawiasach. Kliknij tutaj, aby pobrać.