Reprezentatywne wyniki uzyskano po zastosowaniu tego protokołu w celu zbadania powiązań między białkami mitochondrialnymi (Tabela 2) a ośmioma kategoriami chorób sercowo-naczyniowych (Tabela 3). W tych kategoriach znaleźliśmy 363 567 publikacji wydanych od 2012 roku do października 2022 roku (362 878 skategoryzowanych na podstawie metadanych MeSH, 6 923 skategoryzowanych poprzez imputację etykiet). Wszystkie publikacje posiadały tytuły, 276 524 posiadały streszczenia, a 51 065 posiadało dostępny pełny tekst. Ogółem z 1 687 analizowanych białek mitochondrialnych zidentyfikowano w publikacjach 584, natomiast z 8 026 analizowanych białek funkcjonalnie powiązanych zidentyfikowano 3 284. Łącznie zidentyfikowano 14 unikalnych białek z istotnymi wyników we wszystkich kategoriach chorób, przy przyjęciu progu z-score wynoszącego 3,0 (Rysunek 5). Analiza szlaków Reactome dla tych białek wykazała 12 szlaków istotnych dla wszystkich chorób (Rysunek 6). Wszystkie białka, szlaki, choroby i wyniki zostały zintegrowane w grafie wiedzy (Tabela 4). Graf wiedzy ten wykorzystano do przewidzenia 12 688 nowych powiązań białko-choroba, a następnie przefiltrowano je przy użyciu wyniku prawdopodobieństwa 0,90, co pozwoliło uzyskać 1 583 przewidywań o wysokiej pewności. Przykład dwóch powiązań białko-choroba przedstawiono na Rysunku 7, zilustrowany w kontekście innych istotnych encji biologicznych funkcjonalnie powiązanych z białkami. Metryki oceny modelu przedstawiono w Tabeli 5.

Rysunek 1: Dynamiczny widok schematu przepływu pracy. Rysunek ten przedstawia cztery główne etapy tego procesu. Po pierwsze, odpowiednie białka są selekcjonowane na podstawie dostarczonych przez użytkownika terminów GO (np. składników komórkowych), a kategorie chorób są przygotowywane na podstawie dostarczonych przez użytkownika identyfikatorów MeSH dla chorób. Po drugie, w etapie wydobywania tekstu (text-mining) obliczane są powiązania między białkami a chorobami. Publikacje z określonego zakresu dat są pobierane i indeksowane. Identyfikowane są publikacje dotyczące chorób (poprzez etykiety MeSH i opcjonalnie poprzez etykiety imputowane), a następnie ich pełne teksty są pobierane i indeksowane. Nazwy białek są wyszukiwane w publikacjach i wykorzystywane do obliczenia wyników powiązań białko-choroba. Następnie, po wydobyciu tekstu, wyniki te pomagają zidentyfikować najważniejsze powiązania między białkami a szlakami sygnałowymi. Na koniec konstruowany jest graf wiedzy obejmujący te białka, choroby oraz ich relacje w ramach bazy wiedzy biomedycznej. Nowe powiązania białko-choroba są przewidywane na podstawie skonstruowanego grafu wiedzy. Kroki te wykorzystują najnowsze dostępne dane z biomedycznych baz wiedzy oraz PubMed. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 2Architektura techniczna przepływu pracy. Szczegóły techniczne tego schematu postępowania przedstawiono na poniższej rysunku. Użytkownik podaje numery drzew MeSH dla kategorii chorób oraz terminy GO. Dokumenty tekstowe są pobierane z bazy PubMed, dokumenty powiązane z chorobami są identyfikowane na podstawie podanych etykiet MeSH, a dokumenty pozbawione etykiet MeSH wskazujących na temat otrzymują przypisane etykiety kategorii. Pobierane są białka powiązane z podanymi terminami GO. Zbiór białek ten jest rozszerzany o białka powiązane funkcjonalnie. poprzez oddziaływania białko-białko, wspólne szlaki biologiczne oraz zależność od czynników transkrypcyjnych. Białka te są analizowane w dokumentach związanych z danymi chorobami, a następnie oceniane przez CaseOLAP. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 3: Przykład przetworzonego dokumentu. Przedstawiono tutaj przykład przeanalizowanego i zaindeksowanego dokumentu tekstowego. Kolejno, odpowiednie pola wskazują nazwę indeksu (_index, _type), identyfikator PubMed (_id, pmid), podsekcje dokumentu (title, abstract, full_text, introduction, methods, results, discussion) oraz inne metadane (year, MeSH, location, journal). Wyłącznie w celu prezentacji, podsekcje dokumentu zostały skrócone za pomocą wielokropków. Pole MeSH zawiera tematy dokumentu, które mogą być czasami dostarczone przez nasz etap imputacji etykiet. Aby wyświetlić większą wersję tego rysunku, kliknij tutaj.

Rycina 4: Schemat grafu wiedzy i zasoby biomedyczne. Ta rycina przedstawia schemat grafu wiedzy. Każdy węzeł i krawędź reprezentują odpowiednio typ węzła lub typ krawędzi. Krawędzie między chorobami układu sercowo-naczyniowego (CVDs) a białkami są ważone wynikami CaseOLAP. Krawędzie interakcji białko-białko (PPI) są ważone wynikami zaufania STRING. Krawędzie zależności czynników transkrypcyjnych (TFD) pochodzące z GRNdb/GTEx, krawędzie drzewa chorób pochodne z MeSH oraz krawędzie szlaków pochodne z reactome są nieważone. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 5: Najważniejsze powiązania białko-choroba. Na tym rysunku przedstawiono białka mitochondrialne istotne dla każdej kategorii chorób. Transformacja z-score została zastosowana do wyników CaseOLAP w obrębie każdej kategorii, aby zidentyfikować istotne białka przy użyciu progu 3,0. (Góra) Liczba białek mitochondrialnych istotnych dla każdej choroby: te wykresy skrzypcowe obrazują rozkład z-score dla białek w każdej kategorii chorób. Całkowita liczba białek istotnych dla każdej kategorii chorób jest podana nad każdym wykresem. W sumie 14 unikalnych białek zostało zidentyfikowanych jako istotne dla wszystkich chorób, a niektóre białka były istotne dla wielu jednostek chorobowych. (Dół) Białka z najwyższymi wynikami: mapa ciepła przedstawia 10 białek, które uzyskały najwyższe średnie z-score we wszystkich badanych chorobach. Puste wartości oznaczają brak uzyskanego wyniku pomiędzy białkiem a chorobą. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 6Najważniejsze powiązania między szlakami a chorobami. Rysunek ten przedstawia najważniejsze szlaki biologiczne powiązane z analizowanymi kategoriami chorób, określone na podstawie poprzez analiza szlaków Reactome. Wszystkie analizy szlaków zostały przefiltrowane przy użyciu p < 0,05. Wartości na mapie ciepła reprezentują średni wynik z dla wszystkich białek w danej ścieżce. (Góra) Szlaki zachowane we wszystkich chorobach: Ogólnie zidentyfikowano 14 białek istotnych dla wszystkich kategorii chorób oraz ujawniono 12 szlaków zachowanych we wszystkich kategoriach chorób. Na podstawie hierarchicznej struktury szlaków skonstruowano dendrogram, aby powiązać szlaki o podobnych funkcjach biologicznych. Wysokość dendrogramu reprezentuje względną głębokość w hierarchii szlaków; szerokie funkcje biologiczne mają dłuższe ramiona, a bardziej specyficzne szlaki mają krótsze ramiona. (Dół) Ścieżki charakterystyczne dla kategorii choroby: Analizę ścieżek przeprowadzono z wykorzystaniem białek, które uzyskały istotny wynik z-score w każdej chorobie. Trzy ścieżki o najniższych pWartości p powiązane z każdą chorobą są przedstawione i oznaczone gwiazdkami. Te same szlaki metaboliczne mogły znaleźć się w pierwszej trójce w przypadku wielu chorób. Kliknij tutaj, aby wyświetlić powiększoną wersję tej figury.

Rysunek 7: Zastosowanie głębokiego uczenia do uzupełniania grafu wiedzy. Na tym rysunku przedstawiono przykład zastosowania głębokiego uczenia w odniesieniu do specyficznego dla danej choroby grafu wiedzy. Przewidziane zostały ukryte relacje między białkami a chorobą, które zaznaczono kolorem niebieskim. Wyświetlono obliczone prawdopodobieństwa dla obu przewidywań, gdzie wartości wahają się od 0,0 do 1,0, a 1,0 oznacza silne przewidywanie. Uwzględniono kilka białek o znanych oddziaływaniach, reprezentujących oddziaływania białko-białko, zależność od czynników transkrypcyjnych oraz wspólne szlaki biologiczne. W celu wizualizacji przedstawiono podgraf składający się z kilku węzłów istotnych dla wyróżnionego przykładu. Legenda: IHD = niedokrwienna choroba serca; R-HSA-1430728 = metabolizm; O14949 = podjednostka 8 kompleksu cytochromu b-c1; P17568 = podjednostka 7 beta subkompleksu dehydrogenazy NADH (ubichinonu); Q9NYF8 = czynnik transkrypcyjny 1 związany z Bcl-2, wynik: 7,24 x 10−7; P49821 = flawoproteina 1 dehydrogenazy NADH (ubichinonu), mitochondrialna, wynik: 1,06 x 10−5; P31930 = podjednostka 1 kompleksu cytochromu b-c1, mitochondrialna, wynik: 4,98 x 10−5; P99999 = cytochrom c, wynik: 0,399. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Tabela 1: Przepływ pracy i etapy krytyczne. Tabela ta przedstawia szacunkowy czas obliczeniowy dla każdego etapu przepływu pracy. Decyzje dotyczące włączenia poszczególnych komponentów potoku zmienią całkowity czas uruchomienia niezbędny do ukończenia analizy. Całkowita szacunkowa wartość czasu różni się w zależności od dostępnych zasobów obliczeniowych, w tym specyfikacji sprzętowej i ustawień oprogramowania. Według szacunków protokół wymagał 36 h aktywnego czasu pracy na naszym serwerze obliczeniowym, wyposażonym w sześć rdzeni, 32 Gb pamięci RAM i 2 Tb przestrzeni dyskowej, jednak na innych urządzeniach proces ten może przebiegać szybciej lub wolniej. Prosimy kliknąć tutaj, aby pobrać tę tabelę.
Tabela 2: Automatyczny montaż białek komponentów komórkowych. Tabela ta przedstawia liczbę białek związanych z danym komponentem komórkowym (tzn. terminem GO) oraz białka z nimi powiązane funkcjonalnie poprzez oddziaływania białko-białko (PPI), wspólne szlaki (PW) oraz zależność od czynników transkrypcyjnych (TFD). Całkowita liczba białek stanowi sumę białek ze wszystkich powyższych kategorii. Wszystkie białka powiązane funkcjonalnie zostały wyłonione przy użyciu domyślnych parametrów narzędzia CaseOLAP LIFT. Prosimy kliknąć tutaj, aby pobrać tę tabelę.
Tabela 3: Statystyki imputacji etykiet MeSH.W tabeli przedstawiono kategorie chorób, numery drzew MeSH użyte jako terminy nadrzędne dla wszystkich chorób zawartych w danej kategorii, liczbę artykułów z bazy PubMed znalezionych w każdej kategorii w latach 2012-2022 oraz liczbę dodatkowych artykułów włączonych na podstawie etapu imputacji etykiet. Kliknij tutaj, aby pobrać tę tabelę.
Tabela 4: Statystyki konstrukcji grafu wiedzy. Tabela ta opisuje statystyki dotyczące rozmiaru skonstruowanego grafu wiedzy, w tym różnych typów węzłów i krawędzi. Wyniki CaseOLAP reprezentują relację między białkiem a kategorią choroby układu sercowo-naczyniowego (CVD). Kliknij tutaj, aby pobrać tę tabelę.
Tabela 5: Statystyki i walidacje przewidywań grafu wiedzy.W tabeli przedstawiono mierniki oceny przewidywania krawędzi w grafie wiedzy dla nowych/ukrytych powiązań białko-choroba. Krawędzie grafu wiedzy podzielono na zbiory treningowy i testowy w stosunku 70/30, zachowując spójność połączeń grafu w obu zbiorach. Dokładność (accuracy) określa proporcję poprawnie sklasyfikowanych przewidywań, natomiast zbalansowana dokładność (balanced accuracy) koryguje wynik o niezrównoważenie klas. Specyficzność (specificity) określa proporcję poprawnie sklasyfikowanych przewidywań negatywnych. Precyzja (precision) określa proporcję poprawnych przewidywań pozytywnych spośród wszystkich przewidywań pozytywnych, natomiast czułość (recall) określa proporcję poprawnych przewidywań pozytywnych spośród wszystkich krawędzi pozytywnych (tj. powiązań białko-choroba zidentyfikowanych poprzez text-mining). Wynik F1 (F1 score) jest średnią harmoniczną precyzji i czułości. Pole pod krzywą charakterystyki operacyjnej odbiornika (AUROC) opisuje, jak dobrze model odróżnia przewidywania pozytywne od negatywnych, gdzie wartość 1,0 oznacza klasyfikator idealny. Pole pod krzywą precyzja-czułość (AUPRC) mierzy kompromis między precyzją a czułością przy różnych progach prawdopodobieństwa, przy czym wyższe wartości wskazują na lepszą wydajność. Kliknij tutaj, aby pobrać tę tabelę.