13 października 2023
Przedstawiono protokół obliczeniowy, CaseOLAP LIFT, oraz przypadek użycia do badania białek mitochondrialnych i ich powiązań z chorobami sercowo-naczyniowymi, jak opisano w raportach biomedycznych. Protokół ten można łatwo dostosować do badania wybranych przez użytkownika składników komórkowych i chorób.
Ten protokół obliczeniowy jest istotny, ponieważ pozwala na zbadanie powiązań między składnikami komórkowymi, na przykład białkami mitochondriów i ich powiązaniami z chorobą, jak opisano w publikacjach biomedycznych. CaseOLAP LIFT umożliwia badaczom wyodrębnianie i integrowanie informacji z raportów biomedycznych i baz wiedzy. Wyniki te, zorganizowane w formie grafu wiedzy, można wykorzystać do przewidywania nowych relacji.
Wyniki tych badań wspierają generowanie hipotez, podkreślając priorytetową listę zidentyfikowanych i przewidywanych powiązań chorób białkowych, przydatną do odkrywania nowych spostrzeżeń na temat patologii choroby i terapii. Ten wysoce konfigurowalny przepływ pracy można zastosować do dowolnego komponentu komórkowego za pośrednictwem ich terminu GO, do dowolnej listy chorób za pomocą terminu MeSH w dowolnym zakresie dat publikacji. Ten przyjazny dla użytkownika protokół minimalizuje wiedzę obliczeniową wymaganą do analizy.
Oprogramowanie jest wydawane jako kontener docker, wymagający jedynie wystarczającej ilości pamięci obliczeniowej i zasobów do wykonania. Aby rozpocząć, otwórz okno terminala, aby pobrać kontener platformy dokującej CaseOLAP LIFT, a następnie wpisz docker pull CaseOLAP slash CaseOLAP_LIFT latest. Utwórz katalog, w którym będą przechowywane wszystkie dane i dane wyjściowe programu.
Uruchom kontener platformy Docker za pomocą polecenia wyświetlanego na ekranie, zastępując PATH_TO_FOLDER jako pełną ścieżkę do pliku folderu. Aby uruchomić Elasticsearch w kontenerze, otwórz nowe okno terminala i wpisz polecenie pokazane na ekranie. Przejdź do folderu CaseOLAP_LIFT.
Upewnij się, że łącza pobierania i knowledge_base_links. json ukośnik konfiguracji są aktualne i dokładne dla najnowszej wersji każdego zasobu bazy wiedzy. Aby określić ontologię genu lub termin GO, przejdź do strony internetowej geneontologia.
org i znajdź identyfikatory wszystkich terminów GO. Podobnie, znajdź kategorie chorób za pomocą nagłówka tematu medycznego lub identyfikatorów MeSH ze strony internetowej pokazanej na ekranie. Aby uruchomić moduł przetwarzania wstępnego, należy wskazać zdefiniowane przez użytkownika badane terminy GO za pomocą flagi myślnika C, numery drzewa MeSH choroby za pomocą flagi kreski D i określić skróty za pomocą flagi kreski A.
Aby uruchomić moduł wyszukiwania tekstu, wpisz Python, spacja, CaseOLAP_LIFT. py, spacja, text_mining i dodaj flagę kreski L, aby przypisać tematy nieskategoryzowanych dokumentów, oraz flagę kreski T, aby pobrać pełny tekst dokumentów związanych z chorobą. Upewnij się, że wyniki wyszukiwania tekstu znajdują się w folderze wyników.
Wskaż wyniki wyszukiwania tekstu, które mają być używane do analizy, określając opcję analizuj wszystkie białka, aby uwzględnić wszystkie funkcjonalnie powiązane białka, lub analizuj białka rdzeniowe, aby uwzględnić tylko białka związane z terminem GO. Aby zidentyfikować najważniejsze białka i szlaki dla każdej choroby, wyniki CaseOLAP są przekształcane w skali Z w każdej kategorii choroby. Określ flagę kreski Z, aby wskazać określony wynik progowy, powyżej którego białka zostaną uznane za znaczące.
Przejrzyj wyniki analizy i dostosuj je w razie potrzeby. Otwórz plik z_score_cutoff_table. csv, aby wyświetlić wygenerowaną tabelę Z-score, która zawiera liczbę białek istotnych dla każdej kategorii choroby.
Pomaga to użytkownikowi wybrać odpowiedni próg Z-score. Otwórz folder wyników i upewnij się, że znajdują się w nim wymagane pliki, w tym folder wygenerowany w wyniku przetwarzania wstępnego. Sprawdź, czy wszystkie białka znajdują się w folderach z białkami rdzeniowymi.
Aby zaprojektować graf wiedzy, dołącz drzewo chorób MeSH z flagą dołącz MeSH. Interakcje białko-białko z ciągu z flagą obejmują PPI, współdzielone szlaki Reactome z flagą PW oraz zależność czynnika transkrypcyjnego od GRNdb GTEx z flagą TFD. Uruchom moduł budowy grafu wiedzy, określając analizę białek rdzeniowych, aby uwzględnić tylko białka związane z terminem GO.
Aby przeskalować wagi krawędzi, należy użyć skali Z-score dla nieujemnych wyników Z-score zamiast domyślnych wyników CaseOLAP. Sprawdź dane wyjściowe i upewnij się, że pliki grafu wiedzy merged_edges. TSV i merged_nodes.
Pliki TSV są obecne. Na koniec wpisz polecenie wyświetlane na ekranie, aby uruchomić skrypt przewidywania grafu wiedzy w celu przewidywania asocjacji chorób białkowych. Rysunek ten przedstawia białko mitochondrialne istotne dla każdej kategorii choroby.
Transformację Z-score zastosowano do wyników CaseOLAP w każdej kategorii, aby zidentyfikować istotne białka przy użyciu progu trzech. Całkowita liczba białek istotnych dla każdej kategorii choroby jest przedstawiona powyżej każdego wykresu skrzypiec. Analiza szlaku Reactome tych białek ujawniła 12 szlaków istotnych dla wszystkich chorób.
Przykład zastosowania uczenia głębokiego do wykresu wiedzy specyficznej dla choroby przedstawiono na poniższym rysunku. Ukryte relacje między białkami a chorobą są przewidywane, a obliczone prawdopodobieństwa dla obu przewidywań są tutaj wyświetlane z wartościami w zakresie od zera do jednego, gdzie jeden oznacza silne przewidywanie. Określona sekwencja ma kluczowe znaczenie dla wykonania tego protokołu, w szczególności modułów przetwarzania wstępnego i eksploracji tekstu.
Te dwa etapy mają bezpośredni wpływ na identyfikację najważniejszych białek i szlaków dla każdej choroby, a także na konstrukcję wykresu wiedzy specyficznej dla danej choroby. Wynikowy graf wiedzy jest skutecznie wizualizowany przez narzędzia graficzne, takie jak Neo4j i Cytoscape, i może być wykorzystany do zaawansowanych prognoz głębokiego uczenia nowych relacji. CaseOLAP LIFT umożliwia badanie powiązań między dowolnym komponentem komórkowym a kategoriami chorób.
Uzyskany w ten sposób wykres wiedzy i uszeregowane powiązania chorób białkowych wspierają przetwarzanie języka naturalnego i analizy oparte na wykresach uzupełniających.
Protokół obliczeniowy CaseOLAP LIFT umożliwia badanie białek mitochondrialnych i ich powiązań z chorobami układu sercowo-naczyniowego na podstawie raportów biomedycznych. Ten elastyczny protokół pozwala badaczom na efektywne analizowanie różnych komponentów komórkowych oraz chorób.
Integracja wielkoskalowej literatury biomedycznej w ustrukturyzowane grafy wiedzy umożliwia zespołom biofarmaceutycznym systematyczne odkrywanie powiązań między białkami a chorobami oraz szlaków mechanistycznych istotnych dla patologii chorób. Potok CaseOLAP LIFT zwiększa pewność predykcyjną w walidacji celów i wspiera generowanie hipotez we wczesnej fazie odkrywania oraz w badaniach translacyjnych. Podejście to usprawnia priorytetyzację nowych celów i szlaków, co bezpośrednio wpływa na selekcję portfolio oraz decyzje o rozwoju projektów w oparciu o analizę ryzyka.
Ten potok obliczeniowy łączy wczesne etapy odkrywania, walidację celów oraz badania translacyjne poprzez ekstrakcję, integrację i kontekstualizację powiązań między białkami a chorobami na podstawie literatury biomedycznej.