Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł metodologiczny

Protokół NetDecoder do budowy sieci interakcji białkowych specyficznych dla kontekstu na podstawie danych transkryptomowych z wykorzystaniem modelowania przepływu informacji

85 wyświetleń

DOI:

10.3791/70869

31 lipca 2026

W tym artykule

Podsumowanie

Przedstawiamy tutaj protokół korzystania z NetDecoder, narzędzia do modelowania sieci, aby skonstruować sieci interakcji białkowych specyficznych dla kontekstu i zbudować modele użyteczności genów (GUM). Korzystając z danych transkryptomiki, w połączeniu z kurowanymi sieciami interakcji białko-białko (PPI), NetDecoder umożliwia identyfikację kluczowych celów i podsieci.

Streszczenie

Analiza różnicowej ekspresji to powszechnie stosowana technika wyznaczania potencjalnych docelowych terapii, ale ignoruje złożoność sieci genów w różnych szlakach biologicznych. Często wysoko eksponowane geny niekoniecznie wyjaśniają właściwości biologicznego fenotypu. NetDecoder, narzędzie do biologii sieciowej, które integruje dane transkryptomowe z sieciami interakcji białko-białko (PPI), aby modelować przepływ informacji specyficznych dla kontekstu, użyteczność genów oraz kluczowe krawędzie i różnicująco wykorzystywane sieci genów, zostało opracowane w celu zajęcia się tą ograniczającą cechą analizy różnicowej ekspresji.

Ten protokół to przyjazny dla początkujących, krok po kroku przewodnik po korzystaniu z NetDecoder, z kompleksowymi wytycznymi obejmującymi przetwarzanie danych, wykonywanie NetDecoder oraz analizę wyników. Przepływ pracy obejmuje konfigurację oprogramowania, budowę sieci oraz analizę modelowania opartego na przepływie w celu ilościowego określenia różnic między warunkami biologicznymi na poziomie genów (węzłów) i interakcji gen-gen (poziom krawędzi). Wynikiem są kluczowe cele i routery, różnicowe pod-sieci przepływowe oraz dystrybucje przepływu krawędzi, umożliwiające identyfikację kluczowych genów i ścieżek regulacyjnych związanych z określonymi stanami biologicznymi. Po przeprowadzeniu wyszczególnionych kroków naukowcy będą w stanie przeprowadzić niezależne badania, aby odkryć przepływ genów fenotypu między fenotypami za pomocą danych transkryptomowych i kurowanych sieci PPI.

Wprowadzenie

Wybór genów i powiązanych szlaków do badań terapeutycznych jest często napędzany przez analizy różnicowej ekspresji1. Ta metoda analizy jest skuteczna w określaniu, jak różni się ekspresja genów w dwóch lub więcej warunkach. Jednak geny funkcjonują w złożonych, powiązanych sieciach biologicznych, co oznacza, że indywidualna ekspresja genów nie uchwycuje w pełni, jak geny współdziałają w sieci i jakie są ich relacje gen-gen2. Metody propagacji sieci integrują ekspresję genów z sieciami interakcji, aby zidentyfikować biologicznie ważne geny, które mogą zostać przeoczone przez samą analizę różnicową ekspresji3. Obecne podejścia nie liczą wprost funkcjonalnej ważności genów i tego, jak informacje biologiczne są redystrybuowane w sieciach interakcji białko-białko (PPI) w różnych warunkach biologicznych. Dlatego potrzebna była metoda modelowania zachowania sieci specyficznych dla warunków i ilościowego określania zmian w przepływie informacji w układach biologicznych. Aby uwzględnić, jak geny współdziałają w szerszym biologicznym sieci, platforma biologii sieciowej NetDecoder została opracowana, aby odkrywać geny o największej różnicy w przepływie informacji między warunkami. NetDecoder wykorzystuje algorytm przepływu kierowany procesem, aby przełożyć istniejące wiedzę na temat ludzkiej sieci PPI, w połączeniu z danymi sekwencji RNA w dużej skali, aby skonstruować model interakcji napędzanych przepływem informacji4.

Wykorzystując dane dotyczące przepływu informacji dla sieci fenotypowych, model użyteczności genów (GUM)5 może zostać opracowany, aby zidentyfikować geny o wysokim przepływie informacji jako mające najwyższą ogólną użyteczność genów w sieci, niezależnie od ich wartości różnicowej ekspresji. To podejście wspiera bardziej efektywne strategie priorytetyzacji i identyfikacji celów, zapewniając wgląd, którego tradycyjna analiza często nie uchwyca. W przeciwieństwie do tradycyjnych metod analizy różnicowej ekspresji lub opartych na korelacji metod sieciowych, NetDecoder ilościowo określa zarówno zmiany w przepływie informacji na poziomie genów (poziom węzłów), jak i zmiany w interakcjach (poziom krawędzi), umożliwiając identyfikację funkcjonalnie ważnych genów, nawet w przypadku braku dużych zmian ekspresji4,5. NetDecoder jest szeroko stosowany do danych sekwencji RNA w dużej skali, które obejmują analizę porównawczą między dwoma warunkami biologicznymi, umożliwiając identyfikację zmian w przepływie informacji i organizacji sieci. Chociaż NetDecoder obsługuje integrację innych danych omics, w tym proteomiki i epigenetyki, obecny protokół specyficznie pokazuje przepływ pracy przy użyciu danych transkryptomowych. W tych zastosowaniach użytkownicy mogą definiować geny źródłowe na podstawie białek lub genów regulowanych epigenetycznie, pozwalając na rozpoczęcie analizy przepływu informacji od tych cech molekularnych. Ta elastyczność umożliwia włączenie do analizy opartej na sieci dowodów multi-omics i ułatwia odkrywanie mechanizmów regulacyjnych międzymodalnych leżących u podstaw różnic fenotypowych.

Typowe projekty badań obejmują porównania binarne, w tym, ale nie tylko, warunki chorobowe w porównaniu ze zdrowymi, pacjenci reagujący na leczenie w porównaniu z niereagującymi, leczenia farmakologicznego, eksperymentów z wyciszeniem lub wyłączeniem w porównaniu z eksperymentami kontrolnymi oraz analizy przejść stanów rozwojowych lub komórkowych. Celem niniejszego protokołu jest przedstawienie reproduktywalnej ramy dla stosowania NetDecoder w celu odkrycia genów o zmienionym wpływie sieci w różnych warunkach biologicznych. Osiąga się to dzięki łatwym w naśladowaniu krokom konfiguracji i uruchomienia NetDecoder, a także przykładom do naśladowania, podstawowym technikom rozwiązywania problemów oraz metodom interpretacji wyników, które są również przedstawione w protokole.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

To badania wykorzystały publicznie dostępne zestawy danych sekwencjonowania RNA i nie obejmowały bezpośrednio badań na ludziach ani na zwierzętach. Dlatego nie było wymagane zatwierdzenie przez komitet etyczny instytucji i zgoda na udział w badaniu.

UWAGA: NetDecoder wymaga następujących plików wejściowych: znormalizowane wyrażenie genów w dwóch określonych warunkach biologicznych; plik metadanych opisujący warunki biologiczne; lista genów źródłowych do budowy i modelowania sieci; sieć oddziaływań białko-białko (PPI) z domeny publicznej; oraz sieć o ważonych krawędziach (EWN) zbudowana dla każdego warunku biologicznego.

1. Przygotowanie danych

  1. Pobierz dane z sekwencjonowania RNA i metadane
    1. Pobierz dane z sekwencjonowania RNA (macierz surowych danych liczby ekspresji genów i nazw próbek) oraz odpowiadające im metadane (nazwy próbek, warunki itp.) z publicznego repozytorium, takiego jak Gene Expression Omnibus (GEO), lub użyj eksperymentalnych zestawów danych wygenerowanych w laboratorium. Zazwyczaj jest to macierz, w której wiersze odpowiadają nazwom genów, a kolumny nazwom próbek.
      UWAGA: Zestaw danych przykładowych wykorzystany do zademonstrowania tego protokołu został uzyskany z repozytorium National Omics Data Encyclopedia (NODE) (baza danych BioSino) pod numerem dostępu OEP0011056. Użytkownicy mogą zastąpić go własnymi zestawami danych z sekwencjonowania RNA.
    2. Utwórz plik adnotacji próbek (metadane) zawierający nazwy próbek i ich grupy lub powiązane warunki; na przykład “kontrola” i “choroba” to typowe rodzaje warunków. Upewnij się, że nazwy próbek pasują między metadanymi a plikami ekspresji.
  2. Zbierz dane ekspresji i metadane
    1. Upewnij się, że wygenerowana macierz danych zawiera liczby ekspresji, nazwy genów i plik metadanych z nazwami próbek i warunkami. Jeśli to konieczne, użyj pakietu R, takiego jak org.Hs.eg.db (człowiek) lub AnnotationDbi, aby dopasować różne identyfikatory genów.
    2. Usuń nieistotne informacje z pliku metadanych za pomocą R lub podobnego języka programowania.
    3. Połącz informacje z plików liczby ekspresji w jednym pliku, aby ułatwić manipulację.
  3. Filtruj dane ekspresji
    1. Przed przetwarzaniem macierzy danych ekspresji genów wykluczaj duplikaty genów, wartości null (NA), niskie ekspresje (<10 liczby ekspresji), i/lub geny o niskiej wariancji itp.
  4. Przetworzenie wstępne danych
    1. Normalizacja sekwencjonowania RNA i analiza różnic w ekspresji
      UWAGA: Ten krok jest jednym (1.4.1) z dwóch (1.4.2) podejść do selekcji genów do utworzenia sieci o ważonych krawędziach (EWN) i selekcji genów źródłowych (kroki 1.5–1.6), gdy analiza rozpoczyna się od danych z sekwencjonowania RNA. Jako alternatywę można zastosować dopasowanie szablonów oparte na korelacji Pearson, pomijając krok 1.4.3.
      1. Wykonaj konwersje identyfikatorów genów na tym etapie za pomocą pakietu R, AnnotationDbi, w uzgodnieniu z pakietami dla poszczególnych organizmów. NetDecoder używa symboli genów (czyli identyfikatorów genów), które pasują do przykładowej PPI.
      2. Wykonaj normalizację i analizę różnic w ekspresji między dwoma warunkami za pomocą pakietów R limma, edgeR, DESeq2 lub podobnych narzędzi.
      3. Jeśli używasz DESeq2, skonstruuj zestaw DESeq za pomocą funkcji DESeqDataSetFromMatrix() z macierzą liczby (geny i próbki) i metadanymi próbek (warunki) jako wejście.
      4. Użyj funkcji DESeq() z ustawieniami domyślnymi na obiekcie utworzonym w kroku 1.4.1.3, aby obliczyć wartości różnic w ekspresji.
      5. Zapisz wyniki w macierzy danych z identyfikatorami genów (Gene ID) jako nazwami wierszy i kluczowymi wynikami, w tym log2 fold change (log2FC), p-value i poprawioną wartością p, jako kolumnami.
      6. Opcjonalnie, wyfiltruj wyniki za pomocą poprawionej wartości p (<0.05) i/lub wartości log2FC (na przykład: |log2FC| > 1) za pomocą dplyr lub podobnego narzędzia.
      7. Upewnij się, że wszystkie przetworzone listy genów i macierze log2 fold change są eksportowane jako pliki tabulatorowe (.txt lub.csv) do wejścia do NetDecoder.
      8. Wykonaj porównania parowe dla kroku 1.4.1, jeśli użyto więcej niż 2 warunków biologicznych i uzyskaj parowe wyniki za pomocą funkcji results() z obiektu DESeq wygenerowanego w kroku 1.4.1.5.
    2. Normalizacja ekspresji mikroarray - opcjonalnie
      UWAGA: Jeśli używasz danych mikroarray, wykonaj ten krok w celu normalizacji danych.
      1. Normalizuj dane, otwierając skrypt normalizacji NetDecoder (HuLiLab/NetDecoder_Example/raw_data/NetDecoder_normalize.R), dostępny z https://github.com/HuLiLab/NetDecoder_Example/tree/main, na platformie deweloperskiej R i edytując kursywę, aby pasowała do katalogu roboczego zawierającego pliki intensywności komórek (CEL).
        setwd(~/NetDecoder_Example/raw_data

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Jak pokazano na Rysunku 1, NetDecoder działa w ramach ustrukturyzowanego przepływu pracy składającego się z przetwarzania danych, konfiguracji sieci i analizy opartej na przepływach, przy czym wyniki są organizowane w oddzielnych katalogach odpowiadających każdemu etapowi potoku przetwarzania. Ta modularna struktura umożliwia systematyczną walidację wyników, zapewniając możliwość prześledzenia rezultatów do każdego kroku obliczeniowego i wspierając ogólną powtarzalność.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Ten protokół opisuje implementację NetDecoder, ramy sieciowej biologii, która integruje dane ekspresji genów z sieciami interakcji białko-białko (PPI), aby modelować przepływ informacji specyficznych dla warunków i priorytetyzować geny na podstawie ich funkcjonalnego wpływu w systemach biologicznych. Skuteczne zastosowanie tej metody zależy od kilku kluczowych kroków, starannego doboru metod oraz właściwej interpretacji wyników.

Wstępne etapy protokołu obejmują pobieranie danych ekspresji, gen...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy nie mają żadnych konfliktów interesów finansowych.
Ilustracje do Figur 1 i 2 zostały stworzone za pomocą BioRender (BioRender.com).

Podziękowania

Praca ta była wspierana przez granty z Mayo Clinic Center for Biomedical Discovery, Mayo Clinic Comprehensive Cancer Center (NIH; P30 CA015083), Mayo Clinic Center for Cell Signaling in Gastroenterology (NIH: P30DK084567), Glenn Foundation for Medical Research, V Foundation for Cancer Research (S.Z.), Mayo Clinic Nutrition Obesity Research Program, David F. and Margaret T. Grohne Cancer Immunology and Immunotherapy Program, Schmidt Sciences oraz National Institutes of Health (NIH; U19AG74879, P50CA136393, R01CA240323, R03OD038392).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
AnnotationDbiBioconductorversion 1.68.0Annotation and gene mapping
BioconductorBioconductorversion 3.19Framework for transcriptomic data analysis and package ecosystem supporting DESeq2, edgeR, limma, AnnotationDbi, and organism databases, etc.
CytoscapeThe Cytoscape Consoritumversion 3.10.4Network visualization and analysis
DESeq2Bioconductorversion 1.46.0Differential expression analysis (with negative binomial modeling)
dplyrPosit Software, PBC formerly RStudio, PBCversion 1.1.4Data manipulation and transformation
edgeRBioconductorversion 4.4.2Count-based differential expression analysis
ggplot2Posit Software, PBC formerly RStudio, PBCversion 4.0.0Data visualization and plotting  
GNU BashGNU ProjectSystem defaultBash, Execution of NetDecoder pipeline scripts
igraphigraph Development Teamversion 2.1.4Network construction and graph analysis
LimmaBioconductorversion 3.62.2Linear modeling for gene expression analysis
NetDecoderHu Li Laboratory, Mayo Clinic(2024 Hu Li Lab)Construction of context-specific protein interaction networks via information flow modeling
org.Hs.eg.dbBioconductorversion 3.20.0Human gene annotation database
Oracle JDKOracle Corporation≥ version 1.8Runtime environment for NetDecoder execution
pheatmapRaivo Koldeversion 1.0.13Visualization of expression and correlation structure
RThe R Foundationversion 4.4.2Core environment for transcriptomic and network analysis

Bibliografia

  1. Rosati D et al. Differential gene expression analysis pipelines and bioinformatic tools for the identification of specific biomarkers: A review. Comput Struct Biotechnol J. 2024;23:1154–68.
  2. Barabási A-L, Oltvai ZN. Network biology: understanding the cell's functional organization. Nat Rev Genet. 2004;5(2):101–13.
  3. Cowen L, Ideker T, Raphael BJ, Sharan R. Network propagation: a universal amplifier of genetic associations. Nat Rev Genet. 2017;18(9):551–62.
  4. Rocha DLE, Ung YC, Mcgehee DC, Correia C, Li H. NetDecoder: a network biology platform that decodes context-specific biological networks and gene activities. Nucleic Acids Res. 2016;44(10):e100.
  5. Ung YC et al. Gene utility recapitulates chromosomal aberrancies in advanced stage neuroblastoma. Comput Struct Biotechnol J. 2022;20:3291–303.
  6. Dong L et al. Proteogenomic characterization identifies clinically relevant subgroups of intrahepatic cholangiocarcinoma. Cancer Cell. 2022;40(1):70–87.e15.
  7. Ono K et al. Cytoscape Web: bringing network biology to the browser. Nucleic Acids Res. 2025;53(W1):W203–W212.
  8. Langfelder P, Horvath S. WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics. 2008;9(1):559.
  9. Ma J, Shojaie A, Michailidis G. A comparative study of topology-based pathway enrichment analysis methods. BMC Bioinformatics. 2019;20(1):546.
  10. Ideker T, Krogan NJ. Differential network biology. Mol Syst Biol. 2012;8(1):565.
  11. Tong C et al. Review of knockout technology approaches in bacterial drug resistance research. PeerJ. 2023;11:e15790.
  12. Wei Z et al. PerturBase: a comprehensive database for single-cell perturbation data analysis and visualization. Nucleic Acids Res. 2025;53(D1):D1099–D1111.
  13. Chevalier S et al. Data-driven inference of Boolean networks from transcriptomes to predict cellular differentiation and reprogramming. NPJ Sys Biol Appl. 2025;11(1):105.
  14. Kadelka C, Butrie T-M, Hilton E, Kinseth J, Schmidt A, Serdarevic H. A meta-analysis of Boolean network models reveals design principles of gene regulatory networks. Sci Adv. 2024;10(2)::eadj0822.
  15. Klamt S, Saez-Rodriguez J, Lindquist JA, Simeoni L, Gilles ED. A methodology for the structural and functional analysis of signaling and regulatory networks. BMC Bioinformatics. 2006;7(1):56.
  16. Saez-Rodriguez J et al. Discrete logic modelling as a means to link protein signalling networks with functional analysis of mammalian signal transduction. Mol Syst Biol. 2009;5(1):331.
  17. Bornholdt S. Boolean network models of cellular regulation: prospects and limitations. J R Soc Interface. 2008;5(suppl_1):S85–S94.
  18. Yuan L, Jiang Y, Meng B, Wang Q, Wang C, Huang D-S. SpaLSTF: Diffusion-based generative model with BiLSTM and XCA-Transformer for spatial transcriptomics imputation. PLoS Comput Biol. 2026;22(2):e1013954.
  19. Yuan L, Jiang Y, Wang Q, Hu C, Li G, Zheng C-H. DeepSGE: predicting spatial gene expression using residual network with efficient channel attention and dynamic graph attention network. BMC Genomics. 2026;27(1):293.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

MedycynaNumer 233Numer 233Wartość pustaNumermodelowanietranskryptomikaalgorytm przepływuintegracja

Ten artykuł został opublikowany

Film wkrótce dostępny