$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Badanie przeprowadzono zgodnie z Deklaracją Helsińską, a protokół został zatwierdzony przez Komisję Etyczną Trzeciego Szpitala Uniwersytetu Medycznego w Hebei (W2025-065-1) w listopadzie 2024 roku. Wyraz zgody został uzyskany od wszystkich osób biorących udział w badaniu.
Źródło danych i przetwarzanie wstępne
Uzyskano dane RNA-seq związane z niewydolnością serca, w tym dwa zestawy danych mikroarray z Gene Expression Omnibus (https://www.ncbi.nlm.nih.gov/geo/). Wybrane zostały dwa zestawy danych mikroarray krwi obwodowej: GSE59867 (34 próbki HF i 30 kontrolnych) jako zestaw treningowy; GSE57338 (177 próbek HF i 136 kontrolnych) jako zestaw walidacji. Informacje kliniczne dostępne dla GSE57338, w tym wiek, płeć i status choroby, zostały pobrane z GEO i są podsumowanie w Tabeli uzupełniającej 1. Dodatkowo, łącznie 3 893 geny związane z SUMOylacją (SRG) zostały uzyskane z bazy danych dbPTM (https://awi.cuhk.edu.cn/dbPTM/index.php) (Tabela uzupełniająca 2), podczas gdy 2 030 genów związanych z mitochondriami (MRG) zostały zebrane na podstawie wcześniejszego badania24 (Tabela uzupełniająca 3). Następnie, pakiet R GEOquery (v 2.72.0)25 został użyty do pobrania zestawów danych z bazy GEO, wyodrębnienia macierzy ekspresji i uzyskania informacji o fenotypie próbek. Anotację przeprowadzono poprzez mapowanie pliku anotacji i dopasowanie identyfikatorów genów. Nieważne identyfikatory genów zostały usunięte, a pozostały najbardziej ekspresyjne sondy.
Selekcja kluczowych genów za pomocą uczenia maszynowego
Aby wybrać geny związane z HF, SUMOylacją i mitochondriami, zastosowano wieloetapowe podejście. Najpierw, wspólne geny między zestawem treningowym, SRG i MRG zostały zidentyfikowane za pomocą analizy przecięcia. Potencjalna funkcja wspólnych genów została zidentyfikowana poprzez analizę wzbogacenia Gene Ontology (GO) i Kyoto Encyclopedia of Genes and Genomes (KEGG) przy użyciu pakietu R ClusterProfiler (v 4.12.6)26. Następnie, trzy podejścia uczenia maszynowego, czyli regresja LASSO, XGBoost i las losowy (RF), zostały zastosowane do dalszego filtrowania genów. W regresji LASSO, optymalny parametr regularyzacji λ został wybrany poprzez walidację krzyżową, aby zidentyfikować cechy genetyczne o największej wartości predykcyjnej. Geny o niezerowych współczynnikach zostały wybrane do dalszej analizy. Następnie, algorytmy XGBoost i RF zostały wykorzystane do obliczenia wyników ważności cech i przesiewania najwyższych 20 genów.
Konstrukcja i ocena modeli diagnostycznych
Model diagnostyczny został skonstruowany przy użyciu regresji logistycznej na podstawie zestawu danych GSE59867. Następnie model został zastosowany do przewidywania statusu choroby i obliczania wyników prawdopodobieństwa. Aby zweryfikować model, te same kluczowe geny zostały wyodrębnione z zestawu danych GSE57338, znormalizowane, aby pasowały do zestawu treningowego i użyte do zewnętrznej predykcji. Wynik modelu został oceniony za pomocą krzywych Receiver Operating Characteristic (ROC), macierzy pomyłek, krzywej kalibracji oraz analizy krzywych decyzji (DCA).
Analiza wzbogacenia zestawu genów (GSEA) i subkomórkowa lokalizacja
Analiza korelacji Spearmana została zastosowana do zidentyfikowania genów skorelowanych dla każdego kluczowego genu. Analiza GSEA została przeprowadzona przy użyciu pakietu R ClusterProfiler (v 4.12.6) na powiązanych genach kluczowych. Równocześnie, aby określić dokładną subkomórkową lokalizację kluczowych genów w komórce, ich subkomórkowa lokalizacja została określona za pomocą bazy danych GeneCards (https://www.genecards.org/).
Asocjacja genu-choroby i przewidywanie leków
Aby ocenić kliniczne znaczenie zidentyfikowanych kluczowych genów, przeprowadzono systematyczne analizy asocjacji z chorobami i interakcji z lekami. Asocjacje gen-choroba zostały przebadane za pomocą bazy danych Comparative Toxicogenomics Database (CTD; https://ctdbase.org/), z wynikami klasyfikowanymi zarówno według wyników wnioskowania, jak i liczby referencji (zgłoszono 10 najlepszych asocjacji). Dane o interakcji gen-lek dla kluczowych genów zostały uzyskane z bazy danych Drug-Gene Interaction (DGIdb), a leki zostały wykluczone na podstawie wyniku interakcji < 0,5. Następnie, pobrane zostały struktury 3D białek odpowiadających kluczowymi genom z bazy danych PDB (https://www.rcsb.org/) oraz struktury molekularne potencjalnych leków z PubChem (https://pubchem.ncbi.nlm.nih.gov/). Następnie, przeprowadzono analizę dokowania molekularnego przy użyciu CB-Dock227 (https://cadd.labshare.cn/cb-dock2/php/index.php) w celu obliczenia wyników wiązania pomiędzy potencjalnymi lekami a białkami. Niższa wolna energia wiązania wskazuje na bardziej stabilne wiązanie, sugerując, że związek może mieć większy potencjał ukierunkowania.
Analiza infiltracji immunologicznej
Infiltrację komórek odpornościowych