Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł badawczy

Identyfikacja biomarkerów nadciśnienia płucnego oraz potencjalnych związków terapeutycznych z wykorzystaniem bioinformatyki i uczenia maszynowego

82 wyświetleń

⸱

DOI:

10.3791/73519

⸱

25 sierpnia 2026

W tym artykule

Podsumowanie

Niniejszy artykuł przedstawia powtarzalny schemat bioinformatyczny integrujący publiczne zbiory danych transkrypomicznych, uczenie maszynowe, walidację zewnętrzną, ilościową PCR z odwrotną transkrypcją, przesiew Connectivity Map oraz dokowanie molekularne w celu zidentyfikowania biomarkerów nadciśnienia płucnego i potencjalnych związków terapeutycznych.

Streszczenie

Celem niniejszego badania była identyfikacja molekularnych biomarkerów związanych z nadciśnieniem płucnym (PH) oraz potencjalnych małocząsteczkowych związków leczniczych z wykorzystaniem publicznych danych transkrypcyjnych i niezależnych zasobów walidacyjnych. Trzy zbiory danych z Gene Expression Omnibus (GSE22356, GSE33463 oraz GSE48149) zostały zintegrowane po normalizacji, adnotacji sond i korekcji efektu serii za pomocą metody ComBat. Do identyfikacji kluczowych genów cech wykorzystano analizę różnicowej ekspresji, ważoną analizę sieci koekspresji genów (WGCNA), analizę wzbogacenia funkcjonalnego, analizę sieci oddziaływań białko-białko oraz trzy algorytmy uczenia maszynowego. Wydajność diagnostyczną oceniono za pomocą krzywych charakterystyki ROC. Walidacja zewnętrzna obejmowała niezależną kohortę tkanek płucnych (GSE117261), zbiór danych z sekwencjonowania RNA pojedynczych komórek tętnicy płucnej (GSE210248) oraz walidację za pomocą ilościowej odwrotnej transkrypcji i PCR (qRT-PCR) w niezależnych próbkach tkanek płucnych. Do przesiewania potencjalnych związków wykorzystano repozycjonowanie leków w oparciu o Connectivity Map oraz dokowanie molekularne. Zidentyfikowano siedemdziesiąt osiem genów o różnicowej ekspresji, z czego jako kluczowe geny cech wybrano CXCL10, JUN, IFIH1, MX1 oraz TLR7. W niezależnej kohorcie tkanek płucnych GSE117261 gen JUN wykazał najsilniejsze wsparcie zewnętrzne, podczas gdy replikacja pozostałych genów była zmienna. Analiza qRT-PCR w 20 biologicznie niezależnych próbkach z nadciśnieniem tętniczym płuc oraz 20 próbkach kontrolnych potwierdziła nadekspresję wszystkich pięciu genów. Pozorny model qRT-PCR oparty na pięciu genach oraz 100 powtórzeń stratyfikowanej pięciokrotnej walidacji krzyżowej dały pole pod krzywą (AUC) wynoszące 1,000, choć niewielka kohorta wymaga ostrożnej interpretacji i niezależnej walidacji prospektywnej. Analiza pojedynczych komórek z zestawu GSE210248 potwierdziła zaburzoną komunikację między komórkami odpornościowymi a strukturalnymi oraz przełączanie fenotypowe komórek mięśni gładkich. Związek BRD-K91900765/VX-745 zajął najwyższą pozycję w przesiewie Connectivity Map. Białko MAPK14/p38α, jego ustalony cel farmakologiczny, zostało uwzględnione jako referencyjne białko dokujące, podczas gdy dokowanie do pięciu białek związanych z biomarkerami miało charakter eksploracyjny. Wyniki te wskazują na pięć genów jako potencjalne biomarkery PH oraz VX-745 jako hipotezę obliczeniowego repozycjonowania leku wymagającą walidacji eksperymentalnej.

Wprowadzenie

Nadciśnienie płucne (PH) to postępujący zespół kardiopulmonalny charakteryzujący się trwale podwyższonym ciśnieniem w tętnicy płucnej, zwiększonym oporem naczyniowym płuc oraz ostatecznie niewydolnością prawej komory serca. Obecne kryteria hemodynamiczne definiują nadciśnienie płucne jako średnie ciśnienie w tętnicy płucnej w spoczynku wynoszące >20 mmHg, zmierzone za pomocą cewnikowania prawego serca1Wśród różnych podtypów klinicznych nadciśnienie tętnicze płuc (PAH) jest jedną z najcięższych postaci i charakteryzuje się postępującym remodelowaniem naczyń płucnych. Jego cechy patologiczne obejmują dysfunkcję śródbłonka, nieprawidłową proliferację i migrację komórek mięśni gładkich tętnic płucnych, aktywację fibroblastów błony zewnętrznej, odkładanie macierzy zewnątrzkomórkowej, naciekanie komórek zapalnych oraz zwężenie lub obliterację dystalnych tętnic płucnych.2Zmiany te wskazują, że PH/PAH nie jest jedynie zaburzeniem skurczu naczyń, lecz złożoną chorobą przebudowy naczyniowej, napędzaną przez skoordynowane mechanizmy molekularne, komórkowe i immunologiczno-zapalne.

Obecne terapie PAH celują głównie w szlaki prostacykliny, endoteliny, tlenku azotu – rozpuszczalnej cyklazy guanylowej oraz fosfodiesterazy typu 53˒4. Chociaż leczenie to poprawia objawy, wydolność wysiłkową i parametry hemodynamiczne, jego efekty pozostają w dużej mierze naczyniorozszerzające i hemodynamiczne. Zdolność tych terapii do odwracania utrwalonego przebudowy naczyniowej płuc jest ograniczona, a wielu pacjentów nadal doświadcza progresji choroby mimo stosowania terapii skojarzonej. Dlatego identyfikacja nowych biomarkerów molekularnych i kandydatów terapeutycznych odzwierciedlających proces przebudowy stanowi istotną niezaspokojoną potrzebę. W szczególności aktywacja immunologiczno-zapalna, sygnalizacja związana z interferonem, szlaki receptorów Toll-podobnych, rekrutacja immunologiczna pośredniczona przez chemokiny oraz zmiana fenotypowa komórek mięśni gładkich wyłoniły się jako potencjalne czynniki przyczyniające się do progresji PH/PAH5˒6.

Wysokoprzepustowe zestawy danych transkrypcyjnych stanowią cenne zasoby do identyfikacji sygnatur molekularnych związanych z chorobą w nadciśnieniu płucnym (PH) i nadciśnieniu płucnym z niedoskonalnością serca (PAH). Jednak badania oparte na pojedynczym zestawie danych są często ograniczone przez małą liczebność próby, efekty seryjne, heterogeniczność platform oraz niewystarczającą walidację. Analiza ekspresji różnicowej pozwala zidentyfikować geny o zmienionej ekspresji, ale może nie w pełni oddawać powiązane z chorobą moduły koekspresji lub interakcje na poziomie sieci. Analiza sieci koekspresji genów z wagami (WGCNA) umożliwia identyfikację modułów genów związanych z cechami choroby, podczas gdy analiza sieci oddziaływań białko-białko (PPI) pozwala ujawnić geny o wysokim stopniu połączeń w sieciach biologicznych. Metody uczenia maszynowego mogą również pomóc w priorytetyzacji genów o wartości diagnostycznej lub klasyfikacyjnej. Jednak poleganie na pojedynczym algorytmie może wprowadzić błąd specyficzny dla danego modelu. Zintegrowanie analizy ekspresji różnicowej, WGCNA, analizy sieci PPI oraz wielu algorytmów uczenia maszynowego może zatem zwiększyć wiarygodność procesu odkrywania biomarkerów.

Kolejnym istotnym wyzwaniem w badaniach nad biomarkerami transkrypcyjnymi jest interpretacja biologiczna. Sygnały z tkanek w analizie bulk mogą odzwierciedlać zmiany w ekspresji genów w obrębie komórek naczyniowych, naciekanie komórek odpornościowych lub zmienione proporcje wielu populacji komórkowych. Sekwencjonowanie RNA z pojedynczych komórek (scRNA-seq) stwarza możliwość osadzenia genów kandydatów wyłonionych w analizie bulk w kontekście komórkowym. W przypadku nadciśnienia płucnego (PH/PAH) przebudowa naczyń płucnych obejmuje komórki śródbłonka, komórki mięśni gładkich, fibroblasty, monocyty/makrofagi, limfocyty oraz inne komórki odpornościowe lub strukturalne. Progresja choroby wiąże się również ze zmienioną komunikacją międzykomórkową oraz przełączaniem fenotypowym komórek mięśni gładkich. W związku z tym połączenie screeningu transkrypcyjnego bulk z walidacją na poziomie pojedynczych komórek może pomóc w ustaleniu, czy biomarkery kandydackie są związane z aktywacją immunologiczną, strukturalną przebudową naczyń czy zaburzeniem komunikacji wielokomórkowej.

Oprócz odkrywania biomarkerów, sygnatury transkrypcyjne mogą być wykorzystywane do komputerowego repozycjonowania leków. Mapa Połączeń (Connectivity Map, CMap) wiąże profile ekspresji genów związane z chorobą z małymi cząsteczkami, które mogą odwracać lub modulować te sygnatury7. W połączeniu z kuratelą związków i dokowaniem molekularnym strategia ta może generować hipotezy terapeutyczne możliwe do przetestowania eksperymentalnie. Chociaż predykcja CMap i dokowanie molekularne nie pozwalają na ustalenie skuteczności leku, mogą one pomóc w priorytetyzacji związków kandydackich do przyszłych testów wiązania z celem, eksperymentów komórkowych oraz walidacji w modelach zwierzęcych.

Opracowano zintegrowany i powtarzalny schemat postępowania w celu zidentyfikowania biomarkerów PH/PAH oraz potencjalnych związków terapeutycznych. Zintegrowano trzy publiczne transcriptomiczne zbiory danych z bazy Gene Expression Omnibus po przeprowadzeniu normalizacji i korekty efektu seryjnego. Do przesiewowej analizy w celu wyłonienia stabilnych genów cech wykorzystano analizę różnicowej ekspresji, WGCNA, analizę wzbogacenia funkcjonalnego, analizę sieci PPI oraz trzy algorytmy uczenia maszynowego. Do dalszej oceny wybranych genów zastosowano analizę charakterystyki operacyjnej odbiornika (ROC), niezależną kohortę walidacyjną z tkanki płucnej, dowody z sekwencjonowania RNA pojedynczych komórek tętnicy płucnej oraz walidację za pomocą ilościowej PCR z odwrotną transkrypcją w niezależnych próbkach. Na koniec, w celu zidentyfikowania potencjalnych związków, zastosowano repozycjonowanie leków w oparciu o CMap oraz dokowanie molekularne. Nowatorstwo badania polega na wielowarstwowym modelu walidacji, który łączy odkrycia transcriptomiczne z tkanki objętościowej, priorytetyzację za pomocą uczenia maszynowego, niezależną walidację, eksperymentalne potwierdzenie ilościową PCR z odwrotną transkrypcją, mechaniczną interpretację na poziomie pojedynczych komórek oraz obliczeniowy przesiew związków. Hipoteza badawcza zakładała, że PH/PAH jest napędzane przez skoordynowany program immunologiczno-zapalny i przebudowy naczyniowej, a stabilne geny w ramach tego programu mogą służyć jako potencjalne biomarkery i stwarzać możliwości repozycjonowania leków.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Publiczne zbiory danych Gene Expression Omnibus (GEO) analizowane w niniejszym badaniu zawierały zanonimizowane dane transkrypcyjne z wcześniej opublikowanych badań i nie wymagały dodatkowej zgody komisji etycznej. Komisja Etyczna Uniwersytetu w Huaihua zatwierdziła niezależne badanie walidacyjne metodą ilościowej reakcji łańcuchowej polimerazy z odwrotną transkrypcją (qRT-PCR) w ludzkiej tkance płucnej (numer zgody 2024(A05112)). Przed pobraniem próbek od wszystkich uczestników lub ich prawnie upoważnionych przedstawicieli uzyskano pisemną świadomą zgodę. Procedury zatwierdzenia i zgody zastosowano do wszystkich 20 próbek tkanki płucnej od pacjentów z nadciśnieniem płucnym (PAH) oraz 20 próbek kontrolnych wykorzystanych w walidacji qRT-PCR. Narzędzia badawcze użyte w niniejszym protokole wymieniono w Tabeli materiałów.

1. Gromadzenie i wstępne przetwarzanie publicznych zbiorów danych transkryptomicznych

Zbiory danych z mikromacierzy GSE22356, GSE33463 i GSE48149 powiązane z nadciśnieniem płucnym (PH) pobrano z bazy danych GEO. Próbki z PH/nadciśnieniem tętniczym płuc (PAH) oraz próbki kontrolne wyodrębniono zgodnie z oryginalnymi adnotacjami fenotypowymi. Macierze ekspresji oraz pliki adnotacji platform pobrano za pomocą powtarzalnych skryptów R oraz pakietu GEOquery.

Adnotacja sond oraz mapowanie symboli genów przeprowadzono w sposób spójny dla wszystkich zbiorów danych. W przypadku, gdy wiele sond mapowało na ten sam gen, obliczano średnią wartość ekspresji. Zastosowano normalizację kwantylową, a geny o niskiej ekspresji lub niskiej wariancji zostały usunięte. Zbiory danych połączono, a efekty serii skorygowano za pomocą algorytmu ComBat z pakietu sva8. Korekcję oceniono za pomocą wykresów pudełkowych oraz analizy głównych składowych.

2. Identyfikacja genów o różnym poziomie ekspresji

Do porównania poziomów ekspresji między próbkami PH a kontrolnymi w macierzy ekspresji skorygowanej o efekt serii wykorzystano pakiet limma9. Zastosowano dopasowany model liniowy oraz statystykę empirycznego Bayesa. Geny różnicowo wyrażone zdefiniowano przy użyciu skorygowanej wartości P <0,05 oraz bezwzględnej zmiany log2 fold change > 0,585. Wyniki zwizualizowano za pomocą wykresów wulkanicznych (volcano plots) i map ciepła (heatmaps).

3. Konstrukcja ważonej sieci koekspresji genów

Ważoną sieć koekspresji genów skonstruowano przy użyciu pakietu WGCNA10. W celu wykrycia wartości odstających przeprowadzono klastrowanie próbek. Moc miękkiego progowania (soft-thresholding power) wybrano na podstawie indeksu dopasowania topologii wolnej od skali. Moduły genowe zidentyfikowano za pomocą algorytmu dynamicznego przycinania drzewa. Korelację eigengenów modułów analizowano w odniesieniu do fenotypu PH, a następnie wybrano moduł związany z chorobą o najsilniejszej korelacji. Geny z kluczowego modułu zestawiono z genami różnicowo eksponowanymi w celu wyłonienia genów konsensusowych.

4. Analiza wzbogacenia funkcjonalnego

Kategorie procesów biologicznych, komponentów komórkowych i funkcji molekularnych Gene Ontology zostały przeanalizowane przy użyciu oprogramowania clusterProfiler11. W celu zidentyfikowania szlaków sygnalizacyjnych przeprowadzono analizę wzbogacenia szlaków Kyoto Encyclopedia of Genes and Genomes12. Jako progi wzbogacenia przyjęto wartość P < 0,05 oraz wartość q < 0,2, a wzbogacone terminy przedstawiono za pomocą wykresów bąbelkowych11.

5. Konstrukcja sieci oddziaływań białko-białko i identyfikacja genów hubowych

Konsensusowa lista genów została wprowadzona do bazy danych STRING, z wybranym gatunkiem Homo sapiens oraz progiem ufności dla oddziaływań > 0,413. Plik oddziaływań zaimportowano do programu Cytoscape, a wtyczkę CytoHubba wykorzystano do rankingowania genów według stopnia węzła. Geny o wysokim stopniu połączeń zdefiniowano jako geny hubowe.

6. Wybór genów cech diagnostycznych przy użyciu uczenia maszynowego

Zastosowano trzy niezależne algorytmy selekcji cech. Po pierwsze, przeprowadzono regresję logistyczną z wykorzystaniem metody LASSO (least absolute shrinkage and selection operator) przy użyciu pakietu glmnet i 10-krotnej walidacji krzyżowej w celu zidentyfikowania genów o niezerowych współczynnikach14. Po drugie, zastosowano rekurencyjną eliminację cech (recursive feature elimination) z wykorzystaniem maszyn wektorowych wsparcia (support vector machines), aby usunąć redundantne cechy i wybrać podzbiór cech, który osiągnął najwyższą dokładność w walidacji krzyżowej15. Po trzecie, skonstruowano model lasu losowego, a cechy uszeregowano według średniego spadku zanieczyszczenia Gini16. Przecięcie zbiorów genów uzyskanych z trzech algorytmów posłużyło do zdefiniowania końcowego zestawu kluczowych genów cech. Pakiet pROC został wykorzystany do wygenerowania krzywych charakterystyki ROC (receiver operating characteristic) oraz obliczenia wartości powierzchni pod krzywą (AUC)17.

7. Walidacja genów kluczowych z wykorzystaniem niezależnych zbiorów danych bulk oraz single-cell

Zestaw danych GSE117261 został wykorzystany jako niezależna zewnętrzna kohorta walidacyjna dla tkanki płucnej, zawierająca 58 próbek z PAH oraz 25 próbek kontrolnych od dawców niezakwalifikowanych18. Zestaw ten nie był używany w analizie odkrywczej różnicowej ekspresji, konstrukcji ważonej sieci koekspresji genów ani w selekcji cech za pomocą uczenia maszynowego. Macierz ekspresji została znormalizowana i adnotowana, a różnicową ekspresję przeanalizowano przy użyciu pakietu limma v3.68.0. Korekcja stopy fałszywych odkryć metodą Benjamini-Hochberga została zastosowana dla całego adnotowanego transkrypтому. Krzywe charakterystyki operacyjnej odbiornika (ROC) dla pojedynczych genów obliczono przy użyciu pakietu pROC v1.19.0.1, 95% przedziałów ufności DeLonga oraz punktów odcięcia wskaźnika Youdena. W ramach GSE117261 dopasowano eksploracyjny model regresji logistycznej dla pięciu genów, a jego wewnętrzną wydajność dodatkowo oceniono za pomocą wielokrotnej zagnieżdżonej walidacji krzyżowej.

Zbiór danych GSE210248 (Tabela 1) został wykorzystany jako zewnętrzny zestaw walidacyjny dla pojedynczych komórek tętnicy płucnej, zawierający próbki od trzech pacjentów z PAH oraz trzech zdrowych dawców19. Dane zostały przetworzone przy użyciu oprogramowania Seurat v5.5.1 w celu kontroli jakości, normalizacji, redukcji wymiarowości, klastrowania i adnotacji komórek20. Zidentyfikowano główne populacje komórek, w tym komórki śródbłonka, komórki mięśni gładkich, fibroblasty, monocyty/makrofagi oraz komórki T/natural killer. Komunikację międzykomórkową przeanalizowano za pomocą CellChat v2.1.2 oraz bazy danych ligandów i receptorów CellChatDB.human21. Obiekt CellChat utworzono na podstawie znormalizowanej macierzy ekspresji Seurat oraz metadanych dotyczących typów komórek. Zidentyfikowano geny nadekspresjonowane oraz interakcje ligand-receptor, obliczono prawdopodobieństwa komunikacji, usunięto interakcje obejmujące grupy komórek liczące mniej niż 10 komórek, a następnie wywnioskowano i zagregowano sieci komunikacyjne na poziomie szlaków. Zbiór danych ten został wykorzystany wyłącznie do zewnętrznej walidacji mechanistycznej, a nie do trenowania modelu.

ElementOpis
Zbiór danychGSE210248
Typ danychsekwencjonowanie RNA pojedynczych komórek metodą kroplową 10x Genomics; wysokoprzepustowe profilowanie transkryktomiczne
Próbki ludzkietrzy próbki tętnicy płucnej z PAH oraz trzy próbki tętnicy płucnej od zdrowych dawców
Źródło tkankitkanka tętnicy płucnej ex vivo, odzwierciedlająca głównie ekologię komórkową ściany naczyniowej płuc oraz proces przebudowy naczyniowej
Główny cel analitycznylokalizacja typów komórek, przełączanie fenotypowe komórek mięśni gładkich, komunikacja między komórkami odpornościowymi a strukturalnymi oraz walidacja spójności mechanistycznej genów kandydackich

Tabela 1: Podstawowe informacje dotyczące zbioru danych do walidacji jednokomórkowej GSE210248. Tabela podsumowuje numer dostępu do zbioru danych, platformę sekwencjonowania, źródło tkanki, skład próbek oraz cel analityczny walidacji jednokomórkowej tętnicy płucnej.

8. Walidacja ekspresji genów metodą qRT-PCR

Walidacja metodą qRT-PCR objęła 20 biologicznie niezależnych próbek tkanki płucnej PAH od pacjentów z PH/PAH oraz 20 biologicznie niezależnych kontrolnych próbek tkanki płucnej. Całkowity RNA wyekstrahowano przy użyciu zestawu Total RNA Extraction Kit. Stężenie i czystość RNA oceniono za pomocą spektrofotometru, a integralność RNA oceniono za pomocą elektroforezy w żelu agarozowym. Do analizy włączono wyłącznie próbki RNA o wartościach A260/280 między 1,8 a 2,1 i bez widocznej degradacji.

Równe ilości RNA poddano odwrotnej transkrypcji do komplementarnego DNA przy użyciu zestawu Solarbio Universal RT-PCR Kit (AMV; nr katalogowy RP1200). Ilościową PCR dla CXCL10, JUN, IFIH1, MX1 i TLR7 przeprowadzono z użyciem SYBR Green PCR Master Mix w systemie Real-Time PCR. Każda próbka biologiczna była analizowana w trzech powtórzeniach technicznych, wraz z kontrolami bez matrycy (no-template) i bez odwrotnej transkrypcji (no-reverse-transcription). Do dalszych analiz wykorzystano średnią wartość Ct z trzech powtórzeń technicznych; powtórzenia techniczne nie były traktowane jako niezależne obserwacje. Zastosowano startery obejmujące złącza ekson-ekson, generujące amplikony o długości 80–200 bp (Tabela 2). Specyficzność starterów zweryfikowano za pomocą NCBI Primer-BLAST oraz analizy krzywej topnienia22.

β-actin (ACTB) wykorzystano jako wewnętrzny gen referencyjny do normalizacji poziomów ekspresji genów docelowych. Ekspresję względną obliczono metodą 2-ΔΔCt23. Do porównań międzygrupowych, w zależności od rozkładu danych, zastosowano dwustronne testy U Manna-Whitneya, a dla pięciu genów wprowadzono korektę stopy odkryć fałszywych metodą Benjamini-Hochberga. Krzywe ROC dla pojedynczych genów wygenerowano z 95% przedziałami ufności DeLonga, a optymalne punkty odcięcia wybrano za pomocą indeksu Youdena. Model regresji logistycznej dla pięciu genów został wstępnie dopasowany i oceniony na tych samych 40 próbkach biologicznych; szacunek ten zdefiniowano zatem jako pozorną wydajność wewnątrzpróbkową. Aby ocenić potencjalne przeuczenie, przeprowadzono 100 powtórzeń stratyfikowanej pięciokrotnej walidacji krzyżowej z wykorzystaniem modelu regresji logistycznej z regularyzacją L2, a następnie obliczono zbiorczą wydajność ROC dla danych spoza próby walidacyjnej.

GenNumer akcesyjny RefSeqStarter przedni (5′–3′)Starter odwrotny (5′–3′)Rozmiar produktu (bp)Tm (°C)Przecinający ekson
CXCL10NM_001565.4GTCAAGCCAT
AATTGTTC
ATAGTGCCAG
GGTAGAGT
14146.1Tak
JUNNM_002228.4ACAAGTGGCA
GAGTCCCG
CGCCCAAGTT
CAACAACC
15254.5Tak
IFIH1NM_022168GCACAGAGCG
GTAGACCCT
GCCCTGAAGC
ACGAGATG
18254.7Tak
MX1NM_002462.5TTAGCCGTGG
TGATTTAGC
CAAGGTGGAG
CGATTCTG
15652.3Tak
TLR7NM_016562.4ATTGCCCTCGT
TGTTATA
TTCCTGGAGTT
TGTTGAT
17948.1Tak
ACTBNM_001101.3CTCACCATGGAT
GATGATATCGC
AGGAATCCTTCT
GACCCATGC
19456.2Tak

Tabela 2: Sekwencje starterów użytych do ilościowej PCR z odwrotną transkrypcją. Tabela zawiera geny docelowe, numery dostępowe RefSeq, sekwencje starterów w przód i w tył, wielkości produktów, temperatury topnienia oraz status obejmowania eksonów przez startery użyte do qRT-PCR.

9. Przesiewanie związków kandydackich i dokowanie molekularne

Sygnatury genów rdzeniowych o zwiększonej i zmniejszonej ekspresji zostały wprowadzone do bazy danych Connectivity Map w celu zidentyfikowania małych cząsteczek, które według prognoz odwracają profil ekspresji związany z PH7. Kandydaci zostali uszeregowani według wyniku Logit oraz prawdopodobieństwa predykcji.

Struktura trójwymiarowa BRD-K91900765/VX-745 została pobrana z bazy PubChem pod numerem CID 303852524. Informacje farmakologiczne dotyczące związku opracowano na podstawie publicznych baz danych leków, a deskryptory strukturalne obliczono przy użyciu DrugBank oraz SwissADME25,26. Struktury białek pobrano z RCSB Protein Data Bank, korzystając z następujących identyfikatorów PDB: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN oraz MAPK14/p38α, 1OUK27. Wykrywanie ślepych kawern oraz dokowanie molekularne przeprowadzono za pomocą programu CB-Dock2 v2.0 z silnikiem oceniającym AutoDock Vina v1.2.028,29. Pliki białek i ligandów przesłano do CB-Dock2, automatycznie wykryto potencjalne kawerny, a dokowanie wykonano w obrębie specyficznych dla kawern obszarów (docking-box) wygenerowanych przez serwer. Dla każdego białka zapisano identyfikator kawerny, wynik Vina, objętość kawerny, środek obszaru dokowania, wymiary obszaru dokowania oraz plik kompleksu białko-ligand. Poza z najbardziej ujemnym wynikiem Vina wybrano jako najwyżej ocenioną przewidywaną konformację. Białko MAPK14/p38α zostało uwzględnione jako ustalony cel farmakologiczny i pozytywny punkt odniesienia dla dokowania VX-745. Dokowanie względem CXCL10, JUN, IFIH1, MX1 i TLR7 miało charakter eksploracyjny i nie było interpretowane jako dowód bezpośredniego celowania farmakologicznego, wiązania, inhibicji ani skuteczności.

10. Analiza statystyczna i kontrola powtarzalności

Wszystkie analizy statystyczne wykonano w programie R, chyba że zaznaczono inaczej. Dwustronne wartości P < 0,05 uznano za statystycznie istotne. Korektę dla wielokrotnych testów zastosowano w analizach różnicowej ekspresji, wzbogacenia, walidacji zewnętrznej oraz qRT-PCR, zgodnie z powyższym opisem. W celu oceny stabilności modeli uczenia maszynowego i połączonych modeli qRT-PCR zastosowano walidację krzyżową.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Przetwarzanie wstępne publicznych danych transkryptomicznych i identyfikacja genów różnicowo wyrażonych

Integracja i korekcja metodą ComBat zbiorów GSE22356, GSE33463 oraz GSE48149 zredukowały systematyczne różnice między zestawami danych. Wykresy pudełkowe wykazały, że rozkłady ekspresji próbek stały się bardziej spójne po korekcie. Analiza głównych składowych wskazała, że przed korekcją próbki grupowały się głównie według źródła pochodzenia zestawu danych, natomiast po korek...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Opracowano zintegrowany i powtarzalny schemat postępowania w celu zidentyfikowania biomarkerów molekularnych związanych z PH/PAH oraz potencjalnych związków terapeutycznych, łącząc publiczne dane transkryptomiczne, analizę ważonych sieci koekspresji genów, wzbogacenie funkcjonalne, analizę sieci oddziaływań białko-białko, trzy algorytmy uczenia maszynowego, walidację zewnętrzną, interpretację transkryptomiczną w pojedynczych komórkach, potwierdzenie za pomocą ilościowej reakcji polimerazy w łańcuchu z odwrotną transkrypc...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy oświadczają, że nie stwierdzono konfliktu interesów.

Podziękowania

Badanie to zostało wsparte przez Hunan Innovative Province Construction Project (nr 2022JJ30465).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
2× SYBR Green PCR MastermixBeijing Solarbio Science & Technology Co., Ltd.Nr katalogowy SR1110Ilościowa amplifikacja PCR w czasie rzeczywistym z wykorzystaniem barwników oraz detekcja fluorescencyjna
AI21.msvmRFE.R oraz e1071Własny skrypt R z pakietem e1071 z repozytorium CRANAI21.msvmRFE.R; e1071 v1.7-17Rekurencyjna eliminacja cech z wykorzystaniem maszyny wektorów nośnych
AgarozaBeijing Solarbio Science & Technology Co., Ltd.Nr katalogowy A8201; CAS 9012-36-6Ocena integralności całkowitego RNA za pomocą elektroforezy w żelu agarozowym
Aparatura do elektroforezy w żelu agarozowymBeijing Liuyi Biotechnology Co., Ltd.Model DYCZ-24DNElektroforetyczna ocena integralności RNA
Silnik oceniający AutoDock VinaCentrum Biologii Strukturalnej Obliczeniowej, Scripps Researchv1.2.0; RRID: SCR_011958Punktacja póz białko-ligand w ramach procedury CB-Dock2
CB-Dock2Laboratorium Cao, serwer WWW CB-Dock2v2.0; dostęp w lipcu 2026 r.Wykrywanie pustych wnęk oraz dokowanie molekularne związku VX-745 z wybranymi strukturami białek
CellChatPakiet R CellChatv2.1.2Wnioskowanie i wizualizacja komunikacji międzykomórkowej na podstawie macierzy ekspresji pojedynczych komórek
CellChatDB.humanDystrybuowane z pakietem R CellChatCellChatDB.human; podzbiór sygnalizacji wydzielniczej; minimalny próg komórek = 10Baza danych interakcji ligand-receptor u ludzi dla CellChat
clusterProfilerPakiet R Bioconductorv4.20.0; wersja Bioconductor 3.23Analizy wzbogacenia w oparciu o ontologię genów (Gene Ontology) oraz Kioto encyklopedię genów i genomów (Kyoto Encyclopedia of Genes and Genomes)
Mapa Połączeń (CMap/CLUE)Broad Institutezasób L1000/CLUE; RRID: SCR_016204; dostęp w lipcu 2026 r.Obliczeniowa analiza repozycjonowania leków
Dedykowane primery oligonukleotydoweBeijing Solarbio Science & Technology Co., Ltd.Synteza na zamówienie; sekwencje starterów podano w tabeli 2Amplifikacja ACTB, CXCL10, JUN, IFIH1, MX1 i TLR7
cytoHubbaSklep z aplikacjami Cytoscapev0.1Ranking genów typu hub w sieci oddziaływań białko-białko w oparciu o stopień węzła
CytoscapeKonsorcjum Cytoscapev3.10.4; RRID: SCR_003032Wizualizacja i analiza sieci oddziaływań białko-białko
DrugBankBaza Wiedzy DrugBankv6.0; RRID: SCR_002700Identyfikacja związków i kuratela informacji farmakologicznych
System do dokumentacji żeliBeijing Liuyi Biotechnology Co., Ltd.Model WO-9413BWizualizacja i rejestracja wyników analizy integralności RNA w żelu agarozowym
Gene Expression Omnibus (GEO)Krajowe Centrum Biotehnologii InformacyjnejGSE22356, GSE33463, GSE48149, GSE117261 oraz GSE210248; RRID: SCR_005012Pobieranie zbiorów danych transkrypomicznych z pojedynczych komórek oraz z całych populacji komórek
GEOquerypakiet R Bioconductorv2.80.0; wydanie Bioconductor 3.23Programowe pobieranie i import danych ekspresji oraz fenotypowych z GEO
glmnetpakiet R z repozytorium CRANv5.0Regresja logistyczna metodą LASSO (least absolute shrinkage and selection operator) oraz regularyzowane modelowanie logistyczne
limmapakiet R z projektu Bioconductorv3.68.0; wersja Bioconductor 3.23; RRID: SCR_010943Analiza ekspresji różnicowej i statystyka empirycznego Bayesa
spektrofotometr NanoDropThermo Fisher ScientificNanoDrop ND-1000; oprogramowanie v3.8Pomiar stężenia RNA oraz wskaźników czystości A260/280 i A260/230
NCBI Primer-BLASTKrajowe Centrum Biotechnologii InformacyjnejNarzędzie internetowe; RRID: SCR_003095; dostęp w lipcu 2026 r.Weryfikacja specyficzności starterów
pROCpakiet R z repozytorium CRANv1.19.0.1; RRID: SCR_024286Analiza charakterystyki operacyjnej odbiornika, przedziały ufności DeLonga oraz punkty odcięcia indeksu Youdena
Protein Data Bank (PDB)RCSB Protein Data BankCXCL10: 1LV9; JUN: 1JUN; IFIH1: 3B6E; MX1: 5GTM; TLR7: 7CYN; MAPK14/p38α: 1OUK; RRID: SCR_012820Pobieranie eksperymentalnie wyznaczonych struktur białek do dokowania molekularnego
PubChemKrajowe Centrum Biotechnologiczne (NCBI)PubChem CID 3038525; RRID: SCR_004284Pozyskiwanie struktury trójwymiarowej i identyfikatorów chemicznych BRD-K91900765/VX-745
RR Foundation for Statistical Computingv4.6.1; RRID: SCR_001905Obliczenia statystyczne, przetwarzanie danych, uczenie maszynowe i wizualizacja
lasy losowepakiet R z repozytorium CRANv4.7-1.2Wybór cech i ranking istotności zmiennych metodą lasów losowych
System PCR w czasie rzeczywistymStratagene, obecnie Agilent TechnologiesSystem do analizy PCR w czasie rzeczywistym Mx3000Pamplifikacja qRT-PCR, detekcja fluorescencji, analiza krzywej topnienia oraz eksport wartości Ct
Seuratpakiet R z repozytorium CRAN; Satija Laboratoryv5.5.1; RRID: SCR_016341Kontrola jakości, normalizacja, redukcja wymiarowości, klasteryzacja i adnotacja w sekwencjonowaniu RNA pojedynczych komórek
Proszę podać tekst do tłumaczenia.Konsorcjum STRINGv12.0; RRID: SCR_005223Konstrukcja sieci oddziaływań białko-białko
sva (ComBat)pakiet R Bioconductorv3.60.0; wydanie Bioconductor 3.23Korekcja efektów seryjnych między zestawami danych
SwissADMESzwajcarski Instytut BioinformatykiSerwer WWW; dostęp w lipcu 2026 r.Wstępna analiza właściwości lekopodobnych, fizykochemicznych oraz parametrów ADME
Zestaw do izolacji całkowitego RNABeijing Solarbio Science & Technology Co., Ltd.Nr katalogowy R1200Ekstrakcja i oczyszczanie całkowitego RNA z próbek tkanki płucnej
Uniwersalny zestaw RT-PCR (AMV)Beijing Solarbio Science & Technology Co., Ltd.Nr katalogowy RP1200Odwrotna transkrypcja całkowitego RNA do komplementarnego DNA
WGCNA (Analiza sieci współwyrażania genów ważonej)pakiet R z repozytorium CRANv1.74Konstrukcja ważonej sieci współekspresji genów oraz analiza modułów i cech

Bibliografia

  1. Simonneau G, et al. Haemodynamic definitions and updated clinical classification of pulmonary hypertension. Eur Respir J. 2019;53(1):1801913. doi: 10.1183/13993003.01913-2018.
  2. Rabinovitch M, Guignabert C, Humbert M, Nicolls MR. Inflammation and immunity in the pathogenesis of pulmonary arterial hypertension. Circ Res. 2014;115(1):165–175.
  3. Humbert M, et al. 2022 ESC/ERS Guidelines for the diagnosis and treatment of pulmonary hypertension. Eur Heart J. 2022;43(38):3618–3731.
  4. Galiè N, et al. 2015 ESC/ERS Guidelines for the diagnosis and treatment of pulmonary hypertension. Eur Respir J. 2015;46(4):903–975.
  5. Soon E, et al. Elevated levels of inflammatory cytokines predict survival in idiopathic and familial pulmonary arterial hypertension. Circulation. 2010;122(9):920–927.
  6. George PM, et al. Evidence for the involvement of type I interferon in pulmonary arterial hypertension. Circ Res. 2014;114(4):677–688.
  7. Subramanian A, et al. A next-generation Connectivity Map: L1000 platform and the first 1,000,000 profiles. Cell. 2017;171(6):1437–1452.e17.
  8. Leek JT, et al. The sva package for removing batch effects and other unwanted variation in high-throughput experiments. Bioinformatics. 2012;28(6):882–883.
  9. Ritchie ME, et al. limma powers differential expression analyses for RNA-sequencing and microarray studies. Nucleic Acids Res. 2015;43(7):e47. doi: 10.1093/nar/gkv007.
  10. Langfelder P, Horvath S. WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics. 2008;9:559. doi: 10.1186/1471-2105-9-559.
  11. Yu G, Wang LG, Han Y, He QY. clusterProfiler: an R package for comparing biological themes among gene clusters. OMICS. 2012;16(5):284–287.
  12. Kanehisa M, Goto S. KEGG: Kyoto Encyclopedia of Genes and Genomes. Nucleic Acids Res. 2000;28(1):27–30.
  13. Szklarczyk D, et al. The STRING database in protein–protein association networks and functional enrichment analyses for any sequenced genome of interest. Nucleic Acids Res. 2023;51(D1):D638–D646.
  14. Friedman J, Hastie T, Tibshirani R. Regularization paths for generalized linear models via coordinate descent. J Stat Softw. 2010;33(1):1–22.
  15. Guyon I, Weston J, Barnhill S, Vapnik V. Gene selection for cancer classification using support vector machines. Mach Learn. 2002;46:389–422.
  16. Breiman L. Random forests. Mach Learn. 2001;45(1):5–32.
  17. Robin X, et al. pROC: an open-source package for R and S+ to analyze and compare ROC curves. BMC Bioinformatics. 2011;12:77. doi: 10.1186/s12859-011-0077-8.
  18. Stearman RS, et al. Systems analysis of the human pulmonary arterial hypertension lung transcriptome. Am J Respir Cell Mol Biol. 2019;60(6):637–649.
  19. Crnkovic S, et al. Single-cell transcriptomics reveals skewed cellular communication and phenotypic shift in pulmonary artery remodeling. JCI Insight. 2022;7(20):e153471. doi: 10.1172/jci.insight.153471.
  20. Hao Y, et al. Integrated analysis of multimodal single-cell data. Cell. 2021;184(13):3573–3587.e29.
  21. Jin S, et al. Inference and analysis of cell–cell communication using CellChat. Nat Commun. 2021;12(1):1088. doi: 10.1038/s41467-021-21246-9.
  22. Bustin SA, et al. MIQE 2.0: revision of the Minimum Information for Publication of Quantitative Real-Time PCR Experiments guidelines. Clin Chem. 2025;71(6):634–651.
  23. Livak KJ, Schmittgen TD. Analysis of relative gene expression data using real-time quantitative PCR and the 2−ΔΔCt method. Methods. 2001;25(4):402–408.
  24. Kim S, et al. PubChem 2023 update. Nucleic Acids Res. 2023;51(D1):D1373–D1380.
  25. Knox C, et al. DrugBank 6.0: the DrugBank Knowledgebase for 2024. Nucleic Acids Res. 2024;52(D1):D1265–D1275.
  26. Daina A, Michielin O, Zoete V. SwissADME: a free web tool to evaluate pharmacokinetics, drug-likeness, and medicinal chemistry friendliness of small molecules. Sci Rep. 2017;7:42717. doi: 10.1038/srep42717.
  27. Burley SK, et al. RCSB Protein Data Bank: powerful new tools for exploring 3D structures of biological macromolecules for basic and applied research and education. Nucleic Acids Res. 2021;49(D1):D437–D451. doi: 10.1093/nar/gkaa1038.
  28. Eberhardt J, Santos-Martins D, Tillack AF, Forli S. AutoDock Vina 1.2.0: new docking methods, expanded force field, and Python bindings. J Chem Inf Model. 2021;61(8):3891–3898. doi: 10.1021/acs.jcim.1c00203.
  29. Liu Y, et al. CB-Dock2: improved protein-ligand blind docking by integrating cavity detection, docking, and homologous template fitting. Nucleic Acids Res. 2022;50(W1):W159–W164. doi: 10.1093/nar/gkac394.
  30. Duffy JP, et al. The discovery of VX-745: a novel and selective p38α kinase inhibitor. ACS Med Chem Lett. 2011;2(10):758–763.
  31. Sheng Y, et al. Crocin inhibits neutrophil migration and activation to treat hypoxic pulmonary hypertension through targeting HCK. Phytomedicine. 2025;148:157334. doi: 10.1016/j.phymed.2025.157334.
  32. Cui H, et al. Leonurine ameliorates hypoxic pulmonary hypertension by inhibiting cross-talk between neutrophils and endothelial cells via SERPINB3 targeting. Int Immunopharmacol. 2026;176:116467. doi: 10.1016/j.intimp.2026.116467.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

Identyfikacja biomarkerówdane transkrypcyjneekspresja różnicowakoekspresja genówsieć oddziaływań białkowychsekwencjonowanie RNA pojedynczych komórekrepozycjonowanie lekówilościowy PCR