$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
분석 워크플로우 개요
본 연구의 전사체 및 머신러닝 기반 분석의 전체 설계는 그림 1에 나와 있으며, 주요 단계들은 다음과 같습니다: 레닌-안지오텐신 시스템 관련 유전자(RASRGs) 수집; 고혈압 데이터셋에서 RAS 관련 차별발현 유전자(RASRDEGs)를 스크리닝; 기능적 농축 분석(GO/KEGG/GSEA); 면역침윤 분석(CIBERSORT); 단백질-단백질 상호작용(PPI) 및 조절 네트워크 구축; 머신러닝 기반 핵심 유전자 선택(로지스틱 회귀, 무작위 숲 [RF]); 그리고 고혈압 진단 모델 평가. 본 연구에서 사용된 소프트웨어, 데이터베이스 및 온라인 도구의 전체 목록은 재료표에 제공되어 있습니다.
데이터 다운로드
고혈압 데이터셋GSE75360 8과 GSE74144(호모 사피엔스)은 GEO 데이터베이스10에서 R 패키지 GEOquery9를 통해 획득되었습니다. 말초혈 단핵세포(플랫폼: GPL10558)에서 유래한 GSE75360에는 10개의 고혈압 샘플과 11개의 대조군 샘플이 포함되었으며; 백혈구에서 추출한 GSE74144(플랫폼: GPL13497)에는 14개의 고혈압 샘플과 8개의 대조군 샘플이 포함되었습니다(표 1). 단백질 코딩 RASRGs(1,264)는 GeneCards11(키워드: "Renin-Angiotensin System")과 PubMed(키워드: "Renin-Angiotensin System")12,13을 통해 처음 확인되었습니다. 이 RASRG들과 GSE75360/GSE74144 유전자의 교차 결과, 최종 RASRG는 1,159개가 생성되었습니다14. 두 데이터셋은 서로 다른 마이크로어레이 플랫폼에서 생성되었기 때문에 별도로 처리되었습니다. 프로브 주석은 해당 GPL 플랫폼 주석 파일에 따라 수행되었으며, 정규화된 유전자 발현 행렬은 후속 분석에 사용되었습니다. 박스플롯을 사용하여 정규화 전후의 표현 분포를 비교하였습니다.
고혈압 관련 레닌-안지오텐신 관련 차별발현 유전자
GSE75360 데이터셋의 샘플은 고혈압군과 대조군으로 분류되었습니다. limma 소프트웨어는두 그룹 간 차등 유전자 발현 분석을 수행했으며, |logFC| 임계값으로 식별된 차등 발현 유전자(DEGs)를 사용했습니다. > 0.45, p-값은 0.05<. 이 차별 분석 결과는 R 패키지 ggplot2를 사용해 생성된 화산 도표를 통해 시각화되었습니다.
RASRDEG를 얻기 위해 위 임계값(|logFC| > 0.45, p값 < 0.05)을 충족하는 DEG를 RAS 관련 유전자(RASRGs)와 교차 참조하고, 교차 결과를 벤 다이어그램으로 제시했습니다. 이후 확인된 RASRDEG의 발현 패턴은 R 패키지 히트맵을 사용하여 히트맵으로 시각화되었고, RASRDEG의 염색체 위치는 R 패키지 RCircos15를 사용해 생성된 염색체 지도를 통해 표시되었습니다.
차별 발현 유전자 검증 및 ROC 곡선 분석
그룹 간 플롯을 작성하여 GSE7536016 환자 중 고혈압/대조군 간 RASRDEG 발현 차이를 분석하였으며, R 패키지 pROC를 사용해 ROC 곡선을 그려 RASRDEG 진단 효능에 대한 AUC(0.5–0.7: 낮은 정확도; 0.7–0.9: 보통도; >0.9: 높음)를 산출하였습니다.
상관관계 분석
스피어먼의 상관관계 분석은 GSE75360년의 RASRDEG 발현에 대해 수행되었습니다; 결과는 히트맵(R 패키지 ggplot2)을 통해 시각화되었습니다 (|r| < 0.3: 상관관계 없음/약; 0.3–0.5: 약; 0.5–0.8: 중등도; >0.8: 강).
GO와 KEGG의 농축 분석
GO(Gene Ontology, 2024년 릴리스, http://geneontology.org/)는 생물학적 과정(BP), 세포 구성 요소(CC), 분자 기능(MF)의 세 영역을 포함하는 대규모 기능 풍부화에 널리 사용되는 자원입니다17. KEGG(교토 유전자 및 유전체 백과사전, Release 109.0, 2024, https://www.genome.jp/kegg/)는 유전체, 생체 경로, 질병 및 약물에 관한 데이터를 저장합니다.
RASRDEG는 R 패키지 clusterProfiler19를 사용하여 GO 주석 및 KEGG 경로 농축 분석을 수행하였습니다. 농축 시험 방법: 초기하학적 검사; 다중 시험 보정법: 벤자미니-호흐베르크(BH) 방법. 선별 기준: 조정 p-값 < 0.05.
유전자 집합 풍부화 분석 (GSEA)
코호트 수준 GSEA에서는 GSE75360의 차등 발현 분석에서 검사된 모든 유전자가 logFC에 따라 내림차순으로 순위가 매겨져 clusterProfiler19의 입력 유전자 목록으로 사용되었습니다. GSEA 이전에는 DEG 전처리가 적용되지 않았습니다. MSigDB20의 c2 유전자 집합 모음입니다. 매개변수: 씨앗 = 2022, 세트당 10–500 유전자; 선별 기준: 교정 P < 0.05 (벤자미니-호흐버그, BH 방법), FDR < 0.2521.
고혈압 진단 모델 구축
고혈압과 관련된 주요 유전자를 식별하기 위해 우리는 두 가지 유형의 머신러닝 알고리즘, 즉 로지스틱 회귀와 랜덤 포레스트(RF)를 사용했습니다. 로지스틱 회귀(이진 종속 변수: 고혈압/대조군)를 통해 p < 0.05의 RASRDEG를 선별하였습니다. 랜덤 포레스트 (RF, R 패키지 randomForest): parameters.seed(520), ntree = 1000; MeanDecreaseGini(변수 중요도 지표)를 추출하고 상위 15개의 RASRDEG를 선정하였습니다. RASRDEG는 p값 0.05< 기준으로 선별되었습니다.
RF(Random Forest) 알고리즘은 Bagging 카테고리(다중 결정 트리 통합) 범주에 속하는 앙상블 학습 방법으로, R 패키지 randomForest22 (매개변수: set.seed(520), ntree = 1000)를 통해 적용되었습니다. 특징 유전자의 MeanReductionGini(노드 분할 시 평균 순도 감소에 따른 변수 중요도를 반영)를 추출하고, 상위 15개의 RASRDEG를 선정하였습니다. 마지막으로, 로지스틱 회귀와 RF로 선별한 유전자들의 벤 다이어그램을 통해 고혈압 관련 주요 유전자를 식별하였습니다.
고혈압 진단 모델의 검증
주요 유전자를 기반으로 로지스틱 회귀 모델이 구축되었으며; 선형 예측 값(η)은 다음과 같이 계산되었습니다:

R 패키지 pROC16 을 사용해 ROC 곡선을 그려내고 고혈압 위험 예측에 있어 모델의 효능을 평가하였습니다. R 패키지 rms23 을 통해 각 주요 유전자가 로지스틱 회귀 모델에 기여하는 바를 시각화하기 위해 노모그램이 구축되었으며(주요 유전자와 고혈압 위험 간의 연관성을 반영함), 예측된 고혈압 확률과 실제 고혈압 확률 간의 일관성을 평가하기 위해 보정 곡선이 생성되었으며; 결정곡선 분석(DCA, R 패키지 ggDCA24)을 수행하여 모델의 임상 효용(순이익)을 GSE75360 및 GSE74144에서 평가하였습니다.
단일 유전자 GSEA
GSEA는 특정 유전자와 관련된 유전자가 생물학적 과정/경로/질병에서 어떤 역할을 하는지 발현을 분석하여 그 유전자의 기능적 역할을 이해하는 데 도움을 줍니다. GSE75360 각 초점 유전자에 대해 샘플은 중앙값에서 고발현군과 저발현군으로 나뉘었습니다. 이후 모든 검사된 유전자에 대해 차별 발현 분석을 수행하였고, clusterProfiler19를 사용해 GSEA 전에 유전체 전체 logFC 값을 높음부터 낮음까지 순위 매겼습니다. GSEA 이전에는 DEG 전처리가 적용되지 않았습니다. 매개변수: seed = 2020, 세트당 10–500개의 유전자 (MSigDB21에서 추출한 c2 유전자 집합). 선별 기준: p < 0.05 (형용사 p 보정 BH 방법).
면역 침윤 분석 (CIBERSORT)
CIBERSORT 알고리즘25 (선형 지지 벡터 회귀 기반)는 전사체 행렬을 디컨볼루트하여 혼합 샘플에서 면역 세포 구성 비율을 추정했습니다(면역 세포 풍부도 점수 0> 데이터를 선택함). GSE75360의 최종 면역 세포 침윤 행렬은 비율 막대 차트를 통해 시각화되었습니다. 스피어먼의 상관관계는 면역 세포-면역 세포 및 주요 유전자-면역 세포 연관을 분석하는 데 사용되었으며, 결과는 각각 상관 열지도(R 패키지 히트맵)와 상관 버블 플롯(R 패키지 ggplot2)으로 제시되었습니다.
단백질-단백질 상호작용(PPI) 네트워크
PPI 네트워크는 상호작용을 통해 생물학적 과정을 조절하는 상호 연결된 단백질 시스템입니다. STRING 데이터베이스26을 사용하여 주요 유전자에 대한 PPI 네트워크를 구축했으며(최소 상호작용 점수: 0.150, 신뢰도는 낮음). 상호작용하는 유전자를 선별하여 레닌-안지오텐신 관련 허브 유전자를 선별하였습니다. GeneMANIA 데이터베이스27은 유전체 및 단백질체 데이터셋을 이용해 기능적으로 유사한 유전자를 식별하며, 주요 RAS 유전자의 기능적으로 유사한 유전자를 예측하고 단백질 상호작용 네트워크를 구축하는 데 사용되었습니다.
규제 네트워크 구축
mRNA-TF 네트워크: 전사인자(TFs)는 표적 유전자와의 전사 후 상호작용을 통해 유전자 발현을 조절합니다. 허브 유전자와 그 조절 관계를 표적으로 하는 TFs는 ChIPBase 데이터베이스에서28번을 가져왔고, mRNA-TF 네트워크는 Cytoscape29를 사용해 시각화되었다.
mRNA-miRNA 네트워크: miRNA는 여러 표적 유전자를 조절하며(단일 타깃은 여러 miRNA에 의해 공동 조절될 수 있음). StarBase v3.030 은 RASRDEG와 관련된 miRNA를 식별하는 데 사용되었으며, mRNA-miRNA 네트워크는 Cytoscape를 통해 시각화되었습니다.
mRNA-약물 네트워크: 독성유전체 데이터베이스31 개를 사용해 허브 유전자의 직접적/간접적 약물 표적을 예측하였습니다. mRNA-약물 네트워크(유전자-약물 상호작용 보여)를 Cytoscape로 시각화하여 네트워크 구축을 완료하였습니다.
Ang II 유도 HUVEC 모델
인간 탯줄 정맥 내피세포(HUVECs)는 5%CO2가 포함된 가습 인큐베이터에서 37°C에서 유지되었습니다. 세포는 공급자의 지침에 따라 태아 소 혈청과 항생제를 보충한 완전한 내피 세포 배양 배양지에서 유지되었습니다. 시험관 내 고혈압 관련 내피 손상 모델을 구축하기 위해, HUVECs는 48시간 동안 안지오텐신 II(Ang II; 100 nM)로 치료하였다. 차량 처리 세포를 대조군으로 사용했습니다.
유전자 개입 실험에서는 CST3 또는 FURIN(si-CST3 및 si-FURIN)을 표적으로 하는 소량 간섭 RNA(si-CST3 및 si-FURIN), 해당 음성 대조 siRNA(si-NC), CST3 또는 FURIN 과발현 플라스미드(oe-CST3 및 oe-FURIN), 그리고 이에 대응하는 빈 벡터 대조군(oe-NC)을 제조사 프로토콜에 따라 상업용 형질전환 시약을 사용해 HUVEC에 형질전환했습니다. 형질전환 후 세포는 Ang II에 노출된 후 발현 검증과 기능 분석을 위해 수확되었습니다. qRT-PCR 및 웨스턴 블롯팅으로 녹다운 및 과발현 효율이 확인되었습니다.
qRT-PCR
표준 RNA 추출 시약을 사용해 HUVEC에서 총 RNA를 분리하고, 역전사 키트를 사용해 상보적 DNA를 생성하였습니다. SYBR 그린 화학이 qRT-PCR에 사용되었습니다. LRP1, CTSD, MTHFR, AUTS2, FURIN, CST3, FCER1G, TBXAS1, IL-6, TNF-α, VCAM1, ICAM1, eNOS의 발현 수준은 GAPDH로 정규화되었으며, 2−ΔΔCt 방법으로 계산되었습니다.
서부 블롯팅
웨스턴 블롯 분석에서는 RIPA 용해 버퍼로 단백질을 추출하고 BCA 분석법으로 정량했습니다. 동일한 양의 단백질을 SDS-PAG로 분리하여 PVDF 막으로 전달했습니다. 차단 후에는 CST3, FURIN, TBXAS1, GAPDH에 대한 1차 항체와 함께 막을 인큐베이팅한 후 적절한 2차 항체로 인큐베이팅하였습니다. 밴드는 화학발광으로 검출되었고, 밀도계는 GAPDH로 정규화되었습니다. 배양 상청액에서 분비된 CST3는 제조사 프로토콜에 따라 ELISA 키트로 정량화되었습니다.
세포 생존 가능성
세포 생존 가능성은 Cell Counting Kit-8(CCK-8) 검사법을 사용하여 평가하였습니다. 간단히 말해, 트랜스펙션 및 Ang II 처리된 HUVEC를 96웰 플레이트에 시딩하였고, CCK-8 시약 첨가 후 0, 24, 48, 72시간에 450nm에서 흡광도를 측정했습니다. 세포 이동은 트랜스웰 챔버를 사용하여 평가되었습니다. 지정된 개입 후, 세포는 상부 챔버에 시딩되었고, 하부 막 표면에 위치한 이동 세포는 고정, 염색 후 무작위 선택된 필드에서 현미경으로 세어졌습니다.
염증 검사
염증 활성화, 산화 스트레스, 내피 기능을 평가하기 위함: IL-6, TNF-α, VCAM1, ICAM1, 그리고 eNOS.mRNA 수치는 qRT-PCR로 검출되었습니다. 배양 상청액 내 산화질소(NO) 농도는 상업용 NO 검사 키트를 사용해 측정했으며, 제조사 지침에 따라 DCF 형광법을 이용해 세포내 활성 산소종(ROS) 수치를 검출하였습니다.
통계 분석
R에서는 전사체 처리 및 모델링이 수행되었으며, Shapiro-Wilk 검정으로 연속 변수의 정상성을 평가하였다. 2군 비교에서는 정규분포 변수에 대해 독립 표본 t-검정이 사용되었고, 비정규 변수에는 윌콕슨 랭크합 검정이 사용되었습니다. 세 개 이상의 그룹에 대해, 분산의 정규성과 동질성이 충족될 경우 적절한 사후 검정을 통한 일방향 분산 분석이 사용되었습니다; 그렇지 않으면 크루스칼-월리스 검정이 적용되었다. CCK-8 시간-경과 데이터는 분산의 양측 분석을 통해 분석하였다. 연관 분석을 위해 스피어먼 상관계수를 계산하였다. 특별한 언급이 없는 한, 실험 결과는 평균 ± SD로 표시되며, 양측 p< 0.05는 유의한 것으로 간주되었습니다.