이 연구는 통합 전사체 분석, 머신러닝(LASSO, SVM-RFE, XGBoost), 면역 침윤 분석, 분자 도킹, RT-qPCR 검증을 사용하여 특발성 폐섬유증과 관련된 당실화 관련 유전자를 규명하였습니다. 10개의 후보 진단 유전자가 확인되었고, 폐 조직 데이터셋에서 강력한 성능을 보이는 진단 모델이 개발되고 검증되었습니다.
이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.
이 연구는 통합 전사체 분석, 머신러닝(LASSO, SVM-RFE, XGBoost), 면역 침윤 분석, 분자 도킹, RT-qPCR 검증을 사용하여 특발성 폐섬유증과 관련된 당실화 관련 유전자를 규명하였습니다. 10개의 후보 진단 유전자가 확인되었고, 폐 조직 데이터셋에서 강력한 성능을 보이는 진단 모델이 개발되고 검증되었습니다.
특발성 폐섬유증(IPF)은 원인이 명확하지 않은 진행성 만성 폐 질환으로, 당실화 관련 유전자(GRG)의 발병 기여는 아직 잘 알려져 있지 않습니다. 본 연구는 IPF에서 GRG의 잠재적 메커니즘을 밝히고, 주요 바이오마커를 식별하며, 생물정보학과 머신러닝을 활용한 진단 모델 개발에 중점을 둡니다. GEO 데이터베이스의 전사체 데이터는 IPF에서의 역할을 조사하기 위해 GRG와 통합되었습니다. 차별발현 유전자(DEGs)를 확인하여 기능 풍부화 및 단백질-단백질 상호작용(PPI) 분석을 수행하였습니다. LASSO 회귀, 지원 벡터 기계재귀 특징 제거(SVM-RFE), XGBoost를 결합한 머신러닝 워크플로우가 적용되어 GSE150910 훈련 데이터셋을 활용해 주요 유전자를 식별하고 진단 모델을 구축했습니다. 모델 성능은 이후 네 개의 독립적인 검증 데이터셋에서 평가되었습니다. 유전자 집합 풍부 분석(GSEA), 면역 침윤 분석, 약물-유전자 상호작용 분석, 분자 도킹, 그리고 IPF 환자와 건강한 대조군의 말초혈 샘플을 이용한 RT-qPCR 검증 등 추가 분석이 수행되어 확인된 유전자의 생물학적 관련성을 조사하였습니다. 총 126개의 당실 관련 DEG가 확인되었고, 10개의 핵심 유전자가 선정되었습니다. 진단 모델은 폐 조직 데이터셋에서 곡선 아래 면적(AUC)을 0.963과 0.814, 혈액 데이터셋에서 0.681과 0.706을 달성했습니다. 면역 침윤 분석에서는 환자 하위 그룹 간 B세포 풍부도 차이가 확인되었고, RT-qPCR 검증은 임상 샘플에서 선택된 유전자의 차별 발현을 확인했습니다. 이 발견들은 GRG가 IPF에 잠재적으로 관여할 수 있는지에 대한 통찰을 제공하며, 후보 진단 유전자로서의 적합성을 뒷받침합니다.
특발성 폐섬유증(IPF)은 유전적 소인, 환경 유발 요인, 면역 기능 장애가 포함하는 이질성 병리를 특징으로 하는 진행성 섬유화 간질성 폐질환입니다 1,2. 이 질병은 조기 진단의 어려움, 제한된 치료 효과, 그리고 전반적인 불량한 예후로 인해 임상적으로 큰 도전을 안겨줍니다. IPF의 유병률은 10만 명당 20명에서 80명 사이이며, 치료가 없으면 진단 후 중앙 생존 기간은 일반적으로 3년에서5년입니다. 빠른 질병 진행 위험이 높은 환자를 식별하는 것은 효과적인 치료 전략을 위해 매우 중요하며, 질병 감소를 경험할 가능성이 가장 높은 환자들에게 표적 치료를 가능하게 합니다.
당실화는 단백질의 공동 번역 및 번역 후 변형으로, 단백질 활성과 세포 생물학 조절에 중요한 역할을 합니다 5,6. 단백질 당화 조절 이상이 IPF 진행에 기여하는 것으로 보입니다 7,8. 많은 류머티즘 질환에서 단백질 당화 변화가 관찰되며, 이는 염증 과정과 질병 진행과 밀접하게 연관되어 있습니다. 예를 들어, Lyu 등은 CRLF1과 GLG1이 골관절염10의 병리학적 과정에서 핵심 역할을 한다는 사실을 발견했습니다. 더불어, 당화는 폐 조직 내 면역 세포 활성화와 관련이 있으며, 폐 질환의 발병 기전과도 연관되어 있습니다11. 이러한 점을 고려할 때, 단백질 당화 조절 이상도 IPF 진행에 기여할 수 있습니다. 그러나 당실화 관련 유전자(GRGs)의 IPF에 대한 역할은 아직 충분히 탐구되지 않았으며, IPF 진단에 대한 잠재력은 추가 연구가 필요합니다.
본 연구에서는 머신러닝 접근법과 RNA 시퀀싱 데이터를 통합하여 IPF와 관련된 주요 GRG를 규명하는 연구를 수행하였습니다. 이전 IPF 연구들은 종종 기존의 차별 발현 분석이나 단일 머신러닝 알고리즘에 의존해 후보 바이오마커의 견고성과 일반화성을 제한할 수 있습니다12,13. 이러한 한계를 해결하기 위해 우리는 LASSO, SVM-RFE, XGBoost 등 여러 머신러닝 알고리즘과 차분표현 분석(differential expression analysis)을 결합한 다단계 계산 워크플로우를 사용하여 특징 선택 신뢰성을 향상시켰습니다. 또한 진단 모델은 여러 독립적인 데이터셋에서 평가되었고, 임상 샘플을 통해 주요 발견을 추가로 검증하였습니다. 이후 진단 모델이 개발되고 검증되었으며, 면역 침윤 특성도 분석되었습니다. 또한 확인된 유전자와 관련된 면역 미세환경과 잠재적 분자 상호작용도 탐구하였습니다. 이 연구는 IPF에 초점을 맞추었지만, 여기서 사용된 분석 전략은 다른 만성 폐질환 및 전사체 데이터셋에도 적용 가능할 수 있어 주요 유전자 식별 및 검증을 위한 재현 가능한 틀을 제공합니다. 구체적인 과정은 그림 1을 참조하세요.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
본 연구는 벵부 의과대학 제1부속병원의 기관심사위원회(승인번호: 2023YJS162)의 승인을 받았습니다. 샘플 수집 전에 모든 참가자로부터 서면 동의서를 받았습니다.
자료 수집
본 연구에 사용된 전사체 데이터는 유전자 발현 옴니버스(GEO) 데이터베이스(https://www.ncbi.nlm.nih.gov/; 리드: SCR_005012). 주요 훈련 데이터셋인 GSE150910는 Illumina NovaSeq 6000 플랫폼(GPL24676)을 사용해 생성되었으며, 103개의 IPF와 103개의 정상 폐 조직 샘플로 구성되었습니다. 연구 결과를 검증하기 위해 독립적인 데이터셋 GSE24206, GSE110147, GSE93606, GSE38958 데이터를 사용했습니다. 각 데이터셋에 대한 자세한 정보는 표 1에 제공되어 있습니다. 또한, 이전에 발표된 연구에서 총 636개의 GRG가 선정되었습니다.
당당화 관련 DEG의 차별 발현 분석 및 기능적 특성 분석
GSE150910 데이터셋의 IPF와 정상 폐 조직 샘플 간의 차별 발현 분석은 R 패키지 DESeq2(RRID: SCR_015687)를 사용하여 수행되었습니다. 조정된 P-값(padj) 0.05 < |log2FoldChange|를 가진 유전자는 > 0.5명은 차별발현 유전자(DEGs)로 간주되었습니다. 당실화 관련 DEG(GR-DEGs)는 DEG를 미리 정의된 636개의 GRG 집합과 교차시켜 확인하였습니다. 이 유전자들의 생물학적 역할을 더 연구하기 위해, 유전자 온톨로지(GO) 풍부화 분석과 교토 유전자 및 게놈 백과사전(KEGG) 경로 분석을 수행하여 이들의 기능적 역할과 경로 관여를 밝히는 작업이 수행되었습니다. STRING 데이터베이스(RRID: SCR_005223)15 를 사용하여 상호작용 신뢰 점수 임계값 > 0.7의 단백질-단백질 상호작용(PPI) 네트워크를 생성하여 IPF에서 GR-DEGs의 분자 상호작용과 잠재적 조절 메커니즘을 밝히려 했습니다.
주요 유전자 선별 및 진단 모델 구축
GR-DEG에서 IPF의 핵심 유전자를 선별하기 위해 여러 기계 학습 알고리즘을 사용했습니다. 초기에는 LASSO 회귀(RRID: SCR_003418)에 이진 로지스틱 회귀(가족 = "이항식")가 적용되었고, 최적 페널티 매개변수 λ는 10배 교차 검증(nfold = 10)을 통해 선택되었습니다. 최종 선택 결과는 λ_(min) (0.01700442)에 해당하는 0이 아닌 계수를 가진 특징들이었습니다. SVM-RFE의 경우, R 패키지 캐럿의 RFE 함수가 사용되었습니다. 재귀적 특징 제거는 10배 교차 검증(방법 = "cv", 번호 = 10)을 통해 수행되었으며, 특징을 1에서 126까지 점진적으로 필터링하여 정확도를 사용해 최적의 특징 부분집합을 결정했습니다. XGBoost에서는 목적 함수가 이진 로지스틱 회귀(objective = "이진: 로지스틱")로 설정되었고, 평가 메트릭은 로그 손실(eval_metric = "로그로스")로 설정되었으며, 반복 횟수(nrounds)는 100회로, 학습률(eta)은 0.1로 설정되었습니다. 상위 20개 유전자는 특징 중요도 점수(Gain)를 기준으로 선정되었습니다. 이 방법들의 결과를 교차시켜 정제된 핵심 유전자 집합이 확인되었습니다. 이 유전자 세트를 바탕으로 훈련 데이터셋(GSE150910)을 사용해 XGBoost 진단 모델을 구축하고, 외부 검증 데이터셋(GSE110147, GSE24206, GSE93606, GSE38958)에서 수신자 운행특성(ROC) 분석을 통해 예측 성능을 평가했습니다. 또한, 각 선택된 유전자가 질병 확률에 미치는 기여도를 시각화하기 위해 노모그램이 개발되었고, 모델의 임상적 유용성은 보정 곡선과 결정곡선 분석(DCA)을 통해 추가로 평가되었습니다.
주요 유전자의 생물학적 경로 탐구
머신러닝으로 확인된 주요 유전자의 생물학적 맥락을 탐구하는 것. 유전자 집합 풍부 분석(GSEA)16 은 분자 서명 데이터베이스(MSigDB)(RRID: SCR_016863)17의 유전자 목록을 기반으로 수행되었으며, 경로들은 NES > 1에 대해 선별되었습니다. 상위 풍부 경로는 enrichplot 함수를 사용하여 시각화되었습니다.
주요 유전자 점수를 기반으로 한 IPF 아형의 생물학적 기능과 면역 지형 차이 탐구
확인된 주요 유전자의 발현 프로필을 바탕으로 단일 샘플 유전자 집합 풍부 분석(ssGSEA) 점수를 계산하여 IPF 환자를 중간 점수를 기반으로 고점수 그룹과 저그룹 층화에 사용하였습니다. 두 그룹 간에 차별 발현 분석이 수행되었고, 이어 GSEA(RRID: SCR_003199)18 분석을 통해 DEG에 대한 GO 생물학적 과정(GOBP) 및 KEGG 경로 농축 분석을 수행하였습니다.
면역 세포 침투 및 주요 유전자 발현 차이 분석
ssGSEA 점수를 기반으로 한 하위 그룹 분류를 거쳐, 높은 점수와 낮은 점수 그룹 간의 면역 침윤 차이를 평가하였다. 먼저, CIBERSORT 알고리즘(RRID: SCR_016955)19 와 LM22 특징 행렬을 결합하여 샘플 내 22가지 면역 세포 유형의 상대적 존재도를 계산했습니다. 구체적으로, R 패키지 IOBR의 deconv_tme 함수(매개변수: method = "cibersort", arrays = FALSE, perm = 200)가 계산에 사용되었고, ggpubr 패키지(RRID: SCR_021139)를 사용해 고점수군과 저점수군 간 면역세포 침윤 차이를 평가하기 위해 박스플롯을 생성했습니다. 또한, R 패키지 GSVA의 gsva 함수(ssGSEA 방법 사용)를 사용하여 28종의 면역 세포 유형에 대한 농축 점수를 계산하였습니다. 이 점수들은 최소-최대 스케일링을 사용해 [0, 1] 구간에 정규화되어 세포 유형 간 비교를 용이하게 했습니다. 마지막으로, GSE150910 및 GSE110147 데이터셋에서 정상 샘플과 IPF 환자 간 주요 유전자 발현을 비교하기 위해 Wilcoxon 랭크 합 검정을 수행하여, IPF 하위 그룹 간 면역 세포 침윤 및 유전자 발현 차이를 포괄적으로 분석하였습니다.
RT-qPCR 분석을 이용한 IPF 환자 주요 유전자 검증
확인된 유전자의 진단적 관련성을 검증하기 위해, XGBoost 알고리즘에서 가장 높은 중요도 점수를 가진 6개의 유전자를 역전사 정량 PCR(RT-qPCR)을 사용하여 IPF 환자와 건강한 대조군에서 발현 수준 검증을 위해 선정하였습니다. 벵부 의과대학 제1부속병원에서 총 20건의 혈액 샘플을 채취했으며, 이 중 9건은 IPF 환자, 11건은 건강한 개인에서 채취되었습니다. 혈액 샘플에서 총 RNA를 추출하고, 다기능 마이크로플레이트 리더기를 사용해 RNA 농도를 측정하였습니다. RNA 품질은 하위 분석 전에 평가되었습니다. 역전사 과정에서 유전체 DNA가 제거되었으며, RT-qPCR에 사용된 프라이머 서열은 표 2에 나열되어 있습니다. 프라이머 특이성은 용융 곡선 분석을 통해 검증되었습니다. GAPDH가 내부 참조 유전자로 사용되었습니다. 상대 유전자 발현 수준은 2-ΔΔCt 방법을 사용하여 계산하였습니다. 이 검증 단계는 IPF에서 확인된 유전자의 차별 발현과 잠재적 진단적 관련성에 대한 예비 실험적 지지를 제공합니다.
통계 분석
데이터는 R에서 분석되었으며, Wilcoxon 검정을 사용해 두 그룹 간 차이를 감지하였습니다. GSEA, GO, KEGG 농축 분석은 R 패키지 clusterProfiler(RRID: SCR_016884)를 사용하여 수행되었습니다. p 값 0.05< 별도 명시가 없는 한 유의미한 것으로 간주되었습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
GR-DEG의 함수 분석 및 상호작용 네트워크 분석
IPF에서의 유전자 관여를 조사하기 위해 GSE150910의 차별 발현 분석을 수행하여 4,216개의 DEG를 확인하였습니다(그림 2A). 이 DEGs와 636개의 GRG를 교차시켜 126개의 질병 관련 당화 유전자가 확인되었습니다(그림 2B). 더 나아가, 교차 유전자의 잠재적 생물학적 기능을 평가하기 위해 GO 및 KEGG 농축 분석을 수행하였습니다. 그림 2C에서 보듯, GO 농축 분석은 53 BP(예: 당단백질 대사, 단백질 당실화), 26개의 세포 구성 요소(예: 골지 내강, 소포체 내강), 33개의 분자 기능(예: 당화전이 활성, UDP-글...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
IPF는 원인이 알려지지 않은 만성적이고 진행성 질환으로, 환자의 삶의 질을 크게 저하시키고 조기 사망을 초래합니다. 치료 전략의 발전에도 불구하고, 진단 후 중앙 생존 기간은 여전히 낮으며, IPF의 병인기는 아직 완전히 밝혀지지 않았습니다22. 따라서 IPF의 분자 메커니즘을 규명하는 것은 시급하고 매우 중요합니다. 이전 연구들은 당과 폐질환 간의 연관성을 밝혀냈습니다. 그러나 당화가 IPF 발병 기전에서 차지하는 잠재적 역할은 아직 거의 탐구되지 않았습니다. 따라서 이 연구는 당실화 관련 유전자 서명을 기계학습 접근법과 통합하여 IPF 진단에 처음으로 적용한 연구입니다. 이 혁신적인 접근법은 핵심 유전자를 식별하는 새로운 관점을 제공하며 IPF의 병태생리에 대한 이해를 높이는 데 기여할 수 있습니다.
최근 연구들은 통합 전사체 및...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이해 상충을 선언할 필요가 없습니다.
연구 과정 전반에 걸쳐 도움과 지원을 제공해 주신 모든 동료 여러분께 감사드립니다. 그들의 협력과 격려는 우리 작업에 매우 소중했습니다. 이 연구는 외부 자금 지원을 받지 못했습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Caret | R Foundation for Statistical Computing | 버전 6.0.94 | SVM-RFE |
| ClusterProfiler | R Foundation for Statistical Computing | 버전 4.12.6 | GSEA, GO 및 KEGG 풍부화 분석 |
| DESeq2 | R Foundation for Statistical Computing | 버전 1.44.0 | 차등 발현 분석 |
| Fast First-Strand cDNA Synthesis Mix | Goonie Biotech Co., Ltd. | 500-101 | RT-qPCR용 cDNA 합성 |
| FastTaq qPCR SYBR Green Master Mix | Gooniebio | 500-102 | 정량적 PCR 증폭 |
| Fluorescent Quantitative PCR System | Bio-Rad Laboratories, Inc. | CFX96 | 정량적 PCR 증폭 |
| GEO 데이터베이스 | NCBI | https://www.ncbi.nlm.nih.gov/geo/ | 전사체 데이터 소스 |
| ggpubr | R Foundation for Statistical Computing | 버전 0.6.0 | 박스 플롯 생성 |
| GSVA | R Foundation for Statistical Computing | 버전 1.52.3 | ssGSEA |
| MSigDB | Broad Institute | https://www.gsea-msigdb.org/ | GSEA 분석 |
| PCR 시스템 | Bio-Rad Laboratories, Inc. | PTC Tempo | RT-qPCR용 cDNA 합성 |
| 프라이머 | Tsingke Biotechnology Co., Ltd. | N/A | qPCR 프라이머의 맞춤형 합성 |
| R 소프트웨어 | R Foundation for Statistical Computing | 버전 4.4.1 | 통계 분석 및 시각화 |
| RNA Isolater Total RNA Extraction Reagent | Vazyme Biotech Co., Ltd. | R401-01 | 전체 혈액으로부터의 전체 RNA 추출 |
| STRING 데이터베이스 | STRING 컨소시엄 | https://string-db.org/ | PPI 네트워크 구성 |
| Synergy HTX 멀티 모드 리더 | BioTek Instruments, Inc. | Synergy HTX | RNA 농도 측정 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.