연구 논문

공공 전사체 재분석, 단일 세포 맥락에서 주요 우울장애와 피부근염 간 면역 신호 공유 발견

DOI:

10.3791/71024

2026년 6월 26일

* These authors contributed equally

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구는 공개 GEO 데이터셋의 통합 생물정보학적 재분석을 단일 세포 맥락화와 결합하여 주요 우울장애와 피부근염 사이의 후보 공유 유전자를 식별하고, 피부근염 관련 단세포 데이터셋 내 면역세포 하위 집합 내 분포를 특성화하는 것을 목표로 했습니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구는 단일 세포 맥락화를 포함한 공개 GEO 데이터셋의 통합 생물정보학 재분석을 통해 주요 우울장애와 피부근염 간의 후보 공유 전사체 신호를 규명하는 것을 목표로 했습니다. 분석 워크플로우에는 주요 모듈 식별을 위한 가중 유전자 공동 발현 네트워크 분석(WGCNA), 기능 특성 분석을 위한 유전자 온톨로지(GO) 및 교토 유전자 및 게놈 백과사전(KEGG) 풍부화 분석, 후보 유전자 우선순위 지정을 위한 GeneMANIA 및 네트워크 시각화 플랫폼 기반 네트워크 분석, 그리고 진단 특징 선택을 위한 SHAPLEY 가적 설명(SHAP)과 결합된 113개 머신러닝 모델 평가가 포함되었습니다. 이후 유전자 집합 풍부 분석(GSEA), 면역 침윤 분석, 단세포 RNA-seq-기반 맥락화 등이 수행되어 확인된 신호의 면역 관련 세포 맥락을 더욱 특성화하였습니다. 피부근염 관련 GEO 데이터셋 통합을 통해 570개의 차별 발현 유전자가 확인되었으며, 이 중 33개의 후보 공유 유전자가 WGCNA를 통해 얻어졌습니다. 기능 풍부화 및 네트워크 분석 결과, 면역 방어, 세포독성, PPAR, IL-17, 항원 처리 경로를 포함한 경로가 강조되었으며, ELANE, PPBP, CTSG가 고도로 연결된 결절로 부각되었습니다. 머신러닝 기반 특징 우선순위 지정은 모델 선택 후보 유전자인 KIF4A, OLR1, KIR2DL4, KRT23, KIR3DS1, AZU1, SCG5, LRRC37E 포함되었습니다. 면역 침윤 분석 결과, 이 공유 유전자들은 조절 T 세포(Treg), 휴식 비만세포, 휴식 수지상 세포, 그리고 고전적으로 활성화된 대식세포(M1) 및 대체 활성화된 대식세포(M2) 모두와 연관되었습니다. 단일 세포 RNA-seq-맥락화 결과, 서로 다른 후보 유전자 점수 상태를 가진 CD8⁺ T세포 소집합이 뚜렷한 세포 간 소통 패턴을 보인다는 점도 시사되었습니다. 이 중 MIF–(CD74+CD44) 축과 순진/중앙 기억 T 세포에서 신호가 추가적인 검증이 필요한 주요 특징이었습니다. 전반적으로 본 연구는 주요 우울장애와 피부근염 간의 후보 공유 전사체 신호를 확인하고, 진정한 동반 질환 코호트에서 추가 검증이 필요한 면역 관련 세포 맥락을 강조하였습니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

피부와 골격근에 염증이 침범하는 만성 전신 자가면역 질환으로, 임상적으로는 대칭적인 근위 근력 약화와 독특한 피부 병변으로 나타나며, 심한 경우 다기관 기능 장애가 나타납니다. 임상 증거가 축적되어 피부근염 환자들이 정신과 동반 질환, 특히 주요 우울장애 2,3,4를 경험하는 경우가 많다는 점을 강조합니다. 피부근염 관련 주요 우울장애의 발병 기전은 다요인적이며, 심리사회적 고통, 신경내분비 조절 장애, 전신 면역염증 간의 복잡한 상호작용에서 비롯됩니다. 지속적인 통증, 피로, 점진적인 근력 약화는 신체 기능과 삶의 질을 크게 저해할 수 있습니다. 이러한 부담은 사회적 역할 혼란, 만성적인 심리적 스트레스, 자율성 저하로 이어질 수 있습니다. 또한, 장기간 글루코코르티코이드 노출은 시상하부-뇌하수체-부신(HPA) 축을 교란시키고 해마의 가소성을 저하시켜 우울증 관련 증상에 대한 취약성을 높일 수 있습니다6. 더불어, 피부근염에서 지속적인 면역 활성화와 전신 염증이 우울증 관련 증상의 잠재적 원인으로 점점 더 인식되고 있습니다7. 이 말초 매개체들은 신경전달물질 대사와 신경가소성을 조절함으로써 중추신경계에 영향을 미쳐, 전신 자가면역과 신경정신과적 증상을 연결시킬 수 있습니다 7,8,9,10.

중요한 점은, 이 논리가 어느 질병도 생물학적으로 균질하다는 의미는 아니라는 것이다. 피부근염은 임상적·혈청학적으로 구별되는 하위 집합으로 구성되며, 여기에는 염증 및 임상 프로필이 다른 항MDA5 및 항TIF1-γ 관련 표현형을 포함합니다11, 12, 13. 주요 우울장애 역시 점점 더 이질적인 상태로 인식되고 있으며, 현재의 증거는 단일 보편적 염증 징후가 아닌 면역 염증 아형의 존재를 지지합니다14,15. 따라서 본 연구는 모든 분자를 위한 획일적인 공유 프로그램을 가정하는 것이 아니라, 독립적인 공개 데이터셋 전공 코호트 수준에서 감지 가능한 후보 중복 면역 관련 전사체 신호를 선별하는 데 목적이 있습니다.

심리사회적 스트레스와 치료 노출을 넘어, 주요 우울장애와 피부근염 사이의 생물학적으로 더 검증 가능한 연관성은 공유된 면역-염증성 조절 장애입니다. 주요 우울장애는 이질적인 상태이므로 단일 보편적 전사체 프로필을 가진다고 가정해서는 안 됩니다. 그러나 수렴하는 증거는 주요 우울장애의 염증 관련 아형을 지지하며, 말초 전사체 연구들은 환자 일부에서 선천 면역, 호중구 관련, 인터페론, 보체 경로의 조절 장애를 확인했습니다 14,16,17. 동시에, MAPK 관련 스트레스 신호 전달도 우울 표현형과 관련이 있다고 밝혀졌습니다18. 반면 피부근염은 잘 알려진 인터페론 유발 자가면역 질환이며, 혈액과 영향을 받은 조직에서의 전사체 연구는 일관되게 제1형 인터페론과 광범위한 면역-염증 프로그램의 활성화를 입증해 왔습니다; 최근 다중 옴 분석은 피부근염 19,20,21에서 ERK 및 p38 MAPK 관련 경로 활성을 더욱 강조했습니다. 이 결과들은 독립적인 공개 데이터셋에서 주요 우울장애와 피부근염 사이에 면역 관련 전사체 신호 하위 집합이 겹칠 수 있는지 생물학적으로 그럴듯한 근거를 제공합니다.

이러한 관찰에도 불구하고, 주요 우울장애와 피부근염 사이의 중첩 원인의 분자적 기초는 여전히 충분히 이해되지 않았습니다. 중요한 점은, 현재 공개된 데이터셋은 주요 우울장애와 피부근염을 동시에 진단받은 환자들의 진정한 집단을 제공하지 못한다는 것입니다. 따라서 본 연구는 피부근염 환자의 우울증을 직접 분석하는 대신, 통합 생물정보학 재분석 프레임워크를 통해 주요 우울장애와 피부근염의 별도 공개 데이터셋 간에 후보 공유 전사체 신호를 식별하도록 설계되었습니다22. 구체적으로, 공개된 전사체 데이터셋을 차별발현 분석, 가중 유전자 공발현 네트워크 분석(WGCNA), 기능 풍부 분석, 네트워크 기반 분석, 머신러닝 기반 특징 우선순위 지정을 통해 교차 질병 후보 유전자와 경로를 식별하였습니다. 또한, 피부근염 관련 단세포 데이터셋을 분석하여 면역세포 수준에서 후보 유전자를 맥락화하였습니다. 그림 1에서 볼 수 있듯이, 전체 분석 워크플로우는 단계별 플로우차트로 요약되어 있습니다. 이 연구는 명확한 동반 질환 기전을 확립하기보다는, 주요 우울장애와 피부근염 사이의 후보적 공유 분자 신호를 식별하기 위한 가설 중심 틀을 만드는 것을 목표로 했습니다.

이에 따라 본 연구는 단계별 우선순위 체계를 채택했습니다. 질병 관련 공동 발현 모듈은 처음으로 주요 우울장애 및 피부근염 데이터셋에서 별도로 확인되었으며, 이들의 중첩을 활용해 후보 간 질병 간 공유 신호를 정의하였습니다. 이 후보자들은 이후 기능 강화와 GeneMANIA 기반 네트워크 분석을 통해 기능적 맥락화되었고, 머신러닝 방법을 이용한 피부근염 중심 분류 프레임워크 내에서 우선순위를 정했으며, 마지막으로 피부근염 관련 단세포 데이터셋에서 세포 맥락화를 제공했습니다.

figure-introduction-1
그림 1: 데이터 수집 및 분석 과정의 흐름도. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하세요.

병 간 분자 중복을 조사하기 위해 여러 대체 접근법이 사용되어 왔습니다. 차별발현 유전자(DEG) 목록의 단순 교차는 계산적으로 간단하지만 공동 발현 분석이 제공하는 모듈 수준의 맥락 정보가 부족하고 임의의 접힘 변화 및 P-값 임계값에 민감합니다. 전통적인 메타분석은 동일한 질병에 대한 연구 간 효과 크기를 통합하지만, 두 가지 뚜렷한 상태에서 공유된 신호를 식별하도록 설계되지는 않습니다. 현재 워크플로우는 공동발현 모듈 중첩, 기능 풍부화, 네트워크 분석, 머신러닝 기반 기능 우선순위 지정, 면역 디컨볼루션, 단일 셀 맥락화와 같은 여러 상호 보완적 분석 계층을 통합하여 순차적 우선순위 체계 내에서 각각 뚜렷한 목적을 수행합니다. 이 다층 설계는 후보 유전자 수를 단계별로 줄이고, 여러 수준에서 교차 검증된 생물학적 맥락화를 제공합니다. 이 프로토콜은 공개된 대량 전사체 데이터셋 및 선택적으로 단일 세포 데이터셋이 존재하는 모든 질병 쌍에 적용되며, 특히 진정한 동반 질환 코호트가 없는 경우에 그렇습니다. 하지만 작업 흐름은 관찰 중심이며 공식적인 인과추론 프레임워크를 포함하지 않습니다; 모든 발견은 가설 생성으로 해석되어야 하며, 독립적인 실험적 검증이 필요합니다.

전반적으로 분석 워크플로우는 직접적인 인과-추론 프레임워크가 아닌 순차적 우선순위 지정 전략으로 설계되었습니다. 각 단계는 고유한 목적을 가졌습니다: 후보자 공유 신호 식별을 위한 WGCNA 기반 모듈 중복, 생물학적 맥락화를 위한 농축/네트워크 분석, 피부근염 관련 분류에서 특징 우선순위 지정을 위한 머신러닝, 세포 유형 수준의 맥락화를 위한 단세포 분석.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 유전자 발현 옴니버스(GEO) 데이터베이스에서 공개된 식별 해제 데이터셋만을 사용했습니다. 이 작업은 기존 공개 데이터의 2차 분석이었고 직접 참여자 접촉, 개입, 식별 가능한 개인 정보 접근이 포함되지 않았기 때문에 추가적인 윤리 위원회 승인과 사전 동의가 필요하지 않았습니다.

데이터 소스 및 전처리

모든 유전자 발현 및 단일 세포 데이터셋은 GEO 데이터베이스에서 얻었습니다24. 주요 우울장애의 경우, 128명의 환자와 64명의 건강한 대조군의 말초혈액 샘플을 포함하는 데이터셋 GSE98793가 사용되었습니다. 피부근염의 경우, 호모 사피엔스 발현 프로파일링, 명확히 식별 가능한 질병 및 대조군, 프로브-유전자 매핑을 위한 플랫폼 주석, 발견 또는 검증 분석 적합성 등 사전 정의된 기준에 따라 데이터셋이 선정되었습니다. GEO 시리즈에 여러 염증성 근병증 아형이 포함된 경우, 본 연구에서는 피부근염과 정상 대조군 샘플만 추출하였다. GSE1551, GSE46239, GSE128470가 발견/훈련 데이터셋으로 사용되었고, GSE5370, GSE39454, GSE11971가 독립적인 검증 데이터셋으로 사용되었습니다. 이 연구에서 분석된 피부근염 데이터셋은 주로 말초혈보다는 영향을 받은 근육이나 피부 조직에서 도출되었습니다. 피부근염의 단세포 데이터는 데이터셋 GSE190510에서 수집되었습니다.

GEO 데이터베이스에서 원시 표현 행렬과 해당 플랫폼 주석 파일이 다운로드되었습니다. 프로브 ID는 제조사에서 제공한 GPL 주석에 따라 공식 유전자 기호에 매핑되었습니다. 단일 공식 유전자 기호에 명확하게 매핑할 수 없는 프로브는 제거되었다. 여러 탐침이 동일한 유전자에 매핑될 때, limma 패키지의 'avereps' 함수가 구현한 평균 발현값을 사용하여 유전자 수준에서 압축하여 유전자별 샘플별 발현 행렬을 생성했습니다.

강도 의존 편향을 줄이고 분산을 안정화하기 위해, 표현 값 분포에 따라 적절한 경우 log2 변환이 적용되었습니다. 그 후 limma 패키지의 'normalizeBetweenArrays' 함수를 사용하여 배열 사이 정규화가 수행되었습니다. 누락된 값이 있을 경우 K-최근접 이웃 보충을 사용해 보충했습니다. 통합 피부근염 훈련 데이터셋의 경우, sva 패키지의 'ComBat' 기능을 사용하여 배치 교정이 수행되었으며, 데이터셋/플랫폼 출처를 배치 변수로 간주하고 샘플 그룹(피부근염 대 건강한 대조군)을 설계 행렬에 포함시켜 배치 조정 중 관심 있는 생물학적 변이를 보존했습니다.

모든 분석은 데스크톱 운영체제에서 R을 위한 통합 개발 환경을 사용하여 R으로 수행되었습니다. 림마 패키지는 프로브 요약 및 정규화에 사용되었습니다. SVA 패키지는 ComBat 배치 교정에 사용되었습니다. 누락된 값은 k = 10인 K-최근접 이웃 보정을 사용해 보정되었습니다.

가중 유전자 공동 발현 네트워크 분석

가중 유전자 공동 발현 네트워크 분석(WGCNA)은 WGCNA R 패키지25,26을 사용하여 주요 우울장애 및 피부근염 데이터셋에 대해 별도로 수행되었습니다. 샘플은 flashClust를 사용해 계층적으로 군집화하여 이상치를 식별했습니다; 수목도 높이가 100을 초과하고 분산 하위 25%에 속하는 유전자는 제외하였습니다. 각 네트워크에 대해 pickSoftThreshold를 사용하여 소프트 임계값 파워(β)를 선택하여 근사적인 스케일 프리 토폴로지(R2 > 0.8)를 달성했습니다. 인접 행렬은 위상 중첩 행렬(TOM)으로 변환되었고, 모듈은 최소 모듈 크기가 60이고 병합 절단 높이가 0.2527인 동적 트리 커팅을 통해 식별되었습니다. WGCNA R 패키지는 계층적 클러스터링을 위해 flashClust와 함께 사용되었습니다. 무작위 시드는 재현성을 위해 12345로 설정되었습니다. 모듈 고유유전자는 Pearson 상관관계를 사용하여 질병 상태와 상관관계 관계가 부여되었으며, P-값을 벤자미니-호흐버그 방법으로 조정했습니다. 각 질병에 대해 질병 상태와 가장 강하고 중요한 연관성을 보이는 모듈이 핵심 질병 관련 모듈로 유지되었습니다. 주요 우울장애 데이터셋과 피부근염 데이터셋의 핵심 모듈 유전자 간 중복이 하위 분석을 위한 후보 공유 유전자 집합으로 정의되었습니다. 통합 피부근염 코호트의 차별 발현 분석은 별도로 수행되어 피부근염 관련 전사 변화를 특성화하였습니다.

기능 풍부 분석

유전자 온톨로지(GO) 풍부화 분석은 R을 사용하여 수행되었으며, 유전자 심볼은 org를 사용하여 Entrez ID로 변환되었습니다. Hs.eg.db 그리고 clusterProfiler에서 enrichGO를 사용해 유의미하게 풍부해진 GO 항(p < 0.05)이 확인되었습니다. 결과를 다차원적으로 시각화하기 위해 enrichplot 패키지를 사용해 막대 플롯과 버블 플롯을 생성했고, Circlize 패키지를 사용해 GO 범주, 유전자 개수, 풍부도 인자를 표시하는 원형 플롯을 구성했습니다. ComplexHeatmap 패키지와 함께 전설이 추가되었습니다. 교토 유전자 및 유전체 백과사전(KEGG)의 차별 발현 유전자에 대한 경로 풍부화 분석도 R에서 수행되었으며, 유전자 심볼은 조직을 기반으로 Entrez ID로 변환되었습니다. 데이터베이스Hs.eg.db 그리고 유의미하게 풍부해진 경로(FDR < 0.05)는 clusterProfiler 패키지 28,29,30,31의 enrichKEGG 함수를 사용해 확인되었습니다. 농축 결과는 막대 및 버블 플롯을 사용하여 시각화하였습니다.

GeneMANIA 기반 기능 연합 네트워크 분석

이전에 확인된 공유 유전자를 바탕으로, GeneMANIA 기반 기능적 연관 네트워크가 구축되어 이 유전자들과 관련 파트너 간의 상호작용 맥락을 탐구하였습니다. 유전자 목록은 호모 사피엔스를 기준종으로 GeneMANIA에 제출했습니다. GeneMANIA는 공발현, 물리적 상호작용, 경로, 공동위치, 유전적 상호작용, 공유 단백질 도메인 등 여러 근거 유형을 통합합니다. 생성된 네트워크는 시각화 및 분석을 위해 네트워크 시각화 플랫폼으로 내보내고 가져왔습니다. 네트워크 시각화 플랫폼에서 위상적 분석을 수행하여 고도로 연결된 후보 노드32, 33, 34를 식별하기 위한 시각화 및 분석을 수행했습니다.

머신러닝 기반 진단 모델 구축

진단 분류에는 랜덤 포레스트(RF), 서포트 벡터 머신(SVM), 선형 판별 분석(LDA), 나이브 베이즈, 그라디언트 부스트 머신(GBM), XGBoost, glmBoost, 탄성 넷(Enet), 능선, 최소 절대 축소 및 선택 연산자(LASSO), 단계별 일반화 선형 모델(Stepglm), 편소 최소제곱 회귀 일반화 선형 모델(plsRglm) 등 여러 머신러닝 알고리즘이 사용되었습니다.. 2단계 모델링 프레임워크를 적용하여 113개의 후보 모델 조합을 생성하였습니다. 1단계에서는 초기 알고리즘이 훈련 코호트에서 가변 선별에 사용되었고; 두 번째 단계에서는 보존된 변수들을 진단 분류 모델에 적합시키는 데 사용되었습니다. ≤ 5개의 선택된 변수를 가진 모델은 추가 비교에서 제외되었습니다. 결합된 피부근염 데이터셋이 훈련 코호트로 사용되었으며, 라벨은 피부근염과 건강한 대조군으로 구분되었고, 독립적인 검증 코호트는 외부 성과 평가에 사용되었습니다. 내부 재샘플링과 튜닝은 알고리즘별로 이루어졌으며, glmnet 기반 모델(LASSO, Ridge, Elastic Net)은 lambda.min을 선택하기 위해 10배 교차 검증을 사용했습니다; GBM은 최적의 트리 수를 결정하기 위해 10배 내부 교차 검증을 사용했습니다; XGBoost는 최소 테스트 로그 손실에 따라 최종 부스터팅 라운드를 5배 재샘플링으로 선택했으며; glmBoost는 cvrisk 기반 내부 교차 검증을 사용하여 종료 반복을 결정했습니다; LDA는 캐릿 교차 검증 프레임워크 하에 적용되었습니다. 현재 구현에 명시적인 튜닝 단계가 없는 알고리즘의 경우, 고정 또는 패키지 기본 설정이 사용되었습니다. 정보 유출을 줄이기 위해 특징 선택, 모델 적합, 내부 조정은 훈련 코호트만을 사용하여 수행되었으며, 검증 코호트는 독립적인 예측 및 AUC 기반 성과 평가에만 사용되었습니다. caret 패키지는 glmnet, randomForest, e1071, gbm, xgboost, mboost, plsRglm , MASS 등 개별 알고리즘을 위한 머신러닝 워크플로우 관리에 사용되었습니다. SHAP 분석은 shapviz 패키지를 사용하여 수행되었습니다. 무작위 시드는 각 모델 피팅 전에 12345로 설정되었습니다. 선택된 특징이 5개 미만인 모델은 제외되었습니다. SHapley Additive exPlanations(SHAP)를 사용하여 모델 해석 가능성과 유전자 수준 기여도를 추가로 평가했으며, 가장 유익한 유전자가 하위 생물학적 해석을 위한 모델 선택 특징 후보로 우선순위를 정했습니다.

진단 성과 평가

후보 바이오마커의 진단 성능을 평가하기 위해 "pROC" R 패키지를 사용하여 수신자 작동 특성(ROC) 곡선을 생성하였습니다. 후보 마커의 발현 수준과 예측 정확도는 독립적인 데이터셋(GSE5370, GSE11971, GSE39454)에서 검증되었습니다. 모델 성능은 혼동 행렬을 사용하여 추가로 평가하였습니다. 주요 모듈 유전자의 차등 발현은 화산 및 박스 플롯을 사용해 시각화되었고, 개별 유전자의 진단 가치를 평가하기 위해 ROC 곡선을 구축하였습니다.

유전자 집합 풍부화 분석

후보 공유 전사체 신호와 관련된 조정된 기능 변화를 탐구하기 위해 clusterProfiler36,37을 사용하여 유전자 집합 풍부 분석(GSEA)을 수행하였습니다. 피부근염과 대조군 샘플의 유전자 발현 데이터는 차등 발현에 따라 순위가 매겨졌습니다. KEGG 경로(c2.cp.kegg.Hs.symbols.gmt)에 해당하는 미리 정의된 유전자 집합을 사용하여 각 경로 내 유전자가 상향 또는 하향 조절의 조정된 경향을 보이는지 평가하였습니다. 통계적 유의성은 P < 0.05로 정의되었습니다.

면역 세포 침투 분석

정규화되고 log2 변환되었으며 배치 교정된 피부근염 매트릭스가 면역 디컨볼루션에 사용되었습니다. CIBERSORT 알고리즘을 적용하여 LM22 참조 행렬38을 사용하여 면역 세포 아형의 상대적 풍부도를 추정하였습니다. 디컨볼루션 P 가 0.05< 샘플은 하위 분석을 위해 보관되었습니다. 그룹 간 추정된 면역세포 비율 차이는 박스플롯을 사용하여 시각화되었고, 면역세포 하위 집합과 후보 공유 유전자 간의 연관성을 평가하기 위해 스피어먼 상관분석을 수행하였다.

세포 맥락화를 위한 단일 세포 RNA 시퀀싱 분석

단세포 RNA-seq 분석은 R에서 Seurat를 사용해 수행되었습니다. 배치 보정에는 Harmony, 더블릿 검출에는 DoubletFinder, 주변 RNA 추정에는 celda/decontX, 의사시간 궤적 분석에는 Monocle, 세포 간 통신 분석에는 CellChat, 유전자 집합 활성 점수는 AUCell, ssGSEA 점수는 GSVA가 사용되었습니다. 원시 카운트 행렬은 min.cells = 5, min.features = 300의 매개변수를 가진 Seurat 객체에 가져왔습니다. 각 세포별로 미토콘드리아, 리보솜, 헤모글로빈 유전자 비율을 포함한 품질 관리 지표가 계산되었습니다. 세포는 다음 기준을 모두 충족할 때만 보유했습니다: nFeature_RNA > 500, nCount_RNA < 5,000, percent_mito < 25, percent_ribo > 3, percent_hb < 1. 3개 미만의 세포에서 검출된 유전자는 제외하였다. 또한, 후속 분석 전에 MALAT1과 미토콘드리아 유전자를 제거하였습니다. 초기 필터링 후, DoubletFinder를 사용해 각 샘플에서 이중항을 식별했으며, PCS = 1:30, pN = 0.25; 예상 이중복 비율은 샘플별 세포 수에 따라 설정되었습니다(<4,000 세포: 2.5%; 4,000–8,000 세포: 5%; >8,000 세포: 6.5%). 싱글렛만 남겨졌다. 주변 RNA 오염은 decontX를 사용해 추가로 추정했으며, 오염 점수 0.2< 세포는 유지되었습니다.

필터링된 데이터는 LogNormalize 방법으로 10,000의 척도 인수를 기준으로 정규화되었고, 이어서 가변 유전자 확인, 데이터 척도화, 주성분 분석이 이루어졌습니다. 샘플 간 배치 효과는 orig.ident를 배치 변수로 사용하여 Harmony를 보정했습니다. 처음 15개의 하모니 차원은 UMAP 시각화와 이웃 그래프 구성에 사용되었습니다. 클러스터링은 FindNeighbors와 FindClusters를 사용하여 수행되었으며, 최종 클러스터링 결과는 해상도 0.05로 정의되었습니다. 세포 유형은 정통 마커 유전자와 FindAllMarkers 결과39에 따라 수동으로 주석을 달았습니다.

하위 기능적 맥락화를 위해 후보 유전자 활성은 단일 세포 수준에서 평가되었고, 관련 면역 세포 하위 집합은 궤적 및 세포 간 소통 분석을 받았다. 의사시간 분석은 단안경을 사용해 DDRTree 기반 차원 감소를 사용한 후 세포 순서 분석을 수행하였습니다. 세포 간 통신 분석은 CellChat을 사용해 인간 리간드-수용체 데이터베이스를 사용했으며, 분비 신호 범주로 제한되었으며, 10개 미만의 세포가 포함된 통신은 걸러냈습니다.

각 세포에 대해 후보 유전자 활성은 AUCell, ssGSEA, AddModuleScore 세 가지 상호 보완적 접근법을 사용하여 정량화되었습니다. AUCell 점수는 유전자 순위 행렬을 기반으로 계산되었고, ssGSEA 점수는 GSVA 프레임워크를 사용해 생성되었습니다. AddModuleScore는 Seurat 내장 함수를 사용해 계산되었습니다. 결과적으로 생성된 AUCell, ssGSEA, AddModuleScore 값은 단일 점수 행렬로 결합되었습니다. 각 점수 유형은 먼저 Z-점수 변환으로 표준화되었고, 이후 최소-최대 정규화를 통해 0–1 범위로 재척도되었습니다. 각 셀의 최종 종합 점수("점수")는 세 개의 정규화된 점수의 합으로 정의되었습니다:

점수 = 정규화된 AUCell + 정규화된 ssGSEA + 정규화된 AddModuleScore.

하위 그룹 분석을 위해 CD8⁺ T세포 하위 집합을 추출하고, 이 하위 집합 내 중앙값 점수 값에 따라 세포를 이분화하였습니다. 점수 점수가 중앙값보다 높은 셀은 High_Hub_genes 그룹에, 나머지 셀은 Low_Hub_genes 그룹에 할당되었습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

주요 우울장애와 피부근염 사이의 후보 공유 유전자 식별

피부근염 관련 GEO 데이터셋의 데이터 병합, 정규화 및 배치 보정(그림 2A,B) 이후, 총 570개의 차별 발현 유전자가 확인되었으며(그림 2C,D), 이 중 517개는 상향 조절 유전자, 53개 하향 조절 유전자로 구성되어 있습니다. 이 피부근염 차별 발현 분석은 질병 관련 전사 변화를 특성화하는 데 사용되었습니다.

동시에 WGCNA는 주요 우울장애 및 피부근염 데이터셋에 별도로 적용되어 질병 관련 공동 발현 모듈을 식별하였습니다. 주요 우울장애 데이터셋에서는 최적의 소프트 임계값 값이 4, 피부근염 데이터셋에서는 ...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

피부근염은 피부와 근육이 두드러진 만성 전신 자가면역 질환이며, 임상 관찰에 따르면 피부근염 환자들은 주요 우울장애와 일치하는 증상을 포함한 상당한 정신적 부담을 경험할 수 있습니다. 이 맥락에서 본 연구는 통합 생물정보학 재분석 프레임워크를 적용하여 주요 우울장애와 피부근염 간의 후보 공유 전사체 신호를 식별하고, 추가적인 면역침윤 분석과 단세포 맥락화를 수행하였습니다. WGCNA, 기능 풍부 분석, GeneMANIA 기반 네트워크 분석, 머신러닝 기반 특징 우선순위 지정을 통합하여 후보 교차 질환 유전자와 경로를 선별하였습니다. 이 틀 내에서 KIF4A, OLR1, KIR2DL4, KRT23, KIR3DS1, AZU1, SCG5, LRRC37E 등 8개의 모델이 선정된 유전자가 후속 해석을 위해 강조되었습니다. 면역침윤 분석을 통해 이 유전자들이 관찰된 면역 관련 맥락을 조사했으며, 피부근염 관련 데이터셋에서의 단세포 분석은 특히 CD8⁺ T 세포에서 KIR2DL4...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 이 연구에서 이해 상충이 없다고 보고했습니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 베이징시보건위원회의 우수 임상 연구 프로그램(보조금 번호: BRWEP2024072120118), 베이징 시립병원관리센터 "육성 프로그램"(보조금 번호: PZ2025030), 중일 우호병원 청년 프로젝트(번호 2020-1-QN-8)의 재정 지원에 깊이 감사드립니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

```html

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
AddModuleScoreSeurat function버전 4.4.0Seurat 내에서 모듈 점수 계산
RRID: NA
AUCellBioconductor버전 1.32.0단일 세포 유전자 세트 활동 점수 지정
RRID: SCR_021327
caretCRAN버전 7.0.1기계 학습 워크플로 지원
RRID: SCR_022524
celda / decontXBioconductor버전 1.24.0주변 RNA 오염 추정
RRID: NA
CellChatGitHub / CellChat버전 2.2.0세포-세포 통신 분석
RRID: SCR_021946
CIBERSORT / LM22 서명 매트릭스CIBERSORTLM22면역 세포 침투 추정
RRID: NA
clusterProfilerBioconductor버전 4.12.6기능 강화 분석
RRID: SCR_016884
CytoscapeCytoscape Consortium버전 3.10시각화 및 분석을 위한 네트워크 시각화 플랫폼
RRID: SCR_003032
DoubletFinderGitHub / McGinnis Lab버전 2.0.4단일 세포 데이터 세트에서 더블릿 탐지
RRID: NA
e1071CRAN버전 1.7.16서포트 벡터 머신 및 나이브 베이즈 모델링
RRID: NA
gbmCRAN버전 2.2.2그래디언트 부스팅 머신 모델링
RRID: NA
Gene Expression Omnibus (GEO) 데이터베이스국립 생물공학 정보 센터 (NCBI)GSE98793주요 우울 장애 벌크 전사체 데이터 세트
RRID: NA
Gene Expression Omnibus (GEO) 데이터베이스NCBIGSE1551근피부염 훈련 데이터 세트; 골격근 생검 샘플
RRID: NA
Gene Expression Omnibus (GEO) 데이터베이스NCBIGSE46239근피부염 훈련 데이터 세트; 피부 생검 샘플
RRID: NA
Gene Expression Omnibus (GEO) 데이터베이스NCBIGSE128470근피부염 훈련 데이터 세트; 염증성 근병증 코호트에서 추출한 근피부염 샘플
RRID: NA
Gene Expression Omnibus (GEO) 데이터베이스NCBIGSE5370독립적인 근피부염 검증 데이터 세트; 치료되지 않은 성인 근육 샘플
RRID: NA
Gene Expression Omnibus (GEO) 데이터베이스NCBIGSE11971독립적인 근피부염 검증 데이터 세트
RRID: NA
Gene Expression Omnibus (GEO) 데이터베이스NCBIGSE39454독립적인 근피부염 검증 데이터 세트; 염증성 근병증 코호트에서 추출한 근피부염 샘플
RRID: NA
Gene Expression Omnibus (GEO) 데이터베이스NCBIGSE190510근피부염 관련 단일 세포 RNA-seq 데이터 세트
RRID: NA
GeneMANIA토론토 대학교 / GeneMANIA이 연구에서 액세스한 웹 서버 버전기능 연관 네트워크 구성
RRID: RRID:SCR_005709
glmnetCRAN버전 4.1.8LASSO, Ridge 및 Elastic Net 모델링
RRID: NA
GSVABioconductor버전 2.0.7ssGSEA 점수 지정
RRID: NA
HarmonyCRAN버전 1.2.4단일 세포 데이터 통합을 위한 배치 보정
RRID: NA
limmaBioconductor버전 3.60.6차등 발현 분석, 프로브 요약 및 정규화 유틸리티
RRID: SCR_010943
MASSCRAN버전 7.3.61선형 판별 분석
RRID: NA
mboostCRAN버전 2.9.11glmBoost 모델링
RRID: NA
MonocleBioconductor버전 2.38.0가상 시간 궤적 분석
<

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

MedicinedepressionDermatomyositisMachine LearningSingle Cell AnalysisBioinformatics analysis

관련 논문