여기서는 공개 대량 전사체학, 머신러닝, 면역 침윤 분석, 단세포 전사체학을 통합하여 재현 가능한 바이오마커 우선순위 지정과 세포 유형 위치 지정을 위해 심방세동에서 소포체 스트레스 관련 면역 신호를 식별하는 프로토콜을 제시합니다.
이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.
연구 논문
* These authors contributed equally
여기서는 공개 대량 전사체학, 머신러닝, 면역 침윤 분석, 단세포 전사체학을 통합하여 재현 가능한 바이오마커 우선순위 지정과 세포 유형 위치 지정을 위해 심방세동에서 소포체 스트레스 관련 면역 신호를 식별하는 프로토콜을 제시합니다.
본 연구는 대량 전사체학, 머신러닝, 면역 침윤 분석, 단세포 전사체학을 통합하여 심방세동(AF)에서 소포체 스트레스(ERS) 관련 유전자 서명을 식별하는 재현 가능한 계산 워크플로우를 설명합니다. 공개된 대량 전사체 데이터셋은 유전자 발현 옴니버스(GEO)에서 수집한 후, 표현형 조화, 정규화, 배치 효과 보정, 차별 발현 분석이 진행되었습니다. 가중 유전자 공동 발현 네트워크 분석(WGCNA)을 ERS 관련 유전자 세트와 결합하여 후보 ERS 관련 유전자를 식별하였습니다. 이후 다중 알고리즘 머신러닝 프레임워크를 사용하여 특징 선택과 모델 적합 전략을 비교했습니다. 선정된 모델은 독립적인 외부 검증 코호트(GSE115574)에서 평가되었고, 추가 코호트(GSE14975)에서 추가 평가되었으며, 식별 성능은 수신자 운전 특성(ROC) 분석과 곡선 아래 면적(AUC)으로 정량화되었습니다. 이 워크플로우를 통해 22개의 ERS 관련 핵심 유전자가 확인되었고, 18유전자 Elastic Net(Enet) 모델이 훈련 및 검증 코호트에서 가장 높은 전반적인 식별 성능을 보였습니다. SHapley 추가 설명(SHAP) 분석은 RPS11, NCF2, S100A4와 같은 유전자가 모델 예측에 크게 기여한다는 점을 강조했습니다. 면역 디컨볼루션과 단세포 전사체 분석을 통해 ERS 관련 시그니처가 주로 단핵구-대식세포 계통에 있음을 추가로 밝혀내어, AF 관련 면역 재형성에 잠재적으로 관여할 수 있음을 시사했습니다. 이 워크플로우는 질병 관련 전사체 서명을 특정 면역세포 집단과 연결하는 재현 가능한 전략을 제공하며, 적절한 벌크 및 단세포 데이터셋을 통해 다른 질병 맥락에도 적용할 수 있습니다.
심방세동(AF)은 임상 실무에서 가장 흔한 지속성 부정맥으로, 심방의 전기 활동이 무질서하고 기계적 기능 상실이 특징입니다. 뇌졸중, 심부전, 모든 원인에 의한 사망 위험을 크게 증가시켜 주요 전 세계 공중보건 부담이 됩니다1. 현재 심방세방위증의 임상 치료는 상당한 도전에 직면해 있습니다: 전통적인 항부정맥제는 동리듬 유지에 장기적인 효과가 제한적이며, 부정맥과 심장독성 같은 부작용으로 인해 지속적인 사용이 제한됩니다 2,3. 카테터 절제술은 지속성 심방심동4의 장기 동동 리듬 유지에도 여전히 도전적인과제입니다. 새로운 치료 전략은 현재 AF 상류 기전의 분자 지형에 대한 체계적인 이해가 부족하여 정확한 표적 식별과 번역에 어려움을 겪고 있습니다. 연구에 따르면 AF의 병리적 진행은 전기적, 구조적, 자율신경계 재설계 등 여러 차원에 걸친 복잡한 상호작용을 포함합니다. 이 중 심근섬유증을 중심으로 한 심방 구조 재형성은 AF 5,6,7 유지의 핵심 메커니즘입니다.
따라서 섬유증을 유발하는 상류 스트레스 경로를 명명히 하는 것이 지속성 심방세동에서 치료적 병목 현상을 극복하는 열쇠 중 하나입니다. 최근 연구들은 소포체 소상 스트레스(ERS)가 세포 내외 교란에 대응할 수 있도록 하는 핵심 조절 허브로, 소포체 항상성이 깨져 소포체 내강 내에 접히지 않거나 잘못 접힌 단백질이 과도하게 축적될 때 촉발되는 매우 보존된 적응 반응임을 시사합니다. ERS는 단백질 조절, 칼슘 순환, 염증 반응, 세포자멸사를 조절하여 심방 재형성에 참여할 수 있습니다. 그러나 심방세동에서 ERS의 상류 유발 요인, 주요 효과자 분자, 하류 경로는 아직 체계적으로 특성화되지 않아 심방 재형성에서 중요한 결절과 실행 가능한 개입 지점을 정의하기 어렵습니다.
기존의 대량 전사체 연구와 비교할 때, 다중 오믹스 통합은 더 강력한 인구 집단 수준의 질병 관련 신호를 얻을 수 있습니다. 더 나아가, 단세포 전사체학을 도입하면 세포 이질성을 해부하고 이 신호의 세포 출처를 식별할 수 있어, 특정 세포 유형과 그 잠재적 상호작용 경로에 대한 연관 결과를 매핑할 수 있습니다. 이는 이후 기전적 연구와 표적 우선순위 설정의 기초를 제공합니다. 본 연구에서는 AF 관련 대용량 전사체 및 단세포 전사체 데이터셋을 유전자 발현 옴니버스(GEO) 데이터베이스에서 검색하였습니다. ERS 관련 핵심 모듈은 차등 발현 분석과 가중 유전자 공동 발현 네트워크 분석(WGCNA)을 통해 확인되었습니다. 단일 세포 분석을 통합함으로써 주요 분자들이 특정 세포 유형과 그 상호작용 네트워크에 더욱 국소화되었습니다. 전체적으로 본 연구는 AF에서 ERS 관련 주요 네트워크와 구조 재형성과의 연관성을 구분하여 표적 발견과 메커니즘 중심의 층화된 치료 전략에 대한 근거를 제공하는 것을 목표로 합니다.
단일 데이터셋 차별 발현 분석이나 단일 알고리즘 바이오마커 스크리닝과 비교하여, 이 워크플로우는 교차 코호트 검증, 생물학적으로 제한된 특징 선택, 다중 알고리즘 모델 비교, 면역 탈합성, 단세포 전사체학을 통합하여 견고성과 해석 가능성을 향상시킵니다. 이 단계들은 재현 가능한 ERS 관련 서명을 우선순위 지정하고, 대량 유래 신호를 특정 면역 세포 집단과 상호작용 네트워크에 국소화하는 데 도움을 줍니다. 이 워크플로우는 명확히 정의된 질병 및 통제군, 유사 조직원, 적절한 표본 크기, 그리고 이용 가능한 표현형 주석을 가진 공개 또는 사내 전사체 데이터셋을 사용하는 연구에 적합합니다. 특히 가설 생성, 바이오마커 우선순위 지정, 질병 관련 분자 프로그램의 세포 유형 위치 파악에 유용합니다. 그러나 성능은 데이터셋 품질, 표현형 일관성, 효과적인 배치 효과 보정에 달려 있습니다; 따라서 이 워크플로우에서 확인된 후보 서명은 임상 번역 전에 독립적인 코호트와 실험 모델에서 검증되어야 합니다. 전체 연구 워크플로우는 그림 1에 나와 있습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
2023년 2월 18일 중국에서 공포된 인간 대상 생명과학 및 의학 연구 윤리적 검토 기준에 따라, 공개 데이터를 이용한 연구는 윤리적 검토 면제 기준을 충족할 수 있습니다. 이 연구는 공개적으로 이용 가능한 식별 해제된 2차 전사체 데이터만을 사용했으며, 새로운 인간 참가자 모집, 인간 샘플 수집, 동물 실험은 포함하지 않았습니다. 따라서 추가적인 기관 윤리 승인은 필요하지 않았습니다. 이 연구에서는 동물 실험이 수행되지 않았습니다. 따라서 시설 동물 관리 및 이용 위원회의 승인은 적용되지 않았습니다.
심방세동에서 소포체 스트레스 관련 유전자에 대한 데이터 출처
본 연구에서는 GSE41177, GSE79768, GSE115574, GSE14975, GSE165838 등 공개된 AF 관련 전사체 데이터셋을 GEO 데이터베이스에서 검색하였습니다. GSE 데이터셋에 대한 자세한 정보는 보충 파일 1—보충 표 S1에 제공되어 있습니다. GSE41177와 GSE79768는 통합 대량 전사체 훈련 코호트를 구성하는 데 사용되었고, GSE115574와 GSE14975는 두 개의 독립적인 외부 검증 코호트로 사용되었습니다. GSE165838 단세포 전사체 분석에 사용되었습니다. 이 데이터셋들은 서로 다른 플랫폼에서 생성되었고 조직 출처, 임상 배경, 샘플 구성이 다를 수 있기 때문에, 각 데이터셋은 통합 또는 검증 전에 플랫폼 특성에 따라 별도로 전처리되었습니다. 이후 통합 훈련 코호트를 위해 sva R 패키지를 사용하여 배치 효과 보정이 수행되었습니다. 소포체 스트레스 관련 유전자 집합은 GeneCards 데이터베이스에서 관련성 점수 3≥으로 검색되었으며, 중복 제거 후 본 연구에서 사용된 목표 유전자 목록을 형성했습니다.
차별발현 유전자 분석
데이터 표준화 및 정규화 이후, R 패키지 limma는 통합 훈련 집합에서 차등 발현 유전자(DEG)를 식별하는 데 사용되었습니다. DEGs는 다음과 같은 유의성 기준을 사용하여 정의되었습니다: 거짓 발견률 조정 P 값(adj. P.Val) < 0.05 및 |log2FC| > 0.58510. DEG의 표현 패턴을 시각화하기 위해 각각 ggplot2와 pheatmap 패키지를 사용하여 화산 플롯과 히트맵을 생성했습니다.
WGCNA 분석
조정된 유전자 조절의 잠재적 메커니즘을 밝히고, 공동발현 모듈과 임상 형질 변수 간의 연관 패턴을 정의하며, 번역 잠재력을 가진 핵심 바이오마커 또는 치료 표적을 식별하기 위해 WGCNA가 적용되었습니다11.
R의 WGCNA 패키지를 사용하여 가중 공용 발현 네트워크가 구축되었습니다. 소프트 임계값 몫(β)은 척도 자유 위상 기준에 따라 선택되었으며; 해당 β 값은 척도 자유 위상 적합 지수(R2)가 0.8512 이상에 도달하고 유지될 때 후속 분석에 선택되었다. 모듈 식별 과정에서 동적 나무 절단과 모듈 탐지 민감도와 관련된 매개변수가 최적화되어 모듈 경계 해상도와 안정성을 향상시켰습니다. 마지막으로, 목표 형질과 유의미하게 연관된 모듈을 추출하고, 후속 분석용 후보 유전자 세트로 모듈러 내 허브 유전자를 확인하였습니다.
AF 관련 DEG의 농축 분석
허브 유전자를 정확히 식별하기 위해, DEGs는 먼저 WGCNA 주요 모듈의 유전자들과 교차하여 AF 발병 기전과 관련된 유전자 집합을 정의했습니다. 다음으로, 이 AF 유전자 세트는 ERS 관련 유전자와 추가로 교차되었고, 그 결과 겹치는 유전자들은 이후 분석을 위해 보존되었다.
선별된 유전자의 기능 풍부도는 유전자 온톨로지(GO)와 교토 유전자 및 게놈 백과사전(KEGG) 분석을 통해 평가되었습니다. Go 용어는 R 패키지 clusterProfiler로 분석되어 생물학적 과정(BP), 세포 구성 요소(CC), 분자 기능(MF) 범주 전반에 걸친 농축을 요약했습니다13. 이후 KEGG 분석을 통해 표적 유전자와 관련된 농축된 경로를 확인하였다14. 조정된 P 값 0.05< 농축 결과는 통계적으로 유의한 것으로 간주되었습니다. 주요 GO 항과 KEGG 경로는 ggplot2를 사용하여 막대 플롯과 버블 플롯으로 표시되었습니다.
단백질-단백질 상호작용(PPI) 분석
PPI 분석은 교차된 유전자 집합을 STRING 데이터베이스에 업로드하여 수행되었으며, 생물체는 호모 사피엔스로 제한되었다. 분리된 노드는 제거하고, 중간 신뢰 점수 임계값(합산 점수 ≥ 0.4)을 사용해 상호작용을 검색하였습니다. 생성된 PPI 네트워크는 네트워크 시각화 및 분석 도구로 가져와 위상 분석을 통해 주요 노드를 식별했습니다.
12개의 머신러닝 알고리즘을 기반으로 한 후보 AF-ERS 분류 모델 구축
본 연구에서는 AF와 관련된 ERS 관련 후보 서명 유전자를 선별하고 분류 성능을 최적화하기 위해 12개의 기존 기계 학습 알고리즘을 기반으로 한 앙상블 분류 프레임워크를 개발하였습니다. 데이터 분할을 위해 표준화 및 정규화 후 GSE41177와 GSE79768을 합쳐 훈련 코호트 표현 행렬을 생성했습니다. GSE115574 모델 일반화 가능성을 평가하기 위한 독립적인 외부 검증 코호트로 사용되었습니다. 구체적으로, DEG는 훈련 코호트에서 처음 확인되었습니다(|log2FC| >0.585, 조정 p < 0.05). 이 DEG들은 WGCNA 주요 모듈 및 ERS 관련 유전자와 교차되어, 생성된 유전자 세트가 모델 구축의 입력 특징으로 사용되었습니다.
ERS 관련 유전자와 AF 표현형을 연결하기 위해 12가지 기계 학습 기법을 사용한 후보 분류 모델이 개발되었습니다: Lasso, Ridge, 단계별 일반화 선형 모델(Stepglm), 극단 구배 부스트(XGBoost), 랜덤 포레스트(RF), 탄성 넷(Enet), 일반화 선형 모델에 대한 부분 최소제곱 회귀(plsRglm), 일반화 강화 회귀 모델링(GBM), 나이브 베이즈, 선형 판별 분석(LDA), glmBoost, 그리고 지지 벡터 기계(SVM)를 사용했습니다. 첫 번째 알고리즘에 두 번째 알고리즘을 추가하고 튜닝 매개변수 α을 통해 통합하여 체계적인 조합 모델링 전략을 채택하여, 113가지 특징 선택과 모델 적합 조합이 포괄적으로 평가되었습니다. 모델 판별은 수신자 운행 특성 곡선(AUC) 아래 면적을 계산하여 평가하였습니다. 이전에 보고된 모델 선택 기준에 따르면, 최종 후보 프레임워크는 훈련 및 검증 코호트 간 평균 AUC로 평가된 전체 성능이 가장 우수한 모델로 정의되었습니다.
이 조합 모델링 전략은 생의학 머신러닝에 관한 이전 연구들에 의해 형성되었습니다15, 16, 17. 이 연구들을 종합하면, 단일 알고리즘이 데이터셋과 분석 과제 전반에 걸쳐 다른 알고리즘보다 일관되게 우수하지 않다는 것을 보여줍니다. 이 전제에 기반하여, 앙상블 학습 및 조합 모델링 프레임워크를 채택하면 더 안정적인 일반화 가능성을 가진 고성능 후보 모델을 얻을 가능성을 높이고 모델 선택의 견고성을 높일 수 있습니다.
이후 SHapley Additive exPlanations(SHAP) 값을 적용하여 AF 분류를 이끄는 주요 특징을 시각화하여 각 특징이 예측 결과에 얼마나 기여하는지 정량화하고, 개별 서명 유전자가 최종 모델 출력에 어떻게 영향을 미치는지 보여주었습니다18.
모델 성능 평가 및 최적 모델의 외부 검증
최적 모델의 성능은 훈련 코호트와 독립 외부 검증 코호트(GSE115574)에서 평가되었습니다. 모델 수준에서는 예측된 클래스 라벨을 기반으로 혼동 행렬이 구성되었고, 이에 대응하는 분류 지표가 보고되었습니다. 수신기 작동 특성(ROC) 곡선은 R 패키지 pROC를 사용하여 생성되었고, AUC는 판별 성능을 정량화하기 위해 계산되었습니다.
바이오마커 수준에서는 최적 모델의 각 핵심 유전자별로 단일 유전자 ROC 곡선을 그렸고, 해당 AUC를 계산하여 개별 유전자의 구별 능력을 평가하였습니다. 또한, 주요 유전자의 차별 발현은 화산 플롯을 사용해 요약했으며, 박스플롯을 사용해 질병과 건강한 샘플의 발현 분포를 나타냈습니다. 기존에 정의된 최적의 모델 유도 유전자 서명의 일반화 가능성을 추가로 평가하기 위해, GSE14975을 사용하여 추가적인 독립적인 외부 검증이 수행되었습니다. GSE14975에는 좌심방 부속 샘플에서 추출한 전사체 데이터가 포함되어 있으며, 여기에는 심방세동 샘플 5개와 동성 리듬/대조 샘플 5개가 포함되어 있습니다. 잠긴 서명에 포함된 모든 유전자가 이 데이터셋에서 이용 가능했습니다. 원래의 교차 코호트 분석 워크플로우와 일관성을 유지하기 위해, 개발 코호트와 GSE14975은 데이터셋 소스를 배치 변수로 삼은 ComBat을 사용해 조화를 이루었습니다. 이 화성은 감독 없이 진행되었습니다. 중요한 점은, GSE14975에서 얻은 질병/통제 라벨은 특징 선택, 계수 추정, 임계값 결정, 또는 하이퍼파라미터 튜닝에 사용되지 않았다는 것입니다.
최적의 모델 유도 점수 모델은 개발 코호트만을 사용하여 적합한 후 외부 검증을 위해 GSE14975에 적용하였습니다. GSE14975에서의 모델 성능은 수신자 작업 특성 곡선 분석, 곡선 아래 면적, 95% 신뢰구간(CI), 민감도, 특이도, 정확성, 양성 및 음성 예측값, 브라이어 점수를 사용하여 평가하였습니다. 또한, GSE14975 내 모든 최적 모델 유전자 유전자에 대해 개별 구별 능력을 보여주기 위해 단일 유전자 ROC 곡선을 생성하였습니다. 개발 코호트에서 잠재적 과적합을 추가로 평가하기 위해, 잠긴 최적 모델에서 유도된 유전자 서명을 사용하여 반복적인 10배 교차 검증과 부트스트랩 낙관주의 보정을 수행하였습니다. 반복 교차 검증을 위해 개발 코호트는 반복적으로 10개 분할되었고, 모델 판별은 모든 반복에 걸쳐 요약되었습니다. 부트스트랩 검증을 위해 1,000개의 부트스트랩 재샘플을 생성하여 개발 세트 성능의 낙관성을 추정하고 낙관주의 보정 AUC를 계산했습니다. 최종 시그니처가 최적 모델에서 도출되었기 때문에, 각 유전자의 기여도는 주로 모델 계수의 절대 크기와 방향에 따라 해석되었습니다. 또한, 각 구성 유전자의 개별 구별 능력을 보여주기 위해 단일 유전자 ROC 분석도 GSE14975에서 수행되었습니다. 시각화 목적을 위해, 단일 유전자 ROC 곡선은 AF와 관련된 발현 증가 여부와 관계없이 구별 능력을 반영하도록 정렬되었다.
유전자 집합 풍부화 분석 (GSEA)
주요 유전자의 기능적 함의를 탐구하기 위해 GSEA는 질병군19의 샘플을 사용하여 수행되었다. 각 핵심 유전자에 대해 샘플은 질병군의 중간 발현값을 기준으로 고발현 및 저발현 하위 그룹으로 층화되었습니다. 각 유전자에 대해 두 하위 그룹 간 평균 발현 차이를 계산하고, 풍부 분석을 위한 입력으로 내림차순으로 순위가 매겨진 유전자 목록을 생성하였습니다. GSEA는 R패키지 clusterProfiler를 사용하여 수행되었으며, MSigDB 컬렉션 c2.cp.kegg.Hs.symbols.gmt에서 유전자 세트를 얻었습니다. 통계적 유의성은 p < 0.05로 정의되었습니다. 농축 방향은 정규화 농축 점수(NES)의 부호에 의해 결정되었으며, 대표적인 경로에 대한 농축 플롯이 생성되었습니다.
면역 세포 아형 풍부도와 차별 발현 평가
CIBERSORT 디컨볼루션 알고리즘을 적용하여 침투 면역 세포 하위 집합의 상대적 풍부도와 샘플 간 상호관계를 추정하였습니다. LM22 백혈구 서명 기진을 바탕으로, R 패키지 CIBERSORT20을 사용하여 유전자 발현 프로필을 통해 면역 세포 구성을 정량적으로 추론하였습니다. 결과 필터링에는 p < 0.05의 임계값을 사용했으며, 이후 분석에는 이 기준을 충족하는 샘플만 유지되었습니다. AF군과 대조군 간 면역세포 하위 집합의 추정 상대적 분율을 비교하기 위해 박스플롯이 생성되었습니다. 또한, 스피어먼의 상관관계 분석은 면역 세포 침윤 수준과 허브 유전자 발현 간의 연관성을 평가하기 위해 수행되었습니다.
단일 셀 분석
단일 세포 전사체 분석은 GEO 데이터셋 GSE165838을 사용하여 수행되었습니다. 원시 유전자 세포 수 행렬은 R에 가져와 Seurat v4.4.0으로 처리되었습니다. 각 샘플마다 CreateSeuratObject를 사용하여 min.cells = 5, min.features = 300인 Seurat 객체를 생성했습니다. 각 세포별로 검출된 유전자 수, 총 고유 분자 식별자(UMI) 수, 미토콘드리아 유전자 비율, 리보솜 유전자 비율, 헤모글로빈 유전자 비율 등 품질 관리 지표가 계산되었습니다. 세포가 500개 이상 검출된 유전자, 5,000개 미만의 UMI 개수, 미토콘드리아 유전자 비율 25%, 리보솜 유전자 비율 > 3%, 헤모글로빈 유전자 비율 < 1%< 유지되었습니다. 세 개 미만의 세포에서 검출된 유전자는 제거되었습니다. MALAT1과 미토콘드리아 유전자도 제거하여 후속 분석 전에. DoubletFinder는 잠재적인 더블릿을 탐지하고 배제하는 데 사용되었습니다. 간단히 말해, 세포는 샘플 동일성에 따라 분리되었고, 주성분 1–30을 사용하여 각 샘플별로 이중항 검출이 별도로 수행되었습니다.
pN 매개변수는 0.25로 설정되었고, 매개변수 스위핑을 통해 얻은 최대 BC 지표에 따라 최적의 pK 값을 선택했습니다. 예상 이중률은 각 샘플에서 회수된 세포 수에 따라 추정되었으며, 상대적으로 낮은 세포 수, 중간, 높은 세포 수에 대해 각각 2.5%, 5%, 6.5%의 비율이 사용되었습니다. 단골로 분류된 세포만 보존되었다. DecontX를 이용해 주변 RNA 오염을 추가로 추정했으며, 오염 점수 0.2≥ 세포는 제외하였다. 품질 관리, 이중 제거, 주변 RNA 필터링 후, 40,886개의 세포와 23,947개의 유전자가 후속 분석을 위해 보존되었습니다. 필터링된 단일 세포 데이터셋은 10,000의 척도 계수를 사용하여 LogNormalize 방법으로 정규화되었고, 이후 매우 변이가 큰 유전자를 식별했습니다. 그 후 주성분 분석을 위해 데이터를 척도화했습니다.
샘플별 배치 효과를 줄이기 위해 하모니는 orig.ident를 배치 변수로 사용했습니다. 유니폼드 근사 및 투영(UMAP) 시각화와 최근접 이웃 그래프 구성은 처음 15개의 하모니 보정 차원21을 사용하여 수행되었습니다. 클러스터링은 루뱅 알고리즘을 사용하여 수행되었으며, 여러 클러스터링 해상도를 평가하였습니다. 최종 주요 셀 유형 주석은 해상도 0.05의 군집 결과를 기반으로 하였다. 세포 클러스터는 정식 마커-유전자 발현에 따라 수동으로 주석을 달았습니다. 이 마커 기반 주석 전략은 이전의 단일 세포 면역 프로파일링 연구와 일치합니다22. T 세포는 CD3D, CD3E, TRAC로 확인되었으며; NKG7, GNLY, NCAM1, KLRG1의 자연 살균자(NK) 세포; LYZ, CD14, FCGR3A, CD68, CD163, FCN1, TYROBP, S100A8, S100A9에 의해 단핵구-대식세포; MS4A1과 CD79A에 의한 B 세포; MZB1과 XBP1에 의한 형질체; PECAM1, VWF, CDH5에 의한 내피세포; 혈관 평활근 세포는 ACTA2, TAGLN, MYH11, MYL9에 의해 발견됩니다; DCN, LUM, COL1A1, COL1A2, PDGFRA에 의한 섬유아세포; FCGR3B, CXCR2, S100A8, MPO에 의해 호중구 유사 세포; 비만세포는 TPSB2에 의해 이루어집니다; 그리고 수지상 세포는 LILRA4, CD1C, XCR1에 의해 형성됩니다. 클러스터 간 마커 유전자 발현은 점플롯을 사용해 시각화되었고, 최종 ERS 관련 허브 유전자의 발현 분포는 UMAP 임베딩에서 시각화되었습니다.
단일 세포 수준에서 ERS 관련 전사 활동을 정량화하기 위해, 최종 허브 유전자 집합을 사용하여 AUCell, 단일 샘플 유전자 집합 풍부화 분석, Seurat AddModuleScore를 사용하여 세포별 서명 점수를 계산하였습니다. AUCell의 경우, 정규화된 RNA 발현 매트릭스를 기반으로 세포 순위를 구성하고, AUC 점수는 상위 10%의 유전자를 최대 순위 임계값으로 삼은 허브 유전자 집합을 사용하여 계산했습니다. ssGSEA의 경우 GSVA 패키지를 사용하여 농축 점수를 계산했습니다. 세 개의 점수 출력은 중앙에 맞춰져 스케일링되었으며, 최소-최대값 정규화를 거쳐 각 셀에 대한 통합 ERS 관련 복합 점수를 생성했습니다. 복합 점수의 분포를 주석이 달린 세포 집단 전반에 걸쳐 비교하여 ERS 관련 프로그램의 세포 유형 이질성을 평가하였습니다. 단핵구-대식세포 계통은 두드러진 ERS 관련 시그니처 풍부화를 보였고 면역 염증 재형성과 밀접한 관련이 있었기 때문에, 이후 계통 내 분석에 선정되었습니다. 단핵구-대식세포는 중간값 중위 ERS 관련 복합 점수에 따라 고점수 그룹과 저점수 그룹으로 나뉘었습니다. 그 후 단핵구-대식세포에 대해 단핵구-대식세포에 대해 의사시간 궤적 분석이 수행되었습니다.
의사시간 분석을 위해 음성 이항 표현 모델을 사용하여 원시 카운트 행렬에서 CellDataSet 객체를 생성했습니다. 그 후 크기 요인과 분산을 추정했다. 유전자 순서는 평균 발현 임계값 ≥ 0.1과 적합 확산보다 큰 경험적 분산을 사용하여 선택하였다. DDRTree 알고리즘으로 차원이 줄어들었고, 셀들은 추론된 궤적을 따라 정렬되었습니다. ERS 관련 허브 유전자의 의사 시간 발현 패턴을 시각화하였다. CellChat을 사용하여 다양한 ERS 관련 점수를 가진 단핵구-대식세포 간의 잠재적 리간드-수용체 상호작용을 탐색하기 위해 세포 간 통신 분석이 수행되었습니다. 이 분석에서 단핵구-대식세포는 중앙값 복합 점수에 따라 높은 점수 또는 낮은 점수로 표기되었고, 다른 세포들은 원래의 세포 유형 표지를 유지했습니다. 정규화된 RNA 발현 행렬과 대응하는 세포 그룹 주석을 사용하여 CellChat 객체를 만들었습니다. 세포 간 통신 분석을 위해 인간 CellChatDB 데이터베이스를 선택하고, 분비된 신호 상호작용만을 평가하였습니다. 과발현된 유전자와 리간드-수용체 쌍은 의사소통 확률을 계산하기 전에 검출되었다. 10개 미만의 세포 그룹은 상호작용 분석에서 제외되었습니다. 경로 수준의 의사소통 확률을 추정하고 집계하여 세포 집단 간 상호작용의 수와 강도를 비교하였습니다. 재현성을 높이기 위해 아래에 체크포인트 테이블이 제공되며, 각 프로토콜 단계를 해당 기대 출력 도표 또는 표(보완 파일 1—보조 표 S2)와 연결합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
심방세방에서 차별발현 유전자의 식별
코호트 간 비교 가능성을 높이기 위해 두 개의 AF 관련 전사체 데이터셋(GSE41177과 GSE79768)을 통합하고, 병합된 발현 행렬에서 배치 효과를 보정하였습니다. 그림 2A, B는 배치 효과 보정 전후의 전역 표현 분포를 박스플롯으로 보여주며, 이를 통해 표본 간 발현 강도 분포가 비교 가능한지 평가했습니다. 그림 2C,D는 배치 효과 보정 전후의 주성분 분석(PCA) 플롯을 보여주며, 이를 통해 샘플 수준의 군집 패턴과 코호트 관련 분리를 평가했습니다. 보정 후 전역 발현 분포가 더 일관성을 갖추었고, PCA 공간에서 코호트 간 체계적 분리가 현저히 약화되어 배치 효과가 효과적으로 완화되었음을 시사합니다. 이후 배치 보정된...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구는 대량 및 단세포 전사체를 통합하여 ERS가 AF에서 어떤 역할을 하는지 조사하였습니다. 유리한 교차 코호트 구별을 가진 ERS 관련 유전자 서명이 도출되었으며, 이 신호들은 주로 단핵구-대식세포 계통에 매핑되어 광범위한 세포 간 통신과 연관되어 있었습니다. 종합적으로 이 연구 결과들은 ERS 관련 프로그램이 심방세동에서 면역세포 중심 재형성과 연관되어 있음을 시사합니다. 대량 바이오마커 선별과 비교할 때, 이 워크플로우는 질병 관련 유전자를 다층적으로 해석할 수 있게 합니다. WGCNA와 ERS 관련 유전자 필터링의 통합은 생물학적 특이성을 향상시키며, 여러 머신러닝 알고리즘을 비교하면 단일 모델링 전략에 대한 의존도를 줄입니다. SHAP 분석은 각 특징의 상대적 기여도와 방향을 식별함으로써 모델 해석 가능성을 더욱 향상시킵니다. 또한 단세포 전사체학은 벌크 유래 서명을 특정 세포 집단에 매핑하여 세포 출처와 세포 간 통신에 관한 기전적 가설을 생성합니다. ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이 연구에서 이해 상충이 없다고 보고했습니다. 이 원고가 수정되는 동안, OpenAI의 ChatGPT는 영어 다듬기 지원에만 사용되었습니다. 저자들은 모든 AI 지원 텍스트를 검토, 검증, 편집했으며, 최종 원고의 정확성과 무결성에 대해 전적인 책임을 집니다. AI 지원 도구는 연구 아이디어 생성, 데이터 분석, 결과 해석, 도표 작성, 과학적 결론 도출에 사용되지 않았습니다. 기사에 보고된 작업은 저자들이 수행한 것입니다. F.T, PR. W: 작성 - 원고, 소프트웨어, 방법론, 시각화, 검증, 데이터 큐레이션. 사이. T: 조사 및 방법론. FF. B: 감독. QR 코드. L: 감독, 방법론, 데이터 큐레이션. XY. J, YX. X: 문헌 검색 및 데이터 해석.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| AddModuleScore | Seurat 함수 | version 4.4.0 | NA |
| AUCell | Bioconductor | version 1.32.0 | RRID:SCR_021327 |
| caret | CRAN | version 7.0.1 | RRID:SCR_022524 |
| celda / decontX | Bioconductor | version 1.24.0 | NA |
| CellChat | GitHub / CellChat | version 2.2.0 | RRID:SCR_021946 |
| CIBERSORT / LM22 시그니처 매트릭스 | CIBERSORT | LM22 | NA |
| clusterProfiler | Bioconductor | version 4.12.6 | RRID:SCR_016884 |
| Cytoscape | Cytoscape Consortium | version 3.10 | RRID:SCR_003032 |
| DoubletFinder | GitHub / McGinnis Lab | version 2.0.4 | NA |
| e1071 | CRAN | version 1.7.16 | NA |
| gbm | CRAN | version 2.2.2 | NA |
| Gene Expression Omnibus (GEO) 데이터베이스 | National Center for Biotechnology Information (NCBI) | GSE41177 | NA |
| Gene Expression Omnibus (GEO) 데이터베이스 | NCBI | GSE79768 | NA |
| Gene Expression Omnibus (GEO) 데이터베이스 | NCBI | GSE115574 | NA |
| Gene Expression Omnibus (GEO) 데이터베이스 | NCBI | GSE14975 | NA |
| Gene Expression Omnibus (GEO) 데이터베이스 | NCBI | GSE165838 | NA |
| glmnet | CRAN | version 4.1.8 | NA |
| Harmony | CRAN | version 1.2.4 | NA |
| limma | Bioconductor | version 3.60.6 | RRID:SCR_010943 |
| MASS | CRAN | version 7.3.61 | NA |
| mboost | CRAN | version 2.9.11 | NA |
| Monocle | Bioconductor | version 2.38.0 | RRID:SCR_016339 |
| org.Hs.eg.db | Bioconductor | version 3.19.1 | NA |
| plsRglm | CRAN | version 1.5.1 | NA |
| pROC | CRAN | version 1.18.5 | RRID:SCR_024286 |
| R 통계 소프트웨어 | R Foundation for Statistical Computing | version 4.4.2 | RRID:SCR_001905 |
| randomForest | CRAN | version 4.7.1.2 | RRID:SCR_015718 |
| RStudio | Posit Software, PBC | version 2024.4.1.748 | RRID:SCR_000432 |
| Seurat | CRAN / Satija Lab | version 4.4.0 | RRID:SCR_016341 |
| shapviz | CRAN | version 0.10.2 | NA |
| sva | Bioconductor | version 3.52.0 | NA |
| WGCNA | CRAN | version 1.73 | RRID:SCR_003302 |
| xgboost | CRAN | version 1.7.8.1 | NA |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.