이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.

방법 논문

말라리아 재감염 시 말초혈액 단핵세포 CD4+ T 세포의 단세포 RNA 시퀀싱 분석을 위한 재현 가능한 Seurat 기반 프로토콜

106 조회수

DOI:

10.3791/70858

2026년 7월 31일

이 논문에서

요약

여기서는 말라리아 재감염 시 전사 이질성과 기능적 면역 프로그램을 특성화하기 위해 말초혈 단핵세포 CD4⁺ T 세포의 단일 세포 RNA 시퀀싱 데이터를 분석하기 위한 재현 가능한 쇠라 기반 프로토콜을 제시합니다. 이 프로토콜은 질환 전반에 걸쳐 역동적인 CD4⁺ T 세포 상태와 면역 반응을 일관되게 식별, 비교 및 생물학적 해석을 가능하게 합니다.

초록

여기서는 말라리아 재감염 시점에 걸쳐 PBMC CD4⁺ T세포 단일 세포 RNA 시퀀싱 데이터를 분석하기 위한 재현 가능한 Seurat 기반 프로토콜을 제시합니다. 이 프로토콜은 말라리아 재감염 시점에 걸쳐 PBMC CD4⁺ T세포 scRNA-seq 데이터를 분석하는 재현 가능한 Seurat 기반 워크플로우를 시연하며, 대표적인 공개 데이터셋을 활용합니다: Plasmodium 특이적 TCR 형질전환 CD4⁺ T세포 데이터셋(GSE233703)과 재감염 관련 시점을 비교한 다클론 CD4⁺ T세포 데이터셋(GSE233713; D27₍₃₎ 대 D30). 워크플로우는 표준화된 전처리, 통합, 클러스터링, 그리고 통합된 계산 프레임워크 내에서 하위 전사체(transcriptomic analysis) 분석을 포함합니다. 이 방법은 미리 정의된 면역 및 CD4⁺ T세포 프로그램의 모듈 점수 체계적 계산, 클러스터 특이적 마커 유전자 확인, 시간점 해상도 차별 발현 분석, 그리고 하위 유전자 온톨로지 및 KEGG 경로 풍부화를 가능하게 합니다. 이 워크플로우를 적용하면 서로 다른 CD4⁺ T 세포 기능 상태를 식별하고, 말라리아 재감염 시점에 걸친 동적 전사 변화를 밝혀냅니다. 프로토콜은 표준화된 시각화 출력과 표 결과를 생성하고, 매개변수 선택 및 문제 해결에 관한 실용적인 지침을 제공하여 말라리아 및 관련 면역학 맥락에서 CD4⁺ T세포 scRNA-seq 데이터셋의 일관되고 재현 가능한 분석을 용이하게 합니다. 이 프로토콜은 면역 반응의 재현 가능하고 생물학적으로 해석 가능한 분석을 가능하게 하며, 면역학 연구의 유사한 단세포 데이터셋에도 적용할 수 있습니다.

서론

말라리아는 여전히 전 세계적인 주요 보건 부담으로 남아 있으며, 반복적인 감염이 숙주 면역을 복잡하고 불완전하게 이해한 방식으로 형성합니다. CD4⁺ T 세포는 효과기 사이토카인 생성을 조정하고, B세포 도움을 지원하며, 염증을 조절함으로써 항말라리아 면역 반응에서 중심적인 역할을 합니다 2,3. 말라리아 재감염 과정에서 CD4⁺ T 세포는 동적 전사 재프로그래밍을 겪으며, 이는 효과자, 조절, 기억, 증식, 소진 상태 간의 변화를 반영하여 기생충 통제와 면역병리학 모두에 영향을 미친다 4,5. 이러한 이질성을 정확히 해결하는 것은 면역 보호, 면역 기능 장애, 그리고 자연적으로 획득하거나 백신으로 유도된 면역의 플라스모디움 감염에 대한 내구성을 이해하는 데 필수적입니다. 여기서는 말라리아 재감염 시점에 걸쳐 CD4⁺ T세포 scRNA-seq 데이터를 분석하기 위한 재현 가능한 Seurat 기반 프로토콜을 제시합니다.

단세포 RNA 시퀀싱(scRNA-seq)은 면역 이질성의 고해상도 특성 분석을 가능하게 하며, 말라리아에서 기생충 반응성 CD4⁺ T세포 소집합, 소진 프로그램, 조절 네트워크를 확인했습니다 6,7,8,9. 그러나 품질 관리, 정규화, 군집화, 통합에서의 분석적 변동성은 재현성을 제한하고 교차 연구 비교를 복잡하게 만들 수 있습니다10,11. 그러나 말라리아 재감염 시 CD4⁺ T세포 역학을 분석하기 위해 최적화된 표준화되고 생물학적으로 유도된 워크플로우가 부족합니다.

Seurat와 Scanpy를 포함한 기존의 scRNA-seq 분석 계산 프레임워크는 단일 셀 데이터의 전처리, 클러스터링 및 후속 해석을 위한 포괄적인 도구 세트를 제공합니다 12,13,14. R로 구현된 Seurat는 정규화, 데이터 통합, 시각화를 위한 긴밀히 통합된 워크플로우를 제공하며, 이질적 면역 데이터셋에서 신호 탐지를 개선하는 SCTransform과 같은 분산 안정화 접근법을 포함합니다. Python으로 구현된 Scanpy는 대규모 데이터셋과 효율적인 메모리 사용에 최적화된 확장 가능한 솔루션을 제공하여 특히 고처리량 또는 클라우드 기반 분석에 적합합니다12,14. 이러한 발전에도 불구하고, 감염 환경에서 생물학적 질문을 명확히 해결하면서도 데이터셋 간 투명성, 적응성, 일관성을 유지하는 표준화되고 재현 가능한 워크플로우가 여전히 필요합니다. 본 프로토콜은 말라리아 재감염 시 CD4⁺ T세포 반응에 맞춘 구조화된 생물학적 해석과 함께 Seurat 기반 전처리의 견고함을 결합하여 이 격차를 메우고 있습니다. 기존의 범용 워크플로우와 비교할 때, 이 프로토콜은 재현성, 생물학적 정보 매개변수 선택, 감염 모델에 맞춘 일관된 교차 시간점 분석을 강조합니다.

이 프로토콜의 핵심 특징 중 하나는 재현성과 실용적 사용성에 중점을 둔다는 점입니다. 품질 관리 임계값은 고정되지 않고 중간 절대 편차를 기반으로 한 데이터 적응 접근법을 사용하여 도출되어, 전사체 복잡도, 시퀀싱 깊이, 미토콘드리아 함량에 대한 임계값을 데이터셋 특화 분포에 따라 확장할 수 있게 합니다. 이 설계는 수천에서 수만 셀에 이르는 다양한 크기의 데이터셋과 드롭렛 기반 scRNA-seq 실험에서 흔히 접하는 다양한 시퀀싱 깊이의 데이터셋에 걸쳐 워크플로우를 적용할 수 있게 합니다. 워크플로우에 내장된 지침은 차원 감소, 군집화 해상도, 통합을 위한 적절한 매개변수 선택을 지원하여 분석이 생물학적으로 의미 있으면서도 기술적으로 견고함을 유지하도록 보장합니다. 그럼에도 불구하고, 워크플로우는 데이터 품질과 시퀀싱 깊이에 따라 달라지며, 극심한 희소성이나 배치 효과가 있는 데이터셋의 경우 조정이 필요할 수 있습니다.

이 프로토콜은 R과 단일 셀 분석에 기본적인 숙련도를 가진 중급에서 고급 사용자를 위해 설계되었으며, 구조적이고 단계별 구현과 완전 재현 가능한 출력을 통해 동기 부여된 초보자에게도 접근성을 유지합니다. 워크플로우는 각 단계에서 품질 관리 요약, 군집화 결과, 차별 표현 결과, 풍부 분석 등 표준화된 표와 그림을 생성하여 투명성, 검증, 그리고 협업 또는 다중 연구 맥락에서의 재사용을 촉진합니다. 이 프로토콜은 감염 및 면역학 연구에서 시간대나 조건에 따른 면역 이질성을 조사하는 연구에 특히 적합합니다.

이 방법은 말라리아 재감염 시점에 걸쳐 CD4⁺ T세포 scRNA-seq 분석을 위한 재현 가능하고 종단 간 Seurat 기반 워크플로우를 제공합니다. 적응적 품질 관리, 분산 안정화, 차원 축소, 군집화, 적절 시 다중 표본 통합을 포함합니다13,15. 생물학적 해석 가능성을 높이기 위해, 워크플로우는 면역 및 CD4⁺ T세포 하위 집합 유전자 모듈 점수 채점을 통합하여 Th1, Tfh, Tr1, Treg, 중추 기억, 효과기 기억, 증식, 세포독성, 피로16, 17, 18 등 기능적 프로그램을 정량화합니다. 유전자 온톨로지 및 KEGG 데이터베이스를 이용한 보완적 클러스터 마커 식별, 시간대 차별 발현 분석, 경로 풍부화 기능이 포함되어 T세포 상태의 견고한 주석 및 비교를 지원합니다19,20. 이 프로토콜은 공개된 Plasmodium scRNA-seq 데이터셋을 사용해 입증되었지만, 재현 가능하고 해석 가능한 CD4⁺ T 세포 분석이 필요한 다른 말라리아 재감염 모델과 면역학적 교란에도 폭넓게 적용 가능합니다. 전반적으로 이 프로토콜은 CD4⁺ T 세포 반응의 단일 세포 분석을 위한 재현 가능하고 생물학적으로 해석 가능한 틀을 제공하며, 말라리아 및 관련 시스템의 면역 역학을 견고하게 연구할 수 있도록 지원합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

윤리 진술:

이 연구에 사용된 모든 데이터는 공개된 데이터셋(GSE233703 및 GSE233713)에서 수집되었습니다. 원래 연구들은 동물 실험에 대한 제도적·윤리적 지침을 준수했습니다. 이 연구는 유전자 발현 옴니버스(GEO) 저장소(GSE233703 및 GSE233713)에서 얻은 공개 및 식별 해제된 단일 세포 RNA 시퀀싱 데이터셋에 대한 2차 생물정보학 분석을 포함했습니다. 이 연구에는 새로운 인간 참가자, 임상 샘플 또는 식별 가능한 환자 정보가 포함되지 않았습니다. 공개된 익명 데이터셋을 포함한 연구를 위한 기관 및 국가 지침에 따르면, 이 생물정보학 분석에 대해 추가적인 윤리적 승인과 사전 동의가 필요하지 않았습니다. 이 데이터셋과 관련된 원래 연구들은 관련 기관 윤리 기준과 생의학 연구에 적용되는 지침에 따라 수행되었습니다.

1. GSE233703 및 GSE233713를 위한 재현 가능한 수라 기반 CD4⁺ T세포 scRNA-seq 분석 워크플로우

참고: 이 워크플로우는 보조 파일 S1로 제공됩니다. 또한 전체 워크플로우를 개괄하는 회로도 (그림 1)도 참고하세요.

  1. 프로토콜을 시작하기 전에 범위와 의도된 사용자를 정의하세요
  2. 의도된 사용자를 정의하세요
    1. 사용자가 R과 단세포 RNA 시퀀싱(scRNA-seq) 분석에 중급에서 고급 수준으로 익숙한 경우 이 프로토콜을 사용하세요.
    2. 이 워크플로우를 10배 매트릭스 형식으로 생성된 쥐 비장 CD4⁺ T세포 데이터셋에 적용하세요. 단계별 구조와 예상 출력을 사용해 각 단계를 검증한 후 진행하세요.
      참고: 대규모 시퀀싱 데이터셋을 다룰 때는 적절한 데이터 처리 관행과 안전한 저장 방식을 반드시 확인하세요.
  3. scRNA-seq를 정의하세요
    1. 단일 세포 RNA 시퀀싱(scRNA-seq)을 개별 세포 내 유전자 발현을 정량하는 전사체 방법³¹로 취급합니다.
    2. scRNA-seq를 사용하여 복잡한 조직 내에서 이산 세포 상태, 전이 집단, 이질적인 면역 프로그램을 식별합니다.
  4. 소프트웨어 및 패키지 요구사항 준비
  5. 핵심 소프트웨어 설치
    1. R 4.2 이후에 설치하세요.
    2. RStudio 인터페이스를 열어보세요. setwd()를 사용해 작업 디렉터리를 설정하세요.
    3. source() 함수를 사용해 스크립트를 순차적으로 실행하세요. 프로젝트 노트에 R, RStudio, 운영체제의 정확한 버전을 기록하세요.
  6. R 패키지 설치
    1. 필요한 CRAN 패키지를 설치하세요: Seurat, Matrix, tidyverse, patchwork, pheatmap, RColorBrewer, cluster, glmGamPoi, ggplot2.
    2. 필요한 Bioconductor 패키지를 설치하세요: clusterProfiler, org. Mm.eg.db, enrichplot, 그리고 DESeq2.
    3. 필요 시 선택 패키지만 설치하세요: 더블릿 제거용 DoubletFinder, 궤적 분석을 위한 monocle3. 분석 세션 시작 시 필요한 모든 패키지를 불러오세요.
  7. 레코드 버전
    1. 워크플로우 종료 시 sessionInfo() 또는 이에 상응하는 함수를 사용해 패키지와 세션 정보를 저장하세요.
    2. R 버전, Seurat 버전, DESeq2 버전, clusterProfiler 버전 등 주요 분석 구성 요소를 원고에 명시적으로 보고하세요.
  8. 보조 파일 2에 언급된 예제 설치 명령을 실행하세요
  9. 하드웨어 및 저장 장치 요구 사항 확인
  10. 최소 자원 확인
    1. 수천에서 수만 셀이 포함된 데이터셋을 일상적으로 분석할 때는 최소 16GB RAM, 4개의 CPU 코어, 20GB 여유 디스크 공간을 갖춘 워크스테이션을 사용하세요.
  11. 추천 자료를 확인하세요
    1. 통합 분석, 반복 플롯팅 또는 선택적 더블릿 검출을 위해 32GB 이상의 RAM을 사용하세요.
    2. 큰 객체나 통합 데이터셋에서 메모리 관련 오류가 발생하면 future.globals.maxSize를 증가시킵니다.
    3. 예제 메모리 설정 적용
  12. 보조 파일 2에 언급된 메모리 옵션을 설정하기 위해 다음 명령어를 실행하세요

2. 프로젝트 구조 작성

  1. 루트 프로젝트 디렉터리를 생성하세요
    1. 분석을 위한 프로젝트 디렉터리를 만드세요.
    2. 데이터/, 스크립트/, results_spleen_cd4/이라는 하위 디렉터리를 만듭니다.
  2. 표준화된 출력 구조 사용
    1. 워크플로우가 출력을 다음 디렉터리에 기록하는지 확인하세요:
      results_spleen_cd4/GSE233703/fig/
      results_spleen_cd4/GSE233703/테이블/
      results_spleen_cd4/GSE233703/rds/
      results_spleen_cd4/GSE233713/fig/
      results_spleen_cd4/GSE233713/표/
      results_spleen_cd4/GSE233713/rds/
      results_spleen_cd4/post_markers/
  3. 일관된 파일 이름 사용하세요
    1. GEO 입력 파일의 이름을 스크립트가 예상하는 경로에 맞게 변경하세요.
    2. 다음과 같은 정확한 파일 이름을 사용하세요:
      데이터/GSE233703_matrix.mtx.gz
      데이터/GSE233703_genes.tsv.gz
      데이터/GSE233703_barcodes.tsv.gz
      데이터/GSE233713_d27_3_matrix.mtx.gz
      데이터/GSE233713_d27_3_features.tsv.gz
      데이터/GSE233713_d27_3_barcodes.tsv.gz
      데이터/GSE233713_d30_matrix.mtx.gz
      데이터/GSE233713_d30_features.tsv.gz
      데이터/GSE233713_d30_barcodes.tsv.gz
    3. 선택적 메타데이터 파일 명칭은 다음과 같습니다:
      데이터/GSE233703_cell_metadata.csv
      데이터/GSE233713_cell_metadata.csv
  4. 메타데이터 요구사항 확인
    1. 모든 메타데이터 파일에 바코드 열이 포함되어 있는지 확인하세요. 샘플, 타임포인트, 복제와 같은 선택적 열을 추가할 수 있습니다.
    2. 메타데이터 간 정확한 바코드 매칭과 행렬 수를 계산하세요.
      주의: 가져오기를 시작하기 전에 예상 경로에 매트릭스 트리플렛과 메타데이터 파일이 존재하는지 반드시 확인하세요.

3. 임포트 카운트 매트릭스 및 입력 무결성 검증

  1. 10배 스타일 행렬 읽기
    1. 각 matrix.mtx.gz 파일을 희소 행렬로 읽으세요.
    2. 해당 특징(또는 유전자) 파일과 바코드 파일을 탭으로 구분한 표로 읽으세요.
    3. 유전자 심볼을 행렬 행에 할당할 수 있는 특징 파일의 두 번째 열을 사용하세요. make.unique()를 사용하여 고유 유전자 심볼을 강제합니다.
    4. 매트릭스 컬럼에 바코드 식별자를 할당하세요.'
  2. 예제 가져오기 함수 실행하세요
    1. 보조 파일 2에 언급된 코드를 실행하여 매트릭스를 가져오고 식별자를 할당합니다.
  3. 행렬 무결성 검증
    1. 행렬 행의 수가 특징의 수와 같은지 확인하세요. 행렬 열의 수가 바코드 수와 같은지 확인하세요.
    2. 불일치가 감지되면 워크플로우를 중단하세요.
      참고: 일치하지 않는 부분이 감지되면 파일 무결성을 확인하고 특징 및 바코드 파일의 올바른 정렬을 확인한 후 단계를 재실행하세요.
      체크포인트: 행 수가 특징과 일치하고 열 수가 바코드와 일치할 때만 진행할 수 있습니다.

4. 마커 및 모듈 패널 정의

  1. 말라리아 관련 CD4⁺ T세포 패널을 정의하세요
    1. Th1, Tfh, Tr1, Treg, Tcm, Tem, 소진, 증식, 세포독성, Activation_early, Interferon_response, Immune_regulation에 대한 명명 유전자 패널을 정의하세요
    2. 이 패널들을 이름 붙인 R 리스트에 저장하여 하위 모듈 점수 채용으로 사용하세요.
  2. 보조 파일 2에 언급된 R 코드를 실행하여 유전자 패널을 정의하세요.
  3. 마커 검증 유전자를 정의하세요
    1. Foxp3, Bcl6, Cxcr5, Il21, Ifng, Ctla4, Pdcd1, Lag3, Tbx21, Tcf7, Lef1과 같은 정준 마커 유전자를 포함하는 별도의 검증 패널을 정의합니다.

5. Seurat 객체 생성 및 품질 관리 지표 계산

  1. Seurat 객체 초기화
    1. 각 데이터셋별로 min.cells = 3, min.features = 0을 사용하여 Seurat 객체를 생성합니다. 임의의 기능 컷오프를 임의로 부과하지 마세요.
    2. 데이터셋, 샘플, 타임포인트 메타데이터를 추가하세요. 바코드 매칭을 이용해 선택적 메타데이터를 병합하세요.
  2. 실행: Seurat 객체 초기화 예제
    1. 보조 파일 2에 언급된 R 코드를 실행하여 Seurat 객체를 만들고 메타데이터를 할당합니다.
  3. 품질 관리 지표 계산
    1. 마우스 접두사 ^mt-를 사용하여 미토콘드리아 전사체 분율을 계산합니다.
    2. 다음 지표들을 정량화하세요
      nFeature_RNA
      nCount_RNA
      percent.mt
  4. 보조 파일 2에 언급된 예제 코드를 실행하세요.
  5. 사전 필터 품질 관리를 시각화하세요
    1. nFeature_RNA, nCount_RNA, percent.mt 중 바이올린 플롯을 생성하세요. nCount_RNA 대 nFeature_RNA, nCount_RNA 대 percent.mt 에 대한 특징 산점도를 생성하세요.
    2. QC_pre_filter_AllCells_vln.png, QC_pre_filter_AllCells_scatter.png와 같은 표준화된 명칭으로 프리필터 수치를 저장하세요.
      주의: 낮은 품질의 꼬리와 높은 개수 이상치가 가능한 광범위한 사전 필터 분포를 예상하세요.

6. 적응 QC 임계값을 도출하고 저품질 셀을 필터링합니다

  1. 데이터셋별 임계값 도출
    1. 로그 변환 nFeature_RNA + 1 및 nCount_RNA + 1. 두 변환 변수의 중앙값과 중앙값 절대 편차(MAD)를 계산합니다.
    2. 다음 임계값을 정의하세요:
      min_features = 10^(중앙값 - 3 × MAD) - 1
      max_features = 10^(중앙값 + 3 × MAD) - 1
      min_counts = 10^(중앙값 - 3 × MAD) - 1
      max_counts = 10^(중앙값 + 3 × MAD) – 1
    3. 미토콘드리아 임계값을 percent.mt 의 95번째 백분위수에 3× MAD를 더한 값으로 정의하며, 5%에서 20% 사이에 제한됩니다.
    4. 함수를 실행하기 전에 dataset_id, sample_id, out_dir가 올바르게 지정되었는지 확인하세요.
      qc_thr <- derive_qc_thresholds(seu, dataset_id = "GSE233703", sample_id = "AllCells", out_dir = "results_spleen_cd4/GSE233703")
  2. 필터링 적용
    1. 모든 적응 기준을 충족하는 세포를 유지하세요:
      nFeature_RNA >= min_features
      nFeature_RNA <= max_features
      nCount_RNA >= min_counts
      nCount_RNA <= max_counts
      percent.mt <= max_percent_mt
    2. 보조 파일 2에 언급된 예제 코드를 실행하세요.
  3. 저장 필터링 출력
    1. QC_thresholds_*.csv cell_counts_summary_*.csv 저장하세요.
      일시정지: 필요하다면 중간 출력과 분석을 이 단계에서 저장하세요.
    2. 필터 후 QC 바이올린과 산점도를 생성하고 저장하세요.
      체크포인트: 필터 후 분포가 더 좁아지고, 복잡도가 낮은 셀이 제거되며, 극단적인 이상치가 줄어듭니다.

7. 데이터를 정규화하고 PCA 수행

  1. 정규화 및 분산 안정화
    1. 세포 주기 점수 산정 전에 RNA 분석법을 정규화하세요. 활성화된 셀 사이클 점수 계산을 실행하세요. 분산 안정화를 위해 SCTransform()을 사용하세요.
    2. 미토콘드리아 함량은 생물학적으로 정당화되고 명시적으로 허용될 때만 퇴행하세요.
    3. 연구 설계에 필요한 경우에만 회귀 세포 주기 점수를 적용합니다.
  2. 보조 파일 2에 언급된 정규화 예제를 실행하세요.
  3. 매개변수 값을 정의하세요
    1. n_variable_features = 3000을 사용하세요.
    2. dims_max_for_pca = 50을 사용하세요.
    3. 이 값들을 원고에 명확히 명시하세요.
  4. PCA를 실행하고 주성분을 선택하세요
    1. 정규화된 분석에 대해 PCA를 실행하세요. 분산 설명 및 주성분 부하를 검사하여 성공적인 PCA 실행을 확인한다.
    2. 각 주성분에 의해 설명되는 분산을 계산합니다.
  5. 세 가지 기준을 모두 사용하여 PC를 선택합니다:
    1. 최소 1% 이상의 분산을 설명하는 PC를 유지하세요,
    2. 누적 분산이 약 80%에 도달하도록 하세요.
    3. 최종 선발 인원은 10명에서 40명 사이로 제한하세요.
    4. PCA_variance_table_*.csv, PCA_selection_rationale_*.csv, PCA_Elbow_*.png 저장하세요.
  6. PCA 예제를 실행하세요
    1. 보조 파일 2에 언급된 예시입니다.
      체크포인트: 선택한 컷오프 이후 한계 분산 이득이 눈에 띄게 감소하는 엘보우 플롯을 예상하세요.

8. 이웃을 구성하고, 해상도를 선택하며, 셀을 클러스터링한다.

  1. 그래프 구조 구축
    1. 선택한 PC들을 사용해 공유된 최근접 이웃 그래프를 구성합니다.
    2. 더블렛 검출에 클러스터 라벨이 필요하다면, 초기 저해상도 클러스터링을 실행하세요.
  2. 선택적으로 더블릿을 제거하세요
    1. DoubletFinder는 설치되어 있고 호환되는 경우에만 실행하세요.
      참고: 다중항 아티팩트가 예상되는 높은 셀 수가 있는 데이터셋에만 더블릿 검출을 수행하세요.
    2. 더블렛 제거 후 정규화와 PCA를 재계산합니다.
  3. 클러스터링 해상도를 선택합니다
    1. 해상도 0.2, 0.4, 0.6, 0.8, 1.0, 1.2.8.3.2를 평가하세요
    2. 각 테스트된 해상도마다 평균 실루엣 너비를 계산합니다. 최소 두 개의 클러스터를 가진 해의 중 실루엣 점수가 가장 높은 해상도를 선택하세요.
    3. resolution_sweep_*.csv, resolution_selection_rationale_*.csv, resolution_sweep_*.png을 저장하세요.
  4. 보조 파일 2에 언급된 코드를 실행하여 예제 해상도 선택을 실행하세요
  5. UMAP 실행과 최종 클러스터링을 실행하세요.
    1. 선택한 PC로 UMAP을 실행하세요.
    2. 최근접 이웃 그래프를 다시 만드세요. 선택한 해상도로 셀을 클러스터링하세요.
    3. 클러스터별로 라벨링되고 샘플 또는 시간대별로 그룹화된 UMAP 플롯을 저장하세요. 보조 파일 2에 언급된 다음 코드를 실행하세요.
      주의: 안정적인 클러스터 분리와 주요 면역 상태와 일치하는 해석 가능한 UMAP 구조를 기대하세요.

9. SCT 기반 적분을 수행GSE233713

  1. 별도의 물건을 준비하세요
    1. D27_3와 D30을 위해 별도의 Seurat 객체를 만드세요.
    2. 각 샘플에 대해 품질 관리와 필터링을 독립적으로 적용하세요. 각 샘플을 SCTransform()으로 개별적으로 정규화합니다.
  2. 통합을 정당화하세요
    1. SCT 기반 통합을 사용하여 시간 간 기술적 차이를 줄이면서 공유된 생물학적 구조를 보존하세요.
    2. 통합이 자동으로 유익하다고 가정하지 마세요. 명확히 검증하세요.
  3. 샘플 통합
    1. SelectIntegrationFeatures()를 사용하여 통합 기능을 선택합니다. PrepSCTIntegration()으로 객체를 준비하세요.
    2. FindIntegrationAnchors(normalization.method = "SCT")로 앵커를 찾으세요. IntegrateData(normalization.method = "SCT")와 데이터셋을 통합하세요.
  4. 보조 파일 2에 언급된 예제 통합 실행을 진행하세요
  5. 통합 검증
    1. 시간별로 그룹화된 사전 통합 및 통합 후 UMAP 플롯을 생성합니다. 시간 간 세포 혼합 개선을 성공적인 통합의 증거로 해석합니다.
    2. 이웃 혼합을 적분 전후로 계산합니다. 시간별로 군집 구성을 계산하고 쌓인 구성 플롯을 생성하세요.
    3. 다음 출력을 저장하세요:
      UMAP_preintegration_*
      UMAP_postintegration_*
      integration_diagnostics_*
      cluster_timepoint_composition_*
      주의: 통합 후 시간대 분리가 감소하고, 이웃 혼합이 증가하며, 생물학적으로 의미 있는 구조를 완전히 잃지 않고도 대부분의 클러스터에서 다중 시간점에 기여할 것으로 예상해야 합니다.

10. 클러스터에 주석을 달고 마커 구조를 검증합니다

  1. 말라리아 관련 모듈 점수
    1. 미리 정의된 말라리아 CD4⁺ T세포 패널에 대해 AddModuleScore()를 실행하세요.
    2. 클러스터 수준의 모듈 평균과 모듈 순위를 저장하세요.
  2. 보조 파일 2에 언급된 모듈 점수 예제를 실행해 보세요
  3. 예측된 군집 라벨을 할당합니다
    1. 각 클러스터에 가장 높은 순위의 모듈을 예측 라벨로 할당합니다.
    2. 저장:
      cluster_module_score_means_*
      cluster_module_score_rankings_*
      cluster_predicted_labels_*
  4. 정준 마커로 클러스터를 검증합니다
    1. 정규 마커 패널을 사용하여 마커 검증 닷플롯과 특징도표를 실행하세요.
    2. 저장:
      DotPlot_marker_validation_*
      FeaturePlot_marker_validation_*
      주의: 기능 상태당 여러 정식 유전자가 일치하는 발현을 예상하며, 단일 유전자 신호는 분리되지 않습니다.

11. 표지를 식별하고 차별식을 수행한다.

  1. 클러스터 마커 찾기
    1. FindAllMarkers()를 긍정적인 마커만 사용해 실행하세요.
    2. markers_all_clusters_*.csv 구해.
  2. 보조 파일에 언급된 코드를 실행하여 예시 마커 식별을 실행하세요
  3. 가능할 경우 복제 인식 미분식을 사용하세요
    1. 유효한 복제 메타데이터가 있는지 확인하세요. 복제가 가능하다면 복제와 조건별 집계 수를 설정하고 DESeq2와 함께 의사 대량 DE를 실행합니다.
    2. DE_pseudobulk_*를 구하세요.
  4. 복제가 없을 때는 탐색적 세포 수준 차별 발현을 사용하세요
    1. 복제 메타데이터가 없거나 부족할 경우, 탐색적 분석으로 단일 셀 DE를 실행하세요.
    2. 탐색 상태를 문서화하려면 DE_WARNING_* 저장하세요. 탐색 결과를 DE_exploratory_celllevel_*로 저장하세요.
  5. 전역 미분 표현 출력 생성
    1. DE 결과를 위해 화산 플롯을 만들고 Volcano_*를 저장하세요.
    2. 중요한 DE 결과는 필터링된 테이블로 저장하세요.
  6. 기능 풍부 출력 생성
    1. GO 생물학적 공정 강화를 실행하면 GO_BP_**를 절약하세요. KEGG 인리트리크먼트를 실행하면 KEGG_*를 절약하세요.
    2. 랭크된 log2 폴드 체인지로 GSEA를 실행하고 GSEA_GO_*를 저장하세요. 해당 바플롯과 점플롯을 저장하세요.
  7. 클러스터별 차별 표현 출력 생성
    1. 각 클러스터 내에서 시간 지점 사이에 DE를 실행하세요.
    2. DE_cluster_*와 DE_cluster_specific_combined_*를 저장하세요.
  8. 면역 중심 차별 발현 출력 생성
    1. Ifng, Cxcl10, Ctla4, Il10, Foxp3, Bcl6, Cxcr5, Pdcd1, Lag3, Havcr2, Il21, Tbx21 등 선택된 면역 유전자에 대한 DE 결과를 추출합니다.
    2. DE_immune_focus_*를 구해주세요.
    3. 다음 출력을 생성하고 저장하세요:
      DotPlot_selected_genes_by_timepoint_*
      Heatmap_immune_focus_*
      주의: 전 지구 DE, 농축 산출, 클러스터별 DE, 면역 중심 시그니처 간의 일관성을 기대합니다.

12. 최종 출력 저장 및 세션 아카이브

  1. 세우라 객체 저장
    1. 각 데이터셋에 대해 최종 Seurat 객체를 .rds 형식으로 저장하세요.
  2. 세션 정보 저장
    1. 출력 디렉터리의 텍스트 파일에 sessionInfo()를 작성합니다.
  3. 보조 파일 2에 언급된 코드를 실행하여 예제 세션 내보내기를 실행하세요
  4. 출력 완전성 검증
    1. 예상되는 fig/, tables/, rds/ 디렉터리에 해당 파일이 포함되어 있는지 확인하세요.
    2. 스크립트, 세션 정보, 출력물을 함께 보관하세요.
      주의: QC 요약, PCA 출력, 해상도 선택 출력, 통합 진단, 모듈 주석 파일 , DE 출력, 풍부 파일 등이 모두 내부적으로 일관되고 존재하기 전까지는 보고서 작성을 진행하지 마십시오.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

서열 분석 품질 및 세포 수준 품질 관리(항원 특이적(PcAS 반응성) TCR-형질전환 CD4⁺ T 세포(GSE233703))

프리필터 QC 분포(그림 2A)는 전사체의 복잡성이 이질적으로 나타났으며, 대부분의 세포는 유전자 및 UMI 수가 중간 정도였고, 소수의 일부 세포는 잠재적 다중유와 일치하는 높은 카운트 아웃라이어 프로필을 보였다. 산점도(그림 2B)는 nCount_RNA와 nFeature_RNA 사이에 강한 양의 상관관계를 보였으나, percent.mt 는 전체 개체수와 약하게 연관되어 있어 도서관 복잡성이 허용 가능하고 필터링 전 광범위한 세포 스트레스의 증거가 제한적임을 나타냈다.

임의의 필터링을 피하기 위해, 로그 변환...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

본 연구는 말라리아 재감염 시 CD4⁺ T세포 전사 역학을 분석하기 위한 표준화되고 재현 가능한 쇠라 기반 워크플로우를 제시합니다. 프로토콜은 적응형 품질 관리, 정규화, 차원 감소, 클러스터링, 데이터셋 통합, 마커 검증, 모듈 점수 부여, 차분표현 분석을 통합된 계산 프레임워크 내에 통합합니다. 이러한 분석 단계들은 항원 특이적 및 다클론 데이터셋13, 14, 15에서 생물학적으로 의미 있는 CD4⁺ T세포 상태를 재현 가능하게 했습니다.

대표적인 결과는 말라리아 재감염과 관련된 CD4⁺ T세포 프로그램, Th1 효과자, T 난포 보조자(Tfh), 조절적, 피로 연관, 증식성, 인터페론 반응성, 기억 유사 상태를 포함한 조정된 CD4⁺ T세포 프로그램...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

저자들은 공개할 것이 없습니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
자료 / 장비의 이름회사 / 출처카탈로그 번호코멘트 / 설명
10x Genomics–형식 카운트 행렬NCBI GEON/AMatrix Market 파일(matrix.mtx, features.tsv, barcodes.tsv)
clusterProfiler (R 패키지)BioconductorN/ARRID:SCR_016884; 기능 강화 분석(GO, KEGG)
enrichplot (R 패키지)BioconductorN/ARRID:SCR_017030; 강화 분석 결과 시각화
GEO 데이터셋 GSE233703NCBI 유전자 발현 오비터스GSE233703PcAS-특이적 TCR-형질주입 CD4+ T-세포 scRNA-seq 데이터셋
GEO 데이터셋 GSE233713NCBI 유전자 발현 오비터스GSE233713다클론 CD4+ T-세포 scRNA-seq 데이터셋(D273 vs D30)
GitHub(선택 사항)GitHub Inc.N/ARRID:SCR_002630; 버전 관리 및 재현성(선택 사항)
glmGamPoi (R 패키지)BioconductorN/ARRID:SCR_021001; 가속된 SCTransform 모델 피팅
Matrix (R 패키지)CRANN/ARRID:SCR_008389; scRNA-seq 데이터용 희소 행렬 처리
운영 체제Microsoft / Apple / LinuxN/AWindows 10+, macOS 또는 Linux 지원
org.Mm.eg.db (R 패키지)BioconductorN/ARRID:SCR_002643; 마우스 유전자 주석 데이터베이스
patchwork (R 패키지)CRANN/ARRID:SCR_018787; 다중 패널 그림 조립
PDF 뷰어무엇이든N/AQC 플롯, UMAP 및 히트맵 보기
개인용 컴퓨터 또는 워크스테이션무엇이든N/A통합을 위해 최소 16–32 GB RAM 권장
pheatmap (R 패키지)CRANN/ARRID:SCR_016418; 유전자 발현의 히트맵 시각화
R 통계 소프트웨어(버전 ≥ 4.2)R 통계 컴퓨팅 재단N/ARRID:SCR_001905; 핵심 계산 환경
RStudio 데스크톱Posit 소프트웨어N/ARRID:SCR_000432; R용 통합 개발 환경
Seurat (R 패키지, v4 이상)Satija 연구소N/ARRID:SCR_016341; 단일 세포 RNA-seq 분석
tidyverse (R 패키지 제품군)CRANN/ARRID:SCR_019186; 데이터 조작 및 시각화

참고문헌

  1. World Health Organization. WHO malaria policy advisory group (MPAG) meeting report, 18–20 April 2023. Geneva: World Health Organization; 2023.
  2. Stevenson MM, Riley EM. Innate immunity to malaria. Nat Rev Immunol. 2004;4(3):169-80.
  3. Langhorne J, Ndungu FM, Sponaas AM, Marsh K. Immunity to malaria: more questions than answers. Nat Immunol. 2008;9(7):725-32.
  4. Perez-Mazliah D, Langhorne J. CD4 T-cell subsets in malaria: TH1/TH2 revisited. Front Immunol. 2015;5:671.
  5. Illingworth J, et al. Chronic exposure to Plasmodium falciparum is associated with phenotypic evidence of B and T cell exhaustion. J Immunol. 2013;190(3):1038-47.
  6. Tang F, et al. mRNA-Seq whole-transcriptome analysis of a single cell. Nat Methods. 2009;6(5):377-82.
  7. Lönnberg T, et al. Single-cell RNA-seq and computational analysis using temporal mixture modeling resolves TH1/TFH fate bifurcation in malaria. Sci Immunol. 2017;2(9):eaal2192.
  8. Butler NS, et al. Therapeutic blockade of PD-L1 and LAG-3 rapidly clears established blood-stage Plasmodium infection. Nat Immunol. 2012;13(2):188-95.
  9. Soon MS, Haque A. Recent insights into CD4+ Th cell differentiation in malaria. J Immunol. 2018;200(6):1965-75.
  10. Slovin S, et al. Single-cell RNA sequencing analysis: a step-by-step overview. RNA Bioinformatics. 2021:343-65.
  11. Vieth B, Parekh S, Ziegenhain C, Enard W, Hellmann I. A systematic evaluation of single cell RNA-seq analysis pipelines. Nat Commun. 2019;10(1):4667.
  12. Wolf FA, Angerer P, Theis FJ. SCANPY: large-scale single-cell gene expression data analysis. Genome Biol. 2018;19(1):15.
  13. Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biol. 2019;20(1):296.
  14. Stuart T, et al. Comprehensive integration of single-cell data. Cell. 2019;177(7):1888-902.
  15. Satija R, Farrell JA, Gennert D, Schier AF, Regev A. Spatial reconstruction of single-cell gene expression data. Nat Biotechnol. 2015;33(5):495-502.
  16. Crotty S. T follicular helper cell differentiation, function, and roles in disease. Immunity. 2014;41(4):529-42.
  17. Wherry EJ, Kurachi M. Molecular and cellular insights into T cell exhaustion. Nat Rev Immunol. 2015;15(8):486-99.
  18. Belkaid Y, Rouse BT. Natural regulatory T cells in infectious disease. Nat Immunol. 2005;6(4):353-60.
  19. Ashburner M, et al. Gene ontology: tool for the unification of biology. Nat Genet. 2000;25(1):25-9.
  20. Kanehisa M, Goto S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Res. 2000;28(1):27-30.
  21. Gulati GS, et al. Profiling cell identity and tissue architecture with single-cell and spatial transcriptomics. Nat Rev Mol Cell Biol. 2025;26(1):11-31.
  22. Schofield L, Grau GE. Immunological processes in malaria pathogenesis. Nat Rev Immunol. 2005;5(9):722-35.
  23. Plebanski M, Hill AV. The immunology of malaria infection. Curr Opin Immunol. 2000;12(4):437-41.
  24. Crotty S. T follicular helper cell biology: a decade of discovery and diseases. Immunity. 2019;50(5):1132-48.
  25. Vinuesa CG, Linterman MA, Yu D, MacLennan IC. Follicular helper T cells. Annu Rev Immunol. 2016;34:335-68.
  26. Wherry EJ. T cell exhaustion. Nat Immunol. 2011;12(6):492-9.
  27. Maizels RM, Smith KA. Regulatory T cells in infection. Adv Immunol. 2011;112:73-136.
  28. Choudhary S, Satija R. Comparison and evaluation of statistical error models for scRNA-seq. Genome Biol. 2022;23(1):27.
  29. Li M, et al. Rediscovering publicly available single-cell data with the DISCO platform. Nucleic Acids Res. 2025;53(D1):D932-8.
  30. Islam MT, Xing L. Cartography of genomic interactions enables deep analysis of single-cell expression data. Nat Commun. 2023;14(1):679.
  31. Luecken MD, Theis FJ. Current best practices in single-cell RNA-seq analysis: a tutorial. Mol Syst Biol. 2019;15(6):e8746.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

태그

면역학 및 감염학제233호제233호빈 값scRNA-seqPBMC전사체 통합면역 모듈 점수 산정

이 논문이 게재되었습니다

동영상 곧 제공