Method Article

TCGA 데이터 및 단일 셀 데이터를 기반으로 한 분석 TRPM4 를 예로 들고

DOI:

10.3791/69304

December 5th, 2025

 ,  ,  ,  ,  ,  ,  ,  ,  , 

Corresponding Authors: Hualin Wang <841789075@qq.com>, Zhuang Zhu <ZhuZhuang2826@163.com>, Yuan Liu <a15066@njmu.edu.cn>, Yao Geng <gengyao19970821@163.com>

* These authors contributed equally

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

여기서는 전사체 분석과 단세포 분석을 바탕으로 101개의 머신러닝 알고리즘을 활용하여 방광암에서 단일 유전자의 역할을 철저히 분석하는 프로토콜을 제시합니다.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 논문에서는 공개된 전사체 데이터셋과 단세포 데이터셋을 기반으로 한 분석 방법을 소개하여, 종양 면역 미세환경 형성, 종양 분자 아형 형성, 종양 환자의 예후 예측 등 단일 유전자의 역할을 포괄적으로 기술할 수 있습니다. 동시에, 단일 유전자 데이터 도입은 단일 전사체 분석으로 인한 무작위성과 이질성을 피할 뿐만 아니라, 유전자가 발현되는 특정 세포 클러스터를 더 깊이 탐구하고, 경로 내에서 유전자가 어떤 역할을 하는지에 대한 추가 연구를 가능하게 합니다. 많은 연구자들이 단일 세포 분석에 능숙하지 않을 수 있음을 고려하여, 이 방법 논문에는 TISCH2(http://tisch.compbio.cn/)라는 온라인 웹사이트가 소개되어 모두가 단일 세포 분석을 완료할 수 있도록 돕습니다. 또한, 101가지 머신러닝 기법의 적용은 가장 정확한 예후 모델 구축에 필수적인 역할을 해왔습니다. 결론적으로, 생물정보학 분석, 머신러닝, 단세포 분석을 결합한 이 통합 단일 유전자 분석 방법은 단일 유전자의 종양 진행 기능 연구뿐만 아니라 경로 내 개별 유전자 기능 연구에도 필수적이고 중요한 역할을 할 수 있다고 믿어집니다.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

우리가 모두 알다시피, 방광암(BLCA)은 세계에서 가장 공격적이고 전이성 악성 종양 중 하나이며, 현재 방광암 바이오마커에는 부정확성 등 문제가 여전히 존재합니다. BLCA 환자의 예후를 확인하고 결과를 예측하기 위해 방광암 바이오마커 탐색과 예후 모델 구축이 매우 중요합니다. 사람들이 바이오마커에 대한 연구 방법을 개발했지만, 대부분의 방법은 현재 전사체학에 한정되어 있어 샘플 내 이질성을 불가피하게 만듭니다2. 더불어, 전사체학 데이터만으로는 서로 다른 세포 하위 집단의 역할이나 단일 세포 수준에서 다양한 경로에서 유전자의 기능을 조사하는 데 실패하는 경우가 많아 과거 연구가 덜 정밀하고 효과적이지 않게 만듭니다. 단세포 분석이 초보자에게 어려울 수 있음을 고려하여, 단세포 분석을 위한 온라인 플랫폼이 도입되어 빠르게 기술을 습득할 수 있도록 돕습니다. 마지막으로, 전사체 분석과 단세포 분석을 통해 단일 유전자가 적합한 바이오마커임이 밝혀졌더라도, 그 바이오마커가 모든 코호트에 적용 가능하다는 보장은 없으므로, 결론을 보다 보편적으로 적용할 수 있도록 바이오마커와 연관된 예후 모델을 구축하는 것이 필요합니다. 5. 101 머신러닝 알고리즘은 10가지 서로 다른 머신러닝 알고리즘을 조합하여 최적의 예후 모델을 식별하는 것을 의미합니다. 복잡한 데이터를 더 잘 처리하고 안정성을 보인 랜덤 포레스트, XGBoost, SVM과 같은 알고리즘의 포함으로 이 결합 알고리즘은 놀라운 안정성을 보여주었습니다. 이 예후 모델을 바이오마커와 더 정확하고 관련성 있게 만들기 위해, 먼저 모든 유전자와 바이오마커 간의 상관 분석을 수행한 후, 요구사항에 따라 약 20-30개의 유전자를 선택한 후 101 머신러닝 알고리즘을 사용해 예후 모델을 구축하고, 결과를 최종 확정하기 위한 일련의 분석을 거칩니다.

지난6년간 단순 전사체 분석으로 예측된 바이오마커와 비교하면, 단세포 및 전사체 분석의 바이오마커는 조직이나 샘플을 기본 세포 구성 요소로 편향되지 않고 분해할 수 있게 합니다. 이는 T 세포, B 세포, 대식세포 등 다양한 세포 유형의 명확한 분화와 새로운 하위 집단(예: 고갈된 T 세포 및 조절 T 세포)의 발견, 그리고 세포 분화 궤적과 같은 연속적인 동적 과정을 포착할 수 있게 합니다4. 과일과 우유를 따로 배열하는 것과 비슷하게, 각 성분과 그 양을 명확하게 시각화할 수 있게 해줍니다. 단일 코호트 Cox 모델7과 비교할 때, 101 머신러닝을 사용해 구축된 예후 모델은 데이터에서 변수들 간의 복잡하고 비선형적인 상호작용을 자동으로 학습할 수 있어 더 정확하고 과학적으로 타당합니다. 예를 들어, 특정 유전적 돌연변이의 영향은 특정 연령과 종양 크기의 환자에게만 유의미할 수 있습니다. 랜덤 포레스트나 신경망과 같은 머신러닝 모델은 수동 명세8 없이도 이러한 고차 상호작용을 자동으로 포착할 수 있습니다. 분석에 사용되는 데이터셋이 대부분의 유전자를 포함해야 하는 신호 핵심 적용 제약 조건은 유전자 수가 너무 적지 않고, 예후 모델 구축에 사용되는 유전자 수가 너무 높지 않아 일반적으로 20-30 정도로 유지되어야 하며, 이것이 최적이다. 단일 세포 세트의 품질 관리 기준은 1000 이상이어야 하며, 세포당 UMI 수는 1000 이상이어야 하며, 세포당 유전자 수는 500 9보다 커야 합니다.

여기서는 공개 전사체 데이터셋과 단일 세포 데이터셋에서 새로운 바이오마커를 식별하는 단계별 접근법을 제시하며, BLCA에서 TRPM4 의 역할을 예로 들고 있습니다. 암 게놈 아틀라스-방광암(TCGA-BLCA) 데이터셋, 단세포 데이터셋 GSE145281, BLCA 데이터셋 GSE32894 및 GSE31684 등 다양한 연구 방법과 다양한 데이터셋이 사용되어 종양학에서 바이오마커의 정밀도와 적용성을 높이고 BLCA에서 TRPM4 연구를 진전시키고 있습니다. TCGA-BLCA 데이터셋은 캘리포니아 대학교 산타크루즈 제나(UCSC Xena) 웹사이트에서 수집되었습니다. GSE32894와 GSE31684은 유전자 발현 옴니버스(GEO)에서 다운로드되었으며, 단일 세포 데이터는 GSE145281 Tumor Immune Single-Cell Hub 2(TISCH2)에서 수집되었습니다. 또한, 관련 논문의 보조 스프레드시트 파일에서 BLCA 분자 아형과 처리 반응에 관한 데이터를 추출하였습니다. 이후 생물정보학 분석, 단세포 분석, 머신러닝을 수행하여 통합된 단일 유전자 연구 방법론을 확립합니다.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

참고: 이 글에서 사용된 모든 코드는 https://github.com/YaoGeng-nmu/Analysis-of-TRPM4-based-on-TCGA-data-and-single-cell-data-in-BLCA/blob/main/code 웹사이트에서 확인할 수 있습니다.

1. 전사체학 데이터 준비

  1. TCGA-BLCA 데이터셋 준비
    1. UCSC Xena (https://xenabrowser.net/datapages/)10 웹사이트에서 모든 TCGA 데이터셋을 다운로드하세요. 다운로드된 데이터셋은 사전 처리되어 유전자 주석11과 같은 추가 작업이 필요 없습니다.
    2. TCGA 데이터셋을 선택한 후 TCGA-BLCA 데이터셋t를 클릭하세요. 그 후 TCGA-BLCA 데이터셋 페이지로 이동하여 Gene Expression RNA-seq를 클릭하고, TCGA-BLCA 데이터셋에서 임상 데이터와 유전자 발현 프로필을 다운로드하세요. 이 데이터셋에는 400명의 BLCA 환자의 mRNA 발현 데이터가 포함되어야 합니다.
    3. 종양 샘플과 인접한 정상 조직 샘플을 구분하기 위해, 01과 11이 끝인 샘플은 종양 샘플을, 11이 있는 샘플은 암 인접 조직(정상 샘플)을 나타내기 위해 분리합니다.
  2. GSE32894 및 GSE31684 준비
    1. GEO 웹사이트(https://www.ncbi.nlm.nih.gov)를 클릭하여 BLCA 데이터셋 GSE32894과 GSE3168412,13을 다운로드하세요.
    2. 오른쪽 상단의 해당 항목 들을 클릭한 후, 데이터셋 GSE32894와 GSE31684 페이지로 이동하세요.
    3. 다음으로, 해당 mRNA 데이터, 임상 데이터, 생존 데이터를 다운로드하여 GSE32894. GSE32894 데이터셋의 http 버튼을 클릭하세요. 또한, 플랫폼 버튼을 통해 GPL6947 플랫폼 데이터를 다운로드하세요. GSE32894 mRNA 데이터, 임상 데이터, 생존 데이터를 다운로드할 때 GSE32894_series_matrix.txt.gz 버튼을 클릭한 후 시리즈 매트릭스 파일 버튼을 클릭해 GSE32894 다운로드하세요.
    4. 해당 mRNA 데이터, 임상 데이터, 생존 데이터를 다운로드하여 GSE31684. GSE31684 데이터셋의 http 버튼을 클릭하세요. 또한 플랫폼 버튼을 통해 GPL570 플랫폼 데이터를 다운로드하세요. GSE31684 mRNA 데이터, 임상 데이터, 생존 데이터를 다운로드할 때 GSE31684_series_matrix.txt.gz 버튼을 클릭한 후 시리즈 매트릭스 파일 버튼을 클릭하고 GSE31684를 다운로드하세요.
    5. 필터링 단계에서 발현 수준이 0이거나 0에 가까운 무의미한 유전자를 제거합니다. 배치 교정을 위해 sva 패키지14를 기반으로 한 ComBat 방법을 사용하세요.

2. 단세포 분석 준비

  1. GSE145281 준비
    1. 단일 세포 수준에서 연구를 수행하려면 전사체 데이터만으로는 어떤 세포 클러스터가 TRPM4 를 가장 유의미하게 발현하는지 판단하기에 불충분함을 고려하여 BLCA 단일 세포 데이터셋을 찾아야 합니다.
    2. 여기, 단일 세포 종양 분석을 위한 온라인 웹사이트인 TISCH2(http://tisch.compbio.cn/)로 가보세요.
    3. 실험적 필요에 따라 필요한 암 유형을 선택하며, 이 경우 BLCA를 예로 들었습니다.
    4. BLCA 버튼을 클릭하여 GSE145281이라는 데이터셋을 선택하세요.

3. BLCA의 분자 아형 및 치료 선택 데이터에 대한 반응 준비

  1. 여기서 언급된 기사에서 BLCA의 분자 아형과 치료 선택에 대한 반응 데이터를 다운로드하세요.
  2. PubMed 웹사이트를 열어보세요 (https://pubmed.ncbi.nlm.nih.gov/). 기사를 검색하고 보조 표를 클릭하세요. 이 압축 파일 패키지에는 총 18개의 파일이 포함되어 있습니다.

4. TRPM4의 BLCA 면역 미세환경 분석

  1. 서로 다른 TRPM4 그룹에서 133개의 면역조절제 발현을 나타내는 열맵 플롯
    1. TRPM4의 표현에 따라 모든 BLCA 샘플을 고TRPM4군과 저TRPM4군으로 나눕니다.
    2. 모든 샘플 이름과 TRPM4 발현 데이터를 따로 복사한 후, TRPM4 발현의 내림차순으로 정렬하고, 샘플의 전반부는 그룹 열에서 고-TRPM4 그룹으로, 후반부는 TRPM4 표현에 따라 저-TRPM4 그룹으로 분류합니다. 모든 TCGA-BLCA 환자 ID는 보충표 1에 기재되어 있습니다.
    3. 전사체 데이터 분석에 필요한 R 패키지를 설치하세요. 제공된 코드를 약간 수정한 뒤, 파일 위치를 변경한 후 코드를 실행하세요. 유전자 ID와 면역조절제의 ID가 올바르게 일치하는지 신중히 확인하며, 유전자 ID 뒤에 빈틈이나 눈에 띄지 않는 요인이 없는지 확인하세요. 이것이 히트맵 생성 실패의 주요 원인입니다.
  2. ESTIMATE R 패키지를 이용한 종양 샘플의 기질 및 면역학적 분석
    1. 전사체 데이터 분석에 필요한 모든 R 패키지가 설치되어 있는지 확인하세요. 코드 요구사항에 따라 필요한 데이터의 이름을 해당 이름으로 지정한 후 실행 버튼을 클릭하세요.
      참고: 이 웹사이트는 온라인 분석 기능도 제공한다는 점을 기억하는 것이 중요합니다. 웹사이트(https://bioinformatics.mdanderson.org/estimate/rpackage.html)를 방문해 원하는 결과를 얻을 수 있지만, 이 방법은 스스로 수집한 데이터를 분석하는 데 적합하지 않습니다.
    2. 질병 버튼을 클릭하고 방광 비상피암 옵션을 선택하세요. 그 다음 RNA-seq-V2 플랫폼 버튼을 선택하세요. 모든 샘플의 기질 점수, 면역 점수, 추정 점수를 다운로드하세요.
  3. 서로 다른 TRPM4 그룹 간 발현의 바이올린 플롯
    1. 전사체 데이터 분석에 필요한 모든 R 패키지를 설치하세요. 필요한 모든 R 패키지는 보충 표 2에 나열되어 있습니다. 코드 요구사항에 따라 필요한 데이터의 이름을 해당 이름으로 지정한 후 실행 버튼을 클릭하세요.
    2. 유전자 ID가 올바르게 입력되었는지 신중히 확인하며, 유전자 ID 끝에 빈칸이나 눈에 띄지 않는 요소가 없는지 확인하세요. 이것이 바이올린 플롯 작성 실패의 주요 원인입니다.
  4. 서로 다른 TRPM4 그룹 간의 삼각형 히트맵 플롯
    1. 전사체 데이터 분석에 필요한 모든 R 패키지를 설치하세요. TIGIT 과 CD80 같은 여러 면역 검사점 유전자의 발현 데이터를 반드시 준비하세요. TCGA-BLCA 전사체 데이터를 열고 면역 체크포인트 유전자 수가 많지 않은 상황에서 각 항목을 개별적으로 검색하세요.
    2. 코드 요구사항에 따라 필요한 데이터의 이름을 해당 이름으로 지정한 후 실행 버튼을 클릭하세요.
  5. 서로 다른 유전자와 TRPM4 간의 상관도
    1. 전사체 데이터 분석에 필요한 모든 R 패키지를 설치하세요. 첫 번째 유전자로 TRPM4 를 채우고, 연구 중인 유전자를 두 번째 유전자인 CD3E 로 추가하세요.
    2. Run 버튼을 클릭한 후에는 CTLA4와 같이 분석이 필요한 다른 유전자로 CD3E를 변경하세요.

5. GSE145281 데이터셋에서 TRPM4 의 단일 셀 분석

  1. 단일 세포 분석을 이용한 BLCA GSE145281 데이터셋 분석
    1. 웹사이트에 접속해 BLCA를 클릭하세요. 단세포 분석은 전사체 분석과 비교해 어떤 세포 클러스터가 TRPM4 발현이 높은지 더 심층적으로 탐구할 수 있게 해줍니다. 단일 세포 분석 데이터가 GSE130001에서 수집되었는지, 데이터셋당 세포 수가 1000 이상이어야 하고, 세포당 UMI 수가 1000 이상이어야 하며, 세포당 유전자 수가 500 이상이어야 하는지 품질 관리 기준과 비교해 확인하세요. 각 클러스터의 차등 발현 유전자는 로그 변환 접힘 변화(|logFC| >= 0.25)를 기반으로 식별되며, 클러스터링 해상도는 0.5여야 합니다.
  2. 서로 다른 셀 클러스터에 대한 셀 주석
    1. 모든 셀 클러스터에 주석이 달려 있는지 확인하세요. 예를 들어, B 세포는 CD19, MS4A1, CD27, IGHD, IGHM, TCL1A, FCRL5로 주석을 줄 수 있습니다. 세포 주석에 사용되는 모든 유전자는 보충표 3에서 확인할 수 있습니다.
    2. 그다음 GSE145281 선택하고 TRPM4의 모든 결과를 다운로드하세요. 전체 버튼을 클릭하여 다양한 클러스터와 세포 유형의 GSE145281 UMAP 플롯을 다운로드하세요.
    3. 유전자 버튼을 클릭하고 분석할 단일 유전자를 선택하세요. GSEA 버튼을 클릭하여 KEGG 경로와 Hallmark 경로16, 17 등 다양한 경로에서 이 단일 유전자의 기능을 관찰하세요.
    4. CCI 버튼을 클릭하면 단일 유전자를 고도로 발현한 클러스터의 세포 채팅 플롯과 세포 채팅 버블 플롯을 찾을 수 있습니다.
    5. 각 클러스터의 강화된 전사체 인자를 보려면 TF 풍부 버튼을 클릭하세요.

6. 101 TRPM4와 관련된 예후 모델 구축을 위한 머신러닝

  1. 전사체 데이터 분석에 필요한 모든 R 패키지를 설치하세요. 단일 머신러닝 접근법이 항상 예후 예측에 최적의 방법은 아닐 수 있음을 고려할 때, 101가지 머신러닝 기법을 활용해 예후 모델을 구축할 수 있습니다. TCGA-BLCA 코호트와 GSE32894 및 GSE31684 코호트, TRPM4 간의 모든 유전자 간 상관관계 분석을 수행하라.
  2. TRPM4와 강하게 연관된 유전자 수를 기준으로, TRPM4와 상관관계가 0.6 이상이거나 -0.6 이하인 모든 유전자를 선택합니다. 모든 코호트에서 TRPM4와 강하게 연관된 모든 유전자를 선택하라.
  3. GSE32894 및 GSE31684 코호트의 모든 데이터를 합쳐 검증 세트를 만들고 TCGA-BLCA를 훈련 세트로 사용하세요.
  4. 코드 요구사항에 따라 필요한 데이터의 이름을 해당 이름으로 지정한 후 실행 버튼을 클릭하세요.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

전사체학을 이용해 개별 유전자의 면역 미세환경을 분석하는 핵심 이점은 개별 유전자와 유전자 발현 수준에서 면역 세포 및 분자와의 동적 상호작용 간의 직접적인 상관관계를 가능하게 하여 면역 특성을 직접 관찰하고 개별 유전자 발현이나 변화가 높거나 낮은 그룹 간 침투 세포 비율 차이를 식별할 수 있다는 점으로 잘 알려져 있습니다 면역 체크포인트 분자의 발현에18. 생물정보학 분석의 대표적인 결과는 면역 미세환경 및 바이올린 플롯 등과 같은 면역 분자 분석과 관련된 것입니다. 단일 세포 분석의 대표적인 결과는 각 세포 클러스터의 목표 유전자 발현 수준과 각 세포 클러스터의 경로 열맵 분석입니다. 101개의 머신러닝 모델의 대표적인 결과는 예후 모델을 구축하는 데 사용되는 알고리즘의 히트맵입니다.

우선, 히트맵 플롯은 133개의 면역조절자가 저TRPM4 그룹에서 더 많이 발현됨을 보여줍니다(그림 1A). ESTIMATE R 패키지의 계산에 따르면, 스트로말스코어, 면역 점수, 추정 점수가 모두 높은 TRPM4 그룹에서 낮다는 것이 명백하여, TRPM4 발현이 높은 샘플에서는 면역 침윤과 간질 침윤이 종종 부족함을 나타냅니다(그림 1B-D). 또한, 삼각상관 열맵은 TRPM4VTCN1, CD274, PDCD1, CTLA4, HAVCR2, TIGIT, IDO1, CD80, CD86, LAIR1, PVR, CD200R1, CD200, LGALS3, CEACAM1, BTLA, ADORA2A, KIR3DL1, KLRC1, CD276, CD47, KLRD1, LAG3 등 여러 면역 검사점과 음의 상관관계를 보인다는 것을 보여줍니다(그림 1E). 그러나 우리는 CTLA4, LAG3, HAVCR2, CD3E, TIGIT, PDCD1을 포함한 TRPM4와 T 세포 소진 유전자 간의 상관관계 플롯을 완성했습니다(그림 1F).

전사체학은 TRPM4TME 간의 연관성을 명확히 입증했지만, 이 수준에서의 분석으로는 이러한 표현형을 담당하는 세포 유형이나 아집단을 구분하지 못합니다. 면역 표현형의 세포적 기원을 정확히 밝히고 특정 면역 세포가 기능 변화를 겪었는지 명확히 하기 위해서는 단일 세포 전사체 분석이 필요합니다. 개별 세포의 유전자 발현 특성을 분석함으로써 면역 표현형을 특정 세포 하위 집단으로 정확히 추적할 수 있습니다. 또한, 방광암 면역세포의 단일 세포 데이터셋인 GSE145281가 도입되어 면역 세포 경로에서 TRPM4의 역할을 조사하고 있습니다. 14,462개의 면역 세포는 모두 17개의 클러스터로 나뉩니다(그림 2A). 14462개의 모든 세포는 B 세포, CD4 T 세포, CD8 T 세포, 단핵단세포, NK 세포로 나뉩니다(그림 2B). 총 14,462개의 면역 세포 중 8,465개는 단세포, 2,677개는 CD8 T, 1771개는 CD4 T세포, 566개는 B세포, 995개는 NK 세포입니다(그림 2C). 또한 TRPM4의 분포도 설명합니다(그림 2D). 결과는 TRPM4가 주로 단핵구에서 발현됨을 보여줍니다. 바이올린 플롯은 TRPM4가 주로 C1과 C2 클러스터에서 발현됨을 보여줍니다(그림 2E). 그림 2F의 결과도 이전 결과를 보여주었습니다. 또한 세포 채팅 분석 결과, 클러스터 C1은 클러스터 C0와 클러스터 C13과 연관되어 있고, 클러스터 C2는 클러스터 C0와 클러스터 C11과 가장 연관되어 있음을 알 수 있습니다(그림 2G-H). TRPM4의 역할도 Hallmark 유전자 집합 내에서 탐구되며, 히트맵을 통해 묘사됩니다. 히트맵 결과는 C1 클러스터가 주로 TNF-α 경로에 농축되어 있음을 보여줍니다. 이는 TRPM4가 TNF-α 경로를 통해 그 효과에 관여할 가능성이 있음을 시사합니다(그림 2I). C2 클러스터는 주로 외계 생물 대사 경로에 풍부하게 형성되어 있습니다.

단일 셀 시그니처 분석 결과, 위에서 언급한 두 채널이 TRPM4에 대해 분포되어 있음을 알 수 있습니다(그림 3A-B). 셀 채팅 버블 플롯은 C1과 C2 클러스터의 셀 채팅을 설명하는 데도 사용됩니다(그림 3C-D). 마지막으로 TF 농축 열맵 플롯을 생성합니다(그림 3E). 랭크 그래프는 SPI1이 각 세포 집단에서 유전자 발현을 조절하는 전사 인자일 수 있음을 시사합니다(그림 3F-G). 단세포 분석을 통해 세포 아집단이 TRPM4와 정확히 연관되어 있음을 규명하고, 이들이 질병 진행에 영향을 미치는 잠재적 메커니즘을 명확히 했습니다. 이러한 발견은 질병의 본질을 이해하는 데 탄탄한 이론적 기반을 제공하지만, 임상 의사결정을 직접적으로 안내할 수 있는 도구로 아직 전환되지 않았습니다. 이러한 통찰을 실천에 적용하기 위해서는 예후 모델을 구축하기 위해 머신러닝의 추가 통합이 필요합니다. 이는 TRPM4와 강한 상관관계를 가진 유전자에 대한 데이터를 수집하고, 궁극적으로 환자 생존을 신뢰성 있게 예측할 수 있는 모델을 개발하는 것을 포함합니다. TRPM4와 밀접하게 관련된 모든 유전자는 보충 표 4에 나열되어 있습니다. 마지막으로, BLCA 환자의 예후를 더 예측하기 위해 101개의 머신러닝 모델을 사용하여 모든 환자의 예후를 더 잘 설명합니다.

단일 데이터 소스에 의존함으로써 발생하는 무작위성과 부정확성을 피하기 위해, GSE32894와 GSE31684 같은 여러 BLCA 데이터셋을 활용합니다. 결과는 Coxboost+RSF가 BLCA 환자의 예후를 가장 잘 예측할 수 있으며, 이 예후 모델의 c-지수는 0.879에 이를 수 있음을 보여주었습니다(그림 4).

TRPM4 외에도 ESTIMATE R 패키지는 다양한 SDCBP 발현군 내 stromalscore, immunescore, ESTIMATEScore를 분석하는 데에도 적용되었습니다(보충 그림 1A-C). SDCBP와 면역 체크포인트 간의 삼각상관 히트맵도 작성되어 프로토콜 적응 방법을 보여줍니다(보충 그림 1D). qPCR 실험과 결과는 우리의 생물정보학 분석과 일치합니다. 인간 BLCA 세포주 T24와 정상 방광 세포주 SVHUC1을 사용하였다. 결과 그래프에서 보듯, TRPM4 발현이 높은 세포는 TRPM4 수치도 높게 나타납니다(보충 그림 2).

figure-results-1
그림 1: 종양 미세환경 형성을 위한 TRPM4 의 생물정보학 분석. (A) 서로 다른 TRPM4 그룹의 133개 면역조절제의 히트맵 플롯. (B-D) 다양한 TRPM4 그룹에서 스트로말스코어, 면역점수, 추정점수의 바이올린 플롯. p ≤ 0.0001. (E) TRPM4 와 면역 체크포인트 간의 삼각형 상관 열맵. (F) T 세포 소진 유전자와 TRPM4 간의 상관관계 플롯. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.

figure-results-2
그림 2: GSE145281 데이터셋을 이용한 TRPM4 의 단일 셀 분석. (A) 서로 다른 GSE145281 클러스터. (B) GSE145281의 다양한 면역 세포. (C) GSE145281의 파이 플롯. (D) TRPM4의 분포. (E-F) 다양한 클러스터와 면역세포에서 TRPM4 의 바이올린 플롯. (G-H) C1 및 C2 클러스터의 셀 채팅 분석. (I) 다양한 클러스터의 홀마크 경로 분석. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-3
그림 3: GSE145281 데이터셋을 이용한 TRPM4 의 단일 셀 분석. (A-B) GSE145281 데이터셋을 사용한 단일 셀 서명 분석. (C-D) C1과 C2 클러스터의 버블 플롯. (E-G) TF 풍부화 히트맵 플롯. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-4
그림 4: TRPM4 관련 예후 모델의 101 머신러닝 히트맵 플롯. 다양한 머신러닝 알고리즘 조합의 히트맵 플롯입니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

보조 그림 1: 종양 미세환경 형성에 있어 SDCBP의 생물정보학 분석. (A-C) 다양한 SDCBP 그룹에서 스트로말스코어, 면역스코어, 추정점수의 바이올린 플롯. p ≤ 0.0001. (D) SDCBP와 면역 체크포인트 간의 삼각형 상관 열맵. 이 파일을 다운로드하려면 여기를 클릭해 주세요.

보충 그림 2: 세포주 내 유전자 발현 데이터. 이 파일을 다운로드하려면 여기를 클릭해 주세요.

보충표 1: 모든 TCGA-BLCA 환자의 신분증. 이 파일을 다운로드하려면 여기를 클릭해 주세요.

보충 표 2: 이 글에서 사용된 패키지의 다양한 버전. 이 파일을 다운로드하려면 여기를 클릭해 주세요.

보충표 3: TISCH2에 사용된 모든 마커 유전자. 이 파일을 다운로드하려면 여기를 클릭해 주세요.

보충표 4: 모든 유전자가 TRPM4와 상관관계가 있었다. 이 파일을 다운로드하려면 여기를 클릭해 주세요.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이전 연구에서는 단일 유전자에 대한 생물정보학 분석이 피상적, 부정확성, 적용 가능성 제한 등의 문제에 자주 부딪혔습니다19. 더욱이 이전 단일 유전자 연구는 대개 전사체 데이터에 국한되어 왔습니다. 더불어, 전사체 데이터에만 집중할 때는 샘플 이질성과 무작위성 같은 문제가 발생할 수 있어 보편적인 패턴을 식별하기 어려울 수 있습니다20. 따라서 앞서 언급한 문제를 해결하기 위해 단일 세포 데이터를 도입하여 경로 수준에서 개별 유전자의 중요한 역할을 더 잘 이해하려 했습니다. 이 글의 핵심 단계는 단일세포 분석을 위한 온라인 웹사이트 TISCH2(http://tisch.compbio.cn/)가 도입되었다는 점입니다. 품질 관리를 위해 사용되는 표준은 데이터셋당 세포 수가 1000 이상, 세포당 UMI 수가 1000 이상, 세포당 유전자 수가 500 이상이라는 것입니다. 또한, 101 머신러닝은 모든 환자의 예후와 임상 결과를 예측할 수 있는 최적의 예후 모델을 찾는 데 사용되는 핵심 단계이기도 합니다21. 마지막으로, 단일 유전자의 결과를 설명하기 위해 여러 생물정보학 분석 플롯을 적용하는 것을 잊지 마세요.

물론 다이어그램을 만들고 분석을 수행하는 과정에서 문제를 겪는 것은 불가피합니다. 만약 히트맵에서 출력되는 유전자가 적거나 거의 없다는 것이 발견되면, 유전자 ID 이후에 빈 공간이 있는지 신중히 확인하는 것이 필수적입니다. 이 빈 공간은 결과 출력에 큰 영향을 미칠 수 있기 때문입니다. 코드가 자주 오류를 발생시킨다면, 문제의 상당 부분은 사용자의 컴퓨터에서 경로를 다른 위치로 설정하는 등 제대로 구현되지 않은 개인적인 수정에서 비롯될 수 있습니다. 이 문제를 해결하려면 사용자의 컴퓨터에서 해당 위치로 가는 경로를 설정하면 됩니다. 마지막으로, 101 머신러닝을 활용해 예후 모델을 구축할 때는 인내심이 매우 중요합니다. 이 과정은 30분에서 1시간 정도 소요될 수 있으며, 필요한 R 패키지가 모두 미리 다운로드되었는지 확인하는 것이 중요합니다.

하지만 이 방법에는 여전히 몇 가지 한계가 있습니다. 시간 제한으로 인해 우리는 BLCA에서 다른 암 유형이 아닌 생물정보학 분석을 통해서만 이 결론을 검증했습니다. 더불어, 이 결론이 다른 암에는 적용되지 않을 수 있으므로, 포괄적인 설명을 제공하기 위해서는 더 심층적이고 광범위한 연구가 필요합니다. 프로토콜은 더 다양한 종류의 생물정보학 분석을 추가함으로써 더 풍부하고 만족스러울 수 있습니다. 또한, 생물정보학 분석 결과는 실험과 통합되어야 하며; 예를 들어, 분석에서 TRPM4TNF-α 경로 간의 연관성을 발견하면 PCR 실험을 통해 이 연결을 검증할 수 있으며, 생물정보학 분석 결과는 실험 검증의 방향을 제시하는 지침이 될 수 있습니다.

이 방법 기사에서는 대량의 데이터를 편리하게 다운로드할 수 있는 방법과 단일 셀 온라인 분석 웹사이트 소개도 제공하여 초보자의 분석 부담을 크게 줄이고 더 많은 사람들에게 더 다양한 선택지를 제공합니다. 또한 사용자가 바이올린 플롯, 히트맵 플롯, 상관관계 플롯, 삼각형 상관 히트맵플롯 22 등 자신만의 생물정보학 플롯을 실험할 수 있는 다양한 생물정보학 코드도 있습니다. 이 연구 방법의 또 다른 중요한 장점은 이 유전자가 대체되더라도 다른 단일 유전자들도 유사한 방식으로 연구할 수 있어 연구 결과가 보편적으로 적용 가능하다는 점입니다. 앞으로는 여러 병원에서 데이터를 수집하여 표본 크기를 늘리고, 연구를 더 많은 암 유형으로 확장할 예정입니다. 이 확장은 다양한 암 전반에 걸쳐 연구 결과가 유효한지 평가하는 것을 목표로 합니다. 동시에, TRPM4와 BLCA에서 흔한 TMN 단계와 같은 확립된 바이오마커를 통합하여 견고한 예후 모델을 구축했습니다. 이 모델은 환자의 결과 예측을 향상시키기 위해 설계되었습니다. 더 나아가, 이 모델을 구축하기 위해 머신러닝 기법이 사용되며, 해석 가능성과 예측 정확도 향상에 중점을 둘 예정이며, 이는 향후 주요 연구가 될 것입니다.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 이해 충돌이 없다고 선언합니다.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

지능형 분석 프레임워크(http://www.sxdyc.com/ 에서 이용 가능)를 개발해 준 BioBean Informatics Consortium에 감사드립니다. 이들의 혁신적인 계산 인프라는 정밀 분석과 자동 데이터 해석 모듈을 통해 연구 워크플로우를 크게 가속화했습니다.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
R 4.3.3전혀 없습니다전혀 없습니다전혀 없습니다

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Identification of multicohort-based predictive signature for NMIBC recurrence reveals SDCBP as a novel oncogene in bladder cancer. Ann Med. 57 (1), 2458211(2025).">Zhang, C., et al. Identification of multicohort-based predictive signature for NMIBC recurrence reveals SDCBP as a novel oncogene in bladder cancer. Ann Med. 57 (1), 2458211(2025).
  2. Plasma GFAP and Amyloid Pathology Predict Cognitive Response to Multidomain Interventions in MCI. Aging Dis. , (2025).">Han, M. H., et al. Plasma GFAP and Amyloid Pathology Predict Cognitive Response to Multidomain Interventions in MCI. Aging Dis. , (2025).
  3. Towards Precision Aging Biology: Single-Cell Multi-Omics and Advanced AI-Driven Strategies. Aging Dis. , (2025).">Xie, S., et al. Towards Precision Aging Biology: Single-Cell Multi-Omics and Advanced AI-Driven Strategies. Aging Dis. , (2025).
  4. TISCH2: expanded datasets and new tools for single-cell transcriptome analyses of the tumor microenvironment. Nucleic Acids Res. 51 (D1), D1425-D1431 (2023).">Han, Y., et al. TISCH2: expanded datasets and new tools for single-cell transcriptome analyses of the tumor microenvironment. Nucleic Acids Res. 51 (D1), D1425-D1431 (2023).
  5. Advances in prognostic models for osteosarcoma risk. Heliyon. 10 (7), e28493(2024).">Yao, Y., et al. Advances in prognostic models for osteosarcoma risk. Heliyon. 10 (7), e28493(2024).
  6. Glutamine metabolism reprogramming promotes bladder cancer progression via PYCR1: a multi-omics and functional validation study. J Transl Med. 23 (1), 1277(2025).">Ding, X., et al. Glutamine metabolism reprogramming promotes bladder cancer progression via PYCR1: a multi-omics and functional validation study. J Transl Med. 23 (1), 1277(2025).
  7. Methylparaben and propylparaben promote bladder cancer invasion via MMP2 and PPARG modulation. Ecotoxicol Environ Saf. 306, 119383(2025).">Zhu, T., et al. Methylparaben and propylparaben promote bladder cancer invasion via MMP2 and PPARG modulation. Ecotoxicol Environ Saf. 306, 119383(2025).
  8. Deciphering cutaneous melanoma prognosis through LDL metabolism: Single-cell transcriptomics analysis via 101 machine learning algorithms. Exp Dermatol. 33 (4), e15070(2024).">Xie, J. H., et al. Deciphering cutaneous melanoma prognosis through LDL metabolism: Single-cell transcriptomics analysis via 101 machine learning algorithms. Exp Dermatol. 33 (4), e15070(2024).
  9. TISCH: a comprehensive web resource enabling interactive single-cell transcriptome visualization of tumor microenvironment. Nucleic Acids Res. 49 (D1), D1420-D1430 (2021).">Sun, D., et al. TISCH: a comprehensive web resource enabling interactive single-cell transcriptome visualization of tumor microenvironment. Nucleic Acids Res. 49 (D1), D1420-D1430 (2021).
  10. D-Mannose Upregulates Testin via the NF-κB Pathway to Inhibit Breast Cancer Proliferation. J Biochem Mol Toxicol. 39 (8), e70398(2025).">Cao, X., et al. D-Mannose Upregulates Testin via the NF-κB Pathway to Inhibit Breast Cancer Proliferation. J Biochem Mol Toxicol. 39 (8), e70398(2025).
  11. Visualizing and interpreting cancer genomics data via the Xena platform. Nat Biotechnol. 38 (6), 675-678 (2020).">Goldman, M. J., et al. Visualizing and interpreting cancer genomics data via the Xena platform. Nat Biotechnol. 38 (6), 675-678 (2020).
  12. GREM1 may be a biological indicator and potential target of bladder cancer. Sci Rep. 14 (1), 23280(2024).">Yu, Q., et al. GREM1 may be a biological indicator and potential target of bladder cancer. Sci Rep. 14 (1), 23280(2024).
  13. Membrane palmitoylated protein MPP1 inhibits immune escape by regulating the USP12/ CCL5 axis in urothelial carcinoma. Int Immunopharmacol. 146, 113802(2025).">Wu, Q., et al. Membrane palmitoylated protein MPP1 inhibits immune escape by regulating the USP12/ CCL5 axis in urothelial carcinoma. Int Immunopharmacol. 146, 113802(2025).
  14. Adjusting batch effects in microarray expression data using empirical Bayes methods. Biostatistics. 8 (1), 118-127 (2007).">Johnson, W. E., Li, C., Rabinovic, A. Adjusting batch effects in microarray expression data using empirical Bayes methods. Biostatistics. 8 (1), 118-127 (2007).
  15. Siglec15 shapes a non-inflamed tumor microenvironment and predicts the molecular subtype in bladder cancer. Theranostics. 11 (7), 3089-3108 (2021).">Hu, J., et al. Siglec15 shapes a non-inflamed tumor microenvironment and predicts the molecular subtype in bladder cancer. Theranostics. 11 (7), 3089-3108 (2021).
  16. BlastKOALA and GhostKOALA: KEGG Tools for Functional Characterization of Genome and Metagenome Sequences. J Mol Biol. 428 (4), 726-731 (2016).">Kanehisa, M., Sato, Y., Morishima, K. BlastKOALA and GhostKOALA: KEGG Tools for Functional Characterization of Genome and Metagenome Sequences. J Mol Biol. 428 (4), 726-731 (2016).
  17. Hallmarks of glycosylation in cancer. Oncotarget. 7 (23), 35478-35489 (2016).">Munkley, J., et al. Hallmarks of glycosylation in cancer. Oncotarget. 7 (23), 35478-35489 (2016).
  18. A high stroma-tumor ratio is associated with an immunosuppressive tumor microenvironment and a poor prognosis in bladder cancer. Front Oncol. 15, 1604609(2025).">Da, Y., et al. A high stroma-tumor ratio is associated with an immunosuppressive tumor microenvironment and a poor prognosis in bladder cancer. Front Oncol. 15, 1604609(2025).
  19. Bioinformatics Methods for Mass Spectrometry-Based Proteomics Data Analysis. Int J Mol Sci. 21 (8), 2873(2020).">Chen, C., et al. Bioinformatics Methods for Mass Spectrometry-Based Proteomics Data Analysis. Int J Mol Sci. 21 (8), 2873(2020).
  20. Universal Patterns in Color-Emotion Associations Are Further Shaped by Linguistic and Geographic Proximity. Psychol Sci. 31 (10), 1245-1260 (2020).">Jonauskaite, D., et al. Universal Patterns in Color-Emotion Associations Are Further Shaped by Linguistic and Geographic Proximity. Psychol Sci. 31 (10), 1245-1260 (2020).
  21. Integrated machine learning identifies epithelial cell marker genes for improving outcomes and immunotherapy in prostate cancer. J Transl Med. 21 (1), 782(2023).">Zhu, W., et al. Integrated machine learning identifies epithelial cell marker genes for improving outcomes and immunotherapy in prostate cancer. J Transl Med. 21 (1), 782(2023).
  22. Bioinformatics prediction and experimental verification of key biomarkers for diabetic kidney disease based on transcriptome sequencing in mice. PeerJ. 10, e13932(2022).">Zhao, J., et al. Bioinformatics prediction and experimental verification of key biomarkers for diabetic kidney disease based on transcriptome sequencing in mice. PeerJ. 10, e13932(2022).

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

TCGA DataSingle Cell DataTRPM4 GeneTumor Immune MicroenvironmentTumor Molecular SubtypesPrognostic ModelMachine LearningBioinformatics AnalysisSingle Gene AnalysisTISCH2 Website

Related Articles