여기서는 전사체 분석과 단세포 분석을 바탕으로 101개의 머신러닝 알고리즘을 활용하여 방광암에서 단일 유전자의 역할을 철저히 분석하는 프로토콜을 제시합니다.
Method Article
841789075@qq.com
ZhuZhuang2826@163.com
a15066@njmu.edu.cn
gengyao19970821@163.com
Corresponding Authors: Hualin Wang <841789075@qq.com>, Zhuang Zhu <ZhuZhuang2826@163.com>, Yuan Liu <a15066@njmu.edu.cn>, Yao Geng <gengyao19970821@163.com>
* These authors contributed equally
여기서는 전사체 분석과 단세포 분석을 바탕으로 101개의 머신러닝 알고리즘을 활용하여 방광암에서 단일 유전자의 역할을 철저히 분석하는 프로토콜을 제시합니다.
본 논문에서는 공개된 전사체 데이터셋과 단세포 데이터셋을 기반으로 한 분석 방법을 소개하여, 종양 면역 미세환경 형성, 종양 분자 아형 형성, 종양 환자의 예후 예측 등 단일 유전자의 역할을 포괄적으로 기술할 수 있습니다. 동시에, 단일 유전자 데이터 도입은 단일 전사체 분석으로 인한 무작위성과 이질성을 피할 뿐만 아니라, 유전자가 발현되는 특정 세포 클러스터를 더 깊이 탐구하고, 경로 내에서 유전자가 어떤 역할을 하는지에 대한 추가 연구를 가능하게 합니다. 많은 연구자들이 단일 세포 분석에 능숙하지 않을 수 있음을 고려하여, 이 방법 논문에는 TISCH2(http://tisch.compbio.cn/)라는 온라인 웹사이트가 소개되어 모두가 단일 세포 분석을 완료할 수 있도록 돕습니다. 또한, 101가지 머신러닝 기법의 적용은 가장 정확한 예후 모델 구축에 필수적인 역할을 해왔습니다. 결론적으로, 생물정보학 분석, 머신러닝, 단세포 분석을 결합한 이 통합 단일 유전자 분석 방법은 단일 유전자의 종양 진행 기능 연구뿐만 아니라 경로 내 개별 유전자 기능 연구에도 필수적이고 중요한 역할을 할 수 있다고 믿어집니다.
우리가 모두 알다시피, 방광암(BLCA)은 세계에서 가장 공격적이고 전이성 악성 종양 중 하나이며, 현재 방광암 바이오마커에는 부정확성 등 문제가 여전히 존재합니다. BLCA 환자의 예후를 확인하고 결과를 예측하기 위해 방광암 바이오마커 탐색과 예후 모델 구축이 매우 중요합니다. 사람들이 바이오마커에 대한 연구 방법을 개발했지만, 대부분의 방법은 현재 전사체학에 한정되어 있어 샘플 내 이질성을 불가피하게 만듭니다2. 더불어, 전사체학 데이터만으로는 서로 다른 세포 하위 집단의 역할이나 단일 세포 수준에서 다양한 경로에서 유전자의 기능을 조사하는 데 실패하는 경우가 많아 과거 연구가 덜 정밀하고 효과적이지 않게 만듭니다. 단세포 분석이 초보자에게 어려울 수 있음을 고려하여, 단세포 분석을 위한 온라인 플랫폼이 도입되어 빠르게 기술을 습득할 수 있도록 돕습니다. 마지막으로, 전사체 분석과 단세포 분석을 통해 단일 유전자가 적합한 바이오마커임이 밝혀졌더라도, 그 바이오마커가 모든 코호트에 적용 가능하다는 보장은 없으므로, 결론을 보다 보편적으로 적용할 수 있도록 바이오마커와 연관된 예후 모델을 구축하는 것이 필요합니다. 5. 101 머신러닝 알고리즘은 10가지 서로 다른 머신러닝 알고리즘을 조합하여 최적의 예후 모델을 식별하는 것을 의미합니다. 복잡한 데이터를 더 잘 처리하고 안정성을 보인 랜덤 포레스트, XGBoost, SVM과 같은 알고리즘의 포함으로 이 결합 알고리즘은 놀라운 안정성을 보여주었습니다. 이 예후 모델을 바이오마커와 더 정확하고 관련성 있게 만들기 위해, 먼저 모든 유전자와 바이오마커 간의 상관 분석을 수행한 후, 요구사항에 따라 약 20-30개의 유전자를 선택한 후 101 머신러닝 알고리즘을 사용해 예후 모델을 구축하고, 결과를 최종 확정하기 위한 일련의 분석을 거칩니다.
지난6년간 단순 전사체 분석으로 예측된 바이오마커와 비교하면, 단세포 및 전사체 분석의 바이오마커는 조직이나 샘플을 기본 세포 구성 요소로 편향되지 않고 분해할 수 있게 합니다. 이는 T 세포, B 세포, 대식세포 등 다양한 세포 유형의 명확한 분화와 새로운 하위 집단(예: 고갈된 T 세포 및 조절 T 세포)의 발견, 그리고 세포 분화 궤적과 같은 연속적인 동적 과정을 포착할 수 있게 합니다4. 과일과 우유를 따로 배열하는 것과 비슷하게, 각 성분과 그 양을 명확하게 시각화할 수 있게 해줍니다. 단일 코호트 Cox 모델7과 비교할 때, 101 머신러닝을 사용해 구축된 예후 모델은 데이터에서 변수들 간의 복잡하고 비선형적인 상호작용을 자동으로 학습할 수 있어 더 정확하고 과학적으로 타당합니다. 예를 들어, 특정 유전적 돌연변이의 영향은 특정 연령과 종양 크기의 환자에게만 유의미할 수 있습니다. 랜덤 포레스트나 신경망과 같은 머신러닝 모델은 수동 명세8 없이도 이러한 고차 상호작용을 자동으로 포착할 수 있습니다. 분석에 사용되는 데이터셋이 대부분의 유전자를 포함해야 하는 신호 핵심 적용 제약 조건은 유전자 수가 너무 적지 않고, 예후 모델 구축에 사용되는 유전자 수가 너무 높지 않아 일반적으로 20-30 정도로 유지되어야 하며, 이것이 최적이다. 단일 세포 세트의 품질 관리 기준은 1000 이상이어야 하며, 세포당 UMI 수는 1000 이상이어야 하며, 세포당 유전자 수는 500 9보다 커야 합니다.
여기서는 공개 전사체 데이터셋과 단일 세포 데이터셋에서 새로운 바이오마커를 식별하는 단계별 접근법을 제시하며, BLCA에서 TRPM4 의 역할을 예로 들고 있습니다. 암 게놈 아틀라스-방광암(TCGA-BLCA) 데이터셋, 단세포 데이터셋 GSE145281, BLCA 데이터셋 GSE32894 및 GSE31684 등 다양한 연구 방법과 다양한 데이터셋이 사용되어 종양학에서 바이오마커의 정밀도와 적용성을 높이고 BLCA에서 TRPM4 연구를 진전시키고 있습니다. TCGA-BLCA 데이터셋은 캘리포니아 대학교 산타크루즈 제나(UCSC Xena) 웹사이트에서 수집되었습니다. GSE32894와 GSE31684은 유전자 발현 옴니버스(GEO)에서 다운로드되었으며, 단일 세포 데이터는 GSE145281 Tumor Immune Single-Cell Hub 2(TISCH2)에서 수집되었습니다. 또한, 관련 논문의 보조 스프레드시트 파일에서 BLCA 분자 아형과 처리 반응에 관한 데이터를 추출하였습니다. 이후 생물정보학 분석, 단세포 분석, 머신러닝을 수행하여 통합된 단일 유전자 연구 방법론을 확립합니다.
참고: 이 글에서 사용된 모든 코드는 https://github.com/YaoGeng-nmu/Analysis-of-TRPM4-based-on-TCGA-data-and-single-cell-data-in-BLCA/blob/main/code 웹사이트에서 확인할 수 있습니다.
1. 전사체학 데이터 준비
2. 단세포 분석 준비
3. BLCA의 분자 아형 및 치료 선택 데이터에 대한 반응 준비
4. TRPM4의 BLCA 면역 미세환경 분석
5. GSE145281 데이터셋에서 TRPM4 의 단일 셀 분석
6. 101 TRPM4와 관련된 예후 모델 구축을 위한 머신러닝
전사체학을 이용해 개별 유전자의 면역 미세환경을 분석하는 핵심 이점은 개별 유전자와 유전자 발현 수준에서 면역 세포 및 분자와의 동적 상호작용 간의 직접적인 상관관계를 가능하게 하여 면역 특성을 직접 관찰하고 개별 유전자 발현이나 변화가 높거나 낮은 그룹 간 침투 세포 비율 차이를 식별할 수 있다는 점으로 잘 알려져 있습니다 면역 체크포인트 분자의 발현에18. 생물정보학 분석의 대표적인 결과는 면역 미세환경 및 바이올린 플롯 등과 같은 면역 분자 분석과 관련된 것입니다. 단일 세포 분석의 대표적인 결과는 각 세포 클러스터의 목표 유전자 발현 수준과 각 세포 클러스터의 경로 열맵 분석입니다. 101개의 머신러닝 모델의 대표적인 결과는 예후 모델을 구축하는 데 사용되는 알고리즘의 히트맵입니다.
우선, 히트맵 플롯은 133개의 면역조절자가 저TRPM4 그룹에서 더 많이 발현됨을 보여줍니다(그림 1A). ESTIMATE R 패키지의 계산에 따르면, 스트로말스코어, 면역 점수, 추정 점수가 모두 높은 TRPM4 그룹에서 낮다는 것이 명백하여, TRPM4 발현이 높은 샘플에서는 면역 침윤과 간질 침윤이 종종 부족함을 나타냅니다(그림 1B-D). 또한, 삼각상관 열맵은 TRPM4가 VTCN1, CD274, PDCD1, CTLA4, HAVCR2, TIGIT, IDO1, CD80, CD86, LAIR1, PVR, CD200R1, CD200, LGALS3, CEACAM1, BTLA, ADORA2A, KIR3DL1, KLRC1, CD276, CD47, KLRD1, LAG3 등 여러 면역 검사점과 음의 상관관계를 보인다는 것을 보여줍니다(그림 1E). 그러나 우리는 CTLA4, LAG3, HAVCR2, CD3E, TIGIT, PDCD1을 포함한 TRPM4와 T 세포 소진 유전자 간의 상관관계 플롯을 완성했습니다(그림 1F).
전사체학은 TRPM4와 TME 간의 연관성을 명확히 입증했지만, 이 수준에서의 분석으로는 이러한 표현형을 담당하는 세포 유형이나 아집단을 구분하지 못합니다. 면역 표현형의 세포적 기원을 정확히 밝히고 특정 면역 세포가 기능 변화를 겪었는지 명확히 하기 위해서는 단일 세포 전사체 분석이 필요합니다. 개별 세포의 유전자 발현 특성을 분석함으로써 면역 표현형을 특정 세포 하위 집단으로 정확히 추적할 수 있습니다. 또한, 방광암 면역세포의 단일 세포 데이터셋인 GSE145281가 도입되어 면역 세포 경로에서 TRPM4의 역할을 조사하고 있습니다. 14,462개의 면역 세포는 모두 17개의 클러스터로 나뉩니다(그림 2A). 14462개의 모든 세포는 B 세포, CD4 T 세포, CD8 T 세포, 단핵단세포, NK 세포로 나뉩니다(그림 2B). 총 14,462개의 면역 세포 중 8,465개는 단세포, 2,677개는 CD8 T, 1771개는 CD4 T세포, 566개는 B세포, 995개는 NK 세포입니다(그림 2C). 또한 TRPM4의 분포도 설명합니다(그림 2D). 결과는 TRPM4가 주로 단핵구에서 발현됨을 보여줍니다. 바이올린 플롯은 TRPM4가 주로 C1과 C2 클러스터에서 발현됨을 보여줍니다(그림 2E). 그림 2F의 결과도 이전 결과를 보여주었습니다. 또한 세포 채팅 분석 결과, 클러스터 C1은 클러스터 C0와 클러스터 C13과 연관되어 있고, 클러스터 C2는 클러스터 C0와 클러스터 C11과 가장 연관되어 있음을 알 수 있습니다(그림 2G-H). TRPM4의 역할도 Hallmark 유전자 집합 내에서 탐구되며, 히트맵을 통해 묘사됩니다. 히트맵 결과는 C1 클러스터가 주로 TNF-α 경로에 농축되어 있음을 보여줍니다. 이는 TRPM4가 TNF-α 경로를 통해 그 효과에 관여할 가능성이 있음을 시사합니다(그림 2I). C2 클러스터는 주로 외계 생물 대사 경로에 풍부하게 형성되어 있습니다.
단일 셀 시그니처 분석 결과, 위에서 언급한 두 채널이 TRPM4에 대해 분포되어 있음을 알 수 있습니다(그림 3A-B). 셀 채팅 버블 플롯은 C1과 C2 클러스터의 셀 채팅을 설명하는 데도 사용됩니다(그림 3C-D). 마지막으로 TF 농축 열맵 플롯을 생성합니다(그림 3E). 랭크 그래프는 SPI1이 각 세포 집단에서 유전자 발현을 조절하는 전사 인자일 수 있음을 시사합니다(그림 3F-G). 단세포 분석을 통해 세포 아집단이 TRPM4와 정확히 연관되어 있음을 규명하고, 이들이 질병 진행에 영향을 미치는 잠재적 메커니즘을 명확히 했습니다. 이러한 발견은 질병의 본질을 이해하는 데 탄탄한 이론적 기반을 제공하지만, 임상 의사결정을 직접적으로 안내할 수 있는 도구로 아직 전환되지 않았습니다. 이러한 통찰을 실천에 적용하기 위해서는 예후 모델을 구축하기 위해 머신러닝의 추가 통합이 필요합니다. 이는 TRPM4와 강한 상관관계를 가진 유전자에 대한 데이터를 수집하고, 궁극적으로 환자 생존을 신뢰성 있게 예측할 수 있는 모델을 개발하는 것을 포함합니다. TRPM4와 밀접하게 관련된 모든 유전자는 보충 표 4에 나열되어 있습니다. 마지막으로, BLCA 환자의 예후를 더 예측하기 위해 101개의 머신러닝 모델을 사용하여 모든 환자의 예후를 더 잘 설명합니다.
단일 데이터 소스에 의존함으로써 발생하는 무작위성과 부정확성을 피하기 위해, GSE32894와 GSE31684 같은 여러 BLCA 데이터셋을 활용합니다. 결과는 Coxboost+RSF가 BLCA 환자의 예후를 가장 잘 예측할 수 있으며, 이 예후 모델의 c-지수는 0.879에 이를 수 있음을 보여주었습니다(그림 4).
TRPM4 외에도 ESTIMATE R 패키지는 다양한 SDCBP 발현군 내 stromalscore, immunescore, ESTIMATEScore를 분석하는 데에도 적용되었습니다(보충 그림 1A-C). SDCBP와 면역 체크포인트 간의 삼각상관 히트맵도 작성되어 프로토콜 적응 방법을 보여줍니다(보충 그림 1D). qPCR 실험과 결과는 우리의 생물정보학 분석과 일치합니다. 인간 BLCA 세포주 T24와 정상 방광 세포주 SVHUC1을 사용하였다. 결과 그래프에서 보듯, TRPM4 발현이 높은 세포는 TRPM4 수치도 높게 나타납니다(보충 그림 2).

그림 1: 종양 미세환경 형성을 위한 TRPM4 의 생물정보학 분석. (A) 서로 다른 TRPM4 그룹의 133개 면역조절제의 히트맵 플롯. (B-D) 다양한 TRPM4 그룹에서 스트로말스코어, 면역점수, 추정점수의 바이올린 플롯. p ≤ 0.0001. (E) TRPM4 와 면역 체크포인트 간의 삼각형 상관 열맵. (F) T 세포 소진 유전자와 TRPM4 간의 상관관계 플롯. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.

그림 2: GSE145281 데이터셋을 이용한 TRPM4 의 단일 셀 분석. (A) 서로 다른 GSE145281 클러스터. (B) GSE145281의 다양한 면역 세포. (C) GSE145281의 파이 플롯. (D) TRPM4의 분포. (E-F) 다양한 클러스터와 면역세포에서 TRPM4 의 바이올린 플롯. (G-H) C1 및 C2 클러스터의 셀 채팅 분석. (I) 다양한 클러스터의 홀마크 경로 분석. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 3: GSE145281 데이터셋을 이용한 TRPM4 의 단일 셀 분석. (A-B) GSE145281 데이터셋을 사용한 단일 셀 서명 분석. (C-D) C1과 C2 클러스터의 버블 플롯. (E-G) TF 풍부화 히트맵 플롯. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

그림 4: TRPM4 관련 예후 모델의 101 머신러닝 히트맵 플롯. 다양한 머신러닝 알고리즘 조합의 히트맵 플롯입니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
보조 그림 1: 종양 미세환경 형성에 있어 SDCBP의 생물정보학 분석. (A-C) 다양한 SDCBP 그룹에서 스트로말스코어, 면역스코어, 추정점수의 바이올린 플롯. p ≤ 0.0001. (D) SDCBP와 면역 체크포인트 간의 삼각형 상관 열맵. 이 파일을 다운로드하려면 여기를 클릭해 주세요.
보충 그림 2: 세포주 내 유전자 발현 데이터. 이 파일을 다운로드하려면 여기를 클릭해 주세요.
보충표 1: 모든 TCGA-BLCA 환자의 신분증. 이 파일을 다운로드하려면 여기를 클릭해 주세요.
보충 표 2: 이 글에서 사용된 패키지의 다양한 버전. 이 파일을 다운로드하려면 여기를 클릭해 주세요.
보충표 3: TISCH2에 사용된 모든 마커 유전자. 이 파일을 다운로드하려면 여기를 클릭해 주세요.
보충표 4: 모든 유전자가 TRPM4와 상관관계가 있었다. 이 파일을 다운로드하려면 여기를 클릭해 주세요.
이전 연구에서는 단일 유전자에 대한 생물정보학 분석이 피상적, 부정확성, 적용 가능성 제한 등의 문제에 자주 부딪혔습니다19. 더욱이 이전 단일 유전자 연구는 대개 전사체 데이터에 국한되어 왔습니다. 더불어, 전사체 데이터에만 집중할 때는 샘플 이질성과 무작위성 같은 문제가 발생할 수 있어 보편적인 패턴을 식별하기 어려울 수 있습니다20. 따라서 앞서 언급한 문제를 해결하기 위해 단일 세포 데이터를 도입하여 경로 수준에서 개별 유전자의 중요한 역할을 더 잘 이해하려 했습니다. 이 글의 핵심 단계는 단일세포 분석을 위한 온라인 웹사이트 TISCH2(http://tisch.compbio.cn/)가 도입되었다는 점입니다. 품질 관리를 위해 사용되는 표준은 데이터셋당 세포 수가 1000 이상, 세포당 UMI 수가 1000 이상, 세포당 유전자 수가 500 이상이라는 것입니다. 또한, 101 머신러닝은 모든 환자의 예후와 임상 결과를 예측할 수 있는 최적의 예후 모델을 찾는 데 사용되는 핵심 단계이기도 합니다21. 마지막으로, 단일 유전자의 결과를 설명하기 위해 여러 생물정보학 분석 플롯을 적용하는 것을 잊지 마세요.
물론 다이어그램을 만들고 분석을 수행하는 과정에서 문제를 겪는 것은 불가피합니다. 만약 히트맵에서 출력되는 유전자가 적거나 거의 없다는 것이 발견되면, 유전자 ID 이후에 빈 공간이 있는지 신중히 확인하는 것이 필수적입니다. 이 빈 공간은 결과 출력에 큰 영향을 미칠 수 있기 때문입니다. 코드가 자주 오류를 발생시킨다면, 문제의 상당 부분은 사용자의 컴퓨터에서 경로를 다른 위치로 설정하는 등 제대로 구현되지 않은 개인적인 수정에서 비롯될 수 있습니다. 이 문제를 해결하려면 사용자의 컴퓨터에서 해당 위치로 가는 경로를 설정하면 됩니다. 마지막으로, 101 머신러닝을 활용해 예후 모델을 구축할 때는 인내심이 매우 중요합니다. 이 과정은 30분에서 1시간 정도 소요될 수 있으며, 필요한 R 패키지가 모두 미리 다운로드되었는지 확인하는 것이 중요합니다.
하지만 이 방법에는 여전히 몇 가지 한계가 있습니다. 시간 제한으로 인해 우리는 BLCA에서 다른 암 유형이 아닌 생물정보학 분석을 통해서만 이 결론을 검증했습니다. 더불어, 이 결론이 다른 암에는 적용되지 않을 수 있으므로, 포괄적인 설명을 제공하기 위해서는 더 심층적이고 광범위한 연구가 필요합니다. 프로토콜은 더 다양한 종류의 생물정보학 분석을 추가함으로써 더 풍부하고 만족스러울 수 있습니다. 또한, 생물정보학 분석 결과는 실험과 통합되어야 하며; 예를 들어, 분석에서 TRPM4 와 TNF-α 경로 간의 연관성을 발견하면 PCR 실험을 통해 이 연결을 검증할 수 있으며, 생물정보학 분석 결과는 실험 검증의 방향을 제시하는 지침이 될 수 있습니다.
이 방법 기사에서는 대량의 데이터를 편리하게 다운로드할 수 있는 방법과 단일 셀 온라인 분석 웹사이트 소개도 제공하여 초보자의 분석 부담을 크게 줄이고 더 많은 사람들에게 더 다양한 선택지를 제공합니다. 또한 사용자가 바이올린 플롯, 히트맵 플롯, 상관관계 플롯, 삼각형 상관 히트맵플롯 22 등 자신만의 생물정보학 플롯을 실험할 수 있는 다양한 생물정보학 코드도 있습니다. 이 연구 방법의 또 다른 중요한 장점은 이 유전자가 대체되더라도 다른 단일 유전자들도 유사한 방식으로 연구할 수 있어 연구 결과가 보편적으로 적용 가능하다는 점입니다. 앞으로는 여러 병원에서 데이터를 수집하여 표본 크기를 늘리고, 연구를 더 많은 암 유형으로 확장할 예정입니다. 이 확장은 다양한 암 전반에 걸쳐 연구 결과가 유효한지 평가하는 것을 목표로 합니다. 동시에, TRPM4와 BLCA에서 흔한 TMN 단계와 같은 확립된 바이오마커를 통합하여 견고한 예후 모델을 구축했습니다. 이 모델은 환자의 결과 예측을 향상시키기 위해 설계되었습니다. 더 나아가, 이 모델을 구축하기 위해 머신러닝 기법이 사용되며, 해석 가능성과 예측 정확도 향상에 중점을 둘 예정이며, 이는 향후 주요 연구가 될 것입니다.
저자들은 이해 충돌이 없다고 선언합니다.
지능형 분석 프레임워크(http://www.sxdyc.com/ 에서 이용 가능)를 개발해 준 BioBean Informatics Consortium에 감사드립니다. 이들의 혁신적인 계산 인프라는 정밀 분석과 자동 데이터 해석 모듈을 통해 연구 워크플로우를 크게 가속화했습니다.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| R 4.3.3 | 전혀 없습니다 | 전혀 없습니다 | 전혀 없습니다 |
Request permission to reuse the text or figures of this JoVE article
Request Permission