여기서는 전사체 분석과 단세포 분석을 바탕으로 101개의 머신러닝 알고리즘을 활용하여 방광암에서 단일 유전자의 역할을 철저히 분석하는 프로토콜을 제시합니다.
방법 논문
* These authors contributed equally
여기서는 전사체 분석과 단세포 분석을 바탕으로 101개의 머신러닝 알고리즘을 활용하여 방광암에서 단일 유전자의 역할을 철저히 분석하는 프로토콜을 제시합니다.
본 논문에서는 공개된 전사체 데이터셋과 단세포 데이터셋을 기반으로 한 분석 방법을 소개하여, 종양 면역 미세환경 형성, 종양 분자 아형 형성, 종양 환자의 예후 예측 등 단일 유전자의 역할을 포괄적으로 기술할 수 있습니다. 동시에, 단일 유전자 데이터 도입은 단일 전사체 분석으로 인한 무작위성과 이질성을 피할 뿐만 아니라, 유전자가 발현되는 특정 세포 클러스터를 더 깊이 탐구하고, 경로 내에서 유전자가 어떤 역할을 하는지에 대한 추가 연구를 가능하게 합니다. 많은 연구자들이 단일 세포 분석에 능숙하지 않을 수 있음을 고려하여, 이 방법 논문에는 TISCH2(http://tisch.compbio.cn/)라는 온라인 웹사이트가 소개되어 모두가 단일 세포 분석을 완료할 수 있도록 돕습니다. 또한, 101가지 머신러닝 기법의 적용은 가장 정확한 예후 모델 구축에 필수적인 역할을 해왔습니다. 결론적으로, 생물정보학 분석, 머신러닝, 단세포 분석을 결합한 이 통합 단일 유전자 분석 방법은 단일 유전자의 종양 진행 기능 연구뿐만 아니라 경로 내 개별 유전자 기능 연구에도 필수적이고 중요한 역할을 할 수 있다고 믿어집니다.
우리가 모두 알다시피, 방광암(BLCA)은 세계에서 가장 공격적이고 전이성 악성 종양 중 하나이며, 현재 방광암 바이오마커에는 부정확성 등 문제가 여전히 존재합니다. BLCA 환자의 예후를 확인하고 결과를 예측하기 위해 방광암 바이오마커 탐색과 예후 모델 구축이 매우 중요합니다. 사람들이 바이오마커에 대한 연구 방법을 개발했지만, 대부분의 방법은 현재 전사체학에 한정되어 있어 샘플 내 이질성을 불가피하게 만듭니다2. 더불어, 전사체학 데이터만으로는 서로 다른 세포 하위 집단의 역할이나 단일 세포 수준에서 다양한 경로에서 유전자의 기능을 조사하는 데 실패하는 경우가 많아 과거 연구가 덜 정밀하고 효과적이지 않게 만듭니다. 단세포 분석이 초보자에게 어려울 수 있음을 고려하여, 단세포 분석을 위한 온라인 플랫폼이 도입되어 빠르게 기술을 습득할 수 있도록 돕습니다. 마지막으로, 전사체 분석과 단세포 분석을 통해 단일 유전자가 적합한 바이오마커임이 밝혀졌더라도, 그 바이오마커가 모든 코호트에 적용 가능하다는 보장은 없으므로, 결론을 보다 보편적으로 적용할 수 있도록 바이오마커와 연관된 예후 모델을 구축하는 것이 필요합니다. 5. 101 머신러닝 알고리즘은 10가지 서로 다른 머신러닝 알고리즘을 조합하여 최적의 예후 모델을 식별하는 것을 의미합니다. 복잡한 데이터를 더 잘 처리하고 안정성을 보인 랜덤 포레스트, XGBoost, SVM과 같은 알고리즘의 포함으로 이 결합 알고리즘은 놀라운 안정성을 보여주었습니다. 이 예후 모델을 바이오마커와 더 정확하고 관련성 있게 만들기 위해, 먼저 모든 유전자와 바이오마커 간의 상관 분석을 수행한 후, 요구사항에 따라 약 20-30개의 유전자를 선택한 후 101 머신러닝 알고리즘을 사용해 예후 모델을 구축하고, 결과를 최종 확정하기 위한 일련의 분석을 거칩니다.
지난6년간 단순 전사체 분석으로 예측된 바이오마커와 비교하면, 단세포 및 전사체 분석의 바이오마커는 조직이나 샘플을 기본 세포 구성 요소로 편향되지 않고 분해할 수 있게 합니다. 이는 T 세포, B 세포, 대식세포 등 다양한 세포 유형의 명확한 분화와 새로운 하위 집단(예: 고갈된 T 세포 및 조절 T 세포)의 발견, 그리고 세포 분화 궤적과 같은 연속적인 동적 과정을 포착할 수 있게 합니다4. 과일과 우유를 따로 배열하는 것과 비슷하게, 각 성분과 그 양을 명확하게 시각화할 수 있게 해줍니다. 단일 코호트 Cox 모델7과 비교할 때, 101 머신러닝을 사용해 구축된 예후 모델은 데이터에서 변수들 간의 복잡하고 비선형적인 상호작용을 자동으로 학습할 수 있어 더 정확하고 과학적으로 타당합니다. 예를 들어, 특정 유전적 돌연변이의 영향은 특정 연령과 종양 크기의 환자에게만 유의미할 수 있습니다. 랜덤 포레스트나 신경망과 같은 머신러닝 모델은 수동 명세8 없이도 이러한 고차 상호작용을 자동으로 포착할 수 있습니다. 분석에 사용되는 데이터셋이 대부분의 유전자를 포함해야 하는 신호 핵심 적용 제약 조건은 유전자 수가 너무 적지 않고, 예후 모델 구축에 사용되는 유전자 수가 너무 높지 않아 일반적으로 20-30 정도로 유지되어야 하며, 이것이 최적이다. 단일 세포 세트의 품질 관리 기준은 1000 이상이어야 하며, 세포당 UMI 수는 1000 이상이어야 하며, 세포당 유전자 수는 500 9보다 커야 합니다.
여기서는 공개 전사체 데이터셋과 단일 세포 데이터셋에서 새로운 바이오마커를 식별하는 단계별 접근법을 제시하며, BLCA에서 TRPM4 의 역할을 예로 들고 있습니다. 암 게놈 아틀라스-방광암(TCGA-BLCA) 데이터셋, 단세포 데이터셋 GSE145281, BLCA 데이터셋 GSE32894 및 GSE31684 등 다양한 연구 방법과 다양한 데이터셋이 사용되어 종양학에서 바이오마커의 정밀도와 적용성을 높이고 BLCA에서 TRPM4 연구를 진전시키고 있습니다. TCGA-BLCA 데이터셋은 캘리포니아 대학교 산타크루즈 제나(UCSC Xena) 웹사이트에서 수집되었습니다. GSE32894와 GSE31684은 유전자 발현 옴니버스(GEO)에서 다운로드되었으며, 단일 세포 데이터는 GSE145281 Tumor Immune Single-Cell Hub 2(TISCH2)에서 수집되었습니다. 또한, 관련 논문의 보조 스프레드시트 파일에서 BLCA 분자 아형과 처리 반응에 관한 데이터를 추출하였습니다. 이후 생물정보학 분석, 단세포 분석, 머신러닝을 수행하여 통합된 단일 유전자 연구 방법론을 확립합니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
참고: 이 글에서 사용된 모든 코드는 https://github.com/YaoGeng-nmu/Analysis-of-TRPM4-based-on-TCGA-data-and-single-cell-data-in-BLCA/blob/main/code 웹사이트에서 확인할 수 있습니다.
1. 전사체학 데이터 준비
2. 단세포 분석 준비
3. BLCA의 분자 아형 및 치료 선택 데이터에 대한 반응 준비
4. TRPM4의 BLCA 면역 미세환경 분석
5. GSE145281 데이터셋에서 TRPM4 의 단일 셀 분석
6. 101 TRPM4와 관련된 예후 모델 구축을 위한 머신러닝
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
전사체학을 이용해 개별 유전자의 면역 미세환경을 분석하는 핵심 이점은 개별 유전자와 유전자 발현 수준에서 면역 세포 및 분자와의 동적 상호작용 간의 직접적인 상관관계를 가능하게 하여 면역 특성을 직접 관찰하고 개별 유전자 발현이나 변화가 높거나 낮은 그룹 간 침투 세포 비율 차이를 식별할 수 있다는 점으로 잘 알려져 있습니다 면역 체크포인트 분자의 발현에18. 생물정보학 분석의 대표적인 결과는 면역 미세환경 및 바이올린 플롯 등과 같은 면역 분자 분석과 관련된 것입니다. 단일 세포 분석의 대표적인 결과는 각 세포 클러스터의 목표 유전자 발현 수준과 각 세포 클러스터의 경로 열맵 분석입니다. 101개의 머신러닝 모델의 대표적인 결과는 예후 모델을 구축하는 데 사용되는 알고리즘의 히트맵입니다.
우선, 히트맵 플롯은 133개의 면역조절자가 저TRPM4 그룹에서 더 많...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이전 연구에서는 단일 유전자에 대한 생물정보학 분석이 피상적, 부정확성, 적용 가능성 제한 등의 문제에 자주 부딪혔습니다19. 더욱이 이전 단일 유전자 연구는 대개 전사체 데이터에 국한되어 왔습니다. 더불어, 전사체 데이터에만 집중할 때는 샘플 이질성과 무작위성 같은 문제가 발생할 수 있어 보편적인 패턴을 식별하기 어려울 수 있습니다20. 따라서 앞서 언급한 문제를 해결하기 위해 단일 세포 데이터를 도입하여 경로 수준에서 개별 유전자의 중요한 역할을 더 잘 이해하려 했습니다. 이 글의 핵심 단계는 단일세포 분석을 위한 온라인 웹사이트 TISCH2(http://tisch.compbio.cn/)가 도입되었다는 점입니다. 품질 관리를 위해 사용되는 표준은 데이터셋당 세포 수가 1000 이상, 세포당 UMI 수가 1000 이상, 세포당 유전자 수가 ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이해 충돌이 없다고 선언합니다.
지능형 분석 프레임워크(http://www.sxdyc.com/ 에서 이용 가능)를 개발해 준 BioBean Informatics Consortium에 감사드립니다. 이들의 혁신적인 계산 인프라는 정밀 분석과 자동 데이터 해석 모듈을 통해 연구 워크플로우를 크게 가속화했습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| R 4.3.3 | 전혀 없습니다 | 전혀 없습니다 | 전혀 없습니다 |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청