다양한 전처리 단계, 다중 오믹스 요인 분석 모델 추정 및 여러 다운스트림 분석을 결합한 복잡한 다중 오믹스 데이터 세트의 비감독 분석을 위한 유연하고 확장 가능한 Jupyter-lab 기반 워크플로를 제공합니다.
방법 논문
다양한 전처리 단계, 다중 오믹스 요인 분석 모델 추정 및 여러 다운스트림 분석을 결합한 복잡한 다중 오믹스 데이터 세트의 비감독 분석을 위한 유연하고 확장 가능한 Jupyter-lab 기반 워크플로를 제공합니다.
질병 메커니즘은 일반적으로 복잡하며 몇 가지 뚜렷한 분자 과정의 상호 작용에 의해 제어됩니다. 복잡한 다차원 데이터 세트는 이러한 프로세스에 대한 더 많은 통찰력을 얻을 수 있는 귀중한 리소스이지만, 이러한 데이터 세트의 분석은 예를 들어 다양한 질병 상태, 시점 및 다양한 해상도에서 프로세스를 캡처하는 오믹스에서 발생하는 높은 차원성으로 인해 어려울 수 있습니다.
여기에서는 급성 및 만성 관상동맥 증후군의 면역 반응을 포착하는 혈액 샘플에서 생성된 데이터 세트에 다중 오믹스 요인 분석(MOFA)을 적용하여 이러한 복잡한 다중 오믹스 데이터 세트를 비지도 방식으로 분석하고 탐색하는 접근 방식을 보여줍니다. 데이터 세트는 시료 수준 사이토카인 데이터, 혈장 단백질체학 및 호중구 프라임 염기서열분석, 단일 세포 RNA-염기서열분석(scRNA-seq) 데이터를 포함하여 다양한 해상도의 여러 분석으로 구성됩니다. 환자당 여러 다른 시점을 측정하고 여러 환자 하위 그룹을 측정함으로써 복잡성이 더욱 가중됩니다.
분석 워크플로우는 (1) 데이터 전처리 및 조화, (2) MOFA 모델 추정, (3) 다운스트림 분석의 여러 단계로 데이터를 통합하고 분석하는 방법을 간략하게 설명합니다. 1단계에서는 다양한 데이터 유형의 특징을 처리하고, 품질이 낮은 특징을 필터링하고, 추가 분석을 위해 분포를 일치시키기 위해 정규화하는 방법을 간략하게 설명합니다. 2단계에서는 MOFA 모델을 적용하고 모든 오믹스 및 기능에 걸쳐 데이터 세트 내 분산의 주요 원인을 탐색하는 방법을 보여줍니다. 3단계에서는 캡처된 패턴의 다운스트림 분석을 위한 몇 가지 전략을 제시하여 이를 질병 상태 및 이러한 상태를 지배하는 잠재적인 분자 과정과 연결합니다.
전반적으로, 복잡한 다중 오믹스 데이터 세트의 비지도 데이터 탐색을 위한 워크플로우를 제시하여 다른 컨텍스트 및 다중 오믹스 데이터 세트(예시적인 사용 사례에 제시된 다른 분석 포함)에도 적용할 수 있는 다양한 분자 특징으로 구성된 주요 변동 축을 식별할 수 있도록 합니다.
질병 메커니즘은 일반적으로 복잡하며 몇 가지 뚜렷한 분자 과정의 상호 작용에 의해 제어됩니다. 특정 질병을 유발하거나 질병의 진행을 관장하는 복잡한 분자 메커니즘을 해독하는 것은 질병을 이해하고 치료하기 위한 새로운 통찰력을 제공할 수 있기 때문에 의학적 관련성이 높은 작업입니다.
최근의 기술 발전으로 더 높은 해상도(예: 단일 세포 수준)와 다양한 생물학적 층(예: DNA, mRNA, 염색질 접근성, DNA 메틸화, 단백질체학)에서 이러한 과정을 동시에 측정할 수 있습니다. 이로 인해 대규모 다차원 생물학적 데이터 세트의 생성이 증가하고 있으며, 이를 공동으로 분석하여 기본 프로세스에 대한 더 많은 통찰력을 생성할 수 있습니다. 동시에 생물학적으로 의미 있는 방식으로 다양한 데이터 소스를 결합하고 분석하는 것은 여전히 어려운 작업입니다1.
서로 다른 기술적 한계, 소음 및 서로 다른 오믹스 간의 변동성 범위는 한 가지 문제를 제기합니다. 예를 들어, 단일 세포 RNA 염기서열분석(scRNA-seq) 데이터는 매우 희박하며 종종 대규모 기술 또는 배치 효과의 영향을 받습니다. 또한 특징 공간은 수천 개의 측정된 유전자 또는 단백질에 걸쳐 매우 큰 경우가 많으며 샘플 크기는 제한적입니다. 이는 여러 질병 상태, 교란 요인, 시점 및 해결 방법을 포함할 수 있는 복잡한 설계로 인해 더욱 복잡해집니다. 예를 들어, 제시된 사용 사례에서는 단일 셀 또는 샘플(대량) 수준에서 다양한 데이터 유형을 사용할 수 있었습니다. 그 외에도 데이터가 불완전할 수 있으며 분석된 모든 피험자에 대해 모든 측정이 가능하지 않을 수 있습니다.
이러한 문제로 인해, 통합 분석을 수행하면 공정에 대한 완전한 그림을 제공할 수 있을 뿐만 아니라 한 오믹스의 생물학적 및 기술적 노이즈가 다른 오믹스에 의해 보상될 수 있음에도 불구하고 서로 다른 오믹스 및 포함된 특징이 여전히 개별적으로 분석되는 경우가 많습니다 3,4. 베이지안 방법(Bayesian methods), 네트워크 기반 방법(network-based methods) 5,6, 멀티모달 딥러닝(multimodal deep learning)7, 행렬 분해를 통한 차원 축소(dimensionality reduction methods) 8,9 등 멀티오믹스 데이터의 통합 분석을 수행하기 위해 여러 가지 방법이 제안되었다. 후자의 경우, 대규모 벤치마킹 연구10의 결과에 따르면 MOFA9(다중 오믹 요인 분석) 방법은 데이터를 임상 주석에 연결해야 할 때 더 적합한 도구 중 하나임이 밝혀졌습니다.
특히 복잡한 환경에서 비지도 행렬 분해 방법은 복잡성을 줄이고 다양한 데이터 소스와 특징에서 공유 및 보완 신호를 추출하는 데 유용한 접근 방식입니다. 복잡한 공간을 더 낮은 순위의 잠재 표현으로 분해하면 데이터 내 분산의 주요 원인을 빠르게 탐색하고 알려진 공변량에 연결할 수 있습니다. 동일한 변이 패턴이 여러 특징(예: 유전자 또는 단백질)에 걸쳐 공유되는 경우, 이는 노이즈가 감소하면서 몇 가지 요인으로 집계될 수 있습니다. 정규화는 모델 계수의 희소성을 증가시키는 데 사용될 수 있으며, 이는 특징 공간이 크고 샘플 수가 제한되는 설정에서 이 접근 방식을 매우 적합하게 만듭니다9.
이 프로토콜은 MOFA 모델을 사용하여 복잡한 다중 오믹스 데이터 세트를 빠르게 탐색하고 이 데이터 세트를 특징짓는 주요 변동 패턴을 추출하는 방법을 보여주는 유연한 분석 워크플로우를 제공합니다. 워크플로는 세 가지 주요 단계로 구성됩니다. 첫 번째 단계인 Data pre-processing and harmonization에서는 다양한 입력 데이터 유형(scRNA-seq, proteomics, cytokine, clinical data)을 기반으로 한 데이터 전처리를 위한 다양한 전략을 제시합니다. 이 프로토콜은 서로 다른 입력 데이터 세트의 기능을 처리하고, 품질이 낮은 기능을 필터링하고, 분포를 조화시키기 위해 정규화하는 방법을 자세히 설명합니다. 또한 이러한 사전 처리 결정이 다운스트림 결과에 어떤 영향을 미칠 수 있는지도 보여줍니다. 두 번째 단계에서는 MOFA 모델을 데이터에 적용하고 결과 분산 분해를 사용하여 서로 다른 데이터 세트의 통합을 평가할 수 있습니다. 세 번째 단계에서는 캡처된 요인을 공변량에 연결하고 이러한 요인을 정의하는 분자 프로그램을 발견하는 방법을 보여줍니다. 제시된 워크플로우를 통해 관상 동맥 증후군을 앓고 있는 환자의 데이터 세트에서 임상 공변량과 관련된 여러 잠재 요인을 추출하고 이전 프로젝트11에서 잠재적인 기저 다세포 면역 프로그램을 식별할 수 있었습니다. 여기서는 이 데이터 세트를 사용하지만 프로토콜은 다른 오믹스를 포함한 다른 컨텍스트에 쉽게 적용할 수 있습니다.
이 데이터 세트는 안정적인 만성 관상동맥 증후군(CCS), 급성 관상동맥 증후군(ACS) 및 건강한 관상동맥(비CCS)이 있는 대조군 환자의 샘플로 구성됩니다(그림 1). ACS는 기존 CCS의 플라크 파열로 인해 발생하며, 심근으로 가는 혈류의 급성 중단과 그에 따른 심장의 허혈성 손상으로 이어집니다. 이 손상은 면역 체계에 의한 염증 반응을 일으킨 후 회복 단계를 일으키며, 이는 급성 사건12 후 몇 일까지 지속됩니다. ACS 환자에 대한 이러한 면역 반응을 특성화할 수 있도록 혈액 샘플을 4가지 다른 시점에서 채취했습니다: 급성(TP1); 재개통 후 (14 [± 8] h) (TP2); 60 [± 12] 시간 후 (TP3); 방전 전(6.5 [±1.5]일)(TP4)(그림 1A). CCS 및 건강한 관상동맥 환자의 경우 하나의 시점(TP0)만 사용할 수 있었습니다. 염증의 임상 지표(크레아틴-키나아제(CK), CK-MB, 트로포닌, C-반응성 단백질(CRP)), 말초 혈액 단핵 세포(PBMC)의 scRNA-seq, 사이토카인 분석, 혈장 단백질체학 및 호중구의prime-seq 13 데이터 등 혈액 샘플을 기반으로 한 다양한 분석을 측정했습니다.

그림 1: 심근 경색 다중 OMIC 입력 데이터 세트. 입력 데이터 세트: 분석된 데이터에는 급성 관상동맥 증후군(ACS), 만성 관상동맥 증후군(CCS) 및 건강한 관상동맥(비CCS) 환자(n = 62)의 혈액 샘플이 포함됩니다. ACS 환자의 경우 4개의 다른 시점(TP1-4)에서 혈액 샘플을 포함시켰고, CCS 환자와 비CCS 환자의 경우 단일 시점(TP0)에서 혈액 샘플을 포함했습니다. 각 환자 및 시점 조합은 분석에서 별도의 샘플로 취급됩니다. 샘플에서 임상 혈액 검사(n=125), scRNA-seq(n=121), 혈장-단백질체학(n=119), 사이토카인 분석(n=127) 및 호중구 프라임-seq(n=121)와 같은 다양한 omic 분석을 측정했습니다. 그 후, 설명된 프로토콜을 적용하여 모든 오믹스에서 데이터를 통합하고 MOFA 모델 및 추가 다운스트림 분석(요인 분석, 경로 농축)을 사용하여 데이터를 탐색했습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
여기에 제시된 워크플로우에 대한 입력으로, 예를 들어 scanpy14 전처리 튜토리얼에 설명된 대로 cellranger 및 품질 관리(QC)로 처리한 후 scRNA-seq 데이터에서 원시 계수를 가져옵니다. 셀 유형 주석의 경우 자동화된 Azimuth15 파이프라인을 사용했습니다. 그런 다음 각 샘플 및 셀 유형에 대한 모든 셀의 평균을 취하여 각 셀 유형에 대한 샘플 수준에서 카운트를 집계합니다(pseudobulk 집계). 혈장-단백질체학(Plasma-proteomics)은 정규화 강도(normalized tensity) 및 중앙-중심 강도(median-centered intensities)로 포함되며, 호중구의 경우 prime-seq에서 umi 고유 분자 식별자(UMI) 엑손 수를 취합니다. 사이토카인(cytokine) 및 임상적 가치에 대해서는 이전의 전처리가 적용되지 않았습니다. (실험적) 데이터 생성에 대한 자세한 내용은 해당 원고11에 요약되어 있다. 여기에 제시된 결과는 참조된 간행물에서 사용된 마커 기반 전략과 비교하여 scRNA-seq 데이터의 세포 유형에 대한 자동화된 방위각 주석을 사용한 것을 기반으로 하므로 여기에 제시된 결과는 유사하지만 간행물에 제시된 것과 정확히 동일하지는 않습니다. 원고에서 세포 유형 주석 전략이 분석의 주요 패턴과 생물학적 해석을 변경하지 않지만 모델로 인한 정확한 값의 작은 변화는 다를 수 있음을 보여줄 수 있습니다. 전반적으로 입력 데이터는 10,000개 이상의 서로 다른 특징(유전자, 단백질, 임상 값)의 다양한 시점과 측정 수준(단일 세포 대 벌크)을 포함하는 복잡한 다차원 데이터 세트였습니다. MOFA 분석에 따른 엄격한 전처리 및 데이터 조화 전략은 데이터를 탐색하고 관련 면역 프로그램을 추출하는 데 유용하고 빠른 도구인 것으로 나타났습니다. 각 시점 및 환자 조합은 MOFA 분석에서 독립적인 샘플로 취급됩니다. 각 데이터 유형 및 셀 유형은 MOFA 분석에서 별도의 뷰로 간주됩니다.
이 프로토콜은 워크플로우에 대한 입력 데이터를 준비하고, 다양한 워크플로우 단계를 실행하고, 구성을 사용자 정의하고, 결과 그림을 해석하고, 해석을 기반으로 구성을 반복적으로 조정하기 위한 지침을 제공합니다. 프로토콜의 여러 단계, 각 단계에서 필요한 입력 데이터 세트, 결과 수치 및 데이터 세트에 대한 개요는 기술 워크플로우 개요에 나와 있습니다(그림 2).

그림 2: 기술 워크플로우 개요. multi-omics 데이터 세트 분석을 위한 워크플로우 개요입니다. 다른 요소는 다른 색상과 기호로 강조 표시됩니다. 데이터 전처리 및 조화(Data Preprocessing and Harmonization)(1) 단계에 속하는 Jupyter Notebook은 파란색으로 표시됩니다. 'MOFA 모델'(2) 단계에 속하는 Jupyter Notebook은 주황색으로 표시됩니다. '다운스트림 분석'(3) 단계에 속하는 Jupyter Notebook은 녹색으로 표시됩니다. 결과 비교에 사용할 Jupyter Notebook 하나는 노란색으로 표시됩니다. 워크플로우 실행을 위한 매개 변수를 수정할 수 있는 구성 파일은 자주색으로 강조 표시됩니다. 워크플로를 실행하는 데 필요한 입력 데이터셋은 데이터셋 기호로 표시되며 회색으로 강조 표시됩니다. 워크플로 실행 중에 생성되는 모든 Figure 출력값은 돋보기 기호로 표시됩니다. 워크플로우 실행 중에 생성된 데이터셋은 테이블로 표시됩니다. 일반적으로 워크플로우는 순차적으로 실행됩니다: (1) 데이터 전처리 및 조화는 scRNA-seq 입력 데이터(01_Prepare_Pseudobulk)를 기반으로 하는 pseudobulk 테이블의 첫 번째 생성과 다른 모든 샘플 레벨(벌크) 입력(02_Integrate_and_Normalize_Data)과 함께 이 데이터의 후속 통합 및 정규화의 두 단계로 구성됩니다. 구성 파일을 통해 이 단계 내에서 각 데이터 세트에 대해 표시된 전처리 및 정규화 단계(예: Sample Filter) 중 어느 것을 적용해야 하는지 개별적으로 구성할 수 있습니다. (2) 'MOFA 모델': 구성 파일(03_MOFA_configs.csv)에 지정된 구성을 사용하여 첫 번째 단계에서 생성된 입력에 대해 MOFA 모델을 실행합니다. (3) '다운스트림 분석': 생성된 MOFA 결과에 대한 통찰력을 생성하고 이를 'Sample Meta Data.csv' 파일을 통해 입력으로 제공되는 샘플 메타 데이터(공변량)와 연결하기 위해 서로 독립적으로 실행할 수 있는 3개의 서로 다른 노트북으로 구성됩니다. (4) '모델 비교': 2단계에서 생성된 다른 모델을 비교하는 데 사용할 수 있는 작은 별도 단계입니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
워크플로는 R 및 Python으로 작성된 여러 Jupyter Notebook으로 구성됩니다(워크플로를 실행하는 데 R 및 Python 언어에 대한 지식이 필요하지 않지만 오류가 표시되는 경우 도움이 될 수 있음). 프로토콜의 다양한 단계에서 매개변수는 구성 파일(이름에 접미사 '_Configs'를 포함하는 '.csv' 파일)을 통해 변경됩니다. 프로토콜 내에서는 기본 구성부터 변경해야 하는 매개변수만 간략하게 설명합니다.
예를 들어, 전처리를 사용자 정의하기 위해 몇 가지 다른 매개변수도 변경될 수 있습니다. 이러한 매개 변수 및 설명에 대한 설명서는 다운로드한 저장소에 포함된 'Documentation_Config_Parameter' 파일에 제공됩니다.
1. 준비: 기술 설정 및 설치
참고: 이 프로그램을 실행하려면 wget, git 및 Apptainer가 장치에 미리 설치되어 있어야 합니다. 다른 시스템(Linux, Windows, Mac)에 Apptainer를 설치하는 방법에 대한 안내는 https://apptainer.org/docs/admin/main/installation.html 여기에서 제공됩니다. git에 대한 설치 정보는 여기에서 찾을 수 있습니다. https://git-scm.com/book/en/v2/Getting-Started-Installing-Git. 다양한 입력 데이터 세트의 크기에 따라 적절한 컴퓨터(CPU 16개, 64GB 메모리)에서 워크플로를 실행하는 것이 좋습니다. 제공된 예제 데이터를 사용한 스모크 테스트를 로컬 컴퓨터에서 실행할 수 있습니다. 예제 데이터에서 프로토콜을 실행한 지침 및 예상 출력은 보충 파일 1에 나와 있습니다. 위에서 설명한 데이터 세트에서 실행되는 프로토콜의 중요한 단계에 대해서는 보충 비디오 파일 1 을 참조하십시오.
2. 초기화 및 데이터 준비

그림 3: 데이터 입력 및 설정. 워크플로를 실행하려면 모든 데이터를 지정된 input_data 폴더에 저장해야 합니다. 각 입력 데이터 세트에 대해 별도의 파일을 제공해야 합니다. 단일 셀 데이터는 cluster_id의 셀 주석(예: 이전 셀 유형 주석 단계의 결과) 및 sample_id 열(분석해야 하는 각 개별 샘플을 고유하게 식별)을 포함하는 .h5ad로 제공해야 합니다. 다른 모든 입력 데이터 세트는 '.csv' 형식으로 제공되어야 하며, 여기에는 sample_id(단일 셀 데이터의 해당 열과 일치)을 지정하는 한 열과 다른 모든 열에서 MOFA 분석에 사용할 기능이 포함됩니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 4: Jupyter-lab 구성 파일. 워크플로우를 실행하는 동안 매개변수의 변경(예: 필터링 옵션 조정 등)은 '.csv' 구성 파일을 통해 지정됩니다. 복제된 리포지토리 내에는 각 단계에 대한 기본 구성 파일이 포함됩니다. 스프레드시트와 마찬가지로 jupyter-lab 콘솔에서 직접 편집할 수 있습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 5: Jupyter-notebooks 스크립트. 전체 워크플로는 해당 구성 파일이 수정된 후 순차적으로 실행되는 일련의 Jupyter Notebook으로 구성됩니다. 왼쪽의 Jupyter 노트북을 두 번 클릭하면 해당 파일이 오른쪽에 열립니다. 파일의 전체 실행은 상단에 강조 표시된 버튼으로 시작할 수 있습니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
3. 데이터 전처리 및 조화

그림 6: 데이터 전처리 및 조화. '01_Prepare_Pseudobulk' 스텝의 출력값 중 하나는 플롯 'Fig01_Amount_of_Cells_Overview'입니다. 여기서 각 cluster_id(이전 셀 유형 주석 단계의 셀 유형을 나타내는 y축)에 대해 샘플당 셀 수('sample_id')가 제공됩니다. 제시된 결과 내에서 샘플당 세포 수가 적은 세포 유형은 후속 분석에서 제외됩니다(취소선으로 표시됨). 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
4. MOFA 실행
5. 다운스트림 분석
6. 다양한 구성 및 버전 비교(보충 그림 1, 보충 그림 2, 보충 그림 3, 보충 그림 4)
7. 워크플로우 확장: 다른 매개 변수 및 구성 추가
참고: 구성 파일에서 현재 구성 가능한 매개 변수 외에도 코드 또는 다른 매개 변수의 다른 조정 사항이 포함될 수 있습니다. 예를 들어, MOFA 모델 자체는 코드에서 직접 수정하거나 구성 파일을 통해 조정할 수 있는 몇 가지 다른 훈련 매개변수(17 )를 제공한다. 프로토콜의 다음 섹션에서는 추가 MOFA 모델 학습 매개변수에 대해 이 작업을 수행하는 방법의 예를 간략하게 설명합니다. 이 부분에서는 R 프로그래밍 지식이 필요합니다.
워크플로우가 성공적으로 실행되면 그림 2와 같이 여러 테이블과 그림이 생성됩니다. 그림은 /figures 폴더(그림 6, 그림 7, 그림 8, 보충 그림 1, 보충 그림 2, 추가 그림 3, 보충 그림 4)에 배치되고 테이블은 지정된 /results 폴더에 배치됩니다.
워크플로우 실행이 성공하지 못하는 경우, 이는 주로 메모리 부족(특히 큰 단일 셀 데이터셋이 로드되는 첫 번째 단계)과 같은 기술적 오류, 잘못된 형식의 데이터(예: 데이터셋 간 sample_id 열 불일치) 또는 구성 파일의 잘못된 사양(예: 많은 피처 제외)에 기인할 수 있습니다. 이 경우 일반적으로 Jupyter-notebook 스크립트 내의 오류 메시지가 실행 중에 발생하고 플롯과 데이터가 생성되지 않습니다. 스크립트 실행 중에 생성된 기본 구성 파일을 사용하고 프로토콜에 설명된 대로 특정 매개 변수만 수정하는 것이 좋습니다.
성공적인 실행은 결과 플롯과 테이블의 생성으로 표시되며 각 단계는 데이터에 대한 추가 정보와 데이터에 내재된 주요 분산 패턴을 드러냅니다. 그러나 각 실행이 생물학적으로 유용하고 해석 가능한 결과를 생성한다는 것은 아닙니다. 종종 데이터는 큰 기술적 효과와 다양한 분포로 특징지어지며, 이는 '데이터 전처리 및 조화' 단계 또는 'MOFA9 모델'(입력 데이터 유형에 대해 다른 분포를 지정할 수도 있음)에서 설명되어야 하며, 이를 통해 기본 생물학적 프로세스를 반영하는 데이터의 변동을 추출할 수 있습니다.
제시된 워크플로우 내에서 다양한 다중 오믹 데이터 세트를 입력으로 사용할 수 있습니다. 현재 워크플로는 단일 셀 데이터에 대해 널리 사용되는 .h5ad 파일 형식을 허용하고 다른 모든 데이터 세트에 대해 매우 일반적인 .csv 파일 형식을 입력으로 허용합니다(그림 3). 서로 다른 omic 데이터 세트는 매우 다른 파일 형식을 갖는 것이 일반적입니다. 워크플로우 실행을 특정 파일 형식으로 제한하지 않기 위해 .csv는 매우 일반적인 형식으로 사용됩니다. 따라서 모든 종류의 다양한 오믹스 데이터 세트를 워크플로우의 입력으로 사용할 수 있지만 이 워크플로우 내에서 사용하기 전에 먼저 그림 3에 표시된 대로 해당 .csv 형식으로 변환해야 합니다. 이것은 스프레드시트 또는 omic 특정 소프트웨어를 사용하여 준비할 수 있습니다. 서로 다른 오믹스 데이터 세트를 전처리하기 위해 워크플로우 내에서 여러 옵션을 사용하여 02_Pre_Processing_Configs.csv 및 02_Pre_Processing_Configs_SC.csv 파일을 구성하여 서로 다른 입력 데이터 세트에 다양한 전처리 및 정규화 단계(예: 라이브러리 크기 조정, 로그 변환, 샘플 분위수 정규화)를 적용할 수 있습니다(그림 2). 그럼에도 불구하고 여기에서 사용 가능한 옵션은 주로 여기에 제시된 데이터 세트(scRNA-seq, cytokine assay, proteomics, prime-seq)에서 사용할 수 있는 특정 입력 데이터를 기반으로 합니다. 다른 omics/data type을 사용하는 경우 기존 모범 사례에 따라 추가 omic-specific normalization 단계를 적용해야 할 수 있습니다. 이 경우 데이터는 이미 사전 처리된 형태로 워크플로우에 전달될 수 있으며 추가 사전 처리 단계를 적용하지 않고도 다른 데이터 세트와 함께 통합됩니다. 대부분의 경우 Feature Wise Quantile Normalization 단계를 적용하면 모든 데이터 유형의 분포를 정규 분포에 맞추고 서로 다른 입력 기능 간의 다운스트림 분석을 가우스 노이즈의 모델 사양과 더 비교 가능하고 호환성이 높게 만드는 데 유용합니다.
워크플로우 실행 중에는 데이터 통합 프로세스와 후속 생물학적 다운스트림 해석을 지원하는 여러 플롯과 출력이 생성됩니다. scRNA-seq 데이터의 경우 FIG01_Amount_of_Cells_Overview 의 그림(그림 6)은 어떤 세포 유형이 샘플당 너무 적은 수의 세포를 포함할 수 있는지를 나타내고 세포 유형은 유전자 발현 신호를 신뢰성 있게 측정할 수 없습니다. 후속 분석에서는 샘플당 세포 유형의 모든 세포에 대한 평균값이 발현 추정치로 사용됩니다(psedobulk- 접근법). 이 사용 사례에서는 대부분의 샘플에서 셀이 3개 미만인 셀 유형을 제외합니다.
분산 분해 플롯 FIG03_Overview_Variance_Decomposition(그림 7, 보충 그림 1)은 서로 다른 데이터 소스가 얼마나 잘 통합되는지, 그리고 서로 다른 데이터 소스의 분산이 얼마나 공유되고 각 데이터 소스에 고유한지를 나타낼 수 있습니다. 예를 들어, 여기에 사용된 데이터 세트에서 다양한 전처리 전략을 테스트하면 예를 들어 전처리에서 기능별 분위수 정규화 단계를 제거하면 특정 데이터 보기에 더 집중되는 잠재 요인이 발생하고 단백질체 데이터와 다른 데이터 소스의 통합이 감소한다는 것을 알 수 있습니다. 이는 설명된 분산의 감소된 양에서 볼 수 있습니다(보충 그림 1B). 기능을 필터링하지 않거나 정규화 없이 MOFA 모델을 실행하면 잠재 요인에 의해 캡처된 서로 다른 보기 간의 공유 분산이 줄어듭니다(보충 그림 1C). 이는 잠재 요인이 주로 데이터 유형별 기술적 효과를 반영한다는 것을 나타냅니다. 그 외에도 MOFA9 모델 자체는 제대로 사전 처리되지 않은 데이터의 경우 경고를 반환할 수도 있습니다. 이러한 경고의 예는 대체 전처리 구성 MI_v2 및 MI_v3에 대한 보충 그림 1에 나와 있습니다(특정 예제 구성 파일은 config_examples 폴더의 복제된 GitHub 리포지토리에 저장됨).
또한 MOFA 모델을 실행한 후 요인을 샘플에 대한 알려진 생물학적 메타 정보뿐만 아니라 요인에 의해 포착된 변동의 가능한 원인을 식별하기 위한 기술 및 기타 교란 공변량(04_Downstream_Factor_Analysis)과 연결하여 여러 다운스트림 분석에서 결과를 평가할 수 있습니다. 예를 들어, MOFA 모델의 요인 중 하나가 기술적 공변량(예: 배치 정보) 중 하나와 밀접하게 연관되어 있는 경우 이 요인이 생물학적 변동 대신 데이터 내의 기술적 변동을 포착한다는 것을 나타낼 수 있습니다.
다운스트림 분석 부분에서 생물학적 해석의 범위를 좁히기 위해 입력 데이터 세트를 기반으로 한 몇 가지 결과(보다 정교한 해석은 원래 출판물11에서 찾을 수 있음)가 여기에 요약되어 있습니다. 첫 번째 단계에서는 적용된 전처리 전략을 통해 여러 세포 유형뿐만 아니라 다른 오믹스 데이터 유형에서도 차이를 포착하는 여러 요인을 찾을 수 있음을 관찰할 수 있습니다(그림 7A). 예를 들어, Factor 2는 scRNA-seq 데이터 세트의 임상 입력 특징과 여러 세포 유형의 분산을 캡처합니다. 처음 세 가지 요인을 'CRP' 및 'CK'와 같은 관련 임상 공변량과 연관시키고(그림 7B) 서로 다른 환자 하위 그룹에 대한 요인 값의 차이를 조사한 결과, '대조군(CCS 및 비CCS 포함)' 대 'ACS'와 서로 다른 시점(TP1-TP4)에서 측정된 결과(그림 7C), Factor2는 'CK' 값과 유의한 연관성이 있고 Factor3은 'CRP' 값과 유의하게 연관되어 있음을 알 수 있습니다. 동시에 TP1 및 TP2의 'ACS' 샘플(심근경색(MI)에 대한 면역 반응의 급성 단계를 반영)은 'Control' 및 이후 시점 샘플(TP3/TP4)에 비해 요인 값이 증가했음을 보여줍니다. CK는 심근 손상의 알려진 지표이며 일반적으로 Factor2에 의해 포착된 패턴과 유사하게 TP1/TP2에서 값이 증가하는 것이 특징입니다.
Factor2를 형성하는 생물학적 과정에 대한 통찰력을 얻기 위해 모델(03_Weight_Data.csv)에서 생성된 기능 가중치 테이블을 확인하여 팩터의 최상위 기능을 평가합니다. 요인에 대한 절대 가중치가 가장 높은 특징의 상위 1%를 분석하면 주로 CD4를 찾을 수 있습니다. TCM 및 CD14. 단일에서 파생된 특징은 입력 특징의 전체 수에 비해 과대 대표되며(그림 8A), 이는 이러한 세포 유형이 MI 이후의 염증 과정에서 매우 관련성이 높다는 것을 나타냅니다(참고: 전처리에서 기능별 분위수 정규화가 적용되지 않은 경우 특징의 다른 분포도 이 결과에 영향을 미칠 수 있으며 평가는 데이터 유형별로 별도로 수행해야 함). CD4의 주요 기능 분석. 인자에서 TCM 세포 유형을 살펴보면, 강력한 T 세포 활성화에 필요한 EIF3E18 및 T 세포의 확장 및 활성화를 촉진하는 HMGB119와 같은 몇 가지 흥미로운 유전자를 찾을 수 있습니다(그림 8B). 다음으로, REACTOME20 데이터베이스의 면역 경로를 경로 세트(Prepared_Pathway_Data.csv)로 사용하여 경로 농축 분석을 실행합니다. 우리는 '인터루킨-6' 신호전달을 포함한 여러 '인터루킨' 경로에 대한 농축을 발견합니다. scRNA-seq 데이터의 서로 다른 세포 유형에서 여러 유전자의 발현 수준과 Cytokine 분석으로 측정한 'IL6' cytokine 값이 이 결과에 기여했습니다(그림 8C). 데이터 유형 전반에 걸쳐 이러한 공유 패턴을 식별하면 통합 분석의 부가 가치를 강조할 수 있습니다. 전반적으로, 이 접근법은 또한 질병 상태 또는 관련 치료 결과를 반영하는 여러 다른 요인들을 식별할 수 있으며, 이는 해당 간행물11에 더 상세히 설명되어 있다.
여러 오믹스에 걸친 통합 분석의 이점을 더욱 강조하기 위해 단백질체학 입력 데이터만 포함하여 동일한 워크플로우도 실행되었습니다(보충 그림 4). 결과 요인을 분석하면 통합 분석과 유사하게 'CRP' 값과 강한 상관 관계가 있는 요인(Factor1)을 찾을 수 있습니다. 이 패턴은 단백질체학 데이터 내 변동의 주요 원인을 설명하며, 통합 분석에서 'Factor3'에 의해 캡처된 다른 데이터 세트의 일부 변동과도 일치합니다(그림 7C). 그러나 통합 분석에서 염증의 시간 경과를 포착하는 Factor2에서 나타내는 것과 유사한 패턴은 단백질체학 데이터만으로는 식별할 수 없습니다.
소개된 워크플로우와 MOFA9 모델 자체는 조정 가능한 많은 매개변수로 고도로 사용자 정의할 수 있습니다. 따라서 서로 다른 구성으로 생성된 결과를 시각화하고 체계적으로 비교하는 것이 중요합니다. 이 작업을 용이하게 하기 위해 워크플로에서 생성할 수 있는 최종 출력은 전처리 및 모델 추정에서 서로 다른 매개 변수를 사용하여 파이프라인의 서로 다른 명명된 실행을 비교하는 것입니다. 예를 들어, MOFA 모델은 서로 다른 수의 잠재 인자로 추정할 수 있거나(보충 그림 2A) 더 적은 수의 기능을 가진 뷰에 가중치를 부여할 수 있습니다(보충 그림 3A). 워크플로우 '07_Compare_Models'의 마지막 스크립트를 구성하고 실행하면 서로 다른 파이프라인 실행 간의 유사성을 평가하기 위한 여러 플롯이 생성됩니다. FIG07_Variance_Model_Comparison(보충 그림 2B, 보충 그림 3B)는 서로 다른 런에 대한 각 뷰에 대해 설명된 총 분산의 비교를 보여줍니다. 서로 다른 런 간의 요인 값과 기능 요인 가중치의 상관 관계는 특정 매개변수를 수정할 때 결과가 얼마나 변경되는지를 나타낼 수 있습니다(보충 그림 2C, 보충 그림 3C). 여기서 요인의 수를 수정하면 추정된 요인 값과 특징 가중치에 약간의 변경만 발생합니다(보충 그림 2C). 데이터 보기의 가중치를 수정하면 기능 수가 더 적은 보기(예: '임상' 보기)에서 훨씬 더 높은 설명 분산이 발생합니다(보충 그림 3B). 그럼에도 불구하고, 처음 세 가지 요인 내의 관련 특징은 가중치가 적용되지 않은 버전에서 추론된 특징과 여전히 높은 상관관계가 있습니다(보충 그림 3C).
생성된 모델 출력 .csv 결과 폴더의 파일(예: 추정된 계수 및 피처 가중치)을 사용하여 추가적인 개별 다운스트림 분석을 수행할 수 있습니다. 모든 코드 및 필요한 구성 파일(문서 포함)은 GitHub(https://github.com/heiniglab/mofa_workflow)에서 사용할 수 있습니다. 분석에 필요한 conda 패키지를 쉽게 설치할 수 있도록 생성된 특이점 이미지는 https://doi.org/10.5281/zenodo.10815146 에서 다운로드할 수 있습니다. 파이프라인의 초기 테스트를 수행하는 데 사용할 수 있는 작은 예제 데이터 세트도 동일한 zenodo 레코드에서 다운로드할 수 있습니다.

그림 7: MOFA 출력 분석. MOFA 모델(03_Run_MOFA.ipynb)의 실행 및 요인 값의 다운스트림 분석(04_Downstream_Factor_Analysis.ipynb) 후 여러 플롯이 생성됩니다. (A) FIG03_Overview_Variance_Decomposition: 다양한 보기 내에서 추정된 MOFA 계수의 설명된 분산에 대한 시각화를 반환합니다. 히트맵(왼쪽): 각 뷰에 대한 팩터에 의해 캡처된 뷰의 총 분산의 백분율을 표시합니다. 막대 그래프(오른쪽): 각 뷰에 대한 모든 요인에 의해 포착된 분산의 총 백분율을 표시합니다. (B) FIG04_Factor_Association_Numerical_Features: 선택한 숫자 표본 공변량과 요인 값의 Pearson 상관 관계를 보여줍니다(여기서는 임상 변수(CRP, CK)). (C) FIG04_Factor_Association_Categorical_Features: 범주형 표본 공변량에 대한 요인 값의 차이를 상자 그림으로 표시합니다. 여기서, ACS와 대조군 환자의 각 시점에 대한 Factors1-3의 요인 값을 비교한다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 8: MOFA 기능 분석. 다운스트림 해석(04_Downstream_Factor_Analysis.ipynb, 05_Downstream_Investigate_Features.ipynb)을 실행한 후 여러 플롯이 생성됩니다. 여기의 모든 플롯은 MOFA 요인 2를 시각화합니다. (A) FIG04_Top_Feature_Overview_per_Factor: 히트맵(왼쪽)은 각 뷰에 대해 선택한 요인에 의해 캡처된 분산의 백분율을 보여줍니다. 막대 그래프(오른쪽)는 요인에 대한 여러 보기의 기능 간의 관련성을 나타냅니다. 왼쪽에는 요인에 대한 뷰에서 상위 1% 가장 높은 순위의 피처 내에 있는 특정 뷰의 총 피처 수가 제공됩니다. 오른쪽에는 상위 1%의 총 수를 해당 뷰의 총 피처 수로 나눈 백분율이 제공됩니다. (B) FIG05_Heatmap_Feature_Overview: 히트맵(왼쪽)은 CD4의 기능 중 가장 높은 순위의 1%를 보여줍니다. TCM 세포 유형: '대조군' 환자(CCS 및 비CCS) 환자를 'ACS' 환자에 대한 다른 시점과 비교하는 각 검체의 정규화된 발현 값. 막대 그래프(오른쪽)는 피처의 가중치를 보여줍니다. 무게의 부호의 방향은 세포 유형 이름 앞에 왼쪽에 앞에 표시된다: '+' 긍정적인 요인 무게; '-' 음수 계수 가중치. (C) FIG06_Pathway_and_Genes: 농축된 인터루킨 경로에 속하는 인자에 대해 가장 높은 25% 순위의 유전자의 가중치를 보여줍니다. 위쪽의 히트맵에서는 조회수 전체의 평균이 계산되고 하단의 히트맵에는 조회수별로 표시됩니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
보충 그림 1: 데이터 조화 효과. 이 그림은 여러 가지 다른 데이터 전처리 구성에 대한 FIG03_Overview_Variance_Decomposition 보여줍니다: 서로 다른 보기 내에서 추정된 MOFA 요인의 설명된 분산을 시각화합니다. 히트맵(왼쪽): 각 뷰에 대해 요인에 의해 캡처된 뷰의 총 분산의 백분율을 표시합니다. 막대 그래프(오른쪽): 각 뷰에 대해 모든 요인에 의해 캡처된 분산의 총 백분율을 표시합니다. (A) 이전 그림에서 생물학적 다운스트림 결과를 분석한 기반이 되는 구성('MI_v1')입니다(복제된 저장소의 기본 구성 파일에서 설정된 매개변수). (B) 'MI_v1'와 동일한 전처리 구성과 기능별 분위수 정규화가 적용되지 않는다는 수정 사항(저장소의 'config_examples' 폴더에 있는 예시적 구성 파일에서와 같이 설정된 매개변수). 이 구성에 대한 MOFA 모델 출력 경고의 스크린샷이 아래 플롯에 추가됩니다. (C) 전처리 단계가 적용되지 않고 모든 데이터가 기능의 전처리 또는 필터링 없이 입력으로 사용되는 경우(저장소의 'config_examples' 폴더에 있는 예시적인 구성 파일에 설정된 매개변수) 결과 분산 분해. 이 구성에 대한 MOFA 모델 출력 경고의 스크린샷이 아래 플롯에 추가됩니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.
보충 그림 2: MOFA 구성 - 요인 금액 효과. MOFA 모델을 실행하기 위해 여러 가지 다른 구성을 사용하여 '07_Compare_Models.ipynb' 스크립트에 의해 생성된 결과 그림입니다. (A) '03_MOFA_configs.csv': 여러 가지 다른 양의 요소(10,15,20,25)를 지정하는 '03_Run_MOFA.ipynb' 스크립트를 실행하는 데 사용되는 다양한 구성의 예입니다. '07_Comparison_configs.csv': '07_Compare_Models.ipynb' 스크립트 실행을 위한 구성 입력 파일을 지정하는 방법의 예입니다. (B) 모델에 지정된 모든 요인에 걸쳐 서로 다른 모델에 대한 각 보기(y축)에 대해 설명된 총 분산을 보여주는 'FIG07_Variance_Model_Comparison'. (C) 서로 다른 구성 간의 요인 샘플 값의 상관 관계를 보여주는 'FIG07_Factor_Correlations'. 이 파일을 다운로드하려면 여기를 클릭하십시오.
보충 그림 3: MOFA 구성 - 가중치 뷰의 효과. MOFA 모델을 실행하기 위해 여러 가지 다른 구성을 사용하여 '07_Compare_Models.ipynb' 스크립트에 의해 생성된 결과 그림입니다. (A) '03_MOFA_configs.csv': 'weighting_of_views' 매개 변수를 'TRUE'(MI_v1_MOFA_weighted) 또는 'FALSE'(MI_v1_MOFA)로 지정하는 '03_Run_MOFA.ipynb' 스크립트를 실행하는 데 사용되는 다양한 구성의 예입니다. '07_Comparison_configs.csv': '07_Compare_Models.ipynb' 스크립트 실행을 위한 구성 입력 파일을 지정하는 방법의 예입니다. (B) 모델에 지정된 모든 요인에 걸쳐 서로 다른 모델에 대한 각 보기(y축)에 대해 설명된 총 분산을 보여주는 'FIG07_Variance_Model_Comparison'. (C) 서로 다른 구성 간의 특징 계수 가중치의 상관 관계를 보여주는 'FIG07_Feature_Correlations'. 이 파일을 다운로드하려면 여기를 클릭하십시오.
보충 그림 4: 다중 오믹 통합 효과 - 단백질체 데이터만 사용. 단백질체학 데이터만 입력으로 사용할 때 잠재 인자에 의해 캡처된 결과 패턴입니다. (A) FIG04_Factor_Association_Numerical_Features: 요인 값과 임상 변수(CRP, CK)의 Pearson 상관 관계. (B) FIG04_Factor_Association_Categorical_Features: ACS 및 대조군 환자의 각 시점의 요인 값에 대한 상자 그림 비교. 이 파일을 다운로드하려면 여기를 클릭하십시오.
보충 파일 1: Supplementary_File_
Running_Pipeline_with_Exemplary_Data. 예제 데이터에서 파이프라인을 실행하는 방법 및 예상 출력에 대한 설명은 추가로 제공되는 추가 파일에 제공됩니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.
보충 비디오 파일 1: 프로토콜의 화면 캡처 비디오. 이 파일을 다운로드하려면 여기를 클릭하십시오.
설명된 프로토콜을 사용하면 복잡한 다중 오믹스 데이터 세트를 빠르게 탐색하는 데 사용할 수 있는 확장 가능한 모듈식 Jupyter 노트북 기반 워크플로가 제공됩니다. 워크플로우의 주요 부분은 전처리 및 데이터 조화 부분(데이터 필터링 및 정규화를 위한 다양한 표준 단계 제공), MOFA9 모델 추정 및 몇 가지 예시적인 다운스트림 분석으로 구성됩니다. 가장 중요한 단계 중 하나는 서로 다른 오믹스 데이터 세트를 사전 처리 및 통합하고 조화시키는 것입니다. 여기에서는 scRNA-seq 데이터, prime-seq bulk RNA, 사이토카인 분석, 혈장 단백질체학 및 임상 값으로 구성된 데이터 세트에 대한 전략을 제시하며, 그 결과 MI11에서 관련 생물학적 프로세스를 식별하는 데 사용할 수 있는 통합되고 조화로운 데이터 세트가 생성되었습니다. 다른 omic 데이터 세트에 추가 데이터 전처리 전략이 필요한 경우 MOFA 분석 전에 실행해야 합니다. 그런 다음 전처리된 데이터를 현재 워크플로에 대한 입력으로 사용할 수 있습니다. 모델의 출력은 서로 다른 데이터 세트의 통합 품질과 사전 처리의 효과를 평가하여 잠재적인 기술적 효과를 식별하는 데 사용할 수 있습니다. 예를 들어, 최소한의 전처리 및 정규화 단계만 적용하여 시작한 후 추가 정규화의 효과를 평가할 수 있습니다. 이 응용 분야에서는 'feature wise quantile normalization'을 추가하면 단백질체학이 나머지 분석과 더 잘 통합되는 것으로 관찰되었습니다.
워크플로우의 또 다른 큰 부분은 샘플 수준에서 집계된 데이터에 대한 MOFA9 모델의 추정입니다. 다음과 같은 MOFA 모델의 다른 확장이 있습니다
MOFA+21(특히 단일 셀 데이터용), MEFISTO22 (특히 시간 구성 요소를 포함한 데이터용) 및 MuVI23 (요인 분석 접근 방식에 도메인 지식 통합). 이는 특정 유형의 데이터 세트 또는 설정에 대한 메서드의 매우 유용한 확장이지만 이를 적용하려면 특정 요구 사항이 있습니다. 예를 들어, 우리의 경우 단일 세포 데이터에 대해 특별히 MOFA+21 을 사용하면 사용 가능한 샘플 수준의 다른 오믹스 데이터를 쉽게 사용할 수 없다는 것을 의미합니다. MEFISTO22 방법을 사용하면 시간 경과를 구체적으로 모델링할 수 있지만 여러 시점을 사용할 수 없는 설정이나 한 시점에서만 측정값이 있는 'Control' 샘플을 'ACS' 샘플의 시간 분해 데이터와 결합하는 경우에는 적용할 수 없습니다. 따라서 이 매우 일반적인 워크플로에서는 너무 많은 요구 사항 없이 모든 종류의 데이터 세트를 빠르게 탐색할 수 있는 가장 유연한 방법인 MOFA9 방법을 사용하기로 선택합니다. 참고로, 워크플로우에서 생성된 사전 처리된 데이터는 이러한 방법을 사용하여 분석할 수도 있으며, 데이터 세트가 메서드의 요구 사항과 호환되는 경우 현재 스크립트를 확장하여 이러한 메서드를 통합할 수도 있습니다. 추가 사용 사례, 자습서 및 설명서는 MOFA developers24의 GitHub 리포지토리를 참조하십시오.
주성분 분석(PCA)과 같은 훨씬 더 일반적인 차원 축소 방법과 비교할 때 MOFA9 모델은 특히 다중 오믹스 환경에서 몇 가지 이점을 제공합니다. 예를 들어, 분산 분해는 입력 뷰별로 쉽게 분석할 수 있으며, 가중치를 다른 뷰에 할당하여 서로 다른 수의 기능을 고려할 수 있습니다. 이 모델은 희소성을 장려하여 결과의 해석 가능성을 높입니다. 또한 오믹스 중 하나에서 데이터가 누락된 샘플은 제외할 필요가 없으며, 모델은 희소 기능 계수 가중치를 학습하는 데 초점을 맞추기 위해 일부 기능을 구현합니다. 또한 MOFA 모델은 서로 다른 분포로 특성화된 데이터를 통합하기 위한 몇 가지 설정을 제공합니다('가우스', '베르누이' 또는 '푸아송' 가능성 모델링). 이 워크플로에서는 '가우스' 분포를 따르도록 정규화하는 연속 데이터만 통합하지만 필요한 경우 기존 코드를 확장하여 다른 데이터 유형을 통합할 수도 있습니다. 특히 scRNA-seq 데이터에 대해 scITD25와 같은 다른 분해 기반 방법이 존재하지만, 이러한 방법은 다른 오믹스와 함께 작동하도록 설계되지 않았다는 제한이 있습니다.
제시된 워크플로우는 데이터 내에서 변동을 유발하는 잠재적인 생물학적 프로세스 및 기타 기능을 식별하기 위해 크고 복잡한 다중 오믹스 데이터 세트의 비감독 탐색을 위한 프로토콜을 보여줍니다. 예를 들어 질병 또는 기타 생물학적 또는 기술적 교란으로 인한 데이터 변동을 조사해야 하는 거의 모든 환경에 적용할 수 있습니다. 그 결과로 생성된 다운스트림 분석 및 기능 세트는 서로 다른 오믹스 간의 분산을 주도하여 특정 맥락에서 더 자세히 조사할 수 있는 관련 생물학적 프로세스를 드러낼 수 있습니다. 예를 들어, 질병의 맥락에서 새로운 진단 마커 또는 치료 대상을 식별할 수 있습니다.
저자는 이해 상충이 없음을 선언합니다.
CL은 공동 연구 학교인 "Munich School for Data Science - MUDS"에서 Helmholtz Association의 지원을 받고 있습니다.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Apptainer | NA | https://apptainer.org/docs/admin/main/installation.html | |
| 컴퓨팅 서버 또는 워크스테이션 또는 클라우드 (Linux, Mac 또는 Windows 환경). 다양한 입력 데이터 세트의 크기에 따라 적절한 시스템에서 워크플로를 실행하는 것이 좋습니다(이 설정에서는 16 CPU, 64GB 메모리 사용) | 모든 제조업체의 | 16 CPU, 64GB 메모리 | 대용량 메모리는 원시 단일 셀 데이터 처리에만 필요합니다. 전처리 후 일반 데스크톱 또는 랩톱 컴퓨터에서도 분석 단계를 수행할 수 |
| git | NA | NA https://git-scm.com/book/en/v2/Getting-Started-Installing-Git | |
| GitHub | , GitHub, | NA | https://github.com/heiniglab/mofa_workflow |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청