방법 논문

전사체 데이터를 활용해 정보 흐름 모델링을 사용하여 맥락 특이적 단백질 상호작용 네트워크를 구축하는 NetDecoder 프로토콜

DOI:

10.3791/70869

2026년 7월 31일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

여기서는 네트워크 모델링 도구인 NetDecoder를 사용하여 상황에 맞는 단백질 상호작용 네트워크를 구축하고 유전자 유틸리티 모델(GUM)을 구축하는 프로토콜을 제시합니다. 전사체 데이터를 활용하고 큐레이티드 단백질-단백질 상호작용(PPI) 네트워크를 결합하여 NetDecoder는 주요 표적과 서브네트네트워크를 식별할 수 있게 합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

차별 발현 분석은 잠재적 치료 표적을 결정하는 데 흔히 사용되는 기법이지만, 생물학적 경로 전반에 걸친 유전자 네트워크의 복잡성을 간과합니다. 종종 고발현된 유전자가 생물학적 표현형의 특성을 반드시 설명하지 못합니다. NetDecoder는 전사체 데이터를 단백질-단백질 상호작용(PPI) 네트워크와 통합하여 맥락 특이적 정보 흐름, 유전자 유용성, 주요 엣지 및 차등 활용 유전자 네트워크를 모델링하는 네트워크 생물학 도구로, 차별 발현 분석의 한계를 해결하기 위해 개발되었습니다.

이 프로토콜은 초보자 친화적인 단계별 NetDecoder 사용법 가이드로, 데이터 전처리, NetDecoder 실행, 출력 분석에 대한 포괄적인 가이드를 제공합니다. 워크플로우에는 유전자(노드) 및 유전자-유전자 상호작용(엣지 수준) 차이를 정량화하기 위한 소프트웨어 구성, 네트워크 구축, 흐름 기반 모델링 분석이 포함됩니다. 결과물에는 핵심 표적과 라우터, 차등 흐름 서브네트워크, 엣지 플로우 분포가 포함되어 특정 생물학적 상태와 관련된 주요 조절 유전자와 경로를 식별할 수 있게 합니다. 제시된 단계를 따르면 연구자들은 전사체 데이터와 엄선된 PPI 네트워크를 활용해 표현형 간 표현형 유전자 흐름을 독립적으로 밝혀낼 수 있을 것입니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

유전자와 치료 연구를 위한 관련 경로의 선정은 종종 차별발현분석에 의해 주도됩니다. 이 분석 방법은 두 가지 이상의 조건 간 유전자 발현의 차이를 효과적으로 파악합니다. 하지만 유전자는 복잡하고 상호 연결된 생물학적 네트워크 내에서 기능하기 때문에, 개별 유전자 발현만으로는 네트워크 내에서 유전자들이 어떻게 상호작용하는지와 그 유전자-유전자 관계를 완전히 포착하지 못합니다2. 네트워크 전파 방법은 유전자 발현과 상호작용 네트워크를 통합하여 차별 발현만으로는 놓칠 수 있는 생물학적으로 중요한 유전자를 식별합니다. 현재의 접근법은 유전자의 기능적 중요성과 생물학적 정보가 생물학적 조건 전반에 걸쳐 단백질-단백질 상호작용(PPI) 네트워크 내에서 어떻게 재분배되는지를 명확히 정량화하지 않고 있습니다. 따라서 조건별 네트워크 행동을 모델링하고 생물학적 시스템 전반에 걸친 정보 흐름 변화를 정량화하는 방법이 필요했습니다. 유전자가 더 넓은 생물학적 네트워크 내에서 어떻게 상호작용하는지 설명하기 위해, 네트워크 생물학 플랫폼인 NetDecoder가 개발되어 조건 간 정보 흐름 차이가 가장 큰 유전자를 발견했습니다. NetDecoder는 프로세스 유도 흐름 알고리즘을 사용하여 인간 PPI 네트워크에 대한 기존 지식을 변환하고, 대량 RNA 시퀀싱 데이터를 결합하여 정보 흐름 기반 상호작용 모델을 구축합니다.

표현형 네트워크를 위한 정보 흐름 데이터를 이용하여, 정보 흐름이 높은 유전자를 발현 값과 관계없이 네트워크 내에서 가장 높은 유전자 유용성을 가진 유전자를 식별하는 유전자 효용 모델(GUM)5를 개발할 수 있습니다. 이 접근법은 보다 효과적인 목표 우선순위 지정 전략과 식별을 지원하며, 전통적인 분석이 종종 놓치는 통찰을 제공합니다. 기존의 차별 발현 또는 상관관계 기반 네트워크 방법과 달리, NetDecoder는 유전자(노드 수준)와 상호작용(엣지 수준) 정보 흐름 변화를 모두 정량화하여, 큰 발현 변화가 없더라도 기능적으로 중요한 유전자를 식별할 수 있게 합니다 4,5. NetDecoder는 두 생물학적 상태 간의 비교 분석이 필요한 대량 RNA 시퀀싱 데이터셋에 널리 적용할 수 있으며, 정보 흐름과 네트워크 조직의 변화를 식별할 수 있습니다. NetDecoder는 프로테오믹스와 후생유전체학 등 다른 오믹스 데이터셋의 통합을 지원하지만, 본 프로토콜은 전사체 데이터를 이용한 워크플로우를 구체적으로 시연합니다. 이러한 응용 프로그램에서는 단백질이나 후생유전학적으로 조절된 유전자를 기반으로 소스 유전자를 정의할 수 있어, 이러한 분자 특징으로부터 정보 흐름 분석을 시작할 수 있습니다. 이러한 유연성은 다중 오믹스 증거를 네트워크 기반 분석에 통합할 수 있게 하며, 표현형 차이의 근본적인 교차 모달 조절 메커니즘 발견을 촉진합니다.

일반적인 연구 설계는 질병과 건강한 상태, 치료 반응자와 비반응자, 약물 치료, 녹다운 또는 녹아웃 대 대조군 실험, 발달 또는 세포 상태 전이 분석 등 이분법 비교를 포함합니다. 이 프로토콜의 목표는 생물학적 조건 전반에 걸쳐 네트워크 영향이 변화된 유전자를 발견하기 위해 NetDecoder를 적용하는 재현 가능한 프레임워크를 보여주는 것입니다. 이는 NetDecoder 설정 및 실행을 위한 쉽게 따라할 수 있는 단계, 기본 문제 해결 기법, 결과 해석 방법도 프로토콜에 안내되어 있습니다.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 공개된 RNA 시퀀싱 데이터셋을 사용했으며, 인간이나 동물 대상자를 직접 참여시키지 않았습니다. 따라서 기관 심사위원회의 승인과 사전 동의는 필요하지 않았습니다.

참고: NetDecoder는 다음 입력 파일을 요구합니다: 두 가지 정의된 생물학적 조건에 걸친 정규화된 유전자 발현; 생물학적 조건을 설명하는 메타데이터 파일; 네트워크 구축 및 모델링을 위한 출처 유전자 목록; 공개된 단백질-단백질 상호작용(PPI) 네트워크; 그리고 각 생물학적 조건에 맞게 구축된 엣지 가중 네트워크(EWN)가 있습니다.

1. 데이터 준비

  1. 대량 RNA 시퀀싱 발현 데이터 및 메타데이터 검색
    1. RNA 시퀀싱 데이터(원시 유전자 발현 개수 및 샘플명 매트릭스)와 해당 메타데이터(샘플명, 상태 등)를 Gene Expression Omnibus(GEO)와 같은 공개 저장소에서 다운로드하거나, 실험실에서 생성된 실험 데이터셋을 사용할 수 있습니다. 일반적으로 행은 유전자 이름을, 열은 샘플 이름에 해당하는 행렬입니다.
      참고: 이 프로토콜을 시연하는 데 사용된 예제 데이터셋은 국가 옴믹스 데이터 백과사전(NODE) 저장소(BioSino 데이터베이스)의 accessionOEP001105 6에서 획득했습니다. 사용자는 자신의 대량 RNA 시퀀싱 데이터셋을 대체할 수 있습니다.
    2. 샘플 이름과 그 그룹 또는 관련 조건을 포함하여 샘플 주석 파일(메타데이터)을 생성하세요; 예를 들어, '대조군'과 '질병'은 흔한 상태 유형입니다. 메타데이터와 표현식 파일 간에 샘플 이름이 일치하는지 확인하세요.
  2. 집계 표현 데이터 및 메타데이터
    1. 생성된 데이터 매트릭스에 발현 개수, 유전자 이름, 샘플 이름과 조건이 포함된 메타데이터 파일이 포함되는지 확인하세요. 필요하다면 org 같은 R 패키지를 사용하세요. Hs.eg.db(인간) 또는 주석 Dbi로 서로 다른 유전자 식별자를 매칭합니다.
    2. R이나 유사한 프로그래밍 언어를 사용해 메타데이터 파일에서 필수적이지 않은 정보를 제거하세요.
    3. 표현식 카운트 파일의 정보를 하나의 파일로 합쳐 쉽게 조작할 수 있습니다.
  3. 필터 표현식 데이터
    1. 유전자 발현 데이터 매트릭스를 전처리하여 유전자 중복, 무효값(NA), 저발현(< 총 개체수), 및/또는 분산이 낮은 유전자 등을 제외합니다.
  4. 데이터 전처리
    1. RNA 시퀀싱 정규화 및 차별 발현 분석
      참고: 이 단계는 대량 RNA 시퀀싱 데이터를 분석할 때 엣지 가중 네트워크(EWN) 생성 및 소스 유전자 선택(1.5–1.6단계)을 위한 두 가지 (1.4.2) 접근법 중 하나(1.4.1)입니다. 대안으로, 1.4.3단계로 건너뛰면 Pearson 상관관계 기반 템플릿 매칭을 사용할 수 있습니다.
      1. 이 단계에서 R 패키지인 AnnotationDbi를 사용하여 개별 유기체 패키지와 함께 유전자 ID 변환을 수행합니다. NetDecoder는 예시 PPI와 일치하는 유전자 기호(즉, 유전자 ID)를 사용합니다.
      2. Limma, edgeR, DESeq2 또는 유사한 도구를 사용하여 두 조건 간의 정규화 및 차별 표현 분석을 수행합니다.
      3. DESeq2를 사용할 경우, DESeqDataSetFromMatrix() 함수를 사용하여 DESeq 데이터셋을 구성하고, 입력값은 유전자 및 샘플, 샘플 메타데이터(조건)를 사용합니다.
      4. 1.4.1.3 단계에서 생성된 객체에 기본 설정으로 DESeq() 함수를 사용하여 차분식 값을 계산하세요.
      5. 결과를 유전자 식별자(유전자 ID)를 행 이름으로, log2 접수 변경(log2FC), p-값, 조정된 p-값을 포함한 주요 출력을 포함하는 데이터 매트릭스에 저장하세요.
      6. 선택적으로, dplyr 또는 유사한 도구를 사용해 조정된 p-값(<0.05) 및/또는 log2FC 값(예: |log2FC| > 1)으로 결과를 필터링할 수 있습니다.
      7. 처리된 모든 유전자 목록과 log2 폴드 변화 행렬은 NetDecoder에 입력할 수 있도록 탭 구분(.txt 또는 .csv) 파일로 내보내야 합니다.
      8. 2가지 이상의 생물학적 조건이 사용될 경우 1.4.1단계에서 쌍별 비교를 수행하고, 1.4.1.5단계에서 생성된 DESeq 객체의 result() 함수를 사용하여 쌍별 결과를 얻습니다.
    2. 마이크로어레이 표현 정규화 - 선택 사항
      참고: 마이크로어레이 데이터를 사용할 경우, 데이터 정규화를 위해 이 단계를 수행하세요.
      1. NetDecoder 정규화 스크립트(HuLiLab/NetDecoder_Example/raw_data/NetDecoder_normalize를 열어 데이터를 정규화합니다. R), https://github.com/HuLiLab/NetDecoder_Example/tree/main 에서 R-개발 플랫폼에서 접근 가능하며, 셀 강도 파일(CEL)이 포함된 작업 디렉터리와 일치하도록 이탤릭체로 표시된 부분을 편집합니다.
        setwd(~/NetDecoder_Example/raw_data/CEL_files)
    3. 템플릿 매칭 - 선택 사항
      참고: 이는 차별식 분석("데이터 준비" 1.1–1.4.1 단계에 명시된 대로)이 수행되지 않을 경우 두 번째 선택적 접근법입니다.
      1. limma, edgeR, DESeq2를 통해 처리되지 않은 RNA 시퀀싱 데이터의 경우, 템플릿 매칭을 적용하기 전에 외부에서 정규화를 수행하세요. 마이크로어레이 데이터의 경우, 1.1–1.4.2 단계에서 생성된 정규화된 표현식 값을 직접 사용하세요.
      2. 대조군을 유전자 발현의 기준선 템플릿으로 선택하고, 관심 있는 모든 조건의 정규화된 유전자 발현 값을 비교하세요.
      3. 각 유전자의 발현 프로필과 선택한 템플릿 간의 피어슨 상관계수를 계산합니다. 통계적으로 유의한 상관관계(p < 0.05)와 사용자가 정의한 임계값을 초과하는 절대 상관계수(예: |r| > 0.7)를 가진 유전자는 유지하는 것이 권장됩니다.
  5. 출처 유전자 선택
    참고: 이 단계의 입력은 1.1–1.4단계에서 개발된 정규화된 유전자 발현 행렬입니다.
    1. 출처 유전자로 사용할 유의미한 유전자 집합을 선택하세요. 미분식 기반 워크플로우의 경우, 조정된 p값 및 log2FC 임계값(예: adj p-value < 0.05, |log2FC| > 2)을 선택하세요. 템플릿 매칭 워크플로우를 위해, 1.4.3.3단계에서 확인된 유의한 유전자 중에서 선택한 상관관계 및 유의성 임계값을 사용하여 출처 유전자를 선택합니다. 임계값은 약 300–1,000개의 유전자를 생성하여 하위 네트워크 구축을 위해 선택해야 합니다.
      참고: 소스 유전자는 정보 흐름이 시작되어 네트워크를 통해 전파되는 지점입니다.
  6. 각 표현형에 대해 엣지 가중 네트워크(EWN)를 구축하세요
    참고: 이 단계에는 다음 입력이 필요합니다: 1.1–1.4단계에서 개발된 정규화된 유전자 발현 매트릭스; 가장자리 목록(geneA-geneB 쌍)으로 포맷된 단백질-단백질 상호작용(PPI) 네트워크; 각 샘플의 생물학적 상태 라벨을 지정하는 샘플 주석 파일 (메타데이터). PPI 네트워크는 R 객체로 공유되며 iRefIndex 단백질 데이터베이스를 기반으로 구축되었습니다. 이 프로토콜에서 사용된 버전은 모든 직접 상호작용을 포함하지만, 자기 루프와 다중 엣지는 제외되었습니다. PPI 네트워크는 15,608개의 단백질과 180,044개의 상호작용을 포함합니다. 추가 세부 사항은 NetDecoder-메서드4절을 참조하세요.
    1. NetDecoder Edge 가중 네트워크(EWN) 스크립트(HuLiLab/NetDecoder_Example/input/NetDecoder_Create_EWN)를 열어보세요. R은 https:/github.com/HuLiLab/NetDecoder_Example/tree/main)4에서 R-개발 플랫폼에서 접근 가능합니다.
    2. 스크립트의 주석(아래 이탤릭체)으로 표시된 부분을 편집하여 EWN 개발을 위한 사용자 전용 경로와 입력 파일을 설정하세요.
      길<~/NetDecoder_Example/입력/
      이것이 작업 디렉터리로 가는 경로입니다
      expQuery <- get(load("expBreastCancer_15Set2014.R"))
      이것은 정규화된 표현식 행렬 Rdata 객체의 예입니다
      stQuery < read.csv("stBreastCancer.csv")
      이것이 샘플 메타데이터입니다
    3. 발현 매트릭스를 필터링하여 PPI 네트워크에 존재하는 유전자만 남기도록 합니다.
    4. 각 조건에 대해 표현형별 하위 표본을 선택하고 Pearson 상관관계를 사용하여 PPI 네트워크에서 정의된 모든 경계에서 쌍별 유전자-유전자 상관관계를 계산합니다. 1.4단계에서 생성된 처리된 정규화된 표현 행렬을 사용하여 상관관계를 계산합니다.
    5. 각 유전자 쌍에 대해 상관계수, 절대 상관계, 그리고 관련된 p-값을 계산합니다.
    6. 불완전한 경우(예: NA 값)를 제거하세요.
    7. 각 조건당 하나의 엣지 가중 네트워크를 탭 구분된 파일(헤더 없음)로 내보내며, 다음 열을 포함합니다: proteinA, proteinB, abs_cor, cor, pvalue.
    8. R 스크립트를 실행하여 모든 관련 조건에 대해 공동표현 네트워크를 생성합니다.

2. NetDecoder 설치 및 구성

  1. NetDecoder 다운로드
    1. (https://netdecoder.hulilab.org/#ver)에서 R이나 Java를 선택하여 NetDecoder 소프트웨어에 접근하세요.
  2. 필수 소프트웨어 설치
    1. 작업/분석 환경용으로 Oracle JDK와 R을 설치하세요.
    2. NetDecoder 문서에 명시된 대로 Bioconductor (https://netdecoder.hulilab.org/#ver)4를 사용하여 필요한 R 패키지를 설치하세요.
  3. 다운로드 의존성
    1. NetDecoder에 필요한 의존성을 다운로드하세요. 여기에는 유전자 온톨로지 데이터(https://geneontology.org/docs/download-ontology/ 에서 접근 가능)와 유전자 연관 참조 가이드(https://www.ebi.ac.uk/GOA/human_release 에서 접근 가능)가 포함됩니다.
  4. 작업 디렉터리를 설정하세요
    1. 다운로드한 모든 파일(발현 데이터, 각 조건별 생성된 공동 발현 네트워크, 유전자 온톨로지 데이터, 연관 참조 가이드)을 하나의 폴더로 옮기는데, 이 폴더가 NetDecoder 작업 디렉터리가 될 것입니다.
  5. 필요한 서류철을 추가하세요
    1. NetDecoder 폴더(https://netdecoder.hulilab.org/wp-content/uploads/2025/07/NetDecoder_Example.zip)를 NetDecoder 작업 디렉터리에 다운로드하세요.
    2. NetDecoder 폴더를 압축 해제하세요.

3. NetDecoder 실행

  1. 분석 배시 스크립트를 열어
    1. GNU Bash를 실행하는 터미널을 열고 NetDecoder 작업 디렉터리로 이동하세요.
    2. 명령어로 nano NetDecoder_Analysis.sh 을 실행해 bash 스크립트를 엽니다.
  2. 스크립트를 수정하세요
    참고: 대부분의 코드는 이미 작성되어 있습니다. 이 단계에서는 스크립트에서 지정된 위치에 필요한 매개변수가 명시됩니다.
    1. 간단히 이름을 만드세요:
      이탤릭체로 표시된 부분을 비교 중인 조건으로 수정하세요: myshortname='Your_shortname_here'
    2. 소프트웨어 경로 설정:
      다음 세 가지 경로 정의를 이탤릭체 부분을 편집하여 올바른 경로로 수정하세요:
      JAVA="/your/path/here"
      export R="/너의/길/여기"
      별칭 R="/your/path/here"
    3. 작업 디렉터리 설정:
      이탤릭체 부분을 작업 디렉터리로 수정해 모든 파일에 접근할 수 있는 주소로 바꾸세요: INPUT_DIR="/your/path/here"
    4. NetDecoder 라이브러리 설정:
      이탤릭체로 표시된 부분을 zip 파일에서 2.4단계에서 설치된 NetDecoder 라이브러리로 가는 경로로 수정하세요: LIB_DIR="/your/path/here/netdecoder_lib"
    5. 유전자 온톨로지 및 연관 경로 설정:
      두 디렉터리의 이탤릭체 부분을 선호하는 유전자 온톨로지/연관 파일 위치로 편집하세요.
      SYMBOL=$LIB_DIR/gene_association_file
      GO=$INPUT_DIR/gene_ontology_file
    6. 입력 인자 집합:
      참조 NetDecoder 스크립트에 있는 주석 지침에 따라 다음 다섯 줄의 이탤릭체 부분을 업데이트하세요.
      geneList=$INPUT_DIR/gene_file
      state_trt=치료 상태
      state_ref=기준 조건

      PPI_trt=$INPUT_DIR/treated_co_expression_network_file
      PPI_ref=$INPUT_DIR/reference_co_expression_network_file
    7. 적절한 무대 설정:
      원하는 실행 단계에서 #기호를 제거하여 주석을 풀고, 단계가 완료되면 다시 주석을 달아야 합니다. 1단계는 gen_net_trt이고, 그 다음에 gen_net_ref, 그 다음이 분석 단계, 마지막으로 수집 단계입니다.
      실행 단계부터 시작하는 단계로 설정하세요.
      #STAGE="gen_net_trt"
      #STAGE="gen_net_ref"
      #STAGE="분석"
      #STAGE="collect"
    8. 메인 배시 터미널로 이동하세요:
      Ctrl+X, 그리고 Y를 눌러 저장하고 bash 스크립트를 종료하세요.
  3. NetDecoder 실행
    참고: 성공적으로 실행되면 단말기에 로그 메시지가 나타납니다.
    1. 터미널로 이동해서 ./NetDecoder_Analysis.sh 입력하세요.
    2. 3.2.7 단계에 나열된 순서대로 네 단계를 모두 개별적으로 완료할 때까지 실행하세요.
  4. 결과 검색
    1. 출력 파일과 그래픽 요약으로 이동하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

그림 1에서 보듯, NetDecoder는 데이터 처리, 네트워크 구성, 플로우 기반 분석으로 구성된 구조화된 워크플로우를 통해 작동하며, 출력은 파이프라인의 각 단계에 대응하는 별도의 디렉터리로 조직됩니다. 이 모듈식 구조는 산출물의 체계적인 검증을 가능하게 하여 결과가 각 계산 단계까지 추적될 수 있도록 하고 전반적인 재현성을 지원합니다.

NetDecoder(그림 2)의 성공적인 실행은 네 개의 디렉터리 (분석, 수집, 네트워크, "your_shortname") 에 걸쳐 다양한 조건에 대응하는 데이터를 담은 출력을 생성하며, 여기에는 흐름 값, 서브네트워크, 기타 흐름-상호작용 출력에 대한 도표 및 정량적 출력이 포함됩니다(그림 1, 그림 2, 그림 3). 이 디렉터리들 간에 채워진 파일과 수치가 존재한다는 것은 파이프라인이 제대로 실행되었음을 의미합니다. 반면, 실패한 실행 결과는 누락 및/또는 불완전한 수치가 특징입니다. NetDecoder는 PPI 네트워크 내에서 수천 개의 유전자를 평가하기 때문에, 성공적인 실행은 데이터셋 크기와 사용 가능한 자원에 따라 일반적으로 수 시간의 계산이 필요합니다. 여기서 제시된 대표적인 인간 담도암 분석의 경우, NetDecoder 실행은 리눅스 기반 Puget3(Puget Systems) 워크스테이션에서 약 4–6시간의 런타임이 필요했습니다. 비정상적으로 짧은 실행 시간은 입력 데이터가 잘못 형식화되었거나 파이프라인 실행이 불완전함을 나타낼 수 있습니다. 입력 데이터가 잘못 형식화되거나 파이프라인 실행 실패로 인해 오류 메시지가 발생하여 문제의 원인을 추적할 수 있습니다. 그림 3 은 NetDecoder 성공 실행 후 나타나는 대표적인 출력을 보여줍니다. 여기서 제시된 대표적인 분석은 255개의 담도암 샘플(OEP001105)6에서 RNA 시퀀싱 데이터를 활용하여 I–II기 및 III–IV기 질환 상태를 비교하고 질환 간 정보 흐름 변화를 가능하게 했습니다.

그림 4의 세 개의 히트맵은 네트워크 정보 흐름의 전반적인 변화를 요약하며, 네트워크 내에서 상당한 정보 흐름을 전달하는 라우터 유전자, 중요한 하위 표적 유전자, 또는 크게 영향을 받는 전체 유전자를 포함합니다. 양의 및 음의 차분 흐름이 모두 넓게 분포되어 있다는 것은 정보가 네트워크 전반에 재분배되었음을 나타내며, 균일하게 증가하거나 감소하는 것이 아님을 나타냅니다. 이러한 이질성과 다양한 유전자 유형은 표현형 간 기능적 중요성이 변화된 유전자를 식별하는 NetDecoder의 능력을 뒷받침합니다.

그림 4는 또한 조건 간 개별 유전자-유전자 쌍 상호작용의 흐름 변화를 정량화한 가장자리 수준 막대 플롯을 보여줍니다. 이 결과들은 특정 상호작용을 통한 흐름이 조건에 따라 달라질 수 있음을 보여주며, 이는 맥락 의존적 네트워크 재배선을 반영합니다. 따라서 엣지 플로우는 정보 전달의 상호작용 수준 변화를 포착하는 반면, 차등 플로우는 이러한 변화를 노드 수준에서 요약하여 네트워크 영향 전반적으로 가장 큰 변화를 가진 유전자의 우선순위를 지정할 수 있게 합니다.

이 결과물들은 NetDecoder가 생물학적 네트워크 내 정보 흐름에서 유전자(노드 수준), 유전자-유전자(엣지 수준), 네트워크 수준 정보 흐름의 변화를 포착함을 보여줍니다(그림 4). 히트맵은 네트워크 내에서 정보 전파, 라우팅, 수용에 변화가 있는 유전자를 식별하는 반면, 엣지 수준 분석은 이러한 변화를 유발하는 구체적인 상호작용을 밝혀냅니다. 표현형 특이적 정보 네트워크는 조건 간 네트워크 재배선을 시각적으로 표현하며, 노드는 유전자를 나타내고 가장자리 두께는 정보 흐름의 크기에 대응합니다(그림 4). 이러한 시스템 수준의 표현은 연구 대상 질환과 관련된 주요 조절 유전자와 경로를 식별하는 데 도움을 줍니다. 더불어, 이 수치들의 성공적인 제작은 NetDecoder가 올바르게 실행되었음을 의미합니다.

NetDecoder는 많은 수의 출력 파일을 생성하기 때문에 가장 관련성 높은 결과를 식별하는 것이 해석에 필수적입니다. 예를 들어, 조건 간 흐름 차이(예: 저단계 대 고단계 차이)를 검토하기 위해 두 가지 핵심 파일을 사용할 수 있으며(탐색 단계는 그림 3의 파일 구조에 따라 안내됩니다). 첫 번째인 "EDGE_CENTERED_SUBNET_flowDifference_Disease.txt"(분석/질병 디렉토리에 위치)는 조건 간 흐름 변화가 가장 큰 상호작용(경계선)을 식별합니다. 두 번째인 "flowDifference_PRIORITIZED_NETWORK.txt"("your_shortname" 디렉터리에 위치)는 가장 큰 흐름 차이를 가진 유전자(노드)를 식별합니다. 이 파일들은 네트워크 행동의 상호작용 수준과 유전자 수준 변화를 포괄적으로 보여줍니다.

더 넓게 보면, "analysis" 폴더에는 네트워크 라우터, 주요 타겟, 중요한 차등 유전자 정보가 포함되어 있습니다. "your_shortname" 폴더에는 전체 유량 값, 주요 목표 및 라우터 등 표현형별 데이터가 담긴 원시 텍스트 파일이 포함되어 있습니다. networks 폴더에는 NetDecoder가 생성한 서브네트워크가 포함되어 있으며, Cytoscape7에서 이를 더 분석하고 시각화할 수 있습니다. 마지막으로, "collect" 폴더에는 결과의 일반적인 요약을 제공하는 통합 데이터와 수치가 포함되어 있습니다. NetDecoder 결과의 추가 시각화 및 분석은 ggplot2, igraph, pheatmap 등과 같은 R 패키지를 사용하여 수행할 수 있습니다.

figure-results-1
그림 1: NetDecoder 파이프라인 및 일반 기능의 표현. NetDecoder는 세 가지 일반적인 단계(노란색 상자)를 필요로 합니다: 데이터 처리, NetDecoder 구성, 그리고 NetDecoder 실행. 성공적인 결과를 보장하기 위해 각 단계의 각 단계를 꼼꼼히 따라야 합니다. NetDecoder는 높은 정보 흐름과 유전자 유용성과 연관될 수 있는 유전자를 예측하기 위해 두 가지 조건(녹색 상자 예시)의 발현 데이터를 필요로 합니다. 수도꼭지 비유에서, 유전자 발현 수준은 수도꼭지의 크기, 즉 열 수 있는 넓은 크기로 나타나며, 유전자 효용이나 활동은 실제 수도꼭지를 통해 흐르는 물의 흐름을 반영하여 이 경로가 기능적으로 얼마나 사용되고 있는지를 보여줍니다. 그림에서 보듯, 발현이 매우 높은 유전자(큰 수도꼭지 크기)는 낮은 유전자 유용성(낮은 수류 수준)을 가질 수 있고, 발현 수준이 낮은 유전자(수도꼭지 크기가 작음)는 높은 유전자 유용성(높은 수류 수준)을 가질 수 있습니다. 이는 발현 수준이 다른 유전자보다 낮더라도 특정 조건에서 유전자가 전반적으로 더 높은 중요성을 가질 수 있음을 보여줍니다. 아래 중앙의 그림은 유전자가 얼마나 많이 발현되는지(크기)와 상관없이 서로 연결되어 있어 서로 다른 흐름(색상) 수준을 경험할 수 있음을 보여줍니다. BioRender로 제작되었습니다. 블리센바흐, E. (2026) https://BioRender.com/8okynbu. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-2
그림 2: NetDecoder 일반 워크플로우. NetDecoder 알고리즘의 핵심 원리는 정보 흐름 분석을 통해 단백질-단백질 상호작용(PPI) 네트워크에서 유전자 유용성을 모델링하는 것입니다. 워크플로우는 데이터 전처리와 엣지 가중 네트워크(EWN) 구축에서 시작됩니다. 두 가지 생물학적 상태인 표현형 1(P1)과 표현형 2(P2)의 유전자 발현 데이터를 차별 발현 또는 템플릿 매칭 방식을 사용하여 출처 유전자를 식별하기 위해 처리됩니다. 정규화된 발현 행렬을 사용하여 조건별 EWN을 구축하며, 각 표현형의 유전자-쌍 관계를 반영하는 엣지 가중치를 사용합니다. NetDecoder는 이후 조건 간 정보 흐름의 차이를 정량화하여 네트워크 재배선 사건과 유전자 유용성 변화를 식별할 수 있게 합니다. 결과물에는 차등 정보 흐름 점수, 맥락별 정보 네트워크, 영향 점수 히트맵, 그리고 하위 생물학적 해석과 기전 발견을 촉진하는 추가 네트워크 수준 및 유전자 수준 지표가 포함됩니다. BioRender로 제작되었습니다. 코레아, C. (2026) https://BioRender.com/29cmswf. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-3
그림 3: NetDecoder 출력 및 폴더 구조. 이 다이어그램은 해석을 위해 결과 파일에 접근하는 데 사용되는 출력 디렉터리 구조를 나타냅니다. 폴더 이름은 이탤릭체로 표시되어 있으며(폴더 아이콘 내 이름), 따옴표 안에 있는 이름은 분석 명칭에 특화되어 있습니다. 받은 편지함 아이콘의 값은 색상 코딩에 따라 파일 또는 파일 형식을 나타냅니다. 빨간색은 각 폴더에서 찾을 수 있는 파일 유형을 나타내며, 키 파일은 굵고 밑줄이 그어진 flowDifference_PRIORITIZED_NETWORK.txt과 EDGE_CENTERED_SUBNET_flowDifference_Disease.txt)로 표시됩니다. 폴더 아이콘은 icons8 (https://icons8.com)에서 가져왔습니다. BioRender로 제작되었습니다. 블리센바흐, E. (2026) https://BioRender.com/8okynbu. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-4
그림 4: NetDecoder가 생성한 결과 예시. 영향 유전자(A), 네트워크 라우터(B), 주요 타겟(C) 히트맵, 그리고 맥락별 네트워크(D), 엣지 플로우 바 그래프(E)는 NetDecoder의 주요 출력물입니다. 이 예시에서는 담도암 발현 데이터셋(OEP001105)을 사용하여 초기 질환(I-II기, 낮은 단계)과 진행기 질환(III-IV기, 높은 단계) 환자를 비교했으며, NetDecoder를 사용해 두 그룹 간 정보 차이가 큰 유전자를 식별하였습니다. 각 플롯은 빨간색으로 유량 증가를, 파란색은 유량 감소를 나타냅니다. 네트워크 라우터(B)는 대량의 유량이 통과하는 주요 중간 유전자(collect/Disease_Network_routers.pdf), 주요 표적(C)은 중요한 하위 조절자(collect/Disease_Key_targets.pdf), 유량 차이 열맵은 조건 간 유전자 수준 정보 흐름의 전체 변화(분석/flowDifference_heatmap.pdf)를 나타냅니다. 표현형별 정보 네트워크(D)를 시각화할 수 있으며, 각 유전자는 노드를 나타내고 유전자-유전자 상호작용은 간선(선)으로 표현됩니다(분석/EDGE_CENTERED_SUBNET_Disease). 가장자리 두께는 유전자 간 정보 흐름의 크기에 해당합니다. 막대 그래프(E)는 두 선택된 표현형 간 유전자-유전자 상호작용의 경계 흐름 차이를 보여주며, 낮은 단계 쌍은 청록색, 고단계 쌍은 주황색으로 나타난다(분석/Disease_keyEdges.pdf). 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 프로토콜은 유전자 발현 데이터를 단백질-단백질 상호작용(PPI) 네트워크와 통합하여 조건별 정보 흐름을 모델링하고 생물학적 시스템 내 기능적 영향에 따라 유전자 우선순위를 정하는 네트워크-생물학 프레임워크인 NetDecoder의 구현을 개략적으로 설명합니다. 이 방법의 성공적인 적용은 여러 중요한 단계, 신중한 방법론적 선택, 그리고 결과물의 적절한 해석에 달려 있습니다.

프로토콜의 초기 단계는 표현식 데이터 검색, 메타데이터 생성, 통합 표현 행렬 구축을 포함합니다. 이 단계들은 하위 분석과의 호환성을 보장하는 데 매우 중요합니다. 발현 행렬은 유전자를 행으로, 샘플을 열로 구성해야 하며, 행렬 내 샘플 이름과 메타데이터 파일이 동일하게 일치해야 합니다. 이 단계에서 발생하는 불일치(예: 샘플 식별자 불일치나 유전자 이름 중복)는 파이프라인을 통해 전파되어 이후 단계에서 실패로 이어집니다.

저품질 데이터(예: 수치가 적거나, 누락된 유전자, 분산이 적은 유전자)를 필터링하는 것이 특히 중요한데, 이러한 특징들은 상관관계 기반 네트워크 구축에 잡음을 유발할 수 있기 때문입니다. 성공적인 전처리 단계는 누락 값이 없는 깨끗한 발현 행렬과 PPI 네트워크에서 사용되는 것과 일치하는 일관된 유전자 식별자로 표시됩니다.

프로토콜에서 핵심 결정 지점은 Edge 가중 네트워크(EWN) 구축에 사용되는 출처 유전자를 선택할 때 차별 발현 분석과 템플릿 매칭 중 하나를 선택하는 것입니다. 차별발현 분석은 충분한 복제를 가진 명확한 실험 그룹을 비교할 때 가장 적합합니다. 이 접근법은 조건 간 통계적으로 유의미한 발현 변화가 있는 유전자를 식별하고, log2 변화(log2FC)와 조정된 p-값과 같은 정량적 결과를 제공합니다. 성공적인 실행 결과는 균일하게 무의미한 결과가 아니라 유의한 유전자 및 비유의자 유전자 분포로 표시됩니다. 반면, 템플릿 매칭은 연속적이거나 참조 프로필과 연관된 발현 패턴을 가진 유전자를 식별하는 것이 목표일 때 더 적합합니다. 이 방법은 차이 발현의 크기가 아닌 상관관계 강도에 기반한 유전자를 유지합니다. 성공적인 템플릿 매칭 단계는 기준 조건과 통계적으로 유의미한 상관관계를 가진 유전자 집합을 생성합니다. 이 방법들 중 선택은 하위 네트워크 토폴로지에 영향을 미칩니다; 차등 표현은 크기 변화를 강조하는 반면, 템플릿 매칭은 조정된 표현 패턴을 강조합니다.

EWN 구성 단계는 프로토콜에서 가장 중요한 구성 요소 중 하나입니다. 여기서는 정규화된 유전자 발현 데이터를 PPI 네트워크와 통합하여 네트워크 내 모든 상호작용에 대해 쌍별 유전자-유전자 상관관계를 계산합니다. 발현 데이터셋과 PPI 네트워크 간에 공유된 유전자만 보존되어 생물학적 관련성과 계산적 일관성을 보장합니다. 각 조건에 대해 모든 간선에 걸쳐 피어슨 상관계수와 대응하는 p-값 및 절대 상관계값이 계산됩니다. 이 지표들은 NetDecoder가 사용하는 엣지 가중치를 정의합니다. 성공적인 EWN 구성은 수천 개의 유전자-유전자 상관관계, 광범위한 상관관계 분포, 필터링 후 최소한의 누락값으로 표시됩니다. 이 단계에서 실패는 종종 유전자 식별자 불일치, 표본 크기 부족, 또는 부적절하게 정규화된 발현 데이터 때문입니다. 일반적인 NetDecoder 실패 지점은 입력 파일과 소프트웨어 구성을 체계적으로 검증함으로써 종종 해결할 수 있습니다. NetDecoder가 예기치 않게 종료되거나 불완전한 출력이 나오면, 사용자는 발현 행렬과 메타데이터 파일 간에 샘플 식별자가 동일한지, 발현 데이터셋, 소스 유전자 목록, PPI 네트워크 전반에 걸쳐 유전자 식별자가 일관되는지, 그리고 발현 행렬에 누락 값이 없는지 확인해야 합니다. 오류나 잘린 결과가 발생하면, 사용자는 소프트웨어 설치 및 버전 호환성을 확인하고, 실행 중 생성된 로그 메시지를 검사하며, 각 중간 단계의 성공 완료를 확인한 후 하위 분석으로 넘어갈 수 있습니다. 출력 파일 및/또는 콘솔 메시지를 검사하면 후속 분석을 시도하기 전에 오류의 원인을 파악하는 데 도움이 됩니다. NetDecoder는 파일 경로, 입력 인수, 의존성의 세밀한 설정이 필요합니다. 주요 단계에는 작업 디렉터리와 라이브러리 경로, 유전자 온톨로지 및 주석 파일, 조건별 EWN 입력, 소스 유전자 목록 지정이 포함됩니다.

파이프라인은 단계별로 실행되기 때문에(조건 생성, 분석, 결과 수집 모두), 이전 단계에서 오류가 발생하면 이후 단계의 성공적인 완료가 어려워집니다. 제대로 작동하는 실행은 네 개의 디렉터리(분석, 수집, 네트워크, "your_shortname")를 생성하며, 각 디렉터리에는 조건별 결과가 담겨 있습니다. 올바른 실행의 또 다른 실질적 지표는 실행 시간입니다. 성공적인 실행은 일반적으로 처리에 몇 시간이 걸리는데, 이는 NetDecoder가 대규모 상호작용 네트워크를 평가하기 때문입니다; 매우 짧은 실행 시간은 입력이 잘못 구성되었거나 계산 단계를 건너뛴 경우를 나타냅니다.

NetDecoder는 기존의 유전자 우선순위 지정 및 네트워크 분석 접근법과 근본적으로 다릅니다. 가중 유전자 공동 발현 네트워크 분석(WGCNA)과 같은 방법은 상관 구조를 기반으로 유전자를 클러스터링하지만, 방향성 흐름을 포함하거나 정보를 네트워크를 통해 전파되는 방식을 정량화하지는 않습니다. 마찬가지로, 경로 풍부화 분석9 는 기능 과잉 표현을 식별하지만, 상호작용 수준의 역학이나 네트워크 연결성의 변화는 고려하지 않습니다.

NetDecoder는 유전자 발현 데이터와 PPI 네트워크를 결합하여 조건별 정보 흐름을 모델링하는 통합 접근법을 사용합니다. 개별 유전자(노드 수준) 점수와 상호작용(엣지 수준) 흐름 변화를 모두 정량화함으로써, 네트워크 구조와 정보 라우팅이 조건 간에 어떻게 재배선되는지를 포착합니다. 이로 인해 강한 차별 발현을 보이지 않을 수 있으면서도 네트워크 행동을 매개하는 중심 역할을 하는 유전자를 식별할 수 있게 되는데, 이는 유전자 효용 모델(GUM)5에 부합하며, 이는 고차등 정보 흐름을 가진 유전자가 조건 특이적 네트워크 기능을 구동한다는 주장과 일치합니다.

장점에도 불구하고 NetDecoder에는 몇 가지 한계가 있습니다. 첫째, 이는 직접적인 실험 증거가 아닌 모델화된 네트워크 정보 흐름에 기반해 유전자 중요성을 추론하는 계산 프레임워크입니다. 따라서 그 예측은 생물학적 실험을 통해 검증이 필요한 가설로 해석되어야 한다. 유전자 노크아웃 연구11이나 표적 교란 분석법 12와 같은 기능 검증 접근법은 NetDecoder가 고효용으로 식별한 유전자가 연구 중인 생물학적 과정이나 질병 상태에 실제로 영향을 미치는지 확인하는 데 필수적입니다. 둘째, 이 방법은 기본 PPI 네트워크의 품질과 완전성에 크게 의존합니다. PPI 데이터베이스는 잘 연구된 유전자에 편향되어 있어 덜 특성화된 상호작용이 저평가되어 새로운 조절 관계 발견을 제한할 수 있습니다. 표본 크기, 실험 설계, 데이터 품질의 변동성도 네트워크 구축과 하류 유량 계산에 영향을 미칠 수 있습니다. 셋째, NetDecoder는 정적 엣지가 동적 정보 흐름을 완전히 포착한다고 가정하지 않습니다. 대신 NetDecoder는 문맥 특화 활동을 추론하고 PPI 네트워크를 구조적 사전에 사용하여 정보 흐름을 정량화하며, 이는 생물학적으로 그럴듯한 상호작용 공간을 정의하는 비계 역할을 합니다. 그 후 상태 특이적 분자 데이터(예: 유전자 발현)를 겹쳐 네트워크의 하위 집합을 맥락 의존적으로 재가중치하거나 활성화함으로써 동적 동작을 도입합니다.

NetDecoder의 주요 목적은 정적인 PPI 스캐폴드 위에서 정보 전파를 모델링하면서 유전자(노드) 간의 정량적이고 연속적인 관계를 유지하는 것입니다. 반면, 불 네트워크와 같은 접근법은 단백질 활동을 논리적 상호작용에 의해 지배되는 이산 온/오프 상태로 모델링하여 동역학을 단순화하고 해석 가능한 방식으로 표현합니다. 이러한 접근법은 다양한 조건에서 유전자 조절 및 신호 전달 네트워크를 연구하는 데 널리 사용되어 왔습니다14, 15, 16. 그러나 일반적으로 사전 정의된 논리 규칙과 단백질 상태의 이산화가 필요하며, 이는 크고 이질적인 생물학적 PPI 네트워크에서 대규모로 정의하기 어려울 수 있습니다17. 이 맥락에서 불리언 네트워크 모델링은 NetDecoder와 상호 보완적인 방향을 나타냅니다. NetDecoder가 연속적이고 정량적인 정보 흐름을 포착하는 반면, 논리적 규칙 기반 동역학이나 하이브리드 이산-연속 모델을 통합하면 조건별 신호 행동의 해석 가능성을 높일 수 있습니다. 따라서 불리언 스타일의 정보 흐름 알고리즘 개발은 미래 연구에 유망한 길을 제시합니다.

NetDecoder의 향후 방향으로는 추가 옴 데이터 타입과의 통합과 단일 세포 전사체체로 확장하여 해상도와 생물학적 맥락을 개선하는 것이 포함됩니다. 예를 들어, 공간 전사체 발현 예측 및 인피테이션을 위한 딥러닝 기반 접근법은 데이터 품질 향상과 신호 복원을 목표로 하지만, 상호작용 네트워크 간 정보 흐름을 명시적으로 모델링하지는 않습니다 18,19. 다중 오믹 수준의 분석을 도입하면 예측력을 더욱 강화하고 더 신뢰할 수 있는 결과를 얻을 수 있습니다. 지속적인 방법론적 개발을 통해 NetDecoder는 다중 정보 흐름 계층을 생성할 수 있어 연구 과학자들에게 관심 데이터에 대한 다중 옴 검증을 제공할 것입니다.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 재정적 이해관계가 상충하지 않습니다.
그림 1과 2의 일러스트는 BioRender(BioRender.com)로 제작되었습니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 메이요 클리닉 생의학 발견 센터, 메이요 클리닉 종합 암 센터(NIH; P30 CA015083), 메이요 클리닉 위장병학 세포 신호전달 센터(NIH: P30DK084567), 글렌 의학 연구 재단, V 암 연구 재단(S.Z.), 메이요 클리닉 영양 비만 연구 프로그램, 데이비드 F. 및 마가렛 T. 그로네 암 면역학 및 면역치료 프로그램, 슈미트 사이언스, 혁신 및 국립보건원(NIH; U19AG74879, P50CA136393, R01CA240323, R03OD038392).

재료

```html

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
AnnotationDbiBioconductor버전 1.68.0어노테이션 및 유전자 매핑
BioconductorBioconductor버전 3.19DESeq2, edgeR, limma, AnnotationDbi, 및 유기체 데이터베이스를 지원하는 전사체 데이터 분석 및 패키지 생태계 프레임워크
CytoscapeThe Cytoscape Consoritum버전 3.10.4네트워크 시각화 및 분석
DESeq2Bioconductor버전 1.46.0부정 이항 모델링을 통한 차등 발현 분석
dplyrPosit Software, PBC formerly RStudio, PBC버전 1.1.4데이터 조작 및 변환
edgeRBioconductor버전 4.4.2카운트 기반 차등 발현 분석
ggplot2Posit Software, PBC formerly RStudio, PBC버전 4.0.0데이터 시각화 및 플로팅  
GNU BashGNU Project시스템 기본값Bash, NetDecoder 파이프라인 스크립트 실행
igraphigraph Development Team버전 2.1.4네트워크 구성 및 그래프 분석
LimmaBioconductor버전 3.62.2유전자 발현 분석을 위한 선형 모델링
NetDecoderHu Li Laboratory, Mayo Clinic(2024 Hu Li Lab)정보 흐름 모델링을 통한 상황별 단백질 상호작용 네트워크 구성
org.Hs.eg.dbBioconductor버전 3.20.0인간 유전자 어노테이션 데이터베이스
Oracle JDKOracle Corporation≥ 버전 1.8NetDecoder 실행을 위한 런타임 환경
pheatmapRaivo Kolde버전 1.0.13발현 및 상관 구조 시각화
RThe R Foundation버전 4.4.2전사체 및 네트워크 분석을 위한 핵심 환경
```

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

MedicineNetworkscontext specificmodellingtranscriptomicsflow algorithmintegration
동영상 곧 제공

관련 논문