방법 논문

급성 골수성 백혈병에서 화학요법 내성 신호를 규명하기 위한 골수 샘플의 전사체 프로파일링 및 생물정보학적 분석

DOI:

10.3791/70750

2026년 8월 4일

* These authors contributed equally

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 프로토콜은 급성 골수성 백혈병(AML)에서 전사체 변형을 분석하기 위한 표준화된 생물정보학 워크플로우를 제시합니다. 목표는 새로 진단된 및 재발한 골수 샘플을 비교하고, 화학요법 내성과 질병 진행과 관련된 분자 신호를 우선순위로 지정하여 후속 조사를 진행하는 것입니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

급성 골수성 백혈병(AML)은 재발과 후천성 화학요법 내성이 치료 실패의 주요 원인인 매우 이질적인 혈액학적 악성 종양입니다. 이 글은 골수 흡인의 전사체 분석을 위한 생물정보학 프로토콜을 제시합니다. 프로토콜의 주요 목표는 재발한 AML에서 질병 진행과 치료 저항성과 관련된 분자 서명을 식별하기 위한 표준화된 워크플로우를 제공하는 것입니다. 이 파이프라인은 5건의 새로 진단된 사례와 4건의 재발 사례의 시퀀싱 데이터를 사용해 비조합 골수 샘플을 비교하는 계산 절차를 상세히 보여줍니다. 이 방법은 RNA 시퀀싱 데이터 처리, 차별 유전자 발현 분석 수행, 그리고 후속 기능 평가를 수행하는 필수 단계를 개괄합니다. 이 워크플로우를 적용하면, FOXC1, HOXA11, HOXA11-AS, AXL 등 2,025개의 차별발현 유전자(DEG)가 재발과 관련된 후보 전사체로 확인되었습니다. 기능 및 네트워크 분석은 소규모 GTPase 신호, 염증 신호, 세포외 기질 상호작용, RNA 생합성 과정과 관련된 유전자 집합과 상호작용 허브를 더욱 우선시하였습니다. 전반적으로 이 방법론은 재발한 AML과 관련된 전사체 서명을 매핑하고 이후 실험적 검증이 필요한 가설을 생성하기 위한 재현 가능한 계산 파이프라인을 제공합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

급성 골수성 백혈병(AML)은 조혈 줄기세포/전구세포에서 유래하는 클론 악성 신생물 그룹으로, 골수 내 미성숙 골수세포의 비정상적 증식과 조혈 분화 억제가 특징입니다 1,2,3. 현재 표준 유도 화학요법(예: 시타라빈과 안트라사이클린 병용)은 대부분의 환자에게 완전한 관해를 유도할 수 있지만, 재발률은 50%에서 70%까지 높으며, 재발 환자의 예후는 4,5,6으로 크게 낮습니다. 후천성 화학요법 내성은 AML 치료 실패와 관련이 있어, 치료 전략과 환자 생존율을 개선하기 위해 이 과정과 관련된 분자 신호에 대한 심층 분석이 필요합니다 7,8.

더 넓은 문헌에서 기존 연구들은 AML에서 화학요법 내성이 약물 배출 펌프의 상향 조절이나 비정상적인 약물 대사에 국한되지 않고, 백혈병 줄기세포(LSC)의 생존 유지, 혈액학적 지적 지적 내 상피-중간엽 전이(EMT) 유사 표현형 형성, 골수 미세환경과의 상호작용과도 연관되어 있음을 보여줍니다. 9, 10, 11. 예를 들어, LSC 집단은 높은 자기 갱신 능력과 정지 상태를 보이며, 이는 세포 주기 특이적 화학요법제에 대한 내성과 관련이 있습니다12. 또한, AXL과 같은 수용체 티로신 키나제의 상향 조절은 FLT3-ITD+ AML의 내성과 연관되어 있으며, 이는 PI3K/AKT 및 MAPK 경로의 활성화와 항세포자사파괴 능력 향상과 함께 일어난다13,14. 대사 재프로그래밍과 후생유전학적 재형성도 내성 형성에서 중요한 조절 축으로 인식되고 있습니다. 증거에 따르면 재발 중인 AML 세포는 산화 인산화(OXPHOS) 활성 증가, 조절된 NAD/NADH 비율, 변형된 히스톤 변형을 통해 화학요법으로 인한 산화 스트레스와 DNA 손상에 적응할 수 있습니다 15,16,17. IL-6와 CXCL8과 같은 골수 미세환경의 염증 인자도 LSC 생존 및 화학요법 내성과 관련이 있으며, 이는 종종 STAT3/NF-κB 신호 경로 활성화와 함께 나타납니다(11,18).

이러한 알려진 기전에도 불구하고, AML 재발과 화학요법 내성과 관련된 전사체 변화는 여전히 완전히 규명되지 않았으며, 특히 임상 샘플에서 대사적, 후생유전학적, 골수 미세환경 관련 신호를 함께 평가할 때 더욱 그렇습니다. 이 워크플로우는 초기 진단에서 임상 재발로의 전환과 관련된 후보 DEGs, 경로, 규제 네트워크를 우선순위로 지정하여 이러한 필요를 충족시킵니다. 이 접근법은 차별 발현 분석, 유전자 집합 풍부화 분석(GSEA), 단백질-단백질 상호작용(PPI) 네트워크 구축을 통합하여 시스템 전반의 전사 재프로그래밍을 지도화하고 후속 기전 검증을 위한 후보를 선정합니다.

이 방법의 전반적인 목표는 새로 진단된 AML과 재발한 AML 골수 샘플의 대량 전사체를 비교하기 위한 표준화되고 재현 가능한 생물정보학 파이프라인을 제시하는 것입니다. 이 인실리코 기법을 사용하는 이유는 단일 경로 분석의 한계를 넘어 복잡하고 다차원적인 조절 네트워크를 우선시하는 편향 없는 전사 사건을 포착할 수 있기 때문입니다. 이 기술은 마이크로어레이나 표적 다중화 qPCR 패널과 같은 대안적 방법에 비해 더 높은 동적 범위, 새로운 전사체 검출 능력, 사전 설계된 프로브의 한계 없이 유전자 발현의 정량화를 제공하는 등 상당한 장점을 제공합니다19,20. 이 방법이 적합한지 판단하기 위해, 독자들은 이 파이프라인이 조직 흡인과 같은 쌍 또는 비쌍 임상 코호트의 대량 RNA 시퀀싱 데이터를 연구자용으로 특별히 설계되었다는 점을 유념해야 합니다. 이는 광범위한 내성 관련 서명과 후보 조절 네트워크를 식별하는 데 적합하며, 세포 유형 특이적 또는 공간 해상도가 필요한 연구자들은 보완적인 단일 세포 또는 공간 시퀀싱 워크플로우를 사용해야 합니다. 궁극적으로 이 계산 프로토콜은 후보 유전자, 경로 및 조절 네트워크를 우선순위 지정하여 후속 실험 연구를 가능하게 합니다.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

인간 조직 샘플링을 사용하는 모든 방법은 기관 지침과 헬싱키 선언(2013년 개정)을 준수하여 수행되었습니다. 임상 골수 샘플은 기관 윤리 위원회(승인 번호 TY-ZKY2024-116-01 및 TY-ZKY2024-116-02)의 승인을 받아 확보되었습니다.

1. 임상 샘플 수집 및 환자 분류

  1. 세계보건기구(WHO) 분류 기준에 따라 급성 골수성 백혈병(AML) 진단을 받은 환자들의 골수 흡인 표본을 선별하여 선별합니다.
  2. 환자 선정 시 코호트의 동질성과 재현성을 보장하기 위해 특정 포함 및 제외 기준을 적용하세요. 원발성 AML을 가진 성인 환자를 포함하고, 2차 AML, 급성 전골수혈구 백혈병 또는 기타 악성 종양 병력이 있는 환자는 제외합니다(표 1).
  3. 초기 임상 진단 시점에 환자가 이전에 치료받지 않은 AML을 가지고 있을 경우, 채취된 샘플을 새로 진단받은 그룹에 배정하십시오.
  4. 환자가 말초혈에서 백혈병성 모반이 재발하거나 완전 관해 후 골수에서 5% 이상의 백혈병 배반이 나타나면 수집된 샘플을 재발군에 배정하십시오.
  5. 일상적인 임상 골수 흡인 절차 직후 식별 해제된 잔류 골수 샘플을 수집하세요.
    참고: 이 특정 프로토콜의 시연 과정에서 2024년 9월부터 2025년 9월까지 9개의 연속 검체(5명은 신규 진단, 4명은 재발)가 채취되었습니다. 이 보고서는 신원 확인이 해제된 잔여 임상 샘플만을 사용했기 때문에, 윤리위원회는 서면 동의 요건을 면제했습니다.
  6. 표준 페놀-구아니디늄 용해법을 사용하여 수집된 골수 흡인물을 즉시 RNA 보존을 위해 처리합니다21.
    1. 새로 채취한 골수 흡인액을 항응고제가 포함된 채취관에 옮깁니다. 흡인제와 항응고제를 완전히 섞기 위해 튜브를 흔들어 주세요.
    2. 항응고 샘플의 측정된 부피를 추출하여 상업용 페놀-구아니디늄 용해 시약에 첨가합니다. 용해 시약 3부분과 샘플 1부 부피 비율을 유지하세요.
      주의: 페놀-구아니디늄 용해 시약에는 독성 및 부식성 화학물질이 포함되어 있어 심각한 화상과 조직 손상을 일으킬 수 있습니다. 모든 시약 취급은 적절한 개인 보호 장비를 착용한 채 화학 연기 후드 내에서 수행하십시오.
    3. 튜브를 세게 흔들어 샘플과 용해 시약을 완전히 균질화하세요. 혼합물이 완전히 혼합되었는지 확인하고, 용액 내에 눈에 띄는 혈전이 남아 있지 않은지 확인하세요.
    4. 균질화된 샘플을 액체 질소에 담그고 즉시 급동합니다.
      주의: 액체 질소는 매우 차가워 접촉 시 심한 동상을 유발할 수 있습니다. 액체 질소를 다룰 때는 극저온 장갑과 전면 보호대를 착용하세요.
  7. 급동 샘플을 -80 °C 냉동고로 옮겨 장기 보관 후 RNA 분리 및 전사체 시퀀싱 파이프라인에 착수합니다. 이 시점은 실험을 일시정지했다가 나중에 다시 시작할 수 있는 안전한 시점을 의미합니다.
    참고: 이 프로토콜에서 제시된 워크플로우는 전적으로 계산 저항 서명 생성에 초점을 맞추고 있습니다. 이 특정 파이프라인을 통해 확인된 주요 차별 발현 유전자에 대해서는 실시간 정량 PCR(RT-qPCR)과 같은 독립적인 실험적 검증이 수행되지 않았습니다.

2. RNA 품질 관리 및 라이브러리 준비

  1. 마이크로유체 모세관 전기영동 시스템을 사용하여 RNA 무결성을 평가합니다. 이 대표적인 워크플로우에서는 RNA 무결 수(RIN) ≥ 6.0, A260/280 비율이 1.8에서 2.1 사이이며, 눈에 띄는 열화 피크가 없는 RNA 샘플을 포함합니다. 라이브러리 준비 전에 각 샘플에 대해 측정된 RIN 및 순도비를 기록하세요.
  2. 라이브러리 제제를 위해 샘플당 총 RNA 1 μg를 투입합니다. poly-T 올리고 부착 자기 구슬을 이용해 전체 RNA에서 mRNA를 정제하여 polyA 꼬리 전사체를 풍부하게 만듭니다.
  3. 이가 양이온을 이용해 농축된 mRNA를 분해합니다. 혼합물을 94°C에서 15분간 5X 1가닥 합성 반응 버퍼에서 배양합니다.
  4. RNase H 활성이 없는 역전사효소를 사용하여 무작위 헥사머 프라이머와 역전사효소를 사용하여 첫 번째 가닥 cDNA를 합성합니다.
  5. RNase H를 이용해 RNA 주형 가닥을 열화시키고, 20 μL 반응 시스템에서 DNA 중합효소 I와 dNTP를 이용해 두 번째 가닥 cDNA를 합성합니다.
  6. 2가닥 합성 반응을 16°C에서 1시간 동안 배양합니다. 반응 혼합물을 2,000 x g 에서 원심분리하여 튜브 바닥에 액체를 모으세요.
  7. 남은 돌출부를 엑소뉴클레아제와 중합효소 작용을 이용해 둔한 끝으로 변환합니다. DNA 조각의 3' 끝을 아데닐화하고, 하이브리다이제이션을 준비하기 위해 헤어핀 루프 구조로 어댑터를 연결합니다.
  8. 자기 고체 상 가역성 고정 비즈를 사용해 라이브러리 조각을 정제하여 길이 370–420 bp 크기의 cDNA 조각을 우선적으로 선별합니다.
  9. 비드 정제 중에 에탄올 세척을 수행하세요. 튜브를 2,000 x g 에서 30초간 원심분리하여 최종 용출 전에 잔류 에탄올을 수집하고 완전히 제거하세요.
  10. 고충실도 DNA 중합효소, 범용 PCR 프라이머, 샘플 특이적 인덱스 프라이머를 사용하여 PCR 증폭을 수행합니다.
  11. 초기 변성은 98°C에서 30초간 PCR 열 프로파일을 실행합니다. 이어서 98°C에서 10초, 60°C에서 30초, 72°C에서 30초간 12주기를 반복하고, 마지막으로 72°C에서 5분간 연장합니다.
  12. 자기 구슬을 사용해 PCR 산물을 다시 정제합니다. 2.9단계와 동일한 원심분리 파라미터를 적용하여 최종 라이브러리를 얻습니다.
  13. 형광광도계를 사용해 초기 라이브러리 농도를 정량화하세요. 최종 라이브러리를 1.5 ng/μL 농도로 희석합니다.
  14. 희석된 라이브러리를 충분히 섞으세요. 최종 분석 전에 남은 이물질을 제거하기 위해 혼합물을 10,000 x g 온도에서 4 °C에서 1분간 원심분리합니다.
  15. 미세유체 모세관 전기영동 시스템을 사용하여 라이브러리의 삽입물 크기를 평가합니다.
  16. 삽입물이 기대에 부합하는지 확인한 후 실시간 정량 PCR(qRT-PCR)을 통해 라이브러리의 유효 농도를 정량화합니다. 라이브러리의 안정성과 시열 분석을 보장하기 위해 농도가 1.5 nM 이상이어야 합니다.
    참고: 이 시점은 실험을 일시정지할 수 있는 안전한 시점을 나타냅니다. 준비된 라이브러리는 클러스터링 및 시퀀싱 전까지 -20 °C에서 보관할 수 있습니다.

3. 클러스터링 및 전사체 시퀀싱

  1. 인덱스 코딩된 샘플의 클러스터링을 자동화된 클러스터 생성 시스템에서 수행합니다. 제조사 지침에 따라 상업용 페어엔드 클러스터 키트를 사용하세요.
  2. 클러스터 생성이 성공적으로 완료된 후 고처리량 시퀀싱 플랫폼에서 라이브러리 준비를 시퀀싱합니다. 150개의 염기쌍(bp) 쌍 말단 리드를 생성합니다.

4. 데이터 품질 관리 및 읽기 매핑

  1. fastp v0.23.2를 사용하여 원시 데이터(FASTQ 형식)의 품질을 평가하여 원시 리드 품질 관리 및 필터링을 수행합니다. 명령줄 매개변수를 분석 로그에 기록하세요. 이 워크플로우에서는 어댑터 포함 리드, 폴리-N 서열이 포함된 리드, 저품질 리드를 샘플 간 동일한 필터링 설정을 사용하여 제거하여 클린 리드를 생성했습니다. 대표적인 쌍 끝 명령어는 보충 파일 1에 제공됩니다.
  2. 원시 읽기를 자동화된 전처리 소프트웨어를 통해 처리합니다. 어댑터가 포함된 리드, 폴리-N 서열이 포함된 리드, 저품질 리드를 제거하여 깨끗한 리드를 얻습니다. 모든 샘플에 동일한 필터링 매개변수를 사용하고, 필터링 후 유지된 읽기 수, Q20, Q30, GC 성분을 기록합니다.
  3. 깨끗한 데이터의 Q20, Q30, GC 함량을 계산하세요. 샘플 채취일, RNA 추출일, 라이브러리 준비 배치, 시퀀싱 레인, 시서열 실행 등 잠재적 배치 변수를 정의하세요.
  4. 정규화된 표현 값을 사용하여 PCA와 샘플 간 상관관계를 통해 배치 효과를 평가합니다. 샘플이 주로 임상 상태가 아닌 기술적 변수에 의해 군집된다면, 영향을 받는 변수를 문서화하여 차별표현 설계 공식에 공변량으로 포함시키거나, 다음 시각화 전에 확립된 배치 조정 방법을 적용하세요.
  5. 참조 게놈(Homo sapiens, GRCh38)과 해당 Ensembl 릴리스 109 유전자 주석 파일을 확보하여 읽기 정렬을 수행합니다.
  6. HISAT2 v2.0.5를 사용하여 참조 유전체의 인덱스를 구축합니다.
  7. HISAT2 v2.0.5를 사용하여 쌍 말단 클린 리드를 기준 게놈에 정렬합니다. 이 접합 인식 정렬 방식을 사용하여 유전자 모델 주석 파일을 기반으로 접합 데이터베이스를 생성하세요.

5. 새로운 전사체 예측 및 유전자 발현 정량화

  1. StringTie v1.3.3b를 사용하여 참조 기반 접근법으로 각 샘플의 매핑된 리드를 조립합니다. 이 도구를 활용해 각 유전자 좌위에 대해 여러 스플라이스 변이를 나타내는 전체 전사본을 조립하고 정량화할 수 있습니다.
  2. featureCounts v1.5.0-p3를 사용하여 각 유전자에 매핑된 리드 수를 세어보세요. 결과된 원시 정수 읽기 계열 행렬을 하위 미분 표현 분석의 입력값으로 사용합니다.
  3. paired-end 옵션(예: -p)을 사용하여 paired-end 시퀀싱 데이터를 위해 featureCounts v1.5.0-p3을 구성하세요. 다운로드한 GRCh38 GTF 주석 파일을 제공하여 올바른 유전체 특징 경계를 정의합니다.
  4. 각 유전자별로 백만 맵 리드당 전사체 조각/킬로베이스 조각(FPKM)을 계산합니다. FPKM 값은 기술 시각화, PCA, 히트맵 표시, 탐색적 표현식 요약에만 사용하세요; DESeq2 미분식 검사의 입력 행렬로 FPKM 값을 사용하지 마십시오.

6. 차별 유전자 발현 분석

  1. R v3.5.0과 DESeq2 R 패키지 v1.20.0을 사용하여 새로 진단된 그룹과 재발한 그룹 간 차별 발현 분석을 수행합니다. 5.2단계에서 생성된 원시 읽기 카운트 행렬을 R 환경에 가져오고, FPKM 값은 시각화 및 탐색적 분석에만 유지합니다.
  2. 분석 패키지에 필요한 특수 데이터셋 객체를 구성하세요. 특정 명령어(예: DESeqDataSetFromMatrix())를 실행하여 카운트 데이터 행렬을 해당 샘플 메타데이터 테이블과 결합합니다.
  3. 소프트웨어 객체 내에서 실험 설계 공식을 정의하세요. 임상 상태(신진단 vs 재발)를 비교 변수로 지정하세요(예: 설계 = ~ 상태). 4.3단계에서 기술적 배치 변수가 확인되었고 임상 상태와 완전히 혼동되지 않은 경우, 설계 공식에 포함하세요(예: design = ~ 배치 + 조건).
  4. 핵심 미분 표현 분석 함수(예: DESeq())를 실행하세요. 소프트웨어가 자동으로 크기 인자 추정, 분산 추정, 음의 이항 Wald 검정 적합을 수행할 수 있도록허용합니다.
  5. 결과 추출 함수(예: results())를 사용하여 결과 표를 추출합니다. 정확한 비교(재발 vs 새로 진단된 비교)를 명확히 명확히 하세요.
  6. 결과 P-값을 조정하여 허위 발견률을 제어합니다. 소프트웨어 패키지23에서 자동으로 적용된 통합 벤자미니 및 호흐버그 절차를 활용하세요.
  7. 추출한 결과 표를 필터링하여 유의미한 차별발현 유전자(DEG)를 분리합니다. 조정된 P-값이 0.05이고 절대 log2 배 변화<> 1인 유전자를 유의미하게 차이 있게 발현한 것으로 할당합니다.

7. 유전자 온톨로지(GO) 풍부화 분석

  1. clusterProfiler v3.8.1과 org를 사용하여 확인된 DEGs에 대한 유전자 온톨로지(GO) 풍부 분석을 수행합니다. Hs.eg.db v3.6.0입니다. 6.7단계에서 확인된 유의미한 DEG에 해당하는 Entrez 유전자 ID 목록을 입력합니다.
  2. GO 농축 함수(예: enrichGO())를 실행합니다. 필요한 매개변수를 지정하고, 적절한 배경 생물 데이터베이스(예: OrgDb = org)를 포함하세요. Hs.eg.db), 특정 온톨로지 도메인(생물학적 과정, 세포 구성 요소, 또는 분자 기능), 그리고 조정된 P-값 컷오프(0.05)를 포함합니다.
  3. 농축 계산 시 알고리즘이 필요한 보정을 적용하는지 확인하세요. 소프트웨어가 내부적으로 유전자 길이 편향을 보정하고 Benjamini 및 Hochberg 방법을 사용해 P-값을 조정하는지 확인하세요24.
  4. 보정된 P-값이 0.05 미만인 GO 항을 유의미하게 풍부화된 것으로 간주합니다. 패키지의 통합 시각화 기능을 활용해 상위 강화된 GO 용어를 표시하기 위해 점플롯 또는 막대 차트를 생성하세요.

8. 교토 유전자 및 게놈 백과사전(KEGG) 경로 풍부화 분석

  1. 고수준 생물학적 시스템 기능을 이해하기 위한 종합 데이터베이스 자원을 활용하여 조절 이상된 경로를 식별하세요. 7.1단계에서 사용한 주요 DEG Entrez ID 목록을 작성하세요.
  2. 함수 주석 R 패키지 내에서 KEGG 풍부화 함수(예: enrichKEGG())를 실행하세요.
  3. 함수 호출 내에서 중요한 매개변수를 정의합니다. 유기체 코드를 엄격히 인간(예: 유기체 = '가짐')으로 설정하고, P-값 조정 방법(예: pAdjustMethod = 'BH')을 정의합니다.
  4. 통계적으로 유의미한 KEGG 경로를 추출합니다. 출력을 필터링하여 P값이 0.05 미만인 보정된 경로만 남기도록 합니다.
  5. 가장 풍부한 KEGG 경로를 시각화하세요. 통합 플롯 함수(예: dotplot())를 활용하여 각 경로와 관련된 통계적 유의성과 유전자 수를 매핑합니다.

9. 유전자 집합 풍부화 분석 (GSEA)

  1. 분석에 필요한 사전 순위 유전자 목록을 준비하세요. 차별발현 분석에서 도출된 log2 배 변화의 부호를 곱한 부호를 사용하여 모든 발현된 유전자의 순위 지표를 계산합니다.
  2. Broad Institute GSEA 소프트웨어 v4.2.3의 로컬 설치를 실행하세요. 새로 생성된 사전 순위 유전자 목록을 소프트웨어 인터페이스25에 입력하세요.
  3. 필요한 미리 정의된 유전자 세트를 다운로드하세요. 분자 서명 데이터베이스(MSigDB, 버전 7.5.1)에서 유전자 온톨로지(GO) 및 교토 유전자 및 게놈 백과사전(KEGG) 데이터셋을 확보하세요.
  4. 통계적 농축 검사를 수행하기 위해 소프트웨어 매개변수를 설정하세요. 순열 수를 1,000개로 설정하고 순열 유형을 'gene_set'로 선택하세요.
  5. 분석 알고리즘을 실행하여 미리 정의된 유전자 집합이 새로 진단된 생물학적 상태 간에 통계적으로 유의미하고 일치하는 차이를 보이는지 확인하세요.
  6. 생성된 농축 프로필의 통계적 유의성을 평가합니다. 엄격한 임계값을 사용하여 유의미한 유전자 집합을 정의합니다: 정규화된 농축 점수(NES) 절대값 > 1.0, 명목 P값 0.05<, 그리고 거짓 발견률(FDR) q-값 < 0.25.

10. 단백질-단백질 상호작용(PPI) 네트워크 분석

  1. STRING 데이터베이스에서 알려진 및 예측된 단백질-단백질 상호작용에 접근할 수 있습니다. 이 워크플로우에서 PPI 분석은 STRING v11.527을 사용하여 수행되었습니다.
  2. Entrez 유전자 ID 또는 유의미한 차별 발현 유전자(6.7단계에서 식별됨)의 공식 유전자 심볼을 데이터베이스 검색 인터페이스에 입력하세요. 호모 사피엔스를 표적 생물로 선택하세요.
  3. 고품질 상호작용이 확보되도록 네트워크 구성 매개변수를 설정하세요. 최소 필요 상호작용 점수를 높은 신뢰 임계값(점수 > 0.700)으로 설정하세요.
  4. 결과된 상호작용 네트워크 데이터를 로컬 디렉터리로 내보내세요. 상호작용 맵을 표준 표 형식(예: TSV 형식)으로 저장하세요.
  5. 네트워크 시각화 및 분석을 위해 내보낸 상호작용 데이터를 Cytoscape v3.9.1로 가져오세요28.
  6. 시각화 명확성을 높이고 주요 규제 허브를 강조하기 위해 구성된 네트워크를 필터링하세요. 확립된 신뢰 임계값을 충족하는 연속적인 상호작용을 보이지 않는 분리된 노드나 고아 유전자는 제거하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

임상 코호트 및 시퀀싱 검증

상류 RNA 추출 및 라이브러리 준비 프로토콜(그림 1)의 성공적인 실행은 수율 및 품질 지표 시퀀싱으로 확인되었습니다. 이 대표적인 데이터셋에서, 5명의 새로 진단된 AML 환자와 4명의 재발한 AML 환자의 골수 샘플은 샘플당 평균 약 6.0GB의 원시 데이터를 제공했습니다. 품질 관리 평가(표 2)는 기본 품질과 읽기 깊이가 하위 생물정보학 분석에 필요한 임계값을 충족함을 확인했습니다9. 낮은 RNA 무결성(예: RIN < 6.0), 낮은 매핑률, 또는 높은 전사체 분해 편향은 최적이 아닌 입력 품질을 나타내며, 후속 차별 발현 분석의 신뢰성을 저하시킬 수 있습니다.

전역 전사체 분산 및 PCA

전사체 전사체 분산을 평가하고 임상 그룹화를 점검하기 위해 정규화된 발현 데이터에 대해 PCA를 수행하였습니다. 이 대표적인 데이터셋에서 새로 진단된 그룹과 재발한 그룹은 2차원 공간에서 분리된 상태를 보였으며(그림 2A)20, PC1과 PC2가 각각 전체 분산의 23.82%와 18.75%를 차지했다. 그림 2B,C의 벤 다이어그램은 새로 진단된 및 재발한 그룹 내 샘플 전반에서 검출된 유전자의 추가 설명 요약을 제공하여, 후속 차별 발현 분석 전에 샘플 단위의 재현성 검사를 지원합니다. 코호트가 소규모이고 짝이 없었기 때문에, PCA 분리는 질병 상태 특이적 생물학의 명확한 증거라기보다는 단순한 워크플로우 산출물로 해석되었습니다.

차별 발현 유전자(DEG) 분석

확립된 프로토콜 임계값(|log2FC| ≥ 1 및 조정 P-값 ≤ 0.05)을 DESeq2 출력에 적용하여, 재발군에서 772개의 상향 유전자와 1,253개의 하향 조절 유전자로 구성된 2,025개의 DEG가 확인되었습니다(그림 3A). 변동이 큰 후보 녹취록에는 FOXC1(로그2FC = 7.55, P = 4.92 x 10-5), HOXA11(로그2FC = 7.76), HOXA11-AS(로그2FC = 7.23), AXL(로그2FC = 3.50)이 포함되었으며, 함께 하향 조절된 RHOB, PTX3, CXCL8이 포함되었습니다. 기존 문헌은 이들 유전자 중 여러 개를 AML 줄기, 신호 전달 또는 치료 반응과 연관짓고 있습니다13,29; 하지만 현재의 워크플로우에서는 이를 재발 관련 후보 전사본으로만 식별하고 있습니다. 임상 내성에서 명확한 기전적 역할을 하려면 이후 독립적인 기능적 검증이 필요합니다.

기능 및 경로 강화 (GO, KEGG, GSEA)

기능적 주석 프로토콜은 DEG를 더 넓은 생물학적 시스템에 매핑했습니다. GO 분석 결과, 소규모 GTPase 매개 신호 전달, 금속 이온 수송, 염색질 조립과 관련된 용어들의 농축이 확인되었습니다(그림 4AC). KEGG 경로 지도 분석은 ECM-수용체 상호작용 및 사이토카인-사이토카인 수용체 상호작용과의 연관성을 확인했습니다(그림 4D). GSEA는 재발군에서 RNA 생합성 과정의 농축과, 새로 진단된 그룹의 에너지 대사 경로 농축을 보여주었습니다(그림 5A). 이러한 풍부화 결과는 변형된 유전자 집합의 기술적 로드맵을 제공하며, 재발의 입증된 원인이 아니라 가설 생성 연관성으로 해석되어야 합니다.

단백질-단백질 상호작용(PPI) 네트워크 구축

초기 STRING 네트워크는 56개의 노드와 193개의 상호작용을 포함했습니다. 분리되거나 고아 노드를 제거한 후, 표시된 Cytoscape 서브네트워크는 42개의 노드와 136개의 상호작용을 포함했습니다(그림 5B). 네트워크 모듈식 분석은 TP53, CCL2, CXCL8, IL6을 가장 많은 상호작용을 가진 중심 수학 허브로 우선시했습니다. PPI 네트워크는 데이터베이스에서 예측된 상호작용 점수(예: ATF3 점수: 0.982)에 의존하기 때문에, 허브 식별은 p53 매개 세포자멸사 회피나 기타 저항성 기전의 직접적 증거보다는 향후 실증 연구를 위한 표적 우선순위 지정으로 해석되어야 합니다.

이 프로토콜에서 생성된 원시 RNA 시퀀싱 데이터는 Figshare 저장소에 보관되었으며, 다음 DOI(https://doi.org/10.6084/m9.figshare.30655814)를 통해 공개적으로 접근 가능합니다. 처리된 데이터와 관련 분석 파일은 기사와 보조 자료에 포함되어 있습니다. 계산 워크플로우를 재현하는 데 사용되는 대표적인 명령줄 매개변수와 분석 설정은 보조 파일 1에 제공됩니다. 이 연구 결과를 뒷받침하는 모든 데이터는 제한 없이 제공됩니다.

환자 ID나이 (연도)분자 돌연변이생존/추적 관찰 (개월)임상 상태
R_AML_170남성FLT3-ITD (+)22사망
R_AML_229여성NPM1 (+)11살아 있어
R_AML_340남성CEBPA (+)17살아 있어
R_AML_455여성트리플 네거티브*24사망

표 1: 재발한 AML(R_AML) 그룹의 인구통계학적 및 임상 특성. 표 1은 대표 분석에 사용된 재발 AML 코호트의 인구통계학적 및 임상적 특징을 요약하며, 전사체 워크플로우 해석과 관련된 환자 수준의 임상 특성도 포함합니다.

샘플도서관Raw_readsRaw_basesClean_readsClean_basesError_rateQ20Q30GC_pct
AML_1FRAS25
0244891-1r
487050667.31G478075327.17G0.0199.3597.4847.48
AML_2FRAS25
0244896-1r
429699406.45G422379626.34G0.0199.3597.4446.74
AML_3FRAS2502
44906-1r
487383867.31G477444627.16G0.0199.3697.4847.28
AML_4FRAS250
244915-1r
487236507.31G476882407.15G0.0199.2997.2647.45
AML_5FRAS2502
44920-1r
495081987.43G477403087.16G0.0199.3797.5347.73
R_AML_1FRAS2502
44892-1r
478794087.18G466715847.0G0.0199.3997.4947.63
R_AML_2FRAS2502
70005-1r
476573787.15G469578827.04G0.0199.3997.4950.5
R_AML_3FRAS250
405722-1r
587547668.81G568671128.53G0.0199.3897.4246.52
R_AML_4FRAS2502
44902-1r
484911227.27G474693347.12G0.0199.2397.2146.43

표 2: 데이터 품질 요약. 표 2는 각 샘플의 시퀀싱 품질 지표를 보고하며, 리드 수율, 기본 품질, GC 함량, 그리고 샘플이 하위 분석에 적합한지 판단하는 데 사용된 매핑 관련 품질 관리 정보를 포함합니다.

figure-results-1
그림 1: 프로토콜의 워크플로우. 워크플로우는 임상 샘플 수집, RNA 품질 관리, 라이브러리 준비 및 시퀀싱, 리드 처리 및 정렬, 전사체 정량, 차별 발현 분석, GO/KEGG 농축, GSEA, PPI 네트워크 구축 등 주요 실험 및 계산 단계를 요약합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-2
그림 2: 샘플의 정량적 분석. (A) 주성분 분석(PCA)을 수행하여 집단 간 차이와 집단 내 표본 재현성을 평가하였습니다. PCA는 모든 샘플에서 정규화된 유전자 발현 값을 기반으로 한 선형 대수 방법을 사용하여 수행되었습니다. (B, C) AML과 R_AML 그룹에서 샘플 전반에 걸쳐 검출된 유전자를 보여주는 벤 다이어그램. 샘플 제한 영역은 개별 샘플에서 검출된 유전자를 나타내며, 겹치는 영역은 두 개 이상의 샘플에서 흔히 검출되는 유전자를 나타냅니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-3
그림 3: 차등 유전자 발현 분석. (A) DESeq2로 식별된 비교군 간 차별발현 유전자(DEG) 수를 보여주는 막대 플롯, 조정된 P-값 ≤ 0.05 및 |log2FoldChange| ≥ 1. (B) DEG의 화산 플롯. x축은 log2FoldChange 값을 나타내고, y축은 -log10(P-값)을 나타냅니다. 파란색 점선은 DEG 선택에 사용되는 임계선을 나타냅니다. (C) DEG의 계층적 군집 히트맵. x축은 샘플 이름을, y축은 DEG의 정규화된 표현 값을 나타냅니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-4
그림 4: 차별 발현 유전자의 기능 풍부 분석. (A) Go 인리치 바 플롯. x축은 GO 항을, y축은 -log10(padj)으로 표현되는 농축 유의성을 나타냅니다. 색상은 BP(생물학적 과정), CC(세포 구성 요소), MF(분자 기능)를 나타냅니다. (B) GO 농축 버블 플롯. x축은 각 GO 항에 주석이 달린 DEG의 비율을 전체 DEG 수에 비유한 비율이며, y축은 GO 항의 비율을 나타냅니다. 버블 크기는 주석이 달린 유전자 수에 해당하며, 색상 그라데이션은 풍부도 유의성을 나타냅니다. (C) 케그 인리치 바 부지. x축은 KEGG 경로를 나타내고, y축은 농축 중요성을 나타냅니다. (D) 케그 농축 버블 플롯. 버블 크기는 주석이 달린 유전자 수를 나타내며, 색상 그라데이션은 풍부도 중요성을 반영합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

figure-results-5
그림 5: GSEA 농축 및 단백질-단백질 상호작용(PPI) 네트워크 분석. (A) 선택된 유의한 유전자 집합에 대한 정규화 농축 점수(NES)를 보여주는 막대 플롯. 양성 NES 값은 R_AML 그룹의 농축을 나타내며, 음성의 NES 값은 새로 진단된 AML 그룹의 농축을 나타냅니다. (B) 단백질-단백질 상호작용(PPI) 네트워크. 각 노드는 단백질을 나타내며, 각 간선은 연결된 단백질 간의 상호작용을 나타냅니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

프로토콜의 핵심 단계

이 생물정보학 워크플로우의 성공적인 실행은 여러 중요한 단계에 달려 있습니다. 첫째, 골수 흡입액의 즉각적인 급동과 적절한 용해(Step 1.6)가 매우 중요한데, 골수 미세환경은 리보뉴클레아제가 풍부하여 전사체 무결성을 빠르게 저하시킬 수 있기 때문입니다. 계산 단계에서 DESeq2 패키지 내에서 실험 설계 공식의 올바른 구성(Step 6.3)은 정확한 차별 표현에 매우 중요하며, 특히 임상 상태(신규 진단 대 재발)를 대조하고 잠재적 교란 변수를 고려할 때 더욱 그렇습니다. 마지막으로, 유전자 집합 풍부 분석(GSEA)(단계 9.6) 중 엄격한 거짓 발견률(FDR) 임계값 적용은 거짓 양성 기능 네트워크의 과도한 해석을 방지하는 중요한 통계적 체크포인트입니다.

수정 및 문제 해결

이 방법에서 흔히 겪는 과제는 임상 샘플을 장기간에 걸쳐 수집하고 시퀀싱할 때 자주 발생하는 배치 효과입니다. 분석 전에 샘플 채취일, RNA 추출일, 라이브러리 준비 배치, 시퀀싱 레인, 시서열 분석 실행 등 배치 변수를 정의해야 합니다. PCA나 표본 상관관계 분석에서 임상 표현형이 아닌 시퀀싱 날짜나 다른 기술적 변수에 기반한 군집이 드러난 경우, 사용자는 통계적으로 가능한 경우 분류 변수를 차별 표현 설계 공식에 포함시키거나, 시각화31 전에 ComBat이나 SVA와 같은 배치 보정 알고리즘을 적용하여 프로토콜을 수정해야 합니다. 이 프로토콜을 골수 흡인체 대신 전혈에 적용할 경우, 라이브러리 준비 중 글로빈 mRNA 소모 단계를 포함하는 것이 필수적이며, 이는 매우 풍부한 글로빈 전사체가 시퀀싱 독서 깊이를 독점하는 것을 방지하는 것입니다. 소프트웨어 버전과 대표 워크플로우의 주요 매개변수는 다음과 같이 보완되었습니다: fastp v0.23.2, HISAT2 v2.0.5, StringTie v1.3.3b, featureCounts v1.5.0-p3, R v3.5.0, DESeq2 v1.20.0, clusterProfiler v3.8.1, org. Hs.eg.db v3.6.0, 쌍말단 150 bp 시퀀싱, 1,000 유전자 집합 순열이 포함된 GSEA v4.2.3, MSigDB v7.5.1, STRING v11.5(고신뢰도) 상호작용, 그리고 Cytoscape v3.9.1. 대표적인 명령줄 매개변수와 분석 설정은 보조 파일 1에 제공되어 있습니다.

방법의 한계

이 프로토콜은 포괄적이지만, 본질적으로 방법론적 한계가 있습니다. 첫째, 전체 골수 흡입물의 평균 전사체 프로필을 포착하는 대량 RNA 시퀀싱을 사용하며, 단일 세포 공간 해상도는 없습니다. 따라서 워크플로우는 상향 조절된 재발 관련 신호가 백혈병 줄기세포, 기질 세포, 면역 세포, 또는 세포 유형조성 변화에서 비롯된 것인지 판단할 수 없다. 둘째, 대표성 데이터셋이 작고(n = 9) 짝이 없어 통계적 견고성이 제한되고 명확한 인과관계 추론을 어렵게 만듭니다. 셋째, 작업 흐름은 순전히 실리코(in silico)입니다. 후보 조절 허브와 신호 경로를 생성하지만, 직교 내 시험관 또는 생체 내 실험적 검증 없이는 화학요법 내성에서 기능적 필요성을 독립적으로 검증할 수 없습니다.

최근 단세포 및 단세포 유전체 연구들은 세포 상태 이질성, 클론 구조, 치료 관련 진화를 더 높은 해상도로 해결함으로써 AML 참조 프레임워크를 확장시켰습니다 33,34,35,36. 이러한 접근법은 여기서 설명하는 대량 RNA-seq 워크플로우를 보완합니다: 대량 시퀀싱은 코호트 수준의 전사체 서명에 대해 실용적이고 비용 효율적인 선별 전략을 제공하며, 단일 세포 및 다중 옴 방법은 추적 연구에서 특정 악성 또는 미세환경 세포 집단에 후보 신호를 할당하는 데 사용할 수 있습니다.

기존 방법들과의 중요성

이러한 한계에도 불구하고, 이 전사체 파이프라인은 대체 진단 및 분석 기법에 비해 장점을 제공합니다. 전통적인 AML 재발 임상 평가는 주로 표적 다중성 qPCR 패널이나 표준 유세포측법에 의존합니다. 이러한 표적 방법은 빠른 진단에 유용하지만, 미리 정의된 프로브에 의해 제약을 받으며 알려진 저항 마커만 평가할 수 있습니다19. 편향되지 않은 전사체 시퀀싱과 네트워크 분석을 결합함으로써, 이 프로토콜은 기존 표적 방법이 간과할 수 있는 새로운 전사체와 시스템 전반의 연관성을 지명할 수 있습니다.

중요성과 잠재적 응용

이 프로토콜에서 제시된 방법론은 재발과 관련된 전사체 서명을 우선시하여 추가 연구를 할 수 있어 번역 혈액학 및 개인 맞춤 의학에 적합합니다. 잠재적인 후속 응용 분야로는 재발 시 나타나는 표면 항원이나 면역 회피 경로의 지명이 있습니다. 이러한 후보들은 향후 검증 연구 설계에 도움이 될 수 있으며, 실험적으로 확인될 경우 CAR-T 또는 CAR-NK 세포 전략을 포함한 차세대 면역치료제 개발에 기여할 수 있습니다. 이러한 번역 응용은 현재 데이터셋에서 확립된 결론보다는 가설 생성으로 간주되어야 합니다.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 이해 상충이 없음을 선언합니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 간저우시 과학기술국(2022—ZD1368)의 지원을 받았습니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
Agilent 2100 BioanalyzerAgilent Technologies, Santa Clara, CA, USARRID:SCR_019389G2939BA
AMPure XP systemBeckman Coulter, Brea, CA, USARRID:SCR_008452A63881
cBot Cluster Generation SystemIllumina, San Diego, CA, USA-SY-301-2002 or institution-specific system ID
clusterProfiler (Software)BioconductorRRID:SCR_016884v3.8.1
Cytoscape (Software)Cytoscape ConsortiumRRID:SCR_003032v3.9.1
DESeq2 (Software)BioconductorRRID:SCR_015687v1.20.0
DNA Polymerase INew England Biolabs (NEB, Ipswich, MA, USA-M0209L
dNTP Solution MixNew England Biolabs (NEB, Ipswich, MA, USA-N0447L
edgeR (Software)BioconductorRRID:SCR_012802v3.22.5
fastp (Software)OpenGeneRRID:SCR_016962v0.23.2
featureCounts / Subread (Software)The Walter and Eliza Hall InstituteRRID:SCR_012919featureCounts v1.5.0-p3
GRCh38 reference genomeGenome Reference Consortium / Ensembl-GRCh38; Ensembl release 109
GSEA softwareBroad InstituteRRID:SCR_003199v4.2.3
HISAT2 (Software)Johns Hopkins UniversityRRID:SCR_015530v2.0.5
M-MuLV Reverse Transcriptase (RNase H-)New England Biolabs (NEB, Ipswich, MA, USA-M0253L
MSigDB gene setsBroad InstituteRRID:SCR_016863v7.5.1
NEBNext Ultra II Directional RNA Library Prep Kit for IlluminaNew England Biolabs (NEB, Ipswich, MA, USA-E7760L/E7765L or laboratory-specific kit
NEBNext Ultra II RNA Library Prep Kit for IlluminaNew England Biolabs (NEB, Ipswich, MA, USA-E7770L
NovaSeq sequencing platformIllumina, San Diego, CA, USARRID:SCR_016387NovaSeq system; service-provider instrument ID
org.Hs.eg.db (Annotation package)Bioconductor-v3.6.0
Phusion High-Fidelity DNA PolymeraseThermo Fisher Scientific, Waltham, MA, USARRID:AB_2756816F530L
Qubit 2.0 FluorometerThermo Fisher Scientific, Waltham, MA, USARRID:SCR_018095Q32866
Qubit dsDNA HS Assay KitThermo Fisher Scientific, Waltham, MA, USA-Q32851
R softwareR Foundation for Statistical ComputingRRID:SCR_001905v3.5.0
Random Hexamer PrimerThermo Fisher Scientific, Waltham, MA, USA-SO142
RNA 6000 Nano KitAgilent Technologies, Santa Clara, CA, USA-5067-1511
RNase HNew England Biolabs (NEB, Ipswich, MA, USA-M0297L
RNA-seq Library Prep Kit / Sequencing ServiceNovogene, Beijing, China-Project No. X101SC25054246-Z01-J003
STRING databaseSTRING ConsortiumRRID:SCR_005223v11.5
StringTie (Software)Johns Hopkins University / Center for Computational BiologyRRID:SCR_016323v1.3.3b
TruSeq PE Cluster Kit v3-cBot-HSIllumina, San Diego, CA, USA-PE-401-3001

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

Cancer ResearchAcute myeloid leukemiaChemoresistancetranscriptomicsleukemia stem cellsepigenetic regulationinflammatory signaling

관련 논문