방법 논문

무료 계산 도구를 사용하여 질량 분석 기반 단백질체 데이터 탐색

DOI:

10.3791/68707

2025년 8월 19일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

질량 분석 기반 단백질체 데이터는 개방형 데이터베이스에서 사용할 수 있으며 무료 도구를 사용하여 액세스할 수 있습니다. 데이터베이스 검색 및 설명의 복잡성을 감안할 때 많은 생물학자들은 이러한 데이터 세트를 활용할 수 있는 지식이 부족합니다. 여기에서는 기본 단백질체 데이터 검색을 위한 무료 도구 사용에 대한 가이드를 제공합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

DDA(Data-Dependent Acquisition) 및 DIA(Data-Independent Acquisition)를 포함한 질량 분석법(MS) 기반 단백질체학 데이터는 생물학 연구에 널리 사용됩니다. 그러나 검증 연구에 이러한 데이터 세트를 적용하는 것은 단백질체 데이터를 효과적으로 검색하고 분석하는 방법에 대한 명확한 시연이 부족하기 때문에 여전히 제한적입니다. 이 격차를 메우기 위해 단백질체 데이터 분석 워크플로우와 단백질 검색 결과의 다운스트림 후처리를 더 잘 설명하기 위해 PRIDE(PRoteomics IDEntifications Database) 데이터 저장소에 보관된 하나의 DDA 및 하나의 DIA 데이터 세트를 선택했습니다. 데모를 위해 DDA 데이터 세트용 FragPipe(v22.0)와 DIA 데이터 세트용 DIA-NN(2.1.0)이라는 두 가지 무료 계산 도구를 사용했습니다. 화산 플롯 및 조절 장애 단백질 목록 생성과 같은 후처리 단계는 R 코드를 사용하여 시연되었습니다. 본 연구는 단백질체 데이터를 검색하고 분석하기 위한 기본 프로토콜을 제공하여 단백질체 데이터 세트를 효과적으로 처리하기 위한 필수 초보자 가이드 역할을 합니다. 이 작업을 통해 우리는 연구자들이 생물학적 조사에 단백질체 데이터를 활용하는 데 필요한 지식을 갖추는 것을 목표로 합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

단백질체학 분야는 연구 역량을 발전시키고 데이터 공유 문화를 촉진하는 데 중요한 역할을 해온 오픈 액세스 데이터 저장소와 자유 소프트웨어 도구1의 광범위한 채택으로 혁명을 일으켰습니다. PRIDE2와 같은 중앙 집중식 리소스의 구축과 HUPO(Human Proteome Organization) PSI(Proteomics Standards Initiative)3 의 표준화된 데이터 형식 개발은 데이터 재사용 및 통합을 위한 전례 없는 기회를 창출했습니다. 그러나 단백질체 데이터의 분석 및 해석은 특히 자신의 실험 결과에 대한 직교 검증을 수행하려는 생물학자 및 의사 과학자에게 여전히 상당한 기술적 장벽을 제시합니다4. 이 원고는 연구자가 공개 단백질체학 데이터를 독립적으로 쿼리, 분석 및 자체 발견과 통합할 수 있는 접근 가능한 프레임워크를 제공하는 공급업체에 구애받지 않는 계산 워크플로를 제시함으로써 이러한 문제를 직접 해결함으로써 추가 습식 실험실 실험 없이도 강력한 직교 검증을 용이하게 합니다. 이 연구는 자체 실험에서 확인된 특정 단백질의 차등 발현을 직교적으로 검증하고 광범위한 발표된 연구에서 관심 단백질의 발현 패턴을 탐색하여 새로운 가설을 생성하려는 연구자에게 특히 적합합니다. 단계별 가이드를 제공함으로써 우리는 더 넓은 범위의 과학자들이 공개 단백질체학 데이터의 잠재력을 최대한 활용할 수 있도록 지원하고 궁극적으로 연구의 견고성과 영향력을 향상시키는 것을 목표로 합니다.

질량 분석법(MS) 기반 단백질체학에서 MS1 및 MS2 스캔은 데이터 수집의 기본입니다. MS1 스캔 또는 조사 스캔은 샘플에 있는 모든 이온의 질량 대 전하 비율(m/z) 비율을 감지하고 측정하여 이온 집단에 대한 포괄적인 개요를 제공합니다5. 단편화 스캔이라고도 하는 MS2 스캔은 MS1 스캔에서 선택된 특정 전구체 이온을 분리 및 단편화하여 펩타이드 식별을 위한 단편 이온 스펙트럼을 생성하는 것을 포함합니다6.

데이터 의존 획득(DDA)은 MS2 단편화를 위해 MS1 스캔에서 가장 풍부한 이온을 선택하여 분석을 간소화하는 더 간단한 스펙트럼을 생성합니다. 그러나 DDA는 복잡한 샘플에서 확률론적 샘플링 및 누락값으로 이어져 재현성을 제한할 수 있습니다7. 대조적으로, 데이터 독립적 획득(DIA)은 사전 정의된 m/z 창 내의 모든 이온을 체계적으로 단편화하여 포괄적인 적용 범위를 보장하고 누락된 값을 최소화합니다. 이는 정량적 정확성과 재현성을 향상시키지만8, DIA는 매우 복잡한 MS2 스펙트럼을 디콘볼루션하기 위해 고급 계산 도구가 필요합니다9.

PRIDE(https://www.ebi.ac.uk/pride)2는 단백질체학 데이터 공유를 위한 글로벌 플랫폼인 ProteomeXchange 컨소시엄(https://www.proteomexchange.org)10 내의 선도적인 저장소입니다. 사용자는 키워드 검색을 사용하여 이 방대한 리소스를 효율적으로 탐색하여 관심 있는 데이터 세트를 찾을 수 있습니다.

심층 신경망을 활용하는 소프트웨어 제품군인 DIA-NN11은 DIA(Data-Independent Acquisition) 단백질체학 데이터를 분석하기 위한 표준 도구입니다. 식별 및 정량화 정확도가 뛰어나 복잡한 DIA 데이터 세트를 처리하는 데 특히 효과적입니다12. 데이터 의존적 획득(DDA) 워크플로우의 경우 FragPipe 파이프라인에 통합된 MSFragger13은 초고속 펩타이드 식별을 제공합니다. 혁신적인 단편 이온 인덱싱 (fragment-ion indexing) 접근 방식을 통해 신속한 스펙트럼 매칭이 가능하며, 기존 도구보다 속도가 100 배 이상 향상됩니다.

이러한 포괄적인 데이터베이스와 고급 도구를 갖춘 연구자들은 교차 연구 검증 및 새로운 생물학적 발견을 위해 단백질체 데이터를 쉽게 재사용할 수 있습니다. 이러한 접근성은 다양한 질병에 걸쳐 수많은 단백질 바이오마커의 식별을 주도하고14,15, 예후 예측을 개선하고16, 단백질체학 프로필을 기반으로 한 분자 아형 분류를 가능하게 했습니다17.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

참고: 워크플로에 대한 개요는 그림 1을 참조하고 사용된 소프트웨어에 대한 자세한 설명은 재료 표 를 참조하십시오.

figure-protocol-1
그림 1: 연구 설계 개요. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

1. 예제 파일 및 소프트웨어 설정

참고: 모든 응용 프로그램은 개별 연구용으로 무료이며 개인용 컴퓨터에서 실행할 수 있습니다(Windows 및 Linux 지원).

  1. 프로젝트에 대한 새 디렉터리를 만듭니다.
  2. JMU_LM2_8526_55.raw, JMU_LM2_8568_51.raw, JMU_LM2_8696_37.raw, JMU_LM2_2112_87.raw, JMU_LM2_2195_91.raw, JMU_LM2_2377_73.raw, 20150127_liver_XH03_T_01.raw, 20150127_liver_XH03_T_02.raw, 20150127_liver_XH03_T_03.raw, 20150127_liver_XH03_P_01.raw, 20150127_liver_XH03_P_02.raw 다운로드 20150127_liver_XH03_P_03.raw PRIDE에서.
    참고: 두 파일 그룹은 https://www.ebi.ac.uk/pride/archive/projects/PXD039273 에서 다운로드하고 https://www.ebi.ac.uk/pride/archive/projects/PXD006512 별도로 다운로드할 수 있습니다(그림 2).
  3. 필요한 소프트웨어 도구를 다운로드하여 설치합니다.
    1. 최신 버전의 DIA-NN을 .msi 파일로 다운로드합니다. DIA-NN은 https://github.com/vdemichev/DiaNN/releases/tag/2.0 에서 Windows용 .msi 파일 또는 Linux용 .zip 파일로 무료로 사용할 수 있습니다.
    2. 최신 버전의 MSFileReader를 .exe 파일로 다운로드합니다. MSFileReader는 원시 형식의 Thermo Fisher DIA 데이터를 처리하는 데 필요한 https://github.com/thermofisherlsms/MSFileReader/blob/main/MSFileReader_x64.exe 의 .exe 파일로 무료로 사용할 수 있습니다.
    3. 최신 버전의 .NET SDK를 .exe 파일로 다운로드합니다. .NET SDK는 Windows에서 MSFileReader를 실행하는 데 필요한 https://dotnet.microsoft.com/en-us/download 에서 .exe 파일로 무료로 사용할 수 있습니다.
    4. 최신 버전의 FragPipe를 .zip 파일로 다운로드합니다. FragPipe는 https://github.com/Nesvilab/FragPipe/releases 에서 .zip 파일로 무료로 사용할 수 있습니다. jre가 포함된 zip 파일은 FragPipe를 실행하는 데 필요한 Windows용 Java 런타임을 포함하므로 권장됩니다. MSFragger는 FragPipe에 포함되어 있습니다.
  4. 보충 파일 1 및 보충 파일 2에서 최신 버전의 R 및 Rstudio 및 R 스크립트 파일을 다운로드합니다. R 및 RStudio는 https://cran.rstudio.com/bin/windows/base/R-4.5.0-win.exe 및 https://posit.co/download/rstudio-desktop/ 에서 무료로 다운로드할 수 있습니다.
  5. 압축 파일의 압축을 풀고 . exe 또는 .msi Files 응용 프로그램을 설치합니다.

2. DIA-NN을 이용한 DIA 데이터 분석

  1. UniProt에서 참조 proteome fasta 파일을 다운로드합니다. 호모 사피엔스 참조 프로테옴(이소형 정보는 포함되지 않음)을 다운로드하려면 https://www.uniprot.org/proteomes/UP000005640 로 이동하십시오(그림 3A).
  2. Add FASTA 버튼을 클릭하여 참조 프로테옴 파일을 DIA-NN에 로드합니다.
  3. Precursor 이온 생성 부분에서 라이브러리 없는 검색/라이브러리 생성과 딥 러닝 기반 스펙트럼, RT 및 lMs 예측을 위한 FASTA 다이제스트의 두 가지 옵션을 선택합니다. 실행 버튼을 클릭하여 예측된 스펙트럼 라이브러리를 생성합니다(그림 3B).
    1. 예측된 스펙트럼 라이브러리 파일이 생성되면 스펙트럼 버튼을 클릭하여 예측 라이브러리를 추가하여 동일한 실험 획득 설정 내의 다른 실험에 재사용합니다.
  4. 전구체 이온 생성 부품에서 두 가지 옵션을 선택 취소하고 입력 부품 아래의 파일 형식과 상관 관계가 있는 유형 버튼을 클릭하여 DIA 데이터를 로드합니다.
  5. 알고리즘의 질량 정확도 및 MS1 정확도를 0.0ppm으로 설정합니다.
  6. 실험 설정에 따라 전구체 이온 생성 부분에서 전구체 및 조각 질량 범위 설정을 조정합니다.
  7. 다른 기본 설정을 유지합니다.
    1. DIA-NN의 전구체 생성은 부분 소화를 모델링하기 위해 1개의 누락된 절단과 함께 트립신/P(프롤린이 뒤따르지 않는 한 K/R 후 절단)를 사용합니다. 비표준 펩타이드(예: 면역펩티체학)에 대한 N-항 M 절제 를 비활성화하거나 더 긴 펩타이드에 대해 누락된 절단을 2로 증가시킵니다.
    2. 번역 후 변형(PTM) 연구(예: 산화를 위한 Ox(M), 유비퀴틴화를 위한 K-GG)을 위해 가변 변형(기본적으로 비활성화됨)을 명시적으로 활성화하고 펩타이드 필터(길이: 7-30 aa; 전하: 1-4+; 전구체 m/z: 300-1800)를 실험 설정(예: 길이:5-50 aa, 전하=1-6)을 대형 PTM 또는 비트립스 분해에 대해 확장합니다.
    3. 알고리즘 설정은 정확한 질량 정렬을 위해 자동 보정(질량 정확도=0.0ppm)을 활용하고(저분해능 기기의 경우 수동 허용 오차(예: 10ppm)로 재정의하고, MBR(Match Between Run)은 실행 간에 ID를 전송합니다(이기종 샘플의 경우 비활성화).
    4. 신경망 스코어링은 식별 신뢰도를 높이고(데이터 품질이 좋지 않은 경우 유지), UMS(Quant Unlabeled Mass Spectrometry)는 고정밀 무표지 정량화를 가능하게 합니다. 등압 태그(예: TMT)에 대한 MS2 정량화로 전환합니다. 고분해능 DIA 데이터에만 라이브러리 없는 검색을 사용하여 스펙트럼 라이브러리 요구 사항을 우회합니다.
  8. 실행 버튼을 클릭합니다. 실행이 완료되었음을 나타내는 작업 인터페이스에 Finished가 표시될 때까지 결과를 기다립니다(그림 3C).

3. FragPipe를 이용한 DDA 데이터 분석

  1. 설치 후 ~\FragPipe\fragpipe\bin 폴더에서 Fragpipe 아이콘을 클릭합니다. 모든 종속 설정은 구성 탭에서 볼 수 있습니다. 컴퓨터에 세 가지 모듈(MSFragger, IonQuant, diaTracer, DIA-NN 및 Python)이 있는지 확인합니다. 그렇지 않은 경우 다운로드/업데이트 또는 다운로드 를 클릭하여 다운로드합니다(그림 4A).
  2. 다음 탭인 워크플로로 전환합니다. 워크플로에 대해 기본값을 선택하고 워크플로 로드를 클릭합니다. 파일 추가 를 클릭하여 파일 경로를 추가합니다. 파일 할당 아래에 실험 이름과 생체 복제 번호를 할당하거나 그대로 둡니다(그림 4B).
  3. 이제 데이터베이스를 클릭하고 해당 탭으로 이동합니다. 샘플의 종에 따라 fasta 파일을 로드하거나 fasta 파일을 다운로드합니다. 다운로드하는 동안 간단한 실행을 위해 검토된 시퀀스만, 미끼 추가일반적인 오염 물질 추가 옵션을 선택합니다(그림 4C).
  4. 그런 다음 MSFragger 를 클릭하여 탭을 변경합니다. Closed Search 기본 구성을 선택하고 Load(로드)를 클릭합니다.
    참고: 닫힌 검색은 기본적으로 설정한 수정 사항을 검색하는 반면, 열기 검색은 데이터에서 가능한 모든 수정 사항을 탐색하므로 시간과 메모리가 더 많이 소모됩니다.
  5. 피크 매칭의 경우 시간을 절약할 수 있으므로 보정 및 최적화에 대해 없음 을 선택하는 것이 좋습니다.
  6. 단백질 소화의 경우 실험 조건에 따라 매개변수를 조정하십시오. 다음 기본 설정을 유지합니다(그림 5A).
    참고: 전구체 및 단편 질량 허용 오차(± 20ppm)는 실험 스펙트럼을 이론적 펩타이드와 일치시키기 위한 최대 허용 질량 오류를 정의하며, 고분해능 기기에 더 엄격한 값이 권장됩니다. 효소 규칙(엄격한 트립신)은 절단 특이성(K/R 이후, P가 뒤따르지 않는 한)을 지정하며, 절단 누락(2)은 부분적으로 소화된 펩타이드를 허용합니다. 펩타이드 길이(5-50 잔기) 및 질량(500-5000 Da) 필터는 가능성이 낮은 후보를 배제합니다. 다양한 변형(예: 산화를 위한 메티오닌의 +15.9949 Da, 인산화의 경우 S/T/Y의 +79.96633 Da)을 통해 화학적 변화를 검출할 수 있으며, 최대 조합(5)은 검색 공간을 관리하기 위해 펩타이드당 동시 변형을 제한합니다. 사이트당 최대 가변 모드(예: M의 3개)는 수정 빈도를 제어합니다. 분할 데이터베이스는 큰 프로테옴의 효율성을 향상시키고 동위원소 오류(0/1/2)는 잘못 할당된 동위원소 피크를 설명합니다. 이러한 설정은 펩타이드 식별에서 민감도, 특이도 및 계산 부하의 균형을 집합적으로 유지합니다.
  7. 유효성 검사 탭으로 변경합니다. DIA 데이터에 대한 Predict RTPredict spectra를 선택 취소합니다(그림 5B).
  8. Quant(MS1) 탭을 클릭합니다. Run MS1 quant(MS1 퀀트 실행)를 선택하고 Load Quant defaults(퀀트 기본값 로드)를 클릭합니다. IonQuant를 선택하고 기본 설정을 유지합니다(그림 6A). 불안정한 보존 시간에 대해 MBR을 비활성화하거나 전역 확장 편향이 발생하는 경우 강도 정규화를 비활성화합니다. 디스크에 인덱스 유지를 활성화하여 대규모 데이터 세트로 RAM을 절약합니다.
    참고: Quant(MS1)는 기본적으로 MaxLPQ(MaxLFQ 기반 단백질 정량화, MaxLFQ 방법을 단백질 그룹으로 확장하는 알고리즘)를 사용하여 무표지 정량화를 최적화하며, 단백질당 ≥1개의 고유한 이온이 필요합니다(커버리지를 희생하면서 더 높은 엄격성을 위해 ≥2로 증가). MBR(Match Between Run)은 머무름 시간(RT) 허용 오차(기본값 0.4분, 안정적인 크로마토그래피의 경우 0.2분으로 조이거나 그래디언트 변동성을 위해 느슨하게 조임) 및 이온 이동도(IM) 허용 오차(기본값 0.05 1/k0[역 감소 이동도], IM 정밀도에 따라 조정)을 사용하여 ≤1% FDR(False Discovery Rate, 기본 MBR 이온 FDR=0.01, 엄격함을 위해 0.005로 낮음)을 사용하여 런 간에 식별을 전송합니다. 단백질 추론은 uniquer+rascor(단백질 그룹화를 위한 면도기 펩타이드 할당)를 사용합니다. 특징 검출은 10ppm의 질량 허용 오차를 사용합니다(저분해능 MS의 경우 20ppm으로 증가, 고분해능의 경우 5ppm으로 감소).
  9. 이제 실행 탭을 클릭합니다. 출력 디렉터리를 선택합니다. RUN 을 클릭하여 데이터 분석을 시작합니다(그림 6B).
    참고: 변형에 초점을 맞추지 않거나 라벨 기반 정량화를 사용하지 않는 무표지 단백질체학 데이터의 경우 PTM, Glyco 및 Quant(Isobaric) 탭이 사용되지 않습니다.

4. DIA-NN/FragPipe 다운스트림 분석

참고: 이 연구에 사용된 세부 코드는 보충 파일 1 보충 파일 2로 포함되어 있습니다. 이 연구에서 사용된 패키지 버전은 보충 파일 3에서 찾을 수 있습니다.

  1. RStudio를 열고 DIA-NN 또는 FragPipe에서 생성된 단백질 발현 데이터를 읽습니다. DIA-NN의 .pg_matrix.tsv로 끝나는 단백질 그룹 매트릭스 데이터와 FragPipe의 .tsv로 끝나는 결합된 단백질 데이터가 일반적으로 분석에 사용됩니다.
  2. NA를 채우지 않고 누락된 값을 제거하고 2개 미만의 고유한 펩타이드로 식별 및 정량화된 단백질 그룹을 필터링합니다.
    참고: 이 연구의 DIA 수치는 여과된 단백질 그룹에 의해 생성된 반면, DDA 수치는 여과되지 않은 단백질 그룹에서 생성되었습니다.
  3. 샘플 전반에 걸쳐 중앙값 스케일링 또는 분위수 정규화를 사용하여 단백질 강도를 정규화합니다. 이 연구의 DIA 데이터는 중앙값 정규화에 의해 정규화되었고 DDA 데이터는 두 가지 방법을 더 잘 입증하기 위해 분위수 정규화에 의해 정규화되었습니다.
    참고: 중앙값 정규화는 이상치에 대해 강력하며 대부분의 단백질이 샘플 전체에서 변하지 않은 상태로 유지되는 시나리오에 적합하므로 중앙값 단백질 풍부도가 안정적인 기준점이 됩니다. 그러나 고도로 차등적으로 발현되는 단백질이 있는 시나리오에서는 실패할 수 있습니다18. 분위수 정규화는 샘플 전반에 걸쳐 단백질 풍부도의 균일한 분포를 보장하며, 이는 서로 다른 분포의 샘플을 비교할 때 유용합니다. 통계적 검정력을 감소시키고 데이터를 과도하게 정규화하여 잠재적으로 진정한 생물학적 차이를 가릴 수 있는 것으로 나타났습니다18. 단백질체학에서 중앙값 정규화는 MS 기기 성능과 관련된 체계적인 편향을 제거하기 위해 무표지 연구에서 널리 사용됩니다. 분위수 정규화는 대규모 데이터 세트, 차등 발현 분석 및 클러스터 분석에 선호됩니다19,20.
  4. log2 배 변화(예: PDAC 혈청 대 정상) 및 t-테스트 p-값을 계산합니다. Benjamini-Hochberg 방법을 사용하여 수정된 p-값을 계산합니다. 유의 임계값을 정의합니다(예: |log2FC| > 1, p_adj(FDR) < 0.05).
    참고: 이 연구의 수치에 사용된 컷오프 p-값은 조정된 p-값(p_adj)을 사용하면 이러한 제한된 데이터 세트의 통계적 검정력 내에서 검출 가능한 모든 단백질을 제거하므로 원시 값을 나타냅니다.
  5. 누락/NA 값의 존재를 확인하고 제외합니다. 화산 플롯을 생성하여 중요한 적중을 시각화합니다.
  6. 상당히 조절 장애가 있는 단백질을 선택합니다. 단백질 발현 값에 Z-점수 정규화를 적용합니다. 샘플 그룹 주석이 있는 클러스터형 히트맵을 플로팅합니다.
  7. 조직을 사용하여 단백질을 Entrez ID에 매핑합니다. Hs.eg.db. GO 농축(생물학적 과정) 및 KEGG 경로 분석을 수행합니다.
    참고: 생물학적 과정(BP) 범주는 여러 분자 활동에 의해 수행되는 더 큰 과정 또는 생물학적 프로그램을 설명하기 때문에 유전자 온톨로지(GO) 분석에서 일반적으로 선택됩니다20. 이러한 용어는 세포 주기 조절, 대사 과정 등과 같은 필수 과정을 포함하여 암과 같은 질병에서 잘못되는 세포 기능에 중점을 둡니다. BP 외에도 GO 분석에는 분자 기능(MF) 및 세포 성분(CC) 범주도 포함됩니다. MF 용어는 이온 수송 또는 DNA 결합 능력과 같은 유전자 산물의 생화학적 활성을 간략하게 설명합니다. CC 용어는 유전자 산물이 핵, 미토콘드리아 막 또는 세포골격과 같은 기능을 수행하는 세포 위치를 정의합니다.
  8. 상호 작용에 대해 STRINGdb를 쿼리합니다(신뢰도 점수 ≥ 400). visNetwork를 사용하여 대화형 네트워크를 생성합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

단백질체 데이터 세트 검색을 더 잘 설명하기 위해 이 분석을 위해 두 가지 유형의 데이터 세트를 선택했습니다. 임상 맥락에서 조절 장애 단백질을 입증하기 위해 clinic과 같은 키워드를 사용하여 PRIDE에서 검색했습니다. 구체적으로, 우리는 CPTAC(Clinical Proteomic Tumor Analysis Consortium)21에서 DIA 분석에 적합한 데이터 세트를 선택했고, CNHPP(Chinese Human Proteome Project)22에서 DDA 분석에 적합한 다른 데이터 세트를 선택했습니다. 이러한 선택은 건강한 및 질병 관련 단백질체 데이터를 모두 분석하는 소프트웨어 기능의 포괄적인 평가 및 시연을 용이하게 했습니다.

제시된 화산 플롯은 정상 개인과 췌...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

제시된 프로토콜은 DIA-NN 및 FragPipe와 같은 무료 도구를 통합하여 단백질체학 데이터 분석을 보여줍니다. 성공은 DIA-NN(단계 2.3)27에서 스펙트럼 라이브러리 생성을 위한 정확한 전구체 이온 선택 및 질량 정확도 설정과 같은 중요한 단계에 달려 있으며, 이는 기기에 따라 다르며 완전한 펩타이드 식별에 중요합니다. 마찬가지로 미끼 생성 및 오염 물질 필터링을 포함하여 FragPipe(3.4단계)의 세심한 데이터베이스 설정은 FDR을 제어하는 데 필수적입니다.

수정 및 문제 해결에는 소프트웨어 종속성(예: MSFileReader의 경우 .NET, FragPipe의 경우 Java)을 확인하고 계산 리소스 관리가 포함되는 경우가 많으며, 특히 MSFragger의 경우 메모리를 늘리거나 DIA-NN의 경우 고성능 컴퓨팅(HPC)을 사용해야 할 수 있습니다. 커뮤니티 ...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

FZ는 Molemuse Biotech Studio의 설립자입니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 프로젝트는 Molemuse Biotech Studio의 지원을 받습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
.NET SDK 버전 9.0.203마이크로소프트https://dotnet.microsoft.com/en-us/download
DIA-NN 버전 2.1.0https://github.com/vdemichev/DiaNN/releases/tag/2.0 
FragPipe v. 22.0https://github.com/Nesvilab/FragPipe/releases
MSFileReader v. 3.1 써모 피셔https://github.com/thermofisherlsms/MSFileReader/blob/main/MSFileReader_x64.exe
R 4.5.0https://cran.rstudio.com/bin/windows/base/R-4.5.0-win.exe
Rstudio 대 2024.12.1+563https://posit.co/download/rstudio-desktop/

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pedrioli, P. G. A., et al. A common open representation of mass spectrometry data and its application to proteomics research. Nat Biotechnol. 22 (11), 1459-1466 (2004).
  2. Perez-Riverol, Y., et al. The PRIDE database at 20 years: 2025 update. Nucl Acids Res. 53 (D1), D543-D553 (2025).
  3. Deutsch, E. W., et al. Proteomics Standards Initiative at Twenty Years: Current Activities and Future Work. J Proteome Res. 22 (2), 287-301 (2023).
  4. Schubert, O. T., Röst, H. L., Collins, B. C., Rosenberger, G., Aebersold, R. Quantitative proteomics: challenges and opportunities in basic and applied research. Nat Protoc. 12 (7), 1289-1294 (2017).
  5. Wang, X., Shen, S., Rasam, S. S., Qu, J. MS1 ion current-based quantitative proteomics: A promising solution for reliable analysis of large biological cohorts. Mass Spectro Rev. 38 (6), 461-482 (2019).
  6. Vaudel, M. MS2-Based Quantitation. Proteome Inform. , 155-177 (2016).
  7. Meyer, J. G. Qualitative and Quantitative Shotgun Proteomics Data Analysis from Data-Dependent Acquisition Mass Spectrometry. Shotgun Proteomics. 2259, 297-308 (2021).
  8. Fröhlich, K., et al. Data-Independent Acquisition: A Milestone and Prospect in Clinical Mass Spectrometry-Based Proteomics. Mol Cell Proteomics. 23 (8), 100800(2024).
  9. Zhang, F., Ge, W., Ruan, G., Cai, X., Guo, T. Data-Independent Acquisition Mass Spectrometry-Based Proteomics and Software Tools: A Glimpse in 2020. Proteomics. 20 (17-18), 1900276(2020).
  10. Deutsch, E. W., et al. The ProteomeXchange consortium at 10 years: 2023 update. Nucl Acids Res. 51 (D1), D1539-D1548 (2023).
  11. Demichev, V., Messner, C. B., Vernardis, S. I., Lilley, K. S., Ralser, M. DIA-NN:neural networks and interference correction enable deep proteome coverage in high throughput. Nat Meth. 17 (1), 41-44 (2020).
  12. Zhang, F., et al. A Comparative Analysis of Data Analysis Tools for Data-Independent Acquisition Mass Spectrometry. Mol Cell Proteomics. 22 (9), 100623(2023).
  13. Kong, A. T., Leprevost, F. V., Avtonomov, D. M., Mellacheruvu, D., Nesvizhskii, A. I. MSFragger: ultrafast and comprehensive peptide identification in mass spectrometry-based proteomics. Nat Meth. 14 (5), 513-520 (2017).
  14. Anderson, N. L., Anderson, N. G. The Human Plasma Proteome. Mol Cell Proteomics. 1 (11), 845-867 (2002).
  15. Kowal, J., et al. Proteomic comparison defines novel markers to characterize heterogeneous populations of extracellular vesicle subtypes. Proc Natl Acad Sci. 113 (8), E968-E977 (2016).
  16. Cao, L., et al. Proteogenomic characterization of pancreatic ductal adenocarcinoma. Cell. 184 (19), 5031-5052.e26 (2021).
  17. Dong, L., et al. Proteogenomic characterization identifies clinically relevant subgroups of intrahepatic cholangiocarcinoma. Cancer Cell. 40 (1), 70-87.e15 (2022).
  18. Dubois, E., Galindo, A. N., Dayon, L., Cominetti, O. Comparison of normalization methods in clinical research applications of mass spectrometry-based proteomics. 2020 IEEE Conf Computat Intelligence Bioinfo Computat Biol. , 1-10 (2020).
  19. Dressler, F. F., Brägelmann, J., Reischl, M., Perner, S. Normics: Proteomic Normalization by Variance and Data-Inherent Correlation Structure. Mol Cell Proteomics. 21 (9), 100269(2022).
  20. Dimmer, E. C., et al. The Gene Ontology - Providing a Functional Role in Proteomic Studies. Proteomics. 8 (23-24), pmic.200800002(2008).
  21. Lih, T. M., et al. Detection of Pancreatic Ductal Adenocarcinoma-Associated Proteins in Serum. Mol Cell Proteomics. 23 (1), 100687(2024).
  22. Chinese Human Proteome Project (CNHPP) Consortium. Proteomics identifies new therapeutic targets of early-stage hepatocellular carcinoma. Nature. 567 (7747), 257-261 (2019).
  23. Kanehisa, M., Furumichi, M., Sato, Y., Matsuura, Y., Ishiguro-Watanabe, M. KEGG: biological systems database as a model of the real world. Nucl Acids Res. 53 (D1), D672-D677 (2025).
  24. Campello, E., Ilich, A., Simioni, P., Key, N. S. The relationship between pancreatic cancer and hypercoagulability: a comprehensive review on epidemiological and biological issues. Br J Cancer. 121 (5), 359-371 (2019).
  25. Fang, L., Xu, Q., Qian, J., Zhou, J. Y. Aberrant Factors of Fibrinolysis and Coagulation in Pancreatic Cancer. OncoTargets Ther. 14, 53-65 (2021).
  26. Vlodavsky, I., Elkin, M., Ilan, N. Impact of heparanase and the tumor microenvironment on cancer metastasis and angiogenesis: basic aspects and clinical applications . Rambam Maimonides Med J. 2 (1), (2011).
  27. Fröhlich, K., et al. Benchmarking of analysis strategies for data-independent acquisition proteomics using a large-scale dataset comprising inter-patient heterogeneity. Nat Comm. 13 (1), 2622(2022).
  28. Polasky, D. A., et al. MSFragger-Labile: A Flexible Method to Improve Labile PTM Analysis in Proteomics. Mol Cell Proteomics. 22 (5), 100538(2023).
  29. Gerault, M. A., Camoin, L., Granjeaud, S. DIAgui: a Shiny application to process the output from DIA-NN. Bioinfo Adv. 4 (1), (2024).
  30. Hsiao, Y., et al. Analysis and Visualization of Quantitative Proteomics Data Using FragPipe-Analyst. J Proteome Res. 23 (10), 4303-4315 (2024).
  31. Yu, F., Deng, Y., Nesvizhskii, A. I. MSFragger-DDA+ enhances peptide identification sensitivity with full isolation window search. Nat Comm. 16 (1), 3329(2025).
  32. Li, K., Teo, G. C., Yang, K. L., Yu, F., Nesvizhskii, A. I. diaTracer enables spectrum-centric analysis of diaPASEF proteomics data. Nat Comm. 16 (1), 95(2025).
  33. Qiao, R., Li, H., Bian, H., Xin, L., Shan, B. De Novo sequencing-assisted homology search for DIA data analysis enables low abundance peptide variants discovery. Biorvix. 10, (2025).
  34. Meissner, F., Geddes-McAlister, J., Mann, M., Bantscheff, M. The emerging role of mass spectrometry-based proteomics in drug discovery. Nat Rev Drug Disc. 21 (9), 637-654 (2022).
  35. Zheng, Y., et al. Multi-omics data integration using ratio-based quantitative profiling with Quartet reference materials. Nat Biotechnol. 42 (7), 1133-1149 (2024).
  36. Bubis, J. A., et al. Challenging the Astral mass analyzer to quantify up to 5,300 proteins per single cell at unseen accuracy to uncover cellular heterogeneity. Nat Meth. 22 (3), 510-519 (2025).
  37. Leutert, M., Entwisle, S. W., Villén, J. Decoding Post-Translational Modification Crosstalk With Proteomics. Mol Cell Proteomics. 20, 100129(2021).
  38. Schneider, M., et al. A Scalable, Web-Based Platform for Proteomics Data Processing, Result Storage and Analysis. Proteome Res. 24 (3), 1241-1249 (2025).
  39. Jalili, V., et al. The Galaxy platform for accessible, reproducible and collaborative biomedical analyses: 2020 update. Nucl Acids Res. 48 (W1), W395-W402 (2020).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

KEGG

관련 논문