2025년 8월 19일
질량 분석 기반 단백질체 데이터는 개방형 데이터베이스에서 사용할 수 있으며 무료 도구를 사용하여 액세스할 수 있습니다. 데이터베이스 검색 및 설명의 복잡성을 감안할 때 많은 생물학자들은 이러한 데이터 세트를 활용할 수 있는 지식이 부족합니다. 여기에서는 기본 단백질체 데이터 검색을 위한 무료 도구 사용에 대한 가이드를 제공합니다.
우리의 연구는 생물학자들이 무료 도구를 사용하여 복잡한 단백질체 데이터를 분석할 수 있는 가이드를 제공합니다. 우리는 그들이 결과를 검증하고 공개 데이터 세트를 탐색할 수 있도록 권한을 부여하는 것을 목표로 합니다. 많은 생물학자들은 명확한 지침이 부족하여 공개 프로테옴 데이터를 사용할 수 없습니다.
우리의 작업은 이를 연결하여 새로운 야생 동물 실험 없이 검증을 가능하게 합니다. 우리의 작업은 공급업체에 구애받지 않는 무료 최첨단 소프트웨어를 활용합니다. 이러한 도구는 많은 기존 도구보다 더 빠르고 민감하며 더 정확한 프로테옴 발견을 제공합니다.
시작하려면 UniProt 데이터베이스에서 참조 프로테옴 FASTA 파일을 다운로드하십시오. FASTA 추가 버튼을 클릭하여 참조 단백질체 파일을 DIA-NN 소프트웨어에 로드합니다. 전구체 이온 생성 섹션에서 라이브러리 무료 검색 라이브러리 생성을 위한 FASTA 다이제스트와 딥 러닝 기반 스펙트럼, RT 및 IM 예측의 두 가지 옵션을 선택합니다.
그런 다음 실행 버튼을 클릭하여 예측 스펙트럼 라이브러리를 생성합니다. 전구체 이온 생성 섹션에서 두 가지 옵션을 선택 취소합니다. 입력 섹션에서 파일 형식에 해당하는 유형 버튼을 클릭하여 DIA 데이터를 로드합니다.
이제 알고리즘 섹션에서 질량 정확도와 MS1 정확도를 모두 백만분의 0으로 설정합니다. 실험 설정에 따라 전구체 이온 생성 섹션에서 전구체 및 단편 질량 범위 설정을 조정합니다. 다른 소프트웨어 설정은 변경하지 않고 유지합니다.
그런 다음 실행 버튼을 클릭합니다. 작업이 완료될 때까지 대기(Wait until finished)가 작동에 표시되어 분석이 완료되었음을 나타냅니다. 설치 후 bin 폴더에 있는 파편 파이프 아이콘을 클릭합니다.
구성 탭으로 이동하여 모든 종속 설정을 봅니다. 시스템에서 MSFragger, IonQuant, diaTracer, DIA-NN 및 Python 모듈을 사용할 수 있는지 확인합니다. 누락된 모듈이 있는 경우 업데이트 다운로드 또는 다운로드를 클릭하여 검색합니다.
이제 워크플로 탭으로 전환합니다. 워크플로우 드롭다운에서 기본값을 선택하고 워크플로 로드를 클릭합니다. 그런 다음 파일 추가를 클릭하여 파일 경로를 입력합니다.
파일 할당 아래에 실험 이름과 생물학적 복제 번호를 할당하거나 비워 둡니다. 그런 다음 데이터베이스 탭을 클릭하여 전환합니다. 디스크에서 FASTA 파일을 로드하거나 샘플 종에 해당하는 파일을 다운로드합니다.
다운로드하는 동안 옵션을 선택하고, 시퀀스만 검토하고, 미끼를 추가하고, 간단한 실행을 위해 일반적인 오염 물질을 추가합니다. MSFragger 탭을 클릭하여 보기를 변경합니다. 닫힌 검색 기본 구성을 선택하고 로드를 클릭합니다.
피크 일치 설정에서 모든 기본값을 유지합니다. 보정 및 최적화 모두에서 처리 시간을 줄이려면 없음을 선택합니다. 단백질 분해의 경우 실험 요구 사항에 따라 매개변수를 조정하고 나머지 기본 설정을 유지합니다.
이제 유효성 검사 탭으로 전환합니다. predict RT 및 predict spectra는 데이터 독립적인 수집 워크플로를 위한 옵션이므로 선택 취소합니다. 퀀트 MS1 탭을 클릭합니다.
MS1 퀀트 실행을 선택한 다음 로드 퀀트 기본값을 클릭합니다. 이온 양을 선택하고 다른 모든 설정을 기본값으로 둡니다. 마지막으로 실행 탭을 클릭하여 계속 진행합니다.
원하는 출력 디렉토리를 선택하고 실행을 클릭하여 데이터 분석을 시작합니다. 췌관 선암종(PDAC) 환자에서 SERPINA5와 HPSE는 정상인에 비해 혈청에서 발현이 증가한 반면, FGB는 혈청에서 발현이 증가한 것으로 나타났습니다. 간세포암종 종양 샘플에서 ENO3, PLS3, MTAP, SERPINB9 및 ITPR2는 쌍을 이루는 조직에 비해 발현이 감소한 반면 ME1, CYP27A1, RPS16 및 ATP5PF는 유의하게 증가했습니다.
히트 맵 시각화는 정상인에 비해 PDAC 환자의 혈청에서 단백질 발현이 지속적으로 증가한 것으로 나타났습니다. PDAC 혈청의 유전자 온톨로지 농축 분석은 응고 및 지혈과 관련된 과정의 상당한 상향 조절을 보여주었습니다. 간세포 암종 종양의 GO 분석은 퓨린 뉴클레오티드 대사 및 NAD 대사 경로를 포함한 뉴클레오티드 및 대사 과정의 농축을 확인했습니다.
PDAC 혈청의 KEGG 경로 농축 분석은 글리코사미노글리칸 분해와 함께 보체 및 응고 캐스케이드 경로의 상당한 활성화를 나타냈습니다. 간세포 암종 종양 샘플의 KEG 분석은 통계적 유의성이 낮지만 PPAR 신호 전달, 탄소 대사 및 신경퇴행성 질환 경로의 농축을 확인했습니다. 상향 조절된 PDAC 혈청 단백질에 대한 단백질-단백질 상호작용 네트워크는 응고 인자 11, 피브리노겐 베타 사슬 및 혈장 세린 프로테아제 억제제뿐만 아니라 HPSE, CD5 항원 유사 및 CRISP3를 포함한 여러 분리된 단백질을 포함하는 중앙 클러스터를 밝혔습니다.
전체 스크립트를 보고 수천 개의 과학 동영상에 액세스하세요
이 연구는 생물학자들이 무료의 최신 도구를 사용하여 복잡한 단백질체학 데이터를 분석하는 포괄적인 가이드를 제공합니다.
Mass spectrometry-based proteomics is increasingly central to early discovery and translational research, yet data complexity and lack of accessible workflows limit its broader adoption in biopharma R&D. This article demonstrates how free, vendor-agnostic computational tools enable robust interrogation and validation of public proteomic datasets, supporting hypothesis-driven research without new experimental burden. Streamlined data analysis workflows enhance predictive confidence and facilitate cross-study comparisons, directly impacting target validation and biomarker discovery pipelines.
This workflow positions mass spectrometry data analysis from early discovery through lead identification and translational research, leveraging public repositories and free computational tools.