질량 분석 기반 단백질체 데이터는 개방형 데이터베이스에서 사용할 수 있으며 무료 도구를 사용하여 액세스할 수 있습니다. 데이터베이스 검색 및 설명의 복잡성을 감안할 때 많은 생물학자들은 이러한 데이터 세트를 활용할 수 있는 지식이 부족합니다. 여기에서는 기본 단백질체 데이터 검색을 위한 무료 도구 사용에 대한 가이드를 제공합니다.
방법 논문
질량 분석 기반 단백질체 데이터는 개방형 데이터베이스에서 사용할 수 있으며 무료 도구를 사용하여 액세스할 수 있습니다. 데이터베이스 검색 및 설명의 복잡성을 감안할 때 많은 생물학자들은 이러한 데이터 세트를 활용할 수 있는 지식이 부족합니다. 여기에서는 기본 단백질체 데이터 검색을 위한 무료 도구 사용에 대한 가이드를 제공합니다.
DDA(Data-Dependent Acquisition) 및 DIA(Data-Independent Acquisition)를 포함한 질량 분석법(MS) 기반 단백질체학 데이터는 생물학 연구에 널리 사용됩니다. 그러나 검증 연구에 이러한 데이터 세트를 적용하는 것은 단백질체 데이터를 효과적으로 검색하고 분석하는 방법에 대한 명확한 시연이 부족하기 때문에 여전히 제한적입니다. 이 격차를 메우기 위해 단백질체 데이터 분석 워크플로우와 단백질 검색 결과의 다운스트림 후처리를 더 잘 설명하기 위해 PRIDE(PRoteomics IDEntifications Database) 데이터 저장소에 보관된 하나의 DDA 및 하나의 DIA 데이터 세트를 선택했습니다. 데모를 위해 DDA 데이터 세트용 FragPipe(v22.0)와 DIA 데이터 세트용 DIA-NN(2.1.0)이라는 두 가지 무료 계산 도구를 사용했습니다. 화산 플롯 및 조절 장애 단백질 목록 생성과 같은 후처리 단계는 R 코드를 사용하여 시연되었습니다. 본 연구는 단백질체 데이터를 검색하고 분석하기 위한 기본 프로토콜을 제공하여 단백질체 데이터 세트를 효과적으로 처리하기 위한 필수 초보자 가이드 역할을 합니다. 이 작업을 통해 우리는 연구자들이 생물학적 조사에 단백질체 데이터를 활용하는 데 필요한 지식을 갖추는 것을 목표로 합니다.
단백질체학 분야는 연구 역량을 발전시키고 데이터 공유 문화를 촉진하는 데 중요한 역할을 해온 오픈 액세스 데이터 저장소와 자유 소프트웨어 도구1의 광범위한 채택으로 혁명을 일으켰습니다. PRIDE2와 같은 중앙 집중식 리소스의 구축과 HUPO(Human Proteome Organization) PSI(Proteomics Standards Initiative)3 의 표준화된 데이터 형식 개발은 데이터 재사용 및 통합을 위한 전례 없는 기회를 창출했습니다. 그러나 단백질체 데이터의 분석 및 해석은 특히 자신의 실험 결과에 대한 직교 검증을 수행하려는 생물학자 및 의사 과학자에게 여전히 상당한 기술적 장벽을 제시합니다4. 이 원고는 연구자가 공개 단백질체학 데이터를 독립적으로 쿼리, 분석 및 자체 발견과 통합할 수 있는 접근 가능한 프레임워크를 제공하는 공급업체에 구애받지 않는 계산 워크플로를 제시함으로써 이러한 문제를 직접 해결함으로써 추가 습식 실험실 실험 없이도 강력한 직교 검증을 용이하게 합니다. 이 연구는 자체 실험에서 확인된 특정 단백질의 차등 발현을 직교적으로 검증하고 광범위한 발표된 연구에서 관심 단백질의 발현 패턴을 탐색하여 새로운 가설을 생성하려는 연구자에게 특히 적합합니다. 단계별 가이드를 제공함으로써 우리는 더 넓은 범위의 과학자들이 공개 단백질체학 데이터의 잠재력을 최대한 활용할 수 있도록 지원하고 궁극적으로 연구의 견고성과 영향력을 향상시키는 것을 목표로 합니다.
질량 분석법(MS) 기반 단백질체학에서 MS1 및 MS2 스캔은 데이터 수집의 기본입니다. MS1 스캔 또는 조사 스캔은 샘플에 있는 모든 이온의 질량 대 전하 비율(m/z) 비율을 감지하고 측정하여 이온 집단에 대한 포괄적인 개요를 제공합니다5. 단편화 스캔이라고도 하는 MS2 스캔은 MS1 스캔에서 선택된 특정 전구체 이온을 분리 및 단편화하여 펩타이드 식별을 위한 단편 이온 스펙트럼을 생성하는 것을 포함합니다6.
데이터 의존 획득(DDA)은 MS2 단편화를 위해 MS1 스캔에서 가장 풍부한 이온을 선택하여 분석을 간소화하는 더 간단한 스펙트럼을 생성합니다. 그러나 DDA는 복잡한 샘플에서 확률론적 샘플링 및 누락값으로 이어져 재현성을 제한할 수 있습니다7. 대조적으로, 데이터 독립적 획득(DIA)은 사전 정의된 m/z 창 내의 모든 이온을 체계적으로 단편화하여 포괄적인 적용 범위를 보장하고 누락된 값을 최소화합니다. 이는 정량적 정확성과 재현성을 향상시키지만8, DIA는 매우 복잡한 MS2 스펙트럼을 디콘볼루션하기 위해 고급 계산 도구가 필요합니다9.
PRIDE(https://www.ebi.ac.uk/pride)2는 단백질체학 데이터 공유를 위한 글로벌 플랫폼인 ProteomeXchange 컨소시엄(https://www.proteomexchange.org)10 내의 선도적인 저장소입니다. 사용자는 키워드 검색을 사용하여 이 방대한 리소스를 효율적으로 탐색하여 관심 있는 데이터 세트를 찾을 수 있습니다.
심층 신경망을 활용하는 소프트웨어 제품군인 DIA-NN11은 DIA(Data-Independent Acquisition) 단백질체학 데이터를 분석하기 위한 표준 도구입니다. 식별 및 정량화 정확도가 뛰어나 복잡한 DIA 데이터 세트를 처리하는 데 특히 효과적입니다12. 데이터 의존적 획득(DDA) 워크플로우의 경우 FragPipe 파이프라인에 통합된 MSFragger13은 초고속 펩타이드 식별을 제공합니다. 혁신적인 단편 이온 인덱싱 (fragment-ion indexing) 접근 방식을 통해 신속한 스펙트럼 매칭이 가능하며, 기존 도구보다 속도가 100 배 이상 향상됩니다.
이러한 포괄적인 데이터베이스와 고급 도구를 갖춘 연구자들은 교차 연구 검증 및 새로운 생물학적 발견을 위해 단백질체 데이터를 쉽게 재사용할 수 있습니다. 이러한 접근성은 다양한 질병에 걸쳐 수많은 단백질 바이오마커의 식별을 주도하고14,15, 예후 예측을 개선하고16, 단백질체학 프로필을 기반으로 한 분자 아형 분류를 가능하게 했습니다17.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
참고: 워크플로에 대한 개요는 그림 1을 참조하고 사용된 소프트웨어에 대한 자세한 설명은 재료 표 를 참조하십시오.

그림 1: 연구 설계 개요. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
1. 예제 파일 및 소프트웨어 설정
참고: 모든 응용 프로그램은 개별 연구용으로 무료이며 개인용 컴퓨터에서 실행할 수 있습니다(Windows 및 Linux 지원).
2. DIA-NN을 이용한 DIA 데이터 분석
3. FragPipe를 이용한 DDA 데이터 분석
4. DIA-NN/FragPipe 다운스트림 분석
참고: 이 연구에 사용된 세부 코드는 보충 파일 1 및 보충 파일 2로 포함되어 있습니다. 이 연구에서 사용된 패키지 버전은 보충 파일 3에서 찾을 수 있습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
단백질체 데이터 세트 검색을 더 잘 설명하기 위해 이 분석을 위해 두 가지 유형의 데이터 세트를 선택했습니다. 임상 맥락에서 조절 장애 단백질을 입증하기 위해 clinic과 같은 키워드를 사용하여 PRIDE에서 검색했습니다. 구체적으로, 우리는 CPTAC(Clinical Proteomic Tumor Analysis Consortium)21에서 DIA 분석에 적합한 데이터 세트를 선택했고, CNHPP(Chinese Human Proteome Project)22에서 DDA 분석에 적합한 다른 데이터 세트를 선택했습니다. 이러한 선택은 건강한 및 질병 관련 단백질체 데이터를 모두 분석하는 소프트웨어 기능의 포괄적인 평가 및 시연을 용이하게 했습니다.
제시된 화산 플롯은 정상 개인과 췌...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
제시된 프로토콜은 DIA-NN 및 FragPipe와 같은 무료 도구를 통합하여 단백질체학 데이터 분석을 보여줍니다. 성공은 DIA-NN(단계 2.3)27에서 스펙트럼 라이브러리 생성을 위한 정확한 전구체 이온 선택 및 질량 정확도 설정과 같은 중요한 단계에 달려 있으며, 이는 기기에 따라 다르며 완전한 펩타이드 식별에 중요합니다. 마찬가지로 미끼 생성 및 오염 물질 필터링을 포함하여 FragPipe(3.4단계)의 세심한 데이터베이스 설정은 FDR을 제어하는 데 필수적입니다.
수정 및 문제 해결에는 소프트웨어 종속성(예: MSFileReader의 경우 .NET, FragPipe의 경우 Java)을 확인하고 계산 리소스 관리가 포함되는 경우가 많으며, 특히 MSFragger의 경우 메모리를 늘리거나 DIA-NN의 경우 고성능 컴퓨팅(HPC)을 사용해야 할 수 있습니다. 커뮤니티 ...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
FZ는 Molemuse Biotech Studio의 설립자입니다.
이 프로젝트는 Molemuse Biotech Studio의 지원을 받습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| .NET SDK 버전 9.0.203 | 마이크로소프트 | https://dotnet.microsoft.com/en-us/download | |
| DIA-NN 버전 2.1.0 | https://github.com/vdemichev/DiaNN/releases/tag/2.0 | ||
| FragPipe v. 22.0 | https://github.com/Nesvilab/FragPipe/releases | ||
| MSFileReader v. 3.1 | 써모 피셔 | https://github.com/thermofisherlsms/MSFileReader/blob/main/MSFileReader_x64.exe | |
| R 4.5.0 | https://cran.rstudio.com/bin/windows/base/R-4.5.0-win.exe | ||
| Rstudio 대 2024.12.1+563 | https://posit.co/download/rstudio-desktop/ |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청