이 콘텐츠를 보려면 JoVE 구독이 필요합니다. 로그인하거나 오늘 무료 평가판을 시작하세요.

방법 논문

데이터 독립적 획득 단백질체학 및 기계 학습을 사용하여 자폐 스펙트럼 장애에서 면역 관련 분자 바이오마커 식별

564 조회수

DOI:

10.3791/68949

2025년 9월 26일

* These authors contributed equally

이 논문에서

요약

여기에서는 효소 결합 면역흡착 분석법으로 검증된 초기 자폐 스펙트럼 장애 진단을 위한 정확한 바이오마커로 8개의 면역 관련 단백질을 식별한 데이터 독립적 획득 질량 분석법 및 기계 학습을 사용하는 프로토콜을 제시합니다.

초록

이 연구는 기계 학습(ML)과 결합된 데이터 독립적 획득(DIA) 질량 분석법을 사용하여 자폐 스펙트럼 장애(ASD)와 관련된 혈청 단백질 바이오마커를 식별하기 위한 재현 가능한 프로토콜을 제시합니다. DIA는 저농도 단백질을 포함한 혈청 프로테옴의 편향되지 않은 고분해능 프로파일링을 가능하게 하는 동시에 샘플 전반에 걸쳐 재현성을 보장합니다. 진단적으로 유익한 단백질 패널을 선택하고 모델 견고성을 개선하기 위해 ML 접근 방식을 적용했습니다. 분석에는 ASD가 있는 99명의 어린이와 70명의 연령이 일치하는 대조군의 혈청이 포함되었습니다. 고농도 단백질을 고갈시키고, 표준화된 분해 및 분획 절차를 사용하여 펩타이드를 준비하고, 고분해능 질량 분석기에서 DIA를 수행했습니다. 데이터 처리 및 정량화를 통해 기능적 농축 분석을 거친 차등적으로 발현된 단백질을 확인했습니다. 8개의 면역 관련 단백질이 바이오마커 개발의 강력한 후보로 떠올랐습니다. 이러한 단백질에 대해 훈련된 로지스틱 회귀 모델은 교차 검증에서 95.27%의 정확도, 0.9025의 Kappa 값, 1.000의 AUC를 달성했습니다. 이러한 발견은 기계 학습과 결합된 DIA 기반 단백질체학이 ASD의 바이오마커 발견 및 광범위한 임상 연구에서의 적응을 위한 강력한 프레임워크로서 잠재력을 보여줍니다.

서론

자폐 스펙트럼 장애(ASD)는 병인 및 임상 양상의 이질성을 특징으로 하는 조기 발병 신경 발달 장애 그룹입니다. 핵심 기능에는 사회적 의사소통 및 상호 작용의 지속적인 결함뿐만 아니라 제한적이고 반복적인 행동, 관심사 또는 활동이 포함됩니다. 미국에서는 유병률이 8세 어린이의 약 2.3%, 성인의 약 2.2%로 공중 보건에 미치는 영향을 강조합니다 1,2,3,4. 위험 요인은 유전적 소인, 면역 조절 장애, 산전 환경 노출 등 다양합니다 5,6,7. 조기 진단 및 개입은 발달 결과를 크게 개선할 수 있으므로 객관적이고 신뢰할 수 있는 바이오마커의 식별이 ASD 연구의 주요 초점이 됩니다 8,9,10. 이 프로토콜은 이전에 발표된 연구 결과를 기반으로 데이터 독립적 획득(DIA) 단백질체학 및 기계 학습을 적용하여 면역 관련 단백질을 조기 ASD 진단을 위한 잠재적 바이오마커로 식별합니다11.

광범위한 노력에도 불구하고 현재 임상 ASD 진단을 위한 구체적이고 보편적으로 검증된 바이오마커는 존재하지 않습니다12. 장내 미생물군집13의 변화, 인터루킨-6(IL-6)14 상승, 뇌 유래 신경영양 인자(BDNF)15의 변화, 글루타티온16과 같은 산화 스트레스 마커와 같은 제안된 후보는 예비 단계로 남아 있으며 임상 사용에 대한 재현성이 부족합니다. 단백질체학은 질병 특이적 분자 시그니처를 식별하기 위한 유망한 접근 방식으로 부상했으며 여러 연구에서 차등적으로 발현되는 단백질에 대한 다양한 생물학적 샘플(혈액, 타액, 소변, PBMC)을 조사했습니다 8,17,18,19,20,21,22 . 예를 들어, Bao et al. Olink 단백질체학에 의해 확인된 염증 단백질이 ASD 조기 진단에 도움이 될 수 있음을 입증한 반면(17), 다른 연구에서는 공유된 단백질체 및 대사 경로가 ASD의 유전적 이질성에도 불구하고 강력한 바이오마커를 생성할 수 있음을 시사합니다23.

DIA 질량 분석법은 포괄적이고 재현 가능한 단백질 프로파일링으로 인해 점점 더 주목을 받고 있습니다. 가장 강렬한 이온을 선택적으로 단편화하는 기존의 데이터 의존 획득(DDA)과 달리 DIA는 사전 정의된 m/z 창에서 모든 전구체 이온을 단편화합니다. 이는 대규모 코호트에 걸쳐 더 깊은 프로테옴 커버리지와 향상된 재현성을 제공하며, 이는 임상 비교를 위한 주요 이점입니다14. 벤치마킹 연구에 따르면 DIA는 DDA보다 정량화 가능한 펩타이드를 더 많이 검출하며, 특히 저농도 단백질의 경우 런 간 변동이 더 낮습니다14.

이러한 발전을 바탕으로 우리는 고농도 단백질이 고갈된 후 ASD가 있는 99명의 어린이와 70명의 대조군의 혈청 샘플에 DIA 기반 단백질체학 분석을 적용했습니다. 우리의 연구 결과는 조기 ASD 진단을 위한 분자 마커로서 면역 관련 단백질의 잠재력을 강조하고 엄격한 방법론과 결합될 때 바이오마커 발견에서 DIA 기반 단백질체학의 가치를 보여줍니다11.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

프로토콜은 헬싱키 선언에 따라 수행되었으며 프로토콜은 창사 모자 건강 병원의 기관 검토 위원회의 승인을 받았습니다. 피험자로부터 정보에 입각한 동의를 얻었습니다.

1. DSM-5를 통한 자폐 아동 식별

  1. 병력 및 배경 정보 수집
    1. 발달 역사
      1. 언어, 사회 및 운동 능력 진행을 포함하여 환자의 초기 발달에 대한 정보를 수집합니다.
      2. 발달 지연이나 이상(예: 언어 지연, 사회적 상호 작용의 어려움)을 기록하십시오.
    2. 가족력
      1. 자폐증 또는 기타 신경 발달 장애의 가족력에 대해 문의하십시오.
    3. 현재 기능 수준
      1. 학습, 업무, 사회적 상호 작용 및 독립적인 생활 기술을 포함한 일상 생활에서 환자의 성과를 평가합니다.
  2. DSM-5 진단 기준 사용
    1. 사회적 의사소통과 사회적 상호 작용의 지속적인 결함
      1. 다음 세 가지 기준 중 두 가지 이상이 충족되는지 확인합니다.
        1. 사회적-정서적 호혜성의 결함은 정상적인 눈맞춤, 얼굴 표정 또는 신체 언어의 부족과 연령에 맞는 우정이나 관계를 형성하는 데 어려움을 겪습니다.
        2. 비언어적 의사소통 행동의 결함 - 감정을 전달하기 위해 몸짓, 표정 또는 목소리 톤을 사용하는 데 어려움을 겪고 다른 사람의 비언어적 신호에 대한 제한된 이해를 찾습니다.
        3. 관계를 개발, 유지 및 이해하는 데 결함이 있는 경우 - 다양한 사회적 맥락에 적응하는 데 어려움이 있고 또래에 대한 관심 부족 또는 상상력이 풍부한 놀이에 참여할 수 없음을 찾습니다.
    2. 제한적이고 반복적인 행동, 관심사 또는 활동 패턴
      1. 다음 네 가지 기준 중 두 가지 이상이 충족되는지 확인합니다.
        1. 고정관념적이거나 반복적인 운동 운동(예: 손 펄럭임, 몸 흔들기 또는 반복적인 물체 사용).
        2. 동일성에 대한 고집 또는 의식화된 행동 패턴 - 일상의 사소한 변화에 대한 극도의 고통을 찾습니다.
        3. 매우 제한적이고 집착된 관심사 - 특정 주제나 활동에 비정상적으로 집중하는 것을 찾습니다.
        4. 감각 입력에 대한 과민성 또는 저반응성은 소리, 빛 또는 촉각과 같은 감각 자극에 대한 비정형 반응을 찾습니다.
  3. 증상 발현 및 중증도 평가
    1. 증상의 시기 - 증상이 나중에 더 분명해지더라도 유아기(일반적으로 3세 이전)에 나타났음을 확인합니다.
    2. 증상의 영향 - 증상이 사회적, 직업적 또는 기타 중요한 기능 영역에 심각한 손상을 유발하는지 확인합니다.
    3. 심각도 수준
      참고: DSM-5에 따르면 ASD 중증도는 세 가지 수준으로 분류됩니다(보충 표 S1).
      1. 환자에게 가벼운 지원만 필요한 경우 레벨 1로 분류합니다.
      2. 환자에게 상당한 지원이 필요한 경우 레벨 2로 분류합니다(보통).
      3. 환자에게 매우 실질적인 지원(심각함)이 필요한 경우 레벨 3으로 분류합니다.
  4. 다른 잠재적 원인 배제
    1. 건강 검진 유사한 증상을 유발할 수 있는 다른 상태(예: 유전 증후군, 청각 장애, 지적 장애)를 배제하기 위해 필요한 의학적 평가(예: 유전자 검사, 뇌 영상)를 수행합니다.
    2. 동반이환 평가: 동반이환 상태(예: 주의력 결핍 과잉 행동 장애, 불안 장애, 우울증, 간질 등)의 존재를 평가합니다.

2. DIA 질량 분석 분석을 위한 시료 준비

  1. 윤리적 준수 및 샘플 수집
    1. 자폐 스펙트럼 장애(ASD) 진단을 받은 3-7세 아동의 부모 또는 법적 보호자로부터 정보에 입각한 동의를 얻으십시오.
    2. 자폐증에 대한 미국 DSM-5에 설명된 진단 기준(1.3.3단계)에 따라 환자를 중증도 수준 1에서 3으로 분류합니다.
    3. 참가자로부터 혈청 샘플을 수집합니다. 단백질 분해를 방지하기 위해 채혈 후 4시간 이내에 모든 샘플을 처리해야 합니다. 처리하는 동안 샘플을 얼음 위에 보관하십시오.
  2. 고함량 단백질 제거
    1. 제조업체의 지침에 따라 시료당 60μL의 혈청에서 고농도 단백질을 제거하려면 상용 키트를 사용하십시오. 간단히 말해서, 고갈 컬럼을 결합 완충액으로 평형을 이루고 혈청 샘플을 로드한 다음 중력 흐름 하에서 컬럼을 통과하도록 합니다. 저농도 단백질 분획을 포함하는 플로우스루를 수집합니다.
    2. BCA 분석을 사용하여 총 단백질 농도를 측정합니다. 용액 내 분해 전에 모든 샘플을 0.5-1.0 μg/μL의 최종 농도로 정규화합니다. 후속 분석을 위해 각 샘플에 최소 100μg의 단백질이 포함되어 있는지 확인하십시오.
  3. 단백질 소화
    참고: 단백질 분해는 Wisniewski et al.24에 의해 기술된 FASP 방법을 사용하여 수행되었습니다.
    1. UA(요소 완충액) 완충액에 세제, 디티오스레이톨(DTT) 및 요오도아세트아미드(IAA)를 첨가하여 환원된 시스테인을 차단합니다.
    2. 단백질 현탁액을 트립신과 함께 37°C에서 밤새 50:1 비율로 분해합니다.
  4. 펩타이드 탈염, 정정 및 고pH 역상 분획
    1. 펩타이드 혼합물을 16,000 × g 에서 °C에서 15분 동안 원심분리하여 불용성 파편을 제거합니다.
    2. 상청액(소화된 펩타이드 포함)을 새로운 저결합 미세 원심분리기 튜브로 옮겨 흡착 손실을 최소화합니다.
    3. . 100% 메탄올(20μL)으로 전처리하고 물(완충액 A; 20μL)에서 0.1%(v/v) 트리플루오로아세트산(TFA)으로 평형화하여 C18 마이크로컬럼(C18 수지로 충진된 사내)을 준비합니다.
    4. 펩타이드 샘플을 마이크로컬럼에 로드합니다. 20μL의 완충액 A로 컬럼을 세척하여 염분, 세제 및 비펩티드성 오염 물질을 제거합니다.
    5. 0.1% TFA를 함유한 80% 아세토니트릴 20μL로 정제된 펩타이드를 용리합니다.
    6. 원심 진공 농축기를 사용하여 용출된 펩타이드를 진공 상태에서 건조시킵니다. 건조된 펩타이드는 추가 사용할 때까지 -8°C에서 보관하십시오.
    7. LC-MS/MS 분석 전에 건조된 펩타이드를 0.1% 포름산으로 재구성합니다.
    8. 2.4.8.분광 광도계를 사용하여 280nm(OD280)에서 흡광도를 측정하여 펩타이드 농도를 정량화하고, 정확한 정량화를 위해 트립토판 및 티로신 잔기의 기여도를 설명합니다.
      고pH 역상 HPLC를 사용하여 펩타이드 혼합물을 분획하려면 유속이 0.3mL/min인 HPLC 시스템에서 C18 컬럼(3.5μm, 2.1 x 150mm)을 사용하여 이동상 A: 물에서 10mM 포름산암모늄, pH 10(수산화암모늄으로 조정), 이동상 B: 90% 아세토니트릴에서 10mM 포름산암모늄, pH 10. 그래디언트 용리를 수행하여 ~60분 동안 샘플당 60개의 분획을 수집합니다.
    9. 중복성을 줄이기 위해 세 번째 분획마다 결합하여 샘플당 20개의 풀링된 분획을 생성합니다. 다운스트림 분석을 위해 진공 상태에서 풀링된 각 분획을 건조시킵니다.
      참고: 생성된 펩타이드 분획은 이제 나노-LC-MS/MS 분석을 위한 준비가 되었습니다.

3. DIA 질량 분석 분석 제출

  1. DIA 질량 분석 분석
    1. iRT 표준 펩타이드를 사용하여 HPRP 분획에서 DDA(Data-dependent Acquisition) 펩타이드를 스파이크하고 컬럼(75 μm x 150 mm, 2 μm C18 비드, 120 Å)이 있는 나노 HPLC 시스템에서 300 nL/min의 유속으로 역상 고성능 액체 크로마토그래피(RP-HPLC)를 사용하여 분리합니다. 이동상 B: 95% 아세토니트릴에 0.1% 포름산.
    2. 다음과 같이 설정된 완충액 B의 선형 구배로 60분에 걸쳐 펩타이드를 용리합니다: 0 - 2분, 2% 내지 5% 완충액 B의 선형 구배; 2 - 42분, 5%에서 20% 버퍼 B까지의 선형 구배; 42 - 50분, 20%에서 35% 버퍼 B까지의 선형 구배; 50 - 52분, 35%에서 90% 버퍼 B까지의 선형 구배; 52 - 60분, 완충액 B는 90%로 유지되었습니다.
    3. 참조된 질량 분석기에서 용출된 펩타이드를 분석합니다. HCD 단편화를 위해 조사 스캔(350 - 1500 m/z)에서 가장 풍부한 전구체 이온을 동적으로 선택하는 데이터 종속 top20 방법을 사용하여 MS 데이터를 수집합니다.
    4. 펩타이드 인식 모드가 활성화된 상태에서 기기를 실행합니다. 질량 교정을 위한 내부 표준으로 445.120025 Da의 잠금 질량을 사용합니다. MS/MS 스캔의 경우 m/z 200에서 70,000, m/z 200에서 17,500의 분해능으로 전체 MS 스캔을 획득합니다. 최대 주입 시간을 MS의 경우 50ms, MS/MS의 경우 30ms로, 정규화된 충돌 에너지를 28로, 분리 창을 1.6Th로, 동적 배제 기간을 30초로 설정합니다.
  2. 데이터 독립적 수집(DIA)을 위한 LC-MS/MS 분석
    1. 각 샘플의 펩타이드를 iRT로 균등하고 개별적으로 스파이크합니다.
    2. 나노 HPLC 시스템과 결합된 사중극자 질량 분석기에서 LC-MS/MS를 수행합니다. 위의 DDA 방법과 동일한 방식으로 LC 조건을 설정합니다. 3E6의 AGC 목표와 30ms 주입 시간으로 해상도 60,000에서 400에서 1,200m/z까지 측량 스캔을 수행합니다. 20m/z 분리 창과 1E6의 AGC 타겟 및 50ms 주입 시간으로 분해능 15,000에서 DIA MS/MS 스캔을 획득합니다. 정규화된 콜리전 에너지를 30 으로 설정합니다.
    3. 전체 MS 및 DIA 스캔의 스펙트럼을 각각 프로파일 및 중심 유형으로 기록합니다.
  3. 시퀀스 데이터베이스 검색
    1. DIA 소프트웨어를 사용하여 DDA MS 데이터분석 2.
    2. 11개의 iRT 펩타이드 서열로 구성된 단백질이 스파이크된 UniProtKB 인간 데이터베이스(총 186,532개 항목, 2019년 10월 다운로드)에 대해 MS 데이터를 검색합니다.
    3. 소화 효소로 트립신을 선택합니다. 데이터베이스 검색을 위해 최대 2개의 누락된 절단 부위와 전구체 이온의 경우 4.5ppm, 단편 이온의 경우 20ppm의 질량 허용 오차를 정의합니다. 시스테인의 카르바미도메틸화를 고정 변형으로, 단백질 N-말단의 아세틸화 및 메티오닌의 산화를 데이터베이스 검색을 위한 가변 변형으로 정의합니다.
    4. 데이터베이스 검색 결과를 필터링하고 펩타이드 스펙트럼 일치 및 단백질 수준에서 각각 <1%의 FDR(False Discovery Rate)으로 내보냅니다.
  4. 원시 데이터 처리 수행
    1. DIA 분석 MS 데이터는 검색 결과에서 스펙트럼 라이브러리 생성을 위해 DIA 소프트웨어[34, 35]로 분석되었습니다. 검색 및 동적 iRT에 대한 기본 설정을 사용하여 보존 시간 예측을 수행합니다. MS/MS 스캔에 대한 간섭 보정이 활성화되어 있는지 확인합니다.
    2. 펩타이드 수준에서 <1% FDR로 결과를 내보냅니다.

4. 감별 단백질 분석

  1. http://www.omickits.com/open/tooldetail?id=70 에서 배수 변화(FC)와 결합된 Student's t-test를 사용하여 가설 테스트를 수행합니다.
    1. 클라우드 플랫폼에 로그인하고 가설 테스트 분석 도구로 이동합니다. 전처리된 단백질 정량 데이터 파일(예: CSV 또는 TXT 형식)을 업로드합니다.
    2. 모수 설정에서 통계적 방법으로 스튜던트의 t-검정을 선택하고 p-값에서 유의 임계값을 0.05< 선택합니다. 폴드 변경 임계값을 FC > 1.5 또는 FC < 1/1.5로 정의합니다. 분석 실행을 클릭하고 결과가 생성될 때까지 기다립니다.
    3. 각 단백질에 대한 p-값, log2(FC) 및 유의 상태가 포함된 출력 파일을 다운로드합니다.
      참고: 이 이중 기준 접근 방식은 통계적 유의성과 생물학적 관련성의 균형을 유지하여 차등적으로 발현된 단백질(DEP)의 강력한 식별을 보장합니다.

5. 신호 경로 분석

  1. 화산 플롯 시각화
    1. http://www.omickits.com/open/tooldetail?id=63 에서 도구로 이동한 다음 화산 플롯 도구 페이지로 이동합니다.
      1. 섹션 4에서 DEP 분석 결과 파일을 업로드합니다.
      2. 시각화 매개변수 구성: X축: log2(Fold Change) - 변경 방향을 나타냅니다. Y축: -log10(p-값) - 통계적 유의성을 반영합니다. 색상 코딩: 빨간색 : 유의하게 상향 조절된 단백질(p < 0.05 및 FC > 1.5); 파란색 : 유의하게 하향 조절된 단백질(p < 0.05 및 FC < 0.667); 회색 : 중요하지 않은 단백질(p ≥ 0.05 또는 1/1.5 ≤ FC ≤ 1.5).
      3. 이미지 생성을 클릭하고 게시할 고해상도 이미지(PDF/SVG 형식)를 다운로드합니다.
  2. 계층적 클러스터링 히트맵
    1. http://www.omickits.com/open/tooldetail?id=17 에서 도구로 이동합니다.
      1. 클러스터링 히트맵 도구에 액세스합니다.
      2. 필터링된 DEP 표현식 행렬을 업로드합니다.
      3. 다음 매개변수를 설정합니다. 정규화 방법: 척도 차이를 제거하기 위한 행별 Z-점수; 거리 메트릭: 유클리드 거리; 클러스터링 방법: 완전한 연결 계층적 클러스터링; 선택 사항: 샘플 그룹화에 따라 열 및/또는 행 클러스터링을 사용하도록 설정합니다.
      4. 실행을 클릭하여 히트맵을 생성합니다.
      5. 히트맵을 다운로드하여 게시 준비 이미지로 저장합니다.
        참고: 히트맵은 샘플 전반에 걸쳐 단백질 발현 패턴의 유사성과 발산을 시각적으로 나타냅니다.
  3. GO 기능 주석 및 강화 분석
    1. 필요한 R 패키지를 설치하고 로드합니다.
      라이브러리(clusterProfiler)
      라이브러리(org. Hs.eg.db)

      라이브러리(ggplot2)
    2. 단백질 ID(예: Uniprot 또는 유전자 기호)를 Entrez ID로 변환합니다.
      entrez_ids <- bitr(diff_proteins, fromType = "UNIPROT", toType = "ENTREZID", OrgDb = 조직. Hs.eg.db)
    3. GO 농축 분석 수행:
      go_enrich <- enrichGO(유전자 = entrez_ids$ENTREZID, OrgDb = org. Hs.eg.db, keyType = "ENTREZID", ont = "BP")
    4. 도트 플롯을 사용하여 결과를 시각화합니다.
      1. dotplot(go_enrich, showCategory = 20)
        식:
        리치 팩터 = (a/b) / (c/d)
        어디:
        a = 용어에 주석이 달린 DEP 수;
        b = 총 DEP 수;
        c = 용어에 주석이 달린 배경 단백질의 수;
        d = 배경 단백질의 총 수.
  4. KEGG 경로 주석 및 농축 분석
    1. KEGG 농축 분석 수행:
      kegg_enrich <- 풍부한KEGG(유전자 = entrez_ids$ENTREZID, 유기체 = "가지다")
    2. KEGG 경로 결과 시각화:
      막대 플롯(kegg_enrich, 표시 범주 = 20)
    3. 출판 서식을 지정하기 위해 ggplot2를 사용하여 플롯을 사용자 지정합니다.

6. ROC 곡선 분석을 이용한 단백질의 초기 스크리닝

  1. 데이터 준비 : 자폐 스펙트럼 장애(ASD) 및 대조군에서 식별된 모든 차등 발현 단백질(DEP)을 포함하는 단백질체학 데이터 세트를 로드합니다. 데이터 세트에 ASD 및 대조군 샘플을 나타내는 명확한 라벨과 함께 두 그룹에 대한 단백질 발현 값이 포함되어 있는지 확인하십시오.
  2. ROC 곡선 분석을 수행합니다.
    1. R의 pROC 패키지를 사용하여 각 단백질에 대한 ROC(Receiver Operating Characteristic) 곡선 분석을 수행합니다.
    2. 곡선 아래 면적(AUC)을 계산하여 ASD와 대조군을 구별하는 각 단백질의 능력을 평가합니다.
      AUC = 0.5: 차별이 없습니다(무작위 우연에 해당).
      0.7 ≤ AUC < 0.8: 허용되는 차별.
      0.8 ≤ AUC < 0.9: 뛰어난 차별력.
      AUC ≥ 0.9: 뛰어난 차별력.
      참고: AUC는 ASD 그룹에서 무작위로 선택된 개인이 대조군에서 무작위로 선택된 개인보다 단백질 수치가 더 높을 확률을 나타냅니다. AUC가 높을수록 진단 성능이 더 우수함을 나타내며, 0.8 이상의 값은 일반적으로 바이오마커 연구에서 임상적으로 의미 있는 것으로 간주됩니다.
    3. 모든 단백질에 대한 AUC 값을 기록합니다.
  3. 후보 바이오마커를 선택합니다.
    1. AUC가 0.7보다 큰 단백질을 후보 바이오마커로 식별합니다.
    2. 추가 분석을 위해 후보 바이오마커 목록을 내보냅니다.
  4. 결과를 시각화합니다.
    1. R에서 ggplot2 패키지를 사용하여 최고 성능의 단백질에 대한 ROC 곡선의 시각화를 만듭니다.
    2. 명확성을 위해 플롯 범례에 AUC 값을 포함합니다.

7. 랜덤 포레스트를 이용한 2차 심사

  1. 입력 데이터를 준비합니다.
    1. ROC 분석에서 얻은 후보 바이오마커 목록을 무작위 포레스트 분석을 위한 입력으로 사용합니다.
    2. 데이터 세트의 형식이 샘플을 나타내는 행과 단백질 발현 값을 나타내는 열로 적절하게 지정되었는지 확인하십시오.
  2. 랜덤 포레스트 모델을 학습합니다.
    1. R에서 randomForest 패키지를 사용하여 랜덤 포레스트 알고리즘을 적용합니다.
    2. 트리 수(ntree)를 500으로 설정하고 각 분할(mtry)에서 무작위로 샘플링된 변수 수를 총 기능 수의 제곱근으로 설정합니다.
    3. 특정 기능이 제거될 때 모델 정확도의 감소를 측정하는 MeanDecreaseAccuracy 메트릭을 사용하여 기능 중요도를 평가합니다.
    4. R에서 randomForest 패키지를 사용하여 랜덤 포레스트 모델을 학습합니다.
      R. 라이브러리(randomForest)
      # 예: 단백질 수준을 사용하여 그룹(예: ASD 대 대조군) 예측

      rf_model <- 랜덤포레스트(x = protein_data,
      y = as.factor(그룹),
      importance = TRUE, # 기능 중요도를 계산하는 데 필요
      ntree = 500) # 나무 수
    5. importance() 함수를 사용하여 기능 중요도 메트릭을 추출합니다.
      R. importance_scores <- 중요도(rf_model)
    6. MeanDecreaseAccuracy 값을 검색하고 내림차순으로 정렬합니다.
      R. mean_dec_acc <- importance_scores[ , "평균 감소 정확도"]
      importance_rank <- 정렬(mean_dec_acc, 감소 = TRUE)
    7. 내장 varImpPlot() 함수를 사용하여 기능 중요도를 시각화합니다.
      R. varImpPlot(rf_model, main = "기능 중요도(평균 정확도 감소)")
      참고: MeanDecreaseAccuracy 메트릭은 각 기능이 모델의 예측 성능에 얼마나 중요한지를 반영합니다. 제거 시 정확도가 크게 감소하면 중요도가 높다는 것을 나타냅니다. 이 접근 방식은 그룹 간 가장 강력한 차별력을 가진 단백질이나 유전자의 우선순위를 정하는 데 도움이 되므로 바이오마커 발견에 특히 유용합니다.
    8. 보고 또는 다운스트림 분석을 위해 중요도 점수를 내보냅니다.
      R. importance_table <- data.frame(
      기능 = 이름(importance_rank),
      평균 감소 정확도 = importance_rank
      )
      write.csv(importance_table, "feature_importance.csv", row.names = FALSE)
    9. MeanDecreaseAccuracy 점수를 기준으로 단백질의 순위를 매깁니다.
    10. MeanDecreaseAccuracy 점수가 가장 높은 상위 15개 단백질을 후속 모델링을 위한 가장 중요한 특징으로 선택합니다.
    11. 추가 검증을 위해 이러한 단백질 목록을 내보냅니다.
      참고: MeanDecreaseAccuracy 값이 낮은 단백질은 제거 시 모델 성능에 최소한의 영향을 미칠 수 있습니다.
    12. 선택한 단백질, 특히 ASD와 관련된 면역 기능 또는 경로와 관련된 단백질의 생물학적 관련성을 강조합니다.

8. 최종 바이오마커 선택을 위해 결과를 결합합니다.

참고: R이 pROC, randomForest 및 ggplot2 패키지와 함께 설치되어 있는지 확인합니다. 분석 전에 단백질체학 데이터 세트가 전처리되고 정규화되었는지 확인하십시오. 후보 바이오마커 및 시각화 플롯 목록을 참조용으로 별도의 파일로 저장합니다.

  1. 결과를 통합합니다.
    1. ROC 분석 및 랜덤 포레스트 스크리닝의 결과를 상호 참조하여 중복되는 단백질을 식별합니다.
    2. 두 분석 모두에서 매우 신뢰할 수 있는 후보 바이오마커로 나타나는 단백질의 우선순위를 정합니다.
    3. 선택한 바이오마커의 견고성을 확인하기 위해 LOOCV(leave-one-out cross-validation)와 같은 추가 검증 단계를 수행합니다.
    4. 로지스틱 회귀 모델을 사용하여 결합된 바이오마커 세트의 예측 정확도를 평가합니다.
    5. ggplot2 패키지를 사용하여 최종 바이오마커 세트에 대한 ROC 곡선 및 정밀도-재현율 플롯을 생성합니다.
    6. 선택한 바이오마커의 진단 가능성을 입증하기 위해 AUC 및 정밀도 재현율 값과 같은 지표를 포함합니다.

9. 양방향 기능 선택

  1. 데이터를 준비하고 모델을 정의합니다.
    1. 단백질 발현 값과 해당 라벨(예: ASD 대 대조군)이 포함된 데이터 세트를 로드합니다. 데이터 세트가 전처리되고 정규화되었는지 확인합니다.
    2. 초기 모델 정의: 분류를 위해 이항 계열이 있는 일반화 선형 모델(GLM)을 사용합니다.
    3. AIC를 평가 메트릭으로 사용하여 피처 선택 중에 모델을 비교합니다.
  2. 전방 기능 선택을 수행합니다.
    1. 절편 항만 포함하는 빈 모델로 시작합니다.
    2. AIC의 가장 큰 감소를 기준으로 한 번에 하나의 기능을 추가합니다.
    3. 추가할 때마다 AIC 값을 기록합니다. AIC의 추가 감소가 관찰되지 않으면 중지합니다.
  3. 역방향 기능 선택을 수행합니다.
    1. 사용 가능한 모든 기능을 사용하여 모델을 학습합니다.
    2. AIC의 가장 작은 증가를 기준으로 한 번에 하나의 기능을 제거합니다.
    3. 각 제거 후 AIC 값을 기록합니다. AIC의 추가 감소가 관찰되지 않으면 중지합니다.
    4. 전진 및 후진 단계를 결합합니다.
  4. 앞으로 선택과 뒤로 선택을 번갈아 가며 선택합니다.
    1. 한 라운드의 정방향 특성 선택을 수행한 후 즉시 한 라운드의 역방향 특성 선택을 수행합니다. AIC에서 더 이상 개선이 관찰되지 않을 때까지 이 프로세스를 반복합니다.
    2. 대체 접근 방식: 역방향 기능 선택으로 시작한 다음 정방향 기능 선택을 수행합니다. 이전에 제거된 피처를 모델에 다시 추가하는 효과를 평가합니다.
  5. 선택한 피쳐를 마무리합니다.
    1. 선택한 특징과 해당 계수의 최종 목록을 내보냅니다(보충 그림 S1).

10. leave-one-out 방법을 사용한 로지스틱 회귀를 사용한 양방향 기능 선택의 교차 검증

참고: R이 caret, pROC 및 ggplot2 패키지와 함께 설치되어 있는지 확인합니다. 단백질체학 데이터 세트는 분석 전에 전처리되고 정규화되어야 합니다. 혼동 행렬, ROC 곡선 및 모형 요약을 참조용으로 별도의 파일로 저장합니다.

  1. 데이터를 준비하고 모델을 정의합니다.
    1. GLMSTEP/bothFitModel.txt 파일에서 단백질 발현 값과 해당 라벨(예: ASD 대 대조군)이 포함된 데이터 세트를 로드합니다. 데이터 세트가 전처리되고 정규화되었는지 확인합니다.
    2. 분류를 위해 이항 계열이 있는 일반화 선형 모델(GLM)을 사용하여 초기 모형을 정의합니다.
    3. 정확도와 Kappa 계수를 평가 지표로 사용하여 교차 검증 중에 모델 성능을 평가합니다.
  2. leave-one-out 교차 검증을 수행합니다.
    1. R에서 캐럿 패키지를 사용하여 교차 유효성 검사를 초기화하여 LOOCV(leave-one-out 교차 유효성 검사)를 구현합니다.
    2. 선택한 8개의 특징을 사용하여 로지스틱 회귀 모형을 적합시킵니다.
    3. 교차 검증의 각 반복에 대한 정확도와 Kappa 계수를 기록합니다.
  3. 교차 검증 결과를 분석합니다.
    1. 결과를 요약합니다.
      참고: LOOCV 프로세스의 결과는 다음과 같습니다(이 연구에서와 같이): 일반화 선형 모델, 169개 샘플, 8개 예측 변수, 2개 클래스: 'A', 'B', 리샘플링: Leave-One-Out 교차 검증, 샘플 크기 요약: 168, 168, 168, 168, 168, ... , 리샘플링 결과: 정확도 카파 0.9526627 0.9024531.
    2. 메트릭을 해석합니다.
      참고: 여기서 모델은 0.9527의 정확도와 0.9025의 카파 계수를 달성하여 예측된 결과와 관찰된 결과 간의 탁월한 일치를 나타냅니다.
      1. 카파 계수를 보고 모델의 예측력을 측정합니다. 카파 계수의 범위는 -1에서 1까지이며, 여기서 0은 무작위 예측을 나타내고 1은 완벽한 일치를 나타냅니다.
        참고: 이 연구에서 0.9025의 Kappa 값은 모델의 강력한 예측력을 반영합니다.
  4. 모형 계수를 평가합니다.
    1. 로지스틱 회귀 모델의 계수를 조사하여 각 기능의 기여도를 이해합니다. null 편차, 잔차 편차 및 AIC를 평가하여 모델의 적합성을 확인합니다.
      참고: 예를 들어, 이 연구에서는 168자유도에서 Null 편차: 2.2928e+02, 잔차 편차: 160자유도에서 2.2378e-07, AIC: 18, 피셔 점수 반복 횟수: 25를 얻었습니다.
  5. 결과를 시각화합니다.
    1. 모델의 예측 성능을 시각화하기 위해 혼동 행렬을 만듭니다.
    2. ROC(수신기 작동 특성) 곡선을 그려 모델의 분류 성능을 평가합니다.
    3. 결과를 해석합니다. 곡선 아래 면적(AUC)을 계산하여 모델의 분류 성능 지수를 얻습니다.
      참고: ROC 곡선은 진양성률과 위양성률 사이의 균형을 보여줍니다. 곡선 아래 면적(AUC)은 1에 가까워야 분류 성능이 우수함을 나타냅니다. ROC 곡선은 서로 다른 임계값에서 모델의 진양성률과 거짓양성률의 변화를 반영합니다. AUC 값이 클수록 모델의 성능이 향상됩니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

이 연구에는 ASD가 있는 99명의 어린이와 70명의 연령 일치 대조군(3-7세)이 포함되었으며 균형 잡힌 성별 분포가 있었습니다(보충 표 S2). 혈청은 표준화된 프로토콜을 사용하여 하룻밤 금식 후 수집했습니다: 혈액을 혈청 분리 튜브로 채취하여 실온에서 30분 동안 응고시킨 다음 4°C에서 10분 동안 1,500× g 에서 원심분리했습니다. 상청액을 분취하여 추가 처리까지 -80°C에서 보관했습니다. 검출 감도를 높이기 위해 고농도 단백질(예: 알부민, IgG, 합토글로빈)을 고갈시켰습니다. 단백질 농도는 BCA 분석으로 측정되었고, 분해 전에 샘플을 0.5-1.0 μg/μL로 정규화했습니다. 트립신/LysC 분해를 수행하고, C18 카트리지를 사용하여 펩타이드를 탈염하고, 동결건조24를 수행했습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

이 원고에 설명된 프로토콜은 데이터 독립적 획득(DIA) 질량 분석법 및 기계 학습 기술을 사용하여 자폐 스펙트럼 장애(ASD)에서 면역 관련 분자 바이오마커를 식별하기 위한 포괄적인 접근 방식을 설명합니다. 프로토콜 내의 중요한 단계는 신뢰할 수 있고 재현 가능한 결과를 보장하는 동시에 수정 또는 문제 해결이 필요할 수 있는 영역을 강조합니다(표 2).

프로토콜의 주요 단계 중 하나는 혈청 샘플의 수집 및 처리입니다. 혈청은 원심분리를 통해 또는 혈전 활성화 튜브를 사용하여 수집할 수 있습니다. 다운스트림 분석을 손상시킬 수 있는 단백질 분해를 방지하기 위해 혈액 샘플을 수집 후 4시간 이내에 처리하는 것이 필수적입니다. 단백질 무결성을 유지하기 위해 얼음 위에서 가공을 수행해야 합니다. 지연은 종종 바이오마커 발견에 가장 유익한 저풍부도 단백질의 손실로 이어질 수 있습니다. 처리가 지연...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

저자는 선언할 이해 상충이 없습니다.

감사의 글

중앙연구소의 모든 구성원과 이 프로젝트에 도움을 주신 분들께 감사드립니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
<강함>시약 및 화학 물질아세토니트릴(HPLC 등급)피셔 사이언티픽A18-50
<강함>시약 및 화학 물질중탄산암모늄(NH? HCO?)시그마-알드리치38939
<강함>시약 및 화학 물질포름산암모늄시그마-알드리치90265
<강함>시약 및 화학 물질소 혈청 알부민(BSA)써모 피셔 사이언티픽23212
<강함>시약 및 화학 물질디티오스레이톨(DTT)시그마-알드리치43815
<강함>시약 및 화학 물질포름산(0.1%)써모 피셔 사이언티픽28905
<강함>시약 및 화학 물질요오도아세트아미드(IAA)시그마-알드리치나1149
<강함>시약 및 화학 물질메탄올(HPLC 등급)피셔 사이언티픽A452-4
<강함>시약 및 화학 물질트리플루오로아세트산(TFA)시그마-알드리치티6508
<강함>시약 및 화학 물질요소시그마-알드리치U5378
키트 및 특수 시약BCA 단백질 분석 키트써모 피셔 사이언티픽23227
키트 및 특수 시약C18 Sep-Pak 카트리지바다WAT023590
키트 및 특수 시약C18 StageTips(수제)3M Empore&무역;
키트 및 특수 시약고풍부도 단백질 고갈 키트밀리포어 시그마122642
키트 및 특수 시약iRT 표준 펩타이드바이오그노시스 AG
키트 및 특수 시약리소자임 ELISA 키트우한 파인 바이오텍 유한 주식회사
키트 및 특수 시약트립신/LysC 효소 믹스프로메가V5071
장비원심 분리기에펜도르프5430R
장비Easy-nLC 1200 시스템써모 피셔 사이언티픽
장비Nanodrop One 분광 광도계써모 피셔 사이언티픽ND-원-W
장비Q Exactive HF-X 질량분석기써모 피셔 사이언티픽
장비SpeedVac 집중 장치써모 피셔 사이언티픽SPD131DDA
장비Swinning-Bucket 로터 원심분리기다양한
장비Waters XBridge BEH130 컬럼바다C18, 3.5 & 뮤; 중, 2.1× 150 밀리미터
장비애질런트 1260 HPLC 시스템애질런트1260 인피니티 II
소프트웨어 및 온라인 도구생체전도체(R 패키지)bioconductor.org
소프트웨어 및 온라인 도구캐럿(R 패키지)크 랑caret_6.0-93
소프트웨어 및 온라인 도구clusterProfiler(R 패키지)생체전도체4.0.5
소프트웨어 및 온라인 도구다이어엔DIA-NN 소프트웨어v1.8
소프트웨어 및 온라인 도구ggplot2(R 패키지)크 랑3.4.0
소프트웨어 및 온라인 도구맥스퀀트막스 플랑크 연구소1.6.17
소프트웨어 및 온라인 도구omickits.comOmiKits 클라우드 플랫폼http://www.omickits.com
소프트웨어 및 온라인 도구pROC(R 패키지)크 랑1.18.0
소프트웨어 및 온라인 도구randomForest(R 패키지)크 랑4.7-1.1
소프트웨어 및 온라인 도구스펙트로넛 펄서 X바이오그노시스 AG17
소프트웨어 및 온라인 도구UniProtKB 인간 데이터베이스uniprot.org릴리스 2019_10
<강함>기타 재료저결합 미세 원심분리기 튜브에펜도르프30120094
<강함>기타 재료혈청 분리기 튜브(SST)BD 바이오사이언스367988
<강함>기타 재료3M Empore&무역; C18 디스크3분

참고문헌

  1. Ophir, Y., Rosenberg, H., Tikochinski, R., Dalyot, S., Lipshits-Braziler, Y. Screen time and autism spectrum disorder: A systematic review and meta-analysis. JAMA Netw Open. 6 (12), e2346775(2023).
  2. He, S., Zhou, F., Tian, G., Cui, Y., Yan, Y. Effect of anesthesia during pregnancy, delivery, and childhood on autism spectrum disorder: A systematic review and meta-analysis. J Autism Dev Disord. 54 (12), 4540-4554 (2024).
  3. Alkhonezan, S. M., Alkhonezan, M. M., Alshayea, Y., Bukhari, H., Almhizai, R. Factors influencing the lives of parents of children with autism spectrum disorder in saudi arabia: A comprehensive review. Cureus. 15 (11), e48325(2023).
  4. Larson, C., Thomas, H. R., Crutcher, J., Stevens, M. C., Eigsti, I. M. Language networks in autism spectrum disorder: A systematic review of connectivity-based fmri studies. Rev J Autism Dev Disord. 12 (1), 110-137 (2025).
  5. Kodak, T., Bergmann, S. Autism spectrum disorder: Characteristics, associated behaviors, and early intervention. Pediatr Clin North Am. 67 (3), 525-535 (2020).
  6. Zwaigenbaum, L., et al. Early intervention for children with autism spectrum disorder under 3 years of age: Recommendations for practice and research. Pediatrics. 136 (Suppl 1), S60-S81 (2015).
  7. Whitehouse, A. J. O., et al. Effect of preemptive intervention on developmental outcomes among infants showing early signs of autism: A randomized clinical trial of outcomes to diagnosis. JAMA Pediatr. 175 (11), e213298(2021).
  8. Ngounou Wetie, A. G., et al. A pilot proteomic analysis of salivary biomarkers in autism spectrum disorder. Autism Res. 8 (3), 338-350 (2015).
  9. Mota, F. S. B., et al. Potential protein markers in children with autistic spectrum disorder (asd) revealed by salivary proteomics. Int J Biol Macromol. 199, 243-251 (2022).
  10. Corbett, B. A., et al. A proteomic study of serum from children with autism showing differential expression of apolipoproteins and complement proteins. Mol Psychiatry. 12 (3), 292-306 (2007).
  11. Hu, E., et al. Data independent acquisition proteomics and machine learning reveals that proteins associated with immunity are potential molecular markers for early diagnosis of autism. Clin Chim Acta. 573, 120238(2025).
  12. Shen, L., et al. Biomarkers in autism spectrum disorders: Current progress. Clin Chim Acta. 502, 41-54 (2020).
  13. Yap, C. X., et al. Autism-related dietary preferences mediate autism-gut microbiome associations. Cell. 184 (24), 5916-5931.e17 (2021).
  14. Zhang, H., et al. The use of data independent acquisition based proteomic analysis and machine learning to reveal potential biomarkers for autism spectrum disorder. J Proteomics. 278, 104872(2023).
  15. Francis, K., et al. Brain-derived neurotrophic factor (bdnf) in children with asd and their parents: A 3-year follow-up. Acta Psychiatr Scand. 137 (5), 433-441 (2018).
  16. Bjorklund, G., et al. The impact of glutathione metabolism in autism spectrum disorder. Pharmacol Res. 166, 105437(2021).
  17. Bao, X. H., et al. Olink proteomics profiling platform reveals non-invasive inflammatory related protein biomarkers in autism spectrum disorder. Front Mol Neurosci. 16, 1185021(2023).
  18. Ngounou Wetie, A. G., et al. Comparative two-dimensional polyacrylamide gel electrophoresis of the salivary proteome of children with autism spectrum disorder. J Cell Mol Med. 19 (11), 2664-2678 (2015).
  19. Suganya, V., Geetha, A., Sujatha, S. Urine proteome analysis to evaluate protein biomarkers in children with autism. Clin Chim Acta. 450, 210-219 (2015).
  20. Shen, L., et al. Itraq-based proteomic analysis reveals protein profile in plasma from children with autism. Proteomics Clin Appl. 12 (3), e1700085(2018).
  21. Shen, L., et al. Proteomics study of peripheral blood mononuclear cells (pbmcs) in autistic children. Front Cell Neurosci. 13, 105(2019).
  22. Mesleh, A., et al. Blood proteomics analysis reveals potential biomarkers and convergent dysregulated pathways in autism spectrum disorder: A pilot study. Int J Mol Sci. 24 (8), 7443(2023).
  23. Yang, J., et al. Association between plasma proteome and childhood neurodevelopmental disorders: A two-sample mendelian randomization analysis. EBioMedicine. 78, 103948(2022).
  24. Wisniewski, J. R., Zougman, A., Nagaraj, N., Mann, M. Universal sample preparation method for proteome analysis. Nat Methods. 6 (5), 359-362 (2009).
  25. Wu, Y., et al. Quantitative proteomics analysis of serum and urine with dia mass spectrometry reveals biomarkers for pediatric obstructive sleep apnea. Arch Bronconeumol. 61 (2), 67-75 (2025).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

태그