다중 모달 바이오마커를 이용한 머신러닝은 질병 예측과 모니터링을 향상시키며, 다양한 분야에서 의료 발전을 기대하고, 정확한 질병 예측을 통해 의료 결과를 개선합니다.
Research Article
다중 모달 바이오마커를 이용한 머신러닝은 질병 예측과 모니터링을 향상시키며, 다양한 분야에서 의료 발전을 기대하고, 정확한 질병 예측을 통해 의료 결과를 개선합니다.
매년 전 세계적으로 많은 사람들이 심장병, 호흡기 감염, 신경 기능 장애, 인지 스트레스, 암, 뇌졸중, 당뇨병 등과 같은 심각한 건강 문제로 점차 영향을 받고 있으며, 이는 심각한 건강 합병증과 관련 이상으로 이어집니다. 따라서 조기 건강 분석은 표적 치료로 적시에 개입할 수 있게 하여 즉각적인 완화와 지속적인 장기적 이익을 제공하여 질병 진행을 늦출 수 있는 중요한 도구입니다. 복잡한 병태생리학적 과정과 다양한 건강 상태에서의 이질적인 임상시험으로 인해, 환자의 건강 결과를 정확히 감지하고 모니터링하기 위해 매우 민감한 다중 모달 바이오마커와 효과적인 조사 접근법이 필요합니다. 따라서 예후, 위험 평가, 환자 계층화, 질병 모니터링 등 다양한 범주와 기법을 가진 머신러닝 알고리즘이 결과 예측에 고려됩니다. 제안된 작업의 흐름은 세 단계로 나뉘는데, 첫 번째 단계는 사례 연구를 통해 의료의 중요성을 정의하고, 두 번째 단계는 전통적인 머신러닝(ML) 알고리즘, 전통적인 딥러닝(DL) 접근법, 그리고 현대 딥러닝 기법(TabNet과 AutoInt)입니다. 마지막으로, 실험이 결과를 정당화하기 위해 구현됩니다. 이 연구는 분자 단백질, 화학, 유전 바이오마커를 신흥 ML 특징과 통합하여 모달리티를 그룹화하는 방식을 강조합니다. 결과는 제안된 방법론을 사용한 정확도 예측에서 상당한 향상을 나타냅니다.
의료 시스템은 점점 더 예측 분석을 활용해 환자를 모니터링하고 건강 결과를 적시에 진단함으로써 선제적 치료를 촉진하고 환자 결과를 개선하고 있습니다. 예측 분석과 바이오마커를 통합함으로써 임상의는 진단 정확도를 높이고, 효과적인 치료법을 식별하며, 치료 진행 상황을 모니터링하고, 질병 기전에 대한 귀중한 통찰을 얻어 궁극적으로 더 현명하고 효과적인 치료 결정을 내릴 수 있습니다. 바이오마커는 생물체유체, 조직, 세포, DNA, RNA, 혈액, 소변 등 샘플에서 발견되는 생물학적 분자 또는 지표의 특성을 의미하며, 인체 내 질병의 존재 또는 진행을 측정하여 치료의 효과를 평가하는 데 도움을 줍니다.
분자 바이오마커의 적용 진전은 특정 분자를 정밀하게 측정하여 환자의 독특한 건강 문제를 식별함으로써 초기 단계부터 표적 치료 전략을 가능하게 함으로써 맞춤형 의학에서 중요한 역할을 합니다. 앞으로 멀티모달 접근법은 복잡한 질병 양상의 여러 모달리스를 통합하는 데 도움을 주어, 첨단 예측 분석 기법을 통해 암 및 신경퇴행성 질환에서 질병 예후를 보다 정확하게 식별할 수 있게 할 것입니다. 최첨단 방법론은 다중 오믹스 데이터, 생물정보학, ML 알고리즘을 활용하여 새로운 바이오마커를 식별하여, 환자별 위험 프로파일링과 심혈관 질환(CVD) 및 기타 복잡한 질환에 대한 주관적 치료 전략을 가능하게 합니다. 분자 바이오마커와 다중 오믹스 접근법의 결합은 신경학적 질환에서 진단 정확도와 치료 계층화 향상에 가능성을 지니고 있습니다5.
ML 기법의 발전으로 다중 모달 분자 바이오마커는 다양한 데이터 유형을 통합하여 다양한 건강 상태에서 새로운 질병 신호를 식별할 수 있게 되어, 보다 정확한 진단과 맞춤형 치료 전략을 가능하게 합니다. 이 잠재력을 바탕으로, 저자는 의료 분야에서 질병 진단 위험 요인을 예측하기 위한 다양한 ML 기법을 탐구하고, 다양한 의료 분야에서 이들의 중요성을강조합니다. ML이 질병 진단과 치료를 혁신함에 따라, 제약 기관들은 점점 더 의사결정 알고리즘을 활용해 환자의 건강 결과를 분석하고 일상적인 요구를 충족시키고 있으며, 이를 통해 보다 정보에 기반하고 효과적인 진료를 가능하게 하고 있습니다7. 다중 모달 데이터 통합의 잠재적 필요성을 활용하여 본 연구는 다중 모달 데이터(MRI 및 유전학)를 활용해 바이오마커를 개발하여 알츠하이머병의 발병 및 진행을 예측했으며, 유전 데이터가 정상 대조군에서 미래 알츠하이머 진행을 더 잘 예측하는 반면, MRI 데이터가 안정적인 경도 인지 장애를 더 잘 특징지었으며, 두 가지를 결합하여 더 나은 품질의 분류 성능을 보였습니다.
멀티모달 데이터 분석의 적용을 더욱 발전시키며, 멀티모달 딥러닝은 유전자 발현 데이터를 활용해 새로운 생물학적 분자의 특정 세포주를 표적으로 하는 약물을 식별하고, 이를 통해 유전체 변이가 치료 반응에 미치는 영향을 명확히 합니다. 다중 모달 데이터 분석의 발전과 함께, AI 및 ML 지표를 활용해 평가하는 비침습적 바이오마커는 특정 적용 및 데이터 맥락에 따라 침습적 바이오마커에 비해 특이도와 민감도 프로필이 다르며 진단에 유망한 도구로 부상하고 있습니다.10. 멀티모달 데이터 분석의 중요성이 커짐함에 따라, 딥러닝(DL) 앙상블 모델은 유전자-단백질 상호작용을 포함한 새로운 바이오마커를 통합하여 복잡한 데이터를 효과적으로 처리하여 암 연구를 강화하고 치료 전략을 최적화할 수 있습니다.11. DL 앙상블 모델이 암 연구를 계속 발전시키면서, 예측 분석은 다양한 건강 상태를 포함한 다양한 출처에서 수집된 방대한 데이터를 분석하여 위험 평가 및 진단과 같은 상태를 포괄적으로 파악하는 질병 진단 및 치료에서 중요한 역할을합니다.
제안된 프로토콜의 목적은 서로 다른 생물학적 지표를 통합하여 의료 분석의 정확성을 높이는 ML 기반 및 DL 기반 알고리즘을 구현하는 것입니다. 바이오마커를 활용하는 기존 예측 기법은 일반적으로 단일 모달리티 데이터와 선형 통계 모델에 의존하는데, 이는 질병 발달과 개인차에 영향을 미치는 복잡하고 비선형적인 관계를 충분히 포착하지 못할 수 있습니다. 관찰, 전자 건강 기록, 실험실 측정, 신체 측정, 임상 평가에서 얻은 방대한 데이터를 통합함으로써 환자 진단에서 위험 평가를 종합하고 최적화할 수 있는 중요한 기회를제공합니다. 바이오마커는 정밀 의료에서 중요한 역할을 하여 적절한 시기에 표적 치료를 가능하게 합니다. 바이오마커는 복잡하고 질병 아형과 분자 성장 측정에 어려움이 있지만, 다양한 비정상 조건에서 독성 반응을 평가하는 데 매우 유용하여 추가 분석을 용이하게 합니다. 임상 관찰 중 바이오마커를 활용함으로써 의료 전문가들은 질병 진행을 보다 정확하게 예측하고 치료 반응을 모니터링할 수 있습니다. 궁극적으로 의료 분석에서 다중 모달 분자 바이오마커와 AI의 융합은 기존 특성을 부합시켜 임상 영향을 완화하는 보다 효과적인 패턴 인식을 가능하게 합니다.
특히 Somepalli 등의 연구와 비교할 때, 저자들은 대사, 후생유전학, 단백질체 데이터와 같은 유전체 데이터에 대한 ML 알고리즘을 제안하고, ML 알고리즘 선택에 대한 일반 지침을 제시했습니다. 하지만 데이터 분석에는 한계가 있습니다. 기존 연구에서는 15, 비지도 적분 기법이 옴믹스 데이터에 적용되어 계산적 도전에 초점을 맞췄습니다. 반면, 방법의 범위와 분석에는 한계가 있습니다. 더 나아가 Huang 등은 다양한 응용 분야를 분석하는 대부분의 DL 방법을 다루어 빅데이터와 계산 프레임워크의 힘을 이해하고자 했습니다. 단점으로는 데이터 불균형, 과적합, 해석 문제 등이 있었습니다. 제안된 프로토콜은 현재 기법들이 고차원적이고 다양한 생물학적 데이터를 효과적으로 결합하지 못하는 통합 바이오마커 연구의 중요한 격차를 해소하는 데 매우 중요합니다. 패턴 인식, 특징 선택, 다중 모달 융합에 뛰어난 정교한 ML과 DL을 활용하여 제안된 제출물은 조기 진단, 예후, 개별 치료 옵션을 향상시키는 강력한 예측 신호를 식별하는 것을 목표로 합니다. 이 프로토콜은 분산된 바이오마커 평가의 한계를 직접 해결하며, 확장 가능하고 해석 가능하며 임상적으로 적합한 건강 예측을 가능하게 하는 포괄적이고 데이터 기반 모델을 제시합니다.
Access restricted. Please log in or start a trial to view this content.
1. 실험적 워크플로우
그림 1 은 기계 학습과 딥러닝 기법을 활용해 분자 바이오마커를 위험 또는 진단 적응증 범주로 분류하기 위해 설계된 조직적이고 모듈화된 워크플로우 파이프라인을 보여줍니다. 다음은 과정에 대한 자세한 단계별 설명입니다:

그림 1: 제안된 작업의 흐름도. 제안된 문제의 작업 흐름은 이 그림에 나타났다. 단계로는 데이터 전처리, 특징 공학, 모델 개발, 분할, 지표를 이용한 모델 평가, 바이오마커 분석이 포함됩니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
2. 데이터셋 설명
데이터셋 이름은 csv 확장all_sequence_variants 있습니다. 'id', 'variation', 'position', 'external_link', 'gene_symbol', 'entrez_gene_id', 'reference', 'conditions', 'indication_types' 등 이름이 있는 열들이 있으며, id는 int 타입이고 entrez_gene_id은 float 타입입니다. 총 행 수는 42,818개이며 9개의 열로 이루어져 있습니다. 또한, 데이터셋은 변동, 위치, external_link, entrez_gene_id, 참조, 조건, indication_types에 대해 영값(null value)을 가지고 있습니다. 데이터셋은 다음과 같은 링크에서 가져온 것입니다: https://markerdb.ca/downloads17
3. 데이터셋 전처리
이 단계에서 데이터 전처리는 데이터셋 정보 수집, 설명, 중복 식별, 누락 및 무효 값을 찾는 것부터 시작합니다. 상관계수로 측정할 때 external_link 특징의 영향은 없으므로 제거됩니다. 범주 열과 수치 열의 영값은 각각 중앙값과 평균으로 채워집니다. 마지막으로, 입력과 출력의 데이터셋 형태는 (42787, 6)(42787)입니다. 입력 열은 'id', 'variation', 'position', 'gene_symbol', 'entrez_gene_id', 'conditions'이며, 목표 열은 indication_types입니다.
4. 바이오마커: 범주, 데이터 도전, 분자 위험의 역할
바이오마커는 다양한 노출이나 개입에 대한 정상 또는 비정상적인 생물학적 활동이나 반응을 나타내는 정량화 가능한 특성입니다. 바이오마커는 분자적, 조직학적, 방사선학적 또는 생리학적 성격을 가질 수 있으며 일곱 가지 주요 범주로 나뉩니다: (1) 진단 바이오마커는 개인이 특정 질병이나 장애를 가지고 있는지 여부와 그것이 하위 유형에 속하는지 판단하고, (2) 모니터링 바이오마커는 질병의 진행과 치료에 대한 반응을 나타내며, (3) 반응 바이오마커는 환자가 약물이나 치료에 반응하는지 여부를 보여줍니다. 예를 들어, 심박수 변화, (4) 예측 바이오마커는 개인이 특정 질병에 걸릴 위험이 있는지 여부와 특정 치료에 어떻게 반응할지 판단할 수 있으며, (5) 예후 바이오마커는 특정 건강 결과에 소인이 있을 때 질병의 진행 또는 재발 가능성에 대한 통찰을 제공할 수 있습니다. (6) 위험 바이오마커는 환자가 공식 진단을 받기 전에 상태의 잠재적 위험 수준을 평가하며, (7) 안전성 바이오마커는 치료로 인해 발생할 수 있는 독성 또는 부작용 가능성을 평가합니다. 본 연구는 주로 그림 2에 제시된 위험 평가 및 진단과 관련된 분자 바이오마커 분석에 중점을 둡니다. 전 세계적으로 이용 가능한 방대한 임상 데이터를 고려할 때, 바이오마커는 임상 의사결정을 안내하고 연구를 진전시키며 맞춤형 의료를 촉진하는 데 필수적입니다.

그림 2: 임상 의사결정용 바이오마커 범주. 바이오마커의 결정은 이 도표에 표현되어 있습니다. 바이오마커에 적용된 분석을 바탕으로 임상 결정을 고려하고 ML 알고리즘이 구현됩니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
임상적으로 유용한 바이오마커 정보를 찾고 이해하는 것은 바이오마커 유형, 특성, 품질 차이가 매우 다양하기 때문에 어렵습니다. 지난 20년간 바이오마커 연구의 급속한 성장은 특히 분자 바이오마커에 관한 포괄적이고 최신 데이터 접근을 더욱 복잡하게 만들었습니다. 이로 인해 일관성 없는 발견, 기존 바이오마커의 중복 재발견, 상반된 결과, 그리고 확립된 바이오마커를 활용할 기회를 간과하는 등의 문제가 발생했습니다. "오믹스" 측정의 등장으로 이 문제가 더욱 심화되었고, 임상 시험과 문헌에서 새로운 분자 바이오마커가 급증하여 바이오마커지식을 효과적으로 활용하고 활용하는 것이 점점 더 어려워지고 있습니다.
MarkerDB 2.0은 실험 목적을 위해 다양한 분자 바이오마커에 접근할 수 있게 합니다20. 다양한 바이오마커는 임상 연구와 의료 분야에서 질병을 진단, 예측, 모니터링하는 데 활용됩니다. 이 중 단백질 바이오마커는 혈청, 혈액, 뇌척수액(CSF), 복막액, 양수, 혈장, 소변과 같은 바이오유체를 사용하여 당뇨병, 결핵, 다운증후군, 근병증 관련 질환 등의 상태를 분석합니다. 마찬가지로, 유전 바이오마커는 LRP1, LPP, MAPT, SPI1과 같은 유전자 기호를 사용하여 연령 관련 황반변성, 알레르기 질환, 알츠하이머병, 암, 천식 등의 상태를 분석합니다. 더 나아가, 다중 모달 분자 바이오마커는 환자 위험과 진단 지표 측정에 도움을 줍니다21. 이 연구는 질병 진단, 예측 및 맞춤형 치료를 향상시키기 위해 ML 접근법을 활용한 의료 분석의 필요성을 강조합니다.
5. 바이오마커 발견을 위한 통계적 ML 접근법 모델링
머신러닝 접근법의 적용은 의료 분야를 여러 방면에서 변화시켰습니다. 구체적으로, 분자 바이오마커는 주성분분석(PCA), K-평균 군집화(KMA), 근접 이웃 분석(NNA), 신경망 알고리즘 등 다양한 ML 기법을 사용하여 분석되었습니다. 이 모델들은 선택된 특징에서 복잡한 패턴을 식별하고, 불완전하거나 일관되지 않은 데이터를 관리하며, 질병 진행의 실시간 추적을 지원합니다. 질병 진단 외에도, ML 알고리즘은 데이터 분석과 시각화를 통해 환자 문제에 대한 중요한 통찰을 제공하여 신속하고 목표 지향적인 진료를 가능하게 합니다. 그 결과, 이는 비정상적인 상황에서도 환자 건강 결과를 향상시킵니다. 더불어, 분자 바이오마커 분석을 포함한 다양한 질병 전반에 걸쳐 생물학적 표지자 발견과 치료 결과를 혁신할 수 있는 ML의 역량은 점점 더 활발해지고 있습니다.
ML 알고리즘은 그림 3에 나와 같이 다섯 가지 주요 유형으로 분류됩니다. 지도 학습은 라벨이 붙은 데이터셋에서 입력-출력 관계를 이해하기 위해 훈련하는 과정으로, 결정 트리나 지원 벡터 머신과 같은 분류 및 회귀 작업에 이상적입니다. 비지도 학습은 라벨이 없는 데이터 내에서 패턴을 식별하며, k-평균 군집화나 주성분 분석과 같은 기법을 통해 군집화 및 차원 축소에 자주 적용됩니다. 반지도 학습은 라벨이 붙은 데이터와 표시되지 않은 데이터를 결합하여 예측을 생성합니다. 강화 학습은 환경으로부터 받은 피드백에 기반한 의사결정에 중점을 두며, Q-러닝과 딥 강화 학습 네트워크와 같은 게임 및 로봇 공학 분야에서 자주 사용됩니다. 딥러닝은 다층 인공신경망을 사용하여 데이터 내 복잡한 패턴을 식별합니다. 이 기술은 암, 뇌졸중, 알츠하이머병, 파킨슨병 등 흔한 질병의 바이오마커를 예측하는 데 도움을 줍니다. 수많은 임상적으로 승인된 응용 프로그램에서 이 기술을 사용합니다 24,25. 악성 종양 환자의 정확한 진단은 일반적으로 조직 샘플의 획득 및 병리학적 분석에 달려 있으며, 이는 조직학적 등급, 아형, 병기 및 기타 다양한 종양 바이오마커에 관한 중요한 정보를 제공합니다.

그림 3: 임상 의사결정을 위한 머신러닝 알고리즘의 분류. 도표에 나타난 ML 알고리즘 유형들은 적용된 방법론을 이해하는 데 도움이 되도록 설명되어 있습니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
통계학과 머신러닝은 자주 교차하는 두 개의 별개의 학문 분야입니다. 통계학은 데이터를 수집, 분석, 해석하는 것을 포함하며, 일반적으로 작고 명확하게 정의된 데이터셋을 다루며 주로 정보를 비교하고 요약하는 데 중점을 둡니다. 반면, 머신러닝은 예측 모델을 생성하는 인공지능의 하위 개념으로, 종종 크고 복잡한 데이터셋을 다룹니다. 통계가 검증 연구와 근본 메커니즘 이해에 중요한 역할을 하는 반면, 머신러닝은 탐색적 연구, 복잡한 패턴 발견, 누락된 데이터 관리에 더 효과적입니다. 로지스틱 회귀와 같은 방법은 통계 모델이자 지도 학습 모델로 간주될 수 있어, 두 영역 간의 모호한 구분을 보여줍니다. 궁극적으로 연구자들은 연구 목표와 데이터의 성격을 평가하여 가장 적합한 방법을 선택해야 합니다.
6. MLP 모델링과 MLP의 변형
MLP는 다층 퍼셉트론이라고도 하며, 그림 4에 나타난 것처럼 입력과 출력 층 사이에 여러 뉴런 층이 있는 신경망 아키텍처의 한 종류입니다. MLP는 1950년대에 도입되어 1980년대 역전파의 발전과 발전으로 널리 사용되어 손실을 최소화하는 데 도움을 주었습니다. MLP의 기본 학습 원리는 신경망, 가중치, 그리고 출력 계산을 위한 편향 값입니다. 마지막으로, 출력 계층에서 출력을 얻기 위한 활성화 함수와 임계값을 알아야 합니다. 제안된 방법론에서 입력층, 숨겨진 층, 출력 층의 노드는 임상 및 유전자 특징, ReLU 활성화를 가진 완전 연결 층, 그리고 적응증(위험, 진단) 유형의 이진 결과를 예측하는 단일 뉴런에 대응합니다. 주요 장점은 교육과 해석이 간단하다는 점입니다. 하지만 단순 MLP는 대규모 데이터셋을 처리할 수 없고 학습률에 민감합니다26. 따라서 이러한 단점을 극복하기 위해 그림 3B에 제시된 아키텍처를 적용한 학습 속도 스케줄러(Learning Rate Scheduler)를 고려합니다. LR을 가진 MLP는 급격한 감쇠, 지수 감쇠, 역시간 감쇠, ReduceLROnPlateau, 코사인 어닐링을 포함하는 강력한 동적 메커니즘입니다. 고정된 LR 값 대신, 학습 속도는 모델 성능과 훈련에 따라 달라집니다.

그림 4: LR 스케줄러를 이용한 다층 Perceptron 및 MLP 모델링. (A) 다층 인식기: MLP의 구조는 입력 계층, 숨겨진 계층, 출력 계층으로 설명됩니다. 첫 번째 계층은 입력을 받아 두 번째 계층에서 활성화 처리하며, 출력은 마지막 계층에서 수신됩니다. MLP는 구현하기 간단합니다. (B) LR 스케줄러가 포함된 MLP: MLP와 유사합니다; 학습 속도 스케줄러가 추가되어 학습 속도를 조절하여 수렴률을 높이고 있습니다. 학습 속도는 정체기에 도달합니다. 이로 인해 오버슈팅 최소 현상이 줄어듭니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
이 방법은 표 형식 데이터에 더 효율적이고 신뢰할 수 있으며 효과적입니다. 또한, 노이즈가 있는 데이터에 대한 안정적인 수렴 개선, 일반화 개선, 하이퍼파라미터 튜닝 작업 감소 등의 이점도 있습니다. 하지만 일부 예측 과제에서는 국소 최소값에 갇히는 등 어려움이 발생할 수 있습니다. 더 나아가, 그림 5에 제시된 광범위하고 깊이 있는 MLP 아키텍처에서는 상관관계 매핑, 규칙 암기, 새로운 패턴 학습에 뛰어나도록 넓고 깊은 구성 요소가 MLP에 도입되었으며, 높은 일반화 기준을 유지합니다. 이 측면들을 출력 계층에 결합하면 이진 출력은27로 예측됩니다. 하지만 보이지 않는 특징의 일반화와 과도한 일반화에는 한계가 있습니다. 결론적으로, 배치 정규 및 드롭아웃을 포함한 MLP는 학습 및 미지의 속성 일반화를 위한 학습 및 일반화를 위한 학습 과정을 정규화하는 데 사용됩니다. 특히 이 기법은 고차원 데이터에 적용할 수 있으며 과적합을 방지하는 데 도움을 줍니다. 그럼에도 불구하고 이 기법은 배치 크기 제한, 배치 정규화 계층으로 인한 메모리 소비 증가, 그리고 보편적인 해결책이 아닙니다28,29.

그림 5: MLP 전체 및 딥 네트워크 모델링. 도표는 MLP의 깊은 경로를 보여주며, MLP는 비선형 관계를 포착할 수 있으며, 출력과 시그모이드 단위를 결합하여 분류합니다. 이 아키텍처는 이기종 바이오마커 데이터에 대한 패턴 학습과 지식을 포착합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
7. 탭넷
TabNet은 구글 리서치 팀30이 개발한 Tabular Network라는 딥러닝 모델입니다. TabNet 모델의 주요 동기는 이미지, 텍스트, 음성(CNN, Autoencoder, Transformers)에 대한 DL 접근법과 트리 기반 ML(XGBoost, Random Forest, LightGBM) 접근법 간의 차이점을 조화시키는 것입니다. 더불어, DL 접근법의 한계는 TabNet 모델에 큰 영향을 미치는데, MLP는 매개변수화된 모델입니다. 무엇보다도, DL 접근법은 실제 문제에 대한 해석, 자기 지도 학습, 순차적 학습 능력이 부족하다31. TabNet 모델은 보험 위험 예측32, 석탄재 함량 추정33, 화학 독성 예측34, 교육용 시험 부정행위 탐지35와 같은 응용 분야에 국한되어 있습니다. TabNet의 아키텍처는 그림 6에 나와 있습니다.

그림 6: 표 모양 네트워크 모델링. 테이블 네트워크는 입력 특징을 표 형식으로 받아 각 블록에서 순차적으로 트랜스포머 기법을 적용합니다. GLU 블록은 게이트 선형 단위 블록으로도 알려져 있으며, 네트워크를 통해 정보 흐름을 제어하여 특징 선택과 안정적인 학습을 용이하게 합니다. 출력은 누적된 출력에서 출력 계층에 표시됩니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
위 아키텍처 다이어그램에서 시스템은 입력 블록, 공유 특징 변환기, 순차적 결정 단계, 그리고 최적화를 이용한 손실 계산의 네 가지 구성 요소로 나뉩니다. 범주적 특징에서는 임베딩 계층을 따라 특징이 정수로 변환됩니다. 동시에 연속적인 특징들은 있는 그대로 받아들여진다. 마지막으로, 특징들은 x가 Rd∈ 통합된 특징 벡터로 변환됩니다. 다음 단계에서는 활성화 함수가 있는 완전 연결 계층을 구현하고, 데이터를 벡터로 변환하는 변환을 거쳐 결정을 내립니다. 세 번째 단계에서는 주의 변환기, 마스킹, 의사결정 변환기, 예측 축적을 차례로 사용합니다. 이 단계의 목표는 선택적 주의, 순차적 추론, 그리고 의사결정 경로입니다. 마지막 단계에서는 이진 교차엔트로피 또는 유사한 방법을 사용하여 손실을 찾고 값을 최적화합니다. 또한, 과적합을 방지하기 위해 희소 주의를 사용하여 정규화가 수행됩니다.
8. 오토인텔
자기 주의 신경망 을 통한 자동 특징 상호작용 학습(AutoInt)은 클릭률(CTR) 예측36 에서 도입된 AutoInt의 완전한 형태로, 이후 소프트웨어 결함 예측37, 추천 시스템38, 유전체 검출39 등 다양한 응용 분야에 적용되었습니다. 기존 ML 접근법에는 고차원 희소 데이터 처리, 고차 조합 특징 처리, 예측 능력 이해, 수동 특징 공학 필요성 등 한계가 있습니다. 이러한 모든 도전 과제는 AutoInt 모델로 효율성, 효과성, 설명 가능성으로 해결됩니다. 제안된 방법론에서 AutoInt의 목적은 해당 변이가 위험 적응증 유형인지 진단 적응증 유형인지 예측하는 것입니다. 그림 6에 나타난 것처럼 주어진 데이터셋에 대해 7단계가 제안되었으며, 소스 코드도 포함되어 있습니다. 첫째, 데이터 읽기와 전처리가 구현되어 모든 범주적 특징을 정수로 인코딩하고, 위험과 진단에 대해 라벨을 각각 0과 1로 매핑합니다. 두 번째 단계에서는 특징 표현을 수행하여 임베딩 행렬을 만듭니다; 그 다음, 행렬은 수치 특징을 정규화하기 위해 변환됩니다. 특징 간 중립적인 자동 상호작용이 트랜스포머와의 수동 상호작용 없이 학습되는 상호작용 계층이 있습니다. 더 나아가, 여러 머리가 서로 다른 유형의 상호작용을 배우고, 마지막으로 특징들이 연결되어 표현을 강화합니다. 잔류 연결은 1개의 특징, 2개의 특징, 3개의 특징 등과 같은 저차 및 고차 상호작용 모두를 학습할 수 있습니다. 마지막으로, 잔차 네트워크에서 출력은 이진 값 계산을 위해 시그모이드 함수로 전달되며, 이는 그림 7에 나타난 것입니다.

그림 7: AutoInt 네트워크 모델링. AutoInt 네트워크는 특징을 자동으로 학습하며, 임베딩 계층은 특징을 받아 자기 주의 메커니즘과 잔류 연결을 통해 다음 계층으로 매핑합니다. 마지막 구성 요소는 MLP 계층과 출력을 생성하는 활성화 함수를 가지고 있습니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
Access restricted. Please log in or start a trial to view this content.
실험들은 ML과 DL 접근법을 사용하여 성능을 비교합니다. 동시에 지도 학습 메커니즘과 비지도 학습 메커니즘을 모두 활용하는 머신러닝 모델 생성도 고려됩니다. 이 방법론에서 사용되는 감독 기법은 로지스틱 회귀, 결정 트리, 랜덤 포레스트, 그라디언트 부스트, 지지 벡터 머신, K-근접 이웃 알고리즘입니다. 이 알고리즘들은 단순한 통계 모델부터 복잡한 트리 기반 분석까지 다양합니다. 반면, 지도되지 않은 ML 알고리즘으로는 K-평균 클러스터링, DBSCAN 클러스터링, 그리고 집적 클러스터링 기법이 있습니다. 반면, 사용되는 딥러닝 기법은 단순 MLP, MLP + 배치 정규화 + 조기 정지, 와이드 및 딥 네트워크(표형 하이브리드), 그리고 학습 속도 스케줄러가 포함된 MLP(고급 버전)입니다. 결과 분석을 하기 전에, 모델 기반, 순열 중요도, SHapley 가법 설명(SHAP) 및 국소 해석 가능한 모델 비구애적 설명(LIME) 접근법을 사용하여 특징 중요도를 계산합...
Access restricted. Please log in or start a trial to view this content.
제안된 연구는 질병과 그 특성의 식별과 모니터링에서 바이오마커의 중요성을 명확히 논의합니다. 바이오마커 방법론에 대한 제안된 접근법은 네 가지 필수 단계에 기반합니다: 신중한 데이터 준비(정제, 인코딩, 식별자 제거); 균일한 타겟 인코딩(Risk=0, Diagnostic=1); AutoInt37/TabNet과 같은 모델의 특징 정규화 및 고품질 딥 메베딩; 그리고 견고한 평가 과정의 무결성(적절한 훈련/시험 분할, 정확한 지표 보고)을 포함합니다. 더 나아가, 유전자를 이용한 질병 적응증은 ML 및 DL 알고리즘의 지원을 받아 예측되었습니다. 가장 일반적으로 사용되는 ML 알고리즘이 데이터셋에 구현되었으며, 알고리즘과 데이터셋의 조정 및 효율성은 위 섹션의 결과와 일치하였습니다. 또한, MLP29, TabNet, AutoInt 외에도 새로운 DL 모델들이 데이터셋과 함께 분석되었고,...
Access restricted. Please log in or start a trial to view this content.
저자들은 공개할 것이 없습니다.
저자들은 외부 자금을 받지 않았습니다.
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| AutoInt 모델 | 베이징대학교 | https://github.com/shichence/AutoInt | 자기 주의 신경망을 통한 자동 특징 상호작용 학습: (희소한) 범주형 및 수치 특징에 대한 고차 특징 상호작용을 자동으로 학습하는 효율적인 알고리즘 |
| deepctr_torch.모델 | 오픈 소스 | https://github.com/shenweichen/DeepCTR-Torch | 모듈러 및 확장 가능한 딥러닝 기반 CTR 모델 패키지로, 자체 맞춤형 모델을 쉽게 구축할 수 있습니다. |
| 구글 코슬라버러토리 | 구글 | https://colab.research.google.com/ | 클라우드 기반 머신러닝, 데이터 분석을 위해 브라우저를 통해 Python 코드를 작성하고 실행할 수 있는 환경을 제공합니다 |
| 케라스 2.6.0 | 케라스 | https://keras.io/ | Tensorflow 위에서 실행되는 신경망 실행용 Python 인터페이스를 제공합니다 |
| 마커DB 2.0 | 마커DB | https://markerdb.ca/downloads | 공개 접근 가능한 분자 바이오마커 데이터베이스 |
| MatplotLib 3.4.3 | Matplotlib | https://matplotlib.org/ | 파이썬용 시각화 라이브러리 |
| 넘피 1.21.4 | 넘피 | https://numpy.org/ | 파이썬을 이용한 과학 컴퓨팅을 위한 기본 패키지 |
| 판다스 1.3.4 | 판다 | https://pandas.pydata.org/ | 파이썬 프로그래밍 언어 위에 구축된 강력하고 유연하며 사용하기 쉬운 오픈 소스 데이터 분석 및 조작 도구입니다. |
| 파이썬 3.8.10 | 파이썬 소프트웨어 재단 | https://www.python.org/ | 딥러닝 시스템을 보다 효과적으로 통합하는 인기 있는 프로그래밍 언어입니다. |
| pytorch_tabnet.tab_model | 파이토치 | https://pypi.org/project/pytorch-tabnet/ | 이진/다중 클래스 분류 및 회귀 문제를 구현하기 위해. |
| Scikit-learn | Scikit-learn | https://scikit-learn.org/stable/ | 머신러닝 알고리즘용 파이썬 모듈 |
| 씨본 | 씨본 | https://seaborn.pydata.org/ | 매력적이고 유익한 통계 그래픽을 그리기 위한 고급 데이터 시각화 라이브러리 |
| 탭넷 모델 | 구글 | https://github.com/dreamquark-ai/tabnet | TabNet은 표 형태의 데이터를 직접 처리하도록 설계된 종단 간 신경망입니다 |
| 텐서플로우 2.6.0 | 구글 | https://www.tensorflow.org/ | 머신러닝을 위한 종단 간 플랫폼 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission