방법 논문

약용 식물의 3D 도메인 스와핑 단백질에 대한 기계 학습 예측

DOI:

10.3791/68519

2025년 8월 15일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 다양한 약용 식물 게놈에서 3D 도메인 스와핑에 관여하거나 관여할 것으로 예상되는 단백질을 조사합니다. 기계 학습 모델을 사용하여 3D 도메인 교환 단백질을 정확하게 예측하고 그 기능과 2차 대사산물 생산과의 관련성을 예측합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

3D 도메인 스와핑은 2개 이상의 단백질 서브유닛이 동일한 구조 서브유닛을 교환하여 올리고머를 형성하는 단백질 구조 현상입니다. 3D 도메인 스와핑을 나타내는 단백질은 2차 대사산물 생합성과 같은 다양한 생물학적 기능과 약용 식물의 여러 생물학적 및 비생물적 스트레스에 대처하는 데 중요한 역할을 합니다. 본 연구는 랜덤 포레스트와 K-최근접 이웃 분류기 모델을 사용하여 약용 식물의 게놈 간 3D 도메인 스와핑 패턴을 예측하는 능력을 조사하여 각각 91.6%와 88.7%의 정확도를 입증했습니다. 총 420개(31%)의 서열이 3D 도메인 스와핑에 관여하는 것으로 추정되는 것으로 예측되었습니다. 또한 GO(Gene Ontology) 용어, KEGG(Kyoto Encyclopedia of Genes and Genomes) 경로 분석 및 2차 대사산물 생합성 경로에서의 도메인 분포를 기반으로 기능 주석을 위해 다양한 약용 식물에서 예측된 3D 도메인 교환 단백질 서열에 대한 농축 조사가 수행되었습니다. 예측된 서열의 기능적 주석은 3D 도메인 스왑 서열이 광계 II 및 전자 수송체의 광합성 전자 전달, 광합성 활성의 순환 전자 전달 경로 내에서 전자를 전달하고, 산화적 인산화 및 2차 대사산물(테르페노이드, 알칼로이드 및 폴리아민). 이러한 발견은 3D 도메인 교환 현상에 단백질의 관여, 각각의 기능, 약물 발견 및 생명공학 이니셔티브를 촉진할 수 있는 잠재력을 예측하는 기계 학습의 능력을 강조합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

계산 방법은 단백질 구조, 기능 및 상호 작용에 대한 상세한 분석 및 예측을 가능하게 함으로써 단백질 연구에 혁명을 일으켰습니다. 단백질 기능의 정확한 식별과 주석은 생명의 분자 메커니즘을 밝히는 데 필수적이며 의학 및 약물 개발의 발전에 매우 중요합니다. 그러나 실험 방법의 고유한 복잡성과 비용으로 인해 대규모 시퀀스 데이터를 수용할 수 있는 확장성이 제한됩니다. 그 결과, 단백질 기능 예측을 위한 계산 방법의 개발은 혁신적인 대규모 접근 방식을 통해 이러한 격차를 해소하는 계산 및 분자 생물학의 중추적인 영역으로 부상했습니다1.

3D 도메인 스와핑2 는 공유 구조의 세그먼트가 개별 사슬 간에 교환되는 단백질의 구조적 현상입니다. 1994년에 3D 도메인 스와핑의 메커니즘에 대한 입문 문서가 디프테리아 독소 이량체3에서 발견되었습니다. 그러나 3D 도메인 스와핑의 기본 원칙은 40년 전으로 거슬러 올라갑니다. 소 췌장 리보뉴클레아제 A(RNase A)는 정교한 화학적 변형 실험을 통해 아세트산에서 동결건조하는 동안 이량체를 형성하는 것으로 관찰되었습니다4. 단백질 올리고머화에서 두 개 이상의 단백질 사슬은 유연한 힌지 영역을 통해 동일한 구조 요소를 교환합니다. 단량체 서브유닛 사이에서 교환되는 단백질의 부분을 스왑 도메인이라고 하며, 이는 특정 단백질의 전체 구형 도메인, 루프 또는 2차 구조 요소로 구성될 수 있습니다. 반대로, 단량체 내에서 원래 위치에서 변하지 않은 상태로 남아 있는 영역을 스왑되지 않은 도메인이라고 합니다5. 스왑되지 않은 도메인 간의 결합은 그림 1에 표시된 NSDI(Non-swapped domain interface)로 정의됩니다. 3D 도메인 스와핑에서 한 단백질 서브유닛의 스왑되지 않은 도메인과 다른 서브유닛의 이미 스왑된 도메인 사이의 관계를 스왑 도메인 인터페이스(SDI)라고 합니다. 이 현상의 또 다른 중요한 측면은 스왑되지 않은 도메인과 스왑된 도메인을 연결하는 유연한 링커 세그먼트인 힌지 영역입니다. 이 힌지 영역은 3D 도메인 스와핑의 이동을 돕는 데 필수적인 기능을 수행하며 구조적 스위치 역할을 하여 도메인 스와핑이 발생하는 데 필요한 구조적 재구성을 가능하게 합니다. 3D 도메인 스와핑은 단백질 조립 및 기능적 조절을 포함한 다양한 생물학적 과정과 관련이 있습니다5. 또한 비정상적인 교환으로 인해 응집체나 아밀로이드 원섬유가 형성될 수 있는 특정 단백질 잘못 접힘 질환과도 관련이 있습니다.

figure-introduction-1
그림 1: 3D 도메인 스와핑의 구조적 표현. 이 표현은 유연한 힌지 영역을 통해 두 단백질 단량체 사이의 동일한 구조 요소의 교환을 보여주며, 그 결과 도메인 교환 이량체 또는 올리고머 어셈블리가 형성됩니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

다양한 유형의 3D 도메인 스와핑이 스왑된 도메인의 특성과 결과적인 올리고머 구조(6)에 기초하여 확인되었습니다. 2002년에 Eisenberg와 그들의 동료는 BDS(Bonafide domain swapping), QDS(quasi-domain swapping) 및 3D 도메인 스와핑(CDS) 후보의 세 가지 유형의 3D 도메인 스와핑을 확인했습니다7. 가장 일반적인 단백질 종류는 선의의 도메인 스와핑입니다. 이는 이량체와 단량체 분자가 모두 안정적인 형태로 존재하는 상태를 말하며, 이량체는 도메인 스왑 구성을 채택하고 단량체는 폐쇄 구성을 채택해야 합니다. 준 도메인 스와핑에서 단백질은 올리고머 상태로 존재하는 것으로 알려져 있지만, 그 상동 구조는 단량체 상태로 존재하는 것으로 알려져 있습니다. CDS에서는 도메인 교환 범주에 따른 단백질 분류만 확인하는 반면, 관련 단량체 또는 이들의 단량체 상동체의 구조 정보는 존재하지 않습니다8. 이 절차에서는 단량체 또는 이들의 단량체 상동체가 없습니다. 오히려 이종 단백질 분자가 존재합니다. 표 1은 이 세 가지 범주의 예를보여줍니다 9.

표 1: 예와 함께 3D 도메인 스와핑 유형. 이 표를 다운로드하려면 여기를 클릭하십시오.

후속 연구를 통해 수많은 도메인 스왑 구조가 밝혀져 3D 도메인 스와핑 개념을 이해할 수 있는 길을 열었습니다. 이 현상을 뒷받침하는 최초의 구조적 증거는 C-말단 가닥의 교환을 통해 이량체 구조를 형성하는 박테리오파지 λ의 Cro 억제 단백질 분자에서 관찰되었습니다. 1996년 연구원은 단량체 Cro 분자가 3D 도메인 스와핑에 관여한다는 것을 발견했습니다10. βB2-크리스탈린(12), 인간 CksHs213, 쇠고기 간 카탈라아제14 및 재조합 인간 인터루킨-5(15)과 같은 다른 구조(11)도 가능한 3D 도메인 스왑 구조로 보고되었다. 단백질 분자 내에서 스왑된 도메인 위치에 따라 3D 도메인 스와핑은 C-말단 도메인 스와핑, N-말단 도메인 스와핑 및 비교적 드문 중앙 도메인 스와핑의 세 가지 유형으로 분류됩니다. 저자는 완전한 인간 게놈을 사용하여 도메인 교환 사례를 예측합니다. 그들은 Random Forest와 Support Vector Machine을 각각 81.7%와 73.9%의 정확도로 이진 분류기로 사용합니다. 단백질 서열의 거의 44%가 인간 게놈6에서 3D 도메인 교환으로 예측되었습니다. GO(Gene Ontology)를 기반으로 도메인 분포, 질병 분포 및 기능적 주석에 대한 예측 사례에 대해 농축 분석을 수행했습니다. 또 다른 접근 방식은 랜덤 포레스트 접근 방식을 사용하여 Ocimum tenuiforum의 완전한 게놈 전체 분석을 조사하고 Ocimum tenuiforum의 단백질 서열의 거의 25%가 3D 도메인 교환에 관여할 것으로 예상된다는 것을 발견했습니다. 연구자들은 또한 GO 용어 연관성과 단백질 도메인 패밀리 연관을 사용하여 기능적 주석을 수행했으며 1158개의 서열만이 비생물적 스트레스에 관여한다는 것을 발견했습니다16.

식물은 3D 도메인 스와핑을 포함하여 구조적 재배열을 겪을 수 있는 능력을 가진 것으로 인식되는 특정 단백질과 함께 다양한 독특한 단백질 계열을 보여줍니다. 3D 도메인 스와핑은 2차 대사산물 또는 여러 약리학적 응용을 보유하는 기타 생물학적으로 관련된 경로의 생성과 함께 생물학적 및 비생물적 스트레스 조건에 영향을 미칠 수 있습니다. 따라서 그들은 이 조사에 중요한 초점을 제공합니다. Wal1의 결정 구조는 비대칭 단위 내에 두 개의 이량체와 시스타틴 C에서 발견되는 구조적 재배열을 특징으로 하는 도메인 교환 이량체 구성을 보여주었습니다. 피토시스타틴은 비생물적 스트레스에서 중요한 역할을 하며 작물 저항성도 향상시킵니다. 총 20,121개의 3D 도메인 스왑 예측 단백질이 이용 가능한 문헌 및 다양한 관련 저장소에서 확인되었으며, 그 중 17,552개는 식물 기원이고 2569개는 비식물 유기체에서 유래합니다17,18.

문헌에서는 기계 학습 접근 방식을 사용하여 다양한 식물의 3D 도메인 스와핑 예측에 대한 다양한 다른 예가 보고되었습니다. 예를 들어 Arabidopsis thaliana 는 33.7%(검토된 12,033개의 서열 중 4058개), Medicago truncatula 20.9%(검토된 186개 서열 중 39개), Solanum tuberosum 36.5%(검토된 400개 서열 중 146개), Solanum lycopersicum 25.5%(검토된 423개 서열 중 108개), Ocimum tenuiforum 15.5%(검토된 36841개 서열 중 5706개)6. 계산 방법은 3D 도메인 교환 단백질의 구조적, 기능적 측면을 탐구하는 데 매우 중요해졌습니다. 이러한 접근법은 가능한 최상의 특징19, 주석 및 농축 분석을 기반으로 서열의 예측을 용이하게 하여 기본 분자 메커니즘에 대한 통찰력을 제공합니다. 다양한 단백질 서열에서 3D 도메인 스와핑의 예측은 SVM(Support Vector Machine) 기반 분류기를 사용하여 수행되었습니다. 이 접근법은 서열 및 구조적 특징을 통합하여 개발되었으며, 훈련 데이터 세트에서 76.33%, 테스트 데이터 세트에서 73.81%의 예측 정확도를 산출했으며, 이는 단백질의 도메인 스와핑 경향을 식별하는 데 있어 잠재력을 나타냅니다20. SVM 대신 KNN을 선택하는 주된 이유는 KNN의 교육 프로세스가 훨씬 간단하기 때문입니다. 설정하려면 하나의 기본 매개변수인 K(예측을 할 때 고려되는 최근접 이웃의 수)만 있으면 되는 반면, SVM은 커널 유형, C 및 감마와 같은 여러 매개변수를 신중하게 조정해야 합니다. 또한 KNN은 다중 클래스 분류를 보다 쉽게 처리하는 반면 SVM은 일반적으로 일대일 전략과 같은 더 복잡한 전략이 필요합니다.

단백질 구조 예측을 위한 기계 학습
단백질 구조의 예측에는 FASTA 서열에서 단백질의 3차원 모양을 추론하는 것이 포함됩니다. 이 분야의 최근 발전은 진화 데이터에 대한 다양한 기계 학습 기술의 적용에 의해 크게 주도되었습니다21,22. 공진화 데이터에서 정보를 추출하기 위한 초기 접근 방식은 기계 학습 방법에 의존했습니다. 그러나 보다 최근의 전략, 특히 심층 잔류 네트워크를 활용하는 전략은 잠재적 표적을 예측하는 데 탁월한 성능을 보여주었습니다23. Alphafold는 딥 러닝 기반 데이터베이스인 반면 Rosetta는 물리 기반 에너지 함수 도구입니다. 이러한 도구는 실험 구조에 근사화할 수 있는 전체 3D 원자 구조를 예측하는 데 사용됩니다. 원자 분해능 구조 좌표만 제공하지만 이러한 도구는 3D 도메인 스와핑 이벤트를 지정하지 않습니다. 대조적으로, 제안된 접근법은 완전한 3D 구조 예측 변수가 아니라 단백질이 3D 도메인 스와핑을 겪을 가능성이 있는지 여부를 예측할 뿐입니다24,25.

약용 식물은 생리 활성 화합물로 인해 다양한 질병의 예방 및 치료를 위한 천연 자원으로 수세기 동안 활용되어 왔습니다. 이는 전통 의학에 필수적이며 현대 의약품 개발에 기여합니다. 그러나 신약 발견을 위한 약용 식물의 단백질 도메인 스와핑 분야에서는 중요한 작업이 수행되지 않았습니다. 머신 러닝 및 앙상블 모델을 포함한 알고리즘은 시퀀스 데이터의 패턴과 관계를 인식하여 3D 도메인 스와핑을 예측합니다. 이 연구를 위해 약용 식물을 선택한 이유는 3D 도메인 스와핑에 관여하는 식물에서 단백질의 기능적 다양성을 감지하여 스트레스 반응, 병원체 방어 및 대사 생합성을 이해할 수 있기 때문입니다. NMR 또는 결정학 기술을 활용하여 대량의 단백질 3D 도메인 스와핑과 복잡하고 고급 올리고머 형태를 결정하는 것과 관련된 기술적 과제는 고급 계산 접근 방식 개발의 필요성을 강조합니다.

제안된 연구 작업의 전반적인 목표는 단백질 서열 구조 예측 작업을 위해 랜덤 포레스트(RF)26 및 K-최근접 이웃(KNN)27 알고리즘을 사용하여 계산 방법론을 사용하고 다양한 약용 식물 서열에서 교체된 사례에 대한 완전한 게놈 전체 분석을 수행하는 것입니다. RF(Random Forest)는 이진 분류기입니다. 이는 단백질 서열 분석에 널리 사용되는 강력하고 다재다능한 기계 학습 알고리즘입니다. 이는 의사 결정 트리(DT) 앙상블을 구성하여 작동하며 훈련 및 테스트 데이터 세트 모두에서 상당히 높은 정확도를 달성합니다. 단백질 서열 작업의 경우, RF는 물리화학적 특성, 서열 구성, 2차 구조, 서열 정렬 또는 프로파일에서 파생된 진화 정보 등 다양한 특징을 분석할 수 있습니다. 크고 시끄러운 데이터 세트를 처리하는 데 탁월하며 기능 중요도 메트릭을 제공합니다 28. K-최근접 이웃(KNN) 분류기는 단백질 서열 분석에 널리 적용되는 간단하면서도 효과적인 기계 학습 알고리즘입니다. 이는 기능 공간에서 가장 가까운 이웃 k개의 대다수 클래스를 기반으로 입력 시퀀스를 분류하는 방식으로 작동합니다. 단백질 서열 분석에서 KNN은 기능 범주, 구조적 특성 및 세포 내 국소화를 예측하는 데 사용할 수 있습니다. KNN 분류의 특징에는 종종 아미노산 구성, 서열 모티프, 진화 프로필 또는 물리화학적 속성이 포함됩니다. KNN은 단순성 때문에 단백질 분석에 널리 사용됩니다. 해석 가능성과 효율성으로 인해 단백질 서열 분석을 위한 귀중한 도구가 됩니다29. 이러한 알고리즘은 함께 보완적인 강점을 제공하여 다양한 약용 식물 서열에서 3D 도메인 스와핑 연구를 위한 포괄적인 계산 프레임워크를 가능하게 합니다. 이 두 모델은 도메인 교환을 겪을 수 있는 가능한 사례만 예측합니다. 전체 3D 구조 좌표나 이 교환 과정에 특히 어떤 부분이나 잔류물이 관여하는지 예측하지 않습니다. 3D 도메인 스와핑의 메커니즘 및 기능적 측면을 명확히 하기 위해 스와핑에 관여하는 특정 영역 또는 잔기를 식별하는 것은 events.3D 도메인 스와핑은 폐쇄 루프 구성, 개방형 스왑 및 서로 다른 힌지 영역 및 도메인 아키텍처를 포함하는 기타 차이점과 같은 구조적으로 구별되는 다양한 현상으로 구성되기 때문에 추가 연구의 문제입니다. 이에 비추어 제안된 접근 방식은 모든 종류의 3D 도메인 스와핑 이벤트만 통합 분류로 분류합니다. 이 선택은 처음에 특정 클래스의 3D 도메인 스와핑을 지정할 수 있는 주석이 달린 데이터의 제한된 가용성에 의해 주도되었습니다. 이것은 다양한 약용 식물 기반 데이터 세트에 대한 첫 번째 종류의 시도이며, 서로 다른 스와핑 메커니즘을 구별하면 모델의 예측 정확도를 향상시킬 수 있다고 생각합니다.

약용 식물의 농축 분석은 생리 활성 화합물 합성 및 스트레스 반응에 관여하는 주요 유전자, 단백질 및 경로를 식별하는 데 도움이 됩니다. 분자 메커니즘에 대한 통찰력을 제공합니다. 약용 식물에 대한 이러한 분석은 생리 활성 화학 물질의 합성, 스트레스 회복력 및 질병 저항성과 관련된 필수 유전자, 단백질 및 생물학적 과정을 조사합니다. 유전자 온톨로지(GO) 및 KEGG 경로 분석과 같은 선택된 단백질의 기능적 주석은 2차 대사산물 생산 및 환경 스트레스 반응의 기초가 되는 분자 메커니즘을 밝힙니다. 이 접근 방식은 약물 발견에 실질적으로 도움이 되고, 작물 회복력을 향상시키며, 지속 가능한 농업 및 의약 발전을 위한 식물 대사 경로를 밝힙니다.

연구의 새로운 기여
이 연구는 생물학적 데이터 세트에서 단백질 구조 패턴을 예측하기 위해 보다 정확하고 효율적인 모델을 촉진하는 기계 학습의 기능을 강조합니다.

이 연구는 새로운 기능을 기계 학습 알고리즘에 통합하여 단백질 기능을 더욱 명확하게 예측하는 능력을 향상시킵니다. 이러한 기능은 단백질의 구조-기능 관계에 대한 향상된 이해를 제공하여 단백질 공학에서 보다 정확한 단백질 설계 및 최적화를 돕습니다.

예측된 단백질의 농축 분석은 바이오마커 발견, 약물 설계 및 질병 메커니즘 이해에 귀중한 표적을 제공하는 주요 생물학적 경로, 세포 과정 및 분자 기능을 찾는 데 도움이 됩니다. 이 분석은 경로 기반 개입 및 치료 표적 식별의 정확성을 향상시킵니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

참고: 이 세그먼트는 (a) 데이터 수집, (b) 기능 선택, (c) 데이터 전처리, (d) 데이터 후처리 (e) 모델 개발 (f) 제안된 모델의 결과 평가 및 (g) 긍정적으로 예측된 시퀀스의 다양한 수준에서 농축 분석의 6가지 기본 단계를 포함하는 제안된 방법론의 포괄적인 개요를 제공합니다. Core i5-10500은 이 연구 작업에 사용된 10세대 프로세서입니다. 6개의 코어와 12개의 스레드가 있으며 기본 주파수는 3.10GHz이고 최대 터보 속도는 4.50GHz입니다. 12MB의 Intel Smart Cache가 장착되어 DDR4-2666 메모리를 지원하며 통합 비주얼을 위한 UHD Graphics 630이 포함되어 있습니다. 효율적인 멀티태스킹과 생산성을 위해 제작된 이 제품은 LGA 1200 소켓과 호환되며 65W TDP에서 작동합니다.

1. 데이터 수집

  1. Use3d3dswap-pred(https://caps.ncbs.res.in/3dswap-pred/3dswap-pred.html) 및 3DSwap+(https://caps.ncbs.res.in/3Dswapplus/index.html)3030 보충표 1, 보충표 2, 보충 파일 1, 보충 파일 2). 주로 약용 식물에서 추출한 3D 도메인 스왑 분자의 총 573개의 수동 PDB 항목을 사용합니다.
  2. BRP(Best Representative Profile) 방법을 사용하여 각 Pfam31 단백질 패밀리(http://pfam.xfam.org/)에 BRS(Best Representative Sequence)를 할당하여 음성 데이터 세트를 구성합니다. E-값 임계값이 0.001인 HMMER32 (https://www.ebi.ac.uk/Tools/hmmer/)를 사용하여 모든 Pfam BRP에 대해 총 10,112개의 구조 서열을 검색합니다. DIAL을 사용하여 결과 시퀀스를 처리하여 구조 도메인(https://bioinformaticshome.com/db/tool/DIAL)을 식별합니다. 575개의 PDB 항목을 음수 데이터 세트(학습)로 포함합니다.
  3. BRP 방법을 통해 파생된 314개의 단백질 서열과 3DSwap+에 의해 음성 데이터 세트로 식별된 261개의 수동으로 선별된 비3D 도메인 스왑 서열을 포함합니다.
  4. UniProt33 (https://www.uniprot.org/)에서 다양한 약용 식물에서 총 1,355개의 검토된 단백질 서열 항목을 검색합니다. 이 연구(테스트/예측 데이터 세트)에 13가지 약용 식물을 포함합니다: Citrus sinensis(RS-102), Vitis vinifera(RS-226), Mentha(RS-28), Cannabis sativa(RS-21), Acorus clamus(RS-511), Coffea arabica(RS-104), Papaver somniferum(RS-58), Hibiscus(RS-88), Jasmine(RS-89), 백리향(RS-30), Thymus(RS-14), Illicium oligandrum(RS-72) 및 Citrus limon(RS-12). 계통 발생 트리는 보충 그림 1에 나와 있습니다.

2. 모델 생성을 위한 기능 사용

  1. 약용 식물의 단백질 서열을 예측하기 위한 453가지 기능으로 구성된 포괄적인 기능 세트를 활용합니다. 철저한 문헌 검토를 기반으로 신중하게 선택된 439개의 확립된 기능과 16개의 새로운 기능을 포함합니다.
  2. AAindex 데이터베이스34(https://www.genome.jp/aaindex/)를 사용하여 아미노산 물리화학적 특성을 결정합니다. 기능 선택을 위해 WEKA35 기계 학습 플랫폼(https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/)을 적용합니다. 새로 통합된 기능은 표 2 를 참조하십시오.

표 2: 설명과 함께 새로 추가된 기능 목록. 이 표는 3D 도메인 스와핑을 예측할 때 모델 성능을 향상시키기 위해 특징 추출 단계에서 설계된 새로운 특징을 요약한 것입니다. 각 기능은 도메인 교환 성향에 영향을 미치는 것으로 가정된 단백질의 특정 서열 기반, 물리화학적 또는 구조적 특성을 포착합니다. 각 특징의 생물학적 관련성과 계산적 도출을 명확히 하기 위해 자세한 설명이 제공됩니다. 이 표를 다운로드하려면 여기를 클릭하십시오.

3. 데이터 전처리 및 사후 처리

참고: 데이터 전처리. 데이터 전처리는 분석을 위해 원시 데이터를 준비하는 기계 학습의 필수 단계입니다. 여기에는 데이터 정리(예: 중복 제거, 누락된 값 처리 등)가 포함됩니다.

  1. 범주형 변수를 숫자 형식으로 인코딩하려면 보조 코딩 파일 1 을 사용하며, 여기에는 (1) 점수 사전 정의, (2) 서열 I0에 의한 fasta 시퀀스 처리의 네 가지 주요 단계가 포함됩니다. 구문 분석, (3) 데이터 프레임 생성, (4) 3D 도메인 스왑 기능의 수치 분석.
  2. 데이터 후처리를 통해 모델의 출력을 구체화하고 해석합니다. 예측을 재보정하고, 결과를 집계하고, 분류를 위한 임계값을 적용합니다. 이전 연구 36,37,38에서 지원한 바와 같이 임계값 β = 0.5(범위 0-1)을 사용하여 바이모달 3D 도메인 스와핑 데이터 세트를 분류합니다.
  3. 70:30 훈련-테스트 분할로 데이터 세트를 분할하여 모델 학습에 70%를, 독립 평가에 30%를 할당합니다.
  4. 표준 스케일러 방법을 사용하여 훈련 데이터를 표준화하여 특징 값을 평균 0 및 표준 편차 1로 조정하여 기계 학습 추정기와의 호환성을 향상시킵니다. 가장 영향력 있는 변수를 식별하기 위해 기능 선택을 수행합니다.
    참고: 데이터 세트를 표준화하는 것은 최적의 성능을 보장하기 위해 많은 기계 학습 알고리즘에 널리 사용되는 전제 조건입니다. 정규 분포에서 멀리 떨어진 데이터는 기계 학습 모델의 성능에 부정적인 영향을 미칠 수 있습니다39.
  5. 유효성 검사를 수행합니다. 강력하고 편향되지 않은 모델 평가를 보장하기 위해 K-fold 교차 검증도 구현되었습니다 보충 표 3.
  6. 데이터 세트를 K 하위 집합으로 분할합니다. K=5 하위 집합에서 모델을 반복적으로 훈련하고 평가하고 나머지 하위 집합을 독립적인 테스트에 사용합니다.

4. 모델 생성 및 구현

  1. RF(Random Forest) 및 KNN(K-Nearest Neighbors) 알고리즘을 구현하고 미세 조정하여 예측 성능을 최적화합니다. 훈련을 위해 573 및 575개의 단백질 서열과 테스트를 위해 1,355개의 단백질 서열을 사용하여 모델을 훈련, 검증 및 테스트합니다.
  2. Python 스크립트 (Supplementary Coding File 1) 를 사용하여 선택한 단백질 서열을 기반으로 수치 특징 값을 추출합니다. 두 데이터 세트에 대한 이러한 수치를 CSV 파일에 저장하고 이진 분류 모델 생성을 위해 RF 및 KNN 분류자에 제출합니다.
  3. 이러한 모델을 사용하여 3D 도메인 스왑 단백질과 비 3D 도메인 스왑 단백질을 구별합니다. 3D 도메인 스와핑을 예측하기 위한 일반화된 프레임워크는 그림 2그림 3 을 참조하십시오.
  4. RF 모델에 대해 n_estimators=20, max_depth=4 및 random_state=42와 같은 하이퍼 매개변수를 적용합니다.
  5. KNN 분류기 모델에 하이퍼 매개변수 neighbors=5를 적용합니다.
    참고: 이러한 매개변수 설정은 수동으로 선별된 약용 식물 데이터 세트에서 모델의 성능을 향상시키기 위해 미세 조정되었습니다.

figure-protocol-1
그림 2: 예시적 회로도 표현. 이 표현은 랜덤 포레스트 및 K-최근접 이웃(KNN) 기계 학습 모델을 보여주며, 이진 분류 작업의 맥락에서 알고리즘 구조와 기능적 워크플로를 보여줍니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

figure-protocol-2
그림 3: 기계 학습 기반 워크플로. 이 다이어그램은 약용 식물 단백질의 3D 도메인 스와핑을 예측하기 위한 기계 학습 기반 워크플로를 보여줍니다. 이 프로세스는 벤치마크 데이터 세트와 메타 데이터 세트를 결합한 데이터 세트 획득으로 시작됩니다. 특징 추출에는 단백질 서열에서 기존 특징과 새로운 특징을 모두 도출하는 것이 포함됩니다. 데이터 세트 전처리에서 FASTA 시퀀스는 시퀀스 구문 분석 및 사전 매핑을 사용하여 숫자 값으로 변환되어 특정 3D 도메인 스왑 기능을 포함한 구조화된 데이터 프레임을 생성합니다. 후처리에는 임계값(β = 0.5)을 사용하여 도메인 스왑 상태 할당, 데이터를 훈련 및 테스트 세트(70-30 비율)로 분할, 기능 표준화, k-fold 검증을 통한 기능 선택 수행이 포함됩니다. RF(Random Forest)와 KNN(K-Nearest Neighbors)이라는 두 가지 기계 학습 모델을 훈련하고 AUROC 및 AUPRC와 함께 모델 메트릭을 사용하여 성능을 평가하여 예측 정확도와 견고성을 평가합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

5. ML 분류기의 정적 평가 및 모델 평가

  1. RF(Random Forest) 및 KNN(K-Nearest Neighbors) 알고리즘을 구현하고 미세 조정하여 예측 성능을 최적화합니다. 훈련을 위해 573 및 575개의 단백질 서열과 테스트를 위해 1,355개의 단백질 서열을 사용하여 모델을 훈련, 검증 및 테스트합니다.
    figure-protocol-3(1)
    figure-protocol-4(2)
    figure-protocol-5(3)
    figure-protocol-6(4)
    figure-protocol-7(5)
    figure-protocol-8(6)
    참고: TP(참 긍정)를 모델에 의해 도메인 스왑으로 올바르게 예측된 서열의 백분율로 정의합니다. TN(True Negative)을 도메인 스왑되지 않은 것으로 올바르게 예측된 서열의 백분율로 정의합니다. 위양성(FP)은 도메인 스왑되지 않은 단백질이 도메인 스왑으로 잘못 예측되는 경우로 정의합니다. FN(False Negative)은 도메인 스왑 단백질이 도메인 스왑되지 않은 것으로 잘못 예측되는 경우로 정의합니다.
  2. Xsen 을 정확하게 식별된 참 긍정의 비율로 계산하고 Xspe 를 모델에 의해 올바르게 식별된 참 부정의 비율로 계산합니다.
    참고: MCC를 사용하여 혼동 행렬에서 참 긍정, 참 부정, 거짓 긍정 및 거짓 부정을 분석하여 이진 분류의 품질을 평가합니다.
  3. 정확도 계산(ACC)을 사용하여 전체 예측 중 올바른 예측의 비율을 측정합니다.
    참고: 정밀도는 예측된 모든 양성 중에서 올바르게 식별된 양성의 비율을 평가하는 반면, F1 점수는 정밀도와 민감도의 고조파 평균으로 거짓 긍정과 거짓 부정을 평형을 이룹니다.
  4. AUC를 사용하여 이진 분류 작업에서 분류 모델의 성능을 평가합니다. 양수 및 음수 분류된 단백질을 기반으로 Scikit-learn Python 라이브러리40을 사용하여 AUC(곡선 아래 면적)를 계산합니다.
  5. 테스트 데이터를 사용하여 이러한 매개변수를 평가합니다.

6. 다양한 약용 식물 종에 대한 3D 도메인 스와핑 예측을 위한 모델 구현

  1. Citrus sinensis, Mentha, Vitis vinifera, Thyme, Thymus vulgaris, Jasmine, Hibiscus, Papaver somniferum, Illicium oligandrum, Citrus limon, Acorus calamus, Cannabis sativa 및 Coffea arabica를 포함한 13가지 약용 식물의 총 1,355개의 검토된 서열(예측 데이터 세트)에 RF 및 KNN을 적용합니다.
    참고: 이 단백질은 Citrus sinensis, Mentha, 백리향과 같은 다양한 기능과 관련이 있으며 소화 불량을 돕습니다. Vitis vinifera, Jasmine, Hibiscus 는 항산화제의 매우 풍부한 공급원이며 피부 건강도 개선합니다. Illicium oligandrum 은 항진균 및 항균 특성 등으로 알려져 있습니다.

7. 약용 식물에서 긍정적으로 예측된 3D 도메인 교환 단백질의 농축 조사

  1. UniProt의 데이터를 사용하여 이러한 단백질 서열의 가입 코드를 2차 대사 산물 범주에 매핑합니다.
  2. 예측된 서열에서 유전자 ID를 추출합니다.
  3. KEGG 온라인 웹서버(41 (https://www.genome.jp/kegg/)를 열어 개별 유전자 ID 또는 단백질 이름을 붙여넣어 각각의 경로를 확인하여 KEGG 경로 농축 분석을 수행합니다.
  4. 예측된 3D 도메인 스와핑 단백질을 예측 데이터 세트와 대조하여 비교 분석을 수행하여 특정 유전자 온톨로지(GO) 용어 및 생물학적 경로의 통계적으로 유의미한 과대 표현을 감지합니다. 예측된 서열의 유전자 ID를 ShinyGO v0.742 (https://bioinformatics.sdstate.edu/go74/)에 붙여넣고 원하는 기능 또는 경로 범주(생물학적 기능, 세포 성분, 분자 기능, KEGG 등)를 선택합니다.
    참고: 사용자가 파이썬 코드를 작성하고 실행할 수 있도록 하는 온라인 클라우드 기반 플랫폼(43 )을 사용하여 이러한 주석을 시각화한다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

3D 도메인 스와핑을 나타내는 단백질은 종종 다양한 생물학적 기능과 연결되어 있습니다. 그러나 3D 도메인 스와핑에 관여한 단백질 서열에 대한 체계적인 게놈 전체 분석은 대부분 탐구되지 않은 상태로 남아 있습니다. 본 연구에서는 13종의 약용 식물에서 3D 도메인 교환 단백질을 2차 대사산물 도메인, KEGG 경로 및 유전자 온톨로지(GO) 용어와의 연관성에 초점을 맞춰 추정 예측하기 위한 초기 조사를 수행했습니다. 접근 가능한 문헌에 대한 포괄적인 분석과 응용 기계 학습 모델의 성능 평가는 K-KNN(Nearest Neighbors)과 비교하여 제안된 모델인 RF(Random Forest)가 3D 도메인 스왑 범주를 예측하는 데 우수한 결과를 보여주는 것을 나타냅니다. 그림 4A에서 높은 AUC는 AUROC 분석의 우수한 성능을 나타냅니다. RF(AUC=-0.914) 모델은 3D-DS와 3D-NDS 클래스를 구별하는 강력한 능력을 보여줍니다. KNN 모델의 AUC 값(AUC...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

전체 게놈에 걸쳐 단백질의 3D 도메인 스와핑에 대한 이해는 다양한 분야에서 매우 중요합니다. 기계 학습 접근 방식, 특히 랜덤 포레스트 및 K-최근접 이웃26,27은 게놈 수준에서 단백질 서열 데이터로부터 직접 3D 도메인 스와핑을 예측하는 데 사용되었습니다. 이 두 ML 모델에는 데이터 세트 수집, 기능 선택, 데이터 전/후 처리, 맞춤형 모델 스크립트 구현 및 모델 평가와 같은 다양한 단계가 포함됩니다. RF 및 KNN 모델은 각각 91.6%와 88.7%의 정확도를 보여줍니다. 이러한 예측 모델은 이후 13종의 약용 식물 종의 다양한 완전한 게놈에 적용되었습니다.

우리가 아는 한, 이것은 ML 기술을 활용하여 약용 식물의 게놈 규모에서 3D 도메인 스와핑 사례를 조사하려는 최초의 포괄적인 노력입니다. SVM보다...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자는 이 논문에 보고된 작업에 영향을 미칠 수 있는 알려진 경쟁 재정적 이해관계나 개인적 관계가 없음을 선언합니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구에 대한 자금은 받지 못했습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
3DSwap+https://caps.ncbs.res.in/3Dswapplus/index.html 
PfamEMBL-EBIhttp://pfam.xfam.org/: 
HMMEREMBL-EBI;
Aaindexhttps://www.genome.jp/aaindex/:
다이얼Bioinformaticshome.comhttps://bioinformaticshome.com/db/tool/DIAL: 
WEKA웨카토https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/
  KEGGhttps://www.genome.jp/kegg/ :
ShinyGOhttps://bioinformatics.sdstate.edu/go/ :
uniprotUniprothttps://www.uniprot.org/ :
https://www.ebi.ac.uk/Tools/hmmer/:   대학교

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Radivojac, P., et al. A large-scale evaluation of computational protein function prediction. Nat Methods. 10 (3), 221-227 (2013).
  2. Bennett, M. J., et al. 3D domain swapping: a mechanism for oligomer assembly. Protein Sci. 4, 2455-2468 (1995).
  3. Bennett, M. J., et al. Domain swapping: entangling alliances between proteins. Proc Natl Acad Sci U S A. 91, 3127-3131 (1994).
  4. Liu, Y., et al. The crystal structure of a 3D domain-swapped dimer of RNase A at a 2.1-Å resolution. Proc Natl Acad Sci U S A. 95 (7), 3437-3442 (1998).
  5. Straub, J. E., et al. Principles governing oligomer formation in amyloidogenic peptides. Curr Opin Struct Biol. 20, 187-195 (2010).
  6. Upadhyay, A. K., et al. Genome-wide prediction and analysis of 3D domain-swapped proteins in the human genome from sequence information. PLoS One. 11 (7), e0159627(2016).
  7. Liu, Y., et al. 3D domain swapping: as domains continue to swap. Protein Sci. 11, 1285-1299 (2002).
  8. Schlunegger, M. P., et al. Oligomer formation by 3D domain swapping: a model for protein assembly and misassembly. Adv Protein Chem. 50, 61-122 (1997).
  9. Rousseau, F., et al. Implications of 3D domain swapping for protein folding, misfolding and function. Adv Exp Med Biol. 747, 137-152 (2012).
  10. Anderson, W. F., et al. Structure of the Cro repressor from bacteriophage λ and its interaction with DNA. Nature. 290 (5809), 754-758 (1981).
  11. Albright, R. A., et al. High-resolution structure of an engineered Cro monomer shows changes in conformation relative to the native dimer. Biochemistry. 35, 735-742 (1996).
  12. Bax, B., et al. X-ray analysis of beta B2-crystallin and evolution of oligomeric lens proteins. Nature. 347, 776-780 (1990).
  13. Parge, H. E., et al. Human CksHs2 atomic structure: A role for its hexameric assembly in cell cycle control. Science. 262, 387-395 (1993).
  14. Fita, I., et al. The NADPH binding site on beef liver catalase. Proc Natl Acad Sci U S A. 82 (6), 1604-1608 (1985).
  15. Milburn, M. V., et al. A novel dimer configuration revealed by the crystal structure at 2.4 Å resolution of human interleukin-5. J Biol Chem. 268, 2117-2120 (1993).
  16. Upadhyay, A. K., et al. Genome-wide analysis of domain-swap predicted products in the genome of anti-stress medicinal plant: Ocimum tenuiflorum. Bioinformat Biol Insights. 13, 1177932218821362(2019).
  17. Simpson, G. A., et al. Crystal structure and interconversion of monomers and domain-swapped dimers of the walnut tree phytocystatin. Biochim Biophys Acta Prot Proteom. 1872 (2), 140975(2024).
  18. Tran, L. H., et al. 3D domain swapping dimerization of the receiver domain of cytokinin receptor CRE1 from Arabidopsis thaliana and Medicago truncatula. Front Plant Sci. 24 (12), 756341(2021).
  19. Shameer, K., et al. Insights into protein sequence and structure-derived features mediating 3D domain swapping mechanism using support vector machine-based approach. J Bioinform Comput Biol. 4, 33-42 (2010).
  20. Shameer, K., et al. 3dswap-pred: prediction of 3D domain swapping from protein sequence using Random Forest approach. Protein Pept Lett. 19, 1010-1020 (2012).
  21. Tasnim, F. Protein sequence classification through deep learning and encoding strategies. Proc Comp Sci. 238, 876-881 (2024).
  22. Xu, Y., et al. Deep dive into machine learning models for protein engineering. J Chem Info Modeling. 60 (6), 2773-2790 (2020).
  23. Lilhore, U. K., et al. Optimizing protein sequence classification: integrating deep learning models with Bayesian optimization for enhanced biological analysis. BMC Med Inform Decis Mak. 24, 236(2024).
  24. Jumper, J., et al. Highly accurate protein structure prediction with AlphaFold. Nature. 596 (7873), 583-589 (2021).
  25. Du, Z., et al. The trRosetta server for fast and accurate protein structure prediction. Nat Protoc. 16 (12), 5634-5651 (2021).
  26. Genuer, R., et al. Random forests: Some methodological insights. arXiv. , (2008).
  27. Guo, G., et al. KNN model-based approach in classification. Lect Notes Comput Sci. 2888, 986-996 (2003).
  28. Kathuria, C., et al. Predicting the protein structure using random forest approach. Procedia Comput Sci. 132, 1654-1662 (2018).
  29. Gui, Y., et al. Application of K-nearest neighbors in protein-protein interaction prediction. Highlights Sci Eng Technol. 2, 125-131 (2022).
  30. Joseph, A. P., Shingate, P., Upadhyay, A. K., Sowdhamini, R. 3PFDB+: improved search protocol and update for the identification of representatives of protein sequence domain families. Database. 2014, bau026(2014).
  31. Finn, R. D., et al. The Pfam protein families database. Nucl Acids Res. 41, D211-D222 (2013).
  32. Mistry, J., et al. Challenges in homology search: HMMER3 and convergent evolution of coiled-coil regions. Nucl Acid Res. 41, e121(2013).
  33. Apweiler, A. UniProt: The universal protein knowledgebase. Nucl Acids Res. 46 (5), 2699-2699 (2018).
  34. Kawashima, S., et al. AAindex: amino acid index database, progress report 2008. Nucl Acids Res. 36, D202-D205 (2008).
  35. Frank, E., et al. Data mining in bioinformatics using WEKA. Bioinformatics. 20, 2479-2481 (2004).
  36. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  37. Wu, C., et al. Prediction of DNA methylation site status based on fusion deep learning algorithm. IEEE AEMCSE Proc. 5, 180-183 (2022).
  38. Wilhelm, T., et al. Phenotype prediction based on genome-wide DNA methylation data. BMC Bioinform. 15, 1-15 (2014).
  39. Uddin, S., et al. Dataset meta-level and statistical features affect machine learning performance. Sci Rep. 14 (1), 1F670(2024).
  40. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  41. Kanehisa, M., et al. Kyoto encyclopedia of genes and genomes. Nucl Acid Res. 28 (1), 27-30 (2000).
  42. Ge, S. X., et al. ShinyGO: a graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  43. Bisong, E. Google Colaboratory. Building Machine Learning and Deep Learning Models on Google Cloud Platform. , Apress. Berkeley, CA. (2019).
  44. Kirby, G. W. Biosynthesis of the morphine alkaloids. Science. 155 (3759), 170-173 (1967).
  45. Toffolatti, S. L., et al. Role of terpenes in plant defence to biotic stress. Biocont Agents Sec Metabol. , 401-417 (2021).
  46. Boncan, D. A. T., et al. Terpenes and terpenoids in plants: interactions with environment and insects. Int J Mol Sci. 21 (19), 7382(2020).
  47. Mansouri, H., et al. The response of terpenoids to exogenous gibberellic acid in Cannabis sativa L. at vegetative stage. Acta Physiol. Plant.33, 1085-1091 (2011).
  48. Pál, M., et al. Speculation: Polyamines are important in abiotic stress signalling. Plant Sci. 237, 16-23 (2015).
  49. Mattoo, A. K., et al. Higher polyamines restore and enhance metabolic memory in ripening fruit. Plant Sci. 174 (4), 386-393 (2008).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

3DKKEGG
동영상 곧 제공

관련 논문