이 연구는 다양한 약용 식물 게놈에서 3D 도메인 스와핑에 관여하거나 관여할 것으로 예상되는 단백질을 조사합니다. 기계 학습 모델을 사용하여 3D 도메인 교환 단백질을 정확하게 예측하고 그 기능과 2차 대사산물 생산과의 관련성을 예측합니다.
방법 논문
이 연구는 다양한 약용 식물 게놈에서 3D 도메인 스와핑에 관여하거나 관여할 것으로 예상되는 단백질을 조사합니다. 기계 학습 모델을 사용하여 3D 도메인 교환 단백질을 정확하게 예측하고 그 기능과 2차 대사산물 생산과의 관련성을 예측합니다.
3D 도메인 스와핑은 2개 이상의 단백질 서브유닛이 동일한 구조 서브유닛을 교환하여 올리고머를 형성하는 단백질 구조 현상입니다. 3D 도메인 스와핑을 나타내는 단백질은 2차 대사산물 생합성과 같은 다양한 생물학적 기능과 약용 식물의 여러 생물학적 및 비생물적 스트레스에 대처하는 데 중요한 역할을 합니다. 본 연구는 랜덤 포레스트와 K-최근접 이웃 분류기 모델을 사용하여 약용 식물의 게놈 간 3D 도메인 스와핑 패턴을 예측하는 능력을 조사하여 각각 91.6%와 88.7%의 정확도를 입증했습니다. 총 420개(31%)의 서열이 3D 도메인 스와핑에 관여하는 것으로 추정되는 것으로 예측되었습니다. 또한 GO(Gene Ontology) 용어, KEGG(Kyoto Encyclopedia of Genes and Genomes) 경로 분석 및 2차 대사산물 생합성 경로에서의 도메인 분포를 기반으로 기능 주석을 위해 다양한 약용 식물에서 예측된 3D 도메인 교환 단백질 서열에 대한 농축 조사가 수행되었습니다. 예측된 서열의 기능적 주석은 3D 도메인 스왑 서열이 광계 II 및 전자 수송체의 광합성 전자 전달, 광합성 활성의 순환 전자 전달 경로 내에서 전자를 전달하고, 산화적 인산화 및 2차 대사산물(테르페노이드, 알칼로이드 및 폴리아민). 이러한 발견은 3D 도메인 교환 현상에 단백질의 관여, 각각의 기능, 약물 발견 및 생명공학 이니셔티브를 촉진할 수 있는 잠재력을 예측하는 기계 학습의 능력을 강조합니다.
계산 방법은 단백질 구조, 기능 및 상호 작용에 대한 상세한 분석 및 예측을 가능하게 함으로써 단백질 연구에 혁명을 일으켰습니다. 단백질 기능의 정확한 식별과 주석은 생명의 분자 메커니즘을 밝히는 데 필수적이며 의학 및 약물 개발의 발전에 매우 중요합니다. 그러나 실험 방법의 고유한 복잡성과 비용으로 인해 대규모 시퀀스 데이터를 수용할 수 있는 확장성이 제한됩니다. 그 결과, 단백질 기능 예측을 위한 계산 방법의 개발은 혁신적인 대규모 접근 방식을 통해 이러한 격차를 해소하는 계산 및 분자 생물학의 중추적인 영역으로 부상했습니다1.
3D 도메인 스와핑2 는 공유 구조의 세그먼트가 개별 사슬 간에 교환되는 단백질의 구조적 현상입니다. 1994년에 3D 도메인 스와핑의 메커니즘에 대한 입문 문서가 디프테리아 독소 이량체3에서 발견되었습니다. 그러나 3D 도메인 스와핑의 기본 원칙은 40년 전으로 거슬러 올라갑니다. 소 췌장 리보뉴클레아제 A(RNase A)는 정교한 화학적 변형 실험을 통해 아세트산에서 동결건조하는 동안 이량체를 형성하는 것으로 관찰되었습니다4. 단백질 올리고머화에서 두 개 이상의 단백질 사슬은 유연한 힌지 영역을 통해 동일한 구조 요소를 교환합니다. 단량체 서브유닛 사이에서 교환되는 단백질의 부분을 스왑 도메인이라고 하며, 이는 특정 단백질의 전체 구형 도메인, 루프 또는 2차 구조 요소로 구성될 수 있습니다. 반대로, 단량체 내에서 원래 위치에서 변하지 않은 상태로 남아 있는 영역을 스왑되지 않은 도메인이라고 합니다5. 스왑되지 않은 도메인 간의 결합은 그림 1에 표시된 NSDI(Non-swapped domain interface)로 정의됩니다. 3D 도메인 스와핑에서 한 단백질 서브유닛의 스왑되지 않은 도메인과 다른 서브유닛의 이미 스왑된 도메인 사이의 관계를 스왑 도메인 인터페이스(SDI)라고 합니다. 이 현상의 또 다른 중요한 측면은 스왑되지 않은 도메인과 스왑된 도메인을 연결하는 유연한 링커 세그먼트인 힌지 영역입니다. 이 힌지 영역은 3D 도메인 스와핑의 이동을 돕는 데 필수적인 기능을 수행하며 구조적 스위치 역할을 하여 도메인 스와핑이 발생하는 데 필요한 구조적 재구성을 가능하게 합니다. 3D 도메인 스와핑은 단백질 조립 및 기능적 조절을 포함한 다양한 생물학적 과정과 관련이 있습니다5. 또한 비정상적인 교환으로 인해 응집체나 아밀로이드 원섬유가 형성될 수 있는 특정 단백질 잘못 접힘 질환과도 관련이 있습니다.

그림 1: 3D 도메인 스와핑의 구조적 표현. 이 표현은 유연한 힌지 영역을 통해 두 단백질 단량체 사이의 동일한 구조 요소의 교환을 보여주며, 그 결과 도메인 교환 이량체 또는 올리고머 어셈블리가 형성됩니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
다양한 유형의 3D 도메인 스와핑이 스왑된 도메인의 특성과 결과적인 올리고머 구조(6)에 기초하여 확인되었습니다. 2002년에 Eisenberg와 그들의 동료는 BDS(Bonafide domain swapping), QDS(quasi-domain swapping) 및 3D 도메인 스와핑(CDS) 후보의 세 가지 유형의 3D 도메인 스와핑을 확인했습니다7. 가장 일반적인 단백질 종류는 선의의 도메인 스와핑입니다. 이는 이량체와 단량체 분자가 모두 안정적인 형태로 존재하는 상태를 말하며, 이량체는 도메인 스왑 구성을 채택하고 단량체는 폐쇄 구성을 채택해야 합니다. 준 도메인 스와핑에서 단백질은 올리고머 상태로 존재하는 것으로 알려져 있지만, 그 상동 구조는 단량체 상태로 존재하는 것으로 알려져 있습니다. CDS에서는 도메인 교환 범주에 따른 단백질 분류만 확인하는 반면, 관련 단량체 또는 이들의 단량체 상동체의 구조 정보는 존재하지 않습니다8. 이 절차에서는 단량체 또는 이들의 단량체 상동체가 없습니다. 오히려 이종 단백질 분자가 존재합니다. 표 1은 이 세 가지 범주의 예를보여줍니다 9.
표 1: 예와 함께 3D 도메인 스와핑 유형. 이 표를 다운로드하려면 여기를 클릭하십시오.
후속 연구를 통해 수많은 도메인 스왑 구조가 밝혀져 3D 도메인 스와핑 개념을 이해할 수 있는 길을 열었습니다. 이 현상을 뒷받침하는 최초의 구조적 증거는 C-말단 가닥의 교환을 통해 이량체 구조를 형성하는 박테리오파지 λ의 Cro 억제 단백질 분자에서 관찰되었습니다. 1996년 연구원은 단량체 Cro 분자가 3D 도메인 스와핑에 관여한다는 것을 발견했습니다10. βB2-크리스탈린(12), 인간 CksHs213, 쇠고기 간 카탈라아제14 및 재조합 인간 인터루킨-5(15)과 같은 다른 구조(11)도 가능한 3D 도메인 스왑 구조로 보고되었다. 단백질 분자 내에서 스왑된 도메인 위치에 따라 3D 도메인 스와핑은 C-말단 도메인 스와핑, N-말단 도메인 스와핑 및 비교적 드문 중앙 도메인 스와핑의 세 가지 유형으로 분류됩니다. 저자는 완전한 인간 게놈을 사용하여 도메인 교환 사례를 예측합니다. 그들은 Random Forest와 Support Vector Machine을 각각 81.7%와 73.9%의 정확도로 이진 분류기로 사용합니다. 단백질 서열의 거의 44%가 인간 게놈6에서 3D 도메인 교환으로 예측되었습니다. GO(Gene Ontology)를 기반으로 도메인 분포, 질병 분포 및 기능적 주석에 대한 예측 사례에 대해 농축 분석을 수행했습니다. 또 다른 접근 방식은 랜덤 포레스트 접근 방식을 사용하여 Ocimum tenuiforum의 완전한 게놈 전체 분석을 조사하고 Ocimum tenuiforum의 단백질 서열의 거의 25%가 3D 도메인 교환에 관여할 것으로 예상된다는 것을 발견했습니다. 연구자들은 또한 GO 용어 연관성과 단백질 도메인 패밀리 연관을 사용하여 기능적 주석을 수행했으며 1158개의 서열만이 비생물적 스트레스에 관여한다는 것을 발견했습니다16.
식물은 3D 도메인 스와핑을 포함하여 구조적 재배열을 겪을 수 있는 능력을 가진 것으로 인식되는 특정 단백질과 함께 다양한 독특한 단백질 계열을 보여줍니다. 3D 도메인 스와핑은 2차 대사산물 또는 여러 약리학적 응용을 보유하는 기타 생물학적으로 관련된 경로의 생성과 함께 생물학적 및 비생물적 스트레스 조건에 영향을 미칠 수 있습니다. 따라서 그들은 이 조사에 중요한 초점을 제공합니다. Wal1의 결정 구조는 비대칭 단위 내에 두 개의 이량체와 시스타틴 C에서 발견되는 구조적 재배열을 특징으로 하는 도메인 교환 이량체 구성을 보여주었습니다. 피토시스타틴은 비생물적 스트레스에서 중요한 역할을 하며 작물 저항성도 향상시킵니다. 총 20,121개의 3D 도메인 스왑 예측 단백질이 이용 가능한 문헌 및 다양한 관련 저장소에서 확인되었으며, 그 중 17,552개는 식물 기원이고 2569개는 비식물 유기체에서 유래합니다17,18.
문헌에서는 기계 학습 접근 방식을 사용하여 다양한 식물의 3D 도메인 스와핑 예측에 대한 다양한 다른 예가 보고되었습니다. 예를 들어 Arabidopsis thaliana 는 33.7%(검토된 12,033개의 서열 중 4058개), Medicago truncatula 20.9%(검토된 186개 서열 중 39개), Solanum tuberosum 36.5%(검토된 400개 서열 중 146개), Solanum lycopersicum 25.5%(검토된 423개 서열 중 108개), Ocimum tenuiforum 15.5%(검토된 36841개 서열 중 5706개)6. 계산 방법은 3D 도메인 교환 단백질의 구조적, 기능적 측면을 탐구하는 데 매우 중요해졌습니다. 이러한 접근법은 가능한 최상의 특징19, 주석 및 농축 분석을 기반으로 서열의 예측을 용이하게 하여 기본 분자 메커니즘에 대한 통찰력을 제공합니다. 다양한 단백질 서열에서 3D 도메인 스와핑의 예측은 SVM(Support Vector Machine) 기반 분류기를 사용하여 수행되었습니다. 이 접근법은 서열 및 구조적 특징을 통합하여 개발되었으며, 훈련 데이터 세트에서 76.33%, 테스트 데이터 세트에서 73.81%의 예측 정확도를 산출했으며, 이는 단백질의 도메인 스와핑 경향을 식별하는 데 있어 잠재력을 나타냅니다20. SVM 대신 KNN을 선택하는 주된 이유는 KNN의 교육 프로세스가 훨씬 간단하기 때문입니다. 설정하려면 하나의 기본 매개변수인 K(예측을 할 때 고려되는 최근접 이웃의 수)만 있으면 되는 반면, SVM은 커널 유형, C 및 감마와 같은 여러 매개변수를 신중하게 조정해야 합니다. 또한 KNN은 다중 클래스 분류를 보다 쉽게 처리하는 반면 SVM은 일반적으로 일대일 전략과 같은 더 복잡한 전략이 필요합니다.
단백질 구조 예측을 위한 기계 학습
단백질 구조의 예측에는 FASTA 서열에서 단백질의 3차원 모양을 추론하는 것이 포함됩니다. 이 분야의 최근 발전은 진화 데이터에 대한 다양한 기계 학습 기술의 적용에 의해 크게 주도되었습니다21,22. 공진화 데이터에서 정보를 추출하기 위한 초기 접근 방식은 기계 학습 방법에 의존했습니다. 그러나 보다 최근의 전략, 특히 심층 잔류 네트워크를 활용하는 전략은 잠재적 표적을 예측하는 데 탁월한 성능을 보여주었습니다23. Alphafold는 딥 러닝 기반 데이터베이스인 반면 Rosetta는 물리 기반 에너지 함수 도구입니다. 이러한 도구는 실험 구조에 근사화할 수 있는 전체 3D 원자 구조를 예측하는 데 사용됩니다. 원자 분해능 구조 좌표만 제공하지만 이러한 도구는 3D 도메인 스와핑 이벤트를 지정하지 않습니다. 대조적으로, 제안된 접근법은 완전한 3D 구조 예측 변수가 아니라 단백질이 3D 도메인 스와핑을 겪을 가능성이 있는지 여부를 예측할 뿐입니다24,25.
약용 식물은 생리 활성 화합물로 인해 다양한 질병의 예방 및 치료를 위한 천연 자원으로 수세기 동안 활용되어 왔습니다. 이는 전통 의학에 필수적이며 현대 의약품 개발에 기여합니다. 그러나 신약 발견을 위한 약용 식물의 단백질 도메인 스와핑 분야에서는 중요한 작업이 수행되지 않았습니다. 머신 러닝 및 앙상블 모델을 포함한 알고리즘은 시퀀스 데이터의 패턴과 관계를 인식하여 3D 도메인 스와핑을 예측합니다. 이 연구를 위해 약용 식물을 선택한 이유는 3D 도메인 스와핑에 관여하는 식물에서 단백질의 기능적 다양성을 감지하여 스트레스 반응, 병원체 방어 및 대사 생합성을 이해할 수 있기 때문입니다. NMR 또는 결정학 기술을 활용하여 대량의 단백질 3D 도메인 스와핑과 복잡하고 고급 올리고머 형태를 결정하는 것과 관련된 기술적 과제는 고급 계산 접근 방식 개발의 필요성을 강조합니다.
제안된 연구 작업의 전반적인 목표는 단백질 서열 구조 예측 작업을 위해 랜덤 포레스트(RF)26 및 K-최근접 이웃(KNN)27 알고리즘을 사용하여 계산 방법론을 사용하고 다양한 약용 식물 서열에서 교체된 사례에 대한 완전한 게놈 전체 분석을 수행하는 것입니다. RF(Random Forest)는 이진 분류기입니다. 이는 단백질 서열 분석에 널리 사용되는 강력하고 다재다능한 기계 학습 알고리즘입니다. 이는 의사 결정 트리(DT) 앙상블을 구성하여 작동하며 훈련 및 테스트 데이터 세트 모두에서 상당히 높은 정확도를 달성합니다. 단백질 서열 작업의 경우, RF는 물리화학적 특성, 서열 구성, 2차 구조, 서열 정렬 또는 프로파일에서 파생된 진화 정보 등 다양한 특징을 분석할 수 있습니다. 크고 시끄러운 데이터 세트를 처리하는 데 탁월하며 기능 중요도 메트릭을 제공합니다 28. K-최근접 이웃(KNN) 분류기는 단백질 서열 분석에 널리 적용되는 간단하면서도 효과적인 기계 학습 알고리즘입니다. 이는 기능 공간에서 가장 가까운 이웃 k개의 대다수 클래스를 기반으로 입력 시퀀스를 분류하는 방식으로 작동합니다. 단백질 서열 분석에서 KNN은 기능 범주, 구조적 특성 및 세포 내 국소화를 예측하는 데 사용할 수 있습니다. KNN 분류의 특징에는 종종 아미노산 구성, 서열 모티프, 진화 프로필 또는 물리화학적 속성이 포함됩니다. KNN은 단순성 때문에 단백질 분석에 널리 사용됩니다. 해석 가능성과 효율성으로 인해 단백질 서열 분석을 위한 귀중한 도구가 됩니다29. 이러한 알고리즘은 함께 보완적인 강점을 제공하여 다양한 약용 식물 서열에서 3D 도메인 스와핑 연구를 위한 포괄적인 계산 프레임워크를 가능하게 합니다. 이 두 모델은 도메인 교환을 겪을 수 있는 가능한 사례만 예측합니다. 전체 3D 구조 좌표나 이 교환 과정에 특히 어떤 부분이나 잔류물이 관여하는지 예측하지 않습니다. 3D 도메인 스와핑의 메커니즘 및 기능적 측면을 명확히 하기 위해 스와핑에 관여하는 특정 영역 또는 잔기를 식별하는 것은 events.3D 도메인 스와핑은 폐쇄 루프 구성, 개방형 스왑 및 서로 다른 힌지 영역 및 도메인 아키텍처를 포함하는 기타 차이점과 같은 구조적으로 구별되는 다양한 현상으로 구성되기 때문에 추가 연구의 문제입니다. 이에 비추어 제안된 접근 방식은 모든 종류의 3D 도메인 스와핑 이벤트만 통합 분류로 분류합니다. 이 선택은 처음에 특정 클래스의 3D 도메인 스와핑을 지정할 수 있는 주석이 달린 데이터의 제한된 가용성에 의해 주도되었습니다. 이것은 다양한 약용 식물 기반 데이터 세트에 대한 첫 번째 종류의 시도이며, 서로 다른 스와핑 메커니즘을 구별하면 모델의 예측 정확도를 향상시킬 수 있다고 생각합니다.
약용 식물의 농축 분석은 생리 활성 화합물 합성 및 스트레스 반응에 관여하는 주요 유전자, 단백질 및 경로를 식별하는 데 도움이 됩니다. 분자 메커니즘에 대한 통찰력을 제공합니다. 약용 식물에 대한 이러한 분석은 생리 활성 화학 물질의 합성, 스트레스 회복력 및 질병 저항성과 관련된 필수 유전자, 단백질 및 생물학적 과정을 조사합니다. 유전자 온톨로지(GO) 및 KEGG 경로 분석과 같은 선택된 단백질의 기능적 주석은 2차 대사산물 생산 및 환경 스트레스 반응의 기초가 되는 분자 메커니즘을 밝힙니다. 이 접근 방식은 약물 발견에 실질적으로 도움이 되고, 작물 회복력을 향상시키며, 지속 가능한 농업 및 의약 발전을 위한 식물 대사 경로를 밝힙니다.
연구의 새로운 기여
이 연구는 생물학적 데이터 세트에서 단백질 구조 패턴을 예측하기 위해 보다 정확하고 효율적인 모델을 촉진하는 기계 학습의 기능을 강조합니다.
이 연구는 새로운 기능을 기계 학습 알고리즘에 통합하여 단백질 기능을 더욱 명확하게 예측하는 능력을 향상시킵니다. 이러한 기능은 단백질의 구조-기능 관계에 대한 향상된 이해를 제공하여 단백질 공학에서 보다 정확한 단백질 설계 및 최적화를 돕습니다.
예측된 단백질의 농축 분석은 바이오마커 발견, 약물 설계 및 질병 메커니즘 이해에 귀중한 표적을 제공하는 주요 생물학적 경로, 세포 과정 및 분자 기능을 찾는 데 도움이 됩니다. 이 분석은 경로 기반 개입 및 치료 표적 식별의 정확성을 향상시킵니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
참고: 이 세그먼트는 (a) 데이터 수집, (b) 기능 선택, (c) 데이터 전처리, (d) 데이터 후처리 (e) 모델 개발 (f) 제안된 모델의 결과 평가 및 (g) 긍정적으로 예측된 시퀀스의 다양한 수준에서 농축 분석의 6가지 기본 단계를 포함하는 제안된 방법론의 포괄적인 개요를 제공합니다. Core i5-10500은 이 연구 작업에 사용된 10세대 프로세서입니다. 6개의 코어와 12개의 스레드가 있으며 기본 주파수는 3.10GHz이고 최대 터보 속도는 4.50GHz입니다. 12MB의 Intel Smart Cache가 장착되어 DDR4-2666 메모리를 지원하며 통합 비주얼을 위한 UHD Graphics 630이 포함되어 있습니다. 효율적인 멀티태스킹과 생산성을 위해 제작된 이 제품은 LGA 1200 소켓과 호환되며 65W TDP에서 작동합니다.
1. 데이터 수집
2. 모델 생성을 위한 기능 사용
표 2: 설명과 함께 새로 추가된 기능 목록. 이 표는 3D 도메인 스와핑을 예측할 때 모델 성능을 향상시키기 위해 특징 추출 단계에서 설계된 새로운 특징을 요약한 것입니다. 각 기능은 도메인 교환 성향에 영향을 미치는 것으로 가정된 단백질의 특정 서열 기반, 물리화학적 또는 구조적 특성을 포착합니다. 각 특징의 생물학적 관련성과 계산적 도출을 명확히 하기 위해 자세한 설명이 제공됩니다. 이 표를 다운로드하려면 여기를 클릭하십시오.
3. 데이터 전처리 및 사후 처리
참고: 데이터 전처리. 데이터 전처리는 분석을 위해 원시 데이터를 준비하는 기계 학습의 필수 단계입니다. 여기에는 데이터 정리(예: 중복 제거, 누락된 값 처리 등)가 포함됩니다.
4. 모델 생성 및 구현

그림 2: 예시적 회로도 표현. 이 표현은 랜덤 포레스트 및 K-최근접 이웃(KNN) 기계 학습 모델을 보여주며, 이진 분류 작업의 맥락에서 알고리즘 구조와 기능적 워크플로를 보여줍니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 3: 기계 학습 기반 워크플로. 이 다이어그램은 약용 식물 단백질의 3D 도메인 스와핑을 예측하기 위한 기계 학습 기반 워크플로를 보여줍니다. 이 프로세스는 벤치마크 데이터 세트와 메타 데이터 세트를 결합한 데이터 세트 획득으로 시작됩니다. 특징 추출에는 단백질 서열에서 기존 특징과 새로운 특징을 모두 도출하는 것이 포함됩니다. 데이터 세트 전처리에서 FASTA 시퀀스는 시퀀스 구문 분석 및 사전 매핑을 사용하여 숫자 값으로 변환되어 특정 3D 도메인 스왑 기능을 포함한 구조화된 데이터 프레임을 생성합니다. 후처리에는 임계값(β = 0.5)을 사용하여 도메인 스왑 상태 할당, 데이터를 훈련 및 테스트 세트(70-30 비율)로 분할, 기능 표준화, k-fold 검증을 통한 기능 선택 수행이 포함됩니다. RF(Random Forest)와 KNN(K-Nearest Neighbors)이라는 두 가지 기계 학습 모델을 훈련하고 AUROC 및 AUPRC와 함께 모델 메트릭을 사용하여 성능을 평가하여 예측 정확도와 견고성을 평가합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.
5. ML 분류기의 정적 평가 및 모델 평가
(1)
(2)
(3)
(4)
(5)
(6)6. 다양한 약용 식물 종에 대한 3D 도메인 스와핑 예측을 위한 모델 구현
7. 약용 식물에서 긍정적으로 예측된 3D 도메인 교환 단백질의 농축 조사
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
3D 도메인 스와핑을 나타내는 단백질은 종종 다양한 생물학적 기능과 연결되어 있습니다. 그러나 3D 도메인 스와핑에 관여한 단백질 서열에 대한 체계적인 게놈 전체 분석은 대부분 탐구되지 않은 상태로 남아 있습니다. 본 연구에서는 13종의 약용 식물에서 3D 도메인 교환 단백질을 2차 대사산물 도메인, KEGG 경로 및 유전자 온톨로지(GO) 용어와의 연관성에 초점을 맞춰 추정 예측하기 위한 초기 조사를 수행했습니다. 접근 가능한 문헌에 대한 포괄적인 분석과 응용 기계 학습 모델의 성능 평가는 K-KNN(Nearest Neighbors)과 비교하여 제안된 모델인 RF(Random Forest)가 3D 도메인 스왑 범주를 예측하는 데 우수한 결과를 보여주는 것을 나타냅니다. 그림 4A에서 높은 AUC는 AUROC 분석의 우수한 성능을 나타냅니다. RF(AUC=-0.914) 모델은 3D-DS와 3D-NDS 클래스를 구별하는 강력한 능력을 보여줍니다. KNN 모델의 AUC 값(AUC...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
전체 게놈에 걸쳐 단백질의 3D 도메인 스와핑에 대한 이해는 다양한 분야에서 매우 중요합니다. 기계 학습 접근 방식, 특히 랜덤 포레스트 및 K-최근접 이웃26,27은 게놈 수준에서 단백질 서열 데이터로부터 직접 3D 도메인 스와핑을 예측하는 데 사용되었습니다. 이 두 ML 모델에는 데이터 세트 수집, 기능 선택, 데이터 전/후 처리, 맞춤형 모델 스크립트 구현 및 모델 평가와 같은 다양한 단계가 포함됩니다. RF 및 KNN 모델은 각각 91.6%와 88.7%의 정확도를 보여줍니다. 이러한 예측 모델은 이후 13종의 약용 식물 종의 다양한 완전한 게놈에 적용되었습니다.
우리가 아는 한, 이것은 ML 기술을 활용하여 약용 식물의 게놈 규모에서 3D 도메인 스와핑 사례를 조사하려는 최초의 포괄적인 노력입니다. SVM보다...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자는 이 논문에 보고된 작업에 영향을 미칠 수 있는 알려진 경쟁 재정적 이해관계나 개인적 관계가 없음을 선언합니다.
이 연구에 대한 자금은 받지 못했습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 3DSwap+ | https://caps.ncbs.res.in/3Dswapplus/index.html | ||
| Pfam | EMBL-EBI | http://pfam.xfam.org/: | |
| HMMER | EMBL-EBI | ; | |
| Aaindex | https://www.genome.jp/aaindex/: | ||
| 다이얼 | Bioinformaticshome.com | https://bioinformaticshome.com/db/tool/DIAL: | |
| WEKA | 웨카토 | https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/ | |
| KEGG | https://www.genome.jp/kegg/ : | ||
| ShinyGO | https://bioinformatics.sdstate.edu/go/ : | ||
| uniprot | Uniprot | https://www.uniprot.org/ : |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청