리뷰 논문

천연 제품 발견에서의 다중 오믹스 및 통합 분석

1.4K 조회수

DOI:

10.3791/69458

2025년 11월 28일

이 논문에서

요약

본 리뷰는 인공지능, 머신러닝, 네트워크 분석과 통합되어 새로운 천연 산물의 발견과 기능적 검증을 강화하기 위해 대사체학, 유전체학, 전사체학, 단백질체학 등 최첨단 다중 오믹스 방법론을 강조합니다.

초록

천연산물(NP)은 오랫동안 신약 개발을 위한 새로운 생리활성 화합물의 필수 공급원이었습니다; 하지만 이러한 화합물을 선별하고 분리하는 전통적인 방법은 느리고 종종 수익이 줄어드는 경우가 많습니다. 다행히도 첨단 멀티오믹스와 계산 접근법이 이러한 도전에 강력한 해결책을 제공합니다. 본 리뷰는 대사체학, 유전체학, 전사체학, 단백질체학을 생물정보학 및 분석 화학과 통합하여 NP 발견을 가속화하는 혁신적인 방법론을 강조합니다. 예를 들어, 고해상도 액체 크로마토그래피-탠덤 질량분석법(LC-MS/MS)과 글로벌 내추럴 프로덕츠 소셜 (GNPS) 분자 네트워킹과 같은 비표적 대사체학 플랫폼은 신화합물의 포괄적인 프로파일링을 가능하게 하며, 표적 동위원소 표지 전략은 이 과정을 강화합니다. 또한, 항생제 및 2차 대사물 분석 셸(antiSMASH), 딥 생합성 유전자 클러스터(Deep Biosynthetic Gene Cluster, DeepBGC), 파이프라인 for Reconstructing Integrated Syntheses of Metabolites(PRISM)와 같은 유전체 및 메타게놈 마이닝 도구들은 배양된 생물과 비배양 생물 모두에서 생합성 유전자 클러스터(BGC)를 빠르게 식별하며, 종종 이종 발현을 통해 제품을 검증합니다. RNA 시퀀싱(RNA-seq), 공발현 네트워크, 플럭스오믹스를 포함한 전사체 분석은 경로가 어떻게 조절되는지 명확히 하는 데 도움을 주며, 상대적 및 절대 정량화를 위한 탠덤 질량 태그/등압 태그(TMT/iTRAQ)와 라벨 없는 방법, 그리고 세포 열 이동 분석법과 열 단백질체 프로파일링(TPP)과 같은 화학단백질체학 기법을 통해 분자 표적과 그 작용 기전을 밝혀냅니다. 본 리뷰는 또한 인공지능(AI)과 머신러닝(ML)이 다중 오믹스 데이터 통합에서 차지하는 역할에 중점을 두며, 유전자-대사체 상관관계 네트워크 구축부터 지식 그래프 및 그래프 신경망을 활용한 데이터 융합 및 기능 예측에 이르기까지 다양한 활동을 포함합니다. 마지막으로, 이 리뷰는 자연산물 발견을 위한 다중 오믹스의 시너지 효과를 논의하고, 현재의 기술적 과제를 해결하며, 차세대 NP 연구를 위한 고처리량 지능형 데이터 통합을 위한 미래 방향을 탐구하며 마무리합니다.

서론

천연 제품은 미생물과 식물을 포함한 다양한 생물이 생성하는 분자로, 페니실린과 같은 항생제부터 탁솔과 같은 항암제에 이르기까지 오랫동안 중요한 의약품 공급원으로 사용되어 왔습니다. 현재 우리의 항생제와 화학요법제의 상당 부분은 이러한 천연 화합물에서 유래합니다. 그러나 미생물 배양이나 생물분석법 유도 분리 등 새로운 NP를 발견하는 전통적인 방법들은 점점 더 어려워지고 있습니다. 20세기 후반, 기업들이 수익 체감에 직면하면서 제약업계의 NP에 대한 관심이 줄어들었고; 쉽게 발견할 수 있었던 많은 화합물들이 이미 재발견되었고, 이들 화합물을 스크리닝하고 특성화하는 데 수반된 기술적 어려움 때문에 이 과정은 노동 집약적이었습니다. 다행히도 이 추세는 이제 반전되고 있습니다. 최근 오믹스 및 분석 기술의 발전으로 NP 탐색이 활기를 띠고 있습니다 2,3. 예를 들어, 고처리량 DNA 시퀀싱은 연구자들이 숨겨진 생합성 유전자 클러스터(BGC)를 찾기 위해 게놈을 탐구할 수 있게 하며, 초민감 질량분석법(MS)은 복잡한 혼합물 내 소량의 신종 대사산물을 식별할 수 있습니다. 이러한 기술 혁신은 특히 약물 내성 박테리아와 싸울 수 있는 항생제에 대한 전 세계적인 긴급한 수요가 있는 중요한 시기에 도래합니다. 현대 NP 연구는 전통적인 NP 전문성과 최첨단 유전체 및 화학 분석 기법을 통합하여 이 도전에 대응하기 위해 부상하고 있습니다.

다중 오믹스 통합은 현재 생물학 연구 발전의 핵심입니다. "멀티오믹스" 개념은 유기체의 DNA(유전체), mRNA 전사체, 단백질, 대사산물 등 다양한 생물학적 데이터 계층을 동시에 분석하는 것을 포함합니다. 오믹스 접근법의 적용은 NP 연구를 혁신시켰으며, 고처리량 스크리닝, 신규 화합물의 신속한 식별, 그리고 생물학적 시스템을 형성하는 복잡한 네트워크를 심화한 탐구를 가능하게 했습니다. 이러한 다층적 데이터셋을 통합함으로써 연구자들은 유전자를 그들이 암호화하는 대사산물과 직접 연결할 수 있어, NPs 생합성에 대한 보다 포괄적인 이해를 구축할 수 있습니다6. 예를 들어, 유전체 마이닝 알고리즘은 새로운 항생제를 암호화할 수 있는 유전자 클러스터를 정확히 찾아낼 수 있고, 전사체 데이터는 그 유전자가 활발히 발현되고 있는지 여부를 알 수 있습니다. 또한, 대사체 프로파일링을 통해 유기체 배양물추출물 7,8,9 내 대응하는 항생제 분자를 식별할 수 있습니다. 이러한 통합적 접근법은 새로운 화합물의 발견과 그 생합성 경로에 대한 이해를 크게 가속화합니다. 더 중요한 것은, 약물 표적 식별이 점점 더 통합된 다중 오믹스 접근법에 의존하고 있다는 점이며, 이는 점차 전통적인 단일 오믹스 전략을 대체하고 있습니다. 고해상도 액체 크로마토그래피-MS(LC-MS)와 핵자기공명(NMR) 등 최근 분석 화학 발전으로 연구자들은 복잡한 생물학적 샘플에서 새로운 NP를 검출하고 구조적으로 분석할 수 있게 되었습니다11,12. 이러한 기법들은 방대한 양의 데이터를 생성하며, 바로 이 과정에서 생물정보학과 머신러닝(ML)이 필수적입니다. 인공지능(AI) 알고리즘과 네트워크 기반 분석이 점점 더 활용되어 다중 오믹스 데이터를 분석하며, 수동으로 파악하기 어려운 중요한 패턴과 예측을 밝혀내고 있습니다13,14. 최첨단 오믹스 기술과 AI 기반 데이터 마이닝을 결합함으로써, 연구자들은 NP의 발견과 분석을 그 어느 때보다 빠르고 체계적으로 수행할 수 있는 견고한 파이프라인을 구축할 수 있습니다.

다중 오믹스 전략이 NP 발견을 크게 진전시켰지만, 성공적인 구현은 세심한 실험 계획에 크게 의존합니다. 예를 들어, 샘플의 종류와 품질이 매우 중요합니다; 핵산과 대사산물의 분해를 최소화하는 조건에서 잘 보존된 미생물 배양물, 환경 분리물 또는 임상 재료를 수집하는 것이 필수적입니다15. 시퀀싱의 깊이도 데이터 해상도에 중요한 역할을 합니다: 전체 게놈 시퀀싱은 정확한 조립을 위해 최소 30× 이상의 범위가 필요하지만, 전사체 프로파일링은 Genohub16에서 권장하는 저풍부도 전사체를 식별하기 위해 수천만 건의 리드가 필요합니다. 또한, 대사체학에서는 다양한 화학 계열을 포집하기 위해 적절한 추출 용매와 방법이 필요합니다; 편향을 최소화하고 재현성을 극대화하는 추출 프로토콜을 의식적으로 선택해야 합니다17. 하지만 이러한 방법론들은 고유한 도전 과제를 가지고 있습니다. 크고 이질적인 데이터셋을 통합하는 것은 계산 집약적일 수 있으며, 대사산물의 불안정성이나 낮은 풍부도는 이후 분석을 복잡하게 만들 수있습니다. 더불어, 높은 비용이나 제한된 표본 크기로인해 연구 설계가 제한될 수 있습니다. 특히 저투입 또는 희석된 샘플에서 시퀀싱 데이터의 오염과 편향도 상당한 위험을 초래하는데, Lusk 등은 고처리량 시퀀싱에서의 오염과 관련해20. 이러한 실용적·기술적 한계를 인식함으로써 연구자들은 적합한 다중 오믹스 조합에 대해 정보에 입각한 결정을 내리고 그 결과를 신중하게 해석할 수 있습니다.

이 리뷰는 다중 오믹스와 통합 분석을 통해 NP 발견에 혁신을 가져오는 혁신적인 방법들을 강조합니다. 또한 유전자-대사물 상관관계망 구축과 새로운 생리활성 화합물을 생성할 가능성이 있는 유전자 클러스터 식별 등 다양한 데이터 흐름을 연결하는 데 있어 ML과 AI의 중요성 증가를 탐구합니다. 또한 이 통합 접근법의 중요성과 미래 잠재력을 검토합니다. 결론적으로, 다양한 오믹스 기술과 첨단 분석의 결합은 오늘날 새로운 NP 발견을 가속화할 뿐만 아니라 사회가 시급히 필요로 하는 차세대 신약 개발의 길을 열고 있습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

리뷰 및 관점

이 리뷰를 작성하기 위해 우리는 PubMed, Scopus, Web of Science, ScienceDirect, Google Scholar 등 여러 데이터베이스와 색인 플랫폼에서 포괄적인 문헌 검색을 수행했습니다. 검색은 2015년 1월부터 2025년 7월까지의 출판물을 포함했습니다. 키워드와 불리언 조합에는 "천연 제품 발견", "오믹스", "대사체학", "유전체학", "전사체학", "프로테오믹스", "머신러닝", "인공지능", "생합성 유전자 클러스터", "다중 오믹스 통합" 등이 포함되었습니다. 주요 논문과 최근 리뷰의 참고문헌 목록도 검토하여 추가 관련 출판물을 식별하였습니다. 동료 검토 연구 외에도, bioRxivmedRxiv 같은 플랫폼의 제한된 사전 인쇄 논문이 시의적절하고 관련 있는 문헌에 아직 공개되지 않은 통찰을 제공할 때 참고되었습니다. 모든 프리프린트는 투명성을 유지하기 위해 명확하게 라벨이 붙어 있습니다. 이 섹션에서는 대사체학, 유전체학, 전사체학, 단백질체학 등 유역학 기반 NP 발견의 주요 분야에서의 최신 발전과 향후 전망을 검토합니다. 그리고 AI/ ML을 통한 통합도 마찬가지입니다. 이 분야에서 논의되는 주요 도구와 자원은 표 1에 참고용으로 정리되어 있습니다.

1. 비전구 발견에서의 대사체학

  1. 대사체학 분석 플랫폼
    대사체학은 다양한 생물이 생성하는 소분자를 상세히 분석할 수 있게 해주기 때문에 자연 핵(NP)을 발견하는 데 매우 중요합니다. NP의 대사체 특성화에 사용되는 주요 분석 도구로는 LC-MS/MS, 가스 크로마토그래피-MS(GC-MS)와 같은 고해상도 MS 기법과 NMR 분광법21,22가 포함됩니다. 초고성능 LC-MS와 MS/MS를 결합한 비표적 LC-MS/MS 워크플로우는 복잡한 혼합물에서 다양한 대사산물을 식별할 수 있게 하며, GC-MS는 휘발성 화합물 프로파일링에 뛰어납니다. 또한, 직접 주입-탠덤 MS와 MS 영상 같은 새로운 기법들이 NPs의 대사체학 도구 키트를 향상시키고 있습니다23,24. 양이온 및 음의 이온 모드를 결합하거나 다단계 MSn 단편화를 사용하는 다중 모달 MS와 같은 하이픈 방식과 NMR과 결합된 LC-MS 같은 첨단 질량분석법은 검출되는 대사산물에 대한 더 깊은 구조적 통찰을 제공합니다25,26.
  2. 데이터 처리 및 계산 도구
    전문 소프트웨어 도구는 대사체 데이터의 처리 및 해석에서 중요한 역할을 합니다. XCMS, MZmine, OpenMS와 같은 프로그램이 크로마토그래피 특징 또는 피크를 탐지하고 정렬하는 데 일반적으로 사용되며, 피크 정렬, 정규화, 필터링과 같은 세밀한 데이터 전처리 단계가 재현 가능한 대사 프로필을 달성하는 데 필수적입니다27. 화합물 식별은 NIST와 mzCloud를 포함한 MS/MS 스펙트럼 라이브러리뿐만 아니라 SIRIUS, MetFrag28과 같은 실리코 단편화 도구에서 지원됩니다. 글로벌 내추럴 프로이츠 소셜 (GNPS) 플랫폼은 분자 네트워킹의 핵심 자원으로 부상했으며, 이는 관련 MS/MS 스펙트럼을 조직하여 화학 계열을 강조하고 알려진 화합물의 복제 탈을 촉진하는 데 도움을 줍니다29. 예를 들어, 스트렙토마이세스 배양의 LC-MS/MS 데이터를 GNPS로 분석한 결과, 스피라마이신과 악티노마이신과 같은 알려진 항생제와 이전에 보고되지 않은 유사체가 확인되었습니다30,31. 분자 네트워킹 기법은 관련 미지의 스펙트럼을 효과적으로 그룹화했으며, 이온 동일성 네트워킹의 추가로 특징 간 연결성을 향상시켰습니다. 이러한 네트워크 기반 분석은 주성분 분석, 직교 부분 최소제곱 판별 분석, 상관관계 분석 등 다변량 통계 도구와 결합될 경우, 대사물 생성 패턴을 특정 생물학적 또는 환경 조건과 연결할 수 있습니다. 한 연구에서는 식물과 연관된 스트렙토마이세스에서 추출한 발효 추출물을 GNPS 분자 네트워킹으로 분석한 결과, 사용되는 성장 매개체에 따라 달라지는 독특한 대사물 프로필이 나타났습니다. 스피라마이신, 악티노마이신, 그리고 링비아톡신이라는 발암성 화합물을 포함한 알려진 대사산물이 검출되었다; 그러나 많은 네트워크 노드가 스펙트럼 데이터베이스32의 어떤 항목도 일치하지 않았습니다. 이 발견은 진정으로 새로운 대사산물의 존재를 시사하며, GNPS와 함께 비표적 대사체학이 잠재적으로 새로운 NP를 식별하여 추가 탐구를 가능하게 함을 강조합니다.
    대사체 스크리닝과 기능적 바이오아세이를 결합하면 생리활성 화합물을 생성하는 균주나 추출물을 신속히 우선순위 지정할 수 있습니다. 또한, 자연산물 지도(NPAtlas)와 같은 신흥 지역사회 자원과 통합 대사체-유전체 분석 파이프라인은 원천 생물체에서 검출된 대사산물과 BGC를 연관시키는 데 중요한 역할을 합니다33,34. 이 통합 전략은 연구자들이 대사물 신호를 유전체 데이터와 연관시켜 NP를 식별하고 그 기원을 추적하는 효율성을 높여줍니다.

2. NP 발견에서의 유전체학

지난 10년간 미생물 NP 연구는 고처리량 시퀀싱, 초고감도 고해상도 MS, 통합 다중 오믹스 접근법과 같은 발전에 힘입어 혁신적인 '심해 채굴 시대'에 접어들었습니다. 이 도구들은 발견 노력을 우연한 고립에서 데이터 기반의 목표 탐사로 전환시켰습니다. antiSMASH 7.0과 DeepBGC를 포함한 유전체 마이닝 파이프라인은 특히 미탐구된 분류군36,37에서 암호화된 BGC의 체계적 식별을 가능하게 합니다.

  1. 고처리량 시퀀싱 및 하이브리드 조립
    단독 고처리량 DNA 시퀀싱과 장기 독서 시퀀싱 플랫폼의 결합과 같은 고처리량 DNA 시퀀싱 기술은 노트를 생성하는 생물체의 유전체 연구를 크게 변화시켰습니다. 롱 리드와 숏 리드를 모두 통합하는 하이브리드 조립 전략을 사용함으로써, 연구자들은 전체 BGC를 포착하는 데 필수적인 고연속성 게놈 조립을 달성할 수있습니다. 또한, 메타게놈 조립된 유전체 복원을 포함하는 메타게놈 시퀀싱은 BGCs의 미배양 미생물 발견 범위를 넓혀 과학자들이 환경 DNA의 생합성 잠재력을 탐구할 수 있게 합니다. 기존의 게놈 조립 방법이 크거나 반복적인 유전자 클러스터를 해결하지 못하는 경우, 코스미드나 박테리아 인공 염색체 라이브러리와 같은 라이브러리 기반 기법을 활용해 상당한 유전체 조각을 분리하고 클론할 수 있습니다. 이 접근법은 표적 시퀀싱 또는 이종 발현을 통해 완전한 유전자 클러스터의 특성화를 용이하게 하여 NPs 생합성의 유전적 기초에 대한 이해를 높인다40,41.
  2. 게놈 마이닝 도구
    특수 생물정보학 도구는 유전체 데이터를 분석하여 2차 대사물 경로의 뚜렷한 신호를 식별하는 데 필수적입니다. antiSMASH, PRISM, DeepBGC와 같은 프로그램은 후보 BGC를 자동으로 감지하여 이 과정에서 중요한 역할을 합니다. 이들은 비리보솜 펩타이드 합성효소, 폴리케타이드 합성 시인타스, 리보솜 합성 및 번역 후 변형 펩타이드(RiPP) 경로, 테르펜 사이클라제 등과 관련된 특정 생합성 도메인을 인식함으로써 이를 수행합니다. 복제 제거를 돕기 위해 알려진 BGC와 그 산물을 모은 MIBiG, 알려진 NP를 분류하는 NPAtlas와 같은 데이터베이스가 연구자들이 새로운 서열이나 화합물을 확립된 예제 37,42,43과 일치시키는 데 도움을 줍니다. BiG-SCAPE와 같은 클러스터링 알고리즘과 CORASON 같은 도구는 관련 BGC를 가족으로 조직하여 생물합성 다양성의 네트워크 관점을 제공하고 알려진 클러스터 가족과의 비교를 통해 새로운 클러스터 가족 식별을 용이하게 합니다44. BLAST 검색과 숨겨진 마르코프 모델 스캔을 포함한 추가 생물정보학 분석은 BGC 내에 암호화된 효소의 잠재적 기능을 예측할 수 있으며, 공생 분석과 유전자 공진화와 같은 비교 유전체학 접근법은 이러한 기능적 예측을 정교하게 다듬는 데 도움을 줍니다45. 더 나아가, 유전체 데이터는 경로 특이적 프로모터와 전사 조절자를 포함한 NPs 생합성과 관련된 조절 요소의 주석을 가능하게 합니다46. 이러한 통찰은 경로 공학의 기초를 제공합니다; 예를 들어, 형질전환 관련 재조합 클로닝과 적색/ET 재조합과 같은 합성생물학 기법은 연구자들이 이종 숙주 생물체에서 침묵하거나 은폐된 BGC를 포착하고 발현하여 대사산물 생성을 활성화할 수 있게 합니다47.
    유전체 마이닝 노력은 특정 유전 신호에 집중하여 새로운 NP의 발견으로 성공적으로 이어졌습니다. 예를 들어, 글리코펩타이드 항생제 내성과 관련된 유전자를 체계적으로 탐색한 결과, 새로운 항생제를 암호화할 것으로 예측되는 여러 특이한 BGC가 발견되었습니다. 이 방법을 통해 박테리아 오토리신을 표적으로 하는 독특한 작용 기전을 보이는 콤프스타틴과 코브라마이신이라는 두 가지 새로운 화합물이 확인되었다48. 비슷한 맥락에서, 인간 마이크로바이옴에서 생합성 유전자 성분을 조사한 결과, 포 도상구균연쇄상구 균에 대한 잠재적 효과로 인정받는 '휴미신'이라는 리포펩타이드 항생제 후보가 발견되었습니다. 이들 경우, 화합물은 처음에 유전체 데이터를 기반으로 화학 구조를 예측하는 계산 방법을 통해 확인되었습니다. 이후 예측된 분자들은 화학적으로 합성되어 예상되는 항생제 활성을 입증하여 유전체 기반 발견 전략을 검증했습니다. 더 넓은 차원에서, 희귀 방선균류를 포함한 다양한 박테리아의 대규모 시퀀싱이 생성물이 알려지지 않은 "크립티컬" BGCs 유전자 클러스터를 풍부하게 밝혀내고 있습니다. 예를 들어, 스트렙토마이세스 유전체에 대한 조사에서 수천 개의 미규명된 BGCs50이 밝혀졌습니다. 이러한 고아 군집을 실제 대사산물과 연결하는 새로운 접근법은 대사체 분석과 유전체 조사를 통합하는 것입니다. GNPS나 질량 스펙트럼 데이터베이스와 같은 플랫폼을 통해 유전자 클러스터의 존재 또는 발현을 고유 대사체 특징의 검출과 연관시키면, 연구자들은 수많은 새로운 BGC에 잠정적 화학 산물을 할당하기 시작하여 유전체 데이터로부터 진정한 새로운 NP를 발견하는 데 도움을 줄 수 있습니다.

3. 천연 제품 발견에서의 전사체학

전사체 분석은 다양한 조건에서 mRNA 발현을 측정함으로써 BGCs의 활성에 대한 역동적인 관점을 제공합니다. 구체적으로, RNA-seq 실험은 어떤 BGC가 적극적으로 전사되고 있는지, 그리고 그 발현 수준이 환경적 또는 실험적 변화에 어떻게 변화하는지 밝혀낼 수 있습니다. 다양한 조건에서 전사체 수준을 비교함으로써, DESeq2나 edgeR과 같은 도구를 이용한 차별 발현 분석은 상향 또는 하향 조절된 BGC를 정확히 찾아내어 표준 조건51에서 유도 가능하거나 침묵할 수 있는 유전자 클러스터를 강조할 수 있습니다. 기존 RNA-seq가 대량 배양 세포에서 수행하는 일반적인 BGC 발현 연구의 일반적인 접근법이지만, 단일 세포 RNA-seq와 같은 더 발전된 기법들이 복잡한 마이크로바이옴에서 점차 활용되고 있습니다. 이 변화는 배양이 어려운 환경 유기체에서 유전자 발현을 관찰할 수 있게 합니다52,53. 표준 RNA-seq 워크플로우는 일반적으로 STAR나 HISAT2와 같은 정렬기를 이용한 리드를 참조 게놈에 매핑하고, featureCounts나 Kallisto와 같은 도구로 유전자 발현을 정량화하며, 유의미한 발현 변화를 식별하기 위해 데이터를 정규화하는 것을 포함합니다. 이후 WGCNA 패키지를 사용하여 수행되는 공발현 네트워크 분석은 유사한 발현 패턴을 보이는 유전자들을 군집화할 수 있습니다. 대사물 데이터도 이용 가능하면, 이 네트워크는 대사산물을 포함하도록 확장하여 특정 화합물을 공동 발현 유전자와 연결할 수 있습니다54.

전사체 데이터는 조건부 활성 생합성 경로를 식별하는 데 유용함이 입증되었습니다. 이 접근법의 주목할 만한 예는 네 가지 살리니스포라 균주에 대한 상세한 비교에서 찾을 수있습니다. 이 연구에서 각 균주에서 절반 이상의 BGC가 어느 정도 발현되었고, 한 균주에서 비활성 상태였던 많은 군집이 다른 균주에서 발현된 것으로 밝혀졌습니다. 이 균주들 전반의 유전자 발현 프로필을 분석함으로써, 연구진은 특정 군집을 침묵시키거나 활성화하는 것으로 보이는 여러 조절 요인을 정확히 찾아낼 수 있었습니다. 이 통합 방법은 이전에 알려지지 않은 NP 계열인 살리니포스틴의 확인으로 이어졌습니다. 전사체 데이터는 미확인 화합물의 잠재적 원인으로 은폐 유전자 군집을 나타냈으며; 이 클러스터가 (조절 변화를 통해) 발현하도록 유도되면, 살리니포스틴 분자가 생성되었고, 이후 분리되어 구조적으로 특성화되었습니다. 이 연구는 전사체학이 NP 발견을 촉진할 수 있음을 잘 보여줍니다. 유전자 발현 차이를 분석함으로써 후보 BGC를 강조할 수 있고, 유전자 발현과 대사물 프로필 간의 상관관계는 표적 실험을 통해 검증할 수 있는 유전자-대사물 관계에 대한 뒷받침 증거를 제공합니다.

4. NP 발견에서의 단백질체학

  1. 샷건 접근법과 표적 단백질체학 접근법
    단백질의 대규모 연구를 포함하는 프로테오믹스는 생합성 경로에 역할을 하는 효소와 단백질을 직접 측정함으로써 NP 연구에 중요한 관점을 제공합니다. 일반적으로 프로테오믹스 접근법은 두 가지 주요 유형으로 분류할 수 있습니다: 샷건(비표적) 프로테오믹스와 표적 프로테오믹스. 샷건 단백질체학에서는 미생물 또는 식물 샘플에서 추출한 단백질이 일반적으로 트립신과 함께 효소 소화를 받으며, 생성된 펩타이드는 고해상도 LC-MS/MS로 분석되며, 종종 쿼드러폴 비행 시간(QTOF) 또는 고해상도 궤도 트랩 질량분석기와 같은 첨단 질량분석기를사용합니다. 수집된 MS 데이터는 MS/MS 스펙트라로 알려져 있으며, MaxQuant나 Mascot56,57과 같은 소프트웨어 도구를 활용하여 유기체 유전체 또는 밀접한 종에서 유래한 단백질 데이터베이스와 대조하여 펩타이드 서열과 매칭됩니다. 이 과정은 다양한 조건에서 단백질 풍부도 변화를 정량화할 수 있게 하며, 이는 라벨 없는 방법이나 세포 배양 내 아미노산에 의한 안정 동위원소 표지(SILAC)나 TMT/iTRAQ 시약을 이용한 등압 태깅과 같은 동위원소 표지 기법을 사용하여 어떤 생합성 효소가 상향 또는 하향 조절되는지 결정할 수 있습니다58, 59. 반면, 선택적 반응 모니터링(SRM) 또는 병렬 반응 모니터링(PRM)을 포함한 표적 프로테오믹스 방법은 특정 펩타이드 이온 집합, 종종 주요 생합성 효소나 조절 단백질에서 유래한 독특한 펩타이드에 집중하여 여러 샘플에서 이러한 펩타이드를 정밀하고 민감한 정량화할 수 있게 합니다60,61.
  2. 프로테오믹스에서의 혁신적 접근법
    2차 대사 프로테옴 분석에서 중요한 도전 과제 중 하나는 비리보솜 펩타이드 합성효소와 폴리케타이드 합성효소와 같은 대형 생합성 효소의 검출입니다. 이들은 종종 100 kDa를 초과하며, 표준 소화 프로토콜로는 검출 가능한 펩타이드가 거의 없어 관찰이 어렵습니다. 이 문제를 해결하기 위해 Bumpus 등은 PrISM이라는 방법을 개발했으며, 이는 NRPS와 PKS 단백질의 특정 보조인자를 이용해 이2011년 62번에 발견되는 특정 보좌인자를 이용해 이 단백질의 검출을 향상시키는 방법이다. PrISM은 기존의 산탄총형 단백질체학과 인산판테이닐(Ppant) 배출 분석법을 통합합니다. 특히 NRPS와 PKS 효소는 아실 운반체 또는 펩티딜 운반체 도메인에 공유 결합 판트 암을 가지고 있습니다; MS/MS 단편화 과정에서 이 보철 그룹은 종종 '판트 방출(Ppant ejection)' 이온이라 불리는 독특한 조각 이온을 생성합니다. 이 진단 이온에 대한 LC-MS/MS 데이터를 계산적으로 필터링함으로써, PrISM 방법은 모든 세포 단백질의 복잡한 혼합물 속에서 NRPS 및 PKS 효소에서 유래한 펩타이드를 효과적으로 강조할 수 있습니다. 이 전략은 단백질체학을 통해 숨겨진 생합성 경로를 성공적으로 밝혀냈습니다. 예를 들어, PrISM 워크플로우는 Bacillus brevis 배양에서 그라마시딘 S 합성효소 복합체(GrsA/GrsB)의 펩타이드를 검출할 수 있게 해주었고, 이 NRPS 효소와 해당 생물체에서 항생제 그라니시딘 S 생성 사이에 직접적인 연관성을 입증했습니다62. 중요하게도, GrsA/GrsB의 프로테오믹 확인이 B. brevis에 대한 사전 유전체 지식을 필요로 하지 않아, 특정 경우에는 프로테오믹 분석만으로도 유전체가 아직 시퀀싱되지 않은 유기체에서도 활성 NPs 생합성 경로를 발견할 수 있음을 보여준다.
  3. 유전체 기반 단백질체학
    게놈 서열이 제공되면, 균주 특이적 데이터베이스를 활용해 펩타이드 식별을 통해 프로테오믹스의 성능을 크게 향상시킬 수 있습니다. 예를 들어, Streptomyces lilacinus의 단백질체를 분석하는 연구에서 연구진은 일반 단백질 데이터베이스와 스펙트럼을 비교해 스펙트럼을 검색하고, 다른 하나는 해당 균주63의 염기서열 처리된 게놈에서 파생된 맞춤형 데이터베이스를 분석하는 분석이었습니다. 유전체 기반 분석 결과, 약 10배 더 많은 펩타이드가 확인되었고, 생물체 내 여섯 개의 서로 다른 BGC와 연관된 펩타이드도 검출되었습니다. 특히, 이 중 세 개의 클러스터는 이전에 알려진 '고아' 대사산물인 그레이박틴, 라키시딘 D, 그리고 특정 항상광체에 해당하며, 이들의 생합성 효소가 발현되는 것이 확인되었습니다. 남은 검출된 클러스터들은 새롭고 특성화되지 않은 것으로 보였다. 이 예시는 유전체 정보를 프로테옴 워크플로우에 통합함으로써 균주에서 어떤 생합성 경로가 활발히 발현되는지 확인할 수 있음을 보여주며, 이를 통해 해당 유전자 클러스터를 우선순위로 하여 분리 및 특성화를 진행할 수 있음을 보여줍니다.
    또한, 프로테오믹 방법은 NP의 분자 표적과 작용 방식을 밝혀내는 데 도움이 되며, 이는 종종 화학적 프로테오믹스라고 불립니다. 예를 들어, 활성 기반 단백질 프로파일링(ABPP)은 일반적으로 NP의 유도체 또는 유사체인 소분자 프로브를 사용하여 화합물의 세포 표적과 반응하여 해당 단백질에 표적을 부착하여 MS64를 통해 풍부화 및 식별을 수행합니다. 이 기술은 특정 NP 또는 관련 분자가 세포 내에서 결합하는 단백질 표적을 밝혀낼 수 있습니다. 또 다른 방법인 열프로테옴 프로파일링(TPP)은 화합물이 존재하는지 없이도 단백질 샘플을 가열하여 어떤 단백질이 열적 안정성에 변화를 보이는지 확인하여 결합 상호작용을 나타내는 방법을 의미합니다65. 이러한 화학적 단백질체학적 접근법은 NP의 생물학적 표적을 검증하고 작용 기전을 밝히는 데 매우 귀중하며, 이는 NP 자체의 발견을 보완합니다.

5. 오믹스 통합 및 예측을 위한 ML 및 AI

  1. 다중 오믹스 데이터와 머신러닝 통합
    NP 발견의 흥미로운 최전선은 ML과 AI를 활용해 기능적 예측을 위한 오믹스 데이터를 통합하는 것입니다. 유전체학 분야에서는 랜덤 포레스트, 지지 벡터 기계, 딥 신경망 등 지도 학습 알고리즘이 특정 유형의 NP와 연관된 BGC의 패턴을 식별하기 위해 개발되었습니다. 예를 들어, 이러한 ML 모델은 BGC가 생성하는 분자의 일반적인 분류에 따라 분류하거나, 유전자 서열에서 파생된 화학 구조의 특정 특성을 예측할 수 있습니다. Dason MS와 동료들의 리뷰에서는 DNA 또는 아미노산 서열 데이터를 활용해 해당 NP의 구조와 생활성을 추론하는 BGC의 '언어'를 해독하기 위해 설계된 다양한 ML 도구가 강조되고 있습니다66. 이 모델들은 일반적으로 알려진 유전자 클러스터와 화합물의 방대한 데이터베이스를 활용하여 이들 간의 관계를 학습하고, 새로운 화합물의 잠재적 생물학적 활성에 대한 예측을 가능하게 합니다. 예를 들어, 특성화되지 않은 BGC 제품이 항생제 또는 항암 특성을 가질 수 있는지 평가할 수 있습니다. 이러한 능력을 가능하게 한 중요한 발전으로는 수천 개의 알려진 NP 구조와 유전자 클러스터와 같은 대규모 훈련 데이터셋의 활용, 유전자 클러스터와 화학 구조의 특징을 포착하는 서열 임베딩과 그래프 신경망과 같은 혁신적인 표현 기법, 그리고 예측 정확도를 높이기 위해 다양한 유전체 및 화학적 기술자를 결합한 다중 매개변수 모델 등이 있습니다.
    대사체학 분야에서 AI 기법은 복잡한 질량 스펙트럼 데이터 해석을 크게 향상시키고 있습니다. 주목할 만한 예로는 MS/MS 스펙트럼에서 분자의 구조적 지문을 예측하기 위해 ML을 활용한 CSI:FingerID 도구가 있습니다. 이 능력은 잠재적인 하위 구조와 후보 화합물을 제안하여 미지의 대사산물을 식별하는 데 도움을 줍니다67. 마찬가지로, 딥러닝 모델은 스펙트럼 주석 작성에 활용되어 왔습니다; 합성곱 신경망과 최근에는 "DreaMS" 모델과 같은 트랜스포머 기반 아키텍처가 광범위한 스펙트럼 라이브러리에서 단편화 패턴을 학습합니다. 이 모델들은 학습한 패턴을 바탕으로 미지의 스펙트럼에 대한 구조를 제안할 수 있으며, 특히 기존 데이터베이스에서 정확한 일치가 없는 대사산물의 경우 전통적인 휴리스틱 방법보다 더 뛰어난 성능을 보입니다68. 구조적 주석을 넘어, ML은 전역 패턴을 식별함으로써 대사체학에도 기여합니다. 예를 들어, t-SNE(t-분산 확률 이웃 임베딩)와 UMAP(균등 다양체 근사 및 투영)과 같은 비지도 시각화 알고리즘은 표적 없는 대사체 데이터셋의 차원성을 줄여 대사물 프로필의 유사성을 기반으로 샘플을 군집화할 수 있게 합니다. 한편, 감독 분류기는 특정 대사체 서명을 샘플의 표현형 형질이나 생활성에 연결할 수 있어 분석을 더욱 풍부하게 할 수 있습니다69,70,71.
    ML은 다양한 오믹스 데이터셋 통합에 점점 더 활용되고 있으며, NP의 생합성과 기능에 대한 보다 포괄적인 이해를 가능하게 하고 있습니다. 유전체학, 전사체학, 단백질체학, 대사체학의 데이터를 통합함으로써 통합 모델은 각 데이터 유형을 개별적으로 검토할 때 간과될 수 있는 연결고리를 드러낼 수 있습니다. 예를 들어, 연구자들은 유전자나 단백질의 발현 수준을 대사산물의 생산 수준과 연결하는 유전자-대사물 상관관계 네트워크를 구축할 수 있습니다. 이 통합 데이터를 기반으로 학습된 ML 모델은 특정 대사산물이나 생물학적 활성에 관여하는 유전자 클러스터를 예측할 수 있습니다72,73. MOFA와 같은 도구에서 가능한 다중 오믹스 인자 분석과 mixOmics 같은 패키지에 포함된 정규화된 다변량 기법과 같은 고급 다변량 기법은, 공존 발현 유전자 집합과 함께 존재하는 대사산물 그룹과 같은 서로 다른 데이터 유형을 포함하는 잠재 인자를 식별하는 데 도움을 줍니다74,75,76. 실질적으로, NP 발견을 위해 다양한 접근법이 관찰된 대사산물이나 표현형과의 연관성을 입증하여 후보 유전자 클러스터의 우선순위를 정하는 데 도움을 줍니다. 이러한 통합적이고 AI 유도 전략의 주목할 만한 예는 DecRiPPter 알고리즘을 이용한 새로운 리보솜 합성 및 RiPP 계열의 발견입니다. 이 알고리즘은 지지 벡터 기계(SVM) 기반 모델을 활용하여 은폐 RiPP 전구체 펩타이드의 유전체 데이터를 분석한 후, 이 예측을 범유전체 분석과 교차 참조하여 알려진 화합물을 제거합니다. 1,295명에 적용했을 때 Streptomyces DecRiPPter는 기존 게놈 마이닝 방법으로 이전에 발견되지 않았던 42개의 추정되는 새로운 RiPP 계열을 성공적으로 확인했습니다. 이 예측된 클러스터 중 하나는 새로운 클래스 V 란티펩타이드를 생성하는 것으로 실험적으로 검증되었으며, 연구자들은 이를 '프리스티닌 A3'라고 명명했습니다. 이 침묵 유전자 클러스터의 발현을 유도함으로써 프리스티닌 A3 화합물이 분리되었고, NMR과 MS를 이용해 구조를 확인하여 경로 내에 암호화된 두 가지 이전에 알려지지 않은 란티오닌 형성 효소를 밝혀냈습니다77. 이 성과는 AI 기반 분석이 숨겨진 NP를 발견할 수 있음을 보여줍니다: ML 모델은 이전에 인식되지 않은 유전 신호를 감지하여 새로운 분자 발견을 위한 실험적 노력을 이끌었습니다.
  2. 신흥 AI 응용 분야
    현재의 응용 외에도, 여러 신흥 AI 기반 전략들이 NP 연구를 더욱 혁신할 것으로 기대됩니다. 유망한 분야 중 하나는 계산 역합성 및 경로 설계로, 딥러닝 모델이 개발되어 알려진 NP와 그 유사체에 대한 생합성 경로 또는 합성 화학 단계를 제안하고 있어 신종 화합물의 설계 및 생산을 크게 향상시킬 수 있습니다78,79. 또 다른 흥미로운 분야는 AI를 이용한 효소 기능 예측입니다. 딥러닝 알고리즘을 기반으로 한 현대 단백질 구조 예측 도구와 단백질 서열에 대한 대비 학습과 같은 ML 기법을 활용함으로써, 연구자들은 BGC에서 발견되는 특성화되지 않은 효소의 가능한 활동을 추론하기 시작했습니다. 이는 이 효소들이 촉매하는 화학적 변환 유형에 대한 통찰을 제공할 수 있습니다80, 81, 82. AI 플랫폼이 질량 스펙트럼 특징을 유전체 데이터와 자동으로 연결하는 것을 목표로 하는 완전 통합 오믹스-화학 파이프라인이 개발 중입니다83,84. 원칙적으로, 이러한 시스템은 복잡한 샘플의 LC-MS/MS 데이터셋을 동일 환경의 유전체 서열과 함께 분석하여, 유전자 클러스터-대사체 일치 점수를 얻어 각 미확인 대사체의 원인이 어떤 유전자 클러스터인지 예측할 수 있습니다. 이러한 접근법은 아직 초기 단계이지만, AI가 유전자를 분자와 자율적으로 연결할 수 있어, 오믹스 데이터에서 새로운 NP 발견까지의 과정을 크게 가속화할 수 있는 미래를 시사합니다.
  3. AI 지원 NP 발견에서의 데이터 거버넌스와 윤리적 도전 과제
    현대의 다중 오믹스 연구는 다양한 데이터를 상당히 많이 생산하지만, AI 예측의 효과는 이러한 데이터셋의 품질과 일관성에 크게 의존합니다. 훈련 세트가 주석이 부실하거나 편향되어 있으면 오해를 불러일으키는 결과와 검증 실패로 이어질 수 있습니다85. 이 문제를 해결하기 위해 연구자들은 FAIR 원칙인 Findable, Accessible, Interoperable, Reuse Principles를 구현하여 데이터 투명성, 재현성, 광범위한 재사용성을 촉진해야 합니다86. 이 접근법은 긍정적·부정적 결과를 모두 공유하고, 데이터 전처리 파이프라인을 철저히 문서화하며, 독립적인 검증을 용이하게 하는 분석 코드를 제공하는 것을 포함합니다. 또한, 전자 실험실 노트북(ELN)과 컨테이너화된 워크플로우와 같은 신흥 디지털 인프라의 도입은 데이터 수집 개선과 표준화된 관리 확보에 필수적입니다87,88.
    AI는 NP 발견을 크게 가속화하지만, 동시에 중요한 윤리적 문제도 제기합니다. 불완전하거나 편향된 데이터셋으로 학습된 알고리즘은 기존의 불평등을 강화할 수 있으며, 이는 다양하고 대표성 있는 학습 데이터의 필요성을 강조합니다89. 또한, 설명 가능한 AI 기법의 활용은 투명성을 높이고 과학자들이 예측을 이해하는 데 필수적이며, AI가 의사결정자가 아닌 인간의 통제 하에 보조 도구로 기능하도록 보장합니다85. 윤리적 고려사항에는 데이터 프라이버시, 특히 임상 또는 인간 기반 데이터셋을 사용할 때, 자동화가연구 환경에 점점 더 영향을 미치면서 노동력에 미치는 영향도 포함됩니다. 이러한 문제를 해결하기 위해 AI 시스템은 정기적인 감사, 편향 평가, 엄격한 규제 감독을 받아야 하며, 이는 NP 연구 분야에서 공정성, 책임성, 신뢰성을 유지하는 데 도움이 될 것입니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결론

현재 NP 발견 현황은 분석화학과 생물정보학의 결합을 활용하여 강력한 시너지를 창출하고 있습니다. 그림 1에서 설명한 바와 같이, LC-MS 대사체학, 고처리량 시퀀싱, RNA-Seq, 프로테오믹스와 같은 첨단 오믹스 기술들이 네트워킹 및 머신러닝을 포함한 계산 분석과 함께 효과적인 발견 파이프라인을 형성합니다. 최근 이 분야의 발전으로는 희귀 생산자를 식별할 수 있는 단일 세포 유믹스, 대사물 식별을 돕는 향상된 스펙트럼 라이브러리 및 AI 도구가 포함됩니다. 또한, 새로운 서식지에 대한 광범위한 메타게놈 채굴이 이전에 알려지지 않은 화합물을 발견하고 있습니다. 협력 노력은 GNPS, antiSMASH, NPAtlas와 같은 통합 데이터 프레임워크와 커뮤니티 자원에 의해 지원됩니다. 머신러닝과 AI 기술이 계속 발전함에 따라, 이들은 다중 오믹스 데이터의 ...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

모든 저자는 잠재적인 이해 충돌로 인식될 수 있는 재정적 또는 개인적 관계가 없다고 선언합니다.

감사의 글

이 연구는 중국국가자연과학기금(32500813), 중국과학과학기구 박사후 연구원 프로그램(GZC20251503), 쓰촨성 과학기술프로그램(2024ZYD0149), 쓰촨성 박사후 과정 특별 연구재단(TB2024017), 더양 과학기술국 중점연구개발 프로젝트(2024SZY016, 2023SZZ009), 국가보건위원회 역량강화 및 평생교육센터(GWJJMB202510025060)의 지원을 받았습니다. 그리고 데양 인민병원 인큐베이션 프로젝트 특별기금(FRH202501, FHT202501). 그림 1 이 BioRender를 사용해 제작되었음을 인정합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

참고문헌

  1. Newman, D. J., Cragg, G. M. Natural products as sources of new drugs over the nearly four decades from 01/1981 to 09/2019. J Nat Prod. 83 (3), 770-803 (2020).
  2. Shang, X., et al. Natural products in antiparasitic drug discovery: Advances, opportunities and challenges. Nat Prod Rep. 42 (9), 1419-1458 (2025).
  3. Atanasov, A. G., et al. Natural products in drug discovery: Advances and opportunities. Nat Rev Drug Discov. 20 (3), 200-216 (2021).
  4. Xie, S., Zhan, F., Zhu, J., Xu, S., Xu, J. The latest advances with natural products in drug discovery and opportunities for the future: A 2025 update. Expert Opin Drug Discov. 20 (7), 827-843 (2025).
  5. Sahana, S., et al. Multi-omics approaches: Transforming the landscape of natural product isolation. Funct Integr Genomics. 25 (1), 132(2025).
  6. Zhang, H. W., et al. Application of omics- and multi-omics-based techniques for natural product target discovery. Biomed Pharmacother. 141, 111833(2021).
  7. Blin, K., et al. antiSMASH 5.0: Updates to the secondary metabolite genome mining pipeline. Nucleic Acids Res. 47 (W1), W81-W87 (2019).
  8. Song, C., et al. Comparative transcriptomics unveil the crucial genes involved in coumarin biosynthesis in Peucedanum praeruptorum Dunn. Front Plant Sci. 13, 899819(2022).
  9. Bayona, L. M., De Voogd, N. J., Choi, Y. H. Metabolomics on the study of marine organisms. Metabolomics. 18 (3), 17(2022).
  10. Du, P., Fan, R., Zhang, N., Wu, C., Zhang, Y. Advances in integrated multi-omics analysis for drug-target identification. Biomolecules. 14 (6), 692(2024).
  11. Elgahamy, A. A., El-Desoky, A. H., Otify, A. M., El Fishawy, A. M., El-Beih, A. A. Molecular networking derived from untargeted LC-MS/MS analysis to discover inhibitors of RANKL-induced osteoclastogenesis from Egyptian marine sponge-associated fungi. Sci Rep. 15 (1), 27137(2025).
  12. Bustamam, M. S. A., et al. Complementary analytical platforms of NMR spectroscopy and LCMS analysis in the metabolite profiling of Isochrysis galbana. Mar Drugs. 19 (3), 139(2021).
  13. Hu, G., Qiu, M. Machine learning-assisted structure annotation of natural products based on MS and NMR data. Nat Prod Rep. 40 (11), 1735-1753 (2023).
  14. Gaudencio, S. P., et al. Advanced methods for natural products discovery: Bioactivity screening, dereplication, metabolomics profiling, genomic sequencing, databases and informatics tools, and structure elucidation. Mar Drugs. 21 (5), 308(2023).
  15. Sedighikamal, H., Mashayekhan, S. Critical assessment of quenching and extraction/sample preparation methods for microorganisms in metabolomics. Metabolomics. 21 (2), 40(2025).
  16. Recommended Coverage and Read Depth for NGS Applications. , https://genohub.com/recommended-sequencing-coverage-by-application/?utm_source (2025).
  17. Brockbals, L., Ueland, M., Fu, S., Padula, M. P. Development and thorough evaluation of a multi-omics sample preparation workflow for comprehensive LC-MS/MS-based metabolomics, lipidomics and proteomics datasets. Talanta. 286, 127442(2025).
  18. Graw, S., et al. Multi-omics data integration considerations and study design for biological systems and disease. Mol Omics. 17 (2), 170-185 (2021).
  19. Han, E., Kwon, H., Jung, I. A review on multi-omics integration for aiding study design of large-scale TCGA cancer datasets. BMC Genomics. 26 (1), 769(2025).
  20. Lusk, R. W. Diverse and widespread contamination evident in the unmapped depths of high-throughput sequencing data. PloS one. 9 (10), e110808(2014).
  21. Queiroz, E. F., Guillarme, D., Wolfender, J. L. Advanced high-resolution chromatographic strategies for efficient isolation of natural products from complex biological matrices: From metabolite profiling to pure chemical entities. Phytochem Rev. 23 (5), 1415-1442 (2024).
  22. Huang, Z., Bi, T., Jiang, H., Liu, H. Review on NMR as a tool to analyse natural products extract directly: Molecular structure elucidation and biological activity analysis. Phytochem Anal. 35 (1), 5-16 (2024).
  23. Li, T., et al. Direct infusion-tandem mass spectrometry combining with data mining strategies enables rapid chemome characterization of medicinal plants: A case study of Polygala tenuifolia. J Pharm Biomed Anal. 204, 114281(2021).
  24. Zou, Y., Tang, W., Li, B. Exploring natural product biosynthesis in plants with mass spectrometry imaging. Trends Plant Sci. 30 (1), 69-84 (2025).
  25. Zhang, A., et al. Qualitative and quantitative determination of chemical constituents in Jinbei oral liquid, a modern Chinese medicine for coronavirus disease 2019, by ultra-performance liquid chromatography coupled with mass spectrometry. Front Chem. 11, 1079288(2023).
  26. Liu, Y., et al. Discovery of bioactive-chemical Q-markers of Acanthopanax sessiliflorus leaves: An integrated strategy of plant metabolomics, fingerprint and spectrum-efficacy relationship research. J Chromatogr B Analyt Technol Biomed Life Sci. 1233, 124009(2024).
  27. LC-MS analysis: Mini review frequently used open source softwares. Binanto, I., Warnars, H. L. H. S., Sianipar, N. F., Abbas, B. S. 2019 6th International Conference on Information Technology, Computer and Electrical Engineering (ICITACEE), , IEEE. 1-5 (2019).
  28. Blazenovic, I., Kind, T., Ji, J., Fiehn, O. Software tools and approaches for compound identification of LC-MS/MS data in metabolomics. Metabolites. 8 (2), 31(2018).
  29. Wang, M., et al. Sharing and community curation of mass spectrometry data with Global Natural Products Social Molecular Networking. Nat Biotechnol. 34 (8), 828-837 (2016).
  30. Leclair, M. M., et al. Discovery of Levesquamide B through Global Natural Products Social Molecular Networking. Molecules. 27 (22), 7794(2022).
  31. Yanagisawa, K., et al. A new pyranonaphthoquinone, actinoquinonal A, and its congeners from the combined-culture of Streptomyces sp. 23-50 and Tsukamurella pulmonis TP-B0596. J Antibiot (Tokyo). 78 (6), 350-358 (2025).
  32. Kum, E., Ince, E. Metabolomics approach to explore bioactive natural products derived from plant-root-associated streptomyces. Appl Biochem Biotechnol. 196 (10), 7293-7306 (2024).
  33. Poynton, E. F., et al. The Natural Products Atlas 3.0: Extending the database of microbially derived natural products. Nucleic Acids Res. 53 (D1), D691-D699 (2025).
  34. Zhang, S., et al. Global analysis of natural products biosynthetic diversity encoded in fungal genomes. J Fungi (Basel). 10 (9), 653(2024).
  35. Wang, Z., et al. The deep mining era: Genomic, metabolomic, and integrative approaches to microbial natural products from 2018 to 2024. Mar Drugs. 23 (7), 261(2025).
  36. Blin, K., et al. antiSMASH 7.0: New and improved predictions for detection, regulation, chemical structures and visualisation. Nucleic Acids Res. 51 (W1), W46-W50 (2023).
  37. Hannigan, G. D., et al. A deep learning genome-mining strategy for biosynthetic gene cluster prediction. Nucleic Acids Res. 47 (18), e110(2019).
  38. Sanchez-Navarro, R., et al. Long-read metagenome-assembled genomes improve identification of novel complete biosynthetic gene clusters in a complex microbial activated sludge ecosystem. mSystems. 7 (6), e0063222(2022).
  39. Waschulin, V., et al. Biosynthetic potential of uncultured Antarctic soil bacteria revealed through long-read metagenomic sequencing. ISME J. 16 (1), 101-111 (2022).
  40. Xu, M., et al. Functional genome mining for metabolites encoded by large gene clusters through heterologous expression of a whole-genome bacterial artificial chromosome library in Streptomyces spp. Appl Environ Microbiol. 82 (19), 5795-5805 (2016).
  41. Liu, Z., Zhao, Y., Huang, C., Luo, Y. Recent advances in silent gene cluster activation in Streptomyces. Front Bioeng Biotechnol. 9, 632230(2021).
  42. Blin, K., et al. antiSMASH 6.0: Improving cluster detection and comparison capabilities. Nucleic Acids Res. 49 (W1), W29-W35 (2021).
  43. Skinnider, M. A., et al. Comprehensive prediction of secondary metabolite structure and biological activity from microbial genome sequences. Nat Commun. 11 (1), 6058(2020).
  44. Navarro-Munoz, J. C., et al. A computational framework to explore large-scale biosynthetic diversity. Nat Chem Biol. 16 (1), 60-68 (2020).
  45. Zhu, S., et al. Computational advances in biosynthetic gene cluster discovery and prediction. Biotechnol Adv. 79, 108532(2025).
  46. Zhao, C., et al. Genome sequencing provides potential strategies for drug discovery and synthesis. Acupunc Herbal Med. 3 (4), 244-255 (2023).
  47. Bomfiglio, I. F., Mendes, I. S. M., Bonatto, D. A review of DNA restriction-free overlapping sequence cloning techniques for synthetic biology. Biotechnol J. 20 (7), e70084(2025).
  48. Culp, E. J., et al. Evolution-guided discovery of antibiotics that inhibit peptidoglycan remodelling. Nature. 578 (7796), 582-587 (2020).
  49. Chu, J., et al. Discovery of MRSA active antibiotics using primary sequence from the human microbiome. Nat Chem Biol. 12 (12), 1004-1006 (2016).
  50. Kloosterman, A. M., et al. Expansion of RiPP biosynthetic space through integration of pan-genomics and machine learning uncovers a novel class of lanthipeptides. PLoS Biol. 18 (12), e3001026(2020).
  51. Amos, G. C. A., et al. Comparative transcriptomics as a guide to natural product discovery and biosynthetic gene cluster functionality. Proc Natl Acad Sci U S A. 114 (52), E11121-E11130 (2017).
  52. Imdahl, F., Saliba, A. E. Advances and challenges in single-cell RNA-seq of microbial communities. Curr Opin Microbiol. 57, 102-110 (2020).
  53. Llorens-Rico, V., Simcock, J. A., Huys, G. R. B., Raes, J. Single-cell approaches in human microbiome research. Cell. 185 (15), 2725-2738 (2022).
  54. Hirsch, P., et al. ABC-HuMi: The Atlas of biosynthetic gene clusters in the human microbiome. Nucleic Acid Res. 52 (D1), D579-D585 (2024).
  55. Tyanova, S., Temu, T., Cox, J. The MaxQuant computational platform for mass spectrometry-based shotgun proteomics. Nat Protoc. 11 (12), 2301-2319 (2016).
  56. Lepretre, M., et al. From shotgun to targeted proteomics: rapid Scout- MRM assay development for monitoring potential immunomarkers in Dreissena polymorpha. Anal Bioanal Chem. 412 (26), 7333-7347 (2020).
  57. Rani, P., Alam, S. I., Singh, S., Kumar, S. Elucidation of peptide screen for targeted identification of Yersinia pestis by nano-liquid chromatography tandem mass spectrometry. Sci Rep. 15 (1), 1096(2025).
  58. Beller, N. C., Hummon, A. B. Advances in stable isotope labeling: Dynamic labeling for spatial and temporal proteomic analysis. Mol Omics. 18 (7), 579-590 (2022).
  59. Meng, J. Y., et al. Identification of differentially expressed proteins in sugarcane in response to infection by Xanthomonas albilineans using iTRAQ quantitative proteomics. Microorganisms. 8 (1), 76(2020).
  60. Vidova, V., Spacil, Z. A review on mass spectrometry-based quantitative proteomics: Targeted and data independent acquisition. Anal Chim Acta. 964, 7-23 (2017).
  61. Rauniyar, N. Parallel reaction monitoring: A targeted experiment performed using high resolution and high mass accuracy mass spectrometry. Int J Mol Sci. 16 (12), 28566-28581 (2015).
  62. Bumpus, S. B., Evans, B. S., Thomas, P. M., Ntai, I., Kelleher, N. L. A proteomics approach to discovering natural products and their biosynthetic pathways. Nat Biotechnol. 27 (10), 951-956 (2009).
  63. Albright, J. C., Goering, A. W., Doroghazi, J. R., Metcalf, W. W., Kelleher, N. L. Strain-specific proteogenomics accelerates the discovery of natural products via their biosynthetic pathways. J Ind Microbiol Biotechnol. 41 (2), 451-459 (2014).
  64. Chen, X., et al. Target identification with quantitative activity-based protein profiling (ABPP). Proteomics. 17 (3-4), (2017).
  65. Cui, Z., Li, C., Chen, P., Yang, H. An update of label-free protein target identification methods for natural active products. Theranostics. 12 (4), 1829-1854 (2022).
  66. Dason, M. S., Cora, D., Re, A. Sequence modeling tools to decode the biosynthetic diversity of the human microbiome. mSystems. 10 (7), e0033325(2025).
  67. Ludwig, M., Duhrkop, K., Bocker, S. Bayesian networks for mass spectrometric metabolite identification via molecular fingerprints. Bioinformatics. 34 (13), i333-i340 (2018).
  68. Bushuiev, R., et al. Self-supervised learning of molecular representations from millions of tandem mass spectra using DreaMS. Nat Biotechnol. , (2025).
  69. Tian, M., et al. Pure ion chromatograms combined with advanced machine learning methods improve accuracy of discriminant models in LC-MS-based untargeted metabolomics. Molecules. 26 (9), 2715(2021).
  70. Mildau, K., et al. Effective data visualization strategies in untargeted metabolomics. Nat Prod Rep. 42 (6), 982-1019 (2025).
  71. Yuan, X., Smith, N. S., Moghe, G. D. Analysis of plant metabolomics data using identification-free approaches. Applications in Plant Sciences. 13 (4), e70001(2025).
  72. Ji, J., Jung, S. PredCMB: Predicting changes in microbial metabolites based on the gene-metabolite network analysis of shotgun metagenome data. Bioinformatics. 41 (1), btaf020(2024).
  73. Wang, X., Kadarmideen, H. N. Metabolite genome-wide association study (m GWAS) and gene-metabolite interaction network analysis reveal potential biomarkers for feed efficiency in pigs. Metabolites. 10 (5), 201(2020).
  74. Argelaguet, R., et al. Multi-Omics Factor Analysis-a framework for unsupervised integration of multi-omics data sets. Mol Syst Biol. 14 (6), e8124(2018).
  75. Rohart, F., Gautier, B., Singh, A., Le Cao, K. A. mixOmics: An R package for 'omics feature selection and multiple data integration. PLoS Comput Biol. 13 (11), e1005752(2017).
  76. Arikan, M., Muth, T. Integrated multi-omics analyses of microbial communities: A review of the current state and future directions. Mol Omics. 19 (8), 607-623 (2023).
  77. Kloosterman, A. M., et al. Integration of machine learning and pan-genomics expands the biosynthetic landscape of RiPP natural products. bioRxiv. , (2020).
  78. Sathyanarayana, S. V., et al. DeepRetro: Retrosynthetic pathway discovery using iterative LLM reasoning. arXiv e-prints. , (2025).
  79. Zheng, S., et al. Deep learning driven biosynthetic pathways navigation for natural products with BioNavi-NP. Nat Commun. 13 (1), 3342(2022).
  80. Wang, W., Shuai, Y., Zeng, M., Fan, W., Li, M. DPFunc: Accurately predicting protein function via deep learning with domain-guided structure information. Nat Commun. 16 (1), 70(2025).
  81. Yu, T., et al. Enzyme function prediction using contrastive learning. Science. 379 (6639), 1358-1363 (2023).
  82. Casadevall, G., Duran, C., Osuna, S. AlphaFold2 and deep learning for elucidating enzyme conformational flexibility and its application for design. JACS Au. 3 (6), 1554-1562 (2023).
  83. Lee, Y. Y., et al. HypoRiPPAtlas as an Atlas of hypothetical natural products for mass spectrometry database search. Nat Commun. 14 (1), 4219(2023).
  84. Leao, T. F., et al. NPOmix: A machine learning classifier to connect mass spectrometry fragmentation data to biosynthetic gene clusters. PNAS Nexus. 1 (5), pgac257(2022).
  85. Hermann, E., Hermann, G., Tremblay, J. C. Ethical artificial intelligence in chemical research and development: A dual advantage for sustainability. Sci Eng Ethics. 27 (4), (2021).
  86. Mugahid, D., et al. A practical guide to FAIR data management in the age of multi-OMICS and AI. Front Immunol. 15, 1439434(2024).
  87. Lin, C. L., et al. Addressing standardization and semantics in an electronic lab notebook for multidisciplinary use: LabIMotion. J Cheminform. 17 (1), 75(2025).
  88. Alser, M., et al. Packaging and containerization of computational methods. Nat Protoc. 19 (9), 2529-2539 (2024).
  89. Blanco-Gonzalez, A., et al. The role of AI in drug discovery: Challenges, opportunities, and strategies. Pharmaceuticals (Basel). 16 (6), 891(2023).
  90. Mirakhori, F., Niazi, S. K. Harnessing the AI/ML in drug and biological products discovery and development: The regulatory perspective. Pharmaceuticals (Basel). 18 (1), 47(2025).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

관련 논문