$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
이 데이터베이스 기반 계산 연구는 인간 참가자, 동물 실험, 임상 샘플을 포함하지 않습니다. 중국 생명과학 및 의학 연구 대상 윤리심사 조치 제32조에 따르면, 합법적으로 공개된 데이터를 사용하고, 인간에게 해를 끼치지 않으며, 민감한 개인 정보가 포함되지 않고, 상업적 이익이 없는 연구는 윤리심사 면제 대상이 됩니다. 따라서 이 연구에는 윤리적 승인이 필요하지 않습니다.
이 연구의 실험 설계 및 분석 파이프라인은 플로우차트(그림 1)에 나와 있습니다.

그림 1: 연구의 전체 워크플로우. 이 흐름도는 네트워크 약리학 및 분자 도킹 분석의 순차적 작업 흐름을 보여주며, 여기에는 시신 데오션(SSD)의 활성 성분 및 표적 획득, 통풍 관련 표적 수집, 중첩 표적 식별, 약물-성분-표적-질병 네트워크 및 단백질-단백질 상호작용(PPI) 네트워크 구축, 유전자 온톨로지(GO) 및 교토 유전자 및 유전체 백과사전(KEGG) 풍부화 분석 등이 포함됩니다. 그리고 분자 도킹 시뮬레이션을 포함합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
SSD의 활성 성분 및 표적 단백질 획득
2026년 1월 2일, SSD를 구성하는 다섯 가지 약초인 황기, 원지, 화이니우시, 시후, 진음화의 활성 화학 성분이 중의학 체계 약리학(TCMSP) 데이터베이스21에서 확인되었습니다. 약동학적 특성을 기반으로 한 선별 기준이 적용되었는데, 경구 생체이용률(OB)은 ≥30%, 약물 유사성(DL)은 ≥0.1822였습니다. 이 기준을 충족하는 성분은 잠재적 활성 성분으로 간주되었습니다. 각 구성 요소에 대응하는 표적이 수집되었습니다. TCMSP가 원지와 시후에 대한 완전한 데이터를 갖지 못했기 때문에, 같은 날 이 두 허브의 화학 성분도 허브 2.0 데이터베이스에서 추가로 검색되었습니다. 부품 이름을 얻은 후, TCMSP에서 부품 이름과 해당 CAS 번호를 키워드로 사용하여 역검색을 수행하여 목표 정보를 얻었습니다. 허브 데이터베이스에서 얻은 화합물의 경우, TCMSP의 항목과 성분명 또는 CAS 번호로 성공적으로 일치한 화합물만 보존되었습니다. 일치된 화합물들은 TCMSP 데이터를 사용해 동일한 약물동학 선별 기준(OB ≥ 30%, DL ≥ 0.18)을 적용했으며, 완전한 OB 또는 DL 정보가 없는 화합물은 제외하였다. 모든 일치 및 필터링된 화합물은 오인 식별을 방지하기 위해 원본 허브 2.0 기록과 수동으로 검증되었습니다. 이후 허브 데이터베이스에서 도출된 표적 정보를 나머지 허브와 통합하여 SSD의 전체 활성 성분 표적 세트를 생성했습니다.
회수된 모든 표적 단백질은 UniProt 데이터베이스를 통해 공식 유전자 심볼로 표준화되었습니다. 인간 검토(Swiss-Prot) 항목만 유지하고 검토되지 않은 항목(TrEMBL)은 제외하여 일대일 대응 관계를 구축했습니다. 여러 아이소폼이 동일한 유전자 기호에 대응할 경우, 표준 아이소폼이 선택되었습니다. 표준화된 표적 데이터셋은 이후 교차 유전자 분석을 위해 보존되었습니다.
통풍 관련 표적 수집
2026년 1월 2일, GeneCards 데이터베이스와 OMIM 데이터베이스에서 통풍 관련 질병 표적을 얻기 위해 '통풍'이라는 질병 키워드를 사용해 체계적인 검색이 실시되었습니다. 두 데이터베이스에서 얻은 목표값은 WPS 스프레드시트(버전 12.1.0)로 내보내졌습니다. OMIM의 유전자 심볼 열은 GeneCards의 유전자 심볼 열과 인접하여 배치되었고, 공식 유전자 심볼의 정확한 일치를 기반으로 대문자 구분 없이 "중복 제거" 기능을 사용해 중복 표적을 제거했습니다. 두 데이터베이스의 표적을 통합하여 통풍 관련 질병의 포괄적인 표적 세트를 구축했습니다.
약물-질병 중복 표적 식별
활성 성분 선별에서 얻은 약물 표적 집합과 통풍 관련 질환 표적 집합은 동일한 프로젝트 폴더(D:\Venn)에 배치되었습니다. R 소프트웨어(버전 4.4.0)가 출시되었고, readxl 패키지를 사용해 대상 리스트가 포함된 Excel(.xlsx) 파일을 가져오는 데 사용되었습니다. dplyr 패키지는 교차 분석 전에 칼럼 필터링과 이름 변경을 포함한 데이터 조작에 사용되었습니다. 두 표적 집합은 문자 벡터로 변환되었고, VennDiagram 패키지의 calculate.overlap() 함수를 사용해 겹치는 표적을 식별했습니다. VennDiagram 패키지는 CRAN에서 install.packages("VennDiagram") 명령어를 사용하여 설치되었고, 기본 R 라이브러리 경로에 저장되었습니다. 패키지가 이미 설치되었다는 메시지가 뜨면 설치가 성공한 것으로 간주됩니다. 작업 디렉터리는 setwd("D:\\Venn")라는 명령어를 사용하여 설정되었으며, 이 명령어는 입력 파일이 담긴 폴더를 지정하고 출력 디렉터리 역할을 했습니다. 그 후 R 스크립트를 실행하여 약물 표적 집합과 통풍 관련 질병 표적 집합 간의 교차점을 계산했습니다. 이로 인해 겹치는 표적들은 통풍 치료를 위한 SSD의 잠재적 치료 표적으로 정의되었습니다.
"약물-성분-표적-질병" 네트워크 구축
SSD 표적과 통풍 관련 표적 간 겹침에서 확인된 교차 유전자는 overlapping_targets.txt 파일로 저장되었고, SSD의 활성 구성 요소 정보는 drug_components.txt 파일로 저장되었습니다. 두 파일은 분석 작업 디렉터리 역할을 하는 프로젝트 폴더(D:\Network)에 배치되었습니다. 재현성을 보장하기 위해 이 분석은 R을 사용하여 수행되었습니다. 데이터 읽기, 필터링, 병합 작업은 read.table(), write.table(), merge() 등 기본 R 함수와 데이터 프레임 조작을 위한 dplyr 패키지를 조합하여 수행되었습니다. setwd("D:\Network") 라는 명령어가 실행되어 작업 디렉터리를 명시적으로 정의했습니다.
graph_from_data_frame() 함수는 핵심 적분 함수로 사용되었습니다. 각 drug_components.txt 행은 공식 유전자 기호를 사용해 활성 성분을 해당 목표 유전자와 연결했습니다. overlapping_targets.txt에 존재하는 표적만 유지되었으며, 교차 요구사항을 넘어선 추가 필터링은 적용되지 않았습니다. 생성된 네트워크 데이터셋은 엣지 리스트 형식으로 network.txt 내보내졌습니다. 각 행은 두 개의 열(node1과 node2)을 포함했으며, node1은 SSD 공식이나 활성 성분을, node2는 활성 성분 또는 표적 유전자를 나타냈습니다. 질병 결절('통풍')은 SSD 공식에 별도의 엣지로 연결되었습니다. 엣지 가중치는 할당되지 않았고, 모든 엣지가 동일하게 처리되었습니다(엣지 폭 = 0.8).
network.txt 파일은 Cytoscape(버전 3.7.2) 네트워크 시각화 소프트웨어로 임포트되었습니다. 내장된 NetworkAnalyzer 도구는 Tools → Network Analysis → Analyze Network 통해 접근하여 기본 네트워크 구조를 얻었고, 분석 프레임워크로 "Degree Distribution"이 선택되었습니다. 노드 형태와 색상은 노드 유형에 따라 할당되었는데, 파란색 다이아몬드는 SSD 공식을, 파란색 직사각형은 활성 성분을, 주황색 타원은 질병 표적 유전자를, 빨간색 팔각형은 통풍 질환 엔티티를 나타냈습니다. 노드 크기는 노드 차수에 비례하도록 설정되었습니다(노드 크기 = 30 + 도수 × 5, 최대 크기 = 100).
단백질-단백질 상호작용(PPI) 네트워크 구축
필터링된 교차 대상 유전자 집합은 2026년 1월 2일 STRING 데이터베이스(버전 12.0)에 도입되었습니다. 종은 호모 사피엔스로 제한되었고, 최소 상호작용 신뢰 임계값은 높은 신뢰도(0.700)로 설정되었으며, 분리된 단백질은 숨겨졌고, 상호작용 출처는 모든 이용 가능한 증거 채널을 포함했으며, 기타 모든 매개변수는 기본 설정으로 유지되어 알려진 단백질-단백질 상호작용을 얻었습니다. 생성된 네트워크 데이터는 기본 내보내기 옵션을 사용하여 탭 분리 값(TSV) 형식으로 내보내졌습니다.
내보낸 네트워크는 시각화 및 위상 분석을 위해 네트워크 시각화 소프트웨어로 가져왔습니다. 네트워크 속성은 내장된 NetworkAnalyzer 도구(네트워크 분석 → 분석 도구)→ 네트워크 분석 도구)를 사용하여 계산되었습니다. 계산된 지표에는 정도, 간간성 중심성, 그리고 친밀성 중심성이 포함되었습니다. 노드 크기는 연속 매핑 함수(노드 크기 = 20 + 도 × 3, 최대 크기 = 80)를 사용하여 차수 값에 매핑되었습니다.
허브 목표는 모든 노드를 등급 값에 따라 내림차순으로 정렬하여 식별했습니다. 더 높은 등급 값을 가진 노드는 네트워크 내에서 더 중심에 있는 것으로 간주되었습니다. 고립된 노드(degree = 0)는 시각화에서 제외되었습니다. 네트워크 배치는 노드 연결성에 따라 중심에서 바깥쪽으로 동심원으로 배열되었고, 노드 색상은 차도 값이 증가하는 파란색에서 청록색 구배로 매핑되었습니다. 이 네트워크는 SSD가 통풍에 미치는 잠재적 치료 효과에 관여하는 핵심 허브 표적을 확인하는 데 사용되었습니다.
유전자 온톨로지(GO) 풍부화 분석
확인된 중복 표적 유전자를 바탕으로 R 언어를 사용하여 GO 기능 풍부 분석이 수행되었습니다. 필수 생체전도 패키지가 기본 R 라이브러리 경로에 설치되어 분석 환경에 로드되었습니다. 교차하는 유전자 파일은 프로젝트 디렉터리(D:\GO)에 저장되었고, 작업 디렉터리는 setwd() 함수를 사용해 정의되었습니다.
유전자 식별자 변환 및 주석은 Bioconductor 패키지 조직을 사용하여 수행되었습니다. Hs.eg.db (버전 3.20.0). 공식 유전자 심볼은 clusterProfiler enrichment analysis 패키지(버전 4.21.0)의 bitr() 함수를 사용하여 Entrez 유전자 ID로 변환되었습니다. 고유 1:1 매핑을 보이는 유전자만 후속 분석에 남겨졌으며, 모호하거나 매핑되지 않은 항목은 제외되었습니다.
GO 농축 분석은 농축 분석 패키지를 사용하여 수행되었습니다. enrichGO() 기능은 생물학적 과정(BP), 세포 구성 요소(CC), 분자 기능(MF) 온톨로지 범주와 함께 사용되었습니다. 통계적 유의성은 벤자미니-호흐버그 다중 검정 보정법을 사용하여 결정되었으며, 조정된 P-값 0.05< 유의한 것으로 간주되었습니다.
각 온톨로지 범주별로 유의미하게 풍부해진 용어가 풍부화 계수에 따라 순위가 매겨졌습니다:
EF = (유전자 수 / 총 배경 유전자) ÷ (학기 크기 / 총 유전체 유전자)
상위 10개 용어가 상세 분석을 위해 선정되었습니다. 동일한 농축 인자가 발생했을 때, 조정된 P-값이 낮은 항이 더 높은 순위로 평가되었습니다.
풍부도 결과는 ggplot2(버전 3.5.1)와 enrichplot(버전 1.24.0)을 사용하여 시각화되었습니다. 버블 플롯과 막대 차트는 dotplot()과 barplot() 함수를 사용하여 생성되었습니다. 버블 크기는 풍부 유전자 수를 나타내고, 색상은 −log10(조정 P-값)으로 표현되는 풍부도 유의성에 대응했습니다. 기본 플롯 매개변수가 전반적으로 사용되었습니다.
KEGG 경로 농축 분석
SSD와 통풍의 교차 표적에 대한 KEGG 경로 농축 분석은 R과 앞서 설명한 농축 분석 패키지를 사용하여 수행되었습니다. 유전자 심볼은 농도 분석 패키지에서 제공하는 bitr() 함수를 사용해 KEGG 호환 식별자로 변환되었으며, KEGG는 주석 자원 역할을 했습니다. 경로 풍부도 분석은 초기하학적 검정을 기반으로 enrichKEGG() 함수를 사용하여 수행되었습니다. 통계적 유의성은 Benjamini–Hochberg(BH) 다중 검정 보정법을 사용하여 산출되었으며, 조정된 P-값 0.05< 경로는 유의하게 풍부한 것으로 간주되었습니다.
풍부화 결과는 openxlsx 패키지(버전 4.2.8.1)와 write.xlsx() 기능을 사용하여 Microsoft Excel 호환 워크북 파일로 내보내져 이후 검토 및 그림 준비에 사용되었습니다.
이후 네트워크 시각화 소프트웨어를 사용하여 다단계 표적-경로 상호작용 네트워크가 구축되었습니다. 네트워크 데이터는 파일 → '파일에서 네트워크→ 가져오기'를 통해 가져왔습니다. 노드는 표적 유전자 노드와 유의미하게 농축된 KEGG 경로 노드(BH 조정 P-값 < 0.05)로 구성되었으며, 엣지는 표적 유전자와 풍부 분석 중 확인된 풍부한 경로 간의 문서화된 연관성을 나타냈다. 네트워크 시각화는 네트워크 시각화 소프트웨어의 스타일 패널을 사용하여 수행되었으며, 목표 유전자는 회색 타원으로, 경로는 청록색 직사각형으로 표시되었습니다. 추가 플러그인은 사용하지 않았습니다. 이 네트워크는 핵심 표적과 유의미하게 농축된 경로 간의 관계를 시각화하기 위해 농축 출력 표에서 수동으로 생성되었습니다.
분자 도킹 검증
"약물-성분-표적-질병" 네트워크에서 표적 연결성에 따라 순위가 매겨진 상위 10개의 활성 성분의 3D 구조 파일(MOL2 형식)은 TCMSP 데이터베이스에서 다운로드되었습니다. 표적 연결성은 노드 정도(즉, 네트워크 내 활성 성분과 목표 유전자 간의 직접 연결 수)로 정의되었습니다. 활성 성분은 등급 값에 따라 내림차순으로 순위가 매겨졌고, 상위 10개 성분이 분자 도킹 분석을 위해 선정되었습니다.
PPI 네트워크에서 확인된 상위 10개의 허브 타깃 단백질의 결정 구조는 2026년 1월 23일 RCSB 단백질 데이터 뱅크(PDB)에서 얻어졌습니다. 이 종은 호모 사피엔스에만 제한되었습니다. 각 표적 단백질에 대해, 돌연변이가 없고 천연 리간드 또는 억제제와 동체화된 가장 높은 결정학적 해상도(Å 값)를 가진 구조가 우선적으로 선택되었습니다. 여러 구조가 이 기준을 충족하면, 가장 높은 해상도와 가장 완전한 단백질 서열 커버리지를 가진 구조가 선택되었습니다. 다음 PDB 구조가 사용되었습니다: 1GKC(MMP9), 5WHH (BCL2), 2P33 (JUN), 1RHJ(CASP3), 1WT5 (EGFR), 7APJ(AKT1), 1DU3 (TNF), 1T4Q (IL1B), 4NI9 (IL6), 9CKJ (TP53).
분자 도킹 시뮬레이션은 AutoDock Vina를 도킹 엔진으로 사용하는 CB-Dock 2 온라인 서버(웹 버전, 2026년 1월 23일 접속)를 사용하여 수행되었습니다. 단백질 구조는 서버에 의해 자동으로 전처리되었으며, 여기에는 이형원자 제거와 수용체 구조 준비가 포함됩니다. 리간드는 MOL2 형식으로 업로드되었습니다. 주형에 의존하지 않는 공동체 검출이 사용되었으며, 각 단백질 구조별로 5개의 잠재적 결합 공동이 자동으로 식별되었습니다. 도킹 계산은 도킹 엔진 기본 매개변수를 사용하여 수행되었습니다: 전차성 = 8, 에너지 범위 = 4, 최대 바인딩 모드 수 = 9.
각 표적-복합물 쌍에 대해 다섯 개의 탐지된 공동들 각각에서 독립적으로 도킹이 수행되었다. 도킹 포즈는 도킹 엔진 점수 함수를 사용해 평가했으며, 각 공동에서 가장 낮은 결합 에너지를 가진 포즈가 해당 공동의 대표 구조로 유지되었습니다. 다섯 가지 대표 구조 중 전역적으로 가장 낮은 결합 에너지를 가진 도킹 자세가 최종 도킹 결과로 선택되어 이후 분석에 사용되었습니다.
각 도킹 결과에 대해 얻은 최저 결합 에너지 값은 스프레드시트에 기록되어 2026년 1월 23일 접속된 위성신 온라인 플롯팅 플랫폼에 가져와 기본 매개변수를 사용하여 열지도를 생성했습니다. 히트맵은 노란색에서 빨간색으로 이어지는 색상 그라데이션, 완전 연계 계층적 군집, 그리고 군집 지표로 유클리드 거리를 사용했습니다.
수소-결합 상호작용은 도킹 서버 분석 모듈에 의해 기하학적 기준에 따라 자동으로 식별되었습니다. 수소 결합은 공여체-수용체 거리 3.5 Å≤ 공여체-수소-수용체 각도가 120°≥ 상호작용으로 정의되었습니다. 수소 결합은 2차원 및 3차원 상호작용 도표 모두에서 점선으로 표시되었습니다. 모든 도킹 조합 중 전 세계적으로 가장 낮은 결합 에너지를 보이는 표적 단백질-활성 성분 쌍이 상세 상호작용 분석을 위해 선정되었습니다. 이 선택은 개별 도킹 포즈가 아닌 단일 표적-복합물 쌍을 기반으로 했으며, 네트워크 내에서 가장 강한 예측 상호작용을 식별하기 위한 것이었습니다. 이 표적-화합물 쌍에 해당하는 최종 대표 도킹 자세는 시각화 및 상호작용 분석에 사용되었습니다.
3차원 및 2차원 상호작용 다이어그램은 각각 ChimeraX 버전 1.5와 LigPlot+ 버전 2.2를 사용해 생성되었습니다. ChimeraX에서는 단백질이 기본 만화 표현으로 표시되었고, 리간드는 스틱 모드로, 수소 결합은 점선으로 표시되었고, 기본 색상 체계가 적용되었습니다. LigPlot+에서는 HBPLUS 알고리즘을 사용하여 수소-결합 식별이 수행되었으며, 기증자-수용체 거리 임계값은 3.9 Å, 각도 임계값은 90°였습니다. 다른 모든 시각화 매개변수는 기본 설정으로 유지되었습니다.