$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio computacional basado en bases de datos no involucra participantes humanos, experimentos con animales ni muestras clínicas. Según el artículo 32 de las Medidas de China para la Revisión Ética de las Ciencias de la Vida y la Investigación Médica que Involucran a Sujetos Humanos, los estudios que utilizan datos públicos obtenidos legalmente, que no causan daño a sujetos humanos, que no implican información personal sensible y que no tienen intereses comerciales son elegibles para exención de la revisión ética. Por lo tanto, no se requiere una aprobación ética para este estudio.
El diseño experimental y la línea analítica de este estudio se ilustran en el diagrama de flujo (Figura 1).

Figura 1: Flujo de trabajo general del estudio. El diagrama ilustra el flujo secuencial de trabajo de la farmacología en red y los análisis de acoplamiento molecular, incluyendo la adquisición de componentes activos y objetivos de la Decocción de Sishen (SSD), la recopilación de objetivos relacionados con la gota, la identificación de objetivos superpuestos, la construcción de la red fármaco–componente–objetivo–enfermedad y de la red de interacción proteína–proteína (PPI), análisis de enriquecimiento de la Ontología Génica (GO) y la Enciclopedia de Genes y Genomas de Kyoto (KEGG). y simulaciones de acoplamiento molecular. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Adquisición de componentes activos y proteínas objetivo de SSD
El 2 de enero de 2026, los componentes químicos activos de las cinco hierbas que constituyen SSD, a saber, Huangqi, Yuanzhi, Huainiuxi, Shihu y Jinyinhua, fueron recuperados de la base de datos21 de la Farmacología de Sistemas de Medicina Tradicional China (TCMSP). Se aplicaron criterios de cribado basados en propiedades farmacocinéticas: biodisponibilidad oral (OB) del ≥30% y semejanza farmacológica (DL) de ≥0,1822. Los componentes que cumplían estos criterios se consideraron ingredientes activos potenciales. A continuación, se recogieron los objetivos correspondientes para cada componente. Dado que TCMSP carecía de datos completos para Yuanzhi y Shihu, los componentes químicos de estas dos hierbas se recuperaron además de la base de datos Herb 2.0 el mismo día. Tras obtener los nombres de los componentes, se realizó una búsqueda inversa en TCMSP utilizando los nombres de los componentes y los números CAS correspondientes como palabras clave para recuperar la información objetivo. Para los compuestos obtenidos de la base de datos Herb, solo se conservaron aquellos que coincidieron con entradas en TCMSP por nombre de componente o número CAS. Los compuestos emparejados fueron sometidos a los mismos criterios farmacocinéticos de cribado (OB ≥ 30% y DL ≥ 0,18) utilizando datos TCMSP, y se excluyeron los compuestos que carecían de información completa de OB o DL. Todos los compuestos emparejados y filtrados se verificaron manualmente con los registros originales de Herb 2.0 para evitar errores de identificación. Posteriormente, la información de los objetivos derivada de la base de datos de hierbas se fusionó con la de las hierbas restantes para generar el conjunto completo de objetivos de ingredientes activos para SSD.
Todas las proteínas objetivo recuperadas se estandarizaron como símbolos génicos oficiales utilizando la base de datos UniProt. Se estableció una correspondencia uno a uno manteniendo únicamente las entradas revisadas por humanos (Swiss-Prot) y excluyendo las entradas no revisadas (TrEMBL). Cuando múltiples isoformas correspondían al mismo símbolo genético, se seleccionaba la isoforma canónica. El conjunto de datos estandarizado de objetivos se mantuvo para el análisis posterior de genes intersectantes.
Recogida de objetivos relacionados con la gota
El 2 de enero de 2026 se realizaron búsquedas sistemáticas en las bases de datos GeneCards y OMIM utilizando "gota" como palabra clave para obtener objetivos relacionados con la gota. Los objetivos obtenidos de las dos bases de datos se exportaron a hojas de cálculo WPS (versión 12.1.0). La columna de Símbolos Génicos de OMIM se posicionó junto a la columna de Símbolos Génicos de GeneCards, y los objetivos duplicados se eliminaron usando la función "Eliminar Duplicados" basada en coincidencias exactas de símbolos génicos oficiales de forma insensible a mayúsculas minúsculas. Los objetivos de ambas bases de datos se fusionaron para construir un conjunto completo de objetivos relacionados con enfermedades relacionadas con la gota.
Identificación de objetivos solapados entre fármacos y enfermedades
El conjunto de objetivos de fármacos obtenido a partir de la detección de componentes activos y el conjunto de objetivos relacionados con la gota se colocaron en la misma carpeta del proyecto (D:\Venn). Se lanzó el software R (versión 4.4.0), y el paquete readxl se utilizó para importar archivos de Excel (.xlsx) que contenían las listas de destino. El paquete dplyr se utilizaba para la manipulación de datos, incluyendo filtrado y renombramiento de columnas antes del análisis de intersecciones. Los dos conjuntos de objetivos se convertían entonces en vectores de caracteres, y se identificaban los objetivos superpuestos usando la función calculate.overlap() del paquete VennDiagram. El paquete VennDiagram se instaló desde CRAN usando el comando install.packages("VennDiagram") y se almacenó en la ruta predeterminada de la biblioteca R. Si aparecía un mensaje indicando que el paquete ya había sido instalado, la instalación se consideraba exitosa. El directorio de trabajo se configuraba usando el comando setwd("D:\\Venn"), que designaba la carpeta que contenía los archivos de entrada y servía como directorio de salida. A continuación, se ejecutaba la prescripción R para calcular la intersección entre el conjunto de objetivos del fármaco y el conjunto de objetivos relacionados con la gota. Los objetivos superpuestos resultantes se definieron como posibles objetivos terapéuticos de la SSD para el tratamiento de la gota.
Construcción de la red "Fármaco-Componente-Enfermedad-Objetivo"
Los genes intersectantes identificados por la superposición entre objetivos SSD y objetivos relacionados con la gota se guardaban como el archivo overlapping_targets.txt , y la información activa del SSD se guardaba como el archivo drug_components.txt . Ambos archivos se colocaban en la carpeta del proyecto (D:\Network), que servía como directorio de trabajo para el análisis. Para asegurar la reproducibilidad, este análisis se realizó usando R. Las operaciones de lectura, filtrado y fusión de datos se realizaron usando una combinación de funciones base R, incluyendo read.table(), write.table() y merge(), junto con el paquete dplyr para la manipulación de tramas de datos. El comando setwd("D:\Network") se ejecutaba para definir explícitamente el directorio de trabajo.
La función graph_from_data_frame() se utilizaba como función central de integración. Cada fila de drug_components.txt vinculaba un componente activo a su gen objetivo correspondiente usando símbolos oficiales del gen. Solo se mantuvieron los objetivos presentes en overlapping_targets.txt y no se aplicó filtrado adicional más allá del requisito de intersección. El conjunto de datos de red resultante se exportó como network.txt en formato de lista de aristas. Cada fila contenía dos columnas (nodo1 y nodo2), donde nodo1 representaba la fórmula SSD o un componente activo, y nodo2 representaba un componente activo o un gen objetivo. El nodo de la enfermedad ("gota") estaba conectado a la fórmula SSD como un borde separado. No se asignaron pesos de aristas y todas las aristas se trataron por igual (ancho de arista = 0,8).
El archivo network.txt se importaba al software de visualización de red Cytoscape (versión 3.7.2). La herramienta integrada NetworkAnalyzer se accedió a través de las Herramientas → Análisis de Redes → Análisis de Red para obtener la estructura básica de la red, y se seleccionó "Distribución de Grados" como marco analítico. Se asignaron formas y colores de los nodos según los tipos de nodos: los diamantes azules representaban la fórmula SSD, los rectángulos azules los componentes activos, las elipses naranjas representaban los genes objetivo de la enfermedad y los octágonos rojos representaban la entidad de la enfermedad de la gota. El tamaño del nodo se estableció proporcional al grado del nodo (tamaño del nodo = 30 + grado × 5, tamaño máximo = 100).
Construcción de la Red de Interacción Proteína-Proteína (PPI)
El conjunto filtrado de genes objetivo que se intersectan fue importado a la base de datos STRING (versión 12.0) el 2 de enero de 2026. La especie se restringió a Homo sapiens, el umbral mínimo de confianza en la interacción se estableció en alta confianza (0,700), las proteínas desconectadas se ocultaron, las fuentes de interacción incluyeron todos los canales de evidencia disponibles y todos los demás parámetros se mantuvieron en sus configuraciones predeterminadas para obtener interacciones proteína-proteína conocidas y predichas. Los datos de red resultantes se exportaron en formato de valores separados por tabulación (TSV) utilizando las opciones de exportación predeterminadas.
La red exportada se importaba al software de visualización de redes para su visualización y análisis topológico. Las propiedades de la red se calculaban utilizando la herramienta integrada NetworkAnalyzer (Herramientas → Análisis de Redes → Análisis de Red). Las métricas calculadas incluían centralidad de grado, intermedia y centralidad de cercanía. Los tamaños de los nodos se asignaron a valores de grado usando una función de mapeo continua (tamaño del nodo = 20 + grados × 3, tamaño máximo = 80).
Los objetivos del hub se identificaron ordenando todos los nodos según valores de grado en orden descendente. Los nodos con valores de grado más altos se consideraban más centrales dentro de la red. Los nodos aislados (grado = 0) fueron excluidos de la visualización. La disposición de la red se disponía en círculos concéntricos desde el centro hacia fuera según la conectividad de los nodos, y los colores de los nodos se mapeaban usando un gradiente de azul a cian correspondiente a valores de grado crecientes. La red resultante se utilizó para identificar los objetivos centrales implicados en los posibles efectos terapéuticos de la SSD contra la gota.
Análisis de Enriquecimiento de Ontología Génica (GO)
Basándose en los genes objetivo solapados identificados, se realizó un análisis de enriquecimiento funcional GO usando R. Los paquetes Bioconductor requeridos se instalaron en la ruta predeterminada de la biblioteca R y se cargaron en el entorno de análisis. El archivo de genes que se intersectaban se almacenaba en el directorio del proyecto (D:\GO), y el directorio de trabajo se definía usando la función setwd().
La conversión y anotación de identificadores génicos se realizaban utilizando el organismo del paquete Bioconductor. Hs.eg.db (versión 3.20.0). Los símbolos oficiales de genes se convirtieron a identificadores de genes Entrez usando la función bitr() en el paquete de análisis de enriquecimiento clusterProfiler (versión 4.21.0). Solo se mantuvieron genes que mostraran mapeos únicos uno a uno para análisis posteriores, mientras que se excluyeron las entradas ambiguas o no mapeadas.
El análisis de enriquecimiento GO se realizó utilizando el paquete de análisis de enriquecimiento. La función enrichGO() se utilizó con las categorías ontológicas Proceso Biológico (BP), Componente Celular (CC) y Función Molecular (MF). La significación estadística se determinó utilizando el método de corrección de pruebas múltiples de Benjamini–Hochberg, considerando significativo un valor P ajustado < 0,05.
Para cada categoría de ontología, los términos significativamente enriquecidos se clasificaron según el factor de enriquecimiento:
EF = (recuento génico / genes de fondo total) ÷ (tamaño del término / genes totales del genoma)
Se seleccionaron los 10 términos principales para un análisis detallado. Cuando se produjeron factores de enriquecimiento idénticos, los términos con valores P ajustados más bajos se clasificaron por encima de la clasificación.
Los resultados del enriquecimiento se visualizaron usando ggplot2 (versión 3.5.1) y enrichplot (versión 1.24.0). Los gráficos de burbujas y gráficos de barras se generaban usando las funciones dotplot() y barplot(). El tamaño de la burbuja representaba el número de genes enriquecidos, mientras que el color correspondía a la significación de enriquecimiento expresada como −log10 (valor P ajustado). Se usaron parámetros de trazado por defecto en todo el proceso.
Análisis de enriquecimiento de vías KEGG
El análisis de enriquecimiento de vías KEGG de los objetivos intersectados de SSD y gota se realizó utilizando R y el paquete de análisis de enriquecimiento descrito anteriormente. Los símbolos génicos se convertían en identificadores compatibles con KEGG usando la función bitr() proporcionada por el paquete de análisis de enriquecimiento, con KEGG como recurso de anotación. El análisis de enriquecimiento de vías se realizó utilizando la función enrichKEGG() basada en la prueba hipergeométrica. La significación estadística se determinó mediante el método de corrección de pruebas múltiples de Benjamini–Hochberg (BH), y se consideraron significativamente enriquecidas las vías con un valor P ajustado < 0,05.
Los resultados de enriquecimiento se exportaron a archivos de libro de trabajo compatibles con Microsoft Excel usando el paquete openxlsx (versión 4.2.8.1) y la función write.xlsx() para la revisión y preparación de figuras posteriores.
Posteriormente se construyó una red de interacción objetivo-vía multinivel utilizando el software de visualización de red. Los datos de red se importaban usando File → Import → Network from File. Los nodos consistían en nodos génicos objetivo y nodos de vías KEGG significativamente enriquecidos (valor P ajustado por BH < 0,05), mientras que los bordes representaban asociaciones documentadas entre genes objetivo y vías enriquecidas identificadas durante el análisis de enriquecimiento. La visualización de red se realizó utilizando el panel de Estilo del software de visualización de red, con genes objetivo mostrados como elipses grises y caminos como rectángulos cian. No se usaron plugins adicionales. La red se generaba manualmente a partir de la tabla de salida de enriquecimiento para visualizar las relaciones entre los objetivos centrales y las vías significativamente enriquecidas.
Validación de acoplamiento molecular
Los archivos de estructura 3D (formato MOL2) de los 10 componentes activos principales clasificados por conectividad objetivo en la red "fármaco–componente–objetivo–enfermedad" se descargaron de la base de datos TCMSP. La conectividad objetivo se definía como el grado del nodo (es decir, el número de conexiones directas entre un componente activo y genes objetivo en la red). Los componentes activos se clasificaron en orden descendente según los valores de grado, y los 10 componentes principales fueron seleccionados para el análisis de acoplamiento molecular.
Las estructuras cristalinas de las 10 principales proteínas objetivo central identificadas a partir de la red de PPI se obtuvieron del Banco de Datos de Proteínas (PDB) del RCSB el 23 de enero de 2026. La especie estaba restringida al Homo sapiens. Para cada proteína objetivo, se seleccionó preferentemente la estructura con mayor resolución cristalográfica (valor de Å más bajo), sin mutaciones y cocristalizada con un ligando o inhibidor nativo. Si múltiples estructuras cumplían estos criterios, se seleccionaba la estructura con mayor resolución y mayor cobertura de secuencias proteicas más completa. Se utilizaron las siguientes estructuras PDB: 1GKC (MMP9), 5WHH (BCL2), 2P33 (JUN), 1RHJ (CASP3), 1WT5 (EGFR), 7APJ (AKT1), 1DU3 (TNF), 1T4Q (IL1B), 4NI9 (IL6) y 9CKJ (TP53).
Las simulaciones de acoplamiento molecular se realizaron utilizando el servidor online CB-Dock 2 (versión web, consultado el 23 de enero de 2026), que emplea AutoDock Vina como motor de acoplamiento. Las estructuras proteicas fueron preprocesadas automáticamente por el servidor, incluyendo la eliminación de heteroátomos y la preparación de las estructuras receptoras. Los ligandos se subieron en formato MOL2. Se utilizó la detección de cavidades independiente de la plantilla, identificando automáticamente cinco cavidades potenciales de unión para cada estructura proteica. Los cálculos de acoplamiento se realizaron usando los parámetros predeterminados del motor de acoplamiento: exhaustividad = 8, rango de energía = 4 y número máximo de modos de enlace = 9.
Para cada par objetivo–compuesto, el acoplamiento se realizó de forma independiente dentro de cada una de las cinco cavidades detectadas. Las posturas de acoplamiento se evaluaron usando la función de puntuación del motor de acoplamiento, y la pose con la menor energía de enlace dentro de cada cavidad se mantuvo como conformación representativa de esa cavidad. Entre las cinco conformaciones representativas, la pose de acoplamiento con la energía de enlace globalmente más baja fue seleccionada como resultado final para ese par objetivo–compuesto y utilizada para análisis posteriores.
El valor de energía de enlace más bajo obtenido para cada resultado de acoplamiento se registró en una hoja de cálculo e importó a la plataforma de trazado en línea Weishengxin (consultado el 23 de enero de 2026) para generar un mapa de calor usando parámetros por defecto. El mapa de calor empleaba un gradiente de color de amarillo a rojo, agrupamiento jerárquico de enlace completo y distancia euclidiana como métrica de agrupamiento.
Las interacciones entre enlace de hidrógeno se identificaban automáticamente mediante el módulo de análisis del servidor de acoplamiento en función de criterios geométricos. Un enlace de hidrógeno se definió como una interacción con una distancia donante–aceptor ≤ 3,5 Å y un ángulo donante–hidrógeno–aceptor ≥ 120°. Los enlaces de hidrógeno se mostraban como líneas discontinuas en diagramas de interacción bidimensionales y tridimensionales. Se seleccionó el par proteína-componente activo que presentaba la energía de unión globalmente más baja entre todas las combinaciones de acoplamiento para un análisis detallado de interacción. Esta selección se basaba en un par objetivo–compuesto en lugar de una pose de acoplamiento individual y tenía como objetivo identificar la interacción predicha más fuerte dentro de la red. La pose de acoplamiento representativa final correspondiente a este par objetivo-compuesto se utilizó para visualización y análisis de interacción.
Se generaron diagramas de interacción tridimensionales y bidimensionales utilizando ChimeraX versión 1.5 y LigPlot+ versión 2.2, respectivamente. En ChimeraX, las proteínas se mostraban usando la representación de dibujos animados por defecto, los ligandos en modo stick, los enlaces de hidrógeno se mostraban como líneas discontinuas y se aplicaba el esquema de colores por defecto. En LigPlot+, la identificación de enlaces de hidrógeno se realizó utilizando el algoritmo HBPLUS con un umbral de distancia donante–aceptador de 3,9 Å y un umbral de ángulo de 90°. Todos los demás parámetros de visualización se mantuvieron en sus configuraciones predeterminadas.