$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este protocolo describe un método computacional para definir los posibles biomarcadores del daño hepático inducido por acetaminofén, que aprovecha la toxicología de redes, transcriptómica, aprendizaje automático y acoplamiento molecular (Figura 1). El protocolo está dirigido a investigadores que tienen acceso a herramientas de bioinformática, conjuntos de datos transcriptómicos y software de acoplamiento molecular.
Procedimiento
Paso 1: Identificación de los objetivos del paracetamol
Recupera la representación SMILES del paracetamol (APAP) de PubChem. Utiliza plataformas en línea (ChEMBL, SwissTargetPrediction, STITCH, SEA) para predecir posibles objetivos moleculares de APAP. Integrar y deduplicar los objetivos predichos para generar una lista de 140 objetivos APAP de alta confianza.
Paso 2: Identificación de objetivos de hepatotoxicidad
Recuperar genes relacionados con hepatotoxicidad de la base de datos GeneCards. Compila y deduplica la lista para generar un conjunto no redundante de 657 genes relacionados con la hepatotoxicidad. Identificar genes superpuestos entre los objetivos de APAP y los genes relacionados con hepatotoxicidad utilizando un diagrama de Venn.
Paso 3: Preprocesamiento de datos transcriptómicos
Descarga el conjunto de datos GSE74000 de GEO. Preprocesar los datos de expresión en bruto usando DESeq2: eliminar genes de baja expresión, normalizar usando factores de tamaño y aplicar la transformación estabilizadora de varianza (VST). Realizar análisis de expresión diferencial usando Limma y DESeq2, con umbrales de valor p ajustado < 0,05 y |log 2FC| > 1.
Paso 4: Análisis de Enriquecimiento Funcional
Subir genes superpuestos a STRING para análisis de Ontología Génica (GO), vía KEGG, expresión tisular y correlación de enfermedades. Visualiza los resultados del enriquecimiento funcional usando diagramas de burbujas y mapas de calor.
Paso 5: Aprendizaje automático para la selección de genes de características
Aplicar un clasificador de Bosque Aleatorio (n_estimators=500, max_depth=10) para priorizar genes de características de los genes solapados APAP y de hepatotoxicidad. Evalúa el rendimiento del modelo utilizando el error Out-of-Bag (OOB) y las puntuaciones de importancia de las características. Selecciona los 20 genes principales de las características para un análisis más detallado.
Paso 6: Acoplamiento molecular
Recuperar la estructura APAP (CID 1983) de PubChem y receptores proteicos (ESR1: PDB ID 1SJ0, PNP: PDB ID 1V2H) de PDB. Prepara archivos de ligandos y receptores: convierte a formato PDB, añade hidrógenos polares, asigna cargas y guarda como archivos PDBQT. Define la cuadrícula de acoplamiento en AutoDock Tools, que cubre el sitio activo de la proteína. Realiza acoplamiento molecular usando AutoDock Vina, con exhaustividad ajustada a 8, y analiza afinidades e interacciones de enlace. Visualiza los resultados del acoplamiento usando PyMOL para analizar conformaciones de enlace e interacciones de claves.
Paso 7: Análisis estadístico
Determinar la significación estadística usando pruebas t y ajustar los valores p para comparaciones múltiples utilizando el métodode Benjamini-Hochberg 31. Visualiza asociaciones estadísticamente significativas usando mapas de calor y diagramas de dispersión.
Materiales y métodos
Identificación de objetivos del paracetamol
Para identificar posibles objetivos moleculares de APAP, primero recuperamos su representación SMILES de la base de datos PubChem. Posteriormente utilizamos varias plataformas en línea, incluyendo el Laboratorio Europeo de Biología Molecular Química (ChemBL)32, Swiss TargetPrediction 33, Search Tool for the Interaction of Chemicals and Targets (STITCH)34 y el enfoque de conjunto de similitudes (SEA)35, para predecir sus posibles objetivos. Tras integrar los resultados de estas herramientas, seleccionamos un conjunto de objetivos de alta confianza para APAP. La Tabla 1 define las principales categorías génicas utilizadas en este estudio, aclarando su papel en el análisis de datos y la interpretación biológica. El uso constante de estos términos garantiza una comunicación clara de nuestros resultados.
Identificación de objetivos de hepatotoxicidad
Se recuperaron genes potencialmente asociados a la hepatotoxicidad de la base de datos GeneCards. Se compilaron todos los genes identificados, se eliminaron duplicados y se generó una lista no redundante para análisis posteriores. El conjunto de datos GSE74000 fue descargado del repositorio GEO el 15 de marzo de 2024. Los datos de expresión en bruto se procesaron y normalizaron utilizando el paquete limma (normalización cuantil). El análisis diferencial de expresión se realizó mediante modelado lineal con contracción bayesiana empírica. Genes que cumplen con el valor p ajustado < 0,05 (Benjamini-Hochberg FDR) y |log₂FC| > 1 se consideraban significativas. La visualización de los DEGs se realizó utilizando gráficos de volcán y mapas de calor generados con ggplot2.
Preprocesamiento de datos
Los datos de recuento en bruto se preprocesaron usando DESeq2. Los genes de baja expresión se eliminaron utilizando un umbral de detección de CPM >1 en al menos el 70% de las muestras. La normalización del tamaño de la biblioteca se realizó utilizando factores de tamaño DESeq2, tal como se define en la ecuación (1):
(1)
Donde el factor de tamaño de la razón mediana se denota por sj. Para estabilizar las relaciones media-varianza, se utilizó una transformación estabilizadora de la varianza (VST) en la ecuación (2):
(2)
Los DEG se identificaron mediante la prueba de Wald con corrección de Benjamini-Hochberg, considerando genes significativos si se usan en la ecuación (3):
(3)
El conjunto DEG derivado de DESeq2 se definió como la ecuación (4):
(4)
Este conjunto (X) se utilizó en la estrategia de consenso junto con la tendencia Limma (Y) y la Limma Voom (Z).
Construcción de redes PPI
Se utilizaron diagramas de Venn para identificar genes comunes entre los objetivos APAP y de hepatotoxicidad. Los genes superpuestos se subieron entonces a la base de datos Search Tool for the Retrieval of Interacting Genes/Proteins (STRING) para construir redes PPI.
Análisis de enriquecimiento funcional multidimensional
Primero realizamos análisis de Ontología Génica (GO), Enciclopedia de Genes y Genomas de Kyoto (KEGG), expresión tisular y análisis funcionales relacionados con enfermedades de los genes superpuestos para APAP y hepatotoxicidad utilizando la web STRING. A continuación, realizamos análisis de enriquecimiento de GO, KEGG y Análisis de Enriquecimiento de Conjuntos Génicos (GSEA) (REACTOME) de los genes diferenciales para hepatotoxicidad utilizando herramientas académicas de Sendo.
Análisis de bosque aleatorio
Aplicamos aprendizaje automático para identificar los 20 genes principales de características a partir de los genes superpuestos de APAP y hepatotoxicidad en los datos del transcriptoma de hepatotoxicidad inducida por APAP. Se implementó un clasificador de Bosque Aleatorio, con 500 árboles (n_estimators=500), profundidad máxima de árboles de 10 (max_depth=10), mínimo 2 muestras necesarias para partir un nodo (min_samples_split=2) y el criterio de impureza de Gini (criterio='gini')36. El rendimiento del modelo se evaluó utilizando el error Out-of-Bag (OOB), donde un valor cercano a 0 indica una mayor precisión predictiva. Las puntuaciones de importancia de las características se calcularon y visualizaron basándose en el análisis de Bosque Aleatorio para clasificar la contribución de cada gen, como en la ecuación (5).
(5)
N era el número total de muestras, yi era la función 1(·) una función indicadora, 1 si la condición era cierta y 0 en caso contrario;
fue la etiqueta prevista de la muestra iii usando solo árboles donde iii no se incluyó en la formación.
Expresión diferencial de genes caracterizados
Las diferencias de expresión de los genes de características en los datos transcriptómicos se visualizaron utilizando gráficos de violín. Se identificaron biomarcadores que mostraron diferencias estadísticamente significativas como posibles biomarcadores novedosos de hepatotoxicidad inducida por APAP para una investigación más profunda.
Acoplamiento molecular
Se recuperaron compuestos de pequeñas moléculas (CID 1983) de la base de datos PubChem, y los receptores proteicos ESR1 y PNP (IDs PDB 1SJ0 y 1V2H) se descargaron del Banco de Datos de Proteínas. Las estructuras de ligandos se convirtieron al formato PDB usando OpenBabel y se preprocesaron en AutoDock Tools añadiendo hidrógenos polares, asignando cargas de Gasteiger, definiendo enlaces rotativos y ahorrando en formato PDBQT. Los receptores proteicos se prepararon usando PyMOL eliminando moléculas de agua y ligandos cocristalizados, seguido de la adición de hidrógenos polares y asignación de cargas de Kollman usando AutoDock Tools, y guardados como archivos PDBQT.
En el acoplamiento molecular, se utilizó software AutoDock para definir la rejilla de acoplamiento que cubre el sitio activo de la proteína37. La cuadrícula estaba centrada en las coordenadas (x = XX·XX, y = YY· YY,z = ZZ· ZZ) con dimensiones de 40 × 40 × 40 Å y un espaciado de 0,375 Å, asegurando una cobertura completa de la bolsa de encuadernación. AutoDock Vina se empleó para calcular los modos de unión ligando-proteína y las afinidades de unión, con el parámetro de exhaustividad establecido en 8, y se generaron las nueve primeras posturas de unión para cada ligando.
La validación del protocolo de acoplamiento se realizó reacoplando el ligando cocristalizado en el sitio activo, lo que obtuvo un valor RMSD de < 2,0 Å, confirmando la fiabilidad del procedimiento de acoplamiento. Los resultados del acoplamiento se visualizaron utilizando PyMOL para analizar conformaciones de unión e interacciones clave, incluyendo enlaces de hidrógeno.
Las simulaciones de acoplamiento predijeron que el Compuesto X encaja en el sitio de unión de la proteína Y, formando enlaces de hidrógeno potenciales y contactos hidrofóbicos, con una energía de unión prevista de -8,5 kcal/mol.
Resolución de problemas y posibles modificaciones
Para mejorar la robustez y reproducibilidad del flujo de trabajo propuesto, deben señalarse varias consideraciones de resolución de problemas y posibles modificaciones. Si se identifica un número inesperadamente bajo de genes expresados diferencialmente (DEGs), se recomienda a los usuarios verificar el procedimiento de normalización, confirmar el etiquetado preciso de los grupos y considerar ajustar el cambio de plegamiento |log2| umbral manteniendo un control adecuado de la tasa de descubrimiento de falsos (FDR). Por el contrario, si se obtiene un número excesivo de DEGs, aplicar cortes de FDR más estrictos o filtrar genes de baja varianza antes del análisis diferencial de expresión puede mejorar la especificidad.
Los efectos por lotes pueden influir en patrones de agrupación en análisis exploratorios como el análisis de componentes principales (PCA). Si las muestras agrupan predominantemente por lote en lugar de por condición biológica, deben aplicarse métodos de corrección por lotes (por ejemplo, enfoques bayesianos empíricos como ComBat) y los metadatos de la muestra deben reevaluarse cuidadosamente para garantizar la consistencia.
Para la selección de características basada en Random Forest, las altas tasas de error Out-of-Bag (OOB) o las clasificaciones inestables de características pueden indicar una configuración subóptima del modelo. En tales casos, aumentar el número de árboles, ajustar el parámetro mtry o realizar repetidas ejecuciones del modelo con selección de características por consenso puede mejorar la estabilidad del modelo y la fiabilidad predictiva. Además, pueden emplearse estrategias de validación cruzada para evaluar mejor la robustez del modelo.
Para reforzar la fiabilidad, los usuarios pueden repetir opcionalmente el análisis utilizando umbrales alternativos de DEG o ajustes de parámetros de aprendizaje automático y comparar la consistencia de genes de características identificados. Estos análisis de sensibilidad ayudan a garantizar que los hallazgos clave no estén impulsados por elecciones específicas de parámetros y apoyan la reproducibilidad del flujo de trabajo entre conjuntos de datos transcriptómicos similares.
Análisis estadísticos
La significación estadística se determinó mediante una prueba t, reportándose valores p para comparación. Las correlaciones estadísticas entre los niveles de expresión génica y los fenotipos relacionados con la hepatotoxicidad se evaluaron utilizando los coeficientes de correlación de Pearson y Spearman, dependiendo de la normalidad de los datos. Los valores p se ajustaron para comparaciones múltiples utilizando el método de Benjamini-Hochberg. Se visualizaron asociaciones significativas con mapas de calor y diagramas de dispersión, proporcionando una evaluación robusta de las relaciones transcriptómicas.