Identificación de biomarcadores diagnósticos candidatos para el queloide mediante un algoritmo de aprendizaje automático
Un total de 283 genes relacionados con el metabolismo del hemo se incluyeron en este estudio. El análisis de expresión diferencial del conjunto de datos GSE44270, que compara tejidos de cicatrices queloides y piel normal, identificó 25 genes expresados de manera significativamente diferente (Figura 1A y Tabla Suplementaria S3). Para seleccionar más exhaustivamente biomarcadores asociados a la enfermedad, la regresión LASSO identificó 9 genes candidatos (Figura 1B,C y Tabla Suplementaria S3), mientras que el algoritmo de bosque aleatorio (RF) seleccionó 11 genes con alta importancia predictiva (Figura 1D y Tabla Suplementaria S3). La intersección entre los resultados de LASSO y RF se visualizó mediante un diagrama de Venn, obteniéndose seis biomarcadores centrales, a saber, FLVCR1, TMCC2, EIF2AK1, XK, HPX y KEL (Figura 1E y Tabla Suplementaria S3). El análisis de la característica operativa del receptor (ROC) en la cohorte GSE44270 demostró un desempeño diagnóstico favorable para los seis biomarcadores, con valores de AUC de 0.8016 para FLVCR1, 0.7063 para TMCC2, 0.7817 para EIF2AK1, 0.7460 para XK, 0.7500 para HPX y 0.7857 para KEL (Figura 1F). Basándose en estos seis biomarcadores, se construyó posteriormente un nomograma diagnóstico para queloides utilizando el paquete rms en R (Figura 1G).

Figura 1: Identificación de genes candidatos relacionados con el metabolismo del hemo asociados al queloide mediante algoritmos de aprendizaje automático. (A) Gráfico de cajas que muestra la expresión diferencial de genes relacionados con el metabolismo del hemo entre tejidos queloides y normales. (B,C) Análisis de regresión logística LASSO para la selección de marcadores diagnósticos candidatos. (D) Biomarcadores candidatos seleccionados por el algoritmo RF. (E) Diagrama de Venn que muestra los genes superpuestos identificados por los dos algoritmos de aprendizaje automático. (F) Análisis de la curva ROC para evaluar el rendimiento diagnóstico de los biomarcadores candidatos. (G) Nomograma para la predicción del queloide basado en la firma de seis genes. Abreviaturas: LASSO, operador de contracción y selección absoluto mínima; RF, bosque aleatorio; ROC, característica de operación del receptor. Significancia estadística: ns, P > 0,05; *, P < 0,05; **, P < 0,01; ***, P < 0,001; y ****, P < 0,0001. Haga clic aquí para ver una versión más grande de esta figura.
El rendimiento predictivo del nomograma diagnóstico se evaluó tanto en la cohorte de entrenamiento (GSE44270) como en la cohorte de validación (GSE7890). El modelo mostró una excelente precisión diagnóstica, alcanzando valores de AUC de 0,984 (IC del 95 %: 0,950–1,000) y 0,922 (IC del 95 %: 0,806–1,000), respectivamente (Figura 2A,D). Para evaluar más a fondo la solidez y el posible sobreajuste de la firma diagnóstica de seis genes, se realizaron análisis adicionales de validación interna en la cohorte de descubrimiento (GSE44270). La validación cruzada de cinco particiones mostró un rendimiento discriminativo consistente en los subconjuntos, con una AUC media de 0,925, lo que indica que el modelo mantuvo un rendimiento estable de clasificación a pesar de las variaciones en las muestras de entrenamiento. Además, la validación mediante bootstrap con 1 000 iteraciones de remuestreo arrojó una AUC media de 0,930 (IC del 95 %: 0,794–1,000). Tras ajustar el posible optimismo causado por el tamaño limitado de la muestra, la AUC corregida por optimismo permaneció en 0,930, lo que sugiere que el rendimiento diagnóstico de la firma de seis genes fue relativamente estable tras la validación interna. Asimismo, el análisis de curva de decisión (DCA) indicó que el nomograma presentaba un beneficio neto potencial mayor que otras estrategias diagnósticas en un rango de probabilidades umbral, aunque estos hallazgos deben interpretarse con precaución debido al tamaño limitado de la muestra (Figura 2B,E). Además, las muestras de queloides mostraron puntuaciones de riesgo significativamente más altas que los controles sanos tanto en la cohorte de entrenamiento como en la de validación (Figura 2C,F), lo que demuestra aún más la estabilidad y fiabilidad del modelo diagnóstico.

Figura 2: Validación del nomograma para la predicción de queloides. (A) Curva ROC que evalúa el rendimiento predictivo del nomograma en el conjunto de datos GSE44270. (B) ACD que evalúa la utilidad clínica del nomograma en GSE44270. (C) Distribución del puntaje de riesgo comparando muestras con queloide y muestras sanas en GSE44270. (D) Curva ROC que evalúa el rendimiento predictivo del nomograma en el conjunto de datos independiente GSE7890. (E) ACD que evalúa la utilidad clínica del nomograma en GSE7890. (F) Distribución del puntaje de riesgo comparando muestras con queloide y muestras sanas en GSE7890. Abreviaturas: ROC = característica operativa del receptor; ACD = análisis de la curva de decisión. Haga clic aquí para ver una versión más grande de esta figura.
Los biomarcadores diagnósticos están asociados con las características inmunitarias del queloides
Para explorar la relación entre los seis biomarcadores diagnósticos y el microambiente inmunitario, se realizó un análisis de correlación para evaluar las asociaciones entre la expresión de los biomarcadores y la infiltración de células inmunitarias. Los resultados revelaron que los seis biomarcadores estuvieron significativamente asociados con múltiples poblaciones de células inmunitarias infiltrantes (Figura 3A). Específicamente, la expresión de FLVCR1 se asoció negativamente con las células T foliculares helper (Figura 3B). TMCC2 mostró correlaciones positivas con las células asesinas naturales y las células dendríticas activadas, mientras que se correlacionó negativamente con las células dendríticas inmaduras y las células B inmaduras (Figura 3C–F). Además, la expresión de EIF2AK1 se asoció negativamente con las células asesinas naturales CD56dim (Figura 3G), mientras que XK se asoció negativamente con los eosinófilos (Figura 3H).

Figura 3: Correlación entre genes candidatos relacionados con el metabolismo del hemo y la infiltración de células inmunitarias. (A) Mapa de calor que muestra las correlaciones entre los genes candidato y las poblaciones de células inmunitarias. El rojo indica correlaciones positivas, mientras que el azul indica correlaciones negativas. (B). Correlación entre FLVCR1 expresión y células T foliculares auxiliares.C-F) Correlaciones entre TMCC2 expresión y células asesinas naturales, células dendríticas activadas, células dendríticas inmaduras y células B inmaduras, respectivamente. (G) Correlación entre EIF2AK1 expresión y células asesinas naturales CD56dim. (H). Correlación entre XK expresión y eosinófilos. Abreviaturas: FLVCR1 = receptor del virus de la leucemia felina del subgrupo C 1; TMCC2 = transmembrana y dominios de hélice alfa enrollada 2; EIF2AK1 = quinasa 1 del factor de inicio de la traducción en eucariotas 2 alfa; CD56oscuro = cluster de diferenciación 56 débil Haga clic aquí para ver una versión más grande de esta figura.
Análisis de datos de transcriptómica de una sola célula
Para caracterizar los patrones de expresión de los biomarcadores diagnósticos identificados dentro del microentorno del queloides, analizamos el conjunto de datos de secuenciación de ARN a nivel de célula individual GSE163973. Tras el control de calidad y la integración de los datos, se conservaron 21.488 células de alta calidad para los análisis posteriores. Se excluyeron células con menos de 200 o más de 6.000 recuentos totales de identificadores moleculares únicos (UMI), y se identificaron y eliminaron los dobletes potenciales mediante el paquete DoubletDetection. Se seleccionaron los 2.000 genes que mostraron la mayor variabilidad de expresión, seguido de la reducción de dimensionalidad y la visualización mediante la proyección de aproximación uniforme de variedades (UMAP). Se identificó un total de 10 poblaciones celulares principales, incluyendo células endoteliales, fibroblastos, fibras musculares, queratinocitos, células inmunitarias, células endoteliales linfáticas, células glandulares, células nerviosas, melanocitos y una población celular no clasificada (Figura 4A,B). El perfil de expresión reveló patrones de distribución específicos según el tipo celular de los biomarcadores diagnósticos. FLVCR1 se expresó predominantemente en células endoteliales y melanocitos, mientras que EIF2AK1 mostró una expresión relativamente alta en células nerviosas, células glandulares y fibroblastos. HPX se enriqueció principalmente en melanocitos, mientras que KEL exhibió una expresión predominante en células glandulares (Figura 4C,D).

Figura 4: Distribución de biomarcadores diagnósticos relacionados con el metabolismo del hemo en el transcriptoma unicelular de queloides. (A) Gráfico UMAP que muestra 21 agrupaciones celulares que comprenden 21.488 células de muestras de queloides. (B) Anotaciones de tipos celulares basadas en las anotaciones reportadas en el estudio original. (C) Gráficos de características que muestran la expresión de biomarcadores diagnósticos relacionados con el metabolismo del hemo en diferentes tipos celulares. (D) Gráfico de burbujas que muestra los niveles promedio de expresión y los porcentajes de células que expresan los biomarcadores diagnósticos relacionados con el metabolismo del hemo en diferentes tipos celulares. Abreviatura: UMAP = aproximación y proyección uniforme de variedades. Haga clic aquí para ver una versión más grande de esta figura.
Identificación y análisis de la red de interacciones de biomarcadores diagnósticos candidatos
Para explorar los mecanismos reguladores subyacentes a los biomarcadores diagnósticos candidatos, se construyó una red reguladora de miARN–mARN. Para mejorar la fiabilidad de las interacciones predichas, se identificaron miARNs superpuestos que dirigen a los biomarcadores candidatos. Se obtuvieron un total de 282 miARNs que interactúan con los seis biomarcadores diagnósticos, y la red reguladora resultante se muestra en la Figura 5. Destacablemente, se predijo que hsa-miR-34a-5p, hsa-let-7a-5p, hsa-let-7d-5p, hsa-let-7e-5p y hsa-miR-26b-5p regulan simultáneamente los seis biomarcadores candidatos.

Figura 5: Red reguladora de miARN de biomarcadores diagnósticos relacionados con el metabolismo del hemo. La red ilustra las relaciones reguladoras entre los seis genes biomarcadores diagnósticos (FLVCR1, HPX, TMCC2, KEL, XK y EIF2AK1) y sus miARN asociados. Los nodos génicos representan los biomarcadores diagnósticos, mientras que los nodos circundantes representan los miARN. Las aristas indican interacciones miARN–mARN respaldadas experimentalmente. Abreviaturas: FLVCR1 = receptor del virus de la leucemia felina del subgrupo C 1; HPX = hemopexina; TMCC2 = dominios transmembrana y de hélice enrollada 2; KEL = metaloendopeptidasa Kell; XK = grupo sanguíneo X-ligado Kx; EIF2AK1 = quinasa 1 del factor de inicio de la traducción eucariota 2 alfa; miARN = ARN micro; ARNm = ARN mensajero. Haga clic aquí para ver una versión más grande de esta figura.
Validación experimental de la expresión de FLVCR1 y análisis de acoplamiento molecular de compuestos terapéuticos potenciales
Para validar los hallazgos bioinformáticos y confirmar la relevancia funcional del gen central identificado, evaluamos experimentalmente la expresión de FLVCR1 en PKF y NHDF. Tanto el análisis de qRT-PCR como el de inmunotransferencia mostraron de forma consistente que FLVCR1 estaba significativamente sobreexpresado en los fibroblastos queloides en comparación con los controles normales (Figura 6A–C, Figura suplementaria S1 y Tabla suplementaria S4). Esta expresión celular elevada respalda la posible participación de la disregulación metabólica del hemo asociada a FLVCR1 en la patogénesis del queloide.
Dado el posible papel de FLVCR1 en los cambios inmunitarios asociados al metabolismo del hemo, a continuación se buscó identificar compuestos terapéuticos potenciales que pudieran dirigirse directamente a FLVCR1 para interrumpir este eje patógeno. Se realizó una selección virtual de alta capacidad utilizando una biblioteca de compuestos de medicina tradicional china (MTC) y la estructura proteica preparada. Se seleccionaron los 20 compuestos con las puntuaciones de acoplamiento más favorables para una evaluación adicional (Tabla Suplementaria S5). En general, una energía de unión más baja indica una afinidad de unión más fuerte, y energías de acoplamiento por debajo de −5 kcal/mol se consideran indicativas de interacciones estables entre ligando y proteína. Entre los compuestos analizados, (+)-galocatequina, (−)-epicatequina, (−)-galocatequina y cianidina (cloruro) mostraron afinidades de unión favorables hacia FLVCR1. Notablemente, la (+)-galocatequina mostró la interacción más fuerte con FLVCR1 al formar cuatro enlaces de hidrógeno con GLU214, ASN245, GLN246 y GLN471, lo que sugiere un modo de unión estable entre el ligando y la proteína (Figura 6D–G). Estos hallazgos destacan a la (+)-galocatequina como un candidato prometedor para una intervención terapéutica basada en mecanismos dirigidos a FLVCR1.

Figura 6: Validación experimental de la expresión de FLVCR1 y acoplamiento molecular de compuestos potenciales que dirigen a FLVCR1. (A) Imágenes representativas de inmunotransferencia que muestran la expresión proteica de FLVCR1 en CON y queloides. GAPDH sirvió como control de carga. (B) Cuantificación de los niveles proteicos de FLVCR1 normalizados respecto a GAPDH. (C) Los niveles relativos de expresión de ARNm de FLVCR1 en fibroblastos de CON y queloides se determinaron mediante qRT-PCR. GAPDH se utilizó como referencia interna. (D–G) Representaciones tridimensionales de los modos de unión predichos entre FLVCR1 y compuestos seleccionados de bajo peso molecular: (D) (+)-Galocatequina. (E) (-)-Epicatequina. (F) (-)-Galocatequina. (G) Cianidina (Cloruro). Abreviaturas: FLVCR1 = receptor del virus de la leucemia felina del subgrupo C 1; CON, control; GAPDH, deshidrogenasa de gliceraldehído-3-fosfato; qRT-PCR, reacción en cadena de la polimerasa con transcripción inversa cuantitativa; SD, desviación estándar. Los datos se presentan como media ± SD. Significancia estadística: ns, P > 0,05; *, P < 0,05; **, P < 0,01; ***, P < 0,001; y ****, P < 0,0001. Haga clic aquí para ver una versión ampliada de esta figura.
Confirmación de la estabilidad del complejo FLVCR1–(+)-galocatequina mediante simulación de dinámica molecular
Para examinar la fiabilidad del modo de unión predicho entre el ligando y la proteína, se realizó una simulación de dinámica molecular (MD) para el complejo FLVCR1–(+)-gallocatequina. El análisis se centró en determinar si el complejo permaneció estructuralmente estable a lo largo del tiempo y si la unión del ligando alteró el comportamiento conformacional de la proteína, utilizando análisis de RMSD, RMSF, radio de giro (Rg), SASA, análisis de enlaces de hidrógeno y cálculos MM/GBSA. El análisis de RMSD (Figura 7A) mostró que tanto la proteína en estado apó como el complejo unido al ligando experimentaron fluctuaciones iniciales durante los primeros 20 ns, seguidas de una estabilización gradual, lo que indica que los sistemas alcanzaron el equilibrio durante la simulación. Tras la equilibración, el valor de RMSD del complejo FLVCR1–(+)-gallocatequina permaneció por debajo de 0,2 nm, lo que sugiere que la unión del ligando contribuyó a mantener la estabilidad estructural de FLVCR1. El análisis de RMSF (Figura 7B) demostró que la mayoría de los residuos presentaron fluctuaciones limitadas a lo largo de la simulación, indicando la preservación de la integridad general de la proteína, mientras que varias regiones flexibles podrían representar regiones en bucle implicadas en la acomodación del ligando. Además, los perfiles estables de Rg y SASA (Figura 7C,D) indicaron que el complejo mantuvo una conformación compacta, sin expansión estructural evidente ni cambios en la exposición al disolvente. El análisis de enlaces de hidrógeno (Figura 7E) reveló que el complejo FLVCR1–(+)-gallocatequina mantuvo interacciones intermoleculares persistentes, formándose aproximadamente entre 3 y 4 enlaces de hidrógeno durante la simulación, lo que respalda la estabilidad de la asociación entre el ligando y la proteína. El análisis MM/GBSA mostró además que el complejo FLVCR1–(+)-gallocatequina exhibió una energía libre de unión favorable (ΔGtotal = −34,87 ± 4,13 kcal/mol) (Tabla suplementaria S6). El análisis de descomposición energética indicó que las interacciones de van der Waals (ΔVDWAALS = −46,34 ± 2,16 kcal/mol) y las interacciones electrostáticas (ΔEelec = −14,09 ± 3,45 kcal/mol) fueron las principales contribuciones favorables a la unión, a pesar de la contribución desfavorable de la energía de solvatación polar (ΔGsolvation = 25,55 ± 0,74 kcal/mol) (Tabla suplementaria S6). En conjunto, estos resultados de la simulación de dinámica molecular demostraron que la (+)-gallocatequina formó un complejo estable con FLVCR1 y respaldaron además la fiabilidad del modo de unión predicho por acoplamiento molecular.

Figura 7: Análisis mediante simulación de dinámica molecular del complejo FLVCR1–(+)-Galocatequina. (A) Perfiles de RMSD de FLVCR1 en estado apó y del complejo FLVCR1–(+)-Galocatequina durante la simulación de dinámica molecular de 100 ns. (B) Perfil de RMSF que muestra las fluctuaciones a nivel de residuos de FLVCR1 durante la simulación. (C) Perfil de SASA que muestra los cambios en el área de superficie accesible al disolvente del complejo FLVCR1–(+)-Galocatequina. (D) Perfil de Rg que evalúa la compacidad del complejo FLVCR1–(+)-Galocatequina durante la simulación. (E) Análisis de enlaces de hidrógeno que muestra las interacciones intermoleculares dinámicas entre FLVCR1 y (+)-Galocatequina a lo largo de la simulación. Abreviaturas: FLVCR1 = receptor de leucemia felina del subgrupo C 1; RMSD = desviación cuadrática media; RMSF = fluctuación cuadrática media; SASA = área de superficie accesible al disolvente; Rg = radio de giro. Haga clic aquí para ver una versión más grande de esta figura.
Disponibilidad de datos:
Los conjuntos de datos transcriptómicos disponibles públicamente analizados en este estudio pueden accederse a través del Gene Expression Omnibus (GEO) con los números de acceso GSE44270, GSE7890 y GSE163973. Los datos originales generados en este estudio y que sustentan la validación experimental, incluyendo mediciones de qRT-PCR, imágenes originales de inmunoensayos tipo western blot y datos de cuantificación de western blot, se proporcionan como Figura Suplementaria S1, Tabla Suplementaria S1, Tabla Suplementaria S2, Tabla Suplementaria S3 y Tabla Suplementaria S4. Los resultados de acoplamiento molecular y los datos de energía libre de unión MM/GBSA también se proporcionan en la Tabla Suplementaria S5 y la Tabla Suplementaria S6.
Figura suplementaria S1: Datos originales del inmunotransferencia.Haga clic aquí para descargar este archivo.
Tabla suplementaria S1: Genes relacionados con el metabolismo del hemo.Haga clic aquí para descargar este archivo.
Tabla suplementaria S2: Secuencias de cebadores de genes seleccionados. Haga clic aquí para descargar este archivo.
Tabla suplementaria S3: Enfoques de aprendizaje automático para la identificación de posibles biomarcadores diagnósticos en queloides. Haga clic aquí para descargar este archivo.
Tabla suplementaria S4: Datos brutos que respaldan la validación experimental de la expresión de FLVCR1. Haga clic aquí para descargar este archivo.
Tabla suplementaria S5: Los 20 principales compuestos candidatos identificados mediante acoplamiento molecular con FLVCR1.Haga clic aquí para descargar este archivo.
Tabla suplementaria S6: Análisis de la energía libre de enlace MM/GBSA del complejo FLVCR1–(+)-galocatequina.Haga clic aquí para descargar este archivo.